Qu’est-ce que la génération d’embeddings ?

La génération d’embeddings transforme le texte en un vecteur numérique que les machines peuvent comparer. Cela est utile pour la recherche sémantique, le clustering, les recommandations et les vérifications de similarité.

Description de l’outil

Cet outil envoie votre texte à un modèle d’embedding sélectionné et affiche le vecteur obtenu ainsi que ses dimensions. Il prend en charge les modèles OpenAI, Google et Voyage AI, ce qui vous permet de comparer les fournisseurs ou de tester une configuration d’embedding sans quitter l’application.

Exemple

Entrée :

Réinitialisez votre mot de passe depuis la page des paramètres du compte.

Sortie :

{
  "model": "openai/text-embedding-3-small",
  "dimensions": 1536,
  "embedding": [0.0123, -0.0441, 0.0087]
}

Fonctionnalités

  • Permet de choisir parmi les modèles d’embedding pris en charge d’OpenAI, Google et Voyage AI
  • Affiche la dimension de l’embedding et le vecteur brut au format JSON
  • Télécharge le résultat sous forme de embedding.json

Fonctionnement

L’outil élimine les espaces superflus du texte saisi, l’envoie avec le modèle sélectionné à l’API d’embedding, puis affiche le vecteur renvoyé dans la zone de sortie. Si le modèle change, la structure du vecteur peut également changer ; le champ des dimensions vous aide donc à confirmer le résultat obtenu.

Conseils

  • Utilisez un texte court et représentatif lorsque vous comparez des modèles.
  • Les différents fournisseurs et modèles renvoient souvent des vecteurs de dimensions différentes.
  • C’est un bon moyen de vérifier la cohérence d’un pipeline de recherche sémantique avant de l’intégrer à votre code.