Embeddings
Représentation vectorielle dense d'un texte qui capture sa signification sémantique, utilisée pour la recherche par similarité.
Représentation vectorielle dense d'un texte qui capture sa signification sémantique, utilisée pour la recherche par similarité.
Définition détaillée
Les embeddings (plongements vectoriels) sont des représentations numériques de données textuelles sous forme de vecteurs de nombres réels (généralement de 384 à 3072 dimensions). Des modèles spécialisés (text-embedding-3, BGE, E5) transforment tout texte en un vecteur qui encode sa signification sémantique. Deux textes proches sémantiquement ont des vecteurs proches dans l'espace vectoriel, mesuré par similarité cosinus. Les embeddings sont la brique fondamentale des bases vectorielles et du RAG.
Cas d'usage
Moteur de recherche sémantique interne : les collaborateurs trouvent instantanément les documents pertinents par similarité de sens, sans mots-clés exacts. La recherche fonctionne même avec des formulations différentes.
Termes associés
Questions fréquentes
Quelle est la différence entre embeddings et mots-clés ?
Les mots-clés cherchent des correspondances exactes. Les embeddings cherchent le sens : 'voiture' et 'automobile' auront des vecteurs proches, même sans partager de lettres.
Quel modèle d'embeddings choisir ?
text-embedding-3-small pour le rapport qualité/prix, BGE-M3 pour le multilangue (y compris le français), E5-mistral pour la meilleure qualité générale.
