📚 Série · Les familles de modèles en IA
Embeddings et reranking : les briques invisibles derrière le RAG
Sixième famille du dossier sur IA : LLM, VLM, OCR... le panorama des familles de modèles : les embeddings et le reranking. Contrairement aux familles précédentes, celle-ci ne produit jamais de contenu que tu vois directement. C’est la plomberie derrière tout système de RAG (Retrieval-Augmented Generation), ce qui permet à un LLM : comment fonctionnent les grands modèles de langage de répondre en s’appuyant sur tes propres documents plutôt que sur sa seule mémoire d’entraînement.
Le problème que ça résout
Un LLM ne connaît que ce qu’il a appris à l’entraînement, à une date donnée. Le RAG contourne cette limite : avant de générer une réponse, le système va chercher dans une base de connaissances les passages pertinents, puis les injecte comme contexte au modèle1. Reste à savoir comment “chercher les passages pertinents” sans se limiter à une simple recherche par mots-clés, qui rate tout ce qui est reformulé ou paraphrasé.
Les embeddings, transformer le sens en nombres
Un modèle d’embedding convertit un texte (ou une image) en vecteur numérique, une série de centaines ou milliers de nombres flottants qui encode le sens sémantique du passage1. Deux phrases qui disent la même chose avec des mots différents obtiennent des vecteurs proches dans cet espace mathématique. C’est ce qui permet de retrouver une information pertinente même si l’utilisateur ne reprend pas le vocabulaire exact du document source2.
Les modèles courants en 2026 incluent des solutions propriétaires (OpenAI text-embedding-3, Cohere Embed v3) et open source (BGE-M3, nomic-embed-text), ce dernier groupe étant particulièrement adapté à un déploiement local4.
Le reranking, la deuxième passe
Une recherche vectorielle pure remonte souvent un premier lot de résultats “à peu près pertinents” mais pas classés dans le bon ordre. Le reranking ajoute une étape de réévaluation : après avoir récupéré un ensemble de candidats (les 50 meilleurs par exemple), un modèle spécialisé, un cross-encoder, réévalue chaque paire question-document pour fournir un score de pertinence beaucoup plus précis3. Le gain n’est pas anecdotique : entre 15 et 30 % de précision supplémentaire sur la qualité des réponses RAG en moyenne, selon les benchmarks courants5.
Le pipeline complet
flowchart LR
A[Documents] --> B[Chunking<br/>découpage en fragments]
B --> C[Embedding<br/>vecteur numérique]
C --> D[Base vectorielle]
E[Question utilisateur] --> F[Embedding de la requête]
F --> G[Recherche par similarité]
D --> G
G --> H[Reranking<br/>cross-encoder]
H --> I[Contexte injecté<br/>dans le LLM]
I --> J[Réponse générée]
Un détail qui change beaucoup en pratique : la recherche purement sémantique ignore le contexte métier précis (une clause contractuelle exacte, une référence produit). Beaucoup de systèmes combinent donc recherche vectorielle et recherche par mots-clés classique (BM25), une approche dite hybride qui améliore sensiblement la qualité du résultat final par rapport à la recherche vectorielle seule4.
Où ça s’applique, au-delà du RAG documentaire
Recherche sémantique dans une base de connaissances, système de recommandation, classification de contenu, déduplication, ou encore la mémoire à long terme d’un assistant conversationnel : partout où il faut retrouver “ce qui ressemble en sens” plutôt que “ce qui matche en mots-clés”, un embedding fait le travail en coulisses.
Sources
- RAG (Retrieval-Augmented Generation) : guide complet 2026 - iana-data.orgiana-data.org
- Embeddings et recherche sémantique - Tensoriatensoria.fr
- Meilleurs modèles d'embedding en 2026 - 404 Collective404-collective.com
- RAG : le guide complet pour connecter l'IA à vos données - Shubham Sharmashubham-sharma.fr
- Rerank (re-ranking) - définition et usage en RAG en 2026 - Kezifykezify.com