Ressources · Intégration n8n

Nœud Contextual Compression Retriever n8nConfigurer Contextual Compression Retriever dans n8n.

Un retriever donne des documents à une chaîne, celui-ci en donne moins. Le nœud Contextual Compression Retriever n8n s'intercale entre un autre retriever et le nœud qui lit sa sortie, avec un modèle de chat qui ne garde que les passages liés à la question. Deux ports à brancher, aucun réglage.

Avis vérifiés sur Trustpilot · Agence IA, automatisation & growth

Pourquoi automatiser

À quoi sert le nœud Contextual Compression Retriever n8n ?

Il enveloppe un autre retriever, ce sous-nœud qui va chercher des documents pour une question, et filtre ce que celui-ci renvoie. Chaque document remonté passe par un modèle de chat, le sous-nœud qui dialogue avec un fournisseur comme OpenAI ou Anthropic, et seule la partie qui répond vraiment à la question reste. La chaîne en aval reçoit les mêmes documents, en plus court.

La recherche par similarité est généreuse. Tu demandes les meilleurs résultats à un vector store, il te rend des morceaux entiers, avec deux phrases utiles noyées dans une page de contexte. Ce texte voyage quand même jusqu'au modèle qui rédige la réponse, il occupe sa fenêtre de contexte (la quantité de texte qu'un modèle lit en un appel) et lui laisse de quoi répondre à côté. La compression sert à ça.

Prends une base de connaissances support indexée dans un vector store. Un client demande le délai de rétractation, le retriever remonte 4 morceaux d'une page de conditions générales, et deux phrases seulement parlent du délai. Place le Contextual Compression Retriever entre le retriever du store et l'AI Agent ou la chaîne de questions-réponses : ces deux phrases deviennent la matière de la réponse.

Deuxième cas, un assistant qui lit des comptes rendus de réunion. Sans compression, il reçoit des pages complètes et sa réponse part sur tout ce qui s'est dit ce jour-là. Avec, le modèle rédacteur ne voit que les lignes du sujet demandé. Troisième cas, un flux où le coût compte : chaque appel de compression est facturé par le fournisseur du modèle, que tu passes par OpenAI, Anthropic ou Google Gemini, et tu l'échanges contre un prompt final plus court.

Quand s'en passer. Si tes morceaux sont déjà courts et précis, branche le retriever du vector store directement sur la chaîne, tu économises un appel de modèle par document. Si le bon document ne remonte jamais, le problème est en amont : découpage à revoir, ou MultiQuery Retriever, qui reformule la question de plusieurs façons avant de chercher. La compression améliore ce que tu as trouvé, elle ne trouve pas plus.

Deux limites à connaître avant de brancher. La compression fait lire chaque document remonté par un modèle de chat : la récupération devient plus lente et dépend de la disponibilité du fournisseur. Et elle peut couper trop court. Un fait dont la chaîne avait besoin, logé dans une phrase jugée hors sujet par le modèle, a disparu au moment de rédiger. Teste sur de vraies questions avant de passer en production. Le tableau plus large de n8n, hébergement et modèle de coût compris, est dans l'Avis n8n.

Connexions

Qu'est-ce qu'on lui branche ?

C'est un sous-nœud : il ne s'exécute jamais seul, il se raccorde au port d'un nœud racine et travaille quand celui-ci travaille. Il a lui aussi ses ports, et les deux sont requis.

Ports (ce qui se branche)

  • Chat Modelai_languageModelrequis
  • Retrieverai_retrieverrequis

Sortie (où il se branche)

  • Retrieverai_retriever
01Chat ModelLe modèle qui lit chaque document remonté et le réécrit pour ne garder que ce qui touche à la question. C'est ce port qui fait le travail de compression.

Le modèle qui lit chaque document remonté et le réécrit pour ne garder que ce qui touche à la question. C'est ce port qui fait le travail de compression.

Paramètres clés

  • Required : laissé vide, le nœud refuse de s'exécuter.
  • OpenAI Chat Model ou Anthropic Chat Model : les points de départ habituels, chacun portant le credential de son fournisseur.
  • Ollama Chat Model : pour des documents que tu préfères ne pas envoyer hors de tes machines.
  • Model Selector : pour arbitrer entre plusieurs modèles au lieu d'en figer un.
Cas d'usage
une base interne où le même modèle répond et compresse, ou une autre où un modèle léger est réservé à la compression pendant que la chaîne de réponse en garde un plus solide.
02RetrieverLe retriever dont la sortie sera compressée. Ce nœud ne cherche rien tout seul, il filtre ce que le retriever placé sous lui rapporte.

Le retriever dont la sortie sera compressée. Ce nœud ne cherche rien tout seul, il filtre ce que le retriever placé sous lui rapporte.

Paramètres clés

  • Required : sans retriever branché, il n'y a rien à compresser.
  • Vector Store Retriever : le choix courant, qui lit un vector store rempli à l'avance.
  • Workflow Retriever : quand les documents viennent d'un autre workflow n8n plutôt que d'un store.
  • MultiQuery Retriever : quand une même question mérite plusieurs recherches avant compression.
Cas d'usage
une documentation produit interrogée à chaque question client, ou un workflow qui va chercher des fiches dans un outil maison et les présente comme des documents.
Paramètres

Contextual Compression Retriever

Le nœud Contextual Compression Retriever compte 0 paramètres. Pour chacun : le nœud tel que tu le configures dans n8n, ce que le paramètre change, et nos notes de terrain.

Besoin d'aide

Besoin d'aide pour automatiser Contextual Compression Retriever avec n8n ?

L'équipe te répond directement.

Chaque message est lu par une personne.

FAQ

Les questions qui viennent ensuite

01Le Contextual Compression Retriever est-il inclus dans n8n ?
Oui. Il fait partie du paquet IA livré avec n8n, présent sur n8n Cloud, l'offre hébergée par n8n, comme sur une instance auto-hébergée en Community Edition sous licence Sustainable Use. Rien à installer, aucun surcoût côté n8n, et un workflow se comporte pareil dans les deux cas. Ce qui se facture, c'est le fournisseur du modèle de chat que tu branches, selon ses propres conditions, puisque la compression lui envoie chaque document remonté pour le réécrire. n8n n'ajoute rien à cette facture.
02Que faut-il pour qu'il fonctionne ?
Rien à authentifier sur ce nœud. Ouvre son panneau : ni champ de credential, ni sélecteur Authentication, et en réalité aucun paramètre. C'est justement l'argument. Ce dont il a besoin, ce sont des connexions, pas des réglages. Un modèle de chat sur un port, un retriever sur l'autre, et il tourne. Le credential vit sur le sous-nœud modèle, là où la clé du fournisseur a sa place, donc une clé déjà configurée ailleurs se réutilise telle quelle. Il n'y a rien à configurer ici, donc rien à configurer de travers.
03Quelles sont les limites du nœud Contextual Compression Retriever n8n ?
Trois. Il ajoute un appel de modèle par document remonté, donc la récupération ralentit et la facture du fournisseur suit le nombre de documents. Il peut couper un passage dont la chaîne avait besoin, parce que la notion de pertinence est tranchée par le modèle et non par une règle que tu écris. Et comme son panneau n'expose rien, il n'y a ni seuil, ni longueur cible, ni prompt à ajuster quand le résultat déçoit : tu changes de modèle de chat, ou tu changes le retriever du dessous. La version en cours est la 1.
04Que brancher au minimum, et par quel sous-nœud commencer ?
Les deux ports, puisque les deux sont requis. Commence par un Vector Store Retriever sur le port retriever, pointé sur un store déjà rempli, et un OpenAI Chat Model ou un Anthropic Chat Model sur le port modèle. Puis branche l'ensemble sur une Question and Answer Chain. C'est le montage le plus court qui répond à une vraie question. Une fois qu'il tourne, essaie un modèle plus léger ou hébergé chez toi côté compression, avec un Ollama Chat Model : cet appel tourne une fois par document, et la réponse se rédige ailleurs.
05n8n ou Make pour ce type de récupération ?
Ça dépend d'où tes documents peuvent vivre et de comment tu veux payer. n8n s'auto-héberge avec Docker ou npm, donc les documents compressés et les appels au modèle restent sur une infrastructure que tu maîtrises, ce qui compte quand la base est interne. Make est uniquement hébergé, sans option d'auto-hébergement, et se facture à l'opération : prévisible sur un volume régulier, moins quand une récupération se démultiplie en un appel de modèle par document. Make reste l'éditeur visuel le plus simple sur des scénarios linéaires. Pour un flux IA fait de sous-nœuds sur des ports, n8n colle mieux.
Hack'celeration Lab

Reçois nos tips intégration chaque semaine.

Pas de spam. Désinscription à tout moment.