Recursos · Integración n8n

Nodo Contextual Compression Retriever n8nConfigura Contextual Compression Retriever en n8n.

Un retriever entrega documentos a una cadena, y este entrega menos. El nodo Contextual Compression Retriever n8n se coloca entre otro retriever y el nodo que lee su salida, con un modelo de chat que solo conserva los pasajes ligados a la pregunta. Dos puertos que conectar, cero ajustes.

Reseñas verificadas en Trustpilot · Agencia de IA, automatización y growth

Por qué automatizar

¿Para qué sirve el nodo Contextual Compression Retriever n8n?

Envuelve a otro retriever, ese subnodo que busca documentos para una pregunta, y filtra lo que devuelve. Cada documento recuperado pasa por un modelo de chat, el subnodo que habla con un proveedor como OpenAI o Anthropic, y solo queda la parte que responde de verdad. La cadena que va después recibe los mismos documentos, más cortos.

La búsqueda por similitud es generosa. Le pides los mejores resultados a un vector store y te devuelve fragmentos enteros, con dos frases útiles enterradas en una página de contexto. Ese texto viaja igualmente hasta el modelo que redacta la respuesta, ocupa su ventana de contexto (la cantidad de texto que un modelo lee en una llamada) y le deja margen para responder al lado. La compresión existe para eso.

Piensa en una base de conocimiento de soporte indexada en un vector store. Un cliente pregunta por el plazo de devolución, el retriever sube 4 fragmentos de una página de condiciones y solo dos frases hablan del plazo. Coloca el Contextual Compression Retriever entre el retriever del store y el AI Agent o la cadena de preguntas y respuestas: esas dos frases son con lo que se escribe la respuesta.

Segundo caso, un asistente interno que lee actas de reunión largas. Sin compresión recibe páginas completas y la respuesta se va hacia todo lo demás que se habló ese día. Con ella, el modelo redactor solo ve las líneas del tema preguntado. Tercer caso, un flujo donde el gasto pesa: cada llamada de compresión la factura el proveedor del modelo, ya uses OpenAI, Anthropic o Google Gemini, y la cambias por un prompt final más corto.

Cuándo no usarlo. Si tus fragmentos ya son cortos y precisos, conecta el retriever del vector store directamente a la cadena y te ahorras una llamada de modelo por documento. Si el documento correcto nunca aparece, el problema está antes: revisa el troceado, o usa el MultiQuery Retriever, que reformula la pregunta de varias maneras antes de buscar. La compresión mejora lo que encontraste, no encuentra más.

Dos límites antes de conectar nada. La compresión hace que un modelo de chat lea cada documento recuperado, así que la recuperación tarda más y depende de que el proveedor esté disponible. Y puede cortar de más: un dato que la cadena necesitaba, metido en una frase que el modelo consideró ajena, ya no está cuando toca redactar. Pruébalo con preguntas reales antes de ponerlo en producción. El panorama completo de n8n, hospedaje y modelo de coste incluidos, está en la Reseña n8n.

Conexiones

¿Qué se le conecta?

Es un subnodo: nunca se ejecuta solo, se engancha al puerto de un nodo raíz y trabaja cuando ese nodo trabaja. Él también tiene puertos, y los dos son obligatorios.

Puertos (qué se conecta)

  • Chat Modelai_languageModelobligatorio
  • Retrieverai_retrieverobligatorio

Salida (dónde se conecta)

  • Retrieverai_retriever
01Chat ModelEl modelo que lee cada documento recuperado y lo reescribe para dejar solo lo que toca la pregunta. Este puerto es el que hace el trabajo de compresión.

El modelo que lee cada documento recuperado y lo reescribe para dejar solo lo que toca la pregunta. Este puerto es el que hace el trabajo de compresión.

Parámetros clave

  • Required: si lo dejas vacío, el nodo se niega a ejecutarse.
  • OpenAI Chat Model o Anthropic Chat Model: los puntos de partida habituales, cada uno con el credential de su proveedor.
  • Ollama Chat Model: para documentos que prefieres no sacar de tus propias máquinas.
  • Model Selector: para repartir entre varios modelos en vez de fijar uno.
Casos de uso
una base interna donde el mismo modelo responde y comprime, y otra donde un modelo ligero se dedica a comprimir mientras la cadena de respuesta conserva uno más capaz.
02RetrieverEl retriever cuya salida se va a comprimir. Este nodo no busca nada por su cuenta, filtra lo que le trae el retriever que tiene debajo.

El retriever cuya salida se va a comprimir. Este nodo no busca nada por su cuenta, filtra lo que le trae el retriever que tiene debajo.

Parámetros clave

  • Required: sin un retriever conectado no hay nada que comprimir.
  • Vector Store Retriever: la opción corriente, que lee un vector store llenado de antemano.
  • Workflow Retriever: cuando los documentos vienen de otro workflow de n8n y no de un store.
  • MultiQuery Retriever: cuando una misma pregunta merece varias búsquedas antes de comprimir.
Casos de uso
una documentación de producto que se consulta en cada pregunta de cliente, o un workflow que saca fichas de una herramienta interna y las entrega como documentos.
Parámetros

Contextual Compression Retriever

El nodo Contextual Compression Retriever tiene 0 parámetros. Para cada uno: el nodo tal como lo configuras en n8n, qué cambia el parámetro y nuestras notas de campo.

Necesitas ayuda

¿Necesitas ayuda para automatizar Contextual Compression Retriever con n8n?

El equipo te responde directamente.

Cada mensaje lo lee una persona.

FAQ

Lo que se pregunta después

01¿El Contextual Compression Retriever viene incluido en n8n?
Sí. Forma parte del paquete de IA que se entrega con n8n, y está tanto en n8n Cloud, la oferta alojada por n8n, como en una instancia autoalojada con la Community Edition. Nada que instalar, ningún coste extra del lado de n8n, y un workflow se comporta igual en los dos casos. Lo que sí se factura es el proveedor del modelo de chat que conectes, según sus propias condiciones, porque la compresión le manda cada documento recuperado para reescribirlo. n8n no añade nada a esa factura.
02¿Qué hace falta para que funcione?
Nada que autenticar en este nodo. Abre su panel: no hay campo de credential, no hay selector Authentication y, de hecho, no hay ningún parámetro. Ese es justamente el argumento. Lo que necesita son conexiones, no ajustes. Un modelo de chat en un puerto, un retriever en el otro, y funciona. El credential vive en el subnodo del modelo, que es donde corresponde la clave del proveedor, así que una clave ya configurada en otro sitio se reutiliza tal cual. Aquí no hay nada que configurar, y por tanto nada que puedas dejar mal configurado.
03¿Qué límites tiene el nodo Contextual Compression Retriever n8n?
Tres. Añade una llamada de modelo por documento recuperado, así que la recuperación se vuelve más lenta y la factura del proveedor crece con el número de documentos. Puede recortar un pasaje que la cadena necesitaba, porque quien decide qué es relevante es el modelo y no una regla que escribas tú. Y como su panel no expone nada, no hay umbral, ni longitud objetivo, ni prompt que ajustar cuando el resultado no convence: cambias de modelo de chat, o cambias el retriever de abajo. La versión vigente es la 1.
04¿Qué hay que conectar como mínimo y con qué subnodo empezar?
Los dos puertos, porque los dos son obligatorios. Empieza con un Vector Store Retriever en el puerto de retriever, apuntando a un store que ya tengas lleno, y un OpenAI Chat Model o un Anthropic Chat Model en el puerto del modelo. Después conecta el conjunto a una Question and Answer Chain. Ese es el montaje más corto que responde a una pregunta real. Cuando funcione, prueba un modelo más ligero o alojado en tu casa para la compresión, con un Ollama Chat Model: esa llamada se repite por documento y la respuesta se redacta en otro sitio.
05¿n8n o Make para este tipo de recuperación?
Depende de dónde puedan vivir tus documentos y de cómo quieras pagar. n8n se autoaloja con Docker o npm, así que los documentos comprimidos y las llamadas al modelo se quedan en una infraestructura que controlas, algo que pesa cuando la base es interna. Make solo existe alojado, sin opción de autoalojamiento, y factura por operación: previsible con un volumen estable, menos cuando una recuperación se multiplica en una llamada de modelo por documento. Make sigue siendo el editor visual más cómodo en escenarios lineales. Para un flujo de IA hecho de subnodos sobre puertos, n8n encaja mejor.
Hack'celeration Lab

Recibe nuestros tips de integración cada semana.

Sin spam. Cancela cuando quieras.