Recursos · Integración n8n

Nodo Ollama Chat Model n8nConfigura Ollama Chat Model en n8n.

Ollama sirve modelos de lenguaje desde tu máquina, y el nodo Ollama Chat Model n8n es lo que permite a un flujo hablar con ellos. Trae 21 parámetros y un único puerto de salida, sin entrada principal. Conéctalo a un AI Agent o a una cadena y el prompt nunca sale de tu servidor.

Reseñas verificadas en Trustpilot · Agencia de IA, automatización y growth

Por qué automatizar

¿Qué hace en realidad el nodo Ollama Chat Model n8n?

Ollama Chat Model es un subnodo, es decir un nodo que se engancha a otro en lugar de colocarse en el flujo principal. No tiene entrada principal y nunca se ejecuta solo. Un nodo raíz, un AI Agent o una cadena, le pide una generación, el nodo traslada esa petición a tu instancia de Ollama y el texto vuelve por el puerto. Todo lo que ajustes aquí, modelo, muestreo, memoria y GPU, se aplica a esa llamada.

Hay tres trabajos que aparecen una y otra vez. Uno, un asistente interno: una cadena manda una pregunta al modelo local y devuelve la respuesta, con Sampling Temperature baja para que dos consultas iguales den respuestas comparables. Dos, un agente con herramientas: un AI Agent razona con el modelo local y consulta una ficha en Google Sheets. Ahí Context Length empieza a doler, porque los resultados de las herramientas se acumulan en la ventana de contexto, el texto que el modelo ve de golpe. Tres, clasificación en volumen: cientos de filas pasan por el nodo con Output Format en json, y el nodo siguiente lee un campo en vez de trocear una frase.

¿Cuándo conviene otro nodo? Ollama implica alojar el modelo tú mismo, o sea una GPU o mucha paciencia con la CPU, y una URL base a la que n8n pueda llegar. Si nada de eso encaja, un nodo de modelo alojado como OpenAI o Anthropic se conecta al mismo puerto con una clave y sin nada que administrar. El proveedor factura entonces sus propias llamadas de API según sus condiciones, y n8n no añade nada en ninguno de los dos casos. Lo que cambias es trabajo de operación por datos que se quedan en tu hardware.

Dos límites antes de montar nada. Las expresiones se comportan distinto en un subnodo: {{ $json.name }} apunta siempre al primer item, aunque lleguen cinco, así que no hay forma de inyectar un valor distinto por item. Y el nodo lee su dirección en las credenciales de Ollama, que es por lo que tantos montajes con Docker se quedan atascados hasta acertar con la dirección del host. La Reseña n8n sitúa la plataforma más allá de la parte de IA.

Conexión

¿Cómo apuntas n8n a tu instancia de Ollama?

  1. 01

    Expón Ollama en una dirección alcanzable

    Ollama escucha en el puerto 11434. Si corre en Docker, ponlo a escuchar en 0.0.0.0 dentro del contenedor, cosa que las imágenes oficiales ya hacen, y publica el puerto con la opción -p: docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. Si Ollama corre directamente en la máquina anfitriona mientras n8n va en contenedor, es en el anfitrión donde hay que escuchar en 0.0.0.0.

  2. 02

    Crea las credenciales de Ollama en n8n

    En el menú Credentials, añade credenciales de Ollama y rellena la URL base. Misma máquina y sin contenedores: http://localhost:11434. n8n en Docker sobre Linux: arranca el contenedor con --add-host host.docker.internal:host-gateway y usa http://host.docker.internal:11434; con Docker Desktop ya viene configurado. Dos contenedores separados: usa el nombre del contenedor de Ollama, por ejemplo http://my-ollama:11434.

  3. 03

    Añade una clave para una instancia remota

    El nodo admite autenticación con token Bearer, un método en el que la clave viaja en la cabecera de la petición, para instancias de Ollama detrás de un proxy autenticado como Open WebUI. Pon la URL remota y la clave de API en esas mismas credenciales. Un aviso de la documentación: Ollama no admite agentes HTTP personalizados, así que un montaje detrás de un proxy HTTP o HTTPS puede no funcionar, tengas o no las variables HTTP_PROXY.

Conexiones

¿Dónde se conecta este nodo?

n8n reparte el trabajo de IA entre un nodo raíz, que recibe los items del flujo, y subnodos enganchados a sus puertos, un tipo de subnodo por puerto. Ollama Chat Model es uno de esos subnodos: una sola conexión que hacer y ninguna entrada principal.

Salida (dónde se conecta)

  • Modelai_languageModel
01ModelEl nodo expone una única salida, el puerto ai_languageModel. Arrástralo al hueco Model de un nodo raíz y los dos funcionan como un conjunto: los items entran por el nodo raíz, este llama al modelo, la respuesta vuelve.

El nodo expone una única salida, el puerto ai_languageModel. Arrástralo al hueco Model de un nodo raíz y los dos funcionan como un conjunto: los items entran por el nodo raíz, este llama al modelo, la respuesta vuelve.

Parámetros clave

  • Required: un subnodo nunca se ejecuta solo, así que un Ollama Chat Model sin conectar no hace absolutamente nada.
  • Basic LLM Chain: entra un prompt, sale una respuesta, nada más que cablear.
  • AI Agent: el nodo raíz cuando el asistente llama herramientas y mantiene una memoria.
  • Question and Answer Chain: respuestas sacadas de tus propios documentos, mientras Text Classifier y Summarization Chain cubren clasificar y resumir.
Casos de uso
un flujo de soporte arranca con una Basic LLM Chain y cambia ese nodo raíz por un AI Agent Tool cuando el asistente tiene que actuar.
Parámetros

¿Qué parámetro tocas y en qué momento?

El nodo Ollama Chat Model tiene 21 parámetros. Para cada uno: el nodo tal como lo configuras en n8n, qué cambia el parámetro y nuestras notas de campo.

01

Model

model

Lo que ves en n8n

Notas y casos de uso

Esta lista indica el modelo que genera la completación. Es el único ajuste que rellenas siempre, y tiene que corresponder a un modelo ya descargado en la máquina de Ollama; la biblioteca de modelos de Ollama recoge lo disponible.

Parámetros clave

  • Model: requerido. La documentación del nodo cita Llama2, Llama2 13B, Llama2 70B y Llama2 Uncensored entre las opciones.
Casos de uso
un primer asistente local empieza con un modelo pequeño para validar la fontanería y sube de tamaño cuando el punto débil pasa a ser la calidad de las respuestas.
02

Enable Thinking

options.think

Lo que ves en n8n

Notas y casos de uso

Algunos modelos razonan paso a paso antes de responder. Con el modo de razonamiento activado, que es lo que viene por defecto, ese razonamiento queda separado de la salida. Desactivado, el modelo escribe el contenido directamente. No cambia nada en los modelos que no soportan la función.

Parámetros clave

  • Enable Thinking: una casilla activada por defecto, que aparta el razonamiento del modelo de lo que recibe el flujo.
Casos de uso
un nodo que alimenta un mensaje de Slack solo quiere la respuesta, y dejarlo activado mantiene el razonamiento fuera del texto que lee el equipo.
03

Sampling Temperature

options.temperature

Lo que ves en n8n

Notas y casos de uso

El azar del texto generado lo gobierna este número. Los valores bajos dan una salida más centrada y determinista. Los altos la vuelven más diversa y aleatoria, con el riesgo de invención que eso trae.

Parámetros clave

  • Sampling Temperature: un número, bajo para respuestas reproducibles, alto para respuestas variadas.
Casos de uso
dos nodos, dos ajustes. El que reescribe la descripción de un producto puede ir caliente; el que decide la categoría de un ticket va frío, para que la misma entrada caiga siempre en el mismo sitio.
04

Top K

options.topK

Lo que ves en n8n

Notas y casos de uso

En cada paso el modelo ordena tokens candidatos, los fragmentos de palabra con los que construye el texto. Top K limita cuántos de los más probables siguen en juego. Un valor alto aumenta la diversidad pero puede reducir la coherencia. Con -1, el límite desaparece.

Parámetros clave

  • Top K: un número, que limita los tokens de vocabulario más probables considerados en cada paso.
Casos de uso
una respuesta que se desvía a mitad de camino suele enderezarse bajando este ajuste, antes incluso de retocar el prompt.
05

Top P

options.topP

Lo que ves en n8n

Notas y casos de uso

Aquí no se cuentan tokens sino probabilidad acumulada: el modelo elige dentro del conjunto más pequeño cuya probabilidad sumada supera el umbral. El efecto documentado es un texto más natural y con menos repeticiones.

Parámetros clave

  • Top P: un número, un valor bajo descarta las opciones menos probables.
Casos de uso
con un asistente que siempre responde con los mismos giros, tocar esto funciona mejor que subir la temperatura, porque la redacción se suelta sin que los datos se vayan de paseo.
06

Frequency Penalty

options.frequencyPenalty

Lo que ves en n8n

Notas y casos de uso

Los tokens que ya salieron en el texto generado quedan penalizados, y este valor dice cuánto. Cuanto más sube, menos se repite el modelo. La penalización sigue a la frecuencia: cuanto más vuelve una fórmula, más se aleja de ella.

Parámetros clave

  • Frequency Penalty: un número, que ajusta la penalización de los tokens ya presentes en la salida.
Casos de uso
un resumen largo que vuelve tres veces sobre la misma frase se calma en cuanto se sube este ajuste.
07

Keep Alive

options.keepAlive

Lo que ves en n8n

Notas y casos de uso

Terminada la generación, Ollama puede mantener el modelo en memoria en lugar de descargarlo. Este campo dice cuánto tiempo, como una duración del tipo 1h30m para una hora y treinta minutos. Sirve para los modelos que se usan a menudo.

Parámetros clave

  • Keep Alive: una cadena de duración en formato 1h30m, que fija cuánto sigue cargado el modelo tras usarlo.
Casos de uso
un flujo que se dispara cada pocos minutos vuelve a pagar la carga del modelo en cada ejecución mientras esa ventana no cubra el intervalo.
08

Low VRAM Mode

options.lowVram

Lo que ves en n8n

Notas y casos de uso

¿Memoria gráfica justa? Este interruptor reduce el consumo de memoria a cambio de una generación más lenta. Está pensado para GPU con poca memoria, y es un intercambio real, no una optimización gratis.

Parámetros clave

  • Low VRAM Mode: una casilla que cambia velocidad de generación por menos memoria usada.
Casos de uso
un modelo que se niega a cargar en una tarjeta de consumo puede entrar con esta opción, y vale la pena probarlo antes de bajar de modelo.
09

Main GPU ID

options.mainGpu

Lo que ves en n8n

Notas y casos de uso

En una máquina con varias tarjetas gráficas hay que señalar cuál lleva el cálculo principal. Este campo recibe ese identificador de GPU. Con una sola tarjeta no hay nada que decidir, y la documentación pide tocarlo solo si tienes varias GPU.

Parámetros clave

  • Main GPU ID: un número, el identificador de la GPU usada para el cálculo principal.
Casos de uso
un servidor compartido donde una tarjeta ya está ocupada por otro servicio, así que el flujo se dirige a la que queda libre.
10

Context Batch Size

options.numBatch

Lo que ves en n8n

Notas y casos de uso

El prompt se procesa por lotes, y este ajuste fija su tamaño. Lotes más grandes pueden acelerar la generación, pero consumen más memoria. Es la palanca de rendimiento, sin efecto sobre la calidad de la salida.

Parámetros clave

  • Context Batch Size: un número, el tamaño de lote usado para procesar el prompt.
Casos de uso
un proceso nocturno que empuja documentos largos al modelo puede ganar tiempo aquí, siempre que la máquina tenga memoria de sobra.
11

Context Length

options.numCtx

Lo que ves en n8n

Notas y casos de uso

La ventana de contexto es el texto que el modelo mantiene a la vista para producir el siguiente token. Este número la topa. Un valor bajo reduce la memoria consumida, uno alto da más material al modelo.

Parámetros clave

  • Context Length: el número máximo de tokens que sirven de contexto para generar el siguiente token.
Casos de uso
una conversación de agente que de golpe olvida lo dicho antes suele estar chocando con este techo, porque el historial y los resultados de herramientas comparten el mismo presupuesto.
12

Number of GPUs

options.numGpu

Lo que ves en n8n

Notas y casos de uso

El procesamiento en paralelo entre tarjetas se ajusta aquí: el valor indica cuántas GPU debe usar Ollama. Con -1 se activa la detección automática, que es lo razonable en una máquina que controlas.

Parámetros clave

  • Number of GPUs: un número, -1 significa detección automática.
Casos de uso
un servidor con varias tarjetas compartido con otros procesos, donde el flujo se limita a una parte en vez de quedárselo todo.
13

Max Tokens to Generate

options.numPredict

Lo que ves en n8n

Notas y casos de uso

El largo de la respuesta encuentra su techo en este campo. Con -1 desaparece el límite, aunque la documentación avisa contra los valores altos, que llevan a salidas muy largas y a los tiempos de ejecución que las acompañan.

Parámetros clave

  • Max Tokens to Generate: el número máximo de tokens producidos, -1 quita el límite.
Casos de uso
un nodo que escribe un resumen corto en una columna de base de datos se topa aquí, para que ningún item genere un muro de texto aguas abajo.
14

Number of CPU Threads

options.numThread

Lo que ves en n8n

Notas y casos de uso

El trabajo en la CPU usa tantos hilos como permita este valor. Con 0, Ollama detecta el número por su cuenta. Merece la pena tocarlo cuando la máquina hace algo más que servir modelos.

Parámetros clave

  • Number of CPU Threads: un número, 0 activa la detección automática.
Casos de uso
n8n y Ollama en el mismo servidor, donde limitar los hilos evita que la generación ahogue al motor de flujos durante las ejecuciones largas.
15

Penalize Newlines

options.penalizeNewline

Lo que ves en n8n

Notas y casos de uso

Los saltos de línea también son tokens. Activado, este ajuste hace menos probable que el modelo los genere, lo que empuja hacia secuencias de texto continuas en vez de líneas cortadas.

Parámetros clave

  • Penalize Newlines: una casilla que vuelve menos probables los caracteres de salto de línea en la salida.
Casos de uso
un nodo que redacta el cuerpo de un correo para Gmail, donde una respuesta llena de viñetas habría que limpiarla antes de enviarla.
16

Presence Penalty

options.presencePenalty

Lo que ves en n8n

Notas y casos de uso

El criterio ya no es la frecuencia sino la simple presencia: un token se penaliza en cuanto ha aparecido en el texto producido. Los valores positivos empujan al modelo hacia material nuevo y favorecen la diversidad.

Parámetros clave

  • Presence Penalty: un número, los valores positivos penalizan los tokens ya aparecidos.
Casos de uso
buscar ángulos para una campaña, cuando el modelo si no sirve cinco variantes de su primera idea.
17

Repetition Penalty

options.repeatPenalty

Lo que ves en n8n

Notas y casos de uso

Un modelo atrapado en bucle, repitiendo la misma frase sin parar, es lo que este factor corrige. Cuanto más alto, más fuerte desalienta la repetición. Con 1.0, la penalización por repetición queda desactivada.

Parámetros clave

  • Repetition Penalty: un número, que ajusta el factor de penalización de los tokens repetidos, 1.0 lo desactiva.
Casos de uso
un modelo local pequeño que degenera en bucles con generaciones largas, donde subir esto va más rápido que cambiar de modelo.
18

Use Memory Locking

options.useMLock

Lo que ves en n8n

Notas y casos de uso

El swap, cuando el sistema manda páginas de memoria al disco, hunde los tiempos de respuesta. Bloquear el modelo en memoria lo evita y puede mejorar el rendimiento, pero exige memoria libre suficiente para sostenerlo entero.

Parámetros clave

  • Use Memory Locking: una casilla que fija el modelo en memoria para evitar el swap.
Casos de uso
un servidor dedicado a modelos con memoria de sobra, donde el tiempo de respuesta pesa más que dejar sitio a otros procesos.
19

Use Memory Mapping

options.useMMap

Lo que ves en n8n

Notas y casos de uso

Cargar el fichero del modelo mediante mapeo de memoria puede reducir la memoria usada, con posible impacto en el rendimiento. La documentación recomienda dejarlo activado, así que es un ajuste que se desactiva a propósito, no por defecto.

Parámetros clave

  • Use Memory Mapping: una casilla para la carga del modelo por mapeo de memoria, recomendada activa.
Casos de uso
un anfitrión ajustado que mueve varios modelos, donde la memoria ahorrada al cargar es lo que les permite convivir.
20

Load Vocabulary Only

options.vocabOnly

Lo que ves en n8n

Notas y casos de uso

Solo se carga el vocabulario del modelo, sin los pesos. Detrás no hay generación real, y ese es justo el punto: probar la tokenización se vuelve rápido.

Parámetros clave

  • Load Vocabulary Only: una casilla que carga el vocabulario y deja los pesos fuera.
Casos de uso
comprobar cómo un modelo trocea tus textos antes de confiarle un lote largo, sin esperar a una carga completa.
21

Output Format

options.format

Lo que ves en n8n

Notas y casos de uso

Los nodos siguientes rara vez quieren prosa. Este selector fija el formato de la respuesta de la API, para que llegue en una forma que el resto del flujo pueda manejar.

Parámetros clave

  • Output Format: dos opciones, default (Default) y json (JSON).
Casos de uso
un flujo de clasificación pasa a json para que el nodo siguiente lea un campo directamente, en lugar de rescatar el valor dentro de una frase.
Necesitas ayuda

¿Necesitas ayuda para automatizar Ollama Chat Model con n8n?

El equipo te responde directamente.

Cada mensaje lo lee una persona.

FAQ

Lo que se pregunta después

01¿El nodo Ollama Chat Model n8n viene incluido en n8n?
Sí. Forma parte del paquete de IA de n8n, @n8n/n8n-nodes-langchain, que se entrega con n8n. No hay nada que instalar ni sobrecoste por el lado de n8n, ni en n8n Cloud ni en una instancia autoalojada con la Community Edition y su licencia Sustainable Use. Como los modelos corren en tu propio servidor de Ollama, tampoco hay un proveedor facturando llamadas de API. El coste se desplaza a otro sitio: hardware y operación, una máquina con memoria suficiente, una GPU o paciencia con la CPU, y una URL base a la que n8n llegue.
02¿Qué hace falta para que el nodo funcione?
Una instancia de Ollama y unas credenciales de Ollama en n8n. La credencial guarda la URL base, y ahí se va casi todo el trabajo: puerto 11434 por defecto, localhost cuando todo está en la misma máquina sin contenedores, host.docker.internal cuando n8n corre en Docker, o el nombre del contenedor de Ollama cuando ambos van en contenedores separados. Para una instancia remota detrás de un proxy autenticado como Open WebUI, añade una clave de API junto a la URL y el nodo se autentica con token Bearer. La credencial se crea una vez y se reutiliza en todos los flujos.
03¿Qué límites tiene este nodo?
Es un subnodo: sin entrada principal y sin ejecución por su cuenta, necesita un nodo raíz conectado al puerto Model. Las expresiones responden distinto ahí, porque con cinco items de entrada una expresión apunta siempre al primero, así que no hay valor por item. Ollama no admite agentes HTTP personalizados, lo que vuelve poco fiables los proxys HTTP o HTTPS sin importar las variables HTTP_PROXY. Y el nodo está en la versión 1, de modo que un flujo antiguo puede mostrar menos de los 21 parámetros descritos aquí.
04¿Qué hay que conectar como mínimo y por qué nodo empezar?
Con una conexión basta: arrastra la salida al puerto Model de un nodo raíz. Para empezar, Basic LLM Chain es la pareja más simple, porque manda un prompt y devuelve una respuesta sin más ajustes. Pasa a AI Agent cuando el asistente tenga que llamar herramientas o mantener una memoria, es decir seguir el hilo de la conversación. En el nodo, Model es el único parámetro requerido y el resto son opciones. Ajusta Model, conecta el puerto, lanza el flujo una vez y afina después.
05¿n8n o Make para correr un modelo local?
Make es una plataforma de automatización alojada, sin opción de autoalojamiento, facturada por operación. Aquí eso pesa más de lo normal, porque un modelo local ya es una decisión de autoalojamiento y una plataforma alojada tiene que alcanzar tu máquina desde fuera. n8n puede correr en la misma red que Ollama, y así los prompts y las respuestas se quedan dentro de tu infraestructura. Make resulta más cómodo cuando nadie quiere mantener un servidor y el equipo ya domina su editor visual. Decide por alojamiento, control del dato y modelo de coste.
Hack'celeration Lab

Recibe nuestros tips de integración cada semana.

Sin spam. Cancela cuando quieras.