- Inicio
- Recursos
- Integraciones
- Ollama Chat Model
Nodo Ollama Chat Model n8nConfigura Ollama Chat Model en n8n.
Ollama sirve modelos de lenguaje desde tu máquina, y el nodo Ollama Chat Model n8n es lo que permite a un flujo hablar con ellos. Trae 21 parámetros y un único puerto de salida, sin entrada principal. Conéctalo a un AI Agent o a una cadena y el prompt nunca sale de tu servidor.
Reseñas verificadas en Trustpilot · Agencia de IA, automatización y growth
¿Qué hace en realidad el nodo Ollama Chat Model n8n?
Ollama Chat Model es un subnodo, es decir un nodo que se engancha a otro en lugar de colocarse en el flujo principal. No tiene entrada principal y nunca se ejecuta solo. Un nodo raíz, un AI Agent o una cadena, le pide una generación, el nodo traslada esa petición a tu instancia de Ollama y el texto vuelve por el puerto. Todo lo que ajustes aquí, modelo, muestreo, memoria y GPU, se aplica a esa llamada.
Hay tres trabajos que aparecen una y otra vez. Uno, un asistente interno: una cadena manda una pregunta al modelo local y devuelve la respuesta, con Sampling Temperature baja para que dos consultas iguales den respuestas comparables. Dos, un agente con herramientas: un AI Agent razona con el modelo local y consulta una ficha en Google Sheets. Ahí Context Length empieza a doler, porque los resultados de las herramientas se acumulan en la ventana de contexto, el texto que el modelo ve de golpe. Tres, clasificación en volumen: cientos de filas pasan por el nodo con Output Format en json, y el nodo siguiente lee un campo en vez de trocear una frase.
¿Cuándo conviene otro nodo? Ollama implica alojar el modelo tú mismo, o sea una GPU o mucha paciencia con la CPU, y una URL base a la que n8n pueda llegar. Si nada de eso encaja, un nodo de modelo alojado como OpenAI o Anthropic se conecta al mismo puerto con una clave y sin nada que administrar. El proveedor factura entonces sus propias llamadas de API según sus condiciones, y n8n no añade nada en ninguno de los dos casos. Lo que cambias es trabajo de operación por datos que se quedan en tu hardware.
Dos límites antes de montar nada. Las expresiones se comportan distinto en un subnodo: {{ $json.name }} apunta siempre al primer item, aunque lleguen cinco, así que no hay forma de inyectar un valor distinto por item. Y el nodo lee su dirección en las credenciales de Ollama, que es por lo que tantos montajes con Docker se quedan atascados hasta acertar con la dirección del host. La Reseña n8n sitúa la plataforma más allá de la parte de IA.
¿Cómo apuntas n8n a tu instancia de Ollama?
- 01
Expón Ollama en una dirección alcanzable
Ollama escucha en el puerto
11434. Si corre en Docker, ponlo a escuchar en0.0.0.0dentro del contenedor, cosa que las imágenes oficiales ya hacen, y publica el puerto con la opción-p:docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. Si Ollama corre directamente en la máquina anfitriona mientras n8n va en contenedor, es en el anfitrión donde hay que escuchar en0.0.0.0. - 02
Crea las credenciales de Ollama en n8n
En el menú Credentials, añade credenciales de Ollama y rellena la URL base. Misma máquina y sin contenedores:
http://localhost:11434. n8n en Docker sobre Linux: arranca el contenedor con--add-host host.docker.internal:host-gatewayy usahttp://host.docker.internal:11434; con Docker Desktop ya viene configurado. Dos contenedores separados: usa el nombre del contenedor de Ollama, por ejemplohttp://my-ollama:11434. - 03
Añade una clave para una instancia remota
El nodo admite autenticación con token Bearer, un método en el que la clave viaja en la cabecera de la petición, para instancias de Ollama detrás de un proxy autenticado como Open WebUI. Pon la URL remota y la clave de API en esas mismas credenciales. Un aviso de la documentación: Ollama no admite agentes HTTP personalizados, así que un montaje detrás de un proxy HTTP o HTTPS puede no funcionar, tengas o no las variables
HTTP_PROXY.
¿Dónde se conecta este nodo?
n8n reparte el trabajo de IA entre un nodo raíz, que recibe los items del flujo, y subnodos enganchados a sus puertos, un tipo de subnodo por puerto. Ollama Chat Model es uno de esos subnodos: una sola conexión que hacer y ninguna entrada principal.
Salida (dónde se conecta)
- Model
ai_languageModel
01Model
El nodo expone una única salida, el puerto ai_languageModel. Arrástralo al hueco Model de un nodo raíz y los dos funcionan como un conjunto: los items entran por el nodo raíz, este llama al modelo, la respuesta vuelve.
Parámetros clave
- Required: un subnodo nunca se ejecuta solo, así que un Ollama Chat Model sin conectar no hace absolutamente nada.
- Basic LLM Chain: entra un prompt, sale una respuesta, nada más que cablear.
- AI Agent: el nodo raíz cuando el asistente llama herramientas y mantiene una memoria.
- Question and Answer Chain: respuestas sacadas de tus propios documentos, mientras Text Classifier y Summarization Chain cubren clasificar y resumir.
¿Qué parámetro tocas y en qué momento?
El nodo Ollama Chat Model tiene 21 parámetros. Para cada uno: el nodo tal como lo configuras en n8n, qué cambia el parámetro y nuestras notas de campo.
Índice de parámetros
- Model
- Enable Thinking
- Sampling Temperature
- Top K
- Top P
- Frequency Penalty
- Keep Alive
- Low VRAM Mode
- Main GPU ID
- Context Batch Size
- Context Length
- Number of GPUs
- Max Tokens to Generate
- Number of CPU Threads
- Penalize Newlines
- Presence Penalty
- Repetition Penalty
- Use Memory Locking
- Use Memory Mapping
- Load Vocabulary Only
- Output Format
Model
modelLo que ves en n8n
Notas y casos de uso
Esta lista indica el modelo que genera la completación. Es el único ajuste que rellenas siempre, y tiene que corresponder a un modelo ya descargado en la máquina de Ollama; la biblioteca de modelos de Ollama recoge lo disponible.
Parámetros clave
- Model: requerido. La documentación del nodo cita Llama2, Llama2 13B, Llama2 70B y Llama2 Uncensored entre las opciones.
Enable Thinking
options.thinkLo que ves en n8n
Notas y casos de uso
Algunos modelos razonan paso a paso antes de responder. Con el modo de razonamiento activado, que es lo que viene por defecto, ese razonamiento queda separado de la salida. Desactivado, el modelo escribe el contenido directamente. No cambia nada en los modelos que no soportan la función.
Parámetros clave
- Enable Thinking: una casilla activada por defecto, que aparta el razonamiento del modelo de lo que recibe el flujo.
Sampling Temperature
options.temperatureLo que ves en n8n
Notas y casos de uso
El azar del texto generado lo gobierna este número. Los valores bajos dan una salida más centrada y determinista. Los altos la vuelven más diversa y aleatoria, con el riesgo de invención que eso trae.
Parámetros clave
- Sampling Temperature: un número, bajo para respuestas reproducibles, alto para respuestas variadas.
Top K
options.topKLo que ves en n8n
Notas y casos de uso
En cada paso el modelo ordena tokens candidatos, los fragmentos de palabra con los que construye el texto. Top K limita cuántos de los más probables siguen en juego. Un valor alto aumenta la diversidad pero puede reducir la coherencia. Con -1, el límite desaparece.
Parámetros clave
- Top K: un número, que limita los tokens de vocabulario más probables considerados en cada paso.
Top P
options.topPLo que ves en n8n
Notas y casos de uso
Aquí no se cuentan tokens sino probabilidad acumulada: el modelo elige dentro del conjunto más pequeño cuya probabilidad sumada supera el umbral. El efecto documentado es un texto más natural y con menos repeticiones.
Parámetros clave
- Top P: un número, un valor bajo descarta las opciones menos probables.
Frequency Penalty
options.frequencyPenaltyLo que ves en n8n
Notas y casos de uso
Los tokens que ya salieron en el texto generado quedan penalizados, y este valor dice cuánto. Cuanto más sube, menos se repite el modelo. La penalización sigue a la frecuencia: cuanto más vuelve una fórmula, más se aleja de ella.
Parámetros clave
- Frequency Penalty: un número, que ajusta la penalización de los tokens ya presentes en la salida.
Keep Alive
options.keepAliveLo que ves en n8n
Notas y casos de uso
Terminada la generación, Ollama puede mantener el modelo en memoria en lugar de descargarlo. Este campo dice cuánto tiempo, como una duración del tipo 1h30m para una hora y treinta minutos. Sirve para los modelos que se usan a menudo.
Parámetros clave
- Keep Alive: una cadena de duración en formato
1h30m, que fija cuánto sigue cargado el modelo tras usarlo.
Low VRAM Mode
options.lowVramLo que ves en n8n
Notas y casos de uso
¿Memoria gráfica justa? Este interruptor reduce el consumo de memoria a cambio de una generación más lenta. Está pensado para GPU con poca memoria, y es un intercambio real, no una optimización gratis.
Parámetros clave
- Low VRAM Mode: una casilla que cambia velocidad de generación por menos memoria usada.
Main GPU ID
options.mainGpuLo que ves en n8n
Notas y casos de uso
En una máquina con varias tarjetas gráficas hay que señalar cuál lleva el cálculo principal. Este campo recibe ese identificador de GPU. Con una sola tarjeta no hay nada que decidir, y la documentación pide tocarlo solo si tienes varias GPU.
Parámetros clave
- Main GPU ID: un número, el identificador de la GPU usada para el cálculo principal.
Context Batch Size
options.numBatchLo que ves en n8n
Notas y casos de uso
El prompt se procesa por lotes, y este ajuste fija su tamaño. Lotes más grandes pueden acelerar la generación, pero consumen más memoria. Es la palanca de rendimiento, sin efecto sobre la calidad de la salida.
Parámetros clave
- Context Batch Size: un número, el tamaño de lote usado para procesar el prompt.
Context Length
options.numCtxLo que ves en n8n
Notas y casos de uso
La ventana de contexto es el texto que el modelo mantiene a la vista para producir el siguiente token. Este número la topa. Un valor bajo reduce la memoria consumida, uno alto da más material al modelo.
Parámetros clave
- Context Length: el número máximo de tokens que sirven de contexto para generar el siguiente token.
Number of GPUs
options.numGpuLo que ves en n8n
Notas y casos de uso
El procesamiento en paralelo entre tarjetas se ajusta aquí: el valor indica cuántas GPU debe usar Ollama. Con -1 se activa la detección automática, que es lo razonable en una máquina que controlas.
Parámetros clave
- Number of GPUs: un número,
-1significa detección automática.
Max Tokens to Generate
options.numPredictLo que ves en n8n
Notas y casos de uso
El largo de la respuesta encuentra su techo en este campo. Con -1 desaparece el límite, aunque la documentación avisa contra los valores altos, que llevan a salidas muy largas y a los tiempos de ejecución que las acompañan.
Parámetros clave
- Max Tokens to Generate: el número máximo de tokens producidos,
-1quita el límite.
Number of CPU Threads
options.numThreadLo que ves en n8n
Notas y casos de uso
El trabajo en la CPU usa tantos hilos como permita este valor. Con 0, Ollama detecta el número por su cuenta. Merece la pena tocarlo cuando la máquina hace algo más que servir modelos.
Parámetros clave
- Number of CPU Threads: un número,
0activa la detección automática.
Penalize Newlines
options.penalizeNewlineLo que ves en n8n
Notas y casos de uso
Los saltos de línea también son tokens. Activado, este ajuste hace menos probable que el modelo los genere, lo que empuja hacia secuencias de texto continuas en vez de líneas cortadas.
Parámetros clave
- Penalize Newlines: una casilla que vuelve menos probables los caracteres de salto de línea en la salida.
Presence Penalty
options.presencePenaltyLo que ves en n8n
Notas y casos de uso
El criterio ya no es la frecuencia sino la simple presencia: un token se penaliza en cuanto ha aparecido en el texto producido. Los valores positivos empujan al modelo hacia material nuevo y favorecen la diversidad.
Parámetros clave
- Presence Penalty: un número, los valores positivos penalizan los tokens ya aparecidos.
Repetition Penalty
options.repeatPenaltyLo que ves en n8n
Notas y casos de uso
Un modelo atrapado en bucle, repitiendo la misma frase sin parar, es lo que este factor corrige. Cuanto más alto, más fuerte desalienta la repetición. Con 1.0, la penalización por repetición queda desactivada.
Parámetros clave
- Repetition Penalty: un número, que ajusta el factor de penalización de los tokens repetidos,
1.0lo desactiva.
Use Memory Locking
options.useMLockLo que ves en n8n
Notas y casos de uso
El swap, cuando el sistema manda páginas de memoria al disco, hunde los tiempos de respuesta. Bloquear el modelo en memoria lo evita y puede mejorar el rendimiento, pero exige memoria libre suficiente para sostenerlo entero.
Parámetros clave
- Use Memory Locking: una casilla que fija el modelo en memoria para evitar el swap.
Use Memory Mapping
options.useMMapLo que ves en n8n
Notas y casos de uso
Cargar el fichero del modelo mediante mapeo de memoria puede reducir la memoria usada, con posible impacto en el rendimiento. La documentación recomienda dejarlo activado, así que es un ajuste que se desactiva a propósito, no por defecto.
Parámetros clave
- Use Memory Mapping: una casilla para la carga del modelo por mapeo de memoria, recomendada activa.
Load Vocabulary Only
options.vocabOnlyLo que ves en n8n
Notas y casos de uso
Solo se carga el vocabulario del modelo, sin los pesos. Detrás no hay generación real, y ese es justo el punto: probar la tokenización se vuelve rápido.
Parámetros clave
- Load Vocabulary Only: una casilla que carga el vocabulario y deja los pesos fuera.
Output Format
options.formatLo que ves en n8n
Notas y casos de uso
Los nodos siguientes rara vez quieren prosa. Este selector fija el formato de la respuesta de la API, para que llegue en una forma que el resto del flujo pueda manejar.
Parámetros clave
- Output Format: dos opciones,
default(Default) yjson(JSON).
json para que el nodo siguiente lea un campo directamente, en lugar de rescatar el valor dentro de una frase.¿Necesitas ayuda para automatizar Ollama Chat Model con n8n?
El equipo te responde directamente.
Cada mensaje lo lee una persona.
Lo que se pregunta después
01¿El nodo Ollama Chat Model n8n viene incluido en n8n?
02¿Qué hace falta para que el nodo funcione?
03¿Qué límites tiene este nodo?
04¿Qué hay que conectar como mínimo y por qué nodo empezar?
05¿n8n o Make para correr un modelo local?
Recibe nuestros tips de integración cada semana.
Sin spam. Cancela cuando quieras.


