Recursos · Integración n8n

Nodo Ollama Model n8nConfigura Ollama Model en n8n.

El nodo Ollama Model n8n conecta un flujo de trabajo con un modelo de lenguaje que corre en tu propia máquina. Es un subnodo: no tiene entrada principal ni se ejecuta solo, así que se engancha al puerto Model de un nodo raíz. Un selector, 21 parámetros, y el texto no sale de tu red.

Reseñas verificadas en Trustpilot · Agencia de IA, automatización y growth

Por qué automatizar

¿Para qué sirve el nodo Ollama Model n8n?

El nodo entrega un prompt a una instancia de Ollama que alojas tú y devuelve la respuesta al nodo raíz que la pidió. No se coloca en el flujo principal. Los nodos de IA de n8n funcionan en clúster: un nodo raíz recibe los items del flujo y los subnodos se enganchan a sus puertos, un tipo de subnodo por puerto. Este ocupa el puerto ai_languageModel y permanece inactivo mientras ningún nodo raíz lo llame.

Primer escenario: la consulta que no puede salir de la oficina. Una Basic LLM Chain recibe una pregunta, el nodo Ollama Model responde con un modelo descargado en el servidor de la empresa, y la respuesta vuelve al flujo. Ningún prompt cruza la puerta, algo que pesa cuando dentro va un expediente o una nota interna. Después la respuesta puede caer en Slack o en un ticket de soporte.

Segundo escenario: la revisión. Un modelo de control lee una afirmación junto al texto de origen y dice si se sostiene. Nada impide que dos nodos Ollama Model convivan en el mismo flujo sobre dos cadenas distintas, cada uno con su valor en Model, uno que redacta y otro que revisa. Con una Sampling Temperature baja en el revisor, el veredicto se repite igual entre ejecuciones.

Tercer escenario: la búsqueda documental en casa. Los documentos se trocean, se vectorizan y se guardan en un vector store, y una cadena de resumen o de preguntas y respuestas usa este nodo para redactar la respuesta final a partir de los fragmentos recuperados. Alimenta la cadena desde Google Sheets o desde un buzón y todo el recorrido se queda dentro del perímetro.

¿Cuándo conviene otra cosa? La documentación oficial del nodo lo dice sin rodeos: no soporta herramientas, así que no funciona con el nodo AI Agent y hay que preferir la Basic LLM Chain. En cuanto un agente tiene que llamar herramientas, o un AI Agent Tool se anida dentro de otro agente, hace falta un modelo de chat que las gestione, del lado de los nodos OpenAI o Anthropic. Esos proveedores facturan sus propias llamadas a la API; n8n no añade nada encima.

Quedan dos límites que conviene tener claros antes de montar nada. En un subnodo las expresiones no se comportan igual: donde un nodo normal resuelve {{ $json.campo }} una vez por item, aquí la expresión devuelve siempre el primero, de modo que una lista de cinco prompts no se desplegará desde este nodo. Y Ollama no admite agentes HTTP personalizados en su configuración, lo que complica usarlo detrás de un proxy propio aunque estén puestas las variables de entorno de siempre.

Conexión

¿Qué hace falta para conectarlo?

  1. 01

    Levanta Ollama y descarga un modelo

    Ollama tiene que ser alcanzable desde n8n antes de que el nodo muestre algo útil. Instálalo en la máquina o arranca el contenedor oficial publicando el puerto: docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. El puerto 11434 es el que Ollama escucha por defecto. Luego descarga al menos un modelo desde la Ollama Models Library, porque el selector Model del nodo ofrece lo que tu instancia sabe servir.

  2. 02

    Crea el credential de Ollama en n8n

    Abre el menú Credentials de n8n y añade un credential de Ollama, el juego de datos de acceso que n8n guarda. El campo decisivo es la URL base, la dirección que n8n llama: http://localhost:11434 cuando todo corre en la misma máquina. Si la instancia es remota y está detrás de un proxy autenticado como Open WebUI, el nodo admite el token Bearer: rellena la URL remota y la clave de API. Se crea una vez y se reutiliza en todos los flujos.

  3. 03

    Engancha el nodo a un nodo raíz

    Pon el nodo Ollama Model en el lienzo y arrastra su conector hasta el puerto Model de un nodo raíz, una Basic LLM Chain para empezar. Un puerto es la toma etiquetada que cuelga de un nodo raíz y donde encaja un tipo concreto de subnodo. Selecciona el credential, elige un valor en Model y deja las opciones quietas en la primera prueba. El nodo no tiene entrada principal, así que por la izquierda no llega ningún cable.

Conexiones

¿Dónde se engancha este subnodo?

Los nodos de IA de n8n forman un clúster: un nodo raíz lleva la lógica y recibe los items del flujo, y subnodos como este lo amplían a través de sus puertos. Un subnodo nunca se ejecuta solo, de modo que la única pregunta relevante es en qué toma va.

Salida (dónde se conecta)

  • Modelai_languageModel
01ModelEste nodo expone una única salida, de tipo ai_languageModel, y va al puerto Model de un nodo raíz. Esa conexión es lo que hace que el nodo llegue a ejecutarse.

Este nodo expone una única salida, de tipo ai_languageModel, y va al puerto Model de un nodo raíz. Esa conexión es lo que hace que el nodo llegue a ejecutarse.

Parámetros clave

  • Required: sin entrada principal y sin ejecución autónoma, un nodo Ollama Model sin conectar no aporta nada en el lienzo.
  • Basic LLM Chain y Question and Answer Chain son las dos raíces más sencillas para arrancar: entra un prompt, sale texto.
  • Summarization Chain e Information Extractor aceptan el mismo puerto cuando se trata de condensar un documento o de sacarle campos.
Casos de uso
un asistente autoalojado montado sobre una Basic LLM Chain, o una Summarization Chain que acorta hilos de soporte largos antes de que nadie los lea.
Parámetros

¿Qué parámetros se ajustan en el nodo Ollama Model ?

El nodo Ollama Model tiene 21 parámetros. Para cada uno: el nodo tal como lo configuras en n8n, qué cambia el parámetro y nuestras notas de campo.

01

Model

model

Lo que ves en n8n

Notas y casos de uso

Mientras este selector siga vacío no ocurre nada. Señala el modelo que generará la completación, y esa elección decide todo lo demás: calidad de la respuesta, velocidad y memoria ocupada mientras el modelo está cargado.

Parámetros clave

  • Model: el modelo que genera la completación. La documentación oficial del nodo cita Llama2, Llama2 13B, Llama2 70B y Llama2 Uncensored; para descargar modelos, pasa por la Ollama Models Library.
Casos de uso
un modelo pequeño para una cadena de clasificación que corre cientos de veces al día, y uno mayor para la que redacta un resumen que verá el cliente.
02

Enable Thinking

options.think

Lo que ves en n8n

Notas y casos de uso

Los modelos de razonamiento guardan un borrador antes de responder. Este interruptor decide si ese borrador queda aparte del resultado, y no significa nada en un modelo que no soporta el modo.

Parámetros clave

  • Enable Thinking: activa (por defecto) el modo de razonamiento en los modelos compatibles. Activado, el razonamiento se separa de la salida; desactivado, el modelo devuelve el contenido directamente.
Casos de uso
apágalo cuando la cadena mete el texto crudo en otro nodo y un razonamiento suelto ensuciaría el campo que se escribe.
03

Sampling Temperature

options.temperature

Lo que ves en n8n

Notas y casos de uso

El azar tiene una rueda, y es esta. El mismo prompt lanzado dos veces puede volver redactado de otra forma, y la distancia entre esas dos respuestas depende justo de este número.

Parámetros clave

  • Sampling Temperature: controla la aleatoriedad del texto generado. Los valores bajos hacen la salida más enfocada y determinista; los altos, más variada y aleatoria.
Casos de uso
bajo en una cadena que extrae un estado de un ticket, más alto en la que propone tres asuntos de correo entre los que elegir.
04

Top K

options.topK

Lo que ves en n8n

Notas y casos de uso

En cada paso el modelo ordena todo su vocabulario y luego elige de la parte alta. Un token es un fragmento de texto, más o menos una palabra o un trozo de ella. Este ajuste marca hasta dónde puede bajar el muestreo.

Parámetros clave

  • Top K: limita el número de tokens más probables considerados en cada paso. Un valor alto aumenta la diversidad pero puede reducir la coherencia. -1 lo desactiva.
Casos de uso
apretarlo cuando un modelo pequeño se desvía a mitad de un resumen largo.
05

Top P

options.topP

Lo que ves en n8n

Notas y casos de uso

Aquí ya no se cuentan candidatos sino probabilidad. El muestreo va sumando tokens al cesto hasta que su probabilidad acumulada supera el umbral fijado, y ahí para.

Parámetros clave

  • Top P: elige dentro del conjunto más pequeño de tokens cuya probabilidad acumulada supera top_p. Ayuda a generar texto más natural reduciendo las repeticiones.
Casos de uso
un valor bajo en una cadena que responde a partir de documentos recuperados, donde una palabra improbable suele delatar que el modelo se aleja de la fuente.
06

Frequency Penalty

options.frequencyPenalty

Lo que ves en n8n

Notas y casos de uso

La repetición se cuela cuando el mismo token gana el ranking una y otra vez. Esta penalización empuja en contra de los tokens en proporción a las veces que ya se han usado en la respuesta en curso.

Parámetros clave

  • Frequency Penalty: ajusta la penalización de los tokens que ya han aparecido en el texto generado. Los valores altos desalientan la repetición.
Casos de uso
subirla un poco cuando un boletín semanal abre cada viñeta con las mismas cuatro palabras.
07

Keep Alive

options.keepAlive

Lo que ves en n8n

Notas y casos de uso

Cargar un modelo local en memoria cuesta segundos reales. Este campo dice cuánto debe mantenerlo Ollama ahí tras la llamada, para que la siguiente ejecución arranque en caliente.

Parámetros clave

  • Keep Alive: duración durante la cual el modelo cargado permanece en memoria tras su uso. Útil para modelos muy solicitados. Formato 1h30m para una hora y treinta minutos.
Casos de uso
un flujo disparado cada pocos minutos se mantiene ágil; un proceso nocturno puede dejar que el modelo se descargue y devuelva la memoria.
08

Low VRAM Mode

options.lowVram

Lo que ves en n8n

Notas y casos de uso

Las tarjetas gráficas modestas se ahogan con los modelos grandes. Activar este modo cambia velocidad por espacio, y muchas veces es lo que separa una cadena que corre de otra que falla en la máquina que tienes de verdad.

Parámetros clave

  • Low VRAM Mode: activa el modo de poca VRAM, que reduce el uso de memoria a costa de una generación más lenta. Útil para GPU con memoria limitada.
Casos de uso
mover un asistente interno a un equipo de oficina decente en vez de a un servidor de inferencia dedicado.
09

Main GPU ID

options.mainGpu

Lo que ves en n8n

Notas y casos de uso

Una máquina con varias tarjetas gráficas necesita saber cuál lleva la voz cantante en el cálculo. Si no lo tocas, este campo no hace nada; en un servidor con varias tarjetas decide dónde cae la carga.

Parámetros clave

  • Main GPU ID: identificador de la GPU usada para el cálculo principal. Cámbialo solo si tienes varias GPU.
Casos de uso
fijar un asistente interno muy usado a una tarjeta para dejar la segunda libre para un cálculo de vectores nocturno.
10

Context Batch Size

options.numBatch

Lo que ves en n8n

Notas y casos de uso

Antes de generar nada, el modelo tiene que leer el prompt, y lo lee por lotes. Ensanchar el lote acelera esa fase de lectura, y lo pagas en memoria.

Parámetros clave

  • Context Batch Size: define el tamaño de lote para el procesamiento del prompt. Lotes mayores pueden acelerar la generación pero aumentan el uso de memoria.
Casos de uso
una cadena de preguntas y respuestas que apila varios fragmentos recuperados en cada prompt pasa aquí la mayor parte de su tiempo.
11

Context Length

options.numCtx

Lo que ves en n8n

Notas y casos de uso

El contexto es un presupuesto. Todo lo que el modelo puede mirar para escribir el siguiente token, tanto el prompt como lo que ya lleva escrito, tiene que caber en esta cifra.

Parámetros clave

  • Context Length: número máximo de tokens usados como contexto para generar el siguiente token. Los valores bajos reducen la memoria; los altos dan más contexto al modelo.
Casos de uso
subirlo cuando una cadena de resumen pierde el inicio de un hilo largo de correo; bajarlo cuando la memoria es el verdadero límite.
12

Number of GPUs

options.numGpu

Lo que ves en n8n

Notas y casos de uso

Repartir el trabajo entre varias tarjetas se pide de forma explícita aquí. Este campo cuenta tarjetas, mientras que Main GPU ID nombra la que manda.

Parámetros clave

  • Number of GPUs: número de GPU usadas para el procesamiento en paralelo. -1 activa la detección automática.
Casos de uso
un modelo algo pesado en un servidor de dos tarjetas, donde dejar que la detección automática decida sigue siendo el primer movimiento razonable.
13

Max Tokens to Generate

options.numPredict

Lo que ves en n8n

Notas y casos de uso

Una respuesta puede desbocarse. Este techo corta al modelo en pleno vuelo, lo que protege tanto la duración de la ejecución como al nodo siguiente, que espera un campo de tamaño razonable.

Parámetros clave

  • Max Tokens to Generate: número máximo de tokens generados. -1 elimina el límite; cuidado con un valor alto, porque puede producir salidas muy largas.
Casos de uso
apretarlo bien cuando la respuesta acaba siendo el cuerpo de un mensaje de Gmail.
14

Number of CPU Threads

options.numThread

Lo que ves en n8n

Notas y casos de uso

Parte del trabajo siempre recae en el procesador, y en una máquina sin tarjeta gráfica aprovechable recae todo. Este campo dice cuántos hilos puede reclamar Ollama.

Parámetros clave

  • Number of CPU Threads: número de hilos de CPU usados para el procesamiento. 0 activa la detección automática.
Casos de uso
limitar los hilos en un servidor que también aloja n8n, para que el editor siga usable mientras una cadena genera.
15

Penalize Newlines

options.penalizeNewline

Lo que ves en n8n

Notas y casos de uso

Los saltos de línea también son tokens, y un modelo que los busca devuelve respuestas troceadas. Este interruptor lo empuja en sentido contrario.

Parámetros clave

  • Penalize Newlines: hace que el modelo tienda menos a generar caracteres de salto de línea, favoreciendo secuencias de texto continuas más largas.
Casos de uso
una cadena que redacta un párrafo destinado a una celda de hoja de cálculo, donde los saltos sueltos vuelven la columna ilegible.
16

Presence Penalty

options.presencePenalty

Lo que ves en n8n

Notas y casos de uso

Presencia y frecuencia suenan parecido pero cuentan cosas distintas. Esta solo retiene que un token apareció, no cuántas veces, y empuja al modelo hacia vocabulario aún sin estrenar.

Parámetros clave

  • Presence Penalty: ajusta la penalización de los tokens según su presencia en el texto ya generado. Los valores positivos penalizan los tokens ya aparecidos y fomentan la diversidad.
Casos de uso
las cadenas de ideación, donde cinco propuestas construidas sobre el mismo sustantivo son en realidad una sola.
17

Repetition Penalty

options.repeatPenalty

Lo que ves en n8n

Notas y casos de uso

Un tercer freno contra la repetición se suma a los otros dos, y es el más directo: un único factor aplicado a los tokens que vuelven.

Parámetros clave

  • Repetition Penalty: ajusta el factor de penalización de los tokens repetidos. Los valores altos desalientan con más fuerza la repetición. 1.0 desactiva la penalización.
Casos de uso
el remedio cuando un modelo local pequeño entra en bucle y repite la misma frase hasta que el límite de tokens lo corta.
18

Use Memory Locking

options.useMLock

Lo que ves en n8n

Notas y casos de uso

Un sistema bajo presión moverá el modelo cargado al disco, y la llamada siguiente se arrastra. El bloqueo lo clava en memoria para que eso no pase.

Parámetros clave

  • Use Memory Locking: bloquea el modelo en memoria para evitar el intercambio a disco. Puede mejorar el rendimiento, pero exige memoria disponible suficiente.
Casos de uso
un servidor compartido donde otros servicios pelean por la RAM y el tiempo de respuesta varía mucho entre dos ejecuciones iguales.
19

Use Memory Mapping

options.useMMap

Lo que ves en n8n

Notas y casos de uso

Cómo se leen los pesos desde el disco también es una decisión. El mapeo en memoria deja que el sistema los cargue según hacen falta en lugar de subirlo todo a la RAM de golpe.

Parámetros clave

  • Use Memory Mapping: usa el mapeo en memoria para cargar el modelo. Reduce el uso de memoria pero puede afectar al rendimiento. Se recomienda mantenerlo activo.
Casos de uso
dejarlo como está, y tratar su desactivación como una prueba deliberada cuando un modelo grande carga de forma rara en un equipo concreto.
20

Load Vocabulary Only

options.vocabOnly

Lo que ves en n8n

Notas y casos de uso

A veces los pesos no son el asunto. Cargar solo el vocabulario se los salta por completo: es rápido y no produce ninguna completación real.

Parámetros clave

  • Load Vocabulary Only: carga únicamente el vocabulario del modelo, sin los pesos. Útil para probar rápido la tokenización.
Casos de uso
comprobar cómo se trocea un prompt en tokens antes de fijar un valor de Context Length, nunca un ajuste para dejar activo en producción.
21

Output Format

options.format

Lo que ves en n8n

Notas y casos de uso

La forma de la respuesta de la API se elige, y eso importa en cuanto el nodo siguiente espera datos estructurados en vez de un texto que haya que desmenuzar.

Parámetros clave

  • Output Format: formato de la respuesta de la API, a elegir entre default (Default) y json (JSON).
Casos de uso
poner json cuando una cadena de extracción alimenta a un nodo que escribe campos con nombre, y dejar default para todo lo que vaya a leer una persona.
Necesitas ayuda

¿Necesitas ayuda para automatizar Ollama Model con n8n?

El equipo te responde directamente.

Cada mensaje lo lee una persona.

FAQ

Preguntas frecuentes sobre el nodo Ollama Model

01¿El nodo Ollama Model n8n viene incluido en n8n?
Sí. Forma parte del paquete de IA de n8n, que se entrega con n8n, tanto en n8n Cloud como en una instancia autoalojada en Community Edition bajo licencia Sustainable Use. No hay nada que instalar ni coste extra por el lado de n8n. Lo que sí hace falta es una instancia de Ollama que levantes tú, en la misma máquina que n8n o en algún sitio al que n8n llegue por red, con al menos un modelo descargado. Esa parte es infraestructura tuya, y es justo el motivo de existir del nodo: el prompt y la respuesta se quedan en hardware que controlas.
02¿Qué credentials necesita?
Un credential de Ollama, creado una vez en el menú Credentials de n8n y reutilizado después en todos los flujos. El valor que no puede faltar es la URL base, la dirección que n8n llama para alcanzar Ollama, normalmente tu host más el puerto 11434 por defecto. En el nodo no hay selector de autenticación. Si la instancia es remota y está detrás de un proxy autenticado como Open WebUI, el nodo admite autenticación por token Bearer: pones la URL remota y la clave de API en el mismo credential. A diferencia de un modelo de chat alojado, aquí no entra ninguna cuenta de proveedor ni ninguna facturación.
03¿Qué límites tiene este nodo?
Tres pesan en la práctica. El primero: no soporta herramientas, así que no funciona con el nodo AI Agent y la documentación oficial remite a la Basic LLM Chain. El segundo: es un subnodo, y las expresiones se comportan distinto ahí; con cinco items de entrada, una expresión que referencia un campo devuelve siempre el primero en lugar de resolverse una vez por item. El tercero: Ollama no admite agentes HTTP personalizados en su configuración, de modo que un proxy HTTP o HTTPS propio puede no funcionar en absoluto, aunque estén puestas las variables de entorno habituales. La versión descrita aquí es la 1 del nodo.
04¿Qué hay que conectarle como mínimo y por dónde empezar?
Al puerto Model de un nodo raíz, y con una Basic LLM Chain para arrancar. Es la pareja que recomienda la documentación oficial para este nodo y también la más legible: entra un prompt, sale texto, y ves enseguida si tu instancia de Ollama responde. A partir de ahí el mismo puerto lo aceptan la Question and Answer Chain, la Summarization Chain o el Information Extractor, entre otros. Deja las opciones cerradas en la primera prueba y ábrelas solo cuando la conexión esté demostrada.
05¿n8n o Make para correr un modelo en local?
Depende de dónde tenga que vivir el modelo. Make es una plataforma de automatización alojada, sin opción de autoalojamiento, facturada por operación: un modelo corriendo en tu propio hardware no es el escenario para el que está pensada. n8n se usa en n8n Cloud o se instala en tu casa con Docker o npm, y un flujo de trabajo es idéntico en ambos casos, que es justo lo que permite a este nodo hablar con una instancia de Ollama de la misma red. Júzgalo por cuatro criterios: alojamiento, control de los datos, modelo de coste y la lógica visual que encaje con tu equipo.
Hack'celeration Lab

Recibe nuestros tips de integración cada semana.

Sin spam. Cancela cuando quieras.