- Inicio
- Recursos
- Integraciones
- Ollama Model
Nodo Ollama Model n8nConfigura Ollama Model en n8n.
El nodo Ollama Model n8n conecta un flujo de trabajo con un modelo de lenguaje que corre en tu propia máquina. Es un subnodo: no tiene entrada principal ni se ejecuta solo, así que se engancha al puerto Model de un nodo raíz. Un selector, 21 parámetros, y el texto no sale de tu red.
Reseñas verificadas en Trustpilot · Agencia de IA, automatización y growth
¿Para qué sirve el nodo Ollama Model n8n?
El nodo entrega un prompt a una instancia de Ollama que alojas tú y devuelve la respuesta al nodo raíz que la pidió. No se coloca en el flujo principal. Los nodos de IA de n8n funcionan en clúster: un nodo raíz recibe los items del flujo y los subnodos se enganchan a sus puertos, un tipo de subnodo por puerto. Este ocupa el puerto ai_languageModel y permanece inactivo mientras ningún nodo raíz lo llame.
Primer escenario: la consulta que no puede salir de la oficina. Una Basic LLM Chain recibe una pregunta, el nodo Ollama Model responde con un modelo descargado en el servidor de la empresa, y la respuesta vuelve al flujo. Ningún prompt cruza la puerta, algo que pesa cuando dentro va un expediente o una nota interna. Después la respuesta puede caer en Slack o en un ticket de soporte.
Segundo escenario: la revisión. Un modelo de control lee una afirmación junto al texto de origen y dice si se sostiene. Nada impide que dos nodos Ollama Model convivan en el mismo flujo sobre dos cadenas distintas, cada uno con su valor en Model, uno que redacta y otro que revisa. Con una Sampling Temperature baja en el revisor, el veredicto se repite igual entre ejecuciones.
Tercer escenario: la búsqueda documental en casa. Los documentos se trocean, se vectorizan y se guardan en un vector store, y una cadena de resumen o de preguntas y respuestas usa este nodo para redactar la respuesta final a partir de los fragmentos recuperados. Alimenta la cadena desde Google Sheets o desde un buzón y todo el recorrido se queda dentro del perímetro.
¿Cuándo conviene otra cosa? La documentación oficial del nodo lo dice sin rodeos: no soporta herramientas, así que no funciona con el nodo AI Agent y hay que preferir la Basic LLM Chain. En cuanto un agente tiene que llamar herramientas, o un AI Agent Tool se anida dentro de otro agente, hace falta un modelo de chat que las gestione, del lado de los nodos OpenAI o Anthropic. Esos proveedores facturan sus propias llamadas a la API; n8n no añade nada encima.
Quedan dos límites que conviene tener claros antes de montar nada. En un subnodo las expresiones no se comportan igual: donde un nodo normal resuelve {{ $json.campo }} una vez por item, aquí la expresión devuelve siempre el primero, de modo que una lista de cinco prompts no se desplegará desde este nodo. Y Ollama no admite agentes HTTP personalizados en su configuración, lo que complica usarlo detrás de un proxy propio aunque estén puestas las variables de entorno de siempre.
¿Qué hace falta para conectarlo?
- 01
Levanta Ollama y descarga un modelo
Ollama tiene que ser alcanzable desde n8n antes de que el nodo muestre algo útil. Instálalo en la máquina o arranca el contenedor oficial publicando el puerto:
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. El puerto11434es el que Ollama escucha por defecto. Luego descarga al menos un modelo desde la Ollama Models Library, porque el selector Model del nodo ofrece lo que tu instancia sabe servir. - 02
Crea el credential de Ollama en n8n
Abre el menú Credentials de n8n y añade un credential de Ollama, el juego de datos de acceso que n8n guarda. El campo decisivo es la URL base, la dirección que n8n llama:
http://localhost:11434cuando todo corre en la misma máquina. Si la instancia es remota y está detrás de un proxy autenticado como Open WebUI, el nodo admite el token Bearer: rellena la URL remota y la clave de API. Se crea una vez y se reutiliza en todos los flujos. - 03
Engancha el nodo a un nodo raíz
Pon el nodo Ollama Model en el lienzo y arrastra su conector hasta el puerto Model de un nodo raíz, una Basic LLM Chain para empezar. Un puerto es la toma etiquetada que cuelga de un nodo raíz y donde encaja un tipo concreto de subnodo. Selecciona el credential, elige un valor en Model y deja las opciones quietas en la primera prueba. El nodo no tiene entrada principal, así que por la izquierda no llega ningún cable.
¿Dónde se engancha este subnodo?
Los nodos de IA de n8n forman un clúster: un nodo raíz lleva la lógica y recibe los items del flujo, y subnodos como este lo amplían a través de sus puertos. Un subnodo nunca se ejecuta solo, de modo que la única pregunta relevante es en qué toma va.
Salida (dónde se conecta)
- Model
ai_languageModel
01Model
Este nodo expone una única salida, de tipo ai_languageModel, y va al puerto Model de un nodo raíz. Esa conexión es lo que hace que el nodo llegue a ejecutarse.
Parámetros clave
- Required: sin entrada principal y sin ejecución autónoma, un nodo Ollama Model sin conectar no aporta nada en el lienzo.
- Basic LLM Chain y Question and Answer Chain son las dos raíces más sencillas para arrancar: entra un prompt, sale texto.
- Summarization Chain e Information Extractor aceptan el mismo puerto cuando se trata de condensar un documento o de sacarle campos.
¿Qué parámetros se ajustan en el nodo Ollama Model ?
El nodo Ollama Model tiene 21 parámetros. Para cada uno: el nodo tal como lo configuras en n8n, qué cambia el parámetro y nuestras notas de campo.
Índice de parámetros
- Model
- Enable Thinking
- Sampling Temperature
- Top K
- Top P
- Frequency Penalty
- Keep Alive
- Low VRAM Mode
- Main GPU ID
- Context Batch Size
- Context Length
- Number of GPUs
- Max Tokens to Generate
- Number of CPU Threads
- Penalize Newlines
- Presence Penalty
- Repetition Penalty
- Use Memory Locking
- Use Memory Mapping
- Load Vocabulary Only
- Output Format
Model
modelLo que ves en n8n
Notas y casos de uso
Mientras este selector siga vacío no ocurre nada. Señala el modelo que generará la completación, y esa elección decide todo lo demás: calidad de la respuesta, velocidad y memoria ocupada mientras el modelo está cargado.
Parámetros clave
- Model: el modelo que genera la completación. La documentación oficial del nodo cita Llama2, Llama2 13B, Llama2 70B y Llama2 Uncensored; para descargar modelos, pasa por la Ollama Models Library.
Enable Thinking
options.thinkLo que ves en n8n
Notas y casos de uso
Los modelos de razonamiento guardan un borrador antes de responder. Este interruptor decide si ese borrador queda aparte del resultado, y no significa nada en un modelo que no soporta el modo.
Parámetros clave
- Enable Thinking: activa (por defecto) el modo de razonamiento en los modelos compatibles. Activado, el razonamiento se separa de la salida; desactivado, el modelo devuelve el contenido directamente.
Sampling Temperature
options.temperatureLo que ves en n8n
Notas y casos de uso
El azar tiene una rueda, y es esta. El mismo prompt lanzado dos veces puede volver redactado de otra forma, y la distancia entre esas dos respuestas depende justo de este número.
Parámetros clave
- Sampling Temperature: controla la aleatoriedad del texto generado. Los valores bajos hacen la salida más enfocada y determinista; los altos, más variada y aleatoria.
Top K
options.topKLo que ves en n8n
Notas y casos de uso
En cada paso el modelo ordena todo su vocabulario y luego elige de la parte alta. Un token es un fragmento de texto, más o menos una palabra o un trozo de ella. Este ajuste marca hasta dónde puede bajar el muestreo.
Parámetros clave
- Top K: limita el número de tokens más probables considerados en cada paso. Un valor alto aumenta la diversidad pero puede reducir la coherencia.
-1lo desactiva.
Top P
options.topPLo que ves en n8n
Notas y casos de uso
Aquí ya no se cuentan candidatos sino probabilidad. El muestreo va sumando tokens al cesto hasta que su probabilidad acumulada supera el umbral fijado, y ahí para.
Parámetros clave
- Top P: elige dentro del conjunto más pequeño de tokens cuya probabilidad acumulada supera top_p. Ayuda a generar texto más natural reduciendo las repeticiones.
Frequency Penalty
options.frequencyPenaltyLo que ves en n8n
Notas y casos de uso
La repetición se cuela cuando el mismo token gana el ranking una y otra vez. Esta penalización empuja en contra de los tokens en proporción a las veces que ya se han usado en la respuesta en curso.
Parámetros clave
- Frequency Penalty: ajusta la penalización de los tokens que ya han aparecido en el texto generado. Los valores altos desalientan la repetición.
Keep Alive
options.keepAliveLo que ves en n8n
Notas y casos de uso
Cargar un modelo local en memoria cuesta segundos reales. Este campo dice cuánto debe mantenerlo Ollama ahí tras la llamada, para que la siguiente ejecución arranque en caliente.
Parámetros clave
- Keep Alive: duración durante la cual el modelo cargado permanece en memoria tras su uso. Útil para modelos muy solicitados. Formato
1h30mpara una hora y treinta minutos.
Low VRAM Mode
options.lowVramLo que ves en n8n
Notas y casos de uso
Las tarjetas gráficas modestas se ahogan con los modelos grandes. Activar este modo cambia velocidad por espacio, y muchas veces es lo que separa una cadena que corre de otra que falla en la máquina que tienes de verdad.
Parámetros clave
- Low VRAM Mode: activa el modo de poca VRAM, que reduce el uso de memoria a costa de una generación más lenta. Útil para GPU con memoria limitada.
Main GPU ID
options.mainGpuLo que ves en n8n
Notas y casos de uso
Una máquina con varias tarjetas gráficas necesita saber cuál lleva la voz cantante en el cálculo. Si no lo tocas, este campo no hace nada; en un servidor con varias tarjetas decide dónde cae la carga.
Parámetros clave
- Main GPU ID: identificador de la GPU usada para el cálculo principal. Cámbialo solo si tienes varias GPU.
Context Batch Size
options.numBatchLo que ves en n8n
Notas y casos de uso
Antes de generar nada, el modelo tiene que leer el prompt, y lo lee por lotes. Ensanchar el lote acelera esa fase de lectura, y lo pagas en memoria.
Parámetros clave
- Context Batch Size: define el tamaño de lote para el procesamiento del prompt. Lotes mayores pueden acelerar la generación pero aumentan el uso de memoria.
Context Length
options.numCtxLo que ves en n8n
Notas y casos de uso
El contexto es un presupuesto. Todo lo que el modelo puede mirar para escribir el siguiente token, tanto el prompt como lo que ya lleva escrito, tiene que caber en esta cifra.
Parámetros clave
- Context Length: número máximo de tokens usados como contexto para generar el siguiente token. Los valores bajos reducen la memoria; los altos dan más contexto al modelo.
Number of GPUs
options.numGpuLo que ves en n8n
Notas y casos de uso
Repartir el trabajo entre varias tarjetas se pide de forma explícita aquí. Este campo cuenta tarjetas, mientras que Main GPU ID nombra la que manda.
Parámetros clave
- Number of GPUs: número de GPU usadas para el procesamiento en paralelo.
-1activa la detección automática.
Max Tokens to Generate
options.numPredictLo que ves en n8n
Notas y casos de uso
Una respuesta puede desbocarse. Este techo corta al modelo en pleno vuelo, lo que protege tanto la duración de la ejecución como al nodo siguiente, que espera un campo de tamaño razonable.
Parámetros clave
- Max Tokens to Generate: número máximo de tokens generados.
-1elimina el límite; cuidado con un valor alto, porque puede producir salidas muy largas.
Number of CPU Threads
options.numThreadLo que ves en n8n
Notas y casos de uso
Parte del trabajo siempre recae en el procesador, y en una máquina sin tarjeta gráfica aprovechable recae todo. Este campo dice cuántos hilos puede reclamar Ollama.
Parámetros clave
- Number of CPU Threads: número de hilos de CPU usados para el procesamiento.
0activa la detección automática.
Penalize Newlines
options.penalizeNewlineLo que ves en n8n
Notas y casos de uso
Los saltos de línea también son tokens, y un modelo que los busca devuelve respuestas troceadas. Este interruptor lo empuja en sentido contrario.
Parámetros clave
- Penalize Newlines: hace que el modelo tienda menos a generar caracteres de salto de línea, favoreciendo secuencias de texto continuas más largas.
Presence Penalty
options.presencePenaltyLo que ves en n8n
Notas y casos de uso
Presencia y frecuencia suenan parecido pero cuentan cosas distintas. Esta solo retiene que un token apareció, no cuántas veces, y empuja al modelo hacia vocabulario aún sin estrenar.
Parámetros clave
- Presence Penalty: ajusta la penalización de los tokens según su presencia en el texto ya generado. Los valores positivos penalizan los tokens ya aparecidos y fomentan la diversidad.
Repetition Penalty
options.repeatPenaltyLo que ves en n8n
Notas y casos de uso
Un tercer freno contra la repetición se suma a los otros dos, y es el más directo: un único factor aplicado a los tokens que vuelven.
Parámetros clave
- Repetition Penalty: ajusta el factor de penalización de los tokens repetidos. Los valores altos desalientan con más fuerza la repetición.
1.0desactiva la penalización.
Use Memory Locking
options.useMLockLo que ves en n8n
Notas y casos de uso
Un sistema bajo presión moverá el modelo cargado al disco, y la llamada siguiente se arrastra. El bloqueo lo clava en memoria para que eso no pase.
Parámetros clave
- Use Memory Locking: bloquea el modelo en memoria para evitar el intercambio a disco. Puede mejorar el rendimiento, pero exige memoria disponible suficiente.
Use Memory Mapping
options.useMMapLo que ves en n8n
Notas y casos de uso
Cómo se leen los pesos desde el disco también es una decisión. El mapeo en memoria deja que el sistema los cargue según hacen falta en lugar de subirlo todo a la RAM de golpe.
Parámetros clave
- Use Memory Mapping: usa el mapeo en memoria para cargar el modelo. Reduce el uso de memoria pero puede afectar al rendimiento. Se recomienda mantenerlo activo.
Load Vocabulary Only
options.vocabOnlyLo que ves en n8n
Notas y casos de uso
A veces los pesos no son el asunto. Cargar solo el vocabulario se los salta por completo: es rápido y no produce ninguna completación real.
Parámetros clave
- Load Vocabulary Only: carga únicamente el vocabulario del modelo, sin los pesos. Útil para probar rápido la tokenización.
Output Format
options.formatLo que ves en n8n
Notas y casos de uso
La forma de la respuesta de la API se elige, y eso importa en cuanto el nodo siguiente espera datos estructurados en vez de un texto que haya que desmenuzar.
Parámetros clave
- Output Format: formato de la respuesta de la API, a elegir entre
default(Default) yjson(JSON).
json cuando una cadena de extracción alimenta a un nodo que escribe campos con nombre, y dejar default para todo lo que vaya a leer una persona.¿Necesitas ayuda para automatizar Ollama Model con n8n?
El equipo te responde directamente.
Cada mensaje lo lee una persona.
Preguntas frecuentes sobre el nodo Ollama Model
01¿El nodo Ollama Model n8n viene incluido en n8n?
02¿Qué credentials necesita?
03¿Qué límites tiene este nodo?
04¿Qué hay que conectarle como mínimo y por dónde empezar?
05¿n8n o Make para correr un modelo en local?
Recibe nuestros tips de integración cada semana.
Sin spam. Cancela cuando quieras.

