Ressources · Intégration n8n

Nœud Ollama Model n8nConfigurer Ollama Model dans n8n.

Le nœud Ollama Model n8n relie un workflow à un modèle de langage qui tourne sur ta propre machine. C'est un sous-nœud : pas d'entrée principale, jamais d'exécution isolée, il se raccorde au port Model d'un nœud racine. Un sélecteur, 21 paramètres, et le texte ne sort pas du réseau.

Avis vérifiés sur Trustpilot · Agence IA, automatisation & growth

Pourquoi automatiser

À quoi sert le nœud Ollama Model n8n ?

Le nœud transmet un prompt à une instance Ollama que tu héberges, et rend la réponse au nœud racine qui l'a demandée. Il ne se place pas dans le flux principal du workflow. Chez n8n, les nœuds IA fonctionnent en grappe : un nœud racine reçoit les items, et des sous-nœuds viennent se brancher sur ses ports, un type de sous-nœud par port. Celui-ci occupe le port ai_languageModel et reste inerte tant qu'aucun nœud racine ne l'appelle.

Premier scénario, celui du cabinet qui ne veut rien envoyer dehors. Une Basic LLM Chain reçoit une question, le nœud Ollama Model y répond avec un modèle téléchargé sur le serveur de la boîte, et la réponse repart dans le workflow. Aucun prompt ne quitte les murs, ce qui change tout quand il contient un dossier client ou une note interne. La réponse peut ensuite atterrir dans Slack ou dans un ticket.

Deuxième scénario : la vérification. Un modèle de contrôle lit une affirmation et le texte source, puis dit si l'affirmation tient. Rien n'empêche deux nœuds Ollama Model de cohabiter dans le même workflow sur deux chaînes différentes, chacun avec sa valeur dans Model, l'un qui rédige et l'autre qui relit. Une Sampling Temperature basse côté relecture rend le verdict stable d'une exécution à l'autre.

Troisième scénario : la recherche documentaire sur site. Les documents sont découpés, vectorisés, rangés dans un vector store, et une chaîne de résumé ou de questions-réponses s'appuie sur ce nœud pour formuler la réponse finale à partir des passages retrouvés. Alimente la chaîne depuis Google Sheets ou une boîte mail, et tout le parcours reste derrière le pare-feu.

Quand vaut-il mieux choisir autre chose ? La doc officielle du nœud le dit sans détour : il n'a pas le support des outils, donc il ne fonctionne pas avec le nœud AI Agent, et il faut lui préférer la Basic LLM Chain. Dès qu'un agent doit appeler des outils, ou qu'un AI Agent Tool s'imbrique dans un autre agent, il faut un modèle de chat qui les gère, du côté des nœuds OpenAI ou Anthropic. Ces fournisseurs facturent leurs propres appels d'API ; n8n n'ajoute rien par-dessus.

Deux limites à connaître avant de construire. Dans un sous-nœud, les expressions ne se comportent pas comme ailleurs : là où un nœud classique résout {{ $json.champ }} une fois par item, ici l'expression renvoie toujours le premier item, donc une liste de cinq prompts ne se déroulera pas depuis ce nœud. Ensuite, Ollama ne gère pas d'agent HTTP personnalisé dans sa configuration, ce qui rend son usage derrière un proxy maison compliqué, même avec les variables d'environnement habituelles. Ces deux comportements tiennent au modèle des sous-nœuds, pas à un défaut : mieux vaut les anticiper que les déboguer plus tard.

Connexion

Comment le connecter ?

  1. 01

    Lancer Ollama et télécharger un modèle

    Ollama doit être joignable depuis n8n avant que le nœud n'affiche quoi que ce soit. Installe-le sur la machine ou démarre le conteneur officiel en publiant le port : docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. Ollama écoute sur le port 11434 par défaut. Télécharge ensuite au moins un modèle depuis la bibliothèque Ollama Models Library, puisque le sélecteur Model propose ce que ton instance sait servir.

  2. 02

    Créer le credential Ollama dans n8n

    Ouvre le menu Credentials de n8n et ajoute un credential Ollama, le jeu d'identifiants que n8n stocke. Le champ qui compte est l'URL de base, l'adresse que n8n appelle : http://localhost:11434 quand tout tourne sur la même machine. Si l'instance est distante et placée derrière un proxy authentifié comme Open WebUI, le nœud accepte le jeton Bearer : renseigne l'URL distante et la clé d'API. Il se crée une fois et se réutilise partout.

  3. 03

    Brancher le nœud sur un nœud racine

    Pose le nœud Ollama Model sur le canvas et tire son connecteur vers le port Model d'un nœud racine, une Basic LLM Chain pour commencer. Un port, c'est la prise étiquetée sous un nœud racine où vient se fixer un type précis de sous-nœud. Sélectionne le credential, choisis une valeur dans Model, et laisse les options de côté au premier essai. Le nœud n'a pas d'entrée principale : aucun fil n'arrive sur sa gauche, et c'est normal.

Connexions

Où se branche ce sous-nœud ?

Les nœuds IA de n8n forment une grappe : un nœud racine porte la logique et reçoit les items du workflow, des sous-nœuds comme celui-ci l'étendent via ses ports. Un sous-nœud ne s'exécute jamais seul, donc la seule question qui compte est celle de la bonne prise.

Sortie (où il se branche)

  • Modelai_languageModel
01ModelCe nœud expose une seule sortie, de type ai_languageModel, et elle se pose sur le port Model d'un nœud racine. C'est ce branchement qui le fait tourner, tout simplement.

Ce nœud expose une seule sortie, de type ai_languageModel, et elle se pose sur le port Model d'un nœud racine. C'est ce branchement qui le fait tourner, tout simplement.

Paramètres clés

  • Required : sans entrée principale et sans exécution autonome, un nœud Ollama Model non raccordé ne sert à rien sur le canvas.
  • Basic LLM Chain et Question and Answer Chain sont les deux racines les plus simples pour démarrer : un prompt entre, du texte sort.
  • Summarization Chain et Information Extractor acceptent le même port quand il s'agit de condenser un document ou d'en sortir des champs.
Cas d'usage
un assistant auto-hébergé posé sur une Basic LLM Chain, ou une Summarization Chain qui raccourcit les longs fils de support avant lecture.
Paramètres

Quels paramètres régler sur le nœud Ollama Model ?

Le nœud Ollama Model compte 21 paramètres. Pour chacun : le nœud tel que tu le configures dans n8n, ce que le paramètre change, et nos notes de terrain.

01

Model

model

Ce que tu vois dans n8n

Notes & cas d'usage

Tant que ce sélecteur est vide, rien ne se passe. Il désigne le modèle qui produira la complétion, et ce choix décide de tout le reste : qualité de la réponse, vitesse, mémoire immobilisée pendant le chargement.

Paramètres clés

  • Model : le modèle qui génère la complétion. La doc officielle du nœud cite Llama2, Llama2 13B, Llama2 70B et Llama2 Uncensored ; pour télécharger des modèles, passe par l'Ollama Models Library.
Cas d'usage
un petit modèle pour une chaîne de classification qui tourne des centaines de fois par jour, un plus gros pour celle qui rédige un résumé envoyé au client.
02

Enable Thinking

options.think

Ce que tu vois dans n8n

Notes & cas d'usage

Les modèles de raisonnement gardent un brouillon avant de répondre. Cet interrupteur décide si ce brouillon reste à part du résultat, et il ne veut rien dire sur un modèle qui ne gère pas le mode.

Paramètres clés

  • Enable Thinking : active (par défaut) le mode réflexion sur les modèles compatibles. Activé, le raisonnement est séparé de la sortie ; désactivé, le modèle produit directement le contenu.
Cas d'usage
le couper quand la chaîne injecte le texte brut dans un autre nœud et qu'un raisonnement égaré polluerait le champ écrit.
03

Sampling Temperature

options.temperature

Ce que tu vois dans n8n

Notes & cas d'usage

Le hasard a une molette, la voici. Le même prompt lancé deux fois peut revenir formulé autrement, et l'écart entre ces deux réponses tient exactement à ce nombre.

Paramètres clés

  • Sampling Temperature : contrôle le caractère aléatoire du texte généré. Une valeur basse rend la sortie plus ciblée et déterministe, une valeur haute la rend plus variée et plus aléatoire.
Cas d'usage
bas sur une chaîne qui extrait un statut depuis un ticket, plus haut sur celle qui propose trois objets d'email au choix.
04

Top K

options.topK

Ce que tu vois dans n8n

Notes & cas d'usage

À chaque étape, le modèle classe tout son vocabulaire puis pioche en haut du classement. Un token, c'est un fragment de texte, à peu près un mot ou un morceau de mot. Ce réglage dit jusqu'où le tirage a le droit de descendre.

Paramètres clés

  • Top K : limite le nombre de tokens les plus probables considérés à chaque étape. Une valeur plus haute augmente la diversité mais peut réduire la cohérence. -1 désactive le réglage.
Cas d'usage
le resserrer quand un petit modèle part en vrille au milieu d'un long résumé.
05

Top P

options.topP

Ce que tu vois dans n8n

Notes & cas d'usage

Ici, on ne compte plus les candidats mais la probabilité. Le tirage ajoute des tokens au panier jusqu'à ce que leur probabilité cumulée dépasse le seuil fixé, puis s'arrête.

Paramètres clés

  • Top P : choisit dans le plus petit ensemble de tokens dont la probabilité cumulée dépasse top_p. Aide à produire un texte plus naturel en réduisant les répétitions.
Cas d'usage
une valeur basse sur une chaîne qui répond à partir de documents retrouvés, où un mot improbable trahit souvent un écart par rapport à la source.
06

Frequency Penalty

options.frequencyPenalty

Ce que tu vois dans n8n

Notes & cas d'usage

La répétition s'installe quand le même token gagne le classement encore et encore. Cette pénalité pèse contre les tokens à proportion du nombre de fois où ils ont déjà servi dans la réponse en cours.

Paramètres clés

  • Frequency Penalty : ajuste la pénalité appliquée aux tokens déjà apparus dans le texte généré. Des valeurs plus hautes découragent la répétition.
Cas d'usage
la monter un peu quand un digest hebdomadaire ouvre chaque puce avec les quatre mêmes mots.
07

Keep Alive

options.keepAlive

Ce que tu vois dans n8n

Notes & cas d'usage

Charger un modèle local en mémoire coûte des secondes bien réelles. Ce champ dit combien de temps Ollama doit l'y garder après l'appel, pour que la prochaine exécution démarre à chaud.

Paramètres clés

  • Keep Alive : durée de maintien du modèle chargé en mémoire après usage. Utile pour les modèles fréquemment sollicités. Format 1h30m pour une heure et trente minutes.
Cas d'usage
un workflow déclenché toutes les quelques minutes reste réactif ; un traitement de nuit peut laisser le modèle se décharger et rendre la mémoire.
08

Low VRAM Mode

options.lowVram

Ce que tu vois dans n8n

Notes & cas d'usage

Les petites cartes graphiques étouffent sur les gros modèles. Activer ce mode échange de la vitesse contre de la place, et c'est souvent ce qui sépare une chaîne qui tourne d'une chaîne qui plante sur la machine dont tu disposes.

Paramètres clés

  • Low VRAM Mode : active le mode faible VRAM, qui réduit l'usage mémoire au prix d'une génération plus lente. Utile pour les GPU à mémoire limitée.
Cas d'usage
faire tourner un assistant interne sur un poste de bureau correct plutôt que sur un serveur d'inférence dédié.
09

Main GPU ID

options.mainGpu

Ce que tu vois dans n8n

Notes & cas d'usage

Une machine à plusieurs cartes graphiques doit savoir laquelle mène le calcul. Laissé tranquille, ce champ ne fait rien ; sur un serveur multi-cartes, il décide où la charge tombe.

Paramètres clés

  • Main GPU ID : identifiant du GPU utilisé pour le calcul principal. À ne changer que si plusieurs GPU sont présents.
Cas d'usage
épingler un assistant interne très sollicité sur une carte pour garder la seconde libre pour un calcul de vecteurs nocturne.
10

Context Batch Size

options.numBatch

Ce que tu vois dans n8n

Notes & cas d'usage

Avant de générer quoi que ce soit, le modèle doit lire le prompt, et il le lit par lots. Élargir le lot accélère cette phase de lecture, au prix de la mémoire.

Paramètres clés

  • Context Batch Size : définit la taille de lot pour le traitement du prompt. Des lots plus grands peuvent accélérer la génération mais augmentent l'usage mémoire.
Cas d'usage
une chaîne de questions-réponses qui empile plusieurs passages retrouvés dans chaque prompt passe l'essentiel de son temps ici.
11

Context Length

options.numCtx

Ce que tu vois dans n8n

Notes & cas d'usage

Le contexte est un budget. Tout ce que le modèle a le droit de regarder pour écrire le token suivant, le prompt comme ce qu'il a déjà produit, doit tenir dans ce nombre.

Paramètres clés

  • Context Length : nombre maximal de tokens utilisés comme contexte pour générer le token suivant. Des valeurs basses réduisent la mémoire, des valeurs hautes donnent plus de contexte au modèle.
Cas d'usage
le monter quand une chaîne de résumé perd le début d'un long fil d'emails ; le baisser quand la mémoire est le vrai facteur limitant.
12

Number of GPUs

options.numGpu

Ce que tu vois dans n8n

Notes & cas d'usage

Répartir le travail sur plusieurs cartes se demande explicitement, ici. Ce champ compte les cartes, là où Main GPU ID désigne celle qui commande.

Paramètres clés

  • Number of GPUs : nombre de GPU utilisés pour le traitement parallèle. -1 active la détection automatique.
Cas d'usage
un modèle un peu lourd sur un serveur à deux cartes, où laisser la détection automatique faire le travail reste le bon premier réflexe.
13

Max Tokens to Generate

options.numPredict

Ce que tu vois dans n8n

Notes & cas d'usage

Une réponse peut s'emballer. Ce plafond arrête le modèle en vol, ce qui protège à la fois la durée d'exécution du workflow et le nœud d'après, qui attend un champ de taille raisonnable.

Paramètres clés

  • Max Tokens to Generate : nombre maximal de tokens générés. -1 supprime la limite ; prudence avec une valeur élevée, qui peut produire des sorties très longues.
Cas d'usage
le serrer franchement quand la réponse devient le corps d'un message Gmail.
14

Number of CPU Threads

options.numThread

Ce que tu vois dans n8n

Notes & cas d'usage

Une partie du travail retombe toujours sur le processeur, et sur une machine sans carte graphique exploitable, la totalité. Ce champ dit combien de threads Ollama peut réclamer.

Paramètres clés

  • Number of CPU Threads : nombre de threads CPU utilisés pour le traitement. 0 active la détection automatique.
Cas d'usage
plafonner les threads sur un serveur qui héberge aussi n8n, pour que l'éditeur reste utilisable pendant qu'une chaîne génère.
15

Penalize Newlines

options.penalizeNewline

Ce que tu vois dans n8n

Notes & cas d'usage

Les sauts de ligne sont des tokens comme les autres, et un modèle qui les cherche produit des réponses hachées. Cet interrupteur le pousse dans l'autre sens.

Paramètres clés

  • Penalize Newlines : rend le modèle moins enclin à produire des caractères de saut de ligne, ce qui encourage des séquences de texte continues plus longues.
Cas d'usage
une chaîne qui rédige un paragraphe destiné à une cellule de tableur, où les retours à la ligne rendent la colonne illisible.
16

Presence Penalty

options.presencePenalty

Ce que tu vois dans n8n

Notes & cas d'usage

Présence et fréquence se ressemblent mais ne comptent pas la même chose. Celle-ci retient seulement qu'un token est apparu, pas combien de fois, et pousse le modèle vers du vocabulaire encore vierge.

Paramètres clés

  • Presence Penalty : ajuste la pénalité des tokens selon leur présence dans le texte déjà généré. Les valeurs positives pénalisent les tokens déjà apparus et encouragent la diversité.
Cas d'usage
les chaînes d'idéation, où cinq propositions bâties sur le même nom ne font qu'une seule idée.
17

Repetition Penalty

options.repeatPenalty

Ce que tu vois dans n8n

Notes & cas d'usage

Un troisième garde-fou anti-répétition s'ajoute aux deux autres, et c'est le plus direct : un facteur unique appliqué aux tokens qui reviennent.

Paramètres clés

  • Repetition Penalty : ajuste le facteur de pénalité des tokens répétés. Des valeurs plus hautes découragent plus fortement la répétition. 1.0 désactive la pénalité.
Cas d'usage
le remède quand un petit modèle local se met en boucle et répète la même phrase jusqu'à la limite de tokens.
18

Use Memory Locking

options.useMLock

Ce que tu vois dans n8n

Notes & cas d'usage

Un système sous pression déplacera le modèle chargé vers le disque, et l'appel suivant rampe. Le verrouillage l'épingle en mémoire pour que ça n'arrive pas.

Paramètres clés

  • Use Memory Locking : verrouille le modèle en mémoire pour empêcher le swap. Peut améliorer les performances, mais exige assez de mémoire disponible.
Cas d'usage
un serveur partagé où d'autres services se disputent la RAM et où le temps de réponse varie du simple au double entre deux exécutions.
19

Use Memory Mapping

options.useMMap

Ce que tu vois dans n8n

Notes & cas d'usage

La façon dont les poids sont lus sur le disque est elle aussi un choix. Le memory mapping laisse le système les charger au fil des besoins plutôt que de tout monter en RAM d'un coup.

Paramètres clés

  • Use Memory Mapping : utilise le memory mapping pour charger le modèle. Réduit l'usage mémoire mais peut affecter les performances. Recommandé activé.
Cas d'usage
le laisser tel quel, et traiter sa désactivation comme un test délibéré quand un gros modèle se charge bizarrement sur une machine précise.
20

Load Vocabulary Only

options.vocabOnly

Ce que tu vois dans n8n

Notes & cas d'usage

Parfois, les poids ne sont pas le sujet. Charger le seul vocabulaire les saute entièrement : c'est rapide, et ça ne produit aucune vraie complétion.

Paramètres clés

  • Load Vocabulary Only : charge uniquement le vocabulaire du modèle, sans les poids. Utile pour tester rapidement la tokenisation.
Cas d'usage
vérifier comment un prompt se découpe en tokens avant de fixer une valeur de Context Length, pas un réglage à laisser actif en production.
21

Output Format

options.format

Ce que tu vois dans n8n

Notes & cas d'usage

La forme de la réponse de l'API se choisit, et ça compte dès que le nœud suivant attend des données structurées plutôt qu'un texte à décortiquer.

Paramètres clés

  • Output Format : format de la réponse de l'API, au choix default (Default) ou json (JSON).
Cas d'usage
mettre json quand une chaîne d'extraction alimente un nœud qui écrit des champs nommés, et garder default pour tout ce qu'un humain va lire.
Besoin d'aide

Besoin d'aide pour automatiser Ollama Model avec n8n ?

L'équipe te répond directement.

Chaque message est lu par une personne.

FAQ

Questions fréquentes sur le nœud Ollama Model

01Le nœud Ollama Model n8n est-il inclus dans n8n ?
Oui. Il fait partie du paquet IA de n8n, livré avec n8n, aussi bien sur n8n Cloud que sur une instance auto-hébergée en Community Edition sous licence Sustainable Use. Rien à installer, aucun surcoût côté n8n. Ce qu'il faut en revanche, c'est une instance Ollama que tu fais tourner toi-même, sur la même machine que n8n ou quelque part où n8n peut l'atteindre sur le réseau, avec au moins un modèle téléchargé. Cette partie relève de ton infrastructure, et c'est précisément la raison d'être du nœud : le prompt et la réponse restent sur du matériel que tu contrôles.
02Quels credentials faut-il pour l'utiliser ?
Un credential Ollama, créé une fois dans le menu Credentials de n8n puis réutilisé dans tous les workflows. La valeur essentielle est l'URL de base, l'adresse que n8n appelle pour joindre Ollama, en général ton hôte suivi du port 11434 par défaut. Il n'y a pas de sélecteur d'authentification sur le nœud lui-même. Si l'instance est distante et protégée par un proxy authentifié comme Open WebUI, le nœud accepte l'authentification par jeton Bearer : tu renseignes l'URL distante et la clé d'API dans le même credential. Contrairement à un modèle de chat hébergé, aucun compte fournisseur ni facturation n'entre en jeu.
03Quelles sont les limites de ce nœud ?
Trois comptent en pratique. D'abord, il n'a pas le support des outils : il ne fonctionne donc pas avec le nœud AI Agent, et la doc officielle renvoie vers la Basic LLM Chain. Ensuite, c'est un sous-nœud, et les expressions s'y comportent autrement : avec cinq items en entrée, une expression qui référence un champ renvoie toujours le premier, au lieu d'être résolue une fois par item. Enfin, Ollama ne gère pas d'agent HTTP personnalisé dans sa configuration, donc un proxy HTTP ou HTTPS maison peut ne pas fonctionner du tout, même avec les variables d'environnement classiques. La version décrite ici est la version 1 du nœud.
04Que faut-il brancher au minimum, et par quoi commencer ?
Le port Model d'un nœud racine, et une Basic LLM Chain pour débuter. C'est l'association que la doc officielle recommande pour ce nœud, et c'est aussi la plus lisible : un prompt entre, du texte sort, et tu vois tout de suite si ton instance Ollama répond. Ensuite, le même port est accepté par la Question and Answer Chain, la Summarization Chain ou l'Information Extractor, entre autres. Laisse les options fermées au premier essai et ne les ouvre qu'une fois la connexion prouvée.
05n8n ou Make pour faire tourner un modèle en local ?
Ça dépend de l'endroit où le modèle doit vivre. Make est une plateforme d'automatisation hébergée, sans option d'auto-hébergement, facturée à l'opération : un modèle qui tourne sur ton propre matériel n'est pas le scénario autour duquel elle est pensée. n8n s'utilise sur n8n Cloud ou s'installe chez toi via Docker ou npm, et un workflow est identique dans les deux cas, ce qui permet justement à ce nœud de parler à une instance Ollama du même réseau. Juge sur quatre critères : l'hébergement, la maîtrise des données, le modèle de coût, et la logique visuelle qui colle le mieux à ton équipe.
Hack'celeration Lab

Reçois nos tips intégration chaque semaine.

Pas de spam. Désinscription à tout moment.