Ressources · Intégration n8n

Nœud Ollama Chat Model n8nConfigurer Ollama Chat Model dans n8n.

Ollama fait tourner des modèles de langage sur ta machine, et le nœud Ollama Chat Model n8n est ce qui permet à un workflow de leur parler. Il embarque 21 paramètres et un seul port de sortie, sans entrée principale. Branche-le sur un AI Agent ou une chaîne : le prompt ne quitte jamais ton serveur.

Avis vérifiés sur Trustpilot · Agence IA, automatisation & growth

Pourquoi automatiser

À quoi sert vraiment le nœud Ollama Chat Model n8n ?

Ollama Chat Model est un sous-nœud, c'est-à-dire un nœud qu'on accroche à un autre au lieu de le poser dans le flux principal. Il n'a pas d'entrée principale et ne s'exécute jamais tout seul. Un nœud racine, un AI Agent ou une chaîne, lui demande une génération, le nœud transmet la demande à ton instance Ollama et le texte revient par le port. Tout ce que tu règles ici, choix du modèle, échantillonnage, mémoire, GPU, s'applique à cet appel.

Trois usages reviennent tout le temps. Le premier, un assistant interne : une chaîne envoie une question au modèle local et renvoie la réponse, avec Sampling Temperature basse pour que deux demandes identiques donnent deux réponses comparables. Le deuxième, un agent outillé : un AI Agent raisonne avec le modèle local et va lire une fiche dans Google Sheets. C'est là que Context Length devient sensible, parce que les résultats d'outils s'empilent dans la fenêtre de contexte, la quantité de texte que le modèle voit d'un coup. Le troisième, du tri en volume : des centaines de lignes passent dans le nœud avec Output Format réglé sur json, et le nœud suivant lit un champ au lieu de découper une phrase.

Quand vaut-il mieux prendre autre chose ? Ollama suppose d'héberger le modèle soi-même, donc un GPU ou beaucoup de patience côté processeur, et une URL de base joignable depuis n8n. Si rien de tout ça n'est envisageable, un nœud de modèle hébergé comme OpenAI ou Anthropic se branche sur le même port avec une simple clé, sans rien à administrer. Le fournisseur facture alors ses propres appels d'API selon ses conditions, n8n n'ajoute rien dans un cas comme dans l'autre. Ce que tu échanges, c'est du travail d'exploitation contre des données qui restent sur ton matériel.

Deux limites à connaître avant de construire. Les expressions ne se comportent pas pareil dans un sous-nœud : {{ $json.name }} pointe toujours sur le premier item, même quand cinq items arrivent, donc impossible d'injecter une valeur différente par item. Et le nœud lit son adresse dans les credentials Ollama, ce qui explique le nombre de montages Docker qui restent bloqués tant que l'adresse d'hôte n'est pas la bonne. L'Avis n8n replace la plateforme au-delà des sujets IA.

Connexion

Comment pointer n8n vers ton instance Ollama ?

  1. 01

    Exposer Ollama sur une adresse joignable

    Ollama écoute sur le port 11434. S'il tourne dans Docker, fais-le écouter sur 0.0.0.0 à l'intérieur du conteneur, ce que les images officielles font déjà, et publie le port avec l'option -p : docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. Si Ollama tourne directement sur la machine hôte pendant que n8n est en conteneur, c'est sur l'hôte qu'il faut écouter sur 0.0.0.0.

  2. 02

    Créer les credentials Ollama dans n8n

    Dans le menu Credentials, ajoute des credentials Ollama et renseigne l'URL de base. Même machine, sans conteneur : http://localhost:11434. n8n dans Docker sous Linux : démarre le conteneur avec --add-host host.docker.internal:host-gateway puis utilise http://host.docker.internal:11434 ; sous Docker Desktop, c'est automatique. Deux conteneurs séparés : prends le nom du conteneur Ollama, par exemple http://my-ollama:11434.

  3. 03

    Ajouter une clé pour une instance distante

    Le nœud gère l'authentification par jeton Bearer, un mode où la clé voyage dans l'en-tête de la requête, pour les instances Ollama placées derrière un proxy authentifié comme Open WebUI. Renseigne l'URL distante et la clé d'API dans les mêmes credentials Ollama. Une réserve issue de la doc : Ollama ne gère pas les agents HTTP personnalisés, donc un montage derrière un proxy HTTP ou HTTPS peut ne pas fonctionner du tout.

Connexions

Sur quoi ce nœud se branche-t-il ?

n8n sépare le travail IA entre un nœud racine, qui reçoit les items du workflow, et des sous-nœuds accrochés à ses ports, un type de sous-nœud par port. Ollama Chat Model fait partie de ces sous-nœuds : une seule connexion à faire, aucune entrée principale.

Sortie (où il se branche)

  • Modelai_languageModel
01ModelLe nœud expose une seule sortie, le port ai_languageModel. Tire-le vers l'emplacement Model d'un nœud racine : les deux forment un ensemble, les items entrent dans le nœud racine, celui-ci appelle le modèle, la réponse revient.

Le nœud expose une seule sortie, le port ai_languageModel. Tire-le vers l'emplacement Model d'un nœud racine : les deux forment un ensemble, les items entrent dans le nœud racine, celui-ci appelle le modèle, la réponse revient.

Paramètres clés

  • Required : un sous-nœud ne s'exécute jamais seul, un Ollama Chat Model non raccordé ne fait donc rien.
  • Basic LLM Chain : un prompt entre, une réponse sort, rien d'autre à câbler.
  • AI Agent : le nœud racine à prendre quand l'assistant appelle des outils et tient une mémoire.
  • Question and Answer Chain : des réponses tirées de tes propres documents, pendant que Text Classifier et Summarization Chain couvrent le tri et le résumé.
Cas d'usage
un workflow de support commence sur une Basic LLM Chain, puis remplace ce nœud racine par un AI Agent Tool le jour où l'assistant doit agir.
Paramètres

Quel paramètre toucher, et à quel moment ?

Le nœud Ollama Chat Model compte 21 paramètres. Pour chacun : le nœud tel que tu le configures dans n8n, ce que le paramètre change, et nos notes de terrain.

01

Model

model

Ce que tu vois dans n8n

Notes & cas d'usage

Cette liste désigne le modèle qui génère la complétion. C'est le seul réglage à remplir systématiquement, et il doit correspondre à un modèle déjà téléchargé sur la machine Ollama ; la bibliothèque de modèles Ollama recense ce qui est disponible.

Paramètres clés

  • Model : requis. La doc du nœud cite Llama2, Llama2 13B, Llama2 70B et Llama2 Uncensored parmi les choix.
Cas d'usage
un premier assistant local démarre sur un petit modèle le temps de valider la plomberie, puis monte d'un cran quand la qualité des réponses devient le vrai point faible.
02

Enable Thinking

options.think

Ce que tu vois dans n8n

Notes & cas d'usage

Certains modèles raisonnent étape par étape avant de répondre. Avec le mode réflexion activé, ce qui est le réglage par défaut, ce raisonnement reste séparé de la sortie. Désactivé, le modèle écrit directement son contenu. Ça ne change rien sur les modèles qui ne gèrent pas la fonction.

Paramètres clés

  • Enable Thinking : une case activée par défaut, qui isole le raisonnement du modèle de ce que reçoit le workflow.
Cas d'usage
un nœud qui alimente un message Slack ne veut que la réponse, donc laisser la réflexion activée garde le raisonnement hors du texte lu par l'équipe.
03

Sampling Temperature

options.temperature

Ce que tu vois dans n8n

Notes & cas d'usage

Le hasard dans le texte généré, c'est ce nombre qui le pilote. Les valeurs basses donnent une sortie plus concentrée et déterministe. Les valeurs hautes la rendent plus variée et plus aléatoire, avec le risque d'invention qui va avec.

Paramètres clés

  • Sampling Temperature : un nombre, bas pour des réponses reproductibles, haut pour des réponses variées.
Cas d'usage
deux nœuds, deux réglages. Celui qui reformule une description produit peut travailler chaud, celui qui range un ticket dans une catégorie reste froid pour que la même entrée retombe toujours au même endroit.
04

Top K

options.topK

Ce que tu vois dans n8n

Notes & cas d'usage

À chaque étape, le modèle classe des tokens candidats, les fragments de mots avec lesquels il construit son texte. Top K limite combien des plus probables restent en lice. Une valeur haute augmente la diversité mais peut réduire la cohérence. À -1, la limite disparaît.

Paramètres clés

  • Top K : un nombre, qui limite les tokens de vocabulaire les plus probables retenus à chaque étape.
Cas d'usage
une réponse qui part en vrille au bout de quelques phrases se resserre souvent en baissant ce réglage, avant même de retoucher le prompt.
05

Top P

options.topP

Ce que tu vois dans n8n

Notes & cas d'usage

Ici, pas de comptage de tokens mais une probabilité cumulée : le modèle choisit dans le plus petit ensemble de tokens dont la probabilité additionnée dépasse le seuil. Effet documenté, un texte plus naturel avec moins de répétitions.

Paramètres clés

  • Top P : un nombre, une valeur basse écarte les options les moins probables.
Cas d'usage
pour un assistant qui répond toujours avec les mêmes tournures, jouer ici marche mieux que monter la température, parce que la formulation se détend sans que les faits partent en balade.
06

Frequency Penalty

options.frequencyPenalty

Ce que tu vois dans n8n

Notes & cas d'usage

Les tokens déjà apparus dans le texte généré sont pénalisés, et cette valeur dit à quel point. Plus elle monte, moins le modèle se répète. La pénalité suit la fréquence : plus une formule revient, plus le modèle s'en éloigne.

Paramètres clés

  • Frequency Penalty : un nombre, qui ajuste la pénalité des tokens déjà présents dans la sortie.
Cas d'usage
un compte rendu long qui revient trois fois sur la même phrase se calme généralement dès qu'on remonte ce réglage.
07

Keep Alive

options.keepAlive

Ce que tu vois dans n8n

Notes & cas d'usage

Une fois la génération terminée, Ollama peut garder le modèle en mémoire au lieu de le décharger. Ce champ dit combien de temps, sous forme de durée comme 1h30m pour une heure et trente minutes. Utile pour les modèles sollicités souvent.

Paramètres clés

  • Keep Alive : une chaîne de durée au format 1h30m, qui fixe le maintien en mémoire après usage.
Cas d'usage
un workflow déclenché toutes les quelques minutes repaie le chargement du modèle à chaque exécution tant que cette fenêtre ne couvre pas l'intervalle.
08

Low VRAM Mode

options.lowVram

Ce que tu vois dans n8n

Notes & cas d'usage

Mémoire graphique serrée ? Cet interrupteur réduit la consommation mémoire au prix d'une génération plus lente. Il vise les GPU à mémoire limitée, et c'est un vrai arbitrage, pas une optimisation gratuite.

Paramètres clés

  • Low VRAM Mode : une case qui échange de la vitesse de génération contre moins de mémoire utilisée.
Cas d'usage
un modèle qui refuse de se charger sur une carte grand public peut passer avec cette option, ce qui mérite un essai avant de descendre d'un modèle.
09

Main GPU ID

options.mainGpu

Ce que tu vois dans n8n

Notes & cas d'usage

Sur une machine à plusieurs cartes graphiques, il faut désigner celle qui porte le calcul principal. Ce champ prend cet identifiant de GPU. Avec une seule carte, il n'y a rien à décider, et la doc conseille de n'y toucher qu'en présence de plusieurs GPU.

Paramètres clés

  • Main GPU ID : un nombre, l'identifiant du GPU utilisé pour le calcul principal.
Cas d'usage
un serveur partagé où une carte est déjà prise par un autre service, donc le workflow est dirigé vers celle qui reste libre.
10

Context Batch Size

options.numBatch

Ce que tu vois dans n8n

Notes & cas d'usage

Le traitement du prompt se fait par lots, et ce réglage en fixe la taille. Des lots plus grands peuvent accélérer la génération, mais ils consomment plus de mémoire. C'est le levier de débit, sans effet sur la qualité de la sortie.

Paramètres clés

  • Context Batch Size : un nombre, la taille de lot utilisée pour traiter le prompt.
Cas d'usage
un traitement de nuit qui pousse de longs documents dans le modèle peut gagner du temps ici, à condition que la machine ait de la mémoire en réserve.
11

Context Length

options.numCtx

Ce que tu vois dans n8n

Notes & cas d'usage

La fenêtre de contexte, c'est la quantité de texte que le modèle garde sous les yeux pour produire le token suivant. Ce nombre la plafonne. Une valeur basse réduit la mémoire consommée, une valeur haute donne plus de matière au modèle.

Paramètres clés

  • Context Length : le nombre maximal de tokens servant de contexte pour générer le token suivant.
Cas d'usage
une conversation d'agent qui oublie d'un coup ce qui a été dit plus haut tape souvent dans ce plafond, l'historique et les résultats d'outils partageant le même budget.
12

Number of GPUs

options.numGpu

Ce que tu vois dans n8n

Notes & cas d'usage

Le traitement en parallèle sur plusieurs cartes se règle ici : la valeur indique combien de GPU Ollama doit utiliser. Laissée à -1, elle déclenche la détection automatique, ce qui reste le réglage sain sur une machine que tu maîtrises.

Paramètres clés

  • Number of GPUs : un nombre, -1 signifiant détection automatique.
Cas d'usage
un serveur multi-cartes partagé avec d'autres traitements, où le workflow est bridé sur une partie au lieu de tout prendre.
13

Max Tokens to Generate

options.numPredict

Ce que tu vois dans n8n

Notes & cas d'usage

La longueur de la réponse trouve son plafond dans ce champ. À -1, plus aucune limite, mais la doc met en garde contre les valeurs élevées, qui mènent à des sorties très longues et aux temps d'exécution qui vont avec.

Paramètres clés

  • Max Tokens to Generate : le nombre maximal de tokens produits, -1 retirant la limite.
Cas d'usage
un nœud qui écrit un résumé court dans une colonne de base de données se plafonne ici, pour qu'aucun item ne produise un pavé en aval.
14

Number of CPU Threads

options.numThread

Ce que tu vois dans n8n

Notes & cas d'usage

Le traitement côté processeur utilise autant de threads que cette valeur l'autorise. À 0, Ollama détecte lui-même le nombre. Utile à toucher quand la machine ne fait pas que servir des modèles.

Paramètres clés

  • Number of CPU Threads : un nombre, 0 déclenchant la détection automatique.
Cas d'usage
n8n et Ollama sur le même serveur, où brider les threads évite que la génération étouffe le moteur de workflows pendant les longues exécutions.
15

Penalize Newlines

options.penalizeNewline

Ce que tu vois dans n8n

Notes & cas d'usage

Les retours à la ligne sont des tokens comme les autres. Activé, ce réglage rend leur génération moins probable, ce qui pousse le modèle vers des séquences de texte continues plutôt que vers des lignes hachées.

Paramètres clés

  • Penalize Newlines : une case qui rend les caractères de saut de ligne moins probables dans la sortie.
Cas d'usage
un nœud qui rédige le corps d'un mail pour Gmail, où une réponse criblée de puces demanderait un nettoyage avant envoi.
16

Presence Penalty

options.presencePenalty

Ce que tu vois dans n8n

Notes & cas d'usage

Le critère n'est plus la fréquence mais la simple présence : un token est pénalisé dès qu'il est apparu dans le texte produit. Les valeurs positives poussent le modèle vers du contenu neuf et encouragent la diversité.

Paramètres clés

  • Presence Penalty : un nombre, les valeurs positives pénalisant les tokens déjà apparus.
Cas d'usage
chercher des angles pour une campagne, quand le modèle sert sinon cinq variantes de sa première idée.
17

Repetition Penalty

options.repeatPenalty

Ce que tu vois dans n8n

Notes & cas d'usage

Un modèle coincé en boucle, qui répète la même proposition sans s'arrêter, c'est le problème que ce facteur traite. Plus la valeur monte, plus la répétition est découragée. À 1.0, la pénalité de répétition est désactivée.

Paramètres clés

  • Repetition Penalty : un nombre, qui ajuste le facteur de pénalité des tokens répétés, 1.0 le désactivant.
Cas d'usage
un petit modèle local qui part en boucle sur les générations longues, où remonter ce réglage va plus vite que de changer de modèle.
18

Use Memory Locking

options.useMLock

Ce que tu vois dans n8n

Notes & cas d'usage

Le swap, quand le système déplace des pages de mémoire vers le disque, plombe les temps de réponse. Verrouiller le modèle en mémoire l'empêche et peut améliorer les performances, mais il faut assez de mémoire libre pour tout tenir.

Paramètres clés

  • Use Memory Locking : une case qui épingle le modèle en mémoire pour éviter le swap.
Cas d'usage
un serveur dédié aux modèles avec de la mémoire en rab, où le temps de réponse compte plus que la place laissée aux autres processus.
19

Use Memory Mapping

options.useMMap

Ce que tu vois dans n8n

Notes & cas d'usage

Charger le fichier du modèle par projection mémoire peut réduire la mémoire utilisée, avec un impact possible sur les performances. La doc recommande de garder l'option active : c'est un réglage qu'on désactive volontairement, pas par défaut.

Paramètres clés

  • Use Memory Mapping : une case pour le chargement du modèle par projection mémoire, recommandée activée.
Cas d'usage
un hôte contraint qui fait tourner plusieurs modèles, où la mémoire économisée au chargement est ce qui leur permet de cohabiter.
20

Load Vocabulary Only

options.vocabOnly

Ce que tu vois dans n8n

Notes & cas d'usage

Seul le vocabulaire du modèle est chargé, sans les poids. Aucune vraie génération derrière, et c'est justement l'intérêt : tester la tokenisation devient rapide.

Paramètres clés

  • Load Vocabulary Only : une case qui charge le vocabulaire et laisse les poids de côté.
Cas d'usage
vérifier comment un modèle découpe tes textes avant de lui confier un long traitement par lots, sans attendre un chargement complet.
21

Output Format

options.format

Ce que tu vois dans n8n

Notes & cas d'usage

Les nœuds suivants veulent rarement de la prose. Ce sélecteur fixe le format de la réponse de l'API, pour qu'elle arrive dans une forme exploitable par la suite du workflow.

Paramètres clés

  • Output Format : deux choix, default (Default) et json (JSON).
Cas d'usage
un workflow de classification bascule sur json pour que le nœud suivant lise directement un champ, au lieu d'aller repêcher la valeur dans une phrase.
Besoin d'aide

Besoin d'aide pour automatiser Ollama Chat Model avec n8n ?

L'équipe te répond directement.

Chaque message est lu par une personne.

FAQ

Les questions qui viennent ensuite

01Le nœud Ollama Chat Model n8n est-il inclus dans n8n ?
Oui. Il fait partie du paquet IA de n8n, @n8n/n8n-nodes-langchain, livré avec n8n. Rien à installer, aucun surcoût côté n8n, sur n8n Cloud comme sur une instance auto-hébergée en Community Edition sous licence Sustainable Use. Comme les modèles tournent sur ton propre serveur Ollama, il n'y a pas non plus de fournisseur qui facture des appels d'API. Ce que ça coûte se déplace ailleurs : du matériel et de l'exploitation, une machine avec assez de mémoire, un GPU ou de la patience côté processeur, et une URL de base joignable depuis n8n.
02Que faut-il pour que le nœud fonctionne ?
Une instance Ollama et des credentials Ollama dans n8n. Le credential porte l'URL de base, et c'est là que passe l'essentiel du travail : port 11434 par défaut, localhost quand tout est sur la même machine sans conteneur, host.docker.internal quand n8n tourne dans Docker, ou le nom du conteneur Ollama quand les deux sont dans des conteneurs séparés. Pour une instance distante derrière un proxy authentifié comme Open WebUI, ajoute une clé d'API à côté de l'URL et le nœud s'authentifie par jeton Bearer. Un credential se crée une fois et se réutilise dans tous les workflows.
03Quelles sont les limites de ce nœud ?
C'est un sous-nœud : pas d'entrée principale, jamais d'exécution isolée, il lui faut un nœud racine raccordé au port Model. Les expressions y répondent différemment, puisque avec cinq items en entrée une expression pointe toujours sur le premier, donc pas de valeur par item. Ollama ne gère pas les agents HTTP personnalisés, ce qui rend les proxys HTTP ou HTTPS peu fiables quelles que soient les variables HTTP_PROXY. Enfin le nœud est en version 1, donc un vieux workflow peut afficher moins que les 21 paramètres décrits ici.
04Que faut-il brancher au minimum, et par quel nœud commencer ?
Une connexion suffit : tire la sortie vers le port Model d'un nœud racine. Pour débuter, Basic LLM Chain reste la combinaison la plus simple, puisqu'elle envoie un prompt et renvoie une réponse sans autre réglage. Passe à AI Agent le jour où l'assistant doit appeler des outils ou tenir une mémoire, c'est-à-dire garder le fil de la conversation. Sur le nœud lui-même, Model est le seul paramètre requis, tout le reste est optionnel. Règle Model, branche le port, lance le workflow une fois, puis affine.
05n8n ou Make pour faire tourner un modèle local ?
Make est une plateforme d'automatisation hébergée, sans option d'auto-hébergement, facturée à l'opération. Ça pèse plus que d'habitude ici, parce qu'un modèle local est déjà un choix d'auto-hébergement, et qu'une plateforme hébergée doit atteindre ta machine depuis l'extérieur. n8n peut tourner sur le même réseau qu'Ollama, ce qui garde les prompts et les réponses dans ton infrastructure. Make reste plus confortable quand personne ne veut maintenir un serveur et que l'équipe connaît déjà son éditeur visuel. Arbitre sur l'hébergement, la maîtrise des données et le modèle de coût.
Hack'celeration Lab

Reçois nos tips intégration chaque semaine.

Pas de spam. Désinscription à tout moment.