- Accueil
- Ressources
- Intégrations
- Ollama Chat Model
Nœud Ollama Chat Model n8nConfigurer Ollama Chat Model dans n8n.
Ollama fait tourner des modèles de langage sur ta machine, et le nœud Ollama Chat Model n8n est ce qui permet à un workflow de leur parler. Il embarque 21 paramètres et un seul port de sortie, sans entrée principale. Branche-le sur un AI Agent ou une chaîne : le prompt ne quitte jamais ton serveur.
Avis vérifiés sur Trustpilot · Agence IA, automatisation & growth
À quoi sert vraiment le nœud Ollama Chat Model n8n ?
Ollama Chat Model est un sous-nœud, c'est-à-dire un nœud qu'on accroche à un autre au lieu de le poser dans le flux principal. Il n'a pas d'entrée principale et ne s'exécute jamais tout seul. Un nœud racine, un AI Agent ou une chaîne, lui demande une génération, le nœud transmet la demande à ton instance Ollama et le texte revient par le port. Tout ce que tu règles ici, choix du modèle, échantillonnage, mémoire, GPU, s'applique à cet appel.
Trois usages reviennent tout le temps. Le premier, un assistant interne : une chaîne envoie une question au modèle local et renvoie la réponse, avec Sampling Temperature basse pour que deux demandes identiques donnent deux réponses comparables. Le deuxième, un agent outillé : un AI Agent raisonne avec le modèle local et va lire une fiche dans Google Sheets. C'est là que Context Length devient sensible, parce que les résultats d'outils s'empilent dans la fenêtre de contexte, la quantité de texte que le modèle voit d'un coup. Le troisième, du tri en volume : des centaines de lignes passent dans le nœud avec Output Format réglé sur json, et le nœud suivant lit un champ au lieu de découper une phrase.
Quand vaut-il mieux prendre autre chose ? Ollama suppose d'héberger le modèle soi-même, donc un GPU ou beaucoup de patience côté processeur, et une URL de base joignable depuis n8n. Si rien de tout ça n'est envisageable, un nœud de modèle hébergé comme OpenAI ou Anthropic se branche sur le même port avec une simple clé, sans rien à administrer. Le fournisseur facture alors ses propres appels d'API selon ses conditions, n8n n'ajoute rien dans un cas comme dans l'autre. Ce que tu échanges, c'est du travail d'exploitation contre des données qui restent sur ton matériel.
Deux limites à connaître avant de construire. Les expressions ne se comportent pas pareil dans un sous-nœud : {{ $json.name }} pointe toujours sur le premier item, même quand cinq items arrivent, donc impossible d'injecter une valeur différente par item. Et le nœud lit son adresse dans les credentials Ollama, ce qui explique le nombre de montages Docker qui restent bloqués tant que l'adresse d'hôte n'est pas la bonne. L'Avis n8n replace la plateforme au-delà des sujets IA.
Comment pointer n8n vers ton instance Ollama ?
- 01
Exposer Ollama sur une adresse joignable
Ollama écoute sur le port
11434. S'il tourne dans Docker, fais-le écouter sur0.0.0.0à l'intérieur du conteneur, ce que les images officielles font déjà, et publie le port avec l'option-p:docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. Si Ollama tourne directement sur la machine hôte pendant que n8n est en conteneur, c'est sur l'hôte qu'il faut écouter sur0.0.0.0. - 02
Créer les credentials Ollama dans n8n
Dans le menu Credentials, ajoute des credentials Ollama et renseigne l'URL de base. Même machine, sans conteneur :
http://localhost:11434. n8n dans Docker sous Linux : démarre le conteneur avec--add-host host.docker.internal:host-gatewaypuis utilisehttp://host.docker.internal:11434; sous Docker Desktop, c'est automatique. Deux conteneurs séparés : prends le nom du conteneur Ollama, par exemplehttp://my-ollama:11434. - 03
Ajouter une clé pour une instance distante
Le nœud gère l'authentification par jeton Bearer, un mode où la clé voyage dans l'en-tête de la requête, pour les instances Ollama placées derrière un proxy authentifié comme Open WebUI. Renseigne l'URL distante et la clé d'API dans les mêmes credentials Ollama. Une réserve issue de la doc : Ollama ne gère pas les agents HTTP personnalisés, donc un montage derrière un proxy HTTP ou HTTPS peut ne pas fonctionner du tout.
Sur quoi ce nœud se branche-t-il ?
n8n sépare le travail IA entre un nœud racine, qui reçoit les items du workflow, et des sous-nœuds accrochés à ses ports, un type de sous-nœud par port. Ollama Chat Model fait partie de ces sous-nœuds : une seule connexion à faire, aucune entrée principale.
Sortie (où il se branche)
- Model
ai_languageModel
01Model
Le nœud expose une seule sortie, le port ai_languageModel. Tire-le vers l'emplacement Model d'un nœud racine : les deux forment un ensemble, les items entrent dans le nœud racine, celui-ci appelle le modèle, la réponse revient.
Paramètres clés
- Required : un sous-nœud ne s'exécute jamais seul, un Ollama Chat Model non raccordé ne fait donc rien.
- Basic LLM Chain : un prompt entre, une réponse sort, rien d'autre à câbler.
- AI Agent : le nœud racine à prendre quand l'assistant appelle des outils et tient une mémoire.
- Question and Answer Chain : des réponses tirées de tes propres documents, pendant que Text Classifier et Summarization Chain couvrent le tri et le résumé.
Quel paramètre toucher, et à quel moment ?
Le nœud Ollama Chat Model compte 21 paramètres. Pour chacun : le nœud tel que tu le configures dans n8n, ce que le paramètre change, et nos notes de terrain.
Sommaire des paramètres
- Model
- Enable Thinking
- Sampling Temperature
- Top K
- Top P
- Frequency Penalty
- Keep Alive
- Low VRAM Mode
- Main GPU ID
- Context Batch Size
- Context Length
- Number of GPUs
- Max Tokens to Generate
- Number of CPU Threads
- Penalize Newlines
- Presence Penalty
- Repetition Penalty
- Use Memory Locking
- Use Memory Mapping
- Load Vocabulary Only
- Output Format
Model
modelCe que tu vois dans n8n
Notes & cas d'usage
Cette liste désigne le modèle qui génère la complétion. C'est le seul réglage à remplir systématiquement, et il doit correspondre à un modèle déjà téléchargé sur la machine Ollama ; la bibliothèque de modèles Ollama recense ce qui est disponible.
Paramètres clés
- Model : requis. La doc du nœud cite Llama2, Llama2 13B, Llama2 70B et Llama2 Uncensored parmi les choix.
Enable Thinking
options.thinkCe que tu vois dans n8n
Notes & cas d'usage
Certains modèles raisonnent étape par étape avant de répondre. Avec le mode réflexion activé, ce qui est le réglage par défaut, ce raisonnement reste séparé de la sortie. Désactivé, le modèle écrit directement son contenu. Ça ne change rien sur les modèles qui ne gèrent pas la fonction.
Paramètres clés
- Enable Thinking : une case activée par défaut, qui isole le raisonnement du modèle de ce que reçoit le workflow.
Sampling Temperature
options.temperatureCe que tu vois dans n8n
Notes & cas d'usage
Le hasard dans le texte généré, c'est ce nombre qui le pilote. Les valeurs basses donnent une sortie plus concentrée et déterministe. Les valeurs hautes la rendent plus variée et plus aléatoire, avec le risque d'invention qui va avec.
Paramètres clés
- Sampling Temperature : un nombre, bas pour des réponses reproductibles, haut pour des réponses variées.
Top K
options.topKCe que tu vois dans n8n
Notes & cas d'usage
À chaque étape, le modèle classe des tokens candidats, les fragments de mots avec lesquels il construit son texte. Top K limite combien des plus probables restent en lice. Une valeur haute augmente la diversité mais peut réduire la cohérence. À -1, la limite disparaît.
Paramètres clés
- Top K : un nombre, qui limite les tokens de vocabulaire les plus probables retenus à chaque étape.
Top P
options.topPCe que tu vois dans n8n
Notes & cas d'usage
Ici, pas de comptage de tokens mais une probabilité cumulée : le modèle choisit dans le plus petit ensemble de tokens dont la probabilité additionnée dépasse le seuil. Effet documenté, un texte plus naturel avec moins de répétitions.
Paramètres clés
- Top P : un nombre, une valeur basse écarte les options les moins probables.
Frequency Penalty
options.frequencyPenaltyCe que tu vois dans n8n
Notes & cas d'usage
Les tokens déjà apparus dans le texte généré sont pénalisés, et cette valeur dit à quel point. Plus elle monte, moins le modèle se répète. La pénalité suit la fréquence : plus une formule revient, plus le modèle s'en éloigne.
Paramètres clés
- Frequency Penalty : un nombre, qui ajuste la pénalité des tokens déjà présents dans la sortie.
Keep Alive
options.keepAliveCe que tu vois dans n8n
Notes & cas d'usage
Une fois la génération terminée, Ollama peut garder le modèle en mémoire au lieu de le décharger. Ce champ dit combien de temps, sous forme de durée comme 1h30m pour une heure et trente minutes. Utile pour les modèles sollicités souvent.
Paramètres clés
- Keep Alive : une chaîne de durée au format
1h30m, qui fixe le maintien en mémoire après usage.
Low VRAM Mode
options.lowVramCe que tu vois dans n8n
Notes & cas d'usage
Mémoire graphique serrée ? Cet interrupteur réduit la consommation mémoire au prix d'une génération plus lente. Il vise les GPU à mémoire limitée, et c'est un vrai arbitrage, pas une optimisation gratuite.
Paramètres clés
- Low VRAM Mode : une case qui échange de la vitesse de génération contre moins de mémoire utilisée.
Main GPU ID
options.mainGpuCe que tu vois dans n8n
Notes & cas d'usage
Sur une machine à plusieurs cartes graphiques, il faut désigner celle qui porte le calcul principal. Ce champ prend cet identifiant de GPU. Avec une seule carte, il n'y a rien à décider, et la doc conseille de n'y toucher qu'en présence de plusieurs GPU.
Paramètres clés
- Main GPU ID : un nombre, l'identifiant du GPU utilisé pour le calcul principal.
Context Batch Size
options.numBatchCe que tu vois dans n8n
Notes & cas d'usage
Le traitement du prompt se fait par lots, et ce réglage en fixe la taille. Des lots plus grands peuvent accélérer la génération, mais ils consomment plus de mémoire. C'est le levier de débit, sans effet sur la qualité de la sortie.
Paramètres clés
- Context Batch Size : un nombre, la taille de lot utilisée pour traiter le prompt.
Context Length
options.numCtxCe que tu vois dans n8n
Notes & cas d'usage
La fenêtre de contexte, c'est la quantité de texte que le modèle garde sous les yeux pour produire le token suivant. Ce nombre la plafonne. Une valeur basse réduit la mémoire consommée, une valeur haute donne plus de matière au modèle.
Paramètres clés
- Context Length : le nombre maximal de tokens servant de contexte pour générer le token suivant.
Number of GPUs
options.numGpuCe que tu vois dans n8n
Notes & cas d'usage
Le traitement en parallèle sur plusieurs cartes se règle ici : la valeur indique combien de GPU Ollama doit utiliser. Laissée à -1, elle déclenche la détection automatique, ce qui reste le réglage sain sur une machine que tu maîtrises.
Paramètres clés
- Number of GPUs : un nombre,
-1signifiant détection automatique.
Max Tokens to Generate
options.numPredictCe que tu vois dans n8n
Notes & cas d'usage
La longueur de la réponse trouve son plafond dans ce champ. À -1, plus aucune limite, mais la doc met en garde contre les valeurs élevées, qui mènent à des sorties très longues et aux temps d'exécution qui vont avec.
Paramètres clés
- Max Tokens to Generate : le nombre maximal de tokens produits,
-1retirant la limite.
Number of CPU Threads
options.numThreadCe que tu vois dans n8n
Notes & cas d'usage
Le traitement côté processeur utilise autant de threads que cette valeur l'autorise. À 0, Ollama détecte lui-même le nombre. Utile à toucher quand la machine ne fait pas que servir des modèles.
Paramètres clés
- Number of CPU Threads : un nombre,
0déclenchant la détection automatique.
Penalize Newlines
options.penalizeNewlineCe que tu vois dans n8n
Notes & cas d'usage
Les retours à la ligne sont des tokens comme les autres. Activé, ce réglage rend leur génération moins probable, ce qui pousse le modèle vers des séquences de texte continues plutôt que vers des lignes hachées.
Paramètres clés
- Penalize Newlines : une case qui rend les caractères de saut de ligne moins probables dans la sortie.
Presence Penalty
options.presencePenaltyCe que tu vois dans n8n
Notes & cas d'usage
Le critère n'est plus la fréquence mais la simple présence : un token est pénalisé dès qu'il est apparu dans le texte produit. Les valeurs positives poussent le modèle vers du contenu neuf et encouragent la diversité.
Paramètres clés
- Presence Penalty : un nombre, les valeurs positives pénalisant les tokens déjà apparus.
Repetition Penalty
options.repeatPenaltyCe que tu vois dans n8n
Notes & cas d'usage
Un modèle coincé en boucle, qui répète la même proposition sans s'arrêter, c'est le problème que ce facteur traite. Plus la valeur monte, plus la répétition est découragée. À 1.0, la pénalité de répétition est désactivée.
Paramètres clés
- Repetition Penalty : un nombre, qui ajuste le facteur de pénalité des tokens répétés,
1.0le désactivant.
Use Memory Locking
options.useMLockCe que tu vois dans n8n
Notes & cas d'usage
Le swap, quand le système déplace des pages de mémoire vers le disque, plombe les temps de réponse. Verrouiller le modèle en mémoire l'empêche et peut améliorer les performances, mais il faut assez de mémoire libre pour tout tenir.
Paramètres clés
- Use Memory Locking : une case qui épingle le modèle en mémoire pour éviter le swap.
Use Memory Mapping
options.useMMapCe que tu vois dans n8n
Notes & cas d'usage
Charger le fichier du modèle par projection mémoire peut réduire la mémoire utilisée, avec un impact possible sur les performances. La doc recommande de garder l'option active : c'est un réglage qu'on désactive volontairement, pas par défaut.
Paramètres clés
- Use Memory Mapping : une case pour le chargement du modèle par projection mémoire, recommandée activée.
Load Vocabulary Only
options.vocabOnlyCe que tu vois dans n8n
Notes & cas d'usage
Seul le vocabulaire du modèle est chargé, sans les poids. Aucune vraie génération derrière, et c'est justement l'intérêt : tester la tokenisation devient rapide.
Paramètres clés
- Load Vocabulary Only : une case qui charge le vocabulaire et laisse les poids de côté.
Output Format
options.formatCe que tu vois dans n8n
Notes & cas d'usage
Les nœuds suivants veulent rarement de la prose. Ce sélecteur fixe le format de la réponse de l'API, pour qu'elle arrive dans une forme exploitable par la suite du workflow.
Paramètres clés
- Output Format : deux choix,
default(Default) etjson(JSON).
json pour que le nœud suivant lise directement un champ, au lieu d'aller repêcher la valeur dans une phrase.Besoin d'aide pour automatiser Ollama Chat Model avec n8n ?
L'équipe te répond directement.
Chaque message est lu par une personne.
Les questions qui viennent ensuite
01Le nœud Ollama Chat Model n8n est-il inclus dans n8n ?
02Que faut-il pour que le nœud fonctionne ?
03Quelles sont les limites de ce nœud ?
04Que faut-il brancher au minimum, et par quel nœud commencer ?
05n8n ou Make pour faire tourner un modèle local ?
Reçois nos tips intégration chaque semaine.
Pas de spam. Désinscription à tout moment.



