- Accueil
- Ressources
- Intégrations
- Ollama Model
Nœud Ollama Model n8nConfigurer Ollama Model dans n8n.
Le nœud Ollama Model n8n relie un workflow à un modèle de langage qui tourne sur ta propre machine. C'est un sous-nœud : pas d'entrée principale, jamais d'exécution isolée, il se raccorde au port Model d'un nœud racine. Un sélecteur, 21 paramètres, et le texte ne sort pas du réseau.
Avis vérifiés sur Trustpilot · Agence IA, automatisation & growth
À quoi sert le nœud Ollama Model n8n ?
Le nœud transmet un prompt à une instance Ollama que tu héberges, et rend la réponse au nœud racine qui l'a demandée. Il ne se place pas dans le flux principal du workflow. Chez n8n, les nœuds IA fonctionnent en grappe : un nœud racine reçoit les items, et des sous-nœuds viennent se brancher sur ses ports, un type de sous-nœud par port. Celui-ci occupe le port ai_languageModel et reste inerte tant qu'aucun nœud racine ne l'appelle.
Premier scénario, celui du cabinet qui ne veut rien envoyer dehors. Une Basic LLM Chain reçoit une question, le nœud Ollama Model y répond avec un modèle téléchargé sur le serveur de la boîte, et la réponse repart dans le workflow. Aucun prompt ne quitte les murs, ce qui change tout quand il contient un dossier client ou une note interne. La réponse peut ensuite atterrir dans Slack ou dans un ticket.
Deuxième scénario : la vérification. Un modèle de contrôle lit une affirmation et le texte source, puis dit si l'affirmation tient. Rien n'empêche deux nœuds Ollama Model de cohabiter dans le même workflow sur deux chaînes différentes, chacun avec sa valeur dans Model, l'un qui rédige et l'autre qui relit. Une Sampling Temperature basse côté relecture rend le verdict stable d'une exécution à l'autre.
Troisième scénario : la recherche documentaire sur site. Les documents sont découpés, vectorisés, rangés dans un vector store, et une chaîne de résumé ou de questions-réponses s'appuie sur ce nœud pour formuler la réponse finale à partir des passages retrouvés. Alimente la chaîne depuis Google Sheets ou une boîte mail, et tout le parcours reste derrière le pare-feu.
Quand vaut-il mieux choisir autre chose ? La doc officielle du nœud le dit sans détour : il n'a pas le support des outils, donc il ne fonctionne pas avec le nœud AI Agent, et il faut lui préférer la Basic LLM Chain. Dès qu'un agent doit appeler des outils, ou qu'un AI Agent Tool s'imbrique dans un autre agent, il faut un modèle de chat qui les gère, du côté des nœuds OpenAI ou Anthropic. Ces fournisseurs facturent leurs propres appels d'API ; n8n n'ajoute rien par-dessus.
Deux limites à connaître avant de construire. Dans un sous-nœud, les expressions ne se comportent pas comme ailleurs : là où un nœud classique résout {{ $json.champ }} une fois par item, ici l'expression renvoie toujours le premier item, donc une liste de cinq prompts ne se déroulera pas depuis ce nœud. Ensuite, Ollama ne gère pas d'agent HTTP personnalisé dans sa configuration, ce qui rend son usage derrière un proxy maison compliqué, même avec les variables d'environnement habituelles. Ces deux comportements tiennent au modèle des sous-nœuds, pas à un défaut : mieux vaut les anticiper que les déboguer plus tard.
Comment le connecter ?
- 01
Lancer Ollama et télécharger un modèle
Ollama doit être joignable depuis n8n avant que le nœud n'affiche quoi que ce soit. Installe-le sur la machine ou démarre le conteneur officiel en publiant le port :
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. Ollama écoute sur le port11434par défaut. Télécharge ensuite au moins un modèle depuis la bibliothèque Ollama Models Library, puisque le sélecteur Model propose ce que ton instance sait servir. - 02
Créer le credential Ollama dans n8n
Ouvre le menu Credentials de n8n et ajoute un credential Ollama, le jeu d'identifiants que n8n stocke. Le champ qui compte est l'URL de base, l'adresse que n8n appelle :
http://localhost:11434quand tout tourne sur la même machine. Si l'instance est distante et placée derrière un proxy authentifié comme Open WebUI, le nœud accepte le jeton Bearer : renseigne l'URL distante et la clé d'API. Il se crée une fois et se réutilise partout. - 03
Brancher le nœud sur un nœud racine
Pose le nœud Ollama Model sur le canvas et tire son connecteur vers le port Model d'un nœud racine, une Basic LLM Chain pour commencer. Un port, c'est la prise étiquetée sous un nœud racine où vient se fixer un type précis de sous-nœud. Sélectionne le credential, choisis une valeur dans Model, et laisse les options de côté au premier essai. Le nœud n'a pas d'entrée principale : aucun fil n'arrive sur sa gauche, et c'est normal.
Où se branche ce sous-nœud ?
Les nœuds IA de n8n forment une grappe : un nœud racine porte la logique et reçoit les items du workflow, des sous-nœuds comme celui-ci l'étendent via ses ports. Un sous-nœud ne s'exécute jamais seul, donc la seule question qui compte est celle de la bonne prise.
Sortie (où il se branche)
- Model
ai_languageModel
01Model
Ce nœud expose une seule sortie, de type ai_languageModel, et elle se pose sur le port Model d'un nœud racine. C'est ce branchement qui le fait tourner, tout simplement.
Paramètres clés
- Required : sans entrée principale et sans exécution autonome, un nœud Ollama Model non raccordé ne sert à rien sur le canvas.
- Basic LLM Chain et Question and Answer Chain sont les deux racines les plus simples pour démarrer : un prompt entre, du texte sort.
- Summarization Chain et Information Extractor acceptent le même port quand il s'agit de condenser un document ou d'en sortir des champs.
Quels paramètres régler sur le nœud Ollama Model ?
Le nœud Ollama Model compte 21 paramètres. Pour chacun : le nœud tel que tu le configures dans n8n, ce que le paramètre change, et nos notes de terrain.
Sommaire des paramètres
- Model
- Enable Thinking
- Sampling Temperature
- Top K
- Top P
- Frequency Penalty
- Keep Alive
- Low VRAM Mode
- Main GPU ID
- Context Batch Size
- Context Length
- Number of GPUs
- Max Tokens to Generate
- Number of CPU Threads
- Penalize Newlines
- Presence Penalty
- Repetition Penalty
- Use Memory Locking
- Use Memory Mapping
- Load Vocabulary Only
- Output Format
Model
modelCe que tu vois dans n8n
Notes & cas d'usage
Tant que ce sélecteur est vide, rien ne se passe. Il désigne le modèle qui produira la complétion, et ce choix décide de tout le reste : qualité de la réponse, vitesse, mémoire immobilisée pendant le chargement.
Paramètres clés
- Model : le modèle qui génère la complétion. La doc officielle du nœud cite Llama2, Llama2 13B, Llama2 70B et Llama2 Uncensored ; pour télécharger des modèles, passe par l'Ollama Models Library.
Enable Thinking
options.thinkCe que tu vois dans n8n
Notes & cas d'usage
Les modèles de raisonnement gardent un brouillon avant de répondre. Cet interrupteur décide si ce brouillon reste à part du résultat, et il ne veut rien dire sur un modèle qui ne gère pas le mode.
Paramètres clés
- Enable Thinking : active (par défaut) le mode réflexion sur les modèles compatibles. Activé, le raisonnement est séparé de la sortie ; désactivé, le modèle produit directement le contenu.
Sampling Temperature
options.temperatureCe que tu vois dans n8n
Notes & cas d'usage
Le hasard a une molette, la voici. Le même prompt lancé deux fois peut revenir formulé autrement, et l'écart entre ces deux réponses tient exactement à ce nombre.
Paramètres clés
- Sampling Temperature : contrôle le caractère aléatoire du texte généré. Une valeur basse rend la sortie plus ciblée et déterministe, une valeur haute la rend plus variée et plus aléatoire.
Top K
options.topKCe que tu vois dans n8n
Notes & cas d'usage
À chaque étape, le modèle classe tout son vocabulaire puis pioche en haut du classement. Un token, c'est un fragment de texte, à peu près un mot ou un morceau de mot. Ce réglage dit jusqu'où le tirage a le droit de descendre.
Paramètres clés
- Top K : limite le nombre de tokens les plus probables considérés à chaque étape. Une valeur plus haute augmente la diversité mais peut réduire la cohérence.
-1désactive le réglage.
Top P
options.topPCe que tu vois dans n8n
Notes & cas d'usage
Ici, on ne compte plus les candidats mais la probabilité. Le tirage ajoute des tokens au panier jusqu'à ce que leur probabilité cumulée dépasse le seuil fixé, puis s'arrête.
Paramètres clés
- Top P : choisit dans le plus petit ensemble de tokens dont la probabilité cumulée dépasse top_p. Aide à produire un texte plus naturel en réduisant les répétitions.
Frequency Penalty
options.frequencyPenaltyCe que tu vois dans n8n
Notes & cas d'usage
La répétition s'installe quand le même token gagne le classement encore et encore. Cette pénalité pèse contre les tokens à proportion du nombre de fois où ils ont déjà servi dans la réponse en cours.
Paramètres clés
- Frequency Penalty : ajuste la pénalité appliquée aux tokens déjà apparus dans le texte généré. Des valeurs plus hautes découragent la répétition.
Keep Alive
options.keepAliveCe que tu vois dans n8n
Notes & cas d'usage
Charger un modèle local en mémoire coûte des secondes bien réelles. Ce champ dit combien de temps Ollama doit l'y garder après l'appel, pour que la prochaine exécution démarre à chaud.
Paramètres clés
- Keep Alive : durée de maintien du modèle chargé en mémoire après usage. Utile pour les modèles fréquemment sollicités. Format
1h30mpour une heure et trente minutes.
Low VRAM Mode
options.lowVramCe que tu vois dans n8n
Notes & cas d'usage
Les petites cartes graphiques étouffent sur les gros modèles. Activer ce mode échange de la vitesse contre de la place, et c'est souvent ce qui sépare une chaîne qui tourne d'une chaîne qui plante sur la machine dont tu disposes.
Paramètres clés
- Low VRAM Mode : active le mode faible VRAM, qui réduit l'usage mémoire au prix d'une génération plus lente. Utile pour les GPU à mémoire limitée.
Main GPU ID
options.mainGpuCe que tu vois dans n8n
Notes & cas d'usage
Une machine à plusieurs cartes graphiques doit savoir laquelle mène le calcul. Laissé tranquille, ce champ ne fait rien ; sur un serveur multi-cartes, il décide où la charge tombe.
Paramètres clés
- Main GPU ID : identifiant du GPU utilisé pour le calcul principal. À ne changer que si plusieurs GPU sont présents.
Context Batch Size
options.numBatchCe que tu vois dans n8n
Notes & cas d'usage
Avant de générer quoi que ce soit, le modèle doit lire le prompt, et il le lit par lots. Élargir le lot accélère cette phase de lecture, au prix de la mémoire.
Paramètres clés
- Context Batch Size : définit la taille de lot pour le traitement du prompt. Des lots plus grands peuvent accélérer la génération mais augmentent l'usage mémoire.
Context Length
options.numCtxCe que tu vois dans n8n
Notes & cas d'usage
Le contexte est un budget. Tout ce que le modèle a le droit de regarder pour écrire le token suivant, le prompt comme ce qu'il a déjà produit, doit tenir dans ce nombre.
Paramètres clés
- Context Length : nombre maximal de tokens utilisés comme contexte pour générer le token suivant. Des valeurs basses réduisent la mémoire, des valeurs hautes donnent plus de contexte au modèle.
Number of GPUs
options.numGpuCe que tu vois dans n8n
Notes & cas d'usage
Répartir le travail sur plusieurs cartes se demande explicitement, ici. Ce champ compte les cartes, là où Main GPU ID désigne celle qui commande.
Paramètres clés
- Number of GPUs : nombre de GPU utilisés pour le traitement parallèle.
-1active la détection automatique.
Max Tokens to Generate
options.numPredictCe que tu vois dans n8n
Notes & cas d'usage
Une réponse peut s'emballer. Ce plafond arrête le modèle en vol, ce qui protège à la fois la durée d'exécution du workflow et le nœud d'après, qui attend un champ de taille raisonnable.
Paramètres clés
- Max Tokens to Generate : nombre maximal de tokens générés.
-1supprime la limite ; prudence avec une valeur élevée, qui peut produire des sorties très longues.
Number of CPU Threads
options.numThreadCe que tu vois dans n8n
Notes & cas d'usage
Une partie du travail retombe toujours sur le processeur, et sur une machine sans carte graphique exploitable, la totalité. Ce champ dit combien de threads Ollama peut réclamer.
Paramètres clés
- Number of CPU Threads : nombre de threads CPU utilisés pour le traitement.
0active la détection automatique.
Penalize Newlines
options.penalizeNewlineCe que tu vois dans n8n
Notes & cas d'usage
Les sauts de ligne sont des tokens comme les autres, et un modèle qui les cherche produit des réponses hachées. Cet interrupteur le pousse dans l'autre sens.
Paramètres clés
- Penalize Newlines : rend le modèle moins enclin à produire des caractères de saut de ligne, ce qui encourage des séquences de texte continues plus longues.
Presence Penalty
options.presencePenaltyCe que tu vois dans n8n
Notes & cas d'usage
Présence et fréquence se ressemblent mais ne comptent pas la même chose. Celle-ci retient seulement qu'un token est apparu, pas combien de fois, et pousse le modèle vers du vocabulaire encore vierge.
Paramètres clés
- Presence Penalty : ajuste la pénalité des tokens selon leur présence dans le texte déjà généré. Les valeurs positives pénalisent les tokens déjà apparus et encouragent la diversité.
Repetition Penalty
options.repeatPenaltyCe que tu vois dans n8n
Notes & cas d'usage
Un troisième garde-fou anti-répétition s'ajoute aux deux autres, et c'est le plus direct : un facteur unique appliqué aux tokens qui reviennent.
Paramètres clés
- Repetition Penalty : ajuste le facteur de pénalité des tokens répétés. Des valeurs plus hautes découragent plus fortement la répétition.
1.0désactive la pénalité.
Use Memory Locking
options.useMLockCe que tu vois dans n8n
Notes & cas d'usage
Un système sous pression déplacera le modèle chargé vers le disque, et l'appel suivant rampe. Le verrouillage l'épingle en mémoire pour que ça n'arrive pas.
Paramètres clés
- Use Memory Locking : verrouille le modèle en mémoire pour empêcher le swap. Peut améliorer les performances, mais exige assez de mémoire disponible.
Use Memory Mapping
options.useMMapCe que tu vois dans n8n
Notes & cas d'usage
La façon dont les poids sont lus sur le disque est elle aussi un choix. Le memory mapping laisse le système les charger au fil des besoins plutôt que de tout monter en RAM d'un coup.
Paramètres clés
- Use Memory Mapping : utilise le memory mapping pour charger le modèle. Réduit l'usage mémoire mais peut affecter les performances. Recommandé activé.
Load Vocabulary Only
options.vocabOnlyCe que tu vois dans n8n
Notes & cas d'usage
Parfois, les poids ne sont pas le sujet. Charger le seul vocabulaire les saute entièrement : c'est rapide, et ça ne produit aucune vraie complétion.
Paramètres clés
- Load Vocabulary Only : charge uniquement le vocabulaire du modèle, sans les poids. Utile pour tester rapidement la tokenisation.
Output Format
options.formatCe que tu vois dans n8n
Notes & cas d'usage
La forme de la réponse de l'API se choisit, et ça compte dès que le nœud suivant attend des données structurées plutôt qu'un texte à décortiquer.
Paramètres clés
- Output Format : format de la réponse de l'API, au choix
default(Default) oujson(JSON).
json quand une chaîne d'extraction alimente un nœud qui écrit des champs nommés, et garder default pour tout ce qu'un humain va lire.Besoin d'aide pour automatiser Ollama Model avec n8n ?
L'équipe te répond directement.
Chaque message est lu par une personne.
Questions fréquentes sur le nœud Ollama Model
01Le nœud Ollama Model n8n est-il inclus dans n8n ?
02Quels credentials faut-il pour l'utiliser ?
03Quelles sont les limites de ce nœud ?
04Que faut-il brancher au minimum, et par quoi commencer ?
05n8n ou Make pour faire tourner un modèle en local ?
Reçois nos tips intégration chaque semaine.
Pas de spam. Désinscription à tout moment.
