Ressources · Intégration n8n

Nœud NVIDIA Nemotron Chat Model n8nConfigurer NVIDIA Nemotron Chat Model dans n8n.

Ce nœud ne travaille jamais seul, et c'est voulu. Le nœud NVIDIA Nemotron Chat Model n8n est un sous-nœud : il se raccroche à un nœud plus gros au lieu de tourner de son côté. Il expose 9 paramètres, du choix du modèle jusqu'aux relances, et alimente tout nœud racine qui réclame un modèle de langage.

Avis vérifiés sur Trustpilot · Agence IA, automatisation & growth

Pourquoi automatiser

À quoi sert le nœud NVIDIA Nemotron Chat Model n8n ?

Il fournit le moteur de génération à un autre nœud. Posé seul sur un canevas, il ne produit rien : il n'a pas d'entrée principale et ne s'exécute jamais de lui-même. Tu le branches sur un nœud racine, un agent ou une chaîne, via le port intitulé Model, un port étant simplement la prise sur laquelle un nœud racine attend un sous-nœud. À partir de là, chaque texte généré sort d'un modèle Nemotron, hébergé sur build.nvidia.com ou servi par un conteneur NIM sur ton infrastructure.

Premier cas : le tri des demandes entrantes. Un message arrive, un AI Agent décide s'il s'agit d'un bug, d'une question de facturation ou d'une demande commerciale, et la formulation vient du modèle choisi dans Model. Pour ce genre de décision, Sampling Temperature descend près de zéro. Une catégorie qui change d'une exécution à l'autre ne sert à rien.

Deuxième cas : les brouillons de réponse. Une fois la demande classée, la même chaîne rédige un début de réponse et le dépose dans Gmail sans jamais l'envoyer. Maximum Number of Tokens évite le pavé de trois paragraphes quand deux phrases suffisent, et Frequency Penalty empêche le modèle de replacer la même formule de politesse dans tous les brouillons de la journée.

Troisième cas : l'extraction de données. Une facture ou un formulaire arrive en texte libre, et le nœud suivant a besoin de champs propres. Bascule Response Format sur json_object, demande explicitement du JSON dans le prompt de la chaîne, et la suite du workflow lit le résultat avec une expression du type {{ $json.montant }}, la syntaxe n8n qui va chercher un champ dans l'item entrant.

Quand passer à autre chose ? Ce nœud ne parle qu'à des modèles Nemotron, via un endpoint compatible avec la spécification OpenAI. Si tes clés sont chez un autre fournisseur, le sous-nœud correspondant fait le même travail sur le même port : OpenAI et Anthropic se débranchent et se rebranchent en glissant une connexion. Rester sur Nemotron a du sens quand tu veux le même modèle disponible en ligne et dans un conteneur NIM que tu maîtrises.

Les limites méritent d'être connues avant de construire. Pas d'entrée principale, donc pas de déclenchement possible. n8n charge la liste des modèles depuis l'endpoint configuré dans le credential, ce jeu d'identifiants enregistré une fois dans n8n, et retombe sur une liste restreinte d'identifiants Nemotron connus quand il n'arrive pas à joindre cet endpoint. NVIDIA facture ses propres appels d'API selon ses conditions, n8n n'ajoute rien par-dessus. Si la question du jour porte encore sur la plateforme et pas sur le nœud, l'Avis n8n traite ce point.

Connexion

Comment connecter le credential NVIDIA dans n8n ?

  1. 01

    Ouvrir un compte NVIDIA build

    L'accès en ligne commence par un compte sur build.nvidia.com. Ouvre un modèle Nemotron dans le catalogue, clique sur Get API Key et copie la clé tout de suite. Un seul credential couvre les deux modes de déploiement, donc c'est aussi le compte que tu gardes si une partie du trafic part plus tard sur ta propre machine. Rien ne s'installe côté n8n à cette étape.

  2. 02

    Créer le credential dans n8n

    Dans le menu Credentials, crée un credential NVIDIA Nemotron. Deux champs comptent. Base URL désigne l'endpoint compatible avec la spécification OpenAI à appeler, et la valeur par défaut https://integrate.api.nvidia.com/v1 pointe vers build.nvidia.com. API Key reçoit la clé copiée juste avant. Enregistré une fois, ce credential se réutilise dans tous les workflows de l'instance.

  3. 03

    Viser un NIM auto-hébergé

    Si tu fais tourner un NVIDIA Inference Microservice chez toi, une seule chose change : remplace Base URL par l'adresse de ton NIM, chemin /v1 compris, par exemple http://localhost:8000/v1. Si ce NIM exige une authentification, colle son jeton dans API Key. S'il n'en exige pas, laisse le champ vide. C'est autorisé ici, et assez rare pour être dit.

Connexions

Sur quoi ce sous-nœud se branche-t-il ?

n8n sépare le travail IA entre un nœud racine, qui reçoit les items du workflow, et des sous-nœuds accrochés à ses ports, un type de sous-nœud par port. Celui-ci est un sous-nœud, avec une seule connexion sortante.

Sortie (où il se branche)

  • Modelai_languageModel
01ModelC'est le port du modèle de langage, la prise qu'un nœud racine expose quand il a besoin de faire générer du texte. Tu y glisses le nœud Nemotron et le nœud racine sait d'où viennent ses réponses.

C'est le port du modèle de langage, la prise qu'un nœud racine expose quand il a besoin de faire générer du texte. Tu y glisses le nœud Nemotron et le nœud racine sait d'où viennent ses réponses.

Paramètres clés

  • Required : un nœud racine sans modèle de chat sur ce port refuse simplement de s'exécuter.
  • AI Agent et AI Agent Tool : le point de départ habituel, un agent qui décide puis agit.
  • Basic LLM Chain : un prompt, une réponse, sans appel d'outil entre les deux.
  • Text Classifier et Information Extractor : des nœuds racines plus étroits, pour ranger un item ou en sortir des champs.
Cas d'usage
un tri de tickets démarre souvent sur Text Classifier, puis passe à l'AI Agent le jour où les décisions ne tiennent plus dans une liste de catégories.
Paramètres

Que règle-t-on sur ce nœud ?

Le nœud NVIDIA Nemotron Chat Model compte 9 paramètres. Pour chacun : le nœud tel que tu le configures dans n8n, ce que le paramètre change, et nos notes de terrain.

01

Model

model

Ce que tu vois dans n8n

Notes & cas d'usage

Choisit le modèle Nemotron qui génère la réponse. n8n charge la liste dynamiquement depuis l'endpoint configuré dans le credential, et retombe sur une liste restreinte d'identifiants Nemotron connus quand cet endpoint reste injoignable.

Paramètres clés

  • Model : la liste déroulante, du petit nvidia/nvidia-nemotron-nano-9b-v2 jusqu'à nvidia/nemotron-3-super-120b-a12b, avec entre les deux des variantes de raisonnement et de vision comme nvidia/nemotron-nano-12b-v2-vl.
Cas d'usage
démarrer un workflow de classification sur un modèle nano, et ne monter dans la liste que si les réponses sont vraiment fausses.
02

Frequency Penalty

options.frequencyPenalty

Ce que tu vois dans n8n

Notes & cas d'usage

Agit sur la tendance du modèle à se répéter. Les valeurs positives pénalisent les jetons, ces fragments de mots que le modèle manipule, en fonction de leur fréquence dans le texte déjà produit : plus tu montes, moins la même tournure revient mot pour mot.

Paramètres clés

  • Frequency Penalty : un nombre à augmenter quand le texte généré tourne en boucle sur les mêmes formulations.
Cas d'usage
une série de fiches produits générées depuis un même gabarit, où c'est justement la phrase de conclusion identique partout qui trahit le lot.
03

Maximum Number of Tokens

options.maxTokens

Ce que tu vois dans n8n

Notes & cas d'usage

Plafonne la longueur de la réponse. La valeur se compte en jetons, pas en caractères, et -1 laisse le modèle appliquer sa valeur par défaut.

Paramètres clés

  • Maximum Number of Tokens : à laisser sur -1 tant qu'aucun nœud suivant n'impose de taille.
Cas d'usage
un champ de CRM avec une longueur maximale, où une réponse généreuse pose plus de problèmes qu'une réponse courte. Attention au plafond trop bas : le modèle ne résume pas, il s'arrête au milieu d'une phrase.
04

Response Format

options.responseFormat

Ce que tu vois dans n8n

Notes & cas d'usage

Détermine si le nœud renvoie de la prose ou des données exploitables. Le mode JSON garantit que le message produit est du JSON valide.

Paramètres clés

  • Text (text) : une réponse texte classique, le comportement par défaut.
  • JSON (json_object) : du JSON valide, à une condition, le mot json doit figurer dans le prompt de la chaîne ou de l'agent au-dessus.
Cas d'usage
toute branche où le nœud suivant lit un champ plutôt qu'une phrase. Oublie le mot dans le prompt et l'option déçoit sans prévenir.
05

Presence Penalty

options.presencePenalty

Ce que tu vois dans n8n

Notes & cas d'usage

Pousse le modèle vers de nouveaux sujets. Les valeurs positives pénalisent les jetons déjà apparus, quelle que soit leur fréquence, ce qui augmente les chances que la réponse avance au lieu de tourner autour du même point.

Paramètres clés

  • Presence Penalty : à monter pour explorer, à laisser bas quand la réponse doit rester sur un seul sujet.
Cas d'usage
une étape de brainstorming qui alimente la suite du workflow en angles différents. Sur une réponse au client, c'est le mauvais bouton : partir ailleurs est précisément ce qu'on veut éviter.
06

Sampling Temperature

options.temperature

Ce que tu vois dans n8n

Notes & cas d'usage

Fixe le niveau d'aléatoire de l'échantillonnage. Près de zéro, le modèle devient déterministe et répétitif ; plus haut, la génération se diversifie et le risque d'hallucination augmente.

Paramètres clés

  • Sampling Temperature : l'option la plus utile du nœud, et la première à vérifier quand la qualité bouge d'une exécution à l'autre.
Cas d'usage
proche de zéro pour l'extraction et la classification, plus haut pour la rédaction. Modifier ce réglage et Top P en même temps est déconseillé.
07

Timeout

options.timeout

Ce que tu vois dans n8n

Notes & cas d'usage

Fixe la durée maximale d'une requête, en millisecondes. Au-delà, la requête est abandonnée plutôt que laissée en suspens.

Paramètres clés

  • Timeout : un nombre en millisecondes, donc 2000 vaut deux secondes, pas deux mille.
Cas d'usage
un NIM auto-hébergé qui charge encore un gros modèle répond lentement au premier appel, et un délai trop serré transforme ce démarrage en exécution ratée. C'est sur les longues séries que l'option prend son sens.
08

Max Retries

options.maxRetries

Ce que tu vois dans n8n

Notes & cas d'usage

Indique combien de fois n8n retente une requête avant de la considérer perdue.

Paramètres clés

  • Max Retries : le nombre de tentatives pour une requête, à monter sur un endpoint partagé, à baisser quand un échec doit remonter vite.
Cas d'usage
un traitement nocturne sur une longue liste, où un refus isolé ne doit pas arrêter toute l'exécution. À croiser avec Timeout : des relances par-dessus un délai généreux occupent le workflow bien plus longtemps que prévu.
09

Top P

options.topP

Ce que tu vois dans n8n

Notes & cas d'usage

Joue sur la diversité par échantillonnage nucleus. À 0.5, la moitié des options pondérées par leur probabilité est prise en compte : plus la valeur baisse, plus le modèle ignore ses choix les moins probables.

Paramètres clés

  • Top P : la masse de probabilité dans laquelle la génération a le droit de piocher.
Cas d'usage
resserrer les réponses d'un workflow qui tourne déjà à température fixe. Ajuster cette option ou Sampling Temperature se recommande, mais pas les deux ensemble, sinon aucune exécution ne dit ce qui a agi.
Besoin d'aide

Besoin d'aide pour automatiser NVIDIA Nemotron Chat Model avec n8n ?

L'équipe te répond directement.

Chaque message est lu par une personne.

FAQ

Les questions qui reviennent

01Le nœud NVIDIA Nemotron Chat Model n8n est-il inclus dans n8n ?
Oui. Il fait partie du paquet IA de n8n, @n8n/n8n-nodes-langchain, livré avec n8n. Rien à installer, aucun surcoût côté n8n, que tu sois sur n8n Cloud, l'offre hébergée par n8n, ou sur une instance auto-hébergée en Community Edition sous licence Sustainable Use. Un workflow se comporte de la même façon dans les deux cas. Ce qui se paie, c'est NVIDIA : le fournisseur du modèle facture ses propres appels d'API selon ses conditions, et n8n n'ajoute rien par-dessus. Viser un conteneur NIM chez toi change l'endroit où tourne le calcul, pas la facture n8n.
02Que faut-il pour le faire fonctionner ?
Un credential, créé une fois dans le menu Credentials et réutilisé partout. Il contient une Base URL, l'endpoint compatible avec la spécification OpenAI à appeler, et une API Key. Pour build.nvidia.com, garde l'endpoint par défaut et génère une clé depuis le catalogue avec Get API Key. Pour un NIM auto-hébergé, remplace la Base URL par ta propre adresse, chemin /v1 compris, et laisse l'API Key vide si ce NIM n'impose pas d'authentification. Le nœud lui-même n'a pas de sélecteur d'authentification. Au-delà du credential, il lui faut un nœud racine sur lequel se brancher, puisqu'un sous-nœud ne s'exécute jamais seul.
03Quelles sont les limites du nœud ?
Trois, à connaître avant de construire. Il n'a pas d'entrée principale : impossible de le déclencher, impossible de l'intercaler entre deux nœuds classiques, il attend qu'un nœud racine lui demande une réponse. Il ne joint des modèles Nemotron qu'à travers un endpoint compatible avec la spécification OpenAI, donc build.nvidia.com ou un NIM que tu héberges, et rien d'autre. Enfin, la liste Model dépend de cet endpoint : injoignable, n8n affiche une liste restreinte d'identifiants Nemotron connus au lieu de ce que ton déploiement sert vraiment. Le nœud est en version 1, un ancien workflow montre donc les mêmes options.
04Que faut-il brancher au minimum, et par quoi commencer ?
Une seule connexion, sur le port Model. Le nœud racine a alors tout ce qu'il lui faut. Pour débuter, Basic LLM Chain reste le plus simple : un prompt entre, une réponse sort, sans appel d'outil à déboguer en parallèle du modèle. Le jour où le workflow doit décider plutôt que répondre, l'AI Agent prend le relais sur le même port. Text Classifier et Information Extractor sont de bonnes étapes intermédiaires quand le travail consiste à ranger un item ou à en extraire des champs. Guardrails et Summarization Chain acceptent aussi ce port.
05n8n ou Make pour faire tourner Nemotron ?
Ça dépend de l'endroit où doit vivre le workflow. Make est une plateforme hébergée, sans option d'auto-hébergement, facturée à l'opération. n8n tourne sur son cloud ou sur tes propres serveurs, et c'est le critère décisif ici : si tu passes par un conteneur NIM justement pour garder l'inférence chez toi, envoyer chaque prompt dans une plateforme hébergée va contre ce choix. Make offre une logique visuelle que beaucoup d'équipes lisent plus vite. Les modèles de coût diffèrent aussi, à l'opération d'un côté, à l'instance de l'autre : fais tourner tes volumes réels dans les deux avant de trancher.
Hack'celeration Lab

Reçois nos tips intégration chaque semaine.

Pas de spam. Désinscription à tout moment.