Ressources · Intégration n8n

Nœud Hugging Face Inference Model n8nConfigurer Hugging Face Inference Model dans n8n.

Un modèle ouvert entre dans un workflow dès qu'il est raccordé à une chaîne. Le nœud Hugging Face Inference Model n8n expose 8 paramètres, du nom du modèle jusqu'à Top P, et n'a aucune entrée principale. Il alimente en génération de texte le nœud racine qui porte le port Model.

Avis vérifiés sur Trustpilot · Agence IA, automatisation & growth

Pourquoi automatiser

À quoi sert le nœud Hugging Face Inference Model n8n ?

C'est un sous-nœud, autrement dit un nœud qui ne tourne jamais seul et ne sert à rien tant qu'il n'est pas raccordé au port d'un nœud plus gros. Tu le poses sur le canvas, tu le relies au port Model d'une chaîne, et chaque prompt envoyé par cette chaîne part vers un point d'inférence Hugging Face plutôt que vers un modèle commercial hébergé. Le nœud porte le choix du modèle et les réglages d'échantillonnage. La chaîne au-dessus porte le prompt.

Premier cas : résumer des verbatims. Une ligne arrive de Google Sheets avec un commentaire client à rallonge, la chaîne demande trois lignes de synthèse, et le nœud les produit avec Maximum Number of Tokens réglé bas pour que la réponse reste courte. Le tout tourne sur un modèle que tu as choisi, pas sur celui installé par défaut.

Deuxième cas : classer avant d'aiguiller. Les messages de support arrivent par Gmail, la chaîne demande au modèle de coller une étiquette sur chacun, et Sampling Temperature reste proche de zéro pour que deux passages du même message donnent la même étiquette. C'est cette étiquette qui décide ensuite d'un message Slack ou d'une écriture dans la feuille.

Troisième cas : rédiger sur un point d'inférence privé. Une équipe qui a affiné son propre modèle pointe Custom Inference Endpoint sur ce déploiement, ne touche à rien d'autre, et récupère des brouillons qui parlent comme son corpus. Le reste du workflow ne bouge pas d'un pixel.

Quand prendre autre chose ? Ce nœud ne gère pas les outils, il ne fonctionne donc pas avec le nœud AI Agent. Un agent qui doit appeler des outils réclame un modèle de chat qui les prend en charge, rôle tenu par les nœuds OpenAI ou Anthropic. Ici, la documentation renvoie vers Basic LLM Chain, et ce nœud reste sur du travail de complétion.

Deux limites à connaître avant de construire. Le nœud est en version 1 : le panneau que tu vois est celui décrit ici, sans option cachée. Et le fournisseur du modèle facture ses propres appels d'API selon ses conditions, n8n n'ajoutant rien par-dessus. Une génération longue reste une génération payée quelque part.

Connexion

Comment authentifier le nœud ?

  1. 01

    Ouvrir le menu Credentials

    Dans n8n, un credential est un jeu d'identifiants enregistré une fois et réutilisé par tous les workflows qui en ont besoin. Passe par le menu Credentials pour créer le credential Hugging Face, plutôt que de saisir quoi que ce soit directement dans le nœud. La même entrée servira ensuite à toutes les chaînes que tu monteras, sur n8n Cloud comme sur une instance auto-hébergée.

  2. 02

    Renseigner le credential Hugging Face

    Suis les informations d'authentification que n8n documente pour Hugging Face, puis enregistre le credential sous un nom que tu reconnaîtras dans six mois. Un huggingface-prod vaut mieux qu'un credential 1 quand trois personnes partagent l'instance et que deux d'entre elles débuguent la même exécution ratée.

  3. 03

    Sélectionner le credential sur le nœud

    De retour sur le canvas, ouvre le nœud Hugging Face Inference Model et choisis le credential dans la liste en haut du panneau. Tire ensuite un lien du nœud vers le port Model d'un nœud racine. Un sous-nœud laissé non branché reste sagement là sans jamais s'exécuter, et c'est la première raison pour laquelle une chaîne annonce qu'elle ne trouve aucun modèle.

Connexions

Sur quoi se branche ce nœud ?

n8n coupe le travail IA en deux : un nœud racine reçoit les items du workflow par son entrée principale, et des sous-nœuds viennent se poser sur ses ports, un type par port. Celui-ci est un sous-nœud avec une seule sortie, donc la seule question de câblage est de savoir quel nœud racine la récupère.

Sortie (où il se branche)

  • Modelai_languageModel
01ModelLe port Model, c'est l'endroit où un nœud racine réclame le modèle de langage auquel il doit parler. Tire le lien depuis ce nœud vers ce port et la chaîne cesse d'être une coquille vide.

Le port Model, c'est l'endroit où un nœud racine réclame le modèle de langage auquel il doit parler. Tire le lien depuis ce nœud vers ce port et la chaîne cesse d'être une coquille vide.

Paramètres clés

  • Required : un nœud racine doté d'un port Model ne produit rien tant qu'aucun sous-nœud de modèle n'y est raccordé.
  • Basic LLM Chain : le nœud racine prompt et réponse, celui vers lequel la documentation officielle oriente pour ce modèle.
  • Summarization Chain : prend une entrée longue et en renvoie une version condensée.
  • Question and Answer Chain : répond à une question sur le contenu que tu lui donnes.
Cas d'usage
un credential, un choix de modèle, et le même nœud réutilisé par une chaîne de résumé et une chaîne de classement dans le même workflow.
Paramètres

Quels paramètres comptent dans le panneau ?

Le nœud Hugging Face Inference Model compte 8 paramètres. Pour chacun : le nœud tel que tu le configures dans n8n, ce que le paramètre change, et nos notes de terrain.

01

Model

model

Ce que tu vois dans n8n

Notes & cas d'usage

Désigne le modèle qui génère la complétion. Tout le reste du panneau ne fait que sculpter son comportement, c'est donc le premier champ à remplir et celui qu'on change quand la qualité part dans le décor.

Paramètres clés

  • Model : un champ texte qui porte l'identifiant du modèle ; fixe-le une fois pour un modèle unique, ou pilote-le par une expression {{ $json.model }} quand un nœud précédent décide du modèle item par item.
Cas d'usage
un workflow qui envoie les brouillons courts vers un petit modèle et les synthèses longues vers un plus grand, la ligne portant elle-même le nom.
02

Custom Inference Endpoint

options.endpointUrl

Ce que tu vois dans n8n

Notes & cas d'usage

Oriente le nœud vers une URL de point d'inférence personnalisée au lieu du service par défaut. Laisse le champ vide en usage courant, remplis-le seulement quand le modèle tourne sur une infrastructure que tu maîtrises.

Paramètres clés

  • Custom Inference Endpoint : l'URL du point d'inférence personnalisé, saisie en clair ou récupérée d'un nœud précédent par {{ $json.endpoint }} quand la recette et la production diffèrent.
Cas d'usage
un modèle affiné déployé sur un point privé, appelé par la chaîne qui tournait déjà sur le point partagé, sans rien changer d'autre.
03

Frequency Penalty

options.frequencyPenalty

Ce que tu vois dans n8n

Notes & cas d'usage

Les valeurs positives pénalisent les nouveaux tokens en fonction de leur fréquence déjà présente dans le texte, ce qui réduit la probabilité que le modèle répète la même ligne mot pour mot. On y touche quand un texte généré se met à tourner en rond.

Paramètres clés

  • Frequency Penalty : un nombre ; monte-le quand une réponse longue recycle sans arrêt les mêmes formules, laisse-le tranquille sur une sortie factuelle courte où la répétition ne menace personne.
Cas d'usage
des descriptions produit générées en série, où les trois mêmes adjectifs dans chaque ligne sautent aux yeux avant tout le reste.
04

Maximum Number of Tokens

options.maxTokens

Ce que tu vois dans n8n

Notes & cas d'usage

Plafonne le nombre de tokens utilisés par la complétion. Un token est un morceau de texte, à peu près un mot court ou un fragment de mot, et ce réglage décide si la réponse tient en une phrase ou en une page.

Paramètres clés

  • Maximum Number of Tokens : un nombre borné par la longueur de contexte du modèle, qui vaut 2048 tokens pour la plupart d'entre eux, les plus récents montant nettement plus haut.
Cas d'usage
une chaîne qui rédige des notifications, plafonnée bas pour qu'un résumé n'arrive jamais sous forme de pavé que personne ne lira.
05

Presence Penalty

options.presencePenalty

Ce que tu vois dans n8n

Notes & cas d'usage

Ici la pénalité se déclenche dès qu'un token a été vu une fois, ce qui pousse le modèle à ouvrir des sujets nouveaux. Levier différent de Frequency Penalty : l'un combat la répétition, l'autre combat l'enfermement sur un seul sujet.

Paramètres clés

  • Presence Penalty : un nombre ; monte-le quand une sortie de brainstorming tourne autour d'une seule idée, laisse-le au repos quand la consigne est de ne pas s'écarter du sujet.
Cas d'usage
générer des angles pour une campagne, où cinq variantes du même angle ratent complètement l'objectif de la demande.
06

Sampling Temperature

options.temperature

Ce que tu vois dans n8n

Notes & cas d'usage

Contrôle le hasard. En la baissant, les complétions deviennent moins aléatoires, et quand la température approche de zéro le modèle devient déterministe et répétitif. C'est le premier paramètre à toucher quand un workflow a besoin de réponses reproductibles.

Paramètres clés

  • Sampling Temperature : un nombre ; proche de 0 pour du classement ou de l'extraction où la même entrée doit rendre la même sortie, plus haut quand il s'agit d'écrire du neuf.
Cas d'usage
une chaîne de tri qui étiquette les tickets entrants, où une étiquette qui change entre deux passages rend l'aiguillage impossible à défendre.
07

Top K

options.topK

Ce que tu vois dans n8n

Notes & cas d'usage

Fixe le nombre de tokens candidats que le modèle considère dans l'opération d'échantillonnage pour créer le texte suivant. Rétrécir ce vivier maintient la sortie près de la suite la plus évidente.

Paramètres clés

  • Top K : un nombre qui règle la taille de ce vivier de candidats ; une petite valeur serre la génération, une grande laisse revenir des tokens moins probables.
Cas d'usage
reformater du texte libre approximatif selon un patron de phrase fixe, là où s'écarter de la formulation attendue casse ce qui parse le résultat en aval.
08

Top P

options.topP

Ce que tu vois dans n8n

Notes & cas d'usage

Règle la diversité par échantillonnage du noyau : 0.5 signifie que la moitié des options pondérées par leur vraisemblance sont prises en compte. La recommandation officielle est de modifier ce paramètre ou la température, mais pas les deux ensemble.

Paramètres clés

  • Top P : un nombre ; baisse-le pour ignorer les options les moins probables, et tranche entre lui et Sampling Temperature au lieu de régler les deux en même temps.
Cas d'usage
une équipe qui a déjà arrêté une température de confiance et veut un cran de contrôle de plus sans rouvrir le réglage précédent.
Besoin d'aide

Besoin d'aide pour automatiser Hugging Face Inference Model avec n8n ?

L'équipe te répond directement.

Chaque message est lu par une personne.

FAQ

Les questions qui viennent ensuite

01Le nœud Hugging Face Inference Model n8n est-il gratuit ?
Oui. Il fait partie du paquet IA de n8n, publié sous le nom @n8n/n8n-nodes-langchain, et il est présent sur n8n Cloud comme sur une instance auto-hébergée en Community Edition sous licence Sustainable Use. Rien à installer, aucun surcoût côté n8n pour le nœud lui-même. Ce qui coûte, c'est le fournisseur du modèle, qui facture ses propres appels d'API selon ses conditions. La distinction compte au moment de comparer un modèle ouvert appelé par ce nœud et un modèle commercial hébergé : la part n8n de la facture est la même dans les deux cas.
02Que faut-il pour que le nœud fonctionne ?
Deux choses. Un credential Hugging Face, créé une fois depuis le menu Credentials et réutilisé par tous les workflows de l'instance, et un nœud racine sur lequel se brancher. Ce nœud est un sous-nœud : pas d'entrée principale, aucune exécution en solo, et rien ne se passe tant que sa sortie n'est pas raccordée au port Model d'un nœud comme Basic LLM Chain. Un credential sans branchement donne un nœud inerte, un branchement sans credential donne une chaîne qui échoue au premier appel. Prépare les deux avant la première exécution.
03Quelles sont les limites du nœud ?
La principale tient au support des outils, que ce nœud n'a pas. Il ne fonctionne donc pas avec le nœud AI Agent, et la documentation renvoie vers Basic LLM Chain à la place. Le nœud est en version 1 : le panneau contient le sélecteur de modèle et les 7 options décrites plus haut, rien de plus. Un workflow ancien peut encore afficher une version antérieure, avec moins d'options. Quant au plafond de tokens, il appartient au modèle et non à n8n : la plupart ont une longueur de contexte de 2048 tokens, les plus récents allant bien au-delà.
04Que brancher au minimum, et par quel sous-nœud commencer ?
Au minimum, un credential et un nœud racine. Commence par Basic LLM Chain, le nœud racine le plus simple du lot : il prend un prompt, l'envoie au modèle posé sur son port Model, et renvoie la réponse. Une fois que ça tourne de bout en bout, déplacer le même nœud de modèle vers une Summarization Chain ou une Question and Answer Chain tient en un glissement de souris, puisque le type de port ne change pas. Laisse les agents de côté au début, ce nœud de modèle ne pouvant pas en servir un.
05n8n ou Make pour faire tourner des modèles ouverts ?
Ça dépend d'où les données doivent rester. n8n s'auto-héberge en Docker ou par npm, donc les prompts et les complétions restent sur une infrastructure que tu maîtrises, et le même workflow tourne à l'identique sur n8n Cloud. Make est hébergé uniquement, sans option d'auto-hébergement, et facture à l'opération, ce qui change le calcul sur une chaîne à gros volume. Son éditeur visuel reste un vrai atout sur les process linéaires. Pour un workflow IA fait d'un nœud racine et de sous-nœuds, le modèle de n8n colle mieux à la forme du travail.
Hack'celeration Lab

Reçois nos tips intégration chaque semaine.

Pas de spam. Désinscription à tout moment.