- Accueil
- Ressources
- Intégrations
- Hugging Face Inference Model
Nœud Hugging Face Inference Model n8nConfigurer Hugging Face Inference Model dans n8n.
Un modèle ouvert entre dans un workflow dès qu'il est raccordé à une chaîne. Le nœud Hugging Face Inference Model n8n expose 8 paramètres, du nom du modèle jusqu'à Top P, et n'a aucune entrée principale. Il alimente en génération de texte le nœud racine qui porte le port Model.
Avis vérifiés sur Trustpilot · Agence IA, automatisation & growth
À quoi sert le nœud Hugging Face Inference Model n8n ?
C'est un sous-nœud, autrement dit un nœud qui ne tourne jamais seul et ne sert à rien tant qu'il n'est pas raccordé au port d'un nœud plus gros. Tu le poses sur le canvas, tu le relies au port Model d'une chaîne, et chaque prompt envoyé par cette chaîne part vers un point d'inférence Hugging Face plutôt que vers un modèle commercial hébergé. Le nœud porte le choix du modèle et les réglages d'échantillonnage. La chaîne au-dessus porte le prompt.
Premier cas : résumer des verbatims. Une ligne arrive de Google Sheets avec un commentaire client à rallonge, la chaîne demande trois lignes de synthèse, et le nœud les produit avec Maximum Number of Tokens réglé bas pour que la réponse reste courte. Le tout tourne sur un modèle que tu as choisi, pas sur celui installé par défaut.
Deuxième cas : classer avant d'aiguiller. Les messages de support arrivent par Gmail, la chaîne demande au modèle de coller une étiquette sur chacun, et Sampling Temperature reste proche de zéro pour que deux passages du même message donnent la même étiquette. C'est cette étiquette qui décide ensuite d'un message Slack ou d'une écriture dans la feuille.
Troisième cas : rédiger sur un point d'inférence privé. Une équipe qui a affiné son propre modèle pointe Custom Inference Endpoint sur ce déploiement, ne touche à rien d'autre, et récupère des brouillons qui parlent comme son corpus. Le reste du workflow ne bouge pas d'un pixel.
Quand prendre autre chose ? Ce nœud ne gère pas les outils, il ne fonctionne donc pas avec le nœud AI Agent. Un agent qui doit appeler des outils réclame un modèle de chat qui les prend en charge, rôle tenu par les nœuds OpenAI ou Anthropic. Ici, la documentation renvoie vers Basic LLM Chain, et ce nœud reste sur du travail de complétion.
Deux limites à connaître avant de construire. Le nœud est en version 1 : le panneau que tu vois est celui décrit ici, sans option cachée. Et le fournisseur du modèle facture ses propres appels d'API selon ses conditions, n8n n'ajoutant rien par-dessus. Une génération longue reste une génération payée quelque part.
Comment authentifier le nœud ?
- 01
Ouvrir le menu Credentials
Dans n8n, un credential est un jeu d'identifiants enregistré une fois et réutilisé par tous les workflows qui en ont besoin. Passe par le menu Credentials pour créer le credential Hugging Face, plutôt que de saisir quoi que ce soit directement dans le nœud. La même entrée servira ensuite à toutes les chaînes que tu monteras, sur n8n Cloud comme sur une instance auto-hébergée.
- 02
Renseigner le credential Hugging Face
Suis les informations d'authentification que n8n documente pour Hugging Face, puis enregistre le credential sous un nom que tu reconnaîtras dans six mois. Un
huggingface-prodvaut mieux qu'uncredential 1quand trois personnes partagent l'instance et que deux d'entre elles débuguent la même exécution ratée. - 03
Sélectionner le credential sur le nœud
De retour sur le canvas, ouvre le nœud Hugging Face Inference Model et choisis le credential dans la liste en haut du panneau. Tire ensuite un lien du nœud vers le port Model d'un nœud racine. Un sous-nœud laissé non branché reste sagement là sans jamais s'exécuter, et c'est la première raison pour laquelle une chaîne annonce qu'elle ne trouve aucun modèle.
Sur quoi se branche ce nœud ?
n8n coupe le travail IA en deux : un nœud racine reçoit les items du workflow par son entrée principale, et des sous-nœuds viennent se poser sur ses ports, un type par port. Celui-ci est un sous-nœud avec une seule sortie, donc la seule question de câblage est de savoir quel nœud racine la récupère.
Sortie (où il se branche)
- Model
ai_languageModel
01Model
Le port Model, c'est l'endroit où un nœud racine réclame le modèle de langage auquel il doit parler. Tire le lien depuis ce nœud vers ce port et la chaîne cesse d'être une coquille vide.
Paramètres clés
- Required : un nœud racine doté d'un port Model ne produit rien tant qu'aucun sous-nœud de modèle n'y est raccordé.
- Basic LLM Chain : le nœud racine prompt et réponse, celui vers lequel la documentation officielle oriente pour ce modèle.
- Summarization Chain : prend une entrée longue et en renvoie une version condensée.
- Question and Answer Chain : répond à une question sur le contenu que tu lui donnes.
Quels paramètres comptent dans le panneau ?
Le nœud Hugging Face Inference Model compte 8 paramètres. Pour chacun : le nœud tel que tu le configures dans n8n, ce que le paramètre change, et nos notes de terrain.
Sommaire des paramètres
Model
modelCe que tu vois dans n8n
Notes & cas d'usage
Désigne le modèle qui génère la complétion. Tout le reste du panneau ne fait que sculpter son comportement, c'est donc le premier champ à remplir et celui qu'on change quand la qualité part dans le décor.
Paramètres clés
- Model : un champ texte qui porte l'identifiant du modèle ; fixe-le une fois pour un modèle unique, ou pilote-le par une expression
{{ $json.model }}quand un nœud précédent décide du modèle item par item.
Custom Inference Endpoint
options.endpointUrlCe que tu vois dans n8n
Notes & cas d'usage
Oriente le nœud vers une URL de point d'inférence personnalisée au lieu du service par défaut. Laisse le champ vide en usage courant, remplis-le seulement quand le modèle tourne sur une infrastructure que tu maîtrises.
Paramètres clés
- Custom Inference Endpoint : l'URL du point d'inférence personnalisé, saisie en clair ou récupérée d'un nœud précédent par
{{ $json.endpoint }}quand la recette et la production diffèrent.
Frequency Penalty
options.frequencyPenaltyCe que tu vois dans n8n
Notes & cas d'usage
Les valeurs positives pénalisent les nouveaux tokens en fonction de leur fréquence déjà présente dans le texte, ce qui réduit la probabilité que le modèle répète la même ligne mot pour mot. On y touche quand un texte généré se met à tourner en rond.
Paramètres clés
- Frequency Penalty : un nombre ; monte-le quand une réponse longue recycle sans arrêt les mêmes formules, laisse-le tranquille sur une sortie factuelle courte où la répétition ne menace personne.
Maximum Number of Tokens
options.maxTokensCe que tu vois dans n8n
Notes & cas d'usage
Plafonne le nombre de tokens utilisés par la complétion. Un token est un morceau de texte, à peu près un mot court ou un fragment de mot, et ce réglage décide si la réponse tient en une phrase ou en une page.
Paramètres clés
- Maximum Number of Tokens : un nombre borné par la longueur de contexte du modèle, qui vaut
2048tokens pour la plupart d'entre eux, les plus récents montant nettement plus haut.
Presence Penalty
options.presencePenaltyCe que tu vois dans n8n
Notes & cas d'usage
Ici la pénalité se déclenche dès qu'un token a été vu une fois, ce qui pousse le modèle à ouvrir des sujets nouveaux. Levier différent de Frequency Penalty : l'un combat la répétition, l'autre combat l'enfermement sur un seul sujet.
Paramètres clés
- Presence Penalty : un nombre ; monte-le quand une sortie de brainstorming tourne autour d'une seule idée, laisse-le au repos quand la consigne est de ne pas s'écarter du sujet.
Sampling Temperature
options.temperatureCe que tu vois dans n8n
Notes & cas d'usage
Contrôle le hasard. En la baissant, les complétions deviennent moins aléatoires, et quand la température approche de zéro le modèle devient déterministe et répétitif. C'est le premier paramètre à toucher quand un workflow a besoin de réponses reproductibles.
Paramètres clés
- Sampling Temperature : un nombre ; proche de
0pour du classement ou de l'extraction où la même entrée doit rendre la même sortie, plus haut quand il s'agit d'écrire du neuf.
Top K
options.topKCe que tu vois dans n8n
Notes & cas d'usage
Fixe le nombre de tokens candidats que le modèle considère dans l'opération d'échantillonnage pour créer le texte suivant. Rétrécir ce vivier maintient la sortie près de la suite la plus évidente.
Paramètres clés
- Top K : un nombre qui règle la taille de ce vivier de candidats ; une petite valeur serre la génération, une grande laisse revenir des tokens moins probables.
Top P
options.topPCe que tu vois dans n8n
Notes & cas d'usage
Règle la diversité par échantillonnage du noyau : 0.5 signifie que la moitié des options pondérées par leur vraisemblance sont prises en compte. La recommandation officielle est de modifier ce paramètre ou la température, mais pas les deux ensemble.
Paramètres clés
- Top P : un nombre ; baisse-le pour ignorer les options les moins probables, et tranche entre lui et Sampling Temperature au lieu de régler les deux en même temps.
Besoin d'aide pour automatiser Hugging Face Inference Model avec n8n ?
L'équipe te répond directement.
Chaque message est lu par une personne.
Les questions qui viennent ensuite
01Le nœud Hugging Face Inference Model n8n est-il gratuit ?
02Que faut-il pour que le nœud fonctionne ?
03Quelles sont les limites du nœud ?
04Que brancher au minimum, et par quel sous-nœud commencer ?
05n8n ou Make pour faire tourner des modèles ouverts ?
Reçois nos tips intégration chaque semaine.
Pas de spam. Désinscription à tout moment.


