- Inicio
- Recursos
- Integraciones
- Hugging Face Inference Model
Nodo Hugging Face Inference Model n8nConfigura Hugging Face Inference Model en n8n.
Un modelo abierto entra en el flujo en cuanto queda enganchado a una cadena. El nodo Hugging Face Inference Model n8n reúne 8 parámetros, desde el nombre del modelo hasta Top P, y no tiene entrada principal. Alimenta de texto generado al nodo raíz que lleva el puerto Model.
Reseñas verificadas en Trustpilot · Agencia de IA, automatización y growth
¿Qué hace el nodo Hugging Face Inference Model n8n?
Es un subnodo, es decir, un nodo que nunca se ejecuta por su cuenta y no sirve de nada hasta que se engancha al puerto de otro más grande. Lo colocas en el lienzo, lo unes al puerto Model de una cadena y cada prompt que esa cadena envía viaja a un punto de inferencia de Hugging Face en lugar de a un modelo comercial alojado. El nodo guarda la elección del modelo y los ajustes de muestreo. La cadena de arriba guarda el prompt.
Primer caso: resumir texto libre. Llega una fila de Google Sheets con un comentario de cliente interminable, la cadena pide tres líneas de resumen y el nodo las devuelve con Maximum Number of Tokens ajustado a la baja para que la respuesta no se alargue. Todo corre sobre un modelo que has elegido tú, no sobre el que venía puesto.
Segundo caso: clasificar antes de repartir. Los mensajes de soporte entran por Gmail, la cadena pide al modelo una etiqueta para cada uno y Sampling Temperature se queda cerca de cero para que el mismo mensaje reciba la misma etiqueta dos veces seguidas. Esa etiqueta decide después si el flujo avisa por Slack o escribe en la hoja.
Tercer caso: redactar contra un punto de inferencia propio. Un equipo que ha afinado su modelo apunta Custom Inference Endpoint a ese despliegue, no toca nada más y obtiene borradores con el vocabulario de su propio corpus. El resto del flujo sigue igual.
¿Cuándo conviene otra cosa? Este nodo no admite herramientas, así que no funciona con el nodo AI Agent. Un agente que necesita llamar a herramientas pide un modelo de chat que las soporte, y para eso están los nodos de OpenAI o de Anthropic. Aquí la documentación manda a Basic LLM Chain, y este nodo se queda en trabajo de completado.
Dos límites antes de montar nada. El nodo está en versión 1, así que el panel que ves es el que se describe en esta página, sin opciones escondidas. Y el proveedor del modelo factura sus propias llamadas de API según sus condiciones, sin que n8n añada nada encima. Una generación larga se paga igual en algún sitio.
¿Cómo se autentica el nodo?
- 01
Abrir el menú Credentials
En n8n, un credential es un juego de datos de autenticación guardado una sola vez y reutilizado por todos los flujos que lo necesiten. Entra por el menú Credentials para crear el credential de Hugging Face, en vez de escribir nada dentro del propio nodo. Esa misma entrada servirá para todas las cadenas que montes después, tanto en n8n Cloud como en una instancia autoalojada.
- 02
Rellenar el credential de Hugging Face
Sigue los datos de autenticación que n8n documenta para Hugging Face y guarda el credential con un nombre que reconozcas dentro de seis meses. Un
huggingface-prodfunciona mejor que uncredential 1cuando tres personas comparten la instancia y dos están mirando la misma ejecución fallida. - 03
Seleccionar el credential en el nodo
De vuelta al lienzo, abre el nodo Hugging Face Inference Model y elige el credential en la lista de arriba del panel. Después arrastra una conexión del nodo al puerto Model de un nodo raíz. Un subnodo sin conectar se queda ahí sin ejecutarse nunca, y ese es el motivo número uno por el que una cadena avisa de que no encuentra ningún modelo.
¿Dónde se engancha este nodo?
n8n parte el trabajo de IA en dos: un nodo raíz recibe los items del flujo por su entrada principal y los subnodos se cuelgan de sus puertos, un tipo por puerto. Este es un subnodo con una única salida, así que la única duda de cableado es qué nodo raíz la recoge.
Salida (dónde se conecta)
- Model
ai_languageModel
01Model
El puerto Model es el punto donde un nodo raíz reclama el modelo de lenguaje con el que va a hablar. Arrastra desde este nodo hasta ese puerto y la cadena deja de ser una cáscara vacía.
Parámetros clave
- Required: un nodo raíz con puerto Model no devuelve nada mientras no tenga un subnodo de modelo enganchado.
- Basic LLM Chain: el nodo raíz de prompt y respuesta, el que la documentación oficial recomienda para este modelo.
- Summarization Chain: recibe una entrada larga y devuelve una versión condensada.
- Question and Answer Chain: responde a una pregunta sobre el contenido que le pasas.
¿Qué parámetros importan en el panel?
El nodo Hugging Face Inference Model tiene 8 parámetros. Para cada uno: el nodo tal como lo configuras en n8n, qué cambia el parámetro y nuestras notas de campo.
Índice de parámetros
Model
modelLo que ves en n8n
Notas y casos de uso
Indica el modelo que genera el completado. Lo demás del panel solo moldea su comportamiento, así que este es el primer campo que se rellena y el que se cambia cuando la calidad se tuerce.
Parámetros clave
- Model: un campo de texto con el identificador del modelo; déjalo fijo para un modelo único, o gobiérnalo con una expresión
{{ $json.model }}cuando un nodo anterior decida el modelo item por item.
Custom Inference Endpoint
options.endpointUrlLo que ves en n8n
Notas y casos de uso
Dirige el nodo a una URL de inferencia propia en lugar del servicio por defecto. Déjalo vacío en el uso normal y rellénalo solo cuando el modelo viva en una infraestructura que controlas.
Parámetros clave
- Custom Inference Endpoint: la URL del punto de inferencia personalizado, escrita entera o traída de un nodo anterior con
{{ $json.endpoint }}cuando pruebas y producción no apuntan al mismo sitio.
Frequency Penalty
options.frequencyPenaltyLo que ves en n8n
Notas y casos de uso
Los valores positivos penalizan los tokens nuevos según la frecuencia con la que ya aparecen en el texto, lo que reduce la probabilidad de que el modelo repita la misma línea palabra por palabra. Se toca cuando un texto generado empieza a dar vueltas sobre sí mismo.
Parámetros clave
- Frequency Penalty: un número; súbelo cuando una respuesta larga recicle las mismas fórmulas, y déjalo quieto en salidas cortas y factuales donde la repetición no molesta.
Maximum Number of Tokens
options.maxTokensLo que ves en n8n
Notas y casos de uso
Pone un techo a los tokens que puede usar el completado. Un token es un trozo de texto, más o menos una palabra corta o un fragmento, y este ajuste decide si la respuesta cabe en una frase o en una página.
Parámetros clave
- Maximum Number of Tokens: un número limitado por la longitud de contexto del modelo, que en la mayoría es de
2048tokens, con los más recientes bastante por encima.
Presence Penalty
options.presencePenaltyLo que ves en n8n
Notas y casos de uso
Aquí la penalización salta en cuanto un token ha aparecido una vez, lo que empuja al modelo a abrir temas nuevos. Palanca distinta de Frequency Penalty: aquella pelea contra la repetición, esta contra quedarse clavado en un solo tema.
Parámetros clave
- Presence Penalty: un número; súbelo cuando una lluvia de ideas gire siempre alrededor de la misma, y déjalo en reposo cuando la consigna sea no salirse del tema.
Sampling Temperature
options.temperatureLo que ves en n8n
Notas y casos de uso
Controla el azar. Bajarla produce completados menos aleatorios, y cuando la temperatura se acerca a cero el modelo se vuelve determinista y repetitivo. Es el primer parámetro que se toca cuando un flujo necesita respuestas reproducibles.
Parámetros clave
- Sampling Temperature: un número; cerca de
0para clasificar o extraer, donde la misma entrada debe dar la misma salida, y más alto cuando toca escribir algo nuevo.
Top K
options.topKLo que ves en n8n
Notas y casos de uso
Fija cuántos tokens candidatos considera el modelo dentro de la operación de muestreo para crear el texto siguiente. Estrechar ese grupo mantiene la salida pegada a la continuación más previsible.
Parámetros clave
- Top K: un número que marca el tamaño de ese grupo de candidatos; un valor pequeño aprieta la generación, uno grande deja volver a los tokens menos probables.
Top P
options.topPLo que ves en n8n
Notas y casos de uso
Regula la diversidad mediante muestreo de núcleo: 0.5 significa que se consideran la mitad de las opciones ponderadas por probabilidad. La recomendación oficial es tocar este parámetro o la temperatura, pero no los dos a la vez.
Parámetros clave
- Top P: un número; bájalo para ignorar las opciones menos probables, y elige entre él y Sampling Temperature en lugar de ajustar ambos.
¿Necesitas ayuda para automatizar Hugging Face Inference Model con n8n?
El equipo te responde directamente.
Cada mensaje lo lee una persona.
Lo que se pregunta después
01¿El nodo Hugging Face Inference Model n8n es gratuito?
02¿Qué hace falta para que el nodo funcione?
03¿Qué límites tiene este nodo?
04¿Qué hay que conectar como mínimo y por qué subnodo empezar?
05¿n8n o Make para trabajar con modelos abiertos?
Recibe nuestros tips de integración cada semana.
Sin spam. Cancela cuando quieras.


