- Inicio
- Recursos
- Integraciones
- NVIDIA Nemotron Chat Model
Nodo NVIDIA Nemotron Chat Model n8nConfigura NVIDIA Nemotron Chat Model en n8n.
Este nodo nunca trabaja solo, y así está pensado. El nodo NVIDIA Nemotron Chat Model n8n es un subnodo: se engancha a otro nodo más grande en lugar de ejecutarse por su cuenta. Expone 9 parámetros, desde la lista de modelos hasta los reintentos, y alimenta a cualquier nodo raíz que pida un modelo de lenguaje.
Reseñas verificadas en Trustpilot · Agencia de IA, automatización y growth
¿Para qué sirve el nodo NVIDIA Nemotron Chat Model n8n?
Le da a otro nodo su capacidad de generar texto. Solo en el lienzo no produce nada: no tiene entrada principal y nunca se ejecuta por sí mismo. Lo enganchas a un nodo raíz, un agente o una cadena, por el puerto llamado Model, siendo un puerto la toma donde un nodo raíz espera un subnodo. Desde ahí, cada respuesta la genera un modelo Nemotron alojado en build.nvidia.com o servido por un contenedor NIM en tu propia infraestructura.
Primer caso: calificar leads. Un formulario llega al workflow, un AI Agent lee el mensaje libre y decide si hay intención real de compra, y la redacción sale del modelo elegido en Model. Aquí Sampling Temperature baja cerca de cero. Una calificación que cambia en cada ejecución no sirve para nadie.
Segundo caso: resúmenes diarios. Al cierre del día, una cadena resume lo ocurrido y publica el texto en Slack para el equipo. Maximum Number of Tokens impide que el resumen se convierta en un informe que nadie lee, y Presence Penalty ayuda a que el modelo pase a otro tema en vez de insistir en el primero.
Tercer caso: datos estructurados. Un pedido llega en texto libre y la fila que hay que escribir en Google Sheets necesita campos limpios. Pon Response Format en json_object, pide JSON de forma explícita en el prompt de la cadena, y el nodo siguiente lee el resultado con una expresión como {{ $json.importe }}, la sintaxis de n8n que saca un campo del item entrante.
¿Cuándo conviene otra cosa? Este nodo solo habla con modelos Nemotron, a través de un endpoint compatible con la especificación OpenAI. Si tus claves están en otro proveedor, el subnodo equivalente hace el mismo trabajo en el mismo puerto: Google Gemini se desconecta y se reconecta arrastrando una conexión. Quedarte en Nemotron tiene sentido cuando quieres el mismo modelo disponible en la nube y dentro de un contenedor NIM que controlas tú.
Conviene conocer los límites antes de montar nada. Sin entrada principal no hay forma de dispararlo. n8n carga la lista de modelos desde el endpoint configurado en tu credential, ese juego de credenciales que se guarda una vez en n8n, y recurre a una lista reducida de identificadores Nemotron conocidos cuando no consigue alcanzar ese endpoint. NVIDIA factura sus propias llamadas de API según sus condiciones y n8n no añade nada encima. Si la duda sigue siendo la plataforma y no el nodo, la Reseña n8n entra en ese tema.
¿Cómo se conecta el credential de NVIDIA en n8n?
- 01
Abre una cuenta en NVIDIA build
El acceso en la nube empieza con una cuenta en build.nvidia.com. Abre un modelo Nemotron del catálogo, pulsa Get API Key y copia la clave en ese momento. Un único credential cubre los dos modos de despliegue, así que esta es también la cuenta que conservas si más adelante mueves parte del tráfico a tu propia máquina. En n8n todavía no se instala nada.
- 02
Crea el credential en n8n
En el menú Credentials, crea un credential NVIDIA Nemotron. Dos campos importan. Base URL es el endpoint compatible con la especificación OpenAI al que se llama, y el valor por defecto
https://integrate.api.nvidia.com/v1apunta a build.nvidia.com. En API Key va la clave que acabas de copiar. Guardado una vez, el credential se reutiliza en todos los workflows de la instancia. - 03
Apunta a un NIM autoalojado
Si ejecutas un NVIDIA Inference Microservice en tu infraestructura, cambia una sola cosa: sustituye Base URL por la dirección de tu NIM, incluida la ruta
/v1, por ejemplohttp://localhost:8000/v1. Si ese NIM exige autenticación, pega su token en API Key. Si no la exige, deja el campo vacío. Aquí está permitido, y es lo bastante raro como para decirlo.
¿Dónde se engancha este subnodo?
n8n reparte el trabajo de IA entre un nodo raíz, que recibe los items del workflow, y subnodos enganchados a sus puertos, un tipo de subnodo por puerto. Este es un subnodo y tiene una sola conexión de salida.
Salida (dónde se conecta)
- Model
ai_languageModel
01Model
Es el puerto del modelo de lenguaje, la toma que un nodo raíz expone cuando necesita generar texto. Arrastras ahí el nodo Nemotron y el nodo raíz ya sabe de dónde salen sus respuestas.
Parámetros clave
- Required: un nodo raíz sin modelo de chat en este puerto sencillamente no se ejecuta.
- AI Agent y AI Agent Tool: el punto de partida habitual, un agente que decide y actúa.
- Basic LLM Chain: un prompt, una respuesta, sin llamadas a herramientas por medio.
- Text Classifier e Information Extractor: nodos raíz más acotados, para clasificar un item o sacarle campos.
¿Qué se configura en el nodo?
El nodo NVIDIA Nemotron Chat Model tiene 9 parámetros. Para cada uno: el nodo tal como lo configuras en n8n, qué cambia el parámetro y nuestras notas de campo.
Índice de parámetros
Model
modelLo que ves en n8n
Notas y casos de uso
Elige el modelo Nemotron que genera la respuesta. n8n carga la lista de forma dinámica desde el endpoint configurado en el credential y recurre a una lista reducida de identificadores Nemotron conocidos cuando ese endpoint no responde.
Parámetros clave
- Model: el desplegable, desde el pequeño
nvidia/nvidia-nemotron-nano-9b-v2hastanvidia/nemotron-3-super-120b-a12b, con variantes de razonamiento y de visión por medio, comonvidia/nemotron-nano-12b-v2-vl.
Frequency Penalty
options.frequencyPenaltyLo que ves en n8n
Notas y casos de uso
Actúa sobre la tendencia del modelo a repetirse. Los valores positivos penalizan los tokens, esos fragmentos de palabra con los que trabaja el modelo, según la frecuencia con la que ya aparecieron en el texto, así que cuanto más subes menos se repite la misma línea palabra por palabra.
Parámetros clave
- Frequency Penalty: un número que se sube cuando el texto generado da vueltas sobre las mismas fórmulas.
Maximum Number of Tokens
options.maxTokensLo que ves en n8n
Notas y casos de uso
Limita la longitud de la respuesta. El valor se cuenta en tokens, no en caracteres, y -1 deja que el modelo aplique su valor por defecto.
Parámetros clave
- Maximum Number of Tokens: déjalo en
-1mientras ningún nodo posterior imponga un tamaño.
Response Format
options.responseFormatLo que ves en n8n
Notas y casos de uso
Decide si el nodo devuelve prosa o datos que se puedan leer. El modo JSON garantiza que el mensaje generado sea JSON válido.
Parámetros clave
- Text (
text): una respuesta de texto normal, el comportamiento por defecto. - JSON (
json_object): JSON válido, con una condición, la palabrajsontiene que aparecer en el prompt de la cadena o del agente de arriba.
Presence Penalty
options.presencePenaltyLo que ves en n8n
Notas y casos de uso
Empuja al modelo hacia temas nuevos. Los valores positivos penalizan los tokens que ya aparecieron, sin importar cuántas veces, lo que aumenta la probabilidad de que la respuesta avance en vez de girar sobre el mismo punto.
Parámetros clave
- Presence Penalty: súbelo para explorar, mantenlo bajo cuando la respuesta debe quedarse en un solo tema.
Sampling Temperature
options.temperatureLo que ves en n8n
Notas y casos de uso
Fija cuánta aleatoriedad tiene el muestreo. Cerca de cero el modelo se vuelve determinista y repetitivo; más arriba la generación se diversifica y crece el riesgo de alucinaciones.
Parámetros clave
- Sampling Temperature: la opción más útil del nodo y la primera que hay que mirar cuando la calidad baila entre ejecuciones.
Timeout
options.timeoutLo que ves en n8n
Notas y casos de uso
Define el tiempo máximo que puede durar una petición, en milisegundos. Pasado ese margen, la petición se abandona en lugar de quedarse colgada.
Parámetros clave
- Timeout: un número en milisegundos, así que
2000son dos segundos, no dos mil.
Max Retries
options.maxRetriesLo que ves en n8n
Notas y casos de uso
Indica cuántas veces reintenta n8n una petición antes de darla por perdida.
Parámetros clave
- Max Retries: el número de intentos por petición, a subir en un endpoint compartido y a bajar cuando un fallo debe verse rápido.
Top P
options.topPLo que ves en n8n
Notas y casos de uso
Regula la diversidad mediante muestreo nucleus. Con 0.5 se consideran la mitad de las opciones ponderadas por probabilidad: cuanto más bajas el valor, más ignora el modelo sus opciones menos probables.
Parámetros clave
- Top P: la masa de probabilidad de la que la generación puede tirar.
¿Necesitas ayuda para automatizar NVIDIA Nemotron Chat Model con n8n?
El equipo te responde directamente.
Cada mensaje lo lee una persona.
Lo que se pregunta antes de montar el flujo
01¿El nodo NVIDIA Nemotron Chat Model n8n viene incluido en n8n?
02¿Qué hace falta para que funcione?
03¿Qué límites tiene el nodo?
04¿Qué hay que conectar como mínimo y por dónde empezar?
05¿n8n o Make para ejecutar Nemotron?
Recibe nuestros tips de integración cada semana.
Sin spam. Cancela cuando quieras.
