Guía - NCA-GENL NVIDIA-Certified Associate: Generative AI LLMs
Última revisión: junio de 2026
Una referencia escaneable de patrones arquitectónicos que evalúa el examen NCA-GENL. Lee de arriba a abajo o salta a una sección.
Conocimientos fundamentales de Machine Learning e IA
Explique qué permite a un transformer ponderar tokens distantes al generar el siguiente.
Auto-atención. Cada token atiende a todos los demás tokens a través de proyecciones de query/key/value, produciendo representaciones ponderadas por el contexto.
Por qué: La atención, no la recurrencia, es lo que proporciona a los transformers un contexto de largo alcance y un entrenamiento paralelizable.
Elija cómo inyectar nuevos conocimientos o comportamientos en un LLM.
Hechos nuevos que cambian a menudo → RAG. Nuevo comportamiento/estilo de tarea → fine-tune. Nueva capacidad/vocabulario base a escala → pre-training continuado.
Por qué: RAG mantiene los datos externos y actualizables; el fine-tuning incorpora el comportamiento en los pesos; el pre-training es la palanca más cara.
Defina qué convierte un modelo en un foundation model.
Un modelo grande pre-entrenado con datos amplios, en su mayoría no etiquetados, adaptable a muchas tareas posteriores mediante prompting, RAG o fine-tuning.
Estime cómo el texto se asigna a las unidades de entrada del modelo y qué impulsa el costo.
El texto se divide en sub-word tokens mediante un tokenizer (por ejemplo, BPE). El costo y los límites de contexto se miden en tokens, no en caracteres o palabras.
Por qué: Las palabras raras o no inglesas se dividen en más tokens, inflando el uso del contexto y el costo de inferencia.
Un documento largo no cabe en un solo prompt.
La entrada excede la context window del modelo (tokens máximos para entrada + salida). Divida el documento para RAG o elija un modelo con un contexto más largo.
Por qué: La context window es un límite estricto; todo lo que está más allá se trunca y se pierde silenciosamente.
Potenciar la semantic search o la recuperación de RAG sobre texto.
Utilice un embedding model para convertir texto en vectores densos, luego recupere por similitud de coseno/producto escalar de un vector store.
Por qué: Los embeddings colocan texto semánticamente similar cerca uno del otro, lo que permite una recuperación basada en el significado en lugar de la recuperación por palabras clave.
Elija el comportamiento de salida: determinista vs. creativo.
Temperatura baja (~0.0-0.3) → enfocada, repetible. Temperatura alta (~0.7-1.0) → diversa, creativa. Use cerca de 0 para clasificación o extracción.
Por qué: La temperatura escala la distribución de probabilidad antes del muestreo; los valores más bajos concentran la masa en los tokens superiores.
Restrinja el conjunto de tokens candidatos más allá de la temperatura.
Top-k mantiene los k tokens más probables; top-p (núcleo) mantiene el conjunto más pequeño cuya probabilidad acumulada alcanza p.
Por qué: Top-p adapta el conjunto de candidatos a la forma de la distribución; top-k tiene un ancho fijo independientemente de la confianza.
Identifique cómo los LLMs aprenden de texto sin etiquetar.
Aprendizaje auto-supervisado - la predicción del siguiente token (causal) o del token enmascarado crea etiquetas a partir del propio texto, sin anotación humana.
Por qué: Es lo que permite a los LLMs entrenar en corpora a escala de internet sin etiquetado manual.
Asigne la arquitectura a la familia de tareas.
Generación → solo decodificador (estilo GPT). Comprensión/clasificación → solo codificador (estilo BERT). Traducción/resumen de secuencia a secuencia → codificador-decodificador (estilo T5).
Por qué: Los modelos solo de decodificador predicen de izquierda a derecha; los codificadores ven el contexto bidireccional, mejor para tareas de representación.
Haga que un modelo base siga instrucciones y prefiera respuestas útiles y seguras.
Ajuste de instrucciones seguido de alineación como RLHF - aprendizaje por refuerzo a partir de clasificaciones de preferencias humanas.
Por qué: Un modelo pre-entrenado en bruto predice texto; la alineación lo dirige hacia el comportamiento de asistente deseado.
El modelo afirma hechos con confianza pero fabricados.
Alucinación. Mitigue fundamentando con RAG, bajando la temperatura, citando fuentes y añadiendo guardrails más revisión humana para salidas de alto riesgo.
Por qué: Los LLMs predicen tokens plausibles, no hechos verificados; la fundamentación proporciona la evidencia que falta.
Distinga el tamaño del modelo del tamaño de los datos de entrenamiento.
Parámetros = pesos aprendidos (capacidad del modelo). Tokens = volumen de texto de entrenamiento. Ambos escalan la capacidad bajo las leyes de escalado.
Por qué: Un modelo más grande sub-entrenado con muy pocos tokens rinde menos que uno más pequeño y bien entrenado (conocimiento de Chinchilla).
Separe las dos fases intensivas en GPU del ciclo de vida de un LLM.
El entrenamiento actualiza los pesos a partir de los datos (una sola vez, por lotes). La inferencia ejecuta el modelo congelado para generar salidas (continua, sensible a la latencia).
Por qué: Las herramientas de optimización difieren: el entrenamiento utiliza frameworks de paralelismo; la inferencia utiliza TensorRT-LLM y Triton.
Un modelo fine-tuned memoriza ejemplos de entrenamiento y falla en nuevas entradas.
Overfitting. Mitigue con más/diversidad de datos, early stopping, menor tasa de aprendizaje, menos épocas o regularización como dropout.
Por qué: Una gran brecha entre entrenamiento y validación significa que el modelo ajustó el ruido en lugar de patrones generalizables.
Desarrollo de software
Despliegue rápidamente un LLM optimizado como microservicio de producción con una API compatible con OpenAI.
Utilice un microservicio NVIDIA NIM - un endpoint de modelo preconstruido, contenedorizado y optimizado para TensorRT-LLM.
Por qué: NIM empaqueta el modelo, el runtime y el motor optimizado, lo que le permite omitir el cableado manual de TensorRT-LLM y Triton.
Por qué: Las métricas de superposición léxica omiten el significado; para una calidad matizada, se necesita evaluación humana o con modelo-juez.
RAG recupera contexto irrelevante o demasiado escaso.
Ajuste el tamaño/solapamiento de los chunks, top-k, el embedding model, y añada re-ranking; verifique la calidad de la recuperación por separado de la generación.
Por qué: La mayoría de los fallos de RAG son fallos de recuperación; arregle la recuperación antes de culpar al generador.
Decida cuál de dos variantes de prompt funciona mejor.
Ejecute ambas contra un conjunto de evaluación fijo y compare las métricas; itere sobre datos y prompts, no solo sobre el modelo.
Por qué: La comparación controlada con las mismas entradas aísla el efecto del cambio de prompt.
Después de hacer fine-tuning en una tarea específica, el modelo pierde la capacidad general.
Catastrophic forgetting. Mitigue con PEFT/LoRA, LR más baja, menos épocas o mezclando datos generales en el conjunto de fine-tuning.
Por qué: El ajuste basado en adaptadores preserva los pesos base, limitando la desviación de las capacidades originales.
Análisis de datos
Cure un gran corpus web/texto para el entrenamiento de LLM a escala de GPU.
NVIDIA NeMo Curator - limpieza, deduplicación, filtrado de calidad y manejo de PII acelerados por GPU para datos de entrenamiento.
Por qué: La calidad de los datos impulsa la calidad del modelo; Curator escala la curación que sería inviable en CPU.
El corpus de entrenamiento contiene muchos documentos casi duplicados.
Desduplique (exacta y difusa/casi duplicada) antes del entrenamiento.
Por qué: Los duplicados desperdician cómputo, sesgan el modelo hacia contenido repetido y conllevan riesgo de memorización/fuga.
Divida documentos para la recuperación de RAG.
Divida en pasajes semánticamente coherentes con un solapamiento modesto; dimensione según el embedding model y el presupuesto de contexto.
Por qué: Los chunks demasiado grandes diluyen la relevancia; los chunks pequeños pierden contexto. El solapamiento preserva el significado de los límites.
El texto raspado en bruto es ruidoso, con contenido repetitivo, tóxico o de baja calidad.
Aplique filtros de calidad y toxicidad, identificación de idioma y heurísticas para descartar documentos de bajo valor.
Por qué: La entrada de mala calidad degrada el modelo; el filtrado mejora la calidad posterior más que añadir volumen en bruto.
Prepare una colección de documentos para la recuperación semántica.
Genere embeddings para cada chunk con un embedding model consistente y almacénelos en un índice vectorial.
Por qué: Los embeddings de consulta y documento deben provenir del mismo modelo para ser comparables.
Verifique si un conjunto de entrenamiento subrepresenta grupos o temas.
Analice la distribución entre clases, fuentes y datos demográficos; reequilibre o aumente las brechas antes del entrenamiento.
Por qué: Los datos de entrenamiento sesgados producen un comportamiento de modelo sesgado; la solución pertenece a la capa de datos.
Los datos de entrenamiento o RAG pueden contener información personal.
Detecte y redacte/mascare PII durante la preparación de datos antes de que llegue a los pesos del modelo o al índice.
Por qué: El conocimiento incorporado en los pesos no puede enmascararse de forma confiable en la inferencia; elimine la PII en la etapa anterior.
IA confiable
Mantenga una aplicación LLM en el tema, bloquee contenido inseguro y prevenga jailbreaks.
NVIDIA NeMo Guardrails - rails programables para control de temas, filtrado de seguridad y flujo de diálogo.
Por qué: Los guardrails aplican políticas en las entradas y salidas independientemente del modelo subyacente.
Reduzca las respuestas confiadas pero erróneas en un asistente desplegado.
Fundamente las respuestas con RAG, requiera citas, añada rails de verificación de hechos y mantenga a los humanos en el bucle para resultados de alto riesgo.
Por qué: La fundamentación proporciona evidencia verificable que el modelo de otro modo inventaría.
La entrada del usuario intenta anular el system prompt o exfiltrar datos.
Defensa en profundidad: guardrails, filtrado de entrada/salida, aislamiento de instrucciones y permisos de herramientas con el menor privilegio para agents.
Por qué: Ningún control único detiene la inyección; combine el filtrado con capacidades limitadas.
Un modelo desplegado produce salidas sesgadas o injustas para ciertos grupos.
Audite las salidas en busca de sesgos, reequilibre/aumente los datos de entrenamiento y añada verificaciones de equidad a la evaluación.
Por qué: El sesgo generalmente se origina en los datos; mídelo y corríjalo antes y después del despliegue.
Los prompts y las respuestas no deben salir del control de la organización.
Autohospede con NIM/Triton en infraestructura propia, cifre los datos y evite enviar contenido sensible a APIs de terceros.
Por qué: El despliegue on-prem o VPC mantiene los datos confidenciales dentro del límite de confianza.