Cómo se entrenan los modelos de IA: aprendizaje supervisado, no supervisado, por refuerzo, por transferencia y más
Una guía en lenguaje sencillo sobre cómo se entrenan los modelos de IA y ML - los paradigmas de aprendizaje (supervisado, no supervisado, semisupervisado, autosupervisado, por refuerzo), cómo se adaptan los foundation models (prompting, RAG, fine-tuning, aprendizaje por transferencia), además de la evaluación, el sobreajuste y los conceptos que evalúan los exámenes fundamentales de IA como el AIF-C01.
Pregúntale a diez personas "¿cómo se entrena un modelo de IA?" y obtendrás diez respuestas distintas, porque no existe un único método. El correcto depende de dos preguntas: qué datos tienes y si estás construyendo un modelo desde cero o adaptando uno que ya existe. Si tienes claras esas dos, todo el zoológico de términos - supervisado, no supervisado, por refuerzo, aprendizaje por transferencia, fine-tuning, RAG, RLHF - encaja en un mapa sencillo.
Esta guía recorre ese mapa de principio a fin. Es neutral respecto al proveedor (los conceptos son los mismos en AWS, Azure, Google Cloud y en cualquier otro sitio), pero está escrita pensando en las certificaciones fundamentales de IA - el AWS AI Practitioner (AIF-C01), Azure AI Fundamentals, Google Cloud Generative AI Leader y sus equivalentes evalúan exactamente estas ideas. Donde un examen se apoya en un concepto de una manera particular, hay una nota "En el examen". Es larga; trátala como una referencia que ojeas por secciones.
Las dos preguntas que lo organizan todo
Hay dos sentidos distintos de "entrenamiento" que la gente mezcla:
- Cómo aprende un modelo a partir de los datos - el paradigma de aprendizaje. Se trata de la forma de tus datos (¿etiquetados? ¿sin etiquetar? ¿una señal de recompensa?) y determina qué familia de algoritmos aplica. Aquí viven el aprendizaje supervisado, no supervisado, semisupervisado, autosupervisado y por refuerzo.
- Cómo adaptas un modelo existente - la escalera de personalización. La IA moderna rara vez parte de cero. Tomas un foundation model preentrenado y lo adaptas, desde un ajuste barato del prompt hasta un reentrenamiento costoso. Aquí viven el prompt engineering, RAG, el fine-tuning y el pre-entrenamiento continuo.
Mantén los dos sentidos separados. El primero es "¿qué tipo de problema de aprendizaje es este?". El segundo es "dado un modelo que ya existe, ¿cuánto lo cambio?". La mayoría de las preguntas de examen en realidad preguntan en qué casilla cae un escenario.
Parte 1: Los paradigmas de aprendizaje
Aprendizaje supervisado
Qué. El modelo aprende de ejemplos etiquetados - la entrada emparejada con la respuesta correcta. Le muestras miles de correos marcados como spam o no-spam, y aprende la correspondencia del correo a la etiqueta.
Por qué. Cuando tienes datos etiquetados y un objetivo claro que predecir, este es el enfoque más directo y preciso. Impulsa la mayor parte del ML clásico en producción.
Cómo. Dos subtipos según lo que predices:
- Clasificación - predecir una categoría (spam o no, cuál de 20 tipos de enfermedad, fraude o legítimo).
- Regresión - predecir un número continuo (precio de una vivienda, demanda de mañana, ingresos esperados).
Divides tus datos etiquetados, entrenas el modelo para minimizar el error frente a las respuestas conocidas y mides qué tan bien predice ejemplos reservados.
En el examen. La frase clave es "datos etiquetados". Si un escenario te entrega entradas con salidas correctas conocidas y te pide predecir una categoría o un valor, es aprendizaje supervisado. Clasificación frente a regresión se decide según si la respuesta es una clase o un número.
Aprendizaje no supervisado
Qué. El modelo aprende de datos sin etiquetar - no se proporcionan respuestas correctas. Encuentra la estructura por su cuenta.
Por qué. La mayoría de los datos del mundo real no están etiquetados, y etiquetar es costoso. Cuando quieres descubrir patrones en lugar de predecir un objetivo conocido, esta es la herramienta.
Cómo. Las tareas principales:
- Clustering - agrupar elementos similares (segmentación de clientes, agrupar documentos por tema).
- Reducción de dimensionalidad - comprimir muchas características en unas pocas conservando la señal (para visualización o para acelerar modelos posteriores).
- Detección de anomalías - señalar puntos que no encajan en el patrón aprendido (fraude, intrusión, piezas defectuosas).
En el examen. El disparador es "datos sin etiquetar" más un objetivo como "segmentar", "agrupar" o "encontrar lo inusual". El clustering para segmentación de clientes es el ejemplo de aprendizaje no supervisado más común que verás.
Aprendizaje semisupervisado
Qué. Un punto intermedio: una pequeña cantidad de datos etiquetados más un gran conjunto de datos sin etiquetar.
Por qué. Etiquetar es costoso; a menudo solo puedes permitirte etiquetar una fracción. El aprendizaje semisupervisado usa las pocas etiquetas para guiar el aprendizaje sobre el conjunto sin etiquetar, mucho mayor, obteniendo mejores resultados de los que permitirían las etiquetas por sí solas.
Cómo. Patrón típico: entrenar con el subconjunto etiquetado, usar ese modelo para etiquetar los datos sin etiquetar (pseudoetiquetado) y luego reentrenar con el conjunto combinado. Reduce el costo de anotación y puede mejorar la generalización.
Aprendizaje autosupervisado
Qué. El modelo crea sus propias etiquetas a partir de los datos en bruto, por lo que no se necesita etiquetado humano. El ejemplo clásico: ocultar la siguiente palabra de una frase y entrenar al modelo para predecirla.
Por qué. Así es como se preentrenan los foundation models y los grandes modelos de lenguaje modernos. Hay muchísimo más texto, imágenes y código en bruto en internet de lo que nadie podría etiquetar jamás, y la predicción del siguiente token (o del token enmascarado) convierte todo eso en señal de entrenamiento.
Cómo. El modelo se entrena para completar o predecir partes de su propia entrada sobre conjuntos de datos enormes. El resultado es un modelo base con amplio conocimiento general - fluido, pero aún no alineado para seguir instrucciones o coincidir con las preferencias humanas.
En el examen. Puede que no veas "autosupervisado" nombrado a menudo, pero debes saber que un foundation model es un modelo grande preentrenado con datos masivos y en su mayoría sin etiquetar, y que ese pre-entrenamiento es lo que lo hace adaptable a muchas tareas posteriores.
Aprendizaje por refuerzo (y RLHF)
Qué. Un agente aprende interactuando con un entorno: realiza una acción, recibe una recompensa o penalización y se ajusta para maximizar la recompensa a largo plazo. No hay una clave de respuestas etiquetada - solo retroalimentación sobre qué tan buena fue una acción.
Por qué. Encaja en problemas de decisión secuencial donde la jugada "correcta" no se conoce de antemano: juegos, robótica, recomendación, sistemas de control.
Cómo. El agente observa un estado, elige una acción, recibe una recompensa, pasa a un nuevo estado y repite - aprendiendo gradualmente una política (una estrategia) que gana la mayor recompensa a lo largo del tiempo.
RLHF (aprendizaje por refuerzo a partir de retroalimentación humana) es la aplicación estrella. Después de que un modelo de lenguaje se preentrena, los humanos clasifican sus salidas; esas clasificaciones entrenan un modelo de recompensa; luego el aprendizaje por refuerzo ajusta el modelo de lenguaje para producir salidas que el modelo de recompensa puntúa alto. Esta es una razón importante de que los asistentes de chat modernos sean útiles y estén alineados en lugar de solo fluidos.
En el examen. El disparador es "aprende de la retroalimentación / recompensas / ensayo y error". Un chatbot que mejora al ser recompensado por buenas respuestas es aprendizaje por refuerzo. Debes saber que RLHF es cómo se alinean los LLM con las preferencias humanas.
Parte 2: El ciclo de vida del ML
El entrenamiento es un paso dentro de un bucle, no todo el proceso. El ciclo de vida estándar:
- Enmarcar el problema - qué estás prediciendo y ¿es el ML siquiera la herramienta adecuada? (A veces una regla simple supera a un modelo.)
- Recopilar y preparar los datos - reunir, limpiar y etiquetar si hace falta.
- Análisis exploratorio de datos (EDA) - inspeccionar distribuciones, correlaciones y calidad antes de modelar.
- Feature engineering - usar el conocimiento del dominio para crear o transformar variables de entrada que faciliten el aprendizaje de patrones.
- Entrenar - ajustar el modelo con los datos de entrenamiento.
- Evaluar - medir el rendimiento sobre datos que el modelo no ha visto.
- Desplegar - poner el modelo a disposición para predicciones (esto se llama inferencia).
- Monitorear - vigilar la deriva y la degradación, y reentrenar cuando haga falta.
División en entrenamiento, validación y prueba. Nunca juzgas un modelo con los datos con los que se entrenó. Divide los datos: el conjunto de entrenamiento ajusta el modelo, el conjunto de validación afina la configuración y compara candidatos, y el conjunto de prueba da una estimación final y honesta con datos que no se usaron en ningún otro sitio. Una división común es algo como 80/20, con la porción de entrenamiento dividida de nuevo para validación.
En el examen. Debes saber que la inferencia es usar un modelo entrenado sobre datos nuevos (en contraste con el entrenamiento), y que el feature engineering significa crear mejores entradas a partir de datos en bruto usando el conocimiento del dominio.
Parte 3: Ajuste y generalización
Todo el juego es la generalización - rendir bien con datos nuevos, no solo con los de entrenamiento.
- Sobreajuste - el modelo memoriza los datos de entrenamiento (incluido su ruido) y falla con datos nuevos. Síntoma: alta precisión en entrenamiento, mala precisión en producción; o una precisión que mejora y luego se degrada a medida que entrenas más tiempo. Soluciones: más datos de entrenamiento (y más variados), regularización, parada temprana, dropout o un modelo más simple.
- Subajuste - el modelo es demasiado simple para capturar el patrón y rinde mal incluso con los datos de entrenamiento. Solución: un modelo más capaz, mejores características o más entrenamiento.
- Compensación sesgo-varianza - el sesgo es el error de un modelo demasiado simple (subajuste); la varianza es el error de uno demasiado complejo (sobreajuste). Más complejidad reduce el sesgo pero aumenta la varianza. El arte está en equilibrar ambos.
En el examen. "Excelente con los datos de entrenamiento, malo en producción" es la firma del sobreajuste; las respuestas esperadas son más datos, regularización o parada temprana. No lo confundas con el subajuste (malo en todas partes).
Parte 4: Cómo se mide un modelo
No puedes mejorar lo que no puedes medir, y la métrica correcta depende de la tarea.
Métricas de clasificación.
- Exactitud (accuracy) - fracción de predicciones que son correctas. Bien cuando las clases están balanceadas; engañosa cuando no lo están.
- Matriz de confusión - la tabla completa de verdaderos positivos, falsos positivos, verdaderos negativos y falsos negativos. Todo lo demás se deriva de ella.
- Precisión - de los elementos que marcaste como positivos, cuántos lo eran de verdad. (Penaliza los falsos positivos.)
- Recall (sensibilidad) - de los elementos verdaderamente positivos, cuántos capturaste. (Penaliza los falsos negativos.)
- F1 score - la media armónica de precisión y recall, un solo número que equilibra ambos.
- AUC (área bajo la curva ROC) - medida independiente del umbral de qué tan bien el modelo separa las clases.
Métricas de regresión.
- RMSE (raíz del error cuadrático medio) y MAE (error absoluto medio) - qué tan lejos caen las predicciones de los números verdaderos.
Métricas generativas y de lenguaje.
- BLEU - calidad de traducción frente a referencias humanas.
- ROUGE - calidad de resumen (solapamiento con resúmenes de referencia).
- BERTScore - similitud semántica con una referencia usando embeddings.
- Evaluación humana - sigue siendo el estándar de oro para la salida generativa abierta.
En el examen. El costo de negocio elige la métrica. Cuando un fallo es mucho más costoso que una falsa alarma (fraude, cribado de enfermedades), optimiza el recall. La exactitud es el valor por defecto para la clasificación balanceada; una matriz de confusión cuando quieres el desglose completo; BLEU/ROUGE para traducción/resumen.
Parte 5: Hiperparámetros y dinámica del entrenamiento
Los hiperparámetros son los ajustes que eliges antes del entrenamiento (a diferencia de los pesos que el modelo aprende). Los principales:
- Epochs - cuántas veces el modelo recorre los datos de entrenamiento. Demasiado pocas subajustan; demasiadas sobreajustan.
- Learning rate - qué tan grande es el paso que da el modelo cuando se actualiza. Demasiado alto y nunca se estabiliza; demasiado bajo y avanza a rastras.
- Batch size - cuántos ejemplos por actualización.
El ajuste de hiperparámetros es la búsqueda de la mejor combinación; a menudo está automatizado (por ejemplo, con herramientas de AutoML).
No confundas los hiperparámetros de entrenamiento con los ajustes en tiempo de inferencia de los modelos generativos:
- Temperature - baja (cerca de 0) da una salida determinista y repetible; alta da una salida creativa y variada.
- Top-p / top-k - limitan de qué tokens candidatos puede muestrear el modelo.
En el examen. "Hacer que las respuestas del modelo sean más consistentes/repetibles" significa bajar la temperature. "Mejorar la precisión entrenando más" apunta a más epochs (con el sobreajuste como advertencia).
Parte 6: Adaptar foundation models - la escalera de personalización
Rara vez entrenas un modelo grande desde cero. Tomas un foundation model preentrenado y lo adaptas. Los métodos, ordenados del más barato y rápido al más caro, son la idea más relevante para el examen de toda esta guía.
Aprendizaje por transferencia (la idea paraguas)
Qué. Reutilizar el conocimiento que un modelo aprendió en una tarea para hacer una tarea relacionada. En lugar de partir de pesos aleatorios, partes de un modelo que ya entiende el lenguaje o las imágenes.
Por qué. Recorta los datos y el cómputo que necesitas. Este es el principio que subyace a casi todo lo que sigue - el fine-tuning es una forma específica de hacer aprendizaje por transferencia.
En el examen. "Adaptar un modelo preentrenado para una nueva tarea en lugar de construir desde cero" es aprendizaje por transferencia, y su beneficio es menos datos, menos tiempo, menos costo.
Peldaño 1: Prompt engineering
Qué. Cambiar las instrucciones que le das al modelo, no el modelo en sí. No se reentrena nada.
Cómo. Técnicas:
- Zero-shot - simplemente preguntar, sin ejemplos.
- One-shot / few-shot (in-context learning) - incluir unos pocos ejemplos resueltos en el prompt para que el modelo infiera el patrón. Esto adapta el comportamiento sin actualizar ningún parámetro.
- Chain-of-thought - pedirle al modelo que razone paso a paso para problemas más difíciles.
- Plantillas de prompt - estructuras de prompt estandarizadas y reutilizables.
Por qué. Lo más barato, rápido, sin infraestructura. Prueba esto siempre primero.
En el examen. El few-shot learning y el in-context learning son la misma idea: ejemplos en el prompt, sin reentrenamiento. El zero-shot arriesga malos resultados cuando la tarea está lejos de lo que el modelo vio durante el entrenamiento.
Peldaño 2: Generación aumentada por recuperación (RAG)
Qué. Recuperar hechos relevantes de tus propios datos en el momento de la consulta y añadirlos al prompt, para que el modelo responda a partir de información actual, privada o autorizada con la que nunca fue entrenado.
Cómo. Convierte tus documentos en embeddings (vectores numéricos que capturan el significado), guárdalos en una base de datos vectorial, recupera los fragmentos más cercanos a la pregunta del usuario y aliméntalos al modelo junto con la pregunta.
Por qué. Ancla las respuestas en tus datos y reduce drásticamente la alucinación, sin ningún reentrenamiento. Ideal cuando tu conocimiento cambia a menudo - actualizas los documentos, no el modelo.
En el examen. "Anclar el modelo en los datos de la empresa / reducir la alucinación / mantener las respuestas actualizadas sin reentrenar" es RAG. Los embeddings son las representaciones numéricas que hacen que funcione la recuperación.
Peldaño 3: Fine-tuning
Qué. Continuar entrenando el modelo con tus propios ejemplos etiquetados para que interiorice una tarea o un estilo.
Cómo. Proporciona datos etiquetados - normalmente pares de prompt y completion. El fine-tuning por instrucciones usa pares de entrada-salida formateados como instrucciones; la adaptación de dominio enseña un comportamiento especializado (por ejemplo, manejar terminología científica o legal). El fine-tuning eficiente en parámetros (PEFT), como LoRA, actualiza solo una pequeña porción de los parámetros del modelo, reduciendo el costo mientras mantiene congelada la mayor parte del modelo.
Por qué. Cuando el prompting y RAG no bastan y necesitas que el modelo se comporte de forma fiable de cierta manera. Cuesta más (datos, cómputo) que los peldaños anteriores.
En el examen. El fine-tuning necesita datos etiquetados (pares prompt-completion). Úsalo para un comportamiento de tarea consistente o para la adaptación de dominio; cambia el modelo, mientras que RAG deja el modelo en paz y aporta contexto en el momento de la consulta.
Peldaño 4: Pre-entrenamiento continuo
Qué. Seguir preentrenando el modelo base con un gran cuerpo de texto de dominio sin etiquetar.
Por qué. Para enseñarle al modelo el vocabulario y los conceptos de un campo especializado (médico, legal, científico) a gran escala, o para mantenerlo actualizado a medida que evolucionan los datos. Más caro que el fine-tuning.
En el examen. El pre-entrenamiento continuo usa mucho texto de dominio sin etiquetar para dominar vocabulario y conceptos; el fine-tuning por instrucciones usa pares de instrucciones etiquetados para el comportamiento de la tarea. Datos distintos, objetivo distinto.
La escalera de costo, en una línea
Prompt engineering (lo más barato, sin reentrenamiento) -> RAG (añade tus datos en el momento de la consulta) -> fine-tuning (reentrenar con ejemplos etiquetados) -> pre-entrenamiento continuo (reentrenar con texto de dominio sin etiquetar) -> pre-entrenamiento completo desde cero (raro, lo más caro). Sube solo tan alto como exija el problema.
Parte 7: Hacer los modelos más pequeños y rápidos
Una vez que un modelo funciona, a menudo lo necesitas más barato o con menor latencia:
- Destilación de conocimiento - entrenar un pequeño modelo "estudiante" para que imite a uno grande "maestro", conservando la mayor parte de la calidad a una fracción del tamaño.
- Cuantización - almacenar los pesos con menor precisión numérica (por ejemplo, 8 bits en lugar de 32 bits) para reducir y acelerar el modelo.
- Poda (pruning) - eliminar pesos o estructuras que aportan poco.
Parte 8: Arquitecturas, en breve
Los paradigmas anteriores son cómo aprenden los modelos; las arquitecturas son de qué está construido el modelo. Deberías reconocer los nombres:
- Redes neuronales / deep learning - redes en capas que aprenden características jerárquicas; la base de la IA moderna.
- CNN - especializadas en imágenes.
- RNN - construidas para secuencias (en gran medida superadas por los transformers).
- Transformers - la arquitectura detrás de los LLM modernos; la "GPT" de generative pre-trained transformer y modelos como BERT.
- GAN - dos redes que compiten para generar datos sintéticos realistas.
- Modelos de difusión - generan imágenes aprendiendo a revertir un proceso de adición de ruido.
No necesitas implementarlas para un examen fundamental, pero deberías saber, por ejemplo, que los transformers impulsan los LLM y que las GAN generan datos sintéticos.
La guía de decisión en 30 segundos
- Datos etiquetados, predecir una categoría o número -> aprendizaje supervisado (clasificación o regresión)
- Datos sin etiquetar, encontrar grupos o rarezas -> aprendizaje no supervisado (clustering, detección de anomalías)
- Unas pocas etiquetas más muchos datos sin etiquetar -> aprendizaje semisupervisado
- El modelo crea sus propias etiquetas a partir de datos en bruto (cómo se preentrenan los foundation models) -> aprendizaje autosupervisado
- El agente aprende de recompensas / retroalimentación -> aprendizaje por refuerzo; alinear un LLM con la preferencia humana -> RLHF
- Reutilizar un modelo preentrenado para una tarea relacionada -> aprendizaje por transferencia
- Adaptar un foundation model, lo más barato primero -> prompt engineering, luego RAG, luego fine-tuning, luego pre-entrenamiento continuo
- Anclar las respuestas en tus propios datos actuales, sin reentrenamiento -> RAG
- Excelente con los datos de entrenamiento, malo en producción -> sobreajuste (más datos, regularización, parada temprana)
- Fallar un positivo es muy costoso (fraude) -> optimizar el recall
- Hacer la salida generativa más consistente -> bajar la temperature
Certificaciones relacionadas
Estos fundamentos de métodos de aprendizaje son esenciales para todo examen fundamental de IA - esta guía aparece en las Guías de Estudio Relacionadas de cada uno de sus hubs:
- AWS Certified AI Practitioner (AIF-C01) - el examen al que está afinada esta guía; los Dominios 1-3 se apoyan mucho en estos conceptos.
- AWS Certified Machine Learning Engineer Associate (MLA-C01) - profundiza en el ciclo de vida, el entrenamiento y la evaluación.
- Microsoft Azure AI Fundamentals (AI-900 / AI-901) - evalúa los mismos paradigmas de aprendizaje y los fundamentos del ML.
- Google Cloud Generative AI Leader - foundation models, prompting y adaptación.
- NVIDIA-Certified Associate: Generative AI and LLMs (NCA-GENL) - entrenamiento y adaptación de LLM.
- IBM watsonx Generative AI Engineer Associate - fundamentos de la IA generativa.
- Claude Certified Architect - Foundations (CCA-F) - conceptos de foundation models.
Cómo estudiar esto
Para un examen fundamental, no memorices algoritmos - practica la clasificación. Lee cada escenario y hazte las dos preguntas organizadoras: qué datos tengo (etiquetados, sin etiquetar, recompensa) y ¿estoy construyendo o adaptando? Eso te lleva al paradigma correcto o al peldaño correcto de la escalera de personalización en segundos. Practica preguntas con la guía de decisión de 30 segundos abierta, y cuando falles alguna, vuelve a esa sección de aquí hasta que el límite quede nítido. Los conceptos que separan a quienes aprueban son los de bordes difusos: supervisado frente a no supervisado, fine-tuning frente a RAG, sobreajuste frente a subajuste, y el orden de costo de la escalera de personalización.
Fuente: la guía del examen AWS Certified AI Practitioner (AIF-C01) y sus dominios de preguntas, y referencias estándar de machine learning, a septiembre de 2026.