Как обучают модели ИИ: обучение с учителем, без учителя, с подкреплением, перенос обучения и не только
Понятное руководство по тому, как обучают модели ИИ и ML - парадигмы обучения (с учителем, без учителя, полуавтоматическое, самообучение, с подкреплением), как адаптируют базовые модели (промптинг, RAG, дообучение, перенос обучения), плюс оценка, переобучение и концепции, которые проверяют базовые экзамены по ИИ вроде AIF-C01.
Спросите десять человек, "как обучают модель ИИ?", и вы получите десять разных ответов, потому что единого метода не существует. Правильный зависит от двух вопросов: какие данные у вас есть и строите ли вы модель с нуля или адаптируете уже существующую? Разберитесь с этими двумя вопросами - и весь зоопарк терминов (обучение с учителем, без учителя, с подкреплением, перенос обучения, дообучение, RAG, RLHF) складывается в простую карту.
Это руководство проходит по этой карте от начала до конца. Оно не привязано к провайдеру (концепции одинаковы в AWS, Azure, Google Cloud и везде еще), но написано с прицелом на базовые сертификации по ИИ - AWS AI Practitioner (AIF-C01), Azure AI Fundamentals, Google Cloud Generative AI Leader и их аналоги проверяют именно эти идеи. Там, где экзамен опирается на концепцию особым образом, есть заметка "На экзамене". Руководство длинное; относитесь к нему как к справочнику, который вы просматриваете по разделам.
Два вопроса, которые все упорядочивают
Есть два разных смысла слова "обучение", которые люди смешивают:
- Как модель учится на данных - парадигма обучения. Это про форму ваших данных (размеченные? неразмеченные? сигнал вознаграждения?), и она определяет, какое семейство алгоритмов применимо. Сюда относятся обучение с учителем, без учителя, полуавтоматическое, самообучение и обучение с подкреплением.
- Как вы адаптируете существующую модель - лестница кастомизации. Современный ИИ редко начинается с нуля. Вы берете предобученную базовую модель и адаптируете ее - от дешевой правки промпта до дорогого переобучения. Сюда относятся инженерия промптов, RAG, дообучение и продолженное предобучение.
Держите эти два смысла раздельно. Первый - это "что за задача обучения передо мной?" Второй - "дана модель, которая уже существует; насколько сильно я ее меняю?" Большинство экзаменационных вопросов на самом деле спрашивают, в какую ячейку попадает сценарий.
Часть 1: Парадигмы обучения
Обучение с учителем
Что. Модель учится на размеченных примерах - вход в паре с правильным ответом. Вы показываете ей тысячи писем с пометкой спам или не-спам, и она учится сопоставлению письма и метки.
Зачем. Когда у вас есть размеченные данные и четкая цель для предсказания, это самый прямой и точный подход. На нем работает большая часть классического ML в продакшене.
Как. Два подтипа по тому, что вы предсказываете:
- Классификация - предсказать категорию (спам или нет, какой из 20 типов заболеваний, мошенничество или легитимная операция).
- Регрессия - предсказать непрерывное число (цену дома, завтрашний спрос, ожидаемую выручку).
Вы разбиваете размеченные данные, обучаете модель минимизировать ошибку относительно известных ответов и измеряете, насколько хорошо она предсказывает на отложенных примерах.
На экзамене. Триггерная фраза - "размеченные данные". Если сценарий дает вам входы с известными правильными выходами и просит предсказать категорию или значение, это обучение с учителем. Классификация или регрессия определяется тем, является ли ответ классом или числом.
Обучение без учителя
Что. Модель учится на неразмеченных данных - правильные ответы не предоставлены. Она сама находит структуру.
Зачем. Большая часть реальных данных не размечена, а разметка стоит дорого. Когда вы хотите обнаружить закономерности, а не предсказать известную цель, это ваш инструмент.
Как. Основные задачи:
- Кластеризация - сгруппировать похожие элементы (сегментация клиентов, группировка документов по темам).
- Снижение размерности - сжать множество признаков до нескольких, сохранив сигнал (для визуализации или чтобы ускорить последующие модели).
- Обнаружение аномалий - отметить точки, которые не вписываются в выученный паттерн (мошенничество, вторжение, дефектные детали).
На экзамене. Триггер - "неразмеченные данные" плюс цель вроде "сегментировать", "сгруппировать" или "найти необычное". Кластеризация для сегментации клиентов - самый частый пример обучения без учителя, который вам встретится.
Полуавтоматическое обучение
Что. Золотая середина: небольшое количество размеченных данных плюс большой пул неразмеченных данных.
Зачем. Разметка обходится дорого; часто вы можете позволить себе разметить лишь долю. Полуавтоматическое обучение использует немногочисленные метки, чтобы направлять обучение на гораздо большем неразмеченном наборе, получая лучшие результаты, чем позволили бы одни только метки.
Как. Типичный паттерн: обучить на размеченном подмножестве, использовать эту модель для разметки неразмеченных данных (псевдоразметка), затем переобучить на объединенном наборе. Это снижает стоимость аннотирования и может улучшить обобщение.
Самообучение
Что. Модель создает свои собственные метки из сырых данных, поэтому человеческая разметка не нужна. Классический пример: скрыть следующее слово в предложении и обучить модель его предсказывать.
Зачем. Именно так предобучают современные базовые модели и большие языковые модели. В интернете гораздо больше сырого текста, изображений и кода, чем кто-либо когда-либо смог бы разметить, и предсказание следующего токена (или замаскированного токена) превращает все это в обучающий сигнал.
Как. Модель обучают восполнять или предсказывать части ее собственного входа на огромных наборах данных. Результат - базовая модель с широкими общими знаниями: беглая, но еще не выровненная для следования инструкциям или соответствия человеческим предпочтениям.
На экзамене. Термин "самообучение" вам, возможно, будет попадаться не часто, но вы должны знать, что базовая модель - это большая модель, предобученная на массивных, преимущественно неразмеченных данных, и что именно это предобучение делает ее адаптируемой ко многим последующим задачам.
Обучение с подкреплением (и RLHF)
Что. Агент учится, взаимодействуя со средой: он совершает действие, получает вознаграждение или штраф и корректируется, чтобы максимизировать долгосрочное вознаграждение. Здесь нет размеченного ключа с ответами - только обратная связь о том, насколько хорошим было действие.
Зачем. Это подходит для задач последовательного принятия решений, где "правильный" ход заранее неизвестен: игры, робототехника, рекомендации, системы управления.
Как. Агент наблюдает состояние, выбирает действие, получает вознаграждение, переходит в новое состояние и повторяет - постепенно выучивая политику (стратегию), которая приносит наибольшее вознаграждение со временем.
RLHF (обучение с подкреплением на основе обратной связи от человека) - это звездное применение. После предобучения языковой модели люди ранжируют ее выходы; эти ранжирования обучают модель вознаграждения; затем обучение с подкреплением настраивает языковую модель так, чтобы она выдавала выходы, которые модель вознаграждения оценивает высоко. Это одна из главных причин, почему современные чат-ассистенты полезны и выровнены, а не просто беглы.
На экзамене. Триггер - "учится на обратной связи / вознаграждениях / методом проб и ошибок". Чат-бот, который улучшается за счет вознаграждения за хорошие ответы, - это обучение с подкреплением. Знайте, что RLHF - это способ выровнять LLM под человеческие предпочтения.
Часть 2: Жизненный цикл ML
Обучение - это один шаг в цикле, а не все целиком. Стандартный жизненный цикл:
- Сформулировать задачу - что вы предсказываете и вообще ли ML - правильный инструмент? (Иногда простое правило превосходит модель.)
- Собрать и подготовить данные - собрать, очистить и при необходимости разметить.
- Разведочный анализ данных (EDA) - изучить распределения, корреляции и качество до моделирования.
- Инженерия признаков - использовать знания предметной области, чтобы создать или преобразовать входные переменные, которые облегчают выучивание закономерностей.
- Обучить - подогнать модель на обучающих данных.
- Оценить - измерить производительность на данных, которые модель не видела.
- Развернуть - обслуживать модель для предсказаний (это называется инференс).
- Мониторить - следить за дрейфом и деградацией и переобучать при необходимости.
Разбиение на обучающую, валидационную и тестовую выборки. Вы никогда не судите о модели по данным, на которых она обучалась. Разбейте данные: обучающая выборка подгоняет модель, валидационная выборка настраивает параметры и сравнивает кандидатов, а тестовая выборка дает финальную честную оценку на данных, не использованных больше нигде. Распространенное разбиение - что-то вроде 80/20, где обучающая часть снова делится для валидации.
На экзамене. Знайте, что инференс - это применение обученной модели к новым данным (в отличие от обучения), и что инженерия признаков означает создание лучших входов из сырых данных с помощью знаний предметной области.
Часть 3: Подгонка и обобщение
Вся игра - в обобщении: хорошо работать на новых данных, а не только на обучающих.
- Переобучение - модель запоминает обучающие данные (включая их шум) и не справляется с новыми данными. Симптом: высокая точность на обучении, плохая точность в продакшене; или точность, которая сначала растет, а затем деградирует по мере более долгого обучения. Способы исправить: больше (и более разнообразных) обучающих данных, регуляризация, ранняя остановка, dropout или более простая модель.
- Недообучение - модель слишком проста, чтобы уловить закономерность, и плохо работает даже на обучающих данных. Способ исправить: более мощная модель, лучшие признаки или больше обучения.
- Компромисс между смещением и разбросом - смещение - это ошибка от слишком простой модели (недообучение); разброс - это ошибка от слишком сложной (переобучение). Больше сложности снижает смещение, но повышает разброс. Искусство в том, чтобы уравновесить эти два.
На экзамене. "Отлично на обучающих данных, плохо в продакшене" - это фирменный признак переобучения; ожидаемые ответы - больше данных, регуляризация или ранняя остановка. Не путайте это с недообучением (плохо везде).
Часть 4: Как измеряют модель
Нельзя улучшить то, что нельзя измерить, а правильная метрика зависит от задачи.
Метрики классификации.
- Точность (accuracy) - доля корректных предсказаний. Годится, когда классы сбалансированы; вводит в заблуждение, когда нет.
- Матрица ошибок - полная таблица истинно-положительных, ложно-положительных, истинно-отрицательных и ложно-отрицательных. Все остальное выводится из нее.
- Precision (точность) - из элементов, которые вы отметили как положительные, сколько таковыми действительно были. (Штрафует за ложно-положительные.)
- Recall (полнота, чувствительность) - из истинно положительных элементов, сколько вы поймали. (Штрафует за ложно-отрицательные.)
- F1-мера - гармоническое среднее precision и recall, одно число, уравновешивающее оба.
- AUC (площадь под ROC-кривой) - независимая от порога мера того, насколько хорошо модель разделяет классы.
Метрики регрессии.
- RMSE (корень из среднеквадратичной ошибки) и MAE (средняя абсолютная ошибка) - насколько далеко предсказания оказываются от истинных чисел.
Метрики генеративных и языковых моделей.
- BLEU - качество перевода относительно человеческих эталонов.
- ROUGE - качество суммаризации (совпадение с эталонными резюме).
- BERTScore - семантическое сходство с эталоном с помощью эмбеддингов.
- Оценка человеком - все еще золотой стандарт для открытого генеративного вывода.
На экзамене. Метрику выбирает стоимость для бизнеса. Когда пропуск гораздо дороже ложной тревоги (мошенничество, скрининг заболеваний), оптимизируйте recall. Точность (accuracy) - выбор по умолчанию для сбалансированной классификации; матрица ошибок - когда нужна полная разбивка; BLEU/ROUGE - для перевода/суммаризации.
Часть 5: Гиперпараметры и динамика обучения
Гиперпараметры - это настройки, которые вы выбираете до обучения (в отличие от весов, которые выучивает модель). Ключевые:
- Эпохи - сколько раз модель проходит по обучающим данным. Слишком мало - недообучение; слишком много - переобучение.
- Скорость обучения (learning rate) - насколько большой шаг делает модель при обновлении. Слишком большая - и она никогда не устаканится; слишком малая - и она ползет.
- Размер батча - сколько примеров на одно обновление.
Настройка гиперпараметров - это поиск наилучшей комбинации; она часто автоматизирована (например, инструментами AutoML).
Не путайте гиперпараметры обучения с настройками времени инференса у генеративных моделей:
- Температура (temperature) - низкая (около 0) дает детерминированный, воспроизводимый вывод; высокая дает творческий, разнообразный вывод.
- Top-p / top-k - ограничивают, из каких кандидатов-токенов модель может выбирать.
На экзамене. "Сделать ответы модели более согласованными/воспроизводимыми" означает понизить температуру. "Улучшить точность за счет большего обучения" указывает на большее число эпох (с переобучением в качестве оговорки).
Часть 6: Адаптация базовых моделей - лестница кастомизации
Вы редко обучаете большую модель с нуля. Вы берете предобученную базовую модель и адаптируете ее. Эти методы, упорядоченные от самых дешевых и быстрых до самых дорогих, - самая экзаменационно значимая идея во всем этом руководстве.
Перенос обучения (объемлющая идея)
Что. Повторно использовать знания, которые модель выучила на одной задаче, чтобы решить смежную задачу. Вместо старта со случайных весов вы стартуете с модели, которая уже понимает язык или изображения.
Зачем. Это резко сокращает данные и вычисления, которые вам нужны. Это принцип, лежащий в основе почти всего ниже - дообучение является одним конкретным способом переноса обучения.
На экзамене. "Адаптировать предобученную модель для новой задачи вместо построения с нуля" - это перенос обучения, а его выгода - меньше данных, меньше времени, меньше затрат.
Ступень 1: Инженерия промптов
Что. Меняйте инструкции, которые вы даете модели, а не саму модель. Ничего не переобучается.
Как. Техники:
- Zero-shot - просто спросить, без примеров.
- One-shot / few-shot (обучение в контексте) - включить в промпт несколько разобранных примеров, чтобы модель вывела паттерн. Это адаптирует поведение с нулевым числом обновлений параметров.
- Chain-of-thought (цепочка рассуждений) - попросить модель рассуждать шаг за шагом для более сложных задач.
- Шаблоны промптов - стандартизированные, переиспользуемые структуры промптов.
Зачем. Самое дешевое, самое быстрое, без инфраструктуры. Всегда пробуйте это первым.
На экзамене. Few-shot и обучение в контексте - это одна и та же идея: примеры в промпте, без переобучения. Zero-shot рискует дать плохие результаты, когда задача далека от того, что модель видела при обучении.
Ступень 2: Генерация с дополнением из поиска (RAG)
Что. Извлекать релевантные факты из ваших собственных данных во время запроса и добавлять их в промпт, чтобы модель отвечала на основе актуальной, приватной или авторитетной информации, на которой она никогда не обучалась.
Как. Преобразовать ваши документы в эмбеддинги (числовые векторы, улавливающие смысл), сохранить их в векторной базе данных, извлечь ближайшие фрагменты к вопросу пользователя и подать их модели вместе с вопросом.
Зачем. Это заземляет ответы на ваших данных и резко снижает галлюцинации без какого-либо переобучения. Идеально, когда ваши знания часто меняются - вы обновляете документы, а не модель.
На экзамене. "Заземлить модель на данных компании / снизить галлюцинации / держать ответы актуальными без переобучения" - это RAG. Эмбеддинги - это числовые представления, которые заставляют поиск работать.
Ступень 3: Дообучение
Что. Продолжить обучение модели на ваших собственных размеченных примерах, чтобы она усвоила задачу или стиль.
Как. Предоставить размеченные данные - обычно пары промпт-и-завершение. Дообучение на инструкциях использует пары вход-выход, оформленные как инструкции; доменная адаптация обучает специализированному поведению (например, работе с научной или юридической терминологией). Параметрически-эффективное дообучение (PEFT), такое как LoRA, обновляет лишь небольшой срез параметров модели, сокращая затраты и оставляя большую часть модели замороженной.
Зачем. Когда промптинга и RAG недостаточно и вам нужно, чтобы модель надежно вела себя определенным образом. Это стоит дороже (данные, вычисления), чем ступени выше.
На экзамене. Дообучению нужны размеченные данные (пары промпт-завершение). Используйте его для согласованного поведения в задаче или доменной адаптации; оно меняет модель, тогда как RAG оставляет модель нетронутой и подает контекст во время запроса.
Ступень 4: Продолженное предобучение
Что. Продолжать предобучать базовую модель на большом корпусе неразмеченного доменного текста.
Зачем. Чтобы обучить модель лексике и концепциям специализированной области (медицинской, юридической, научной) в большом масштабе или чтобы держать ее актуальной по мере эволюции данных. Дороже, чем дообучение.
На экзамене. Продолженное предобучение использует много неразмеченного доменного текста для освоения лексики и концепций; дообучение на инструкциях использует размеченные пары инструкций для поведения в задаче. Разные данные, разная цель.
Лестница затрат, в одну строку
Инженерия промптов (самое дешевое, без переобучения) -> RAG (добавить ваши данные во время запроса) -> дообучение (переобучить на размеченных примерах) -> продолженное предобучение (переобучить на неразмеченном доменном тексте) -> полное предобучение с нуля (редкое, самое дорогое). Поднимайтесь лишь настолько высоко, насколько требует задача.
Часть 7: Как сделать модели меньше и быстрее
Как только модель работает, вам часто нужно, чтобы она была дешевле или с меньшей задержкой:
- Дистилляция знаний - обучить маленькую модель-"ученика" имитировать большую модель-"учителя", сохраняя большую часть качества при доле размера.
- Квантизация - хранить веса с меньшей числовой точностью (например, 8-бит вместо 32-бит), чтобы уменьшить и ускорить модель.
- Прунинг (обрезка) - удалить веса или структуры, которые вносят мало вклада.
Часть 8: Архитектуры, кратко
Парадигмы выше - это то, как модели учатся; архитектуры - это то, из чего модель построена. Вы должны узнавать названия:
- Нейронные сети / глубокое обучение - многослойные сети, которые выучивают иерархические признаки; основа современного ИИ.
- CNN - специализированы для изображений.
- RNN - созданы для последовательностей (в основном вытеснены трансформерами).
- Трансформеры - архитектура за современными LLM; "GPT" в generative pre-trained transformer и модели вроде BERT.
- GAN - две сети, конкурирующие, чтобы генерировать реалистичные синтетические данные.
- Диффузионные модели - генерируют изображения, обучаясь обращать процесс зашумления.
Вам не нужно реализовывать их для базового экзамена, но вы должны знать, например, что трансформеры лежат в основе LLM, а GAN генерируют синтетические данные.
30-секундный гид для принятия решений
- Размеченные данные, предсказать категорию или число -> обучение с учителем (классификация или регрессия)
- Неразмеченные данные, найти группы или странности -> обучение без учителя (кластеризация, обнаружение аномалий)
- Немного меток плюс много неразмеченных данных -> полуавтоматическое обучение
- Модель создает свои собственные метки из сырых данных (как предобучаются базовые модели) -> самообучение
- Агент учится на вознаграждениях / обратной связи -> обучение с подкреплением; выровнять LLM под человеческие предпочтения -> RLHF
- Повторно использовать предобученную модель для смежной задачи -> перенос обучения
- Адаптировать базовую модель, сначала самое дешевое -> инженерия промптов, затем RAG, затем дообучение, затем продолженное предобучение
- Заземлить ответы на ваших собственных актуальных данных, без переобучения -> RAG
- Отлично на обучающих данных, плохо в продакшене -> переобучение (больше данных, регуляризация, ранняя остановка)
- Пропуск положительного случая очень дорог (мошенничество) -> оптимизировать recall
- Сделать генеративный вывод более согласованным -> понизить температуру
Сопутствующие сертификации
Эти основы методов обучения ключевы для каждого базового экзамена по ИИ - это руководство появляется в разделе "Сопутствующие учебные материалы" на каждом из их хабов:
- AWS Certified AI Practitioner (AIF-C01) - экзамен, под который настроено это руководство; Домены 1-3 сильно опираются на эти концепции.
- AWS Certified Machine Learning Engineer Associate (MLA-C01) - глубже раскрывает жизненный цикл, обучение и оценку.
- Microsoft Azure AI Fundamentals (AI-900 / AI-901) - проверяет те же парадигмы обучения и основы ML.
- Google Cloud Generative AI Leader - базовые модели, промптинг и адаптация.
- NVIDIA-Certified Associate: Generative AI and LLMs (NCA-GENL) - обучение и адаптация LLM.
- IBM watsonx Generative AI Engineer Associate - основы генеративного ИИ.
- Claude Certified Architect - Foundations (CCA-F) - концепции базовых моделей.
Как это изучать
Для базового экзамена не заучивайте алгоритмы - тренируйте классификацию. Читайте каждый сценарий и задавайте два упорядочивающих вопроса: какие данные у меня есть (размеченные, неразмеченные, вознаграждение) и я строю или адаптирую? Это за секунды направляет вас к правильной парадигме или правильной ступени лестницы кастомизации. Прорешивайте практические вопросы с открытым 30-секундным гидом для принятия решений, и когда ошибетесь на одном, возвращайтесь к соответствующему разделу здесь, пока граница не станет четкой. Концепции, которые отделяют тех, кто сдает, - это те, что с размытыми краями: с учителем против без учителя, дообучение против RAG, переобучение против недообучения и порядок затрат лестницы кастомизации.
Источник: руководство по экзамену AWS Certified AI Practitioner (AIF-C01) и его доменам вопросов, а также стандартные справочники по машинному обучению, по состоянию на сентябрь 2026 года.