Обучение любой современной языковой модели состоит из трёх обязательных этапов:
- Предобучение (pre-training) — самая дорогая и долгая фаза: многократный прогон корпуса триллионов токенов, предсказание продолжения, сравнение с реальным текстом, подстройка параметров. Результат — базовая модель (foundation model), которая знает факты, но не умеет вести диалог. GPT-4 обучен на ~13 триллионах токенов, длится месяцы на тысячах GPU и стоит десятки–сотни миллионов долларов.
- Supervised Fine-Tuning (SFT) — дообучение на сотнях тысяч размеченных пар «вопрос — образцовый ответ». Модель учится формату диалога, фильтрует токсичный контент, различает разрешённые и запрещённые запросы.
- RLHF (Reinforcement Learning from Human Feedback) — люди ранжируют несколько вариантов ответа, модель учится предпочитать более высокие по рангу ответы, что делает её вежливой, структурированной и безопасной. В альтернативных методах разметчиков заменяет другая модель (Constitutional AI от Anthropic).


Leave A Comment