• DPO (Direct Preference Optimization) — прямое обучение на парах «хороший / плохой ответ» без отдельной модели наград; математически строже и дешевле, вытесняет классический RLHF во многих лабораториях.
  • RLAIF / Constitutional AI — разметчиков заменяет другая модель, оценивающая ответы по набору заранее заданных принципов.
  • Test-time compute — модели o1, o3, DeepSeek-R1 «думают» длинными цепочками рассуждений перед финальным ответом, что повышает качество reasoning-задач.