Существует семь основных технических причин:
- Оптимизация под предсказание следующего токена вместо проверки истинности — модель поощряется воспроизводить наиболее вероятное продолжение, даже если оно неверно.
- Пробелы, шум и устаревание обучающих данных — модель не имеет механизма верификации, а в данных есть спам, устаревшие блоги, неверные ответы на форумах.
- Стратегии декодирования — жадный декодинг закрепляет ранние ошибки, высокая температура увеличивает отклонения от фактов.
- RLHF-выравнивание поощряет полные и полезные ответы — люди-оценщики предпочитают уверенный ответ признанию «не знаю», поэтому модель учится уверенно высказываться.
- Плохая калибровка — присваиваемая вероятность не отражает истинность: высокая уверенность означает «очень подходящий паттерн», а не «фактически верно».
- Сдвиг домена — в нишевых областях (медицина, право, инженерия) или на новых фактах модель импровизирует из ближайших паттернов.
- Чрезмерное обобщение паттернов — модель усваивает «как звучит Википедия» и распространяет паттерн дальше, чем уместно.


Leave A Comment