Существует семь основных технических причин:

  1. Оптимизация под предсказание следующего токена вместо проверки истинности — модель поощряется воспроизводить наиболее вероятное продолжение, даже если оно неверно.
  2. Пробелы, шум и устаревание обучающих данных — модель не имеет механизма верификации, а в данных есть спам, устаревшие блоги, неверные ответы на форумах.
  3. Стратегии декодирования — жадный декодинг закрепляет ранние ошибки, высокая температура увеличивает отклонения от фактов.
  4. RLHF-выравнивание поощряет полные и полезные ответы — люди-оценщики предпочитают уверенный ответ признанию «не знаю», поэтому модель учится уверенно высказываться.
  5. Плохая калибровка — присваиваемая вероятность не отражает истинность: высокая уверенность означает «очень подходящий паттерн», а не «фактически верно».
  6. Сдвиг домена — в нишевых областях (медицина, право, инженерия) или на новых фактах модель импровизирует из ближайших паттернов.
  7. Чрезмерное обобщение паттернов — модель усваивает «как звучит Википедия» и распространяет паттерн дальше, чем уместно.