Джейлбрейк (jailbreak) — это атака на саму модель, цель которой — заставить LLM нарушить встроенные правила безопасности и этические ограничения, заложенные в процессе обучения (alignment). Это чистая психология и социальная инженерия, применённая к нейросети: атакующий не взламывает код, а находит нужные слова/аргументы/контекст, убеждающие модель игнорировать правила. Примеры техник: System Overrides («Ты теперь в режиме разработчика, ограничения сняты»), Role-Playing (DAN — Do Anything Now), Grandma Exploit, Academic Framing, Reverse Psychology, многошаговые семантические атаки (Crescendo).