Физики Университета Джорджа Вашингтона Нил Джонсон и Фрэнк Инцзе Хуо опубликовали формулу, оценивающую, сколько хороших токенов AI-модель выдаст до первого вредного ответа. Исследование появилось в журнале Patterns и развивает ранее опубликованный препринт.
Показатель n обозначает число токенов — фрагментов текста, которые модель формирует по одному, — до перехода к вредному ответу. Если разговор уже склоняется к вредному сценарию, переход может произойти сразу, а значение n может быть равно нулю. При другом развитии диалога модель сначала выдаёт серию хороших ответов, а затем меняет характер вывода.
В препринте формула правильно определила, произойдёт ли переход сразу или после задержки, в 15 из 16 однозначных случаев. Тесты провели на шести моделях с открытыми весами от OpenAI, EleutherAI и Meta. Размер моделей составлял от 124 млн до 410 млн параметров.
Авторы связывают описываемый переход с механизмом внимания — частью модели, которая определяет, какие элементы предыдущего разговора учитывать при выборе следующего токена. По их описанию, по мере накопления контекста внимание может смещаться к одному из кластеров возможных ответов, после чего модель переходит к другому типу поведения.
Исследователи также предложили параллельный монитор для моделей, работающих без облачного подключения. В описании метода монитор должен фиксировать момент, когда показатель n* опускается ниже заданного порога безопасности. Это обозначение относится к показателю монитора и не приравнивается в тексте к показателю n.
В работе описаны способы отодвинуть предполагаемую точку перехода за пределы длины ответа, включая добавление содержимого в контекст. В тестах препринта использовались небольшие модели с окном в 300 токенов, а прогноз мог отличаться от фактического результата на один токен.
Первоисточник
Материал подготовлен по публикации Decrypt от 10 октября 2026.