Физики предложили формулу для оценки перехода AI-модели к вредному ответу
BTC$83 032+0,57%ETH$2 508+0,84%USDT$0,9992−0,00%BNB$750,79+1,20%SOL$110,39+1,21%XRP$1,40+0,62%TON$1,47+1,27%DOGE$0,0858+0,50%

Физики предложили формулу для оценки перехода AI-модели к вредному ответу

Опубликовано: Автор: Издание: LegalCoin Обновлено:
Физики предложили формулу для оценки перехода AI-модели к вредному ответу

Физики Университета Джорджа Вашингтона Нил Джонсон и Фрэнк Инцзе Хуо опубликовали формулу, оценивающую, сколько хороших токенов AI-модель выдаст до первого вредного ответа. Исследование появилось в журнале Patterns и развивает ранее опубликованный препринт.

Показатель n обозначает число токенов — фрагментов текста, которые модель формирует по одному, — до перехода к вредному ответу. Если разговор уже склоняется к вредному сценарию, переход может произойти сразу, а значение n может быть равно нулю. При другом развитии диалога модель сначала выдаёт серию хороших ответов, а затем меняет характер вывода.

В препринте формула правильно определила, произойдёт ли переход сразу или после задержки, в 15 из 16 однозначных случаев. Тесты провели на шести моделях с открытыми весами от OpenAI, EleutherAI и Meta. Размер моделей составлял от 124 млн до 410 млн параметров.

Авторы связывают описываемый переход с механизмом внимания — частью модели, которая определяет, какие элементы предыдущего разговора учитывать при выборе следующего токена. По их описанию, по мере накопления контекста внимание может смещаться к одному из кластеров возможных ответов, после чего модель переходит к другому типу поведения.

Исследователи также предложили параллельный монитор для моделей, работающих без облачного подключения. В описании метода монитор должен фиксировать момент, когда показатель n* опускается ниже заданного порога безопасности. Это обозначение относится к показателю монитора и не приравнивается в тексте к показателю n.

В работе описаны способы отодвинуть предполагаемую точку перехода за пределы длины ответа, включая добавление содержимого в контекст. В тестах препринта использовались небольшие модели с окном в 300 токенов, а прогноз мог отличаться от фактического результата на один токен.

Первоисточник

Материал подготовлен по публикации Decrypt от 10 октября 2026.

Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Операции с криптовалютами связаны с риском потери средств: решения принимайте самостоятельно.