Кратко

  • Физики из Университета Джорджа Вашингтона Нил Джонсон и Фрэнк Инцзе Хо опубликовали формулу, которая оценивает, сколько хороших токенов производит модель ИИ до первого плохого.
  • В препринте формула правильно предсказала, сразу ли модель сорвётся или после задержки, в 15 из 16 однозначных случаев.
  • Авторы предлагают параллельный монитор, который сигнализирует, когда модели опускаются ниже порога безопасности.

Физики из Университета Джорджа Вашингтона опубликовали формулу, которая оценивает, сколько хороших ответов даст чат-бот с ИИ, прежде чем он сорвётся в плохой, и ранние тесты показывают, что она работает.

Исследование, проведённое Нилом Джонсоном и Фрэнком Инцзе Хо, появилось в журнале Patterns и основано на препринте, версии, опубликованной публично до формального рецензирования, впервые выпущенной в феврале.

Myriad: Какая компания проведёт IPO следующей? Нажмите, чтобы сделать свой прогноз.
Myriad: Какая компания проведёт IPO следующей? Нажмите, чтобы сделать свой прогноз.

Чат-боты могут отвечать разумно на протяжении долгого времени, а затем сворачивать в сторону чего-то вредного, например, плохих советов о самоповреждении или экстремистских высказываний, и не было простого способа предсказать, когда произойдёт этот поворот. Авторы утверждают, что существующие инструменты безопасности часто зависят от облачного подключения, которого лишены офлайн-модели.

Джонсон и Хуо прослеживают проблему до головы внимания — части модели ИИ, которая решает, какие более ранние слова в разговоре имеют наибольшее значение при выборе следующего. По мере роста чата накопленный контекст притягивает это внимание к одному кластеру возможных ответов или другому, пока оно не опрокинется.

Это распространённый паттерн, используемый многими взломщиками джейлбрейков, и одна из причин, по которой многие компании уделяют внимание системным подсказкам (фрагментам текста, которые чат-бот ИИ читает перед любым запросом). Однако никто не может точно указать, сколько усилий требуется, чтобы эффективно ослабить модель.

Их формула оценивает точку перелома, называемую n, как количество хороших токенов — фрагментов слов, которые модель выдаёт по одному за раз, — вышедших до первого плохого. Если разговор уже склоняется к плохой стороне, модель опрокидывается сразу, с n, равным нулю. Если он склоняется к хорошей, модель выдаёт серию нормальных ответов, а затем переворачивается.

В препринте формула выбрала правильный случай — немедленный или отложенный — в 15 из 16 однозначных тестов, то есть в 94%. Исследователи провели эти тесты на шести моделях с открытыми весами, то есть на системах ИИ, файлы которых находятся в открытом доступе, так что любой может их скачать и запустить, от OpenAI, EleutherAI и Meta.

Все шесть содержали от 124 миллионов до 410 миллионов параметров — настраиваемых чисел внутри модели, которые служат приблизительной мерой её размера. Как сообщается, в опубликованной статье тест расширен до семи моделей с числом параметров до 12 миллиардов, что по нынешним меркам всё ещё немного.

Цель — ИИ на устройстве, тот вид, который работает полностью на телефоне или ноутбуке без подключения к интернету, включая чат-ботов-компаньонов, с которыми люди разговаривают как с другом. Экспериментальное приложение Google AI Edge Gallery, которое тестировал Decrypt в прошлом году, уже позволяет Android-телефону запускать модели офлайн, и ничего введённое в него не отправляется на серверы Google, и, похоже, это тенденция, которая может усиливаться со временем по мере того, как аппаратное обеспечение становится мощнее, а меньшие модели ИИ — более способными.

У модели, работающей офлайн, нет облачного сервиса, проверяющего её вывод, и именно этот пробел авторы хотят закрыть. Они предлагают недорогой монитор, который работает параллельно с моделью и подаёт сигнал, когда n* падает ниже порога безопасности, немного похоже на предупреждающую лампочку на приборной панели автомобиля.

BitcoinBTC · USD

$82,986−2.22%

Oct 3Oct 5Oct 7Oct 8Oct 10

$86.7k$84.7k$82.7k$80.7k

24h HighHigh$82,978

24h LowLow$82,229

VolVol$747.7M

→

Купить Bitcoin за USDT

Работает на Jupiter

Данные о ценах от CoinGeckoCoinGeckoБольше Bitcoin новостей и прогнозов →

Они также описывают способы отодвинуть точку невозврата за пределы досягаемости, например, путём внедрения контента в разговор, чтобы n* оказалось за пределами длины ответа. По словам авторов, обучение выравниванию, процесс обучения модели правильному поведению, может сместить или подавить точку невозврата для конкретных запросов, но не может устранить лежащий в основе механизм.

В апреле 2025 года Decryptосвещал более раннюю статью тех же авторов, показывающую, что «пожалуйста» и «спасибо» оказывают ничтожное влияние на вывод модели, поскольку модель рассматривает вежливые слова как ортогональные, или математически не связанные, с сутью запроса. В той версии моделировалась одна, намеренно упрощённая, голова внимания.

Тесты препринта использовали небольшие модели и окно в 300 токенов, или несколько коротких абзацев текста, и его предсказания могли отличаться на один вывод.