W skrócie

  • Fizycy z George Washington University, Neil Johnson i Frank Yingjie Huo, opublikowali wzór, który szacuje, ile dobrych tokenów wygeneruje model AI, zanim pojawi się pierwszy zły.
  • W preprintcie wzór poprawnie przewidział, czy model przechyli się natychmiast, czy po opóźnieniu, w 15 z 16 jednoznacznych przypadków.
  • Autorzy proponują równoległy monitor, który sygnalizuje, gdy modele spadają poniżej progu bezpieczeństwa.

Fizycy z George Washington University opublikowali wzór, który szacuje, ile dobrych odpowiedzi udzieli chatbot AI, zanim przejdzie do złej, a wstępne testy sugerują, że działa.

Badanie, autorstwa Neila Johnsona i Franka Yingjie Huo, ukazało się w czasopiśmie Patterns i opiera się na preprintcie, wersji opublikowanej publicznie przed formalną recenzją, po raz pierwszy udostępnionej w lutym.

Myriad: Która firma następna wejdzie na giełdę? Kliknij, aby dokonać swojej prognozy.
Myriad: Która firma następna wejdzie na giełdę? Kliknij, aby dokonać swojej prognozy.

Chatboty potrafią odpowiadać rozsądnie przez długi czas, a potem zboczyć w coś szkodliwego, na przykład złe rady dotyczące samookaleczania się lub ekstremistyczne wypowiedzi, i nie było prostego sposobu, aby przewidzieć, kiedy nastąpi to zboczenie. Autorzy argumentują, że istniejące narzędzia bezpieczeństwa często zależą od połączenia z chmurą, którego brakuje modelom offline.

Johnson i Huo doszukują się problemu w głowicy uwagi, części modelu AI, która decyduje, które wcześniejsze słowa w rozmowie mają największe znaczenie przy wyborze następnego. W miarę rozwoju czatu nagromadzony kontekst przyciąga tę uwagę w stronę jednego skupiska możliwych odpowiedzi lub innego, aż do przechylenia.

Jest to powszechny wzorzec wykorzystywany przez wielu użytkowników łamiących zabezpieczenia, i jeden z powodów, dla których wiele firm zwraca uwagę na prompty systemowe (fragmenty tekstu, które chatbot AI czyta przed jakimkolwiek zapytaniem). Jednak nikt nie potrafi dokładnie wskazać, ile wysiłku potrzeba, aby skutecznie osłabić model.

Ich formuła szacuje punkt przechylenia, nazywany n, jako liczbę dobrych tokenów—fragmentów słów, które model produkuje jeden po drugim—które pojawiają się przed pierwszym złym. Jeśli rozmowa już skłania się ku złej stronie, model przechyla się natychmiast, z n równym zero. Jeśli skłania się ku dobrej, model dostarcza serię poprawnych odpowiedzi, a następnie się odwraca.

W preprintcie formuła wybrała właściwy przypadek, natychmiastowy lub opóźniony, w 15 z 16 jednoznacznych testów, czyli w 94%. Naukowcy przeprowadzili te testy na sześciu modelach o otwartych wagach, czyli systemach AI, których pliki są publiczne, więc każdy może je pobrać i uruchomić, od OpenAI, EleutherAI i Meta.

Wszystkie sześć miały od 124 milionów do 410 milionów parametrów, czyli regulowanych liczb wewnątrz modelu, które służą jako przybliżona miara jego rozmiaru. Opublikowany artykuł podobno rozszerza test na siedem modeli o maksymalnie 12 miliardach parametrów, co według obecnych standardów wciąż jest niewielkie.

Celem jest AI działająca na urządzeniu, taka, która działa w całości na telefonie lub laptopie bez połączenia z internetem, w tym chatboty towarzyszące, z którymi ludzie rozmawiają jak z przyjacielem. Eksperymentalna aplikacja Google AI Edge Gallery, którą Decrypt testował w zeszłym roku, już pozwala telefonowi z Androidem uruchamiać modele offline, a nic, co się w niej wpisze, nie jest wysyłane na serwery Google, i wydaje się, że to trend, który może rosnąć z czasem, w miarę jak sprzęt staje się coraz potężniejszy, a mniejsze modele AI stają się coraz bardziej zdolne.

Model działający offline nie ma usługi w chmurze sprawdzającej jego wyniki, i to jest luka, którą autorzy chcą zamknąć. Proponują tani monitor, który działa równolegle z modelem i sygnalizuje, gdy n* spadnie poniżej progu bezpieczeństwa, trochę jak lampka ostrzegawcza na desce rozdzielczej samochodu.

BitcoinBTC · USD

$82,986−2.22%

Oct 3Oct 5Oct 7Oct 8Oct 10

$86.7k$84.7k$82.7k$80.7k

24h HighHigh$82,978

24h LowLow$82,229

VolVol$747.7M

→

Kup Bitcoin za USDT

Obsługiwane przez Jupiter

Dane cenowe od CoinGeckoCoinGeckoWięcej Bitcoin wiadomości i prognoz →

Opisują również sposoby na przesunięcie punktu krytycznego poza zasięg, takie jak wstrzyknięcie treści do rozmowy, aby n* znalazło się poza długością odpowiedzi. Zdaniem autorów trening alignmentu, czyli proces uczenia modelu właściwego zachowania, może przesunąć lub stłumić punkt krytyczny dla określonych promptów, ale nie może usunąć leżącego u podstaw mechanizmu.

W kwietniu 2025 roku Decryptomówił wcześniejszy artykuł tej samej pary autorów, pokazujący, że „proszę” i „dziękuję” mają znikomy wpływ na wynik modelu, ponieważ model traktuje uprzejme słowa jako ortogonalne, czyli niezwiązane matematycznie, z istotą prośby. Tamta wersja modelowała pojedynczą, celowo uproszczoną głowę uwagi.

Testy preprintu wykorzystywały małe modele i okno 300 tokenów, czyli kilka krótkich akapitów tekstu, a jego przewidywania mogły się różnić o jeden wynik.