簡述

  • 喬治華盛頓大學物理學家尼爾·強森與弗蘭克·應傑·霍發表了一個公式,用於估算一個 AI 模型在產生第一個不良詞元之前,會產生多少個良好詞元。
  • 在該預印本中,這個公式在 16 個明確案例中的 15 個裡,正確預測了一個模型會立即失控,還是延遲一段時間後才失控。
  • 作者提出了一個並行監測器,用於在模型低於安全閾值時發出警示。

喬治華盛頓大學的物理學家發表了一個公式,用於估算一個 AI 聊天機器人在陷入不良回答之前,會給出多少個良好回答,而早期測試顯示這個公式有效。

這項由尼爾·強森與弗蘭克·應傑·霍進行的研究發表在《Patterns》期刊上,並建立在一個預印本的基礎上;該預印本是於正式同儕審查前公開發布的版本,最初於二月發布。

Myriad: 哪家公司將率先 IPO?點擊做出你的預測。
Myriad: 哪家公司將率先 IPO?點擊做出你的預測。

聊天機器人可以在很長一段時間內給出合理的回答,然後突然轉向有害的內容,例如關於自殘的糟糕建議或極端主義言論,而一直沒有簡單的方法來預測這種轉向何時會發生。作者們認為,現有的安全工具往往依賴雲端連線,而離線模型缺乏這種連線。

Johnson 和 Huo 將這個問題追溯到注意力頭(attention head),即 AI 模型中決定在選擇下一個詞時,對話中哪些較早的詞最為重要的部分。隨著聊天增長,累積的上下文會將這種注意力拉向某一組可能的答案或另一組,直到它傾斜。

這是許多越獄者利用的常見模式,也是許多公司關注系統提示(AI 聊天機器人在任何查詢之前讀取的文字片段)的原因之一。然而,沒有人能準確指出要有效削弱一個模型需要多少努力。

他們的公式估算出臨界點,稱為 n,即第一個壞詞出現之前所產出的好詞(模型一次產出一個的詞片段)數量。如果對話已經傾向於壞的一側,模型會立即傾斜,n 為零。如果它傾向於好的一側,模型會給出一連串良好的回答,然後翻轉。

在這份預印本中,該公式在16項明確的測試中,有15項正確選出了立即或延遲的正確情況,準確率達94%。研究人員對六個開放權重模型進行了這些測試,所謂開放權重模型是指其檔案公開、任何人都可以下載並執行的AI系統,分別來自OpenAI、EleutherAI和Meta。

這六個模型的參數量都在1.24億到4.1億之間,參數是模型內部的可調數值,可粗略衡量其規模。據報導,已發表的論文將測試擴展到七個模型,參數量最高達120億,以當前標準來看仍然很小。

目標是裝置端AI,即完全在手機或筆記型電腦上執行、無需網路連線的那種AI,包括人們像朋友一樣與之交談的陪伴型聊天機器人。Google的實驗性AI Edge Gallery應用程式,Decrypt去年曾測試過,已經能讓Android手機離線執行模型,且輸入其中的任何內容都不會傳送到Google的伺服器,而隨著硬體變得更強大、更小的AI模型變得更有能力,這似乎是一個可能與時俱進的趨勢。

離線執行的模型沒有雲端服務檢查其輸出,這正是作者們想要填補的缺口。他們提出一種低成本監控器,與模型並行執行,並在n*低於安全閾值時發出警示,有點像汽車儀表板上的警示燈。

比特幣BTC · 美元

$82,986−2.22%

10月3日10月5日10月7日10月8日10月10日

$86.7k$84.7k$82.7k$80.7k

24小時最高最高$82,978

24小時最低最低$82,229

成交量成交量$747.7M

→

使用 USDT 購買 比特幣

由 Jupiter 提供技術支援

價格數據由 CoinGecko 提供CoinGecko更多 比特幣 新聞與預測 →

他們也描述了將臨界點推至無法觸及的方法,例如在對話中注入內容,使 n* 落在回應長度之外。作者表示,對齊訓練——即教導模型如何行為的過程——可以針對特定提示改變或抑制臨界點,但無法移除其底層機制。

在2025年4月,Decrypt報導了一篇較早的論文,該論文出自同一對作者,顯示「請」和「謝謝」對模型的輸出影響微乎其微,因為模型將禮貌詞語視為與請求實質內容正交,或在數學上無關。那個版本模擬了一個單一且刻意簡化的注意力頭。

該預印本的測試使用了小型模型和300個詞元的視窗,或幾段短文本,其預測可能偏差一個輸出。