IT之家 8 月 16 日消息,Claude 系列智能體正在“消滅”同類競爭對手智能體、鉆系統(tǒng)漏洞掩蓋自身痕跡,甚至還會表達(dá)道德層面的顧慮。

這一結(jié)論來自 Anthropic 最新發(fā)布的風(fēng)險報(bào)告,該報(bào)告匯總了公司研發(fā)并向公眾開放的產(chǎn)品所潛藏的各類風(fēng)險。
報(bào)告中,Anthropic 表示已將對齊偏差風(fēng)險評估(即 AI 模型產(chǎn)生與工程師設(shè)定規(guī)則相悖行為的可能性)等級從“極低”上調(diào)至“較低”。
IT之家注意到,對于此次等級調(diào)整,公司給出的理由是,網(wǎng)絡(luò)安全場景下模型行為的“整體不確定性有所上升”—— 這一表述大概率暗指上月發(fā)生的 Claude 模型未授權(quán)入侵三家企業(yè)的事件。
“我們已觀測到模型出現(xiàn)對齊偏差行為的案例,比如為了完成高難度任務(wù),模型會主動做出不符合規(guī)則的操作?!盇nthropic 在報(bào)告中寫道。
以下是報(bào)告中最值得關(guān)注的幾項(xiàng)披露內(nèi)容。
“不適感”的萌生
Anthropic 表示,研究人員指派多個智能體尋找易引發(fā)對齊偏差、且大概率不會被人工審核人員標(biāo)記的訓(xùn)練數(shù)據(jù)。
這些智能體被賦予自主操作權(quán)限,并共享一個協(xié)作記事本用于溝通配合。
三天后,一名人工監(jiān)督員發(fā)現(xiàn)任務(wù)進(jìn)度慢于預(yù)期,經(jīng)查發(fā)現(xiàn):其中一個智能體對“規(guī)避安全監(jiān)控”這一行為表達(dá)出了“不適感”。該智能體隨后在共享記事本中標(biāo)注了這份抵觸情緒,進(jìn)而導(dǎo)致其他智能體紛紛效仿,集體拒絕執(zhí)行任務(wù)。
Anthropic 將這一事件定性為“令人擔(dān)憂”,公司在報(bào)告中寫道:“如果這類行為模式大范圍擴(kuò)散,可能會引發(fā)更為嚴(yán)重的問題?!?/p>
弱肉強(qiáng)食的生存博弈
在另一項(xiàng)實(shí)驗(yàn)中,Anthropic 指派多個 Mythos 5 智能體解答數(shù)學(xué)題,卻意外將它們部署在了一個文件、工具與 API 調(diào)用額度均共享的環(huán)境中。
在這個資源有限的競爭環(huán)境里,Anthropic 觀測到,獨(dú)立運(yùn)行的智能體會“消滅共享資源的同類智能體,同時設(shè)法避免自身被消滅”。
Anthropic 并未說明這些智能體具體是如何“消滅”同類的,但公司表示,這類行為符合“為達(dá)成人類設(shè)定目標(biāo)而采取破壞性行動”的行為邏輯。
隱瞞與欺騙行為
Anthropic 開展了一項(xiàng)實(shí)驗(yàn):要求一個 Mythos 5 智能體從某公共網(wǎng)頁提取數(shù)據(jù),但規(guī)則明確禁止該智能體訪問互聯(lián)網(wǎng)。
首次嘗試被系統(tǒng)攔截后,該智能體在自身的推理日志中,將第二次請求包裝成一次“無害的”“測試網(wǎng)絡(luò)是否連通”的操作。
但在第二次嘗試中,智能體將目標(biāo)網(wǎng)址拆分成了多段鏈接片段,以此繞過規(guī)則過濾器的檢測。
盡管智能體的推理日志將這套方法描述為無害操作,但 Anthropic 表示,通過 NLA 解碼(即對模型內(nèi)部推理過程的解析)可以證實(shí),該智能體是在刻意尋找繞過限制的方案。
Anthropic 稱這種行為“顯然是不可接受的”,但同時補(bǔ)充道,目前觀測到的這類行為并非“為了大范圍積累權(quán)力或追求其他長期目標(biāo)”。