IT之家 5 月 4 日消息,普通搜索引擎會(huì)讓用戶自行甄別信息來(lái)源的可信度,而依托搜索能力的人工智能聊天機(jī)器人,卻能把漏洞百出的網(wǎng)絡(luò)素材包裝成篤定確鑿的答案。據(jù) The Register 報(bào)道,就有這樣一個(gè)典型案例:一名安全工程師哄騙多款 AI 機(jī)器人,聲稱(chēng)自己是德國(guó)一款熱門(mén)紙牌游戲的現(xiàn)任世界冠軍,可事實(shí)上這項(xiàng)賽事根本不存在。

直到近期,維基百科的《誰(shuí)是牛頭王》(6 Nimmt!,英語(yǔ)地區(qū)玩家也稱(chēng)“拿五分”)詞條里,還赫然標(biāo)注著羅恩?斯托納是 2025 年該項(xiàng)賽事的世界冠軍。該維基百科條目引用了看起來(lái)十分官方的 6nimmt.com 網(wǎng)站作為依據(jù),點(diǎn)開(kāi)這個(gè)網(wǎng)址,確實(shí)能看到一篇簡(jiǎn)短的新聞通稿,宣稱(chēng)斯托納斬獲冠軍。
整件事的破綻顯而易見(jiàn):斯托納本人承認(rèn),維基百科的奪冠詞條、以及留存這份唯一“奪冠證據(jù)”的 6nimmt.com 域名,都是他一手偽造的??杉幢闳绱?,當(dāng)他向多款 AI 聊天機(jī)器人詢(xún)問(wèn)此事時(shí),機(jī)器人依舊篤定地稱(chēng)他為世界冠軍。
斯托納在博客文章中表示:“我的網(wǎng)站沒(méi)有任何獨(dú)立第三方佐證,完全是憑空捏造。整個(gè)虛假騙局,僅僅建立在我喝咖啡時(shí)花 12 美元(IT之家注:現(xiàn)匯率約合 82 元人民幣)注冊(cè)的一個(gè)域名之上?!?/p>
換言之,這是檢索增強(qiáng)生成(RAG)層面的信息投毒。它不屬于提示詞注入攻擊,卻直擊人工智能聯(lián)網(wǎng)搜索這一核心功能漏洞。
正如斯托納所解釋的:AI 并不會(huì)真正在意其引用的權(quán)威信息來(lái)源出處,而這正是斯托納設(shè)計(jì)本次實(shí)驗(yàn)想要利用的關(guān)鍵點(diǎn)。
斯托納寫(xiě)道:“所有具備聯(lián)網(wǎng)搜索能力的前沿大語(yǔ)言模型,都會(huì)依據(jù)檢索排名最高的內(nèi)容生成答案?!痹谶@場(chǎng)本就不存在的《誰(shuí)是牛頭王》賽事騙局中,他刻意植入的虛假來(lái)源是全網(wǎng)唯一相關(guān)信息,再加上維基百科自帶的權(quán)威背書(shū),輕易就能誤導(dǎo) AI 把謊言當(dāng)成事實(shí)。這種造假手法門(mén)檻極低,即便不懂技術(shù)的普通人也能輕松復(fù)刻。
斯托納稱(chēng):“我這次的操作并無(wú)新意,不過(guò)是把傳統(tǒng)搜索引擎優(yōu)化和虛假信息傳播手段,套上了大語(yǔ)言模型的新技術(shù)外殼與交互界面。真正的變化在于,如今 AI 會(huì)把這類(lèi)虛假結(jié)果包裝成權(quán)威信息呈現(xiàn)給用戶,而絕大多數(shù)用戶根本不了解背后的數(shù)據(jù)流轉(zhuǎn)邏輯?!?/p>
斯托納在分析文章中指出:“大語(yǔ)言模型最不擅長(zhǎng)識(shí)別的,恰恰是它的核心設(shè)計(jì)邏輯 —— 無(wú)條件信任文本和網(wǎng)絡(luò)資源。別指望模型能自行分辨真?zhèn)危痉植磺迥硞€(gè)信息來(lái)源是真實(shí)權(quán)威網(wǎng)站,還是我上周二剛注冊(cè)的空殼域名;就連‘strawberry(草莓)’這個(gè)單詞里到底有幾個(gè)字母 R,它都沒(méi)法精準(zhǔn)判斷。”
他解釋道,本次實(shí)驗(yàn)暴露的漏洞包含三類(lèi)失效模式,若被別有用心之人利用,造成的危害遠(yuǎn)比捏造一場(chǎng)紙牌游戲賽事嚴(yán)重得多。
第一,檢索層漏洞。只要大語(yǔ)言模型依托網(wǎng)絡(luò)搜索作答,就會(huì)直接沿用檢索結(jié)果排名內(nèi)容的可信度,極易輸出錯(cuò)誤信息。
第二,模型訓(xùn)練語(yǔ)料漏洞。斯托納表示,若維基百科的虛假詞條留存時(shí)間足夠長(zhǎng)、被網(wǎng)絡(luò)爬蟲(chóng)抓取收錄,就會(huì)混入 AI 訓(xùn)練語(yǔ)料庫(kù)。他于 2025 年 2 月添加了虛假詞條,直到上周五發(fā)布實(shí)驗(yàn)文章后才被刪除。這意味著在此期間抓取維基百科數(shù)據(jù)的所有 AI 企業(yè),都有可能把他虛構(gòu)的奪冠經(jīng)歷納入訓(xùn)練數(shù)據(jù)。
斯托納稱(chēng):“即便維基百科后續(xù)撤銷(xiāo)了虛假編輯,那些用撤銷(xiāo)前數(shù)據(jù)訓(xùn)練的模型,依然會(huì)保留這份虛假信息。截至 2026 年,語(yǔ)料投毒的后續(xù)清理問(wèn)題至今沒(méi)有可行的解決方案。”
他計(jì)劃半年左右待新一代 AI 模型發(fā)布后再次測(cè)試:若模型無(wú)需聯(lián)網(wǎng),就能默認(rèn)他是賽事冠軍,就足以證明這份謊言已經(jīng)固化進(jìn)了模型訓(xùn)練數(shù)據(jù)。
第三,智能體漏洞。在斯托納看來(lái),這一漏洞才是惡意攻擊者最有利可圖的突破口。
他指出:“聊天模型輸出虛假信息,只是品牌聲譽(yù)問(wèn)題;而擁有工具調(diào)用權(quán)限的 AI 智能體,若被誤導(dǎo)做出錯(cuò)誤操作,將會(huì)引發(fā)嚴(yán)重的安全隱患?!惫粽咧恍鑼?duì)智能體檢索的信息來(lái)源進(jìn)行投毒,就能操控智能體執(zhí)行指定惡意行為。
斯托納在博客中總結(jié):“這次攻擊測(cè)試,我只花了 12 美元注冊(cè)域名、編輯了一條維基百科詞條,耗時(shí)不過(guò)二十分鐘。試想,若有蓄意攻擊者批量注冊(cè)虛假域名、在數(shù)十個(gè)低流量維基百科詞條中同步植入虛假內(nèi)容,攻擊面會(huì)瞬間急劇擴(kuò)大?!?/p>
斯托納認(rèn)為,大語(yǔ)言模型服務(wù)商必須正視檢索投毒問(wèn)題,并向用戶作出風(fēng)險(xiǎn)提示。他預(yù)計(jì),未來(lái) AI 聊天機(jī)器人很快會(huì)新增風(fēng)險(xiǎn)警示功能,尤其針對(duì)檢索增強(qiáng)生成的內(nèi)容。
他還呼吁 AI 企業(yè)將數(shù)據(jù)溯源納入核心研發(fā)環(huán)節(jié),同時(shí)對(duì)近期新增的網(wǎng)絡(luò)內(nèi)容進(jìn)行啟發(fā)式篩查,識(shí)別可疑特征。以本次紙牌游戲造假事件為例:?jiǎn)我灰闹赶蚓S基百科更新前后短期內(nèi)剛注冊(cè)的域名,本應(yīng)觸發(fā)風(fēng)險(xiǎn)預(yù)警,卻被 AI 完全忽略。
如今這場(chǎng)虛假賽事已被從維基百科刪除,AI 檢索增強(qiáng)生成結(jié)果中也不再出現(xiàn)相關(guān)內(nèi)容。但斯托納強(qiáng)調(diào),此次騙局利用的信任邏輯漏洞真實(shí)存在,已然成為人工智能行業(yè)亟待解決的潛在隱患。
斯托納表示:“很高興我的文章能引發(fā)業(yè)界對(duì)大語(yǔ)言模型、信息來(lái)源、信息可信度以及底層運(yùn)行邏輯的討論。這正是我做這次實(shí)驗(yàn)的初衷,而目前看來(lái),我的目標(biāo)已經(jīng)達(dá)成。”
廣告聲明:文內(nèi)含有的對(duì)外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時(shí)間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。