IT之家 7 月 31 日消息,OpenAI 公司今天(7 月 31 日)發(fā)布公告,宣布通過改進(jìn)框架,讓 GPT-5.6 Sol 模型的 ARC-AGI-3 提高了 188%。

IT之家注:ARC-AGI-3 由 ARC Prize 團(tuán)隊(duì)推出的全新交互式推理基準(zhǔn)測試,是目前全球公認(rèn)衡量 AI 通用智能(AGI)最嚴(yán)苛、最頂尖的交互式推理評測基準(zhǔn)。
該基準(zhǔn)完全打破了傳統(tǒng) AI“做題”和知識問答的靜態(tài)測試模式,將 AI 直接扔進(jìn)一個(gè)完全陌生的“游戲環(huán)境”中,來評估其是否具備像人類一樣的實(shí)時(shí)探索、學(xué)習(xí)與自適應(yīng)能力。

在未調(diào)整優(yōu)化前,GPT-5.6 Sol 在 ARC-AGI-3 基準(zhǔn)測試中的得分為 7.8%,而 GPT-5.5 模型的得分只有 0.4%。
OpenAI 公司在復(fù)盤后發(fā)現(xiàn),GPT-5.6 系列模型官方框架存在 2 個(gè)影響 GPT-5.6 Sol 表現(xiàn)的機(jī)制:
第一,每次游戲動(dòng)作后,私有推理都會(huì)被丟棄。這意味著 GPT-5.6 Sol 每執(zhí)行 1 次動(dòng)作后,都需要重新理解游戲。模型仍可看到過去動(dòng)作記錄和簡短備注,但看不到促成這些動(dòng)作的計(jì)劃、洞察和思考過程。
第二,官方框架采用滾動(dòng)截?cái)啻翱?。隨著歷史變長,較早動(dòng)作會(huì)從上下文中消失。也就是說,GPT-5.6 Sol 不僅無法保留過去思考,也會(huì)丟失過去動(dòng)作記憶。
針對上述問題,OpenAI 提出了推理保留(inference preservation)和上下文壓縮(context compression)兩個(gè)解決方案。
推理保留方面,OpenAI 使用 Responses API 重新實(shí)現(xiàn) ARC-AGI-3 測試框架,對于 GPT-5.6,只需傳入前一次 response ID,即可在工具調(diào)用和多輪交互中自動(dòng)保留推理。

OpenAI 表示在啟用推理保留后,GPT-5.6 不必每輪重新解釋游戲,從而減少每次動(dòng)作前花在思考上的時(shí)間,模型保留過去想法后,更善于隨時(shí)間學(xué)習(xí),并采用更連貫的策略。
在上下文壓縮方面,官方 ARC-AGI-3 框架在對話上下文超過 175000 個(gè)字符后,會(huì)丟棄最早消息。OpenAI 稱,滾動(dòng)截?cái)嘤?2 個(gè)缺點(diǎn):模型會(huì)丟失早期觀察和動(dòng)作;模型在任務(wù)的大部分時(shí)間里會(huì)帶著更滿的上下文窗口運(yùn)行,這可能輕微損害表現(xiàn)。
啟用上下文壓縮后,GPT-5.6 Sol 在較長任務(wù)中更能保留對每個(gè)游戲的已學(xué)信息,并以更少輸出 token 獲得更高得分。

而在使用官方 harness 后,GPT-5.6 Sol 在 ARC-AGI-3 的得分為 13.3%;在啟用推理保留(inference preservation)和上下文壓縮(context compression)后,GPT-5.6 Sol 在 Token 輸出數(shù)量降低至六分之一的同時(shí),得分達(dá)到 38.3%,成績增長 188.42%。

harness(常被稱為馭韁工程)是指包在大模型外部、為其提供運(yùn)行環(huán)境、工具集成、規(guī)則約束與反饋機(jī)制的整套系統(tǒng)架構(gòu)。
如果把強(qiáng)大的 AI 模型比作一匹充滿力量但容易失控的烈馬,那么 harness 就是它的韁繩、馬鞍與騎手路線,不改變模型本身的架構(gòu),而是決定模型如何被安全、可靠地駕馭并真正完成復(fù)雜工作。

廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時(shí)間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。