IT之家 7 月 24 日消息,Artificial Analysis 于 7 月 22 日更新 AI 智能體知識(shí)工作基準(zhǔn) AA-Briefcase,顯示 Kimi K3 模型斬獲 1543 分,超過 GPT-5.6 Sol(1501 分),僅次于 Claude Fable 5 模型(1574 分)。
IT之家注:AA-Briefcase 是獨(dú)立 AI 評測機(jī)構(gòu) Artificial Analysis 于 2026 年 6 月推出的全新前沿 AI 智能體(Agent)知識(shí)工作基準(zhǔn)測試。
它專為評估 AI 在處理長周期、高復(fù)雜度真實(shí)業(yè)務(wù)中的表現(xiàn)而設(shè)計(jì),模擬企業(yè)中真實(shí)且混亂的辦公環(huán)境,測試數(shù)據(jù)科學(xué)、產(chǎn)品管理、企業(yè)戰(zhàn)略等場景,處理海量碎片化上下文(包括 25000+ 條 Slack 消息、3500+ 封電子郵件、會(huì)議紀(jì)要和財(cái)務(wù)報(bào)表等),并要求生成 Excel 財(cái)務(wù)模型、董事會(huì)匯報(bào) PPT 等實(shí)際的商務(wù)交付物。

根據(jù)最新跑分結(jié)果顯示,Kimi K3 模型在 AA-Briefcase 上的跑分達(dá)到 1543 分,僅次于 Claude Fable 5(1574 分),超過 GPT-5.6 Sol (最高 1501)、Claude Sonnet 5 (最高 1388) 和 Claude Opus 4.8 (最高 1347)。相比較而言 Kimi K2.6 模型在榜單上的成績?yōu)?816 分。



延伸閱讀
Kimi K3 模型由月之暗面(Moonshot AI)于 2026 年 7 月 16 日正式上線,是其迄今為止最強(qiáng)的旗艦?zāi)P停瑩碛?2.8 萬億參數(shù)和 100 萬 Tokens 的上下文窗口,尤其擅長編程、游戲 / 3D 與知識(shí)類任務(wù)。
在編程能力方面,Kimi K3 在 Frontend Code Arena 基準(zhǔn)測試中曾以 1679 分超越 Claude Fable 5 登頂,在品牌營銷、數(shù)據(jù)分析等七個(gè)前端領(lǐng)域中的六個(gè)位居第一。
Kimi K3 模型采用按量計(jì)費(fèi),每 100 萬 Tokens 的輸入費(fèi)用在緩存命中時(shí)為 2 元,未命中時(shí)為 20 元,輸出費(fèi)用為 100 元。
近期有報(bào)道稱,微軟正在內(nèi)部測試 Kimi K3 模型,并評估將其部分接入 Copilot AI 助手的可行性,以降低推理成本。
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時(shí)間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。