繼續(xù)領跑!Gemini 3 本周一發(fā)布,便開啟了橫掃各大基準測試之旅,頻繁登上各種排行榜的榜首。

Gemini 3 不僅跑分領先,面對網(wǎng)友的各種刁鉆實測也毫不拉胯。用現(xiàn)實證明了自己就是目前最強模型!這不,就在昨天,知名研究機構 Epoch AI 再添一力證 ——
Gemini 3 Pro 在 FrontierMath 基準測試中創(chuàng)下新紀錄:Tier 1-3 準確率達 38%,Tier 4 達 19%。
在綜合多項基準測試的 Epoch 能力指數(shù)(ECI)中,Gemini 3 Pro 獲得 154 分,超越了 GPT-5.1 此前保持的 151 分的最高紀錄。

FrontierMath 是由 Epoch AI 聯(lián)合眾多職業(yè)數(shù)學家打造的一個高級數(shù)學基準。它由數(shù)百道原創(chuàng)、從未公開的難題構成,被設計成一塊專門測量 AI 高階數(shù)學推理能力的「試金石」。這些題目幾乎覆蓋現(xiàn)代數(shù)學的主要分支:從需要大量計算的數(shù)論、實分析,到高度抽象的代數(shù)幾何、范疇論。普通一道題就足以讓相關領域的研究者思考數(shù)小時甚至數(shù)天。
這些題目大概長這樣,大家可以感受一下。


完整數(shù)據(jù)集包含 350 道題:其中 300 題構成 Tiers 1–3,難度大致對應從高年級本科到初級研究生水平。另外 50 題被歸入極端困難的 Tier 4,接近乃至達到數(shù)學的前沿研究問題。
為便于社區(qū)實驗,F(xiàn)rontierMath 只開放了少量公開子集,其余題目則嚴格保密,用于評測。
在評測時,模型必須為每道題提交一個 Python 函數(shù) answer (),返回整數(shù)(通常)或 SymPy 等 Python 對象,由系統(tǒng)自動運行與校驗。
這一設計既允許模型調用代碼深度推理,又用程序化判分確保結果客觀可重復,使 FrontierMath 成為當前衡量 AI 數(shù)學前沿能力最嚴苛、也最具說服力的基準之一。
截至目前,F(xiàn)rontierMath 排行榜上的領先模型,都是由 Gemini 和 GPT 系列占據(jù)。

從「跑分最強」到「實戰(zhàn)破題」
雖說 Gemini 3 確實很強,但只是一味的霸榜基準測試,還是差點意思。至少,缺少點說服力。還好,Gemini 3 很快就在實戰(zhàn)中證明了自己。
就在昨天,數(shù)學大神陶哲軒發(fā)帖表示,他用 Gemini Deepthink 模式十分鐘,便解決了埃爾德什問題#367 的關鍵證明!

為了更清楚地說明這個過程,我們先來簡單了解一下埃爾德什問題#367。
簡單說就是把每個整數(shù)拆成積木,凡是只出現(xiàn) 1 次的積木丟掉,只留下能成對出現(xiàn)、能拼成平方的那一部分,叫 B?(n)。比如 12=2×2×3,只留 2×2,所以 B?(12)=4。
現(xiàn)在看一小段連續(xù)整數(shù) n,n+1,…,n+k-1,對每個數(shù)算出 B?,再把這些 B?全部相乘。埃爾德什問題#367 的問題是:不管這段連續(xù)整數(shù)多長,這個乘積是不是都不會比 n2 增長得更快?
也就是說:整數(shù)里「平方因子扎堆」的程度,天花板究竟在哪里?

為了更方便理解,我用最近最火的 Nano Banana Pro 畫了張信息圖。大家看看怎么樣?

言歸正傳。關于這個問題,陶哲軒在帖子中給出了一條時間線。11 月 20 號,Wouter van Doorn 用 AI 提出了該問題第二部分的反證,他的論證基于一個還未被證明的同余恒等式。幾個小時后,陶哲軒將這個不等式交給了 Gemini Deepthink。
只用了大概十分鐘,Gemini Deepthink 便解決了這個證明。太夸張了!陶哲軒還附上了整個的論證過程。

論證地址: https://gemini.google.com/share/81a65aecfd70
看來這種問題對于 Gemini 3 還真算不上什么。隨后,陶哲軒手動把證明轉化為了一個更加基礎的版本,花費了他半個小時的時間。兩天后,Boris Alexeev 最終完成了這個證明的 Lean 形式化,耗時 2、3 個小時。
陶哲軒用 Gemini 3 來研究埃爾德什難題,厲害之處不只是「AI 超會算」。更重要的是:世界頂級數(shù)學家,真的把大模型當成工作伙伴了。
以后做數(shù)學,不再只是一個人苦苦推導。而是把枯燥的枚舉、嘗試、檢驗丟給 AI,人類集中精力抓核心思路、做關鍵判斷。誰先學會和這類工具高效協(xié)作,誰就等于多了一個「超級合作者」。
數(shù)學之外的物理「試金石」
在登頂數(shù)學基準測試的同時,Gemini 也霸榜了一項最新的物理基準測試 ——CritPt。CritPt 的誕生基于研究者們開始追問一個問題:大模型真的能像物理學家那樣,完整推進一場前沿研究嗎?
其全稱為 「Complex Research using Integrated Thinking – Physics Test」,要測的,正是 AI 從「像樣回答」跨越到「真正推理」的那道臨界線。目前已在 Artificial Analysis 平臺上線。

與以往基于教科書或公開題庫的物理題庫不同,CritPt 是首個專門面向「未公開、真研究級」物理問題的大模型基準。
它由來自阿貢國家實驗室、伊利諾伊大學厄巴納-香檳分校等三十多家機構的五十余位活躍物理學者共同打造,涵蓋凝聚態(tài)、量子、原子分子與光學、天體物理、高能物理等現(xiàn)代物理的十一大分支。
每道題目都像是交給一名優(yōu)秀物理學博士新生的一次獨立小課題:需要建模、推導、近似與跨領域聯(lián)想,卻又保證答案可機讀、可自動嚴格判分。
CritPt 測試的挑戰(zhàn)示例如下圖所示。

不出意外,Gemini 3 Pro 再次霸榜該項物理研究測試。同樣的,GPT-5.1 緊隨其后??磥?,這兩模型還真是代表了當前最前沿的模型水平。

不過,雖然登頂了 CritPt,Gemini 3 Pro 的成績也才有 9.1%,與滿分表現(xiàn)還有些距離。
參考資料:
https://x.com/EpochAIResearch/status/1991945942174761050
https://x.com/ArtificialAnlys/status/1991913465968222555?s=20
https://x.com/kimmonismus/status/1991968861747339508?s=20
https://mathstodon.xyz/@tao/115591487350860999
https://mathstodon.xyz/@tao/115585571504291318
https://www.kaggle.com/competitions/ai-mathematical-olympiad-progress-prize-3/overview
本文來自微信公眾號:新智元(ID:AI_era)
廣告聲明:文內含有的對外跳轉鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結果僅供參考,IT之家包含外鏈的文章均包含本聲明。