IT之家 7 月 27 日消息,Arena(arena.ai)平臺今日發(fā)布了 2026 年第 30 周的 AI 大模型排行數據,統計周期為 2026-07-20 ~ 2026-07-26。
本周國產模型表現亮眼,月之暗面旗下的 kimi-k3 蟬聯前端開發(fā)榜全球第一,同時代碼榜殺入 Top 10,成為本期最大亮點。
整體榜單中 Anthropic 旗下多款 Claude 新模型集中入榜,頭部梯隊集中在 1500 分區(qū)間,國產模型在多個細分賽道持續(xù)實現突破,不少模型進入對應榜單的頭部序列,整體競爭力穩(wěn)步提升。
綜合榜
綜合榜頭部格局保持穩(wěn)定,claude-fable-5 以 1508 分繼續(xù)蟬聯榜首,Anthropic 旗下多款 Claude 系列模型占據前 6 名位置,其中 claude-opus-4-6-thinking、claude-opus-4-7-thinking 等多款新模型完成入榜。
前 7 名模型的 ELO 分差均在 30 分以內,在誤差范圍內視為并列競爭狀態(tài)。Meta 的 muse-spark-1.1 和 muse-spark 分別位列第 7 和第 8,谷歌的 gemini-3.1-pro-preview 上升 2 位來到第 9,前 10 名整體競爭十分膠著。
國產模型在綜合榜中整體處于中上游位置,梯隊相對完整:
月之暗面 kimi-k3 位列第 11 名,ELO 1485 分,較上周下降 2 位,是當前排名最高的國產模型;
阿里 qwen3.7-max-preview 位列第 20 名,ELO 1475 分,較上周下降 2 位;
智譜 glm-5.1 此前排名第 27,本周位列第 31 名;
智譜 glm-5.2 (max) 此前排名第 30,本周排名不變。
| 排名 | 模型 | 廠商 | 分數 (±CI) | 票數 | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 — | ???? claude-fable-5 | Anthropic | 1508 ±6 | 15817 | $10 / $50 | 1M |
| 2 — | ???? claude-opus-4-6-thinking | Anthropic | 1505 ±4 | 64435 | $5 / $25 | 1M |
| 3 — | ???? claude-opus-4-7-thinking | Anthropic | 1502 ±4 | 51943 | $5 / $25 | 1M |
| 4 — | ???? claude-opus-4-6 | Anthropic | 1498 ±4 | 68145 | $5 / $25 | 1M |
| 5 — | ???? claude-opus-5-high | Anthropic | 1495 ±8 | 5417 | $5 / $25 | 1M |
| 6 — | ???? claude-opus-4-7 | Anthropic | 1493 ±4 | 53093 | $5 / $25 | 1M |
| 7 — | ???? muse-spark-1.1 | Meta | 1493 ±7 | 9573 | $1.25 / $4.25 | N/A |
| 8 — | ???? muse-spark | Meta | 1488 ±6 | 13497 | N/A | N/A |
| 9 ↑2 | ???? gemini-3.1-pro-preview | 谷歌 | 1486 ±3 | 86298 | $2 / $12 | 1.05M |
| 10 ↓2 | ???? gemini-3-pro | 谷歌 | 1486 ±4 | 41242 | $2 / $12 | 1.05M |
| — 以下為 Top 10 外的國產模型 — | ||||||
| 11 ↓2 | ???? kimi-k3 預發(fā)布 | 月之暗面 | 1485 ±10 | 3569 | $3 / $15 | 1.05M |
| 20 ↓2 | ???? qwen3.7-max-preview | 阿里 | 1475 ±10 | 3698 | $1.48 / $4.43 | 1M |
| 30 — | ???? glm-5.2 (max) | 智譜 | 1469 ±6 | 19623 | $1.40 / $4.40 | 1M |
| 31 ↓4 | ???? glm-5.1 | 智譜 | 1469 ±5 | 32221 | $1.40 / $4.40 | 202.8K |
代碼榜
代碼榜頭部依然由 Anthropic 旗下模型主導,claude-opus-4-7-thinking 以 1553 分守住榜首位置,前 5 名全部為 Anthropic Claude 系列模型,分差均在 5 分以內,競爭十分接近。
本期最大亮點是國產模型 kimi-k3 排名上升 2 位來到第 8 名,以 1530 分躋身代碼榜 Top 10,與周邊頭部模型的分差也在 30 分的統計誤差范圍內,完全具備第一梯隊的競爭力。
國產模型在代碼榜中分布廣泛,多個模型進入中上游序列,表現穩(wěn)定:
月之暗面 kimi-k3 排名第 8 名,ELO 1530 分,較上周上升 2 位,是排名最高的國產代碼模型;
阿里 qwen3.7-max-preview 排名第 15 名,ELO 1525 分,較上周下降 3 位;
智譜 glm-5.1 排名第 21 名,ELO 1520 分,較上周下降 4 位;
小米 mimo-v2.5-pro 排名第 24 名,ELO 1519 分,與上周排名相同;
月之暗面 kimi-k2.6 排名第 28 名,ELO 1515 分,較上周下降 2 位;
百度 ernie-5.1 此前排名第 27,本周來到第 31 位。
| 排名 | 模型 | 廠商 | 分數 (±CI) | 票數 | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 — | ???? claude-opus-4-7-thinking | Anthropic | 1553 ±7 | 14800 | $5 / $25 | 1M |
| 2 — | ???? claude-fable-5 | Anthropic | 1551 ±10 | 4278 | $10 / $50 | 1M |
| 3 ↑2 | ???? claude-opus-4-6-thinking | Anthropic | 1550 ±6 | 16646 | $5 / $25 | 1M |
| 4 ↑1 | ???? claude-opus-4-7 | Anthropic | 1549 ±6 | 15069 | $5 / $25 | 1M |
| 5 ↓1 | ???? claude-opus-4-6 | Anthropic | 1548 ±6 | 18952 | $5 / $25 | 1M |
| 6 — | ???? claude-opus-5-high | Anthropic | 1540 ±17 | 1405 | $5 / $25 | 1M |
| 7 ↓1 | ???? claude-opus-4-8-thinking | Anthropic | 1535 ±8 | 9039 | $5 / $25 | 1M |
| 8 ↑2 | ???? kimi-k3 預發(fā)布 | 月之暗面 | 1530 ±20 | 948 | $3 / $15 | 1.05M |
| 9 ↓1 | ???? muse-spark-1.1 | Meta | 1530 ±12 | 2860 | $1.25 / $4.25 | N/A |
| 10 ↑1 | ???? claude-opus-4-5-20251101-thinking-32k | Anthropic | 1530 ±7 | 7606 | $5 / $25 | 200K |
| — 以下為 Top 10 外的國產模型 — | ||||||
| 15 ↓3 | ???? qwen3.7-max-preview | 阿里 | 1525 ±18 | 1113 | $1.48 / $4.43 | 1M |
| 21 ↓4 | ???? glm-5.1 | 智譜 | 1520 ±7 | 9070 | $1.4 / $4.4 | 202.8K |
| 24 — | ???? mimo-v2.5-pro | 小米 | 1519 ±7 | 11974 | $0.44 / $0.87 | 1.05M |
| 28 ↓2 | ???? kimi-k2.6 | 月之暗面 | 1515 ±7 | 10342 | $0.95 / $4 | 262.1K |
| 31 ↓4 | ???? ernie-5.1 | 百度 | 1514±7 | 10243 | ||
前端開發(fā)榜
前端開發(fā)榜迎來歷史性突破,國產模型 kimi-k3 以 1682 分衛(wèi)冕榜首位置(上周 1679 分),超過了此前排名第一的 claude-opus-5-high,成為全球當前前端開發(fā)能力最強的大模型。
Anthropic 的 claude-opus-5-high 以 1673 分緊隨其后位列第 2,claude-fable-5 落到第 3 名,OpenAI 的 gpt-5.6-sol-xhigh 排在第 4 名。
前 4 名之外的模型分數差距開始拉開,智譜的 glm-5.2 (max) 也進入了第 5 名,繼續(xù)擴大國產模型在前端開發(fā)賽道的優(yōu)勢。
國產模型在前端開發(fā)榜中形成了龐大的梯隊,近半數席位被國產模型占據,整體表現亮眼:
月之暗面 kimi-k3 登頂榜首,ELO 1682 分,與上周排名相同,是本期榜單最大亮點;
智譜 glm-5.2 (max) 排在第 5 名,ELO 1587 分,較上周下降 1 位;
字節(jié)跳動 seed-2.1-pro-preview 排在第 15 名,ELO 1529 分,較上周下降 1 位;
智譜 glm-5.1 排在第 18 名,ELO 1518 分,較上周下降 3 位;
騰訊 hy3 排在第 19 名,ELO 1518 分;
阿里 qwen3.7-max-20260517 排在第 20 名,ELO 1517 分;
月之暗面 kimi-k2.6 排在第 21 名,ELO 1510 分,較上周下降 3 位;
Minimax minimax-m3 排在第 24 名,ELO 1493 分;
阿里 qwen3.6-max-preview 排在第 28 名,ELO 1478 分;
小米 mimo-v2.5-pro 排在第 29 名,ELO 1474 分;
月之暗面 kimi-k2.7-code 排在第 30 名,ELO 1473 分。
| 排名 | 模型 | 廠商 | 分數 (±CI) | 票數 | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 — | ???? kimi-k3 預發(fā)布 | 月之暗面 | 1682 ±13 | 3776 | $3 / $15 | 1.05M |
| 2 — | ???? claude-opus-5-high | Anthropic | 1673 ±14 | 2392 | $5 / $25 | 1M |
| 3 ↓1 | ???? claude-fable-5 | Anthropic | 1629 ±10 | 5721 | $10 / $50 | 1M |
| 4 ↓1 | ???? gpt-5.6-sol-xhigh (codex-harness) | OpenAI | 1625 ±10 | 5242 | $5 / $30 | 1.05M |
| 5 ↓1 | ???? glm-5.2 (max) | 智譜 | 1587 ±9 | 5700 | $1.4 / $4.4 | 1M |
| 6 ↑1 | ???? claude-opus-4-8-thinking | Anthropic | 1568 ±8 | 8247 | $5 / $25 | 1M |
| 7 ↑1 | ???? claude-opus-4-7 | Anthropic | 1559 ±7 | 11050 | $5 / $25 | 1M |
| 8 ↑1 | ???? claude-opus-4-7-thinking | Anthropic | 1557 ±7 | 11661 | $5 / $25 | 1M |
| 9 ↓3 | ???? grok-4.5 | SpaceXAI | 1549 ±11 | 3314 | $2 / $6 | 500K |
| 10 ↑1 | ???? claude-opus-4-6-thinking | Anthropic | 1546 ±6 | 13607 | $5 / $25 | 1M |
| — 以下為 Top 10 外的國產模型 — | ||||||
| 15 ↓1 | ???? seed-2.1-pro-preview 預發(fā)布 | 字節(jié)跳動 | 1529 ±10 | 4916 | N/A | N/A |
| 18 ↓3 | ???? glm-5.1 | 智譜 | 1518 ±8 | 6737 | $1.4 / $4.4 | 202.8K |
| 19 | ???? hy3 | 騰訊 | 1518 ±17 | 1490 | $0.13 / $0.53 | 262.1K |
| 20 | ???? qwen3.7-max-20260517 | 阿里 | 1517 ±8 | 7267 | $1.48 / $4.43 | 1M |
| 21 ↓3 | ???? kimi-k2.6 | 月之暗面 | 1510 ±8 | 9263 | $0.95 / $4 | 262.1K |
智能體榜
智能體榜頭部由 Claude Fable 5 (High) 以 12.72% 的凈提升度守住榜首,該模型的可控性也達到了 14.62%,位列全榜第一。
OpenAI 的 GPT 5.6 Sol (xHigh) 以 10.12% 的凈提升度緊隨其后排在第 2,Anthropic 的 Claude Opus 4.8 (Thinking) 排在第 3 名。
國產模型 kimi-k3 排名第 4,凈提升度 9.71%,其任務確認成功率達到了 14.0%,是榜單所有頭部模型中最高的表現,任務完成反饋表現突出。
國產模型在智能體榜中覆蓋了從頭部到中下游的大量席位,梯隊十分完整:
月之暗面 kimi-k3 排名第 4 名,凈提升度 9.71%,任務確認成功率 14.0%,是排名最高的國產智能體模型;
智譜 GLM 5.2 (Max) 排名第 10 名,凈提升度 6.5%,任務確認成功率 8.65%;
智譜 GLM 5.1 排名第 17 名,凈提升度 1.43%;
阿里 Qwen3.7 Max 排名第 19 名,凈提升度 0.09%;
阿里 Qwen3.7 Plus 排名第 21 名,凈提升度 0.76%,工具幻覺率僅 0.3% 為全榜最低;
月之暗面 Kimi K2.7 Code 排名第 22 名,凈提升度 1.02%;
深度求索 DeepSeek V4 Pro 排名第 24 名,凈提升度 1.19%;
騰訊 Hy3 排名第 25 名,凈提升度 2.23%;
月之暗面 Kimi K2.6 排名第 26 名,凈提升度 2.57%;
Minimax Minimax M3 排名第 27 名,凈提升度 3.1%;
小米 Mimo V2.5 Pro 排名第 28 名,凈提升度 3.39%。
| 排名 | 模型 | 廠商 | 凈提升度 (±CI) | 任務確認成功率 | 好評 / 差評比 | 可控性 | 會話數 |
|---|---|---|---|---|---|---|---|
| 1 — | ???? Claude Fable 5 (High) | Anthropic | 12.72% ±2.0% | 10.67% | 23.94% | 14.62% | 23549 |
| 2 — | ???? GPT 5.6 Sol (xHigh) | OpenAI | 10.12% ±1.69% | 7.25% | 23.53% | 9.71% | 15991 |
| 3 — | ???? Claude Opus 4.8 (Thinking) | Anthropic | 9.75% ±1.39% | 8.9% | 19.42% | 9.78% | 34147 |
| 4 — | ???? Kimi K3 | 月之暗面 | 9.71% ±1.52% | 14.0% | 20.3% | 6.52% | 11490 |
| 5 — | ???? Claude Sonnet 5 (High) | Anthropic | 8.66% ±1.89% | 8.14% | 16.88% | 6.2% | 24359 |
| 6 ↓2 | ???? GPT 5.5 (xHigh) | OpenAI | 8.41% ±0.87% | 6.65% | 11.08% | 8.18% | 40667 |
| 7 ↑1 | ???? Claude Opus 4.7 (Thinking) | Anthropic | 7.94% ±1.24% | 5.67% | 11.55% | 8.62% | 35151 |
| 8 ↑1 | ???? Claude Opus 4.7 | Anthropic | 7.67% ±1.25% | 4.97% | 12.48% | 8.95% | 35672 |
| 9 ↓1 | ???? GPT 5.5 (High) | OpenAI | 7.61% ±0.81% | 6.2% | 9.8% | 8.77% | 65859 |
| 10 ↑1 | ???? GLM 5.2 (Max) | 智譜 | 6.5% ±1.0% | 8.65% | 12.94% | 4.71% | 38221 |
| — 以下為 Top 10 外的國產模型 — | |||||||
| 17 — | ???? GLM 5.1 | 智譜 | 1.43% ±0.78% | 1.12% | 0.99% | 0.15% | 57532 |
| 19 — | ???? Qwen3.7 Max | 阿里 | 0.09% ±1.07% | 1.84% | 5.73% | 0.02% | 15992 |
AI 生圖 & AI 視頻榜
AI 生圖榜頭部格局穩(wěn)定,OpenAI 的 gpt-image-2 (medium) 以 1385 分繼續(xù)穩(wěn)居第一,字節(jié)跳動 seedream-5.0-pro 作為排名最高的國產模型,排在第 11 名,ELO 1231 分,整體表現處于中上游位置。
AI 視頻榜方面,谷歌 gemini-omni-flash 守住榜首,字節(jié)跳動 dreamina-seedance-2.0-720p 排在第 2 名,阿里 happyhorse-1.0 排在第 4 名,國產視頻模型直接占據了前 4 名中的兩個席位,后續(xù)字節(jié)跳動、阿里、MiniMax 的多款模型也分布在榜單中下游,形成了完整的國產視頻模型梯隊,競爭力處于全球第一梯隊。
整體來看,本周 Arena 榜單最大的突破來自國產模型在前端開發(fā)賽道登頂,kimi-k3 同時在代碼榜和智能體榜進入頭部序列,體現出國產模型在工程開發(fā)、智能體實際應用場景的快速進步。Anthropic 大量新模型集中入榜后,頭部競爭的膠著程度進一步提升,后續(xù)幾周的分數和排名變化值得持續(xù)關注。
下周隨著更多國產新模型完成數據積累更新,有望在更多細分榜單中看到新的突破。
廣告聲明:文內含有的對外跳轉鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。