IT之家 8 月 10 日消息,Arena(arena.ai)平臺發(fā)布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲測排名,本周共有多款新模型入榜,其中國產(chǎn)模型阿里 qwen3.8-max 表現(xiàn)突出,殺入綜合榜第 6 名,ELO 分數(shù)達到 1497 分,整體處于頭部梯隊。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列綜合榜第 4 名,成為海外陣營的亮眼新秀。本周多個細分榜單都有新模型亮相,國產(chǎn)模型在前端開發(fā)、代碼、生圖等領(lǐng)域均實現(xiàn)突破。
IT之家注:本榜單基于 Arena(arena.ai)平臺匿名盲測投票,通過 ELO(智能體榜為百分比信號)計算排名,反映用戶主觀偏好而非絕對能力測試;不同分榜相互獨立,不宜跨榜比較,分差在誤差范圍內(nèi)均視為并列,新模型也需積累一定投票量后才會正式入榜。
綜合榜
本周綜合榜頭部格局相對穩(wěn)定,Anthropic 旗下 claude-fable-5 依舊占據(jù)榜首位置,ELO 分數(shù)為 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 緊隨其后位列第二、三名,三者分差均在 10 分以內(nèi),在誤差范圍內(nèi)視為接近。本周最大看點是兩款新模型強勢闖入頭部:Meta 新發(fā)布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,與第 5 名的 claude-opus-4-6 同分,僅因置信區(qū)間差異排名靠后,同樣在統(tǒng)計誤差范圍內(nèi)并列。頭部整體分數(shù)密集,前 10 名分數(shù)均在 1488 分以上,競爭極為激烈。
國產(chǎn)模型在綜合榜已有多款進入中上游,具體排名如下:
阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;
月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;
阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。
| 排名 | 較上周 | 模型 | 廠商 | 分數(shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-fable-5 | Anthropic | 1507 ±6 | 19390 | $10 / $50 | 1M |
| 2 | - | claude-opus-4-6-thinking | Anthropic | 1505 ±4 | 69336 | $2.5 / $12.5 | 1M |
| 3 | - | claude-opus-4-7-thinking | Anthropic | 1502 ±4 | 57018 | $5 / $25 | 1M |
| 4 | 新上榜 | muse-spark-1.2 (xHigh) | Meta | 1498 ±13 | 2057 | $1.25 / $4.25 | N/A |
| 5 | ↓ 1 | claude-opus-4-6 | Anthropic | 1497 ±3 | 73158 | $2.5 / $12.5 | 1M |
| 6 | 新上榜 | qwen3.8-max | Alibaba | 1497 ±9 | 4662 | $2 / $6 | 1M |
| 7 | ↓ 2 | claude-opus-4-7 | Anthropic | 1493 ±4 | 58135 | $5 / $25 | 1M |
| 8 | ↓ 2 | claude-opus-5-high | Anthropic | 1493 ±6 | 14902 | $5 / $25 | 1M |
| 9 | ↓ 2 | claude-opus-5-max | Anthropic | 1488 ±8 | 7137 | $5 / $25 | 1M |
| 10 | ↓ 1 | muse-spark | Meta | 1488 ±6 | 13476 | N/A | N/A |
| — 以下為 Top 10 外的國產(chǎn)模型 — | |||||||
| 14 | ↓ 2 | kimi-k3-max | Moonshot | 1485 ±7 | 9861 | N/A | N/A |
| 23 | ↓ 2 | qwen3.7-max-preview | Alibaba | 1475 ±10 | 3695 | $1.48 / $4.43 | 1M |
代碼榜
代碼榜頭部依舊被 Anthropic 模型壟斷,claude-fable-5 蟬聯(lián)第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分別占據(jù)第二、三名。月之暗面 kimi-k3-max 本周排名從第 8 位上升至第 6 位,ELO 分數(shù)上漲 11 分至 1542 分,闖入 Top 6,成為代碼榜排名最高的國產(chǎn)模型。阿里 qwen3.8-max 排名第 8,ELO 1532 分,同樣進入前十。Meta muse-spark-1.2 (xHigh) 本周首次入榜排名第 15,ELO 1526 分。
國產(chǎn)模型在代碼榜已有多款進入前 30,具體如下:
月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,較上周上升 2 位;
阿里 qwen3.8-max 排名第 8 名,ELO 1532 分;
阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名下滑 1 位;
小米 mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平;
智譜 glm-5.1 排名第 30 名,ELO 1517 分,較上周下降 3 位。
| 排名 | 較上周 | 模型 | 廠商 | 分數(shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-fable-5 | Anthropic | 1553 ±9 | 5234 | $10 / $50 | 1M |
| 2 | - | claude-opus-4-7-thinking | Anthropic | 1552 ±6 | 16303 | $5 / $25 | 1M |
| 3 | - | claude-opus-4-6-thinking | Anthropic | 1551 ±6 | 18015 | $2.5 / $12.5 | 1M |
| 4 | - | claude-opus-4-6 | Anthropic | 1547 ±6 | 20444 | $2.5 / $12.5 | 1M |
| 5 | - | claude-opus-4-7 | Anthropic | 1546 ±6 | 16534 | $5 / $25 | 1M |
| 6 | ↑ 2 | kimi-k3-max | Moonshot | 1542 ±12 | 2611 | N/A | N/A |
| 7 | ↓ 1 | claude-opus-4-8-thinking | Anthropic | 1535 ±7 | 10509 | $2.5 / $12.5 | 1M |
| 8 | 新上榜 | qwen3.8-max | Alibaba | 1532 ±16 | 1411 | $2 / $6 | 1M |
| 9 | ↑ 1 | muse-spark-1.1 | Meta | 1532 ±10 | 4199 | $1.25 / $4.25 | N/A |
| 10 | ↓ 1 | claude-opus-4-5-20251101- thinking-32k | Anthropic | 1530 ±7 | 7603 | $5 / $25 | 200K |
| — 以下為 Top 10 外的國產(chǎn)模型 — | |||||||
| 17 | ↓ 1 | qwen3.7-max-preview | Alibaba | 1526 ±18 | 1112 | $1.48 / $4.43 | 1M |
| 28 | - | mimo-v2.5-pro | Xiaomi | 1519 ±7 | 13199 | $0.44 / $0.87 | 1.05M |
| 30 | ↓ 3 | glm-5.1 | Z.ai | 1517 ±7 | 10330 | $1.4 / $4.4 | 202.8K |
前端開發(fā)榜
本周前端開發(fā)榜榜首依舊是 claude-opus-5-max,ELO 1686 分,月之暗面 kimi-k3-max 穩(wěn)定保持第二位,ELO 1675 分,僅下跌 1 分,仍緊逼頭部海外模型。阿里 qwen3.8-max 拿下第四名,ELO 1667 分,直接進入前五,表現(xiàn)十分搶眼。深度求索 deepseek-v4-flash-high 也首次入榜,排名第 8 位,ELO 1581 分。國產(chǎn)模型在前端開發(fā)榜已經(jīng)占據(jù)多個 top10 位置,整體競爭力持續(xù)提升。
國產(chǎn)模型具體排名如下:
月之暗面 kimi-k3-max 排名第 2 名,ELO 1675 分,排名持平;
阿里 qwen3.8-max 排名第 4 名,ELO 1667 分;
智譜 glm-5.2-max 排名第 7 名,ELO 1588 分,上升 1 位;
深度求索 deepseek-v4-flash-high 排名第 8 名,ELO 1581 分,首次入榜。
| 排名 | 較上周 | 模型 | 廠商 | 分數(shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-opus-5-max | Anthropic | 1686 ±11 | 4029 | $5 / $25 | 1M |
| 2 | - | kimi-k3-max | Moonshot | 1675 ±12 | 4372 | $3 / $15 | 1.05M |
| 3 | - | claude-opus-5-high | Anthropic | 1670 ±10 | 5145 | $5 / $25 | 1M |
| 4 | 新上榜 | qwen3.8-max | Alibaba | 1667 ±16 | 1980 | $2 / $6 | 1M |
| 5 | ↓ 1 | claude-fable-5 | Anthropic | 1630 ±9 | 6816 | $10 / $50 | 1M |
| 6 | ↓ 1 | gpt-5.6-sol-xhigh (codex-harness) | OpenAI | 1620 ±9 | 6903 | $5 / $30 | 1.05M |
| 7 | ↓ 1 | glm-5.2-max | Z.ai | 1588 ±9 | 6924 | $1.4 / $4.4 | 1M |
| 8 | 新上榜 | deepseek-v4-flash-high | DeepSeek | 1581 ±15 | 1931 | $0.14 / $0.28 | 1.05M |
| 9 | ↓ 1 | claude-opus-4-8-thinking | Anthropic | 1565 ±8 | 9549 | $2.5 / $12.5 | 1M |
| 10 | ↓ 1 | claude-opus-4-7 | Anthropic | 1560 ±7 | 12398 | $5 / $25 | 1M |
| — 以下為 Top 10 外的國產(chǎn)模型 — | |||||||
| 21 | ↓ 3 | seed-2.1-pro-preview | Bytedance | 1524 ±9 | 6069 | N/A | N/A |
| 24 | ↓ 1 | hy3 | Tencent | 1522 ±15 | 1729 | $0.13 / $0.53 | 262.1K |
| 25 | ↓ 3 | qwen3.7-max-20260517 | Alibaba | 1516 ±8 | 8044 | $1.48 / $4.43 | 1M |
| 26 | ↓ 2 | glm-5.1 | Z.ai | 1515 ±8 | 7853 | $1.4 / $4.4 | 202.8K |
| 27 | ↓ 2 | kimi-k2.6 | Moonshot | 1510 ±8 | 9261 | $0.95 / $4 | 262.1K |
智能體榜
智能體榜本周頭部發(fā)生更替,Anthropic Claude Opus 5 (High) 從第三名上升至第一名,凈提升度達到 11.99%,此前榜首 Claude Fable 5 (High) 降至第二,凈提升度 11.66%,兩者凈提升度差距小于雙方置信區(qū)間之和,在誤差范圍內(nèi)視為并列。國產(chǎn)模型月之暗面 Kimi K3 (Max) 穩(wěn)定保持第五名,凈提升度 10.08%,任務確認成功率達到 14.97%,已經(jīng)躋身智能體榜第一梯隊。深度求索 Deepseek V4 Flash (High) (20260731) 本周首次入榜排名第 21,凈提升度 2.84%,任務確認成功率達到 8.53%,首秀表現(xiàn)符合預期。
國產(chǎn)模型在智能體榜已有多款進入前 30,具體如下:
月之暗面 Kimi K3 (Max) 排名第 5 名,凈提升度 10.08%,任務確認成功率 14.97%,排名持平;
智譜 GLM 5.2 (Max) 排名第 12 名,凈提升度 6.75%,排名持平;
深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名,凈提升度 2.84%,首次入榜;
智譜 GLM 5.1 排名第 24 名,凈提升度 0.35%,排名下降 2 位。
| 排名 | 較上周 | 模型 | 廠商 | 凈提升度 (±CI) | 任務確認成功率 | 好評 / 差評比 | 可控性 |
|---|---|---|---|---|---|---|---|
| 1 | ↑ 2 | Claude Opus 5 (High) | Anthropic | 11.99% ±1.37% | 16.04% ±2.79% | 19.46% ±5.19% | 10.29% ±2.51% |
| 2 | ↓ 1 | Claude Fable 5 (High) | Anthropic | 11.66% ±2.39% | 11.47% ±4.46% | 22.56% ±8.25% | 10.01% ±4.93% |
| 3 | ↓ 1 | Claude Opus 5 (Max) | Anthropic | 11.19% ±1.62% | 16.36% ±3.11% | 19.07% ±6.03% | 5.8% ±3.1% |
| 4 | - | GPT 5.6 Sol (xHigh) | OpenAI | 10.28% ±1.72% | 9.06% ±3.48% | 22.7% ±6.42% | 8.42% ±3.5% |
| 5 | - | Kimi K3 (Max) | Moonshot | 10.08% ±1.07% | 14.97% ±2.09% | 19.68% ±3.85% | 7.45% ±1.97% |
| 6 | - | Claude Opus 4.8 (Thinking) | Anthropic | 9.35% ±1.7% | 8.81% ±2.9% | 21.46% ±5.38% | 8.5% ±3.08% |
| 7 | ↑ 1 | GPT 5.5 (xHigh) | OpenAI | 8.45% ±0.99% | 5.24% ±2.08% | 13.56% ±3.55% | 8.19% ±1.8% |
| 8 | ↑ 1 | Claude Opus 4.7 (Thinking) | Anthropic | 8.33% ±1.32% | 6.65% ±2.76% | 11.87% ±4.59% | 8.61% ±2.72% |
| 9 | ↓ 2 | Claude Sonnet 5 (High) | Anthropic | 7.46% ±2.15% | 5.56% ±4.29% | 14.8% ±7.65% | 5.14% ±4.55% |
| 10 | ↑ 1 | Claude Opus 4.7 | Anthropic | 7.32% ±1.36% | 5.55% ±2.85% | 10.72% ±4.45% | 9.54% ±2.7% |
| — 以下為 Top 10 外的國產(chǎn)模型 — | |||||||
| 12 | - | GLM 5.2 (Max) | Z.ai | 6.75% ±0.9% | 9.21% ±1.83% | 12.39% ±3.21% | 5.62% ±1.59% |
| 21 | 新上榜 | Deepseek V4 Flash (High) (20260731) | DeepSeek | 2.84% ±1.1% | 8.53% ±2.54% | 0.46% ±3.64% | 0.43% ±2.19% |
| 23 | - | Kimi K2.7 Code | Moonshot | 0.69% ±1.94% | 4.12% ±4.08% | 2.36% ±6.68% | 1.92% ±4.37% |
| 24 | ↓ 2 | GLM 5.1 | Z.ai | 0.35% ±0.77% | 1.06% ±1.72% | 0.72% ±2.5% | 0.76% ±1.4% |
| 25 | - | Qwen3.7 Max | Alibaba | 0.16% ±0.88% | 0.24% ±2.11% | 5.07% ±2.72% | 0.21% ±1.55% |
| 26 | - | DeepSeek V4 Pro | DeepSeek | 0.33% ±0.86% | 2.74% ±2.16% | 3.35% ±2.78% | 0.3% ±1.54% |
| 27 | ↑ 2 | Kimi K2.6 | Moonshot | 0.48% ±2.16% | 2.28% ±4.11% | 2.12% ±6.8% | 1.66% ±4.49% |
| 30 | ↓ 3 | Hy3 | Tencent | 1.12% ±1.42% | 2.2% ±3.04% | 3.7% ±4.91% | 9.01% ±2.6% |
AI 生圖榜
本周 AI 生圖榜頭部依舊是 OpenAI gpt-image-2 (medium) 占據(jù)第一,ELO 1380 分,SpaceXAI 新推出的 grok-imagine-image-2.0 (low) 首次入榜即拿到第二名,ELO 1320 分,表現(xiàn)出色。國產(chǎn)方面,阿里 qwen-image-3.0-pro 首次入榜排名第七,ELO 1258 分,字節(jié)跳動 seedream-5.0-pro 排名第八,ELO 1257 分,兩款國產(chǎn)模型均進入前十,整體處于第一梯隊。騰訊 hunyuan-image-3.0 排名第 29 名,ELO 1151 分,表現(xiàn)穩(wěn)定。
| 排名 | 較上周 | 模型 | 廠商 | 分數(shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gpt-image-2 (medium) | OpenAI | 1380 ±5 | 69194 | N/A | N/A |
| 2 | 新上榜 | grok-imagine-image-2.0 (low) | SpaceXAI | 1320 ±12 | 2722 | N/A | N/A |
| 3 | ↓ 1 | reve-2.1 | Reve | 1302 ±8 | 7598 | N/A | N/A |
| 4 | ↓ 1 | muse-image | Meta | 1283 ±7 | 14510 | N/A | N/A |
| 5 | ↓ 1 | reve-2.0 | Reve | 1270 ±6 | 14650 | N/A | N/A |
| 6 | ↓ 1 | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1263 ±5 | 27910 | N/A | N/A | |
| 7 | 新上榜 | qwen-image-3.0-pro | Alibaba | 1258 ±10 | 3735 | N/A | N/A |
| 8 | ↓ 2 | seedream-5.0-pro | Bytedance | 1257 ±5 | 26510 | N/A | N/A |
| 9 | ↓ 2 | mai-image-2.5 | Microsoft AI | 1256 ±5 | 44940 | N/A | N/A |
| 10 | ↓ 2 | gemini-3.1-flash-lite-image (nano-banana-2-lite) | 1251 ±6 | 16419 | N/A | N/A | |
| — 以下為 Top 10 外的國產(chǎn)模型 — | |||||||
| 16 | ↓ 2 | qwen-image-2.0-pro-2026-06-22 | Alibaba | 1191 ±6 | 12026 | N/A | N/A |
| 29 | ↓ 4 | hunyuan-image-3.0 | Tencent | 1151 ±3 | 173366 | N/A | N/A |
AI 視頻榜
AI 視頻榜頭部格局穩(wěn)定,谷歌 gemini-omni-flash 依舊占據(jù)榜首,ELO 1513 分,字節(jié)跳動 dreamina-seedance-2.0-720p 保持第二名,ELO 1479 分,差距僅 34 分,接近頭部水平。MiniMax 全新 minimax-h3 首次入榜排名第四,ELO 1455 分,直接闖入前五,成為國產(chǎn) AI 視頻模型的最新亮點。阿里 happyhorse-1.0 排名第五,ELO 1428 分,同樣保持穩(wěn)定,國產(chǎn)模型已經(jīng)占據(jù)榜單前五中的三個席位,優(yōu)勢明顯。
| 排名 | 較上周 | 模型 | 廠商 | 分數(shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gemini-omni-flash | 1513 ±12 | 14571 | N/A | N/A | |
| 2 | - | dreamina-seedance-2.0-720p | Bytedance | 1479 ±11 | 47067 | N/A | N/A |
| 3 | - | muse-video | Meta | 1458 ±15 | 2160 | N/A | N/A |
| 4 | 新上榜 | minimax-h3 | MiniMax | 1455 ±19 | 1060 | N/A | N/A |
| 5 | ↓ 1 | happyhorse-1.0 | Alibaba-ATH | 1428 ±13 | 21979 | N/A | N/A |
| 6 | ↓ 1 | sora-2-pro | OpenAI | 1365 ±8 | 44543 | $0 / $0.3 | N/A |
| 7 | - | veo-3.1-audio | 1364 ±14 | 13687 | $0 / $0.4 | N/A | |
| 8 | ↓ 2 | veo-3.1-audio-1080p | 1363 ±10 | 24846 | N/A | N/A | |
| 9 | ↓ 1 | veo-3.1-fast-audio | 1362 ±11 | 39301 | $0 / $0.15 | N/A | |
| 10 | ↓ 1 | veo-3.1-fast-audio-1080p | 1358 ±10 | 25637 | N/A | N/A | |
| — 以下為 Top 10 外的國產(chǎn)模型 — | |||||||
| 13 | ↓ 2 | wan2.7-t2v | Alibaba | 1347 ±9 | 15246 | N/A | N/A |
| 16 | ↓ 1 | wan2.6-t2v | Alibaba | 1330 ±9 | 41706 | N/A | N/A |
| 17 | ↓ 1 | seedance-v1.5-pro | Bytedance | 1256 ±7 | 75653 | N/A | N/A |
| 19 | ↓ 2 | wan2.5-t2v-preview | Alibaba | 1252 ±10 | 25895 | N/A | N/A |
| 28 | ↓ 1 | hailuo-2.3 | MiniMax | 1202 ±7 | 72127 | N/A | N/A |
| 29 | ↓ 1 | hailuo-02-pro | MiniMax | 1198 ±13 | 9365 | N/A | N/A |
| 30 | ↓ 1 | seedance-v1-pro | Bytedance | 1190 ±11 | 12117 | N/A | N/A |
本周 Arena 周榜迎來多款重量級新模型,國產(chǎn)大模型在綜合、代碼、前端開發(fā)、生圖、視頻等多個維度均實現(xiàn)突破,阿里 qwen3.8-max 首秀即殺入頭部梯隊,證明國產(chǎn)大模型綜合能力已經(jīng)接近國際第一梯隊水平,多個細分領(lǐng)域國產(chǎn)模型已經(jīng)占據(jù)領(lǐng)先位置。下周預計將有更多新模型完成測試入榜,我們也將持續(xù)關(guān)注排名變化。