IT之家 9 月 7 日消息,Arena(arena.ai)平台本周发布 2026 年第 36 周(8 月 31 日 ~9 月 6 日)AI 大模型盲测排名,本期迎来多个重量级新模型入榜,其中多款国产模型在细分榜单实现亮眼突破。
前端开发榜中,阿里 qwen3.8-max-0902 首次入榜即位列第 4,阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也同步首次入榜并杀入前 15;
AI 视频榜中,阿里 wan3.0 首次入榜直接冲进前三,展现国产生成视频模型的最新竞争力。
整体来看,头部格局仍以海外模型为主,但国产模型在细分领域的进步速度值得关注。
IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
综合榜
本期综合榜头部排名整体稳定,claude-fable-5 以 1507 分蝉联榜首,claude-opus-4-6-high 以 1505 分紧随其后,两者分差仅 2 分,在误差范围内视为接近。
本周有两款新模型首次入榜,Anthropic claude-fable-5.1-max 直接冲入前三,ELO 得分 1504 分,位列第 3;谷歌 gemini-3.8-flash-high 位列第 8,ELO 得分 1494 分,目前仍为 preliminary 阶段。
头部前 10 名分数均在 1492 分以上,分差均小于 30 分,整体竞争非常胶着。
国产模型整体处于中上游位置,梯队相对稳定:
月之暗面 kimi-k3-max 排名最高,位列第 12 名,ELO 1489 分,排名持平;
智谱 glm-5.3-max 位列第 20 名,ELO 1482 分,较上周下降 5 位;
阿里 qwen3.8-max 位列第 22 名,ELO 1480 分,排名下降 2 位;
claude-fable-5
Anthropic
1507 ±5
27189
$10 / $50
1M
claude-opus-4-6-high
Anthropic
1505 ±4
72099
$5 / $25
1M
新上榜
claude-fable-5.1-max
Anthropic
1504 ±11
2906
$10 / $50
1M
↓ 1
claude-opus-4-7-high
Anthropic
1502 ±4
60103
$5 / $25
1M
↓ 1
muse-spark-1.2 (xHigh)
Meta
1499 ±10
3240
$1.25 / $4.25
N/A
↓ 1
claude-opus-4-6
Anthropic
1498 ±3
76015
$5 / $25
1M
↓ 1
claude-opus-4-7
Anthropic
1494 ±4
61238
$5 / $25
1M
新上榜
gemini-3.8-flash-high
1494 ±9
5125
$0.75 / $3.75
1.05M
↓ 2
claude-opus-5-high
Anthropic
1493 ±5
35174
$5 / $25
1M
10
↓ 2
muse-spark-1.1
Meta
1492 ±5
24064
$1.25 / $4.25
N/A
— 以下为 Top 10 外的国产模型 —
12
↓ 2
kimi-k3-max
Moonshot
1489 ±5
18090
N/A
20
↓ 5
glm-5.3-max
Z.ai
1482 ±7
7668
$1.4 / $4.4
1.05M
22
↓ 2
qwen3.8-max
Alibaba
1480 ±6
13346
$2 / $6
1M
代码榜
代码榜头部格局同样稳定,claude-opus-4-7-high 和 claude-opus-4-6-high 同以 1552 分并列前两位,claude-fable-5 以 1551 分紧随其后,前三名均为 Anthropic 模型。
本周谷歌 gemini-3.8-flash-high 首次入榜即位列第 7,ELO 1537 分;OpenAI gpt-5.5-high 也首次入榜,位列第 28,ELO 1520 分。国产模型 glm-5.3-flash 排名上升 2 位,来到第 9,表现亮眼。
国产模型在代码榜已有多款进入前 30,具体排名如下:
月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平;
智谱 glm-5.3-flash 位列第 9 名,ELO 1534 分,较上周上升 2 位;
智谱 glm-5.3-max 位列第 16 名,ELO 1528 分,较上周下降 3 位;
阿里 qwen3.8-max 位列第 30 名,ELO 1520 分,较上周下降 4 位;
claude-opus-4-7-high
Anthropic
1552 ±6
17176
$5 / $25
1M
claude-opus-4-6-high
Anthropic
1552 ±6
18800
$5 / $25
1M
claude-fable-5
Anthropic
1551 ±8
7293
$10 / $50
1M
claude-opus-4-7
Anthropic
1547 ±6
17342
$5 / $25
1M
claude-opus-4-6
Anthropic
1546 ±5
21198
$5 / $25
1M
kimi-k3-max
Moonshot
1542 ±9
4719
N/A
新上榜
gemini-3.8-flash-high
1537 ±16
1456
$0.75 / $3.75
1.05M
↑ 1
claude-opus-4-8-high
Anthropic
1534 ±6
13439
$5 / $25
1M
↑ 2
glm-5.3-flash
Z.ai
1534 ±17
1274
$0.15 / $0.5
1.05M
10
↓ 3
muse-spark-1.2 (xHigh)
Meta
1533 ±20
935
$1.25 / $4.25
N/A
— 以下为 Top 10 外的国产模型 —
16
↓ 3
glm-5.3-max
Z.ai
1528 ±14
2008
$1.4 / $4.4
1.05M
19
↓ 1
qwen3.7-max-preview
Alibaba
1525 ±18
1118
$1.48 / $4.43
1M
26
↑ 1
mimo-v2.5-pro
Xiaomi
1520 ±6
15813
$0.44 / $0.87
1.05M
30
↓ 4
qwen3.8-max
Alibaba
1520 ±10
3867
$2 / $6
1M
前端开发榜
前端开发榜本周迎来密集新模型入榜,OpenAI gpt-6-astra-max 首次登榜即拿下榜首,ELO 1797 分;Anthropic claude-fable-5.1-max 首次入榜位列第二,ELO 1762 分。
国产模型此次扎堆入榜表现突出,阿里 qwen3.8-max-0902 首次入榜即冲到第 4,ELO 1686 分,仅次于三款海外头部模型;阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也均首次入榜并杀入前 15,分别位列第 9、第 12、第 15。
国产模型在前端开发榜已有多款进入前 20:
阿里 qwen3.8-max-0902 排名最高,位列第 4 名,ELO 1686 分,首次入榜;
月之暗面 kimi-k3-max 位列第 5 名,ELO 1674 分,排名下降 3 位;
阿里 qwen3.8-max 位列第 6 名,ELO 1670 分,排名下降 3 位;
阿里 qwen3.8-flash-next 位列第 9 名,ELO 1626 分,首次入榜;
腾讯 hy4-preview 位列第 12 名,ELO 1621 分,首次入榜。
新上榜
gpt-6-astra-max
OpenAI
1797 ±24
1199
$10 / $50
1.05M
新上榜
claude-fable-5.1-max
Anthropic
1762 ±16
2275
$10 / $50
1M
↓ 2
claude-opus-5-max
Anthropic
1688 ±8
10904
$5 / $25
1M
新上榜
qwen3.8-max-0902
Alibaba
1686 ±16
1868
$2 / $6
N/A
↓ 3
kimi-k3-max
Moonshot
1674 ±11
4546
$3 / $15
1.05M
↓ 3
qwen3.8-max
Alibaba
1670 ±12
3223
$2 / $6
1M
↓ 3
claude-opus-5-high
Anthropic
1661 ±7
10928
$5 / $25
1M
↓ 2
claude-fable-5
Anthropic
1629 ±8
9356
$10 / $50
1M
新上榜
qwen3.8-flash-next
Alibaba
1626 ±14
2158
$0.16 / $0.47
1M
10
↓ 5
grok-4.6-high
SpaceXAI
1625 ±11
3487
$2 / $6
500K
— 以下为 Top 10 外的国产模型 —
12
新上榜
hy4-preview
Tencent
1621 ±16
1661
$0.83 / $2.5
1.05M
14
↓ 6
glm-5.3-max
Z.ai
1609 ±12
2930
$1.4 / $4.4
1.05M
15
新上榜
glm-5.3-flash
Z.ai
1605 ±15
1961
$0.15 / $0.5
1.05M
16
↓ 7
qwen3.8-27b
Alibaba
1594 ±11
3543
$0.4 / $3
N/A
18
↓ 7
glm-5.2-max
Z.ai
1587 ±7
9836
$1.4 / $4.4
1M
19
↓ 7
deepseek-v4-pro-high-20260813
DeepSeek
1582 ±11
3518
$1.32 / $3.96
N/A
20
↓ 7
deepseek-v4-flash-high
DeepSeek
1580 ±10
4177
$0.44 / $1.32
1.05M
智能体榜
智能体榜本周迎来新模型 claude-fable-5.1-max 首次登榜,直接以 15.87% 的净提升度登顶榜首,原榜首 Claude Opus 5 (High) 以 12.68% 降至第二。
在信号指标方面,claude-opus-4.8 (High) 工具幻觉率仅 0.24%,为头部最低;kimi-k3-max 任务确认成功率达到 16.58%,在国产模型中领先。
国产模型在智能体榜已有多款进入前 30,其中多款新模型本周首次入榜:
月之暗面 kimi-k3-max 排名最高,位列第 7 名,净提升度 7.96%,任务确认成功率 16.58%,排名下降 1 位;
腾讯 hy4-preview 位列第 10 名,净提升度 6.92%,任务确认成功率 13.56%,首次入榜;
智谱 glm-5.2 (max) 位列第 12 名,净提升度 6.03%,较上周上升 4 位;
阿里 qwen3.8-max 位列第 16 名,净提升度 5.51%,较上周下降 5 位;
新上榜
Claude Fable 5.1 (Max)
Anthropic
15.87% ±2.84%
22.45% ±3.71%
42.45% ±10.94%
0.58% ±6.77%
↓ 1
Claude Opus 5 (High)
Anthropic
12.68% ±1.73%
13.3% ±3.69%
18.27% ±6.49%
16.09% ±3.24%
↓ 1
Claude Opus 5 (Max)
Anthropic
11.67% ±1.96%
14.89% ±3.95%
17.3% ±7.1%
9.7% ±3.85%
↓ 1
Claude Fable 5 (High)
Anthropic
10.23% ±1.46%
7.37% ±3.17%
19.36% ±5.29%
11.89% ±2.68%
↓ 1
GPT 5.6 Sol (xHigh)
OpenAI
9.31% ±1.49%
6.68% ±3.13%
22.07% ±5.5%
8.88% ±2.84%
↓ 1
Claude Opus 4.8 (High)
Anthropic
9.17% ±1.48%
5.27% ±3.07%
18.04% ±5.19%
12.59% ±2.73%
↓ 1
Kimi K3 (Max)
Moonshot
7.96% ±0.68%
16.58% ±1.4%
14.03% ±2.36%
1.24% ±1.35%
Claude Sonnet 5 (High)
Anthropic
7.41% ±1.95%
2.8% ±4.13%
11.19% ±6.78%
11.52% ±4.13%
↓ 2
GPT 5.5 (xHigh)
OpenAI
7.21% ±1.08%
2.07% ±2.42%
11.41% ±3.77%
8.54% ±2.01%
10
新上榜
Hy4 preview
Tencent
6.92% ±1.51%
13.56% ±2.96%
10.26% ±5.61%
0.1% ±3.21%
— 以下为 Top 10 外的国产模型 —
12
↑ 4
GLM 5.2 (Max)
Z.ai
6.03% ±0.76%
8.63% ±1.64%
11.73% ±2.67%
4.48% ±1.38%
16
↓ 5
Qwen3.8 Max
Alibaba
5.51% ±1.09%
10.37% ±2.35%
6.58% ±3.8%
4.15% ±2.19%
18
↓ 6
DeepSeek V4 Pro (High) (0813)
DeepSeek
5.43% ±0.9%
11.75% ±1.91%
5.24% ±3.13%
0.67% ±1.95%
22
↓ 2
GLM 5.3 (Max)
Z.ai
3.8% ±0.71%
12.1% ±1.52%
5.75% ±2.41%
0.63% ±1.37%
23
新上榜
GLM 5.3 Flash
Z.ai
3.67% ±1.03%
14.14% ±2.16%
5.45% ±3.49%
0.23% ±2.12%
24
↓ 2
Deepseek V4 Flash (High)(20260731)
DeepSeek
3.29% ±0.8%
8.46% ±1.76%
3.9% ±2.76%
0.02% ±1.6%
27
新上榜
Qwen3.8 Flash Next
Alibaba
2.61% ±1.21%
12.46% ±2.49%
0.24% ±4.15%
1.18% ±2.74%
30
↓ 3
Qwen 3.8 27B
Alibaba
1.03% ±0.99%
6.98% ±2.26%
0.78% ±3.28%
0.39% ±2.02%
AI 生图榜
AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1382 分蝉联榜首;微软 mai-image-2.6 首次入榜即拿到第二名,ELO 1332 分。
国产模型 seedream-5.0-pro 稳定保持第 8,qwen-image-3.0-pro 位列第 9,hunyuan-image-3.0 位列第 29,整体排名变化不大。
gpt-image-2 (medium)
OpenAI
1382 ±4
77830
$8 / $30
N/A
新上榜
mai-image-2.6
Microsoft AI
1332 ±7
10086
N/A
grok-imagine-image-2.0 (low)
SpaceXAI
1315 ±12
2682
N/A
reve-2.1
Reve
1301 ±8
7576
N/A
muse-image
Meta
1279 ±6
24856
N/A
reve-2.0
Reve
1270 ±6
14636
N/A
gemini-3.1-flash-image(nano-banana-2) [web-search]
1261 ±5
40649
$0.5 / $3
131.1K
seedream-5.0-pro
Bytedance
1258 ±4
59484
N/A
qwen-image-3.0-pro
Alibaba
1254 ±7
10923
N/A
10
mai-image-2.5
Microsoft AI
1254 ±4
57295
N/A
— 以下为 Top 10 外的国产模型 —
16
qwen-image-2.0-pro-2026-06-22
Alibaba
1191 ±6
12016
N/A
29
hunyuan-image-3.0
Tencent
1151 ±3
173129
N/A
AI 视频榜
AI 视频榜本周最大亮点是阿里 wan3.0 首次入榜即冲进前三,ELO 得分 1494 分,仅次于谷歌 gemini-omni-1.1-flash( 1515 分)和 gemini-omni-flash( 1511 分),与第四名 flux-3-video( 1494 分)同分,在误差范围内视为并列。
国产 dreamina-seedance-2.5-720p 排名上升一位,来到第 6;minimax-h3 位列第 8,整体国产模型占据多个中上游位置。
gemini-omni-1.1-flash
1515 ±15
1777
$1.5 / $9
131.1K
gemini-omni-flash
1511 ±10
21934
N/A
新上榜
wan3.0
Alibaba
1494 ±19
1167
N/A
↓ 1
flux-3-video
Black Forest Labs
1494 ±17
1290
N/A
新上榜
grok-imagine-video-1.5-agent
SpaceXAI
1491 ±19
1195
N/A
↓ 1
dreamina-seedance-2.5-720p
Bytedance
1482 ±12
4066
N/A
↓ 3
dreamina-seedance-2.0-720p
Bytedance
1479 ±8
52864
N/A
↓ 2
minimax-h3
MiniMax
1462 ±10
7648
N/A
↓ 2
muse-video
Meta
1456 ±15
2178
N/A
10
↓ 2
happyhorse-1.0
Alibaba-ATH
1427 ±13
22116
N/A
— 以下为 Top 10 外的国产模型 —
19
↓ 4
wan2.7-t2v
Alibaba
1341 ±8
23025
N/A
21
↓ 2
wan2.6-t2v
Alibaba
1328 ±8
49348
N/A
22
↓ 2
seedance-v1.5-pro
Bytedance
1256 ±7
75891
N/A
25
↓ 2
wan2.5-t2v-preview
Alibaba
1246 ±9
32461
N/A
本期 Arena 周榜的最大看点是大量新模型集中发布并迅速入榜测试,其中国产模型在前端开发、AI 生成视频等细分领域实现了突破性排名,多款新模型首次入榜就冲进前十甚至前三,展现出快速迭代的竞争力。
头部综合榜仍由海外厂商模型占据,但国产模型与头部的分差正在持续缩小。
下周随着更多新模型完成投票积累,排名格局有望进一步变化,值得持续关注。