IT之家 9 月 7 日消息,Arena(arena.ai)平台本周发布 2026 年第 36 周(8 月 31 日 ~9 月 6 日)AI 大模型盲测排名,本期迎来多个重量级新模型入榜,其中多款国产模型在细分榜单实现亮眼突破。

前端开发榜中,阿里 qwen3.8-max-0902 首次入榜即位列第 4,阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也同步首次入榜并杀入前 15;

AI 视频榜中,阿里 wan3.0 首次入榜直接冲进前三,展现国产生成视频模型的最新竞争力。

整体来看,头部格局仍以海外模型为主,但国产模型在细分领域的进步速度值得关注。

IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本期综合榜头部排名整体稳定,claude-fable-5 以 1507 分蝉联榜首,claude-opus-4-6-high 以 1505 分紧随其后,两者分差仅 2 分,在误差范围内视为接近。

本周有两款新模型首次入榜,Anthropic claude-fable-5.1-max 直接冲入前三,ELO 得分 1504 分,位列第 3;谷歌 gemini-3.8-flash-high 位列第 8,ELO 得分 1494 分,目前仍为 preliminary 阶段。

头部前 10 名分数均在 1492 分以上,分差均小于 30 分,整体竞争非常胶着。

国产模型整体处于中上游位置,梯队相对稳定:

月之暗面 kimi-k3-max 排名最高,位列第 12 名,ELO 1489 分,排名持平;

智谱 glm-5.3-max 位列第 20 名,ELO 1482 分,较上周下降 5 位;

阿里 qwen3.8-max 位列第 22 名,ELO 1480 分,排名下降 2 位;

claude-fable-5

Anthropic

1507 ±5

27189

$10 / $50

1M

claude-opus-4-6-high

Anthropic

1505 ±4

72099

$5 / $25

1M

新上榜

claude-fable-5.1-max

Anthropic

1504 ±11

2906

$10 / $50

1M

↓ 1

claude-opus-4-7-high

Anthropic

1502 ±4

60103

$5 / $25

1M

↓ 1

muse-spark-1.2 (xHigh)

Meta

1499 ±10

3240

$1.25 / $4.25

N/A

↓ 1

claude-opus-4-6

Anthropic

1498 ±3

76015

$5 / $25

1M

↓ 1

claude-opus-4-7

Anthropic

1494 ±4

61238

$5 / $25

1M

新上榜

gemini-3.8-flash-high

Google

1494 ±9

5125

$0.75 / $3.75

1.05M

↓ 2

claude-opus-5-high

Anthropic

1493 ±5

35174

$5 / $25

1M

10

↓ 2

muse-spark-1.1

Meta

1492 ±5

24064

$1.25 / $4.25

N/A

— 以下为 Top 10 外的国产模型 —

12

↓ 2

kimi-k3-max

Moonshot

1489 ±5

18090

N/A

20

↓ 5

glm-5.3-max

Z.ai

1482 ±7

7668

$1.4 / $4.4

1.05M

22

↓ 2

qwen3.8-max

Alibaba

1480 ±6

13346

$2 / $6

1M

代码榜

代码榜头部格局同样稳定,claude-opus-4-7-high 和 claude-opus-4-6-high 同以 1552 分并列前两位,claude-fable-5 以 1551 分紧随其后,前三名均为 Anthropic 模型。

本周谷歌 gemini-3.8-flash-high 首次入榜即位列第 7,ELO 1537 分;OpenAI gpt-5.5-high 也首次入榜,位列第 28,ELO 1520 分。国产模型 glm-5.3-flash 排名上升 2 位,来到第 9,表现亮眼。

国产模型在代码榜已有多款进入前 30,具体排名如下:

月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平;

智谱 glm-5.3-flash 位列第 9 名,ELO 1534 分,较上周上升 2 位;

智谱 glm-5.3-max 位列第 16 名,ELO 1528 分,较上周下降 3 位;

阿里 qwen3.8-max 位列第 30 名,ELO 1520 分,较上周下降 4 位;

claude-opus-4-7-high

Anthropic

1552 ±6

17176

$5 / $25

1M

claude-opus-4-6-high

Anthropic

1552 ±6

18800

$5 / $25

1M

claude-fable-5

Anthropic

1551 ±8

7293

$10 / $50

1M

claude-opus-4-7

Anthropic

1547 ±6

17342

$5 / $25

1M

claude-opus-4-6

Anthropic

1546 ±5

21198

$5 / $25

1M

kimi-k3-max

Moonshot

1542 ±9

4719

N/A

新上榜

gemini-3.8-flash-high

Google

1537 ±16

1456

$0.75 / $3.75

1.05M

↑ 1

claude-opus-4-8-high

Anthropic

1534 ±6

13439

$5 / $25

1M

↑ 2

glm-5.3-flash

Z.ai

1534 ±17

1274

$0.15 / $0.5

1.05M

10

↓ 3

muse-spark-1.2 (xHigh)

Meta

1533 ±20

935

$1.25 / $4.25

N/A

— 以下为 Top 10 外的国产模型 —

16

↓ 3

glm-5.3-max

Z.ai

1528 ±14

2008

$1.4 / $4.4

1.05M

19

↓ 1

qwen3.7-max-preview

Alibaba

1525 ±18

1118

$1.48 / $4.43

1M

26

↑ 1

mimo-v2.5-pro

Xiaomi

1520 ±6

15813

$0.44 / $0.87

1.05M

30

↓ 4

qwen3.8-max

Alibaba

1520 ±10

3867

$2 / $6

1M

前端开发榜

前端开发榜本周迎来密集新模型入榜,OpenAI gpt-6-astra-max 首次登榜即拿下榜首,ELO 1797 分;Anthropic claude-fable-5.1-max 首次入榜位列第二,ELO 1762 分。

国产模型此次扎堆入榜表现突出,阿里 qwen3.8-max-0902 首次入榜即冲到第 4,ELO 1686 分,仅次于三款海外头部模型;阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也均首次入榜并杀入前 15,分别位列第 9、第 12、第 15。

国产模型在前端开发榜已有多款进入前 20:

阿里 qwen3.8-max-0902 排名最高,位列第 4 名,ELO 1686 分,首次入榜;

月之暗面 kimi-k3-max 位列第 5 名,ELO 1674 分,排名下降 3 位;

阿里 qwen3.8-max 位列第 6 名,ELO 1670 分,排名下降 3 位;

阿里 qwen3.8-flash-next 位列第 9 名,ELO 1626 分,首次入榜;

腾讯 hy4-preview 位列第 12 名,ELO 1621 分,首次入榜。

新上榜

gpt-6-astra-max

OpenAI

1797 ±24

1199

$10 / $50

1.05M

新上榜

claude-fable-5.1-max

Anthropic

1762 ±16

2275

$10 / $50

1M

↓ 2

claude-opus-5-max

Anthropic

1688 ±8

10904

$5 / $25

1M

新上榜

qwen3.8-max-0902

Alibaba

1686 ±16

1868

$2 / $6

N/A

↓ 3

kimi-k3-max

Moonshot

1674 ±11

4546

$3 / $15

1.05M

↓ 3

qwen3.8-max

Alibaba

1670 ±12

3223

$2 / $6

1M

↓ 3

claude-opus-5-high

Anthropic

1661 ±7

10928

$5 / $25

1M

↓ 2

claude-fable-5

Anthropic

1629 ±8

9356

$10 / $50

1M

新上榜

qwen3.8-flash-next

Alibaba

1626 ±14

2158

$0.16 / $0.47

1M

10

↓ 5

grok-4.6-high

SpaceXAI

1625 ±11

3487

$2 / $6

500K

— 以下为 Top 10 外的国产模型 —

12

新上榜

hy4-preview

Tencent

1621 ±16

1661

$0.83 / $2.5

1.05M

14

↓ 6

glm-5.3-max

Z.ai

1609 ±12

2930

$1.4 / $4.4

1.05M

15

新上榜

glm-5.3-flash

Z.ai

1605 ±15

1961

$0.15 / $0.5

1.05M

16

↓ 7

qwen3.8-27b

Alibaba

1594 ±11

3543

$0.4 / $3

N/A

18

↓ 7

glm-5.2-max

Z.ai

1587 ±7

9836

$1.4 / $4.4

1M

19

↓ 7

deepseek-v4-pro-high-20260813

DeepSeek

1582 ±11

3518

$1.32 / $3.96

N/A

20

↓ 7

deepseek-v4-flash-high

DeepSeek

1580 ±10

4177

$0.44 / $1.32

1.05M

智能体榜

智能体榜本周迎来新模型 claude-fable-5.1-max 首次登榜,直接以 15.87% 的净提升度登顶榜首,原榜首 Claude Opus 5 (High) 以 12.68% 降至第二。

在信号指标方面,claude-opus-4.8 (High) 工具幻觉率仅 0.24%,为头部最低;kimi-k3-max 任务确认成功率达到 16.58%,在国产模型中领先。

国产模型在智能体榜已有多款进入前 30,其中多款新模型本周首次入榜:

月之暗面 kimi-k3-max 排名最高,位列第 7 名,净提升度 7.96%,任务确认成功率 16.58%,排名下降 1 位;

腾讯 hy4-preview 位列第 10 名,净提升度 6.92%,任务确认成功率 13.56%,首次入榜;

智谱 glm-5.2 (max) 位列第 12 名,净提升度 6.03%,较上周上升 4 位;

阿里 qwen3.8-max 位列第 16 名,净提升度 5.51%,较上周下降 5 位;

新上榜

Claude Fable 5.1 (Max)

Anthropic

15.87% ±2.84%

22.45% ±3.71%

42.45% ±10.94%

0.58% ±6.77%

↓ 1

Claude Opus 5 (High)

Anthropic

12.68% ±1.73%

13.3% ±3.69%

18.27% ±6.49%

16.09% ±3.24%

↓ 1

Claude Opus 5 (Max)

Anthropic

11.67% ±1.96%

14.89% ±3.95%

17.3% ±7.1%

9.7% ±3.85%

↓ 1

Claude Fable 5 (High)

Anthropic

10.23% ±1.46%

7.37% ±3.17%

19.36% ±5.29%

11.89% ±2.68%

↓ 1

GPT 5.6 Sol (xHigh)

OpenAI

9.31% ±1.49%

6.68% ±3.13%

22.07% ±5.5%

8.88% ±2.84%

↓ 1

Claude Opus 4.8 (High)

Anthropic

9.17% ±1.48%

5.27% ±3.07%

18.04% ±5.19%

12.59% ±2.73%

↓ 1

Kimi K3 (Max)

Moonshot

7.96% ±0.68%

16.58% ±1.4%

14.03% ±2.36%

1.24% ±1.35%

Claude Sonnet 5 (High)

Anthropic

7.41% ±1.95%

2.8% ±4.13%

11.19% ±6.78%

11.52% ±4.13%

↓ 2

GPT 5.5 (xHigh)

OpenAI

7.21% ±1.08%

2.07% ±2.42%

11.41% ±3.77%

8.54% ±2.01%

10

新上榜

Hy4 preview

Tencent

6.92% ±1.51%

13.56% ±2.96%

10.26% ±5.61%

0.1% ±3.21%

— 以下为 Top 10 外的国产模型 —

12

↑ 4

GLM 5.2 (Max)

Z.ai

6.03% ±0.76%

8.63% ±1.64%

11.73% ±2.67%

4.48% ±1.38%

16

↓ 5

Qwen3.8 Max

Alibaba

5.51% ±1.09%

10.37% ±2.35%

6.58% ±3.8%

4.15% ±2.19%

18

↓ 6

DeepSeek V4 Pro (High) (0813)

DeepSeek

5.43% ±0.9%

11.75% ±1.91%

5.24% ±3.13%

0.67% ±1.95%

22

↓ 2

GLM 5.3 (Max)

Z.ai

3.8% ±0.71%

12.1% ±1.52%

5.75% ±2.41%

0.63% ±1.37%

23

新上榜

GLM 5.3 Flash

Z.ai

3.67% ±1.03%

14.14% ±2.16%

5.45% ±3.49%

0.23% ±2.12%

24

↓ 2

Deepseek V4 Flash (High)(20260731)

DeepSeek

3.29% ±0.8%

8.46% ±1.76%

3.9% ±2.76%

0.02% ±1.6%

27

新上榜

Qwen3.8 Flash Next

Alibaba

2.61% ±1.21%

12.46% ±2.49%

0.24% ±4.15%

1.18% ±2.74%

30

↓ 3

Qwen 3.8 27B

Alibaba

1.03% ±0.99%

6.98% ±2.26%

0.78% ±3.28%

0.39% ±2.02%

AI 生图榜

AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1382 分蝉联榜首;微软 mai-image-2.6 首次入榜即拿到第二名,ELO 1332 分。

国产模型 seedream-5.0-pro 稳定保持第 8,qwen-image-3.0-pro 位列第 9,hunyuan-image-3.0 位列第 29,整体排名变化不大。

gpt-image-2 (medium)

OpenAI

1382 ±4

77830

$8 / $30

N/A

新上榜

mai-image-2.6

Microsoft AI

1332 ±7

10086

N/A

grok-imagine-image-2.0 (low)

SpaceXAI

1315 ±12

2682

N/A

reve-2.1

Reve

1301 ±8

7576

N/A

muse-image

Meta

1279 ±6

24856

N/A

reve-2.0

Reve

1270 ±6

14636

N/A

gemini-3.1-flash-image(nano-banana-2) [web-search]

Google

1261 ±5

40649

$0.5 / $3

131.1K

seedream-5.0-pro

Bytedance

1258 ±4

59484

N/A

qwen-image-3.0-pro

Alibaba

1254 ±7

10923

N/A

10

mai-image-2.5

Microsoft AI

1254 ±4

57295

N/A

— 以下为 Top 10 外的国产模型 —

16

qwen-image-2.0-pro-2026-06-22

Alibaba

1191 ±6

12016

N/A

29

hunyuan-image-3.0

Tencent

1151 ±3

173129

N/A

AI 视频榜

AI 视频榜本周最大亮点是阿里 wan3.0 首次入榜即冲进前三,ELO 得分 1494 分,仅次于谷歌 gemini-omni-1.1-flash( 1515 分)和 gemini-omni-flash( 1511 分),与第四名 flux-3-video( 1494 分)同分,在误差范围内视为并列。

国产 dreamina-seedance-2.5-720p 排名上升一位,来到第 6;minimax-h3 位列第 8,整体国产模型占据多个中上游位置。

gemini-omni-1.1-flash

Google

1515 ±15

1777

$1.5 / $9

131.1K

gemini-omni-flash

Google

1511 ±10

21934

N/A

新上榜

wan3.0

Alibaba

1494 ±19

1167

N/A

↓ 1

flux-3-video

Black Forest Labs

1494 ±17

1290

N/A

新上榜

grok-imagine-video-1.5-agent

SpaceXAI

1491 ±19

1195

N/A

↓ 1

dreamina-seedance-2.5-720p

Bytedance

1482 ±12

4066

N/A

↓ 3

dreamina-seedance-2.0-720p

Bytedance

1479 ±8

52864

N/A

↓ 2

minimax-h3

MiniMax

1462 ±10

7648

N/A

↓ 2

muse-video

Meta

1456 ±15

2178

N/A

10

↓ 2

happyhorse-1.0

Alibaba-ATH

1427 ±13

22116

N/A

— 以下为 Top 10 外的国产模型 —

19

↓ 4

wan2.7-t2v

Alibaba

1341 ±8

23025

N/A

21

↓ 2

wan2.6-t2v

Alibaba

1328 ±8

49348

N/A

22

↓ 2

seedance-v1.5-pro

Bytedance

1256 ±7

75891

N/A

25

↓ 2

wan2.5-t2v-preview

Alibaba

1246 ±9

32461

N/A

本期 Arena 周榜的最大看点是大量新模型集中发布并迅速入榜测试,其中国产模型在前端开发、AI 生成视频等细分领域实现了突破性排名,多款新模型首次入榜就冲进前十甚至前三,展现出快速迭代的竞争力。

头部综合榜仍由海外厂商模型占据,但国产模型与头部的分差正在持续缩小。

下周随着更多新模型完成投票积累,排名格局有望进一步变化,值得持续关注。