AI 大模型周榜:国产 glm-5.3-max 首秀闯入综合榜前 15,kimi-k3-max 冲进前十
IT之家 8 月 24 日消息,Arena(arena.ai)平台发布 2026 年第 34 周(8 月 17 日 ~8 月 23 日)AI 大模型盲测排名,本期智谱新发布的 glm-5.3-max 首次入榜即闯入综合榜 Top 15,位列第 13 名,ELO 得分 1487 分;月之暗面 kimi-k3-max 从第 12 名升至第 10 名,首次杀入综合榜前十。此外,本周还有多个国产模型在各细分榜单中取得亮眼表现,新模型入榜数量较多,整体竞争格局进一步变化。
IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
综合榜头部格局保持稳定,claude-fable-5 以 1508 分蝉联第一,claude-opus-4-6-high 和 claude-opus-4-7-high 分别以 1504 分、 1502 分位列二、三名,三者分差均在 30 分以内,在误差范围内视为接近。
本周最大变化是新入榜的 glm-5.3-max 直接来到第 13 名,表现突出; kimi-k3-max 上升 2 位来到第 10 名,首次进入前十; muse-spark-1.1 上升 3 位至第 8 名。同时本周有 gpt-5.5-instant 、 claude-opus-4-8 两款新模型入榜,分别位列第 28、 29 名。qwen3.8-max 排名有所下滑,从第 8 名降至第 19 名。
国产模型在中上游占据多个席位,整体表现稳定:
月之暗面 kimi-k3-max 位列第 10 名,ELO 1489 分,较上周上升 2 位;
智谱 glm-5.3-max 位列第 13 名,ELO 1487 分,首次入榜;
阿里 qwen3.8-max 位列第 19 名,ELO 1481 分,较上周下降 11 位;
阿里 qwen3.7-max-preview 位列第 27 名,ELO 1474 分,排名基本持平。
代码榜头部发生微调,claude-opus-4-7-high 升至榜首,ELO 1552 分,claude-opus-4-6-high 位列第二,原本榜首的 claude-fable-5 降至第三,三者 ELO 分差仅为 1 分,在误差范围内属于并列水平。智谱 glm-5.3-max 首次入榜即杀入前十,位列第 10 名,ELO 1531 分,首秀表现亮眼。grok-4.20-beta1 新入榜位列第 20 名; claude-sonnet-4-5-20250929-high-32k 、 gpt-5.5-high 两款新模型也完成首次排名。qwen3.8-max 排名下滑明显,从第 13 名降至第 25 名。
国产模型在代码榜中已有多款进入前三十,具体排名如下:
月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名基本持平;
智谱 glm-5.3-max 位列第 10 名,ELO 1531 分,首次入榜;
阿里 qwen3.7-max-preview 位列第 17 名,ELO 1524 分,排名基本持平;
阿里 qwen3.8-max 位列第 25 名,ELO 1520 分,较上周下降 12 位;
小米 mimo-v2.5-pro 位列第 27 名,ELO 1519 分,排名基本持平。
前端开发榜头部依旧稳定,claude-opus-5-max 以 1691 分蝉联第一,国产 kimi-k3-max 和 qwen3.8-max 稳定占据二、三名,ELO 分别为 1674 分和 1669 分,与榜首分差在 30 分以内,误差范围内视为接近。新入榜的 glm-5.3-max 直接来到第 8 名,qwen3.8-27b 首次入榜位列第 9 名,两款国产新模型均进入前十,表现突出。目前已有多款国产模型进入前十五,在前端开发领域竞争力显著。
AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1381 分继续领跑,国产 seedream-5.0-pro 稳定保持第 8 名,qwen-image-3.0-pro 位列第 9 名,两款国产模型均进入前十,整体排名没有大幅波动。hunyuan-image-3.0 本周升至第 29 名,保持在前三十行列。
AI 视频榜中,字节跳动新发布的 dreamina-seedance-2.5-720p 首次入榜即来到第 4 名,ELO 1477 分,紧随其前代产品 dreamina-seedance-2.0-720p 之后,两款国产模型均进入前五,表现亮眼。gemini-omni-flash 继续以 1512 分排名第一,flux-3-video 位列第二,dreamina-seedance-2.0-720p 保持第三。
智能体榜头部依旧由 Anthropic 模型占据,Claude Opus 5 (High) 以 12.47% 的净提升度保持第一,Claude Opus 5 (Max) 上升一位至第二,Claude Fable 5 (High) 降至第三,三者净提升度差距小于置信区间,在误差范围内视为接近。月之暗面 Kimi K3 (Max) 上升一位至第四,净提升度 10.41%,任务确认成功率达到 17.97%,整体表现已经进入头部梯队。本周 DeepSeek V4 Pro (High) (0813) 和 Qwen3.8 Max 两款国产模型新入榜,分别位列第 14 和第 15 名,表现不俗。
国产模型在智能体榜已有多款进入前三十,头部已经摸到第一梯队门槛:
月之暗面 Kimi K3 (Max) 排名第 4,净提升度 10.41%,任务确认成功率 17.97%,较上周上升 1 位;
深度求索 DeepSeek V4 Pro (High) (0813) 排名第 14,净提升度 6.26%,任务确认成功率 13.06%,首次入榜;
阿里 Qwen3.8 Max 排名第 15,净提升度 6.20%,工具幻觉率仅 0.18%,首次入榜;
智谱 GLM 5.2 (Max) 排名第 17,净提升度 5.82%,较上周下降 3 位;

