AI 大模型周榜:阿里 qwen3.8-max 冲进综合榜 Top 6,国产多模型表现亮眼
IT之家 8 月 10 日消息,Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。
IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。
国产模型在综合榜已有多款进入中上游,具体排名如下:
阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;
月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;
阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。
代码榜头部依旧被 Anthropic 模型垄断,claude-fable-5 蝉联第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分别占据第二、三名。月之暗面 kimi-k3-max 本周排名从第 8 位上升至第 6 位,ELO 分数上涨 11 分至 1542 分,闯入 Top 6,成为代码榜排名最高的国产模型。阿里 qwen3.8-max 排名第 8,ELO 1532 分,同样进入前十。Meta muse-spark-1.2 (xHigh) 本周首次入榜排名第 15,ELO 1526 分。
国产模型在代码榜已有多款进入前 30,具体如下:
月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,较上周上升 2 位;
阿里 qwen3.8-max 排名第 8 名,ELO 1532 分;
阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名下滑 1 位;
小米 mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平;
智谱 glm-5.1 排名第 30 名,ELO 1517 分,较上周下降 3 位。
本周前端开发榜榜首依旧是 claude-opus-5-max,ELO 1686 分,月之暗面 kimi-k3-max 稳定保持第二位,ELO 1675 分,仅下跌 1 分,仍紧逼头部海外模型。阿里 qwen3.8-max 拿下第四名,ELO 1667 分,直接进入前五,表现十分抢眼。深度求索 deepseek-v4-flash-high 也首次入榜,排名第 8 位,ELO 1581 分。国产模型在前端开发榜已经占据多个 top10 位置,整体竞争力持续提升。
月之暗面 kimi-k3-max 排名第 2 名,ELO 1675 分,排名持平;
阿里 qwen3.8-max 排名第 4 名,ELO 1667 分;
智谱 glm-5.2-max 排名第 7 名,ELO 1588 分,上升 1 位;
深度求索 deepseek-v4-flash-high 排名第 8 名,ELO 1581 分,首次入榜。
智能体榜本周头部发生更替,Anthropic Claude Opus 5 (High) 从第三名上升至第一名,净提升度达到 11.99%,此前榜首 Claude Fable 5 (High) 降至第二,净提升度 11.66%,两者净提升度差距小于双方置信区间之和,在误差范围内视为并列。国产模型月之暗面 Kimi K3 (Max) 稳定保持第五名,净提升度 10.08%,任务确认成功率达到 14.97%,已经跻身智能体榜第一梯队。深度求索 Deepseek V4 Flash (High) (20260731) 本周首次入榜排名第 21,净提升度 2.84%,任务确认成功率达到 8.53%,首秀表现符合预期。
国产模型在智能体榜已有多款进入前 30,具体如下:
月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 10.08%,任务确认成功率 14.97%,排名持平;
智谱 GLM 5.2 (Max) 排名第 12 名,净提升度 6.75%,排名持平;
深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名,净提升度 2.84%,首次入榜;
智谱 GLM 5.1 排名第 24 名,净提升度 0.35%,排名下降 2 位。

