AI大模型周榜:Anthropic新模型霸榜,kimi-k3-max稳居国产第一
Arena(arena.ai)平台发布2026年第33周(8月10日至8月16日)AI大模型盲测排名。本期榜单中,Anthropic旗下多款claude-opus-4系列模型密集上榜,占据综合榜前五;国产模型kimi-k3-max排名上升2位至综合榜第12位,并在前端开发榜保持第2名。qwen3.8-max首次进入智能体榜前十。国产模型整体处于中上游,在部分细分领域已紧追海外头部模型。
该榜单基于匿名盲测投票,采用ELO(智能体榜为百分比信号)计分,反映用户主观偏好而非绝对能力。各分榜相互独立,分差在误差范围内视为并列,新模型需积累一定投票量后才正式入榜。
综合榜:Anthropic新模型包揽前三,claude-fable-5以1506分蝉联第一,claude-opus-4-6-high(1505分)和claude-opus-4-7-high(1502分)分列二、三位,三者分差均在5分以内。谷歌gemini-3.7-flash-high首次入榜即获第9名。国产模型中,kimi-k3-max以1489分升至第12名,为国产最高;阿里qwen3.8-max以1491分列第8,较上周下降2位;qwen3.7-max-preview以1474分列第26,下降3位。
代码榜:claude-fable-5以1554分守擂成功,claude-opus-4-7-high(1552分)和claude-opus-4-6-high(1551分)紧随其后。kimi-k3-max以1544分稳居第6,为国产最高;Meta muse-spark-1.2 (xHigh)上升7位至第8,成涨幅最大头部模型。其他国产排名:qwen3.8-max第13(1529分,降5位)、qwen3.7-max-preview第17(1525分,持平)、小米mimo-v2.5-pro第25(1520分,升3位)。
前端开发榜:claude-opus-5-max以1692分蝉联第一,kimi-k3-max以1674分紧随其后,仅差18分。qwen3.8-max升1位至第3(1667分),深度求索deepseek-v4-pro-high-20260813首次入榜即列第10(1584分)。其他国产:智谱glm-5.2-max第9(1585分,降2位)、deepseek-v4-flash-high第11(1581分,降3位)。
AI生图榜:gpt-image-2 (medium)以1381分继续领跑,微软mai-image-2.6-preview首次入榜即获第2(1336分)。国产seedream-5.0-pro(1258分)和qwen-image-3.0-pro分别列第8、第9,分差仅1分。
AI视频榜:Black Forest Labs的flux-3-video首次入榜即获第2(1496分),落后榜首gemini-omni-flash 16分。国产dreamina-seedance-2.0-720p保持第3(1478分),minimax-h3列第5。
智能体榜:Anthropic模型包揽前三,Claude Opus 5 (High)以12.19%净提升度居首。国产Qwen3.8 Max首次入榜即列第11,净提升度7.61%,任务确认成功率12.54%,工具幻觉率仅0.11%;Kimi K3 (Max)稳定第5(净提升度10.6%),已跻身全球第一梯队。另一新入榜的Claude Opus 4.8 (High)列第6(净提升度9.78%)。

