17173 > 游戏资讯 > 科技新闻 > 正文

AI 大模型周榜:阿里千问 3.8-Max 空降综合前五,字节即梦 5.0 生图第六

2026-08-03 18:05:46 神评论
17173 新闻导语

AI大模型周榜出炉:阿里千问3.8-Max空降综合前五,字节即梦5.0生图第六,国产模型强势崛起,与海外差距缩小,点击查看完整榜单!

8 月 3 日消息,Arena(arena.ai)平台 AI 大模型 2026 年第 31 周排行榜发布,本期统计周期为 2026 年 7 月 27 日至 8 月 2 日。

本周榜单迎来大量新模型更新,国产模型亮点突出:阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5,月之暗面 kimi-k3-max 位列综合榜第 13 名,字节跳动 seedream-5.0-pro 排名大幅上升 5 位进入 AI 生图榜 Top 6,多款国产模型在细分榜单取得亮眼成绩。整体来看,本周国产模型在头部梯队占位进一步提升,与海外顶级模型差距继续缩小。

综合榜

本周综合榜头部几乎被 Anthropic 新品包揽,claude-fable-5 以 1509 分蝉联榜首,第二到第四名分别为 claude-opus-4-6-thinking ( 1505 分)、 claude-opus-4-7-thinking ( 1502 分)、 claude-opus-4-6 ( 1497 分),分数差距均在 30 分以内,在统计误差范围内视为接近。阿里最新发布的 qwen3.8-max 以 1496 分位列第 5 名,仅比榜首低 13 分,成为目前排名最高的国产模型,表现极为突出。

国产模型在本次综合榜已有多款进入前 25 名,梯队分布如下:

阿里 qwen3.8-max 排名第 5,ELO 1496 分,为本次新入榜模型;

月之暗面 kimi-k3-max 排名第 13,ELO 1485 分,本次新入榜;

阿里 qwen3.7-max-preview 排名第 22,ELO 1475 分,排名持平。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文1🇺🇸 claude-fable-5Anthropic1509 ±617799$10 / $501M2🇺🇸 claude-opus-4-6-thinkingAnthropic1505 ±467203$5 / $251M3🇺🇸 claude-opus-4-7-thinkingAnthropic1502 ±454781$5 / $251M4🇺🇸 claude-opus-4-6Anthropic1497 ±470970$5 / $251M5🇨🇳 qwen3.8-max阿里1496 ±103327$2 / $61M6🇺🇸 claude-opus-4-7Anthropic1492 ±455992$5 / $251M7🇺🇸 claude-opus-5-highAnthropic1492 ±610704$5 / $251M8🇺🇸 claude-opus-5-maxAnthropic1490 ±95124$5 / $251M9🇺🇸 muse-spark-1.1Meta1490 ±612086$1.25 / $4.25N/A10🇺🇸 muse-sparkMeta1488 ±613486N/AN/A— 以下为 Top 10 外的国产模型 —13🇨🇳 kimi-k3-max 预发布月之暗面1485 ±103556$3 / $151.05M22🇨🇳 qwen3.7-max-preview 预发布阿里1475 ±103695$1.48 / $4.431M代码榜

代码榜方面,claude-fable-5 以 1553 分从第二名升至榜首,claude-opus-4-7-thinking 以 1552 分紧随其后,两款模型分差仅 1 分,在统计误差范围内并列。头部前 8 名中,阿里 qwen3.8-max 以 1530 分位列第 10 名,月之暗面 kimi-k3-max 同样以 1531 分排在第 8 名,国产模型首次有两款同时杀入代码榜 Top 10,进步显著。

国产模型在代码榜的具体排名如下:

月之暗面 kimi-k3-max 排名第 8,ELO 1531 分,本次新入榜,预发布状态;

阿里 qwen3.8-max 排名第 10,ELO 1530 分,本次新入榜,预发布状态;

阿里 qwen3.7-max-preview 排名第 17,ELO 1525 分,排名持平;

智谱 glm-5.1 排名第 28,ELO 1518 分,较上周下降 7 位;

小米 mimo-v2.5-pro 排名第 29,ELO 1518 分,排名下降 5 位。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文1🇺🇸 claude-fable-5Anthropic1553 ±94823$10 / $501M2🇺🇸 claude-opus-4-7-thinkingAnthropic1552 ±615649$5 / $251M3🇺🇸 claude-opus-4-6-thinkingAnthropic1551 ±617433$5 / $251M4🇺🇸 claude-opus-4-6Anthropic1548 ±619814$5 / $251M5🇺🇸 claude-opus-4-7Anthropic1547 ±615915$5 / $251M6🇺🇸 claude-opus-4-8-thinkingAnthropic1534 ±79830$5 / $251M7🇺🇸 claude-opus-5-highAnthropic1532 ±122918$5 / $251M8🇨🇳 kimi-k3-max 预发布月之暗面1531 ±20947$3 / $151.05M9🇺🇸 claude-opus-4-5-20251101-thinking-32kAnthropic1530 ±77606$5 / $25200K10🇨🇳 qwen3.8-max 预发布阿里1530 ±19991$2 / $61M— 以下为 Top 10 外的国产模型 —17🇨🇳 qwen3.7-max-preview 预发布阿里1525 ±181113$1.48 / $4.431M28🇨🇳 glm-5.1智谱1518 ±79822$1.4 / $4.4202.8K29🇨🇳 mimo-v2.5-pro小米1518 ±712665$0.44 / $0.871.05M前端开发榜

前端开发榜中,claude-opus-5-max 以 1705 分守住榜首位置,月之暗面 kimi-k3-max 以 1676 分位列第二,阿里 qwen3.8-max 以 1668 分排名第四,国产模型共有三款进入 Top 8,占据半壁江山。kimi-k3-max 仅落后榜首 29 分,在统计误差范围内与头部海外模型非常接近。

国产模型整体处于中上游,具体排名如下:

月之暗面 kimi-k3-max 排名第 2,ELO 1676 分,预发布状态;

阿里 qwen3.8-max 排名第 4,ELO 1668 分,预发布状态;

智谱 glm-5.2-max 排名第 7,ELO 1586 分;

字节跳动 seed-2.1-pro-preview 排名第 19,ELO 1527 分,预发布状态;

阿里 qwen3.7-max-20260517 排名第 23,ELO 1517 分。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文1🇺🇸 claude-opus-5-maxAnthropic1705 ±152192$5 / $251M2🇨🇳 kimi-k3-max 预发布月之暗面1676 ±124366$3 / $151.05M3🇺🇸 claude-opus-5-highAnthropic1669 ±113873$5 / $251M4🇨🇳 qwen3.8-max 预发布阿里1668 ±181563$2 / $61M5🇺🇸 claude-fable-5Anthropic1630 ±96310$10 / $501M6🇺🇸 gpt-5.6-sol-xhigh (codex-harness)OpenAI1620 ±96000$5 / $301.05M7🇨🇳 glm-5.2-max 预发布智谱1586 ±96361$1.4 / $4.41M8🇨🇳 deepseek-v4-flash-high 预发布深度求索1577 ±181319$0.14 / $0.281.05M9🇺🇸 claude-opus-4-8-thinkingAnthropic1566 ±88934$5 / $251M10🇺🇸 claude-opus-4-7Anthropic1561 ±711755$5 / $251M— 以下为 Top 10 外的国产模型 —19🇨🇳 seed-2.1-pro-preview 预发布字节跳动1527 ±95513N/AN/A23🇨🇳 qwen3.7-max-20260517阿里1517 ±87840$1.48 / $4.431M24🇨🇳 hy3 预发布腾讯1517 ±171491$0.13 / $0.53262.1K25🇨🇳 glm-5.1 预发布智谱1516 ±87377$1.4 / $4.4202.8K26🇨🇳 kimi-k2.6 预发布月之暗面1510 ±89256$0.95 / $4262.1K30🇨🇳 minimax-m3 预发布MiniMax1491 ±88155$0.6 / $2.4N/A智能体榜

智能体榜采用百分比信号评分体系,本周 Claude Fable 5 (High) 以 12.58% 的净提升度稳居第一,Claude Opus 5 (Max) 和 Claude Opus 5 (High) 分列二三位,头部格局基本稳定。Anthropic 旗下模型占据前七名中的五席,在智能体任务领域仍保持明显优势。工具幻觉率最低的模型是腾讯 hy3 ,仅为 0.33% ,可控性最强的模型是 Nemotron 3 Ultra,达到 20.73% 。

国产模型在智能体榜的排名和净提升度如下:

MiniMax minimax-m3 排名第 33 名,净提升度 2.55% ,任务确认成功率 5.67%;

深度求索 DeepSeek V4 Flash 排名第 34 名,净提升度 2.96% ,任务确认成功率 4.9%;

小米 Mimo V2.5 Pro 排名第 32 名,净提升度 2.52% ,任务确认成功率 3.81%;

阿里 Qwen3.7 Max 排名第 25 名,净提升度 0.53% ,任务确认成功率 1.95%;

月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 9.91% ,任务确认成功率 14.23%,进入智能体榜 Top 5。

排名模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性会话数1🇺🇸 Claude Fable 5 (High)Anthropic12.58 ±2.1910.2624.4212.93238072🇺🇸 Claude Opus 5 (Max)Anthropic11.88 ±2.8117.5625.631.8172533🇺🇸 Claude Opus 5 (High)Anthropic11.73 ±1.6616.624.45.49111144🇺🇸 GPT 5.6 Sol (xHigh)OpenAI10.02 ±1.638.6121.98.96169665🇨🇳 Kimi K3 (Max)月之暗面9.91 ±1.1914.2317.459.67195866🇺🇸 Claude Opus 4.8 (Thinking)Anthropic9.43 ±1.648.7521.059.77344777🇺🇸 Claude Sonnet 5 (High)Anthropic8.57 ±2.07.9516.126.74246578🇺🇸 GPT 5.5 (xHigh)OpenAI8.49 ±0.955.8212.918.24431229🇺🇸 Claude Opus 4.7 (Thinking)Anthropic8.19 ±1.266.1911.29.653547110🇺🇸 GPT 5.5 (High)OpenAI7.89 ±0.885.6311.319.1868340— 以下为 Top 10 外的国产模型 —19🇺🇸 Claude Opus 4.8Anthropic3.34 ±1.948.2412.758.393255120🇺🇸 Claude Sonnet 4.6Anthropic3.18 ±1.20.070.882.393596623🇨🇳 Kimi K2.7 Code月之暗面0.44 ±1.824.733.423.711035925🇨🇳 Qwen3.7 Max阿里0.53 ±0.971.955.890.22091426🇨🇳 DeepSeek V4 Pro深度求索0.78 ±0.943.615.370.392145927🇨🇳 hy3腾讯1.03 ±1.881.552.838.17850629🇨🇳 Kimi K2.6月之暗面1.09 ±1.953.11.584.91043630🇨🇳 gemini-3.6-flash谷歌1.59 ±2.680.156.22.59253231🇨🇳 Qwen3.7 Plus阿里1.65 ±1.291.727.984.631411232🇨🇳 Mimo V2.5 Pro小米2.52 ±1.013.818.052.112139933🇨🇳 Minimax M3MiniMax2.55 ±0.935.679.014.562099634🇨🇳 DeepSeek V4 Flash深度求索2.96 ±0.954.98.383.982077541🇨🇳 Minimax M2.7MiniMax11.59 ±1.1714.6715.7414.9421221AI 生图榜

AI 生图榜本周最大亮点是字节跳动 seedream-5.0-pro 排名大幅上升 5 位,从第 11 名升至第 6 名,ELO 分数达到 1257 分,仅落后榜首 gpt-image-2 (medium) 124 分,成功杀入 Top 6,成为排名最高的国产 AI 生图模型。另有多款国产模型进入前 30 名,hunyuan-image-3.0 排名第 25,seedream-4.5 排名第 28,整体表现稳定。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文1🇺🇸 gpt-image-2 (medium)OpenAI1381 ±566665N/AN/A2🇺🇸 reve-2.1Reve1300 ±86131N/AN/A3🇺🇸 muse-imageMeta1281 ±713261N/AN/A4🇺🇸 reve-2.0Reve1270 ±614563N/AN/A5🇺🇸 gemini-3.1-flash-image (nano-banana-2) [web-search]谷歌1263 ±625351N/AN/A6🇨🇳 seedream-5.0-pro 预发布字节跳动1257 ±620977N/AN/A7🇺🇸 mai-image-2.5Microsoft AI1254 ±541589N/AN/A8🇺🇸 gemini-3.1-flash-lite-image (nano-banana-2-lite)谷歌1251 ±616201N/AN/A9🇺🇸 gemini-3-pro-image-2k (nano-banana-pro)谷歌1246 ±3135981N/AN/A10🇺🇸 gpt-image-1.5-high-fidelityOpenAI1239 ±3139642N/AN/A— 以下为 Top 10 外的国产模型 —14🇨🇳 qwen-image-2.0-pro-2026-06-22 预发布阿里1191 ±611952N/AN/A25🇨🇳 hunyuan-image-3.0 预发布腾讯1151 ±3172741N/AN/A28🇨🇳 seedream-4.5 预发布字节跳动1147 ±3229805N/AN/A30🇨🇳 seedream-4-2k 预发布字节跳动1140 ±712599N/AN/AAI 视频榜

AI 视频榜头部格局稳定,gemini-omni-flash 以 1513 分继续排名第一,字节跳动 dreamina-seedance-2.0-720p 以 1479 分守住第二的位置,阿里 happyhorse-1.0 以 1428 分排名第四,两款国产模型稳居前五,表现稳定。国产模型共有 7 款进入前 30,整体占据中上游位置。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文1🇺🇸 gemini-omni-flash谷歌1513 ±1214571N/AN/A2🇨🇳 dreamina-seedance-2.0-720p 预发布字节跳动1479 ±1147067N/AN/A3🇺🇸 muse-videoMeta1458 ±152160N/AN/A4🇨🇳 happyhorse-1.0 预发布阿里1428 ±1321979N/AN/A5🇺🇸 sora-2-proOpenAI1365 ±844543$0 / $0.3N/A6🇺🇸 veo-3.1-audio谷歌1364 ±1413687$0 / $0.4N/A7🇺🇸 veo-3.1-audio-1080p谷歌1363 ±1024846N/AN/A8🇺🇸 veo-3.1-fast-audio谷歌1362 ±1139301$0 / $0.15N/A9🇺🇸 veo-3.1-fast-audio-1080p谷歌1358 ±1025637N/AN/A10🇺🇸 grok-imagine-video-720pSpaceXAI1349 ±8151774N/AN/A— 以下为 Top 10 外的国产模型 —12🇨🇳 wan2.7-t2v 预发布阿里1347 ±915246N/AN/A15🇨🇳 wan2.6-t2v 预发布阿里1330 ±941706N/AN/A16🇨🇳 seedance-v1.5-pro 预发布字节跳动1256 ±775653N/AN/A18🇨🇳 wan2.5-t2v-preview 预发布阿里1252 ±1025895N/AN/A27🇨🇳 hailuo-2.3 预发布MiniMax1202 ±772127N/AN/A28🇨🇳 hailuo-02-pro 预发布MiniMax1198 ±139365N/AN/A29🇨🇳 seedance-v1-pro 预发布字节跳动1190 ±1112117N/AN/A30🇨🇳 hailuo-02-standard 预发布MiniMax1180 ±129333N/AN/A

总结来看,本周 Arena AI 大模型周榜迎来密集更新,大量新模型首次入榜,国产模型整体取得突破性进展:阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5,代码榜和前端开发榜也均有国产模型进入 Top 10;字节跳动 seedream-5.0-pro 大幅提升排名进入 AI 生图榜 Top 6;AI 视频榜始终有两款国产模型稳居前五,月之暗面 kimi-k3-max 在智能体榜也进入 Top 5。国产大模型在多个维度持续缩小与海外顶级模型的差距,后续新品发布值得期待。

【来源:IT之家】
关于AI大模型,周榜,阿里千问,月之暗面,字节跳动,seedream-5.0-pro,kimi-k3-max,qwen3.8-max,综合榜,代码榜的新闻