17173 > 游戏资讯 > 科技新闻 > 正文

AI 大模型周榜:国产 GLM-5.3-Flash 首秀杀进代码榜前十,千问 3.8-Max 登顶前端榜

2026-09-02 16:04:28 神评论
17173 新闻导语

AI大模型周榜发布:国产GLM-5.3-Flash首秀代码榜前十,Qwen3.8-Max登顶前端开发榜,多款国产新模型集中亮相,代码与前端领域持续突破,点击查看完整排名!

9 月 2 日消息,Arena(arena.ai)平台发布 2026 年第 35 周(8 月 24 日 ~8 月 30 日)AI 大模型盲测排行榜,本期有多款国产新模型亮相,且取得亮眼排名。

国产 GLM-5.3-Flash 首次进入代码榜 Top 10,Qwen3.8-Max-0902 首次入榜即登顶前端开发榜榜首,Kimi-K3-Max 稳定守住综合榜 Top 10 位置,整体来看国产模型在细分领域继续保持竞争力。

注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本周综合榜头部格局稳定,Claude-Fable-5 以 1508 分蝉联榜首,Anthropic 多款模型占据前七位,排名变化均在 1 位以内,ELO 分差均在 30 分以内,属于统计误差范围内的接近。

另外,本周有两款新模型入榜,分别是谷歌 Gemini-3-Flash 和智谱 GLM-5.3-Flash,首秀分别排在第 27 位和第 30 位,ELO 分数分别为 1474 分和 1473 分。

国产模型整体处于中上游位置:

月之暗面 kimi-k3-max 排名最高,位列第 10 名,ELO 1489 分,排名持平;

智谱 glm-5.3-max 位列第 17 名,ELO 1482 分,较上周下降 4 位;

阿里 qwen3.8-max 位列第 20 名,ELO 1479 分,较上周下降 1 位;

阿里 qwen3.7-max-preview 位列第 28 名,ELO 1474 分,排名下降 1 位;

智谱 glm-5.3-flash 位列第 30 名,ELO 1473 分,为本周新入榜模型。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)输入 / 输出上下文1-claude-fable-5Anthropic1508 ±527013$10 / $501M2-claude-opus-4-6-highAnthropic1505 ±472114$5 / $251M3-claude-opus-4-7-highAnthropic1502 ±460125$5 / $251M4-muse-spark-1.2 (xHigh)Meta1499 ±103245$1.25 / $4.25N/A5-claude-opus-4-6Anthropic1498 ±376040$5 / $251M6-claude-opus-4-7Anthropic1494 ±461248$5 / $251M7-claude-opus-5-highAnthropic1492 ±534718$5 / $251M8-muse-spark-1.1Meta1491 ±523814$1.25 / $4.25N/A9-gemini-3.7-flash-highGoogle1491 ±85682$0.75 / $3.571.05M10-kimi-k3-maxMoonshot1489 ±517908N/AN/A— 以下为 Top 10 外的国产模型 —17↓ 4glm-5.3-maxZ.ai1482 ±77454$1.4 / $4.41.05M20↓ 1qwen3.8-maxAlibaba1479 ±613190$2 / $61M28↓ 1qwen3.7-max-previewAlibaba1474 ±103707$1.48 / $4.431M30新上榜glm-5.3-flashZ.ai1473 ±94451$0.15 / $0.51.05M代码榜

本周代码榜头部同样由 Anthropic 垄断,Claude-Opus-4-7-high 以 1552 分稳居第一,前三名 ELO 分差仅 1 分,在误差范围内视为并列。

最值得关注的是国产新模型 GLM-5.3-Flash 首次入榜即闯入 Top 10,排在第 7 名,ELO 分数达到 1535 分,超过绝大多数头部海外模型。另外 OpenAI 新模型 GPT-5.6-Terra-Xhigh 也首次入榜,排在第 30 名,ELO 1519 分。

国产模型在代码榜已有多款进入前列:

月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平;

智谱 glm-5.3-flash 位列第 7 名,ELO 1535 分,本周新入榜;

智谱 glm-5.3-max 位列第 16 名,ELO 1528 分,较上周下降 6 位;

阿里 qwen3.7-max-preview 位列第 18 名,ELO 1525 分,下降 1 位;

小米 mimo-v2.5-pro 位列第 24 名,ELO 1521 分,上升 3 位;

阿里 qwen3.8-max 位列第 29 名,ELO 1519 分,下降 4 位。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)输入 / 输出上下文1-claude-opus-4-7-highAnthropic1552 ±617190$5 / $251M2-claude-opus-4-6-highAnthropic1552 ±618804$5 / $251M3-claude-fable-5Anthropic1551 ±87247$10 / $501M4-claude-opus-4-7Anthropic1547 ±617347$5 / $251M5-claude-opus-4-6Anthropic1546 ±521209$5 / $251M6-kimi-k3-maxMoonshot1542 ±94674N/AN/A7新上榜glm-5.3-flashZ.ai1535 ±181213$0.15 / $0.51.05M8-claude-opus-4-8-highAnthropic1534 ±613386$5 / $251M9-muse-spark-1.2 (xHigh)Meta1534 ±20936$1.25 / $4.25N/A10↓ 3claude-opus-5-highAnthropic1533 ±79237$5 / $251M— 以下为 Top 10 外的国产模型 —16↓ 6glm-5.3-maxZ.ai1528 ±141961$1.4 / $4.41.05M18↓ 1qwen3.7-max-previewAlibaba1525 ±181119$1.48 / $4.431M24↑ 3mimo-v2.5-proXiaomi1521 ±615762$0.44 / $0.871.05M29↓ 4qwen3.8-maxAlibaba1519 ±103828$2 / $61M前端开发榜

本周前端开发榜迎来重大变化,阿里新模型 Qwen3.8-max-0902 首次入榜即直接登顶,以 1691 分夺得榜首,将此前的 Claude-Opus-5-Max 挤到第二。

腾讯新模型 Hy4-Preview 首秀排在第 8 名,ELO 1627 分;阿里 Qwen3.8-flash-next 首秀第 9 名( 1622 分),智谱 GLM-5.3-Flash 首秀第 12 名( 1604 分),四款国产新模型集体闯入前 12,表现极为抢眼。

国产模型在前端开发榜占据半壁江山,头部位置稳定:

阿里 qwen3.8-max-0902 位列第 1 名,ELO 1691 分,本周新入榜;

月之暗面 kimi-k3-max 位列第 3 名,ELO 1674 分,下降 1 位;

阿里 qwen3.8-max 位列第 4 名,ELO 1669 分,下降 1 位;

腾讯 hy4-preview 位列第 8 名,ELO 1627 分,本周新入榜;

阿里 qwen3.8-flash-next 位列第 9 名,ELO 1622 分,本周新入榜;

智谱 glm-5.3-flash 位列第 12 名,ELO 1604 分,本周新入榜。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)输入 / 输出上下文1新上榜qwen3.8-max-0902Alibaba1691 ±191390$2 / $61M2↓ 1claude-opus-5-maxAnthropic1687 ±810517$5 / $251M3↓ 1kimi-k3-maxMoonshot1674 ±114544$3 / $151.05M4↓ 1qwen3.8-maxAlibaba1669 ±123220$2 / $61M5↓ 1claude-opus-5-highAnthropic1661 ±810462$5 / $251M6↓ 1grok-4.6-highSpaceXAI1629 ±171534$2 / $6500K7↓ 1claude-fable-5Anthropic1628 ±89131$10 / $501M8新上榜hy4-previewTencent1627 ±171438$0.83 / $2.51.05M9新上榜qwen3.8-flash-nextAlibaba1622 ±151939$0.16 / $0.471M10↓ 3gpt-5.6-sol-xhigh(codex-harness)OpenAI1616 ±710766$4 / $201.05M— 以下为 Top 10 外的国产模型 —11↓ 3glm-5.3-maxZ.ai1609 ±132712$1.4 / $4.41.05M12新上榜glm-5.3-flashZ.ai1604 ±161749$0.15 / $0.51.05M13↓ 4qwen3.8-27bAlibaba1598 ±113312$0.4 / $3N/A15↓ 4glm-5.2-maxZ.ai1585 ±79636$1.4 / $4.41M16↓ 4deepseek-v4-pro-high-20260813DeepSeek1583 ±113349$1.32 / $3.96N/A17↓ 4deepseek-v4-flash-highDeepSeek1580 ±103998$0.44 / $1.321.05M29↓ 3seed-2.1-pro-previewBytedance1522 ±88452N/AN/A智能体榜

本周智能体榜头部格局基本稳定,Anthropic 模型依然占据前三,Claude Opus 5 (High) 以 13.74% 的净提升度蝉联第一,工具幻觉率仅 0.8%,为头部模型中最低。值得关注的是智谱 GLM 5.2 (Max) 排名大幅提升 7 位,来到第 10 名,净提升度 6.23%,任务确认成功率达到 8.65%,表现亮眼。

本周共有四款新模型入榜,分别是 SpaceXAI Grok-4.6 (xHigh)、智谱 GLM 5.3 Flash、智谱 GLM 5.3 (Max)、阿里 Qwen3.8 Flash Next 和阿里 Qwen 3.8 27B,其中 Grok-4.6 (xHigh) 首秀排在第 15 名,净提升度 5.33%。

国产模型在智能体榜已有多款进入前 20,具体排名:

月之暗面 Kimi K3 (Max) 排名第 6 名,净提升度 8.71%,任务确认成功率 16.90%,较上周下降 2 位;

深度求索 DeepSeek V4 Pro (High) (0813) 排名第 14 名,净提升度 5.91%,任务确认成功率 13.14%;

阿里 Qwen3.8 Max 排名第 16 名,净提升度 5.24%,工具幻觉率仅 0.11%;

智谱 GLM 5.2 (Max) 排名第 10 名,净提升度 6.23%,较上周上升 7 位;

智谱 GLM 5.3 Flash 排名第 19 名,净提升度 4.03%,本周新入榜;

智谱 GLM 5.3 (Max) 排名第 20 名,净提升度 3.74%,本周新入榜。

排名较上周模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性1-Claude Opus 5 (High)Anthropic13.74% ±1.8%14.96% ±3.73%21.82% ±6.81%16% ±3.26%2-Claude Opus 5 (Max)Anthropic11.69% ±2.01%15.49% ±4.03%18.35% ±7.36%8.3% ±3.98%3-Claude Fable 5 (High)Anthropic10.61% ±1.53%6.81% ±3.3%20.25% ±5.49%13.23% ±2.77%4↑ 1GPT 5.6 Sol (xHigh)OpenAI9.49% ±1.51%7.57% ±3.2%21.62% ±5.62%8.73% ±2.88%5↑ 1Claude Opus 4.8 (High)Anthropic9.22% ±1.53%5.38% ±3.11%18.87% ±5.3%12.06% ±2.83%6↓ 2Kimi K3 (Max)Moonshot8.71% ±0.66%16.9% ±1.35%15.85% ±2.31%2.13% ±1.29%7-GPT 5.5 (xHigh)OpenAI7.53% ±1.08%2.45% ±2.36%12.23% ±3.75%8.55% ±1.99%8↑ 3Claude Sonnet 5 (High)Anthropic7.51% ±2.11%1.07% ±4.44%12.46% ±7.28%12.29% ±4.43%9↓ 1Claude Opus 4.7 (High)Anthropic6.49% ±1.42%3.98% ±3%10.47% ±4.7%6.18% ±2.62%10↑ 7GLM 5.2 (Max)Z.ai6.23% ±0.77%8.65% ±1.66%11.26% ±2.71%5.41% ±1.41%— 以下为 Top 10 外的国产模型 —14-DeepSeek V4 Pro (High) (0813)DeepSeek5.91% ±1.04%13.14% ±2.13%5.47% ±3.51%1.06% ±2.31%16↓ 1Qwen3.8 MaxAlibaba5.24% ±1.13%8.38% ±2.5%6.47% ±3.89%4.56% ±2.26%19新上榜GLM 5.3 FlashZ.ai4.03% ±1.23%14.56% ±2.63%4.64% ±4.09%1.19% ±2.7%20新上榜GLM 5.3 (Max)Z.ai3.74% ±0.77%12.36% ±1.71%4.27% ±2.53%0.83% ±1.55%23↓ 3Deepseek V4 Flash (High)(20260731)DeepSeek2.85% ±0.81%6.97% ±1.82%3.38% ±2.73%0.16% ±1.65%24新上榜Qwen3.8 Flash NextAlibaba2.51% ±1.57%11.86% ±3.26%1.54% ±5.29%0.31% ±3.72%27-Kimi K2.7 CodeMoonshot1.24% ±2.52%1.92% ±5.57%1.16% ±8.58%5.13% ±5.51%28新上榜Qwen 3.8 27BAlibaba1.19% ±1.11%7.08% ±2.54%0.84% ±3.67%0.27% ±2.28%AI 生图榜

本周 AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1382 分继续领跑,国产 seedream-5.0-pro 稳居第 8 名,qwen-image-3.0-pro 排在第 9 名,两款国产模型均守住 Top 10 位置。谷歌 gemini-2.5-flash-image-preview 本周新入榜,排在第 30 名,ELO 1150 分。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)输入 / 输出上下文1-gpt-image-2 (medium)OpenAI1382 ±475014$8 / $30N/A2-mai-image-2.6-previewMicrosoft AI1331 ±86418N/AN/A3-grok-imagine-image-2.0 (low)SpaceXAI1316 ±122675N/AN/A4-reve-2.1Reve1302 ±87580N/AN/A5-muse-imageMeta1281 ±622691N/AN/A6-reve-2.0Reve1270 ±614631N/AN/A7-gemini-3.1-flash-image(nano-banana-2) [web-search]Google1263 ±536392$0.5 / $3131.1K8-seedream-5.0-proBytedance1258 ±548174N/AN/A9-qwen-image-3.0-proAlibaba1255 ±710927N/AN/A10-mai-image-2.5Microsoft AI1254 ±456737N/AN/A— 以下为 Top 10 外的国产模型 —16-qwen-image-2.0-pro-2026-06-22Alibaba1191 ±612013N/AN/A29-hunyuan-image-3.0Tencent1151 ±3173101N/AN/AAI 视频榜

本周 AI 视频榜迎来新榜首,谷歌 gemini-omni-1.1-flash 首次入榜即夺得第一,ELO 1515 分,超过此前的 gemini-omni-flash。

国产模型方面,dreamina-seedance-2.0-720p 排在第 4 名,dreamina-seedance-2.5-720p 排在第 5 名,minimax-h3 上升至第 6 名,MiniMax 新模型 hailuo-2.3 首次入榜排在第 30 名,ELO 1205 分。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)输入 / 输出上下文1新上榜gemini-omni-1.1-flashGoogle1515 ±161762$1.5 / $9131.1K2↓ 1gemini-omni-flashGoogle1512 ±1019830N/AN/A3↓ 1flux-3-videoBlack Forest Labs1495 ±171287N/AN/A4↓ 1dreamina-seedance-2.0-720pBytedance1479 ±951266N/AN/A5↓ 1dreamina-seedance-2.5-720pBytedance1476 ±142121N/AN/A6-minimax-h3MiniMax1460 ±105813N/AN/A7↓ 2muse-videoMeta1457 ±152178N/AN/A8↓ 1happyhorse-1.0Alibaba-ATH1428 ±1322112N/AN/A9↓ 1sora-2-proOpenAI1365 ±748782$0 / $0.3N/A10↓ 1veo-3.1-audioGoogle1364 ±1413705$0 / $0.4N/A— 以下为 Top 10 外的国产模型 —15-wan2.7-t2vAlibaba1344 ±820882N/AN/A19↓ 1wan2.6-t2vAlibaba1329 ±847267N/AN/A20↓ 1seedance-v1.5-proBytedance1256 ±775890N/AN/A23↓ 2wan2.5-t2v-previewAlibaba1247 ±930497N/AN/A30新上榜hailuo-2.3MiniMax1205 ±679981N/AN/A

总结来看,本周 Arena 周榜最大看点是多款国产新模型集中亮相并取得优异排名,glm-5.3-flash 在代码榜闯入 Top 10,qwen3.8-max-0902 更是直接登顶前端开发榜,显示国产模型在代码开发领域持续进步。头部依然是 Anthropic 模型垄断综合和代码榜,但国产模型在细分领域已经能冲击榜首位置,后续更多国产新模型的表现值得继续关注。

【来源:IT之家】
关于AI大模型,GLM-5.3-Flash,Qwen3.8-Max,代码榜,前端开发榜,国产模型,Anthropic,排行榜,ELO,盲测的新闻
17173想了解一下大家怎么看17173的,以便提供更好的阅读体验,所以请各位路过的大佬们花一分钟时间看看这个问卷吧 一键参与