本文由第三方AI基于17173文章http://news.17173.com/content/04102026/190104553.shtml提炼总结而成,可能与原文真实意图存在偏差。不代表网站观点和立场。推荐点击链接阅读原文细致比对和校验。
国产AI大模型GLM-5.1登顶开源第一:可独立编程8小时
2026-04-10 19:01:04
神评论
17173 新闻导语
GLM-5.1登顶开源AI模型第一!编程能力45.3分,8小时独立构建Linux桌面,SWE-bench Pro超越GPT-5.4。全球第三,开源最强!
3月底智谱正式推出了GLM-5.1大模型,编程能力评分45.3分,号称比全球最强的Opus 4.6只低了2.6分。
前两天GLM-5.1大模型也正式开源,也深受开发者喜爱,现在最新的排名也来了——全球权威AI评测平台LMArena(百万用户参与盲测)更新Code Arena专项榜单,GLM-5.1登顶全球开源模型第一,位列全球模型第三。
除了榜单表现优秀,根据智谱的说法,GLM-5.1不仅继承了上一代模型的开源SOTA编码能力,还在长程任务(Long-Horizon Task)上取得突破,实现了:
·8小时从零构建Linux桌面
·655次迭代打破向量数据库优化瓶颈
·1000轮工具调用优化真实机器学习模型负载
值得一提的是,在METR榜单的同等评估标准下,GLM-5.1是唯一达到8小时级持续工作的开源模型,也是全球范围内除Claude Opus 4.6外少数具备这一能力的模型。

此前智谱提到,GLM-5.1大大提高了代码能力,在完成长程任务方面提升尤为显著。
在最接近真实软件开发的SWE-bench Pro基准测试中,GLM-5.1刷新全球最佳成绩,超过GPT-5.4、Claude Opus 4.6。SWE-Bench Pro要求模型在真实GitHub仓库中定位并修复高难度工程Bug,是衡量模型能否胜任专业软件开发的最硬指标。

【来源:快科技】
今日热点
热门测试游戏
- 1国服重启!《代号:LUNA》「拾光测试」定档5月28日
- 2当所有人扑向手游的风口,它却回头为端游玩家造了一座“慢城”
- 3《七界梦谭》五大离谱设定!这可能是近几年最阴间的游戏了
- 4看了200个华强买瓜视频后,我意识到B站鬼畜区变天了
- 5巴西MMORPG《凡尼亚Online》支持中文,推出新公会系统
- 6点券自由交易真的要来了?《DNF》手游二周年爆料
- 7《剑网3国际版》与《仙剑奇侠传三》合作上线,新资料片同步改版
- 8因为双重氪金,网石新作《权力游戏:国王大道》被喷,官方滑跪退款
- 9150万在线神话再现?《冒险岛》怀旧服爆火背后,藏着怎样的时代执念
- 10不限号不付费!《精灵曙光重制版》启航测试今日正式开启

