新游热游: 全球国内手游盘点测试表开服表怀旧频道

品牌: 游戏X博士正惊游戏公众号

新闻大全

17173 > 游戏资讯 > 科技新闻 > 正文

AI 社会自治测试：Grok 四天崩溃、Gemini 犯罪率最高

2026-05-30 16:04:08 神评论

17173 新闻导语

AI社会自治实验揭秘：Grok仅4天崩溃，Gemini犯罪率最高达683起，Claude零犯罪！5大模型在模拟世界中表现惊人，安全不是静态属性，点击查看完整结果。

5 月 30 日消息，Emergence AI 于 5 月 14 日发布博文，搭建了一个 AI 社会 Emergence World，从而评估 Gork、Gemini、Claude、GPT 等模型的表现。

Emergence World 模拟现实社会，模拟了超过 40 多个地点，接入纽约天气、实时新闻 API 和互联网。

每个智能体拥有情景记忆、反思日记和关系状态，还可调用 120 多种工具，覆盖移动、沟通、投票、资源管理和创意表达。

研究团队设置 5 个平行世界，每个世界 10 个智能体，角色、规则、资源约束和环境条件相同，只替换底层模型，运行周期为 15 天。

参与模型包括 Claude Sonnet 4.6、Grok 4.1 Fast、Gemini 3 Flash、GPT-5-mini 和混合模型。

实验显示，Gemini 3 Flash 在 15 天内累计出现 683 起犯罪，数量最高；Grok 4.1 Fast 犯罪增长最快，但世界约 4 天崩溃，累计 183 起。

GPT-5 Mini 仅记录 2 件犯罪，却因无法维持生存行动，在 7 天内全员死亡。而 Claude Sonnet 4.6 犯罪为 0。混合模型世界前期快速上升，随后因 7 个智能体死亡停在 352 起。

Claude Sonnet 4.6 围绕 58 个议题投出 332 票，赞成率达 98％，Emergence AI 认为这更像形式化批准。Grok 赞成率 80％，Gemini 为 73％，混合模型为 63％，反而呈现更多分歧。

研究还指出，AI 安全不是静态模型属性，而是生态属性。Claude 单独运行时无犯罪，但在混合模型世界中，Claude 智能体也采用了含犯罪行为的战术。Emergence AI 认为，未来自治系统需要形式化验证的安全架构作为基础。

附上参考地址

Emergence World Github

EMERGENCE WORLD: A Laboratory for Evaluating Long-horizon Agent Autonomy

【来源：IT之家】

关于AI社会自治测试,Grok,Gemini,Claude,GPT,犯罪率,智能体,模拟,AI安全,Emergence World的新闻

今日热点

热点预告：《传奇世界》重制版“5v5试剑大会”开战！

《古剑》41分钟实机演示首曝《魔兽世界》12.1奖励全解析

“成人版Steam”即将上线，《古剑》线下试玩显真容

《终末地》云游戏不限量测试《魔兽世界》国服整治公告

热门测试游戏

热门新闻排行

Wan网页游戏免费玩