17173 > 游戏资讯 > 科技新闻 > 正文

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

2026-08-12 20:09:17 神评论
17173 新闻导语

华为昇腾联合openJiuwen推出“算力亲和”技术,解决智能体推理慢的根因!首Token时延降低57%,存储占用峰值下降25%,大幅提升AI Agent效率,即将开源,速来了解!

由华为2012实验室、华为云、计算、终端等团队联合打造的开源智能体平台openJiuwen,近日联合昇腾推出了一项名为“算力亲和”的全链路协同技术。

该技术打通了Agent框架、推理引擎与底层算力之间的协同壁垒,通过让KV Cache(键值缓存)从被动管理走向主动协同,使Agent推理的首Token时延降低57%以上,推理存储占用峰值下降25%。

随着AI Agent应用日益复杂,单个任务可能持续数十分钟甚至数小时,多个Agent还需分工协作。任务越长、协作的Agent越多,推理过程中产生的KV Cache就越庞大,推理时延也越久。

然而,传统推理引擎只能看到请求和缓存,却看不懂Agent正在做什么。如果子任务已经结束,缓存可能还停留在昂贵的NPU显存里;如果会话暂时挂起时,缓存却继续占着最贵的资源位置。

这背后的核心问题是:Agent掌握任务状态,引擎掌握算力资源,两者之间缺一条传递语义的通道。openJiuwen的解法是在Agent与推理引擎之间建立一套“状态契约”,即Agent Hint。

Agent在关键状态变化时发出Hint信号,告诉引擎当前会话的生命周期状态;引擎据此执行对应的缓存动作:驱逐、卸载、预取。缓存不再只有“留在显存”或“排队等淘汰”两种命运,而是随任务节奏在存储层级间主动流动。

测试结果显示,开启算力亲和后,模型请求端到端时延降低27.61%,前缀缓存命中率提升33%,池化缓存使用量峰值降低25.24%。

当前这套能力即将开源,感兴趣的开发者可以关注openJiuwen开源社区。

【来源:快科技】
关于华为昇腾,openJiuwen,算力亲和,AI Agent,KV Cache,推理优化,首Token时延,存储优化,智能体,推理引擎的新闻