DeepSeek推出NSA:快速进行长上下文训练和推理
2025-02-18 20:39:09
神评论
据报道,DeepSeek团队在其新发表的论文中介绍了NSA(Native Sparse Attention),这是一种创新的稀疏注意力机制,该机制专为与现代硬件高度协同且支持本机训练而设计,旨在实现超高速的长上下文训练与推理过程。
NSA通过一系列针对现代硬件特性的优化设计,不仅显著提升了推理速度,还有效降低了预训练成本,同时确保了模型性能的丝毫不减。
据官方介绍,NSA在通用基准测试、长上下文任务以及基于指令的推理中表现优异,与完全注意力模型相比表现相当甚至更佳。
据悉,DeepSeek设计了一种分层的稀疏策略,将注意力分为三个分支:压缩(compression)、选择(selection)和滑动窗口(sliding window),以便同时捕捉全局上下文和局部精细信息。
NSA不仅在算法上实现了稀疏注意力的高效建模,还通过硬件对齐的设计,优化了内存访问和计算调度,使得模型在处理长文本时能够大幅减少计算延迟和资源消耗。
【来源:快科技】
今日热点
热门测试游戏
- 1网易新游《雾海之下》首曝!把《迷宫饭》做成了“吃打撤”?
- 2韩厂Kakao Games新作密集出击,多款MMO产品蓄势待发
- 3Neowiz旗下多端MMO《王国2:烈焰战场》今日正式上线
- 4《NIKKE》新版本上线 杀手今日登场,温柔人妻有容乃大!
- 5《冒险岛》怀旧服公测首日排队超三十万,但玩家却很不满?
- 6《剑星:血雨》新片被狂喷!老外怒斥金亨泰“毫无诚意”
- 7一款不做抽卡不卖武学的手游,怎么就做出了最浓的武侠味儿
- 8抢先约!韩国网石MMO《SOL: enchant》首个大版本即将上线
- 910大坐骑免费送!《魔兽世界》国服21周年庆典明日开启
- 10《激战2》世界之战模式大改:下周开测,防守终于有存在感了



