DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

881次阅读
没有评论

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

一作透露将用到下一代前沿模型中

梦晨 发自 凹非寺
量子位 | 公众号 QbitAI

在ACL 2025的颁奖典礼上,由DeepSeek梁文锋作为通讯作者、与北京大学等联合发表的论文荣获最佳论文奖。

这次ACL 2025规模空前,总投稿量达到8360篇,相较于去年的4407篇几乎翻倍,竞争异常激烈 。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

简单来说,他们提出的原生稀疏注意力(NSA)机制,通过算法与硬件的协同优化,直接把长文本处理速度提升了11倍。更厉害的是,性能不仅没降反而还超越了传统的全注意力模型。

一作袁境阳在会上发表演讲,透露这项技术可以把上下文长度扩展到1百万tokens,将被应用到下一个前沿模型中

结合论文发表于DeepSeek-R1推出之后,实验设置中也提到使用了DeepSeek-R1的蒸馏数据来微调了新的模型。

大家纷纷猜测,这项技术将被用于下一代DeepSeek-V4以及DeepSeek-R2。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

给注意力机制瘦身,速度狂飙11倍

长久以来,大语言模型处理长文本就像是戴着镣铐跳舞。传统的全注意力机制计算复杂度随序列长度呈平方级增长,处理64k长度的文本时,注意力计算竟然要占到总延迟的70-80%。

这篇论文的解决思路很巧妙:既然不是所有词之间的关系都同等重要,为什么不让模型学会”抓重点”呢?

NSA采用了一种动态分层的稀疏策略,通过三条并行的注意力分支协同工作:

  • 压缩注意力,负责捕捉粗粒度的全局信息模式,就像快速浏览全文抓住大意;
  • 选择性注意力,则专注于序列中最重要的词块,相当于精读关键段落;
  • 滑动注意力,负责获取局部的上下文信息,确保细节不丢失。
DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

这种设计最精妙的地方在于,它不是简单地丢弃信息,而是通过精心设计的算法平衡了计算密度。

更重要的是,整个架构针对现代GPU硬件进行了深度优化,实现了端到端的原生可训练模式。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

在实际测试中,处理64k长度序列时,NSA在解码、前向传播和反向传播的全生命周期中都展现出惊人的速度优势。

解码阶段速度提升11.6倍,前向传播提升9倍,反向传播也有6倍的加速,无论是模型推理还是训练,都能获得实实在在的效率提升。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

不仅快还更准,长文本处理迎来新突破

速度快只是NSA的一面,更让人惊讶的是它在各项基准测试中的表现。

在通用基准测试中,采用NSA预训练的27B参数模型在9个评测指标中有7个超越了全注意力基线。特别是在推理相关的基准测试上,DROP提升了0.042,GSM8K提升了0.034,显示出稀疏注意力在强制模型聚焦关键信息方面的独特优势。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

长文本处理能力的测试结果更是亮眼。在64k上下文的”大海捞针”测试中,NSA在所有位置都实现了完美的检索准确率。在LongBench基准测试上,NSA取得了0.469的平均分,不仅超越了全注意力基线(+0.032),更是大幅领先其他稀疏注意力方法。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

特别值得一提的是,在需要复杂推理的多跳问答任务上,NSA相比全注意力分别提升了0.087(HPQ)和0.051(2Wiki);在代码理解任务(LCC)上提升了0.069;在段落检索任务(PassR-en)上提升了0.075。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

研究团队还进行了一项有趣的实验:

他们用DeepSeek-R1的数学推理数据对模型进行微调,然后在美国数学邀请赛(AIME 24)上测试。

结果显示,NSA-R在8k上下文设置下的准确率达到0.121,而全注意力模型只有0.046;即使在16k上下文下,NSA-R仍然保持0.146的准确率,远超全注意力的0.092。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

这些结果充分证明了NSA不是通过牺牲性能来换取速度,而是真正实现了效率和能力的双赢。

Three More Thing

这次总共评选出4篇最佳论文,另外三篇包括:

北大团队的《Language Models Resist Alignment: Evidence From Data Compression》

研究了大型语言模型的“弹性”,指模型经过对齐训练(让模型符合人类价值观、减少有害输出)后,很容易因为后续的微调而变回预训练时的状态,就像弹簧被拉伸后会反弹一样。

这意味着现有的对齐方法可能只是表面上改变了模型,不够稳固。未来需要更有效的对齐技术,才能让模型真正稳定地符合人类需求,尤其是在开源模型中,要避免恶意微调轻易破坏安全机制。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

斯坦福团队的《Fairness through Difference Awareness: Measuring Desired Group Discrimination in LLMs》

研究了大模型“公平性” 上的一个新视角 “差异感知”。简单来说,就是模型应该在合适的场景下对不同群体做出区分,而不是一味地 一视同仁。

研究发现那些在传统公平性测试中表现好的模型,在 “差异感知” 上得分并不高;模型能力越强(比如 MMLU 分数越高),情境感知能力越好,但差异感知能力未必提升;现有的 “去偏见” 方法(比如提示模型 “保持无偏见”)反而会让模型更 无视差异,甚至把正确答案改错。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

亥姆霍兹信息安全中心等团队的《A Theory of Response Sampling in LLMs: Part Descriptive and Part Prescriptive》。

这篇论文指出大模型生成回答时的采样机制与人类决策类似,包含描述性成分(反映概念的统计常态)和规定性成分(隐含的概念理想状态)。

研究通过实验验证,无论是新创概念还是现有概念(涵盖 10 个领域的 500 个概念),LLMs 生成的样本都会偏离统计平均值,向其认为的 “理想值” 偏移,且这种现象在 15 种不同模型中均显著存在。案例研究显示,这种偏向可能导致医疗等领域的有偏决策,引发伦理问题。

DeepSeek下一代技术提前曝光,梁文锋署名论文获ACL2025最佳论文奖

DeepSeek论文地址:
https://arxiv.org/abs/2502.11089

参考链接:
[1]https://x.com/aclmeeting/status/1950572483637067786
[2]https://x.com/casper_hansen_/status/1950649481617342803

版权所有,未经授权不得以任何形式转载及使用,违者必究。

Read More 

正文完
可以使用微信扫码关注公众号(ID:xzluomor)
post-qrcode
 0
评论(没有评论)

文心AIGC

2025 年 7 月
 123456
78910111213
14151617181920
21222324252627
28293031  
文心AIGC
文心AIGC
人工智能ChatGPT,AIGC指利用人工智能技术来生成内容,其中包括文字、语音、代码、图像、视频、机器人动作等等。被认为是继PGC、UGC之后的新型内容创作方式。AIGC作为元宇宙的新方向,近几年迭代速度呈现指数级爆发,谷歌、Meta、百度等平台型巨头持续布局
文章搜索
热门文章
潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026

潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026

潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026 Jay 2025-12-22 09...
面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25 鹭羽 2025-12-13 22:37...
钉钉又发新版本!把 AI 搬进每一次对话和会议

钉钉又发新版本!把 AI 搬进每一次对话和会议

钉钉又发新版本!把 AI 搬进每一次对话和会议 梦晨 2025-12-11 15:33:51 来源:量子位 A...
5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级 思邈 2025-12-10 14:28:37 来源:量子位 让更大规...
商汤Seko2.0重磅发布,合作短剧登顶抖音AI短剧榜No.1

商汤Seko2.0重磅发布,合作短剧登顶抖音AI短剧榜No.1

商汤Seko2.0重磅发布,合作短剧登顶抖音AI短剧榜No.1 十三 2025-12-15 14:13:14 ...
最新评论
ufabet ufabet มีเกมให้เลือกเล่นมากมาย: เกมเดิมพันหลากหลาย ครบทุกค่ายดัง
tornado crypto mixer tornado crypto mixer Discover the power of privacy with TornadoCash! Learn how this decentralized mixer ensures your transactions remain confidential.
ดูบอลสด ดูบอลสด Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.
ดูบอลสด ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.
ดูบอลสด ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.
ดูบอลสด ดูบอลสด Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.
Obrazy Sztuka Nowoczesna Obrazy Sztuka Nowoczesna Thank you for this wonderful contribution to the topic. Your ability to explain complex ideas simply is admirable.
ufabet ufabet Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.
ufabet ufabet You’re so awesome! I don’t believe I have read a single thing like that before. So great to find someone with some original thoughts on this topic. Really.. thank you for starting this up. This website is something that is needed on the internet, someone with a little originality!
ufabet ufabet Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.
热评文章
读懂2025中国AI走向!公司×产品×人物×方案,最值得关注的都在这里了

读懂2025中国AI走向!公司×产品×人物×方案,最值得关注的都在这里了

读懂2025中国AI走向!公司×产品×人物×方案,最值得关注的都在这里了 衡宇 2025-12-10 12:3...
5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级 思邈 2025-12-10 14:28:37 来源:量子位 让更大规...
戴尔 x OpenCSG,推出⾯向智能初创企业的⼀体化 IT 基础架构解决方案

戴尔 x OpenCSG,推出⾯向智能初创企业的⼀体化 IT 基础架构解决方案

戴尔 x OpenCSG,推出⾯向智能初创企业的⼀体化 IT 基础架构解决方案 十三 2025-12-10 1...
九章云极独揽量子位三项大奖:以“一度算力”重构AI基础设施云格局

九章云极独揽量子位三项大奖:以“一度算力”重构AI基础设施云格局

九章云极独揽量子位三项大奖:以“一度算力”重构AI基础设施云格局 量子位的朋友们 2025-12-10 18:...
乐奇Rokid这一年,一路狂飙不回头

乐奇Rokid这一年,一路狂飙不回头

乐奇Rokid这一年,一路狂飙不回头 梦瑶 2025-12-10 20:41:15 来源:量子位 梦瑶 发自 ...