英伟达开源Nemotron-Labs-TwoTower:离散扩散语言模型加速Token生成

英伟达开源新型语言模型架构

英伟达于日前开源了 Nemotron-Labs-TwoTower 离散扩散语言模型,旨在解决大模型逐一生成 Token 速度慢的核心痛点。

传统自回归模型必须逐个 Token 顺序生成,这在长文本场景下导致推理速度与文本长度线性增长。英伟达的 TwoTower 架构采用离散扩散方式,可以在多个 Token 位置上并行完成生成,大幅提升推理效率。

更为关键的是,该模型基于现有 Nemotron 骨干网络改造,可以直接复用预训练权重,无需从零开始完整训练,这意味着迁移成本极低。这一设计思路为提升大模型推理速度提供了新的技术路径。

随着大模型应用场景的不断扩展,推理效率已成为制约落地的关键因素。英伟达此举不仅是技术分享,更是为自家 GPU 硬件生态打造更强的软件护城河。


来源:OSCHINA

发表评论