英伟达发布官方大模型推理指南《用投机解码做 AI 模型协同设计》,核心内容是一张主流推理加速方案选型表,表中核心方案几乎全由华人团队主导。投机解码技术通过小模型前置预测、大模型验证实现无损加速,加速效果取决于预期接受长度和耗时。表中技术演进主线的四代方案包括:北大等团队研发的EAGLE-3,曾是领域霸主但接受长度已被超越;被英伟达评为GPU上大模型最佳选择、由DeepSeek-V3完善的MTP;由含英伟达研究院学者的团队研发、实现6倍无损加速的并行架构DFlash;由DeepSeek和北大团队打造、接受长度更高的DSpark。此外,指南还指出,硬件物理常数会限制模型架构发展,当前大模型竞赛重心已转向挖掘硅片物理极限,华人团队成为破局关键力量。
