字节Seed为什么不蒸馏别的模型?
6 小时前 / 阅读约11分钟
来源:36kr
字节跳动创始人张一鸣明确表示不会利用模型蒸馏提升大语言模型能力,强调追求模型真正智能。Seed内部多次争论蒸馏方案,最终决定禁止蒸馏,重视基础研究。

2026年8月5日,《The Information》报道称,字节跳动创始人张一鸣在一个月前举行的 Seed 全员会上明确表示:字节跳动不会利用模型蒸馏来加速自身大语言模型的能力提升。

该报道分析称:字节跳动拒绝蒸馏美国前沿 AI 实验室的模型,是出于担心蒸馏行为会引发华盛顿方面的报复,危及公司旗下备受瞩目的社交媒体资产 TikTok 。

而我们了解到的是:TikTok 的前景占禁止 Seed 蒸馏美国前沿模型的考虑要素权重几乎为零。

在 Seed 全体会上,张一鸣解释禁止蒸馏其它模型的原因时说:“为了实现长远目标,我们应该愿意牺牲一些短期利益“。

这里的”长远目标“, 很容易被解读成 TikTok 的未来命运。然而,在已卸下字节跳动日常管理事务的张一鸣的优先级中,当下TikTok 的重要性,远不及追求模型的真正智能。因此,这句话应该被解读为:为了追求模型的无限智能,现阶段应禁止蒸馏。

“我们可以接受暂时的落后,但不要蒸馏”,知情人士对我们称,张一鸣曾在 Seed 内部多次做过如是表态。

过去半年,美国前沿 AI 实验室 Anthropic 已经公开指控通义千问、 DeepSeek、月之暗面和 MiniMax 等中国实验室,通过大规模虚假账号和代理网络获取 Claude 的输出,用来提高自己的模型能力。模型蒸馏正在从一种常见的训练方法,变成中美人工智能竞争中越来越“敏感”的词。

但早在“蒸馏”远未成为中美 AI 竞争的关键词的2023年,字节跳动就明确了对蒸馏的反对态度。

彼时字节的大模型团队还处于早期探索阶段,部分工程师曾将 GPT API 生成的数据用于一个较小模型的实验性研究。2023年4月,字节引入 GPT API 调用规范检查后,模型团队内部随即提出明确要求:不得将 GPT 生成的数据加入字节模型的训练数据集。此后又进行了一轮内部检查,抽样检测模型输出与 GPT 的相似度,防止数据标注人员私自使用 GPT。

字节对蒸馏训练数据的警惕,显然早于今天围绕蒸馏形成的 AI 竞争叙事。

而这项内部规定并没有终结争论。随着模型竞争加剧,研究员仍然会在具体项目遭遇能力或算力差距时,重新提出蒸馏方案。

据我们了解,从2025年开始,Seed 内部至少发生过三次更重要的关于“蒸馏”的路线争论。

第一次争论发生在2025年1月,那时 Anthropic 还没有公开指控过中国实验室。

DeepSeek-R1 发布后,它以有限的训练成本展现出强大的推理能力,震动了硅谷,也给中国其他头部实验室带来了巨大压力。Seed 内部的一些研究员对此尤其焦虑。在他们看来,Seed 的人才密度、算力投入和真实研究能力都不弱于 DeepSeek,但模型当时表现出来的推理能力却没有达到 R1 的水平。

当时业内已有猜测,DeepSeek 在训练过程中使用过来自美国前沿模型的生成数据,而这个判断至今没有得到证实,除了 Anthropic 的单方指控。

但是在 Seed 内部,它构成了一种非常现实的提问:既然同行可以通过蒸馏美国 SOTA 模型迅速提高表现,Seed 为什么不能适度采用同样的方法?

一些研究员因此建议,引入美国头部闭源模型的生成结果,提高 Seed 语言模型的推理和综合表现。这不需要放弃自己的预训练,也不意味着整款模型建立在别人身上。它更像一剂见效很快的补药:保留原有训练体系,同时用更强“教师模型”的输出来补齐已经暴露的能力差距。

但 Seed 内部最终否决了这个提议。

一年之后,关于是否“蒸馏”争论,第二次出现在英伟达 Blackwell 系列 GPU 大规模在美国部署商用的阶段。

这一次,Seed 面对的压力更加具体。

英伟达 Blackwell 系列 GPU 在2025年底大规模进入美国头部实验室;由于美国对高端 GPU 的定向出口管制,中国实验室无法获得性能最先进的“B卡”。

一个不为人知的消息是:奠定了字节视频模型全球 SOTA 地位的 Seedance 2.0,是在大量英伟达 H20 堆出来的算力环境里训练出来的。H20 是专供中国市场的“合规阉割版”,用于模型训练的综合性能表现仅为 B200 的1/50。

无论如何,美国实验室和中国实验室之间原本已经存在的算力差距,在2025年底2026年初这个节点,被一个新的 GPU 世代,骤然进一步急剧拉大。

Seed 内部注意到一个令他们不安的事实:从 GPT-5.5 到 Claude 4.8,美国顶级模型在推理、编程和科学领域出现了智能的跃迁,而这一切都与 Blackwell 系列 GPU 的大规模部署密切相关。尤其是 Claude Fable 5 展现出的智能程度,让 Seed 研究员们印象深刻。

“实在不行就蒸馏”动议再次出现,而且得到了不少研究员的支持。这成了内部逐渐弥散的情绪——尤其是在自研的 Seedance 2.0 已经是世界上表现最好的视频生成模型之一,而 Seed 系列语言模型却仍然相对落后的情形下。

支持蒸馏的研究员认为:既然短期无法消除算力的巨大差距,那就用数据换回来,把极其稀缺的、先天不足的训练资源,集中到已经被证明有效的方向上。

这个提议仍然没有得到来自公司最高层的支持,但在 Seed 内部渐有成为共识的趋势。

而这时,Seed 内部“蒸馏”动议的外在压力,仍然只是追赶美国最领先的 SOTA 模型。几个月后,Kimi K3 的成功让这个讨论真正爆发出来。

K3 在编程、工具调用、深度研究和复杂任务上的表现,已经与美国头部闭源模型进入同一个竞争区间。对 Seed 来说,这次压力甚至比 R1 更直接。

一家同样来自中国,规模和算力资源远小于字节 Seed 的实验室,已经让自己的开放权重语言模型进入全球第一阵营;投入更大、人才更多的 Seed,却仍然没有拿出一款位置相当的语言模型。

蒸馏的提议因此第三次被大声地提了出来,得到了更多人的响应。

提议者相信,只要系统性使用头部 SOTA 模型的生成结果,Seed 语言模型的表现很容易在短期内得到提升,它不需要复制某一家模型的全部能力,只需要让强模型生成足够多的推理、代码、工具调用和复杂任务数据,就可能迅速补齐最影响榜单和用户感知的部分。

这一次,内部也出现了一个看起来更稳妥的折中方案:既然蒸馏美国实验室的闭源模型,可能违反服务条款,可能遭到公开指控,也可能被卷入地缘政治争议。那么,Seed 至少可以蒸馏表现最好的开放权重模型。

开放权重模型的授权通常更宽松,模型可以在自己的服务器上部署,不需要批量注册账号,也不需要绕过地域和访问限制。它同样能够产生高质量训练数据,法律与商业风险却低得多。

这次,他们等到了张一鸣的直接表态。

张一鸣说:闭源模型不能蒸馏,开放权重模型也不能蒸馏。

他还表示:Seed 可以接受暂时的落后,但不接受依靠蒸馏竞争对手来消除这种落后。

而据我们所知,这也是此次 Seed 召开全员会的背景之一。

张一鸣希望 Seed 内部统一认识,传递一个更清晰的技术判断:关键不是短期的输赢,而是真正影响长期的基础工作和基础研究,有没有被真正地重视,有没有认真做好。

来自字节跳动创始人的直接表态,直面的是在 K3 问世后,Seed 内部对是否可以蒸馏其它模型,展现出来的前所未有的态度动摇和立场松动情绪。

这次全体会之后,Seed 内部特别出台了新的政策:明确要求禁止蒸馏 K3等开放权重模型,并通过 API 技术检测等手段,追溯排查疑似蒸馏的行为。

至此,字节内部关于蒸馏的争论和决断,已成定论,而它也越过了法律、商业条款和地缘 AI 竞争的意义。

模型蒸馏本身没有原罪。它是一种非常成熟的训练技术:让一个“学生模型”学习“教师模型”产生的概率、答案、推理轨迹或工具调用过程,以更低成本复现教师模型的部分能力。所有头部实验室都会进行自蒸馏,也会使用自己的模型生成合成数据,再把这些数据送回训练体系。

Seed 拒绝这种能力的来源,头部性能的模型——无论开源闭源,都不能成为它的教师爷。

当一个实验室发现自己落后时,它可以研究竞争对手的论文,分析其技术报告,理解它的评测结果,重新检查自己的数据、架构和训练方法。

它也可以把竞争对手直接变成“教师”,批量生产答案,再让自己的模型沿着对方已经走通的道路前进。

后一条路通常更快。

它可以让一款模型在几个月内补齐推理、编程和 Agent 能力,缩小 benchmark 的差距,也可以让产品更快进入第一阵营。但它无法告诉实验室,这些能力究竟是怎样产生的;更无法保证,当现在的 SOTA 模型智能边界走到尽头时,蒸馏的一方下一步应该去哪里。

这就蒸馏动议在字节跳动被屡次提出,又屡次否决的动因。

蒸馏并非一种有争议的技术,而是一种足够有效、足够诱人,也足以改变实验室长期研究文化的捷径。

而在字节内部,Seed 第一次想用它追赶 R1 带来的推理冲击;第二次想用它跨越 H20 与 Blackwell 之间的算力鸿沟;第三次想用它缩小与 Kimi K3 和美国头部闭源模型的差距。

三次提议,都发生在 Seed 确实有“理由”选择捷径的时候,但都被否决了。

背后却是一场持续了一年多的路线争论。TikTok 的前景、Anthropic 的指控以及美国不断升高的政策风险,当然让拒绝蒸馏变得更加容易解释,但它们不足以构成原则。字节跳动不蒸馏 SOTA 模型的技术原则,发端于这些风险和外部压力之前。

张一鸣最关心的问题恐怕是:作为一家 AI 实验室,Seed 能不能为追求最前沿的智能程度做出自己的成就,能不能摸到全球大模型竞争力的天花板。

至少可以明确的是:一款模型可以通过蒸馏进入前沿,一家实验室却不能通过蒸馏成为前沿实验室。

这意味着 Seed 可能在某些时候落后,也意味着它要为独立探索支付更多算力、时间和失败成本。但现在,它们都是可以被接受的。