KiMi的关键人物之一苏剑林, 是
他在公司内部被称为“苏神”。
苏1993年生,广东云浮人。本科就读于华南师范大学数学科学院,硕士毕业于中山大学数学学院。毕业后先在追一科技研究自然与原处理,后来加入月之暗 面,并长期在广州工作。
此前他层提出 旋转位置编码RoPE,以间接的数学形式解决了Transformer在处理长序列时的位置信息问题,既保持了计算效率,又实现了更好的外推能力。 RoPE 后来成为许多现代大模型常见的位置编码组件。
这个贡献把苏剑林从工程社区作者推到 Transformer 基础组件贡献者的位置。
苏剑林 个人有一个从2008年起更新至今的技术博客科学空间。 在技术学院派口中有着极高的口碑,已经成了不少人学习大模型技术的地方。
科学空间最早不是大模型站点。它长期覆盖数学、物理、天文、机器学习和 NLP。 很多这个领域的硕博毕业生认为,科学空间的文章很新很前沿,比很多教科书更有时效性。
更有博客的技术追随者,认为苏的地位“在中国大陆的人基本没有比他对当下AI贡献更大的”。理由是“好多博士生靠人家博客毕业呢。”
苏剑林在工作后才开始做 bert4keras,写 RoFormer 和 RoPE,再持续拆解 attention、优化器和 MoE。
但是此前长期写作的过程,让苏剑林形成了一个少见能力:把复杂模型拆成普通工程师也能复查的技术问题。
到
对于 KiMi的技术团队来说, 团队多了一个能从数学、工程和公开解释三方面理解架构取舍的人,能够连接理论直觉、工程消融和前沿训练研究等架构设计。
对于企业来说,有这样的导师型的技术高手,对他月之暗面公司招人有 巨大的帮助。很多技术毕业生在毕业后第一份工作的选择中,确实会因为追随高手而加入团队。
市场上一直传说,苏是 KiMi团队唯一可以居家办公的人。但在技术社区,社区成员笃信苏值得任何形式的优待。
“苏神想居家办公,任何公司应该都允许。”“ 苏神的话,不是应该把团队放在他家周围吗?”
作为技术团队的灵魂人物,苏在KiMi团队很出活。
往近了说是K3,往远了说还有已经被大模型采用的旋转位置编码RoPE。 加入
过往在技术上,苏剑林博客里探讨的许多问题,只有在大规模模型训练中才会露出真实难度。
位置编码是否能长程外推,attention 变体是否真的省 KV cache,优化器是否能 scale up,MoE 是否能保持负载均衡,这些都不是小模型上完全能回答的问题。
今年三月,KiMi团队发了一个很轰动的论文——Attention Residuals。
论文的署名为陈广宇、张林和苏剑林。 张是KIMI的研究员,也是FLA的共同建 设者之一。除了苏以外,论文作者里的 张和陈的资历相差很大,但有一个共同点,他们都来自FLA开源社区,有研究Attention机制的背景。
这也是杨植麟招人的技术审美之一:去各种开源社区、论坛和TOP高校招最强的技术工程师。
陈广宇 就是那位少年成名的17岁天才高中生,曾通过GitHub向FLA提交DeltaFormer实现。 FLA是他研究大模型的起点,也因此获得了加入
2025年下半年,苏完成了 AttnRes的数学推导和初步实现。这时的方案是 Full AttnRes,模型中的每一层,都可以直接查看此前所有层的输出。每个token再根据当前内容,选择重点去读的内容。
在内部的小规模实验中,Full AttnRes展现出明显的优势。
Full AttnRes想法初步验证可行后,苏建林带领的
其实 AttnRes的真正 成果出来时,K3已经快定版了。
最终,杨植麟拍板,让它进入K3。
2026年3月16日,
事实上,直到现在回看,也很难从技术报告中找出更多的数据证明,因为用了 AttnRes让K3的能力有了质的提升。一切都更像是系统提升的结果。但K3也证明, AttnRes成功进入了一个2.8万亿参数的完整训练和推理系统,让模型能够更有选择地使用不同深度的信息。最关键的是,成本可控。
苏剑林这个级别的核心专家于
拥有对结构机制的顶级理解,在团队承上启下,他带着团队探索技术可实现应用场景的同时,还在源源不断地通过个人技术吸引力帮助月之暗面团队招募到更多的高智商工程师。
他一个人就代表着一支部队,是 今天
