被字节开除的实习生,融资2亿:挑战李飞飞
2 小时前 / 阅读约8分钟
来源:36kr
被字节辞退实习生田柯宇获近3000万美元融资,投后估值2亿美元。其论文降低视觉生成成本,现创业做世界模型,降低生成视频成本,获资本投资。

公司还没有名字,产品还没有影子,团队只有10个人,先拿到了近3000万美元(约合人民币2亿元)融资,投后估值2亿美元。

据最新报道,这笔钱投给了田柯宇创办的世界模型公司,五源资本、IDG资本等参与。

田柯宇最大的标签,就是“被字节辞退并索赔的实习生”。

一个被大厂除名的实习生,怎么在两年后带着2亿美元估值回来?他要做的"世界模型",又凭什么让资本如此着急?

一篇论文,让行业大幅降本

田柯宇本科毕业于北京航空航天大学软件学院,研究生进入北京大学,师从王立威,研究方向是深度学习优化与生成模型。从2021年起,他在字节跳动商业化技术部门实习,做超参数优化、强化学习和视觉生成。

2024年6到7月,因为对团队内部的算力资源分配不满,他动手关掉了另一名实习生的程序,好把显卡腾给自己认可的研究。字节的说法是,他通过编写、篡改代码,恶意攻击团队研究项目的模型训练任务,造成资源损耗。

事发后田柯宇一度否认,称动手的是别的实习生,甚至报警称自己被造谣。字节认为他毫无认错之意,2024年11月正式起诉,索赔800万元。

后来,他承认行为不当。法院最终认定他违反实习合同,判赔50万元,并没收全部实习工资。

戏剧性的转折发生在起诉后第十天。2024年12月,NeurIPS把年度最佳论文颁给了田柯宇作为第一作者的成果——《视觉自回归建模:通过下一尺度预测生成可扩展图像》(VAR),论文在当届排名第六。这是中国大陆背景的学者作为第一作者,极其罕见地拿到这个奖项。

这篇论文的分量,直接决定了他今天在做什么。

在VAR之前,AI画图主要靠扩散模型——先勾勒模糊全局,再一层层修清楚,画面好但慢、贵、吃算力,架构上也和大语言模型不是一套。田柯宇和团队换了个做法:不再把图像拉成一维逐个像素预测,而是保留二维结构,从1×1的模糊轮廓开始,2×2、4×4、8×8……由粗到细一级级预测,像人画画。

结果是,这类GPT式自回归模型第一次在图像生成上超过扩散模型:在ImageNet基准上,衡量失真度的FID从18.65降到1.73,推理速度提高20倍,还第一次让视觉生成跑通了"模型越大、效果越好"的规模化规律。项目开源后在GitHub收获超过4400颗星。

田柯宇最擅长的事,就是用更省的架构,把视觉生成的成本打下来。两年后他创业,做的还是这件事,只是从图片换成了视频,从图像生成换成了世界模型。

世界模型在风口

世界模型,简单说就是让AI不只看懂一帧画面,而是理解现实世界的空间、运动和因果,能预测"下一步会发生什么"。它被看作机器人、自动驾驶、交互式视频共同的底层能力,也是李飞飞、杨立昆这些人近年全力推动的方向。

田柯宇认为人类语言根本不适合描述视频。一段猫从桌上跳下的几分钟画面,物体位置、运动轨迹、光影和碰撞,用文字写出来会丢掉绝大部分信息,还白白浪费算力。

他的方案是给AI另造一套语言。团队已经做出一本包含约20万个符号的"视觉词典",这些符号人类无法识别,AI却能用它们来表示、压缩和预测视频。"我们首先是在为AI创造一种语言,然后向它输入1亿小时的视频。"田柯宇说。

用这套方法,生成1秒视频的成本至少降到原来的十分之一,完整模型计划2027年发布。

他选的时间点,正是这个赛道最热闹、也最微妙的时候。

9月1日,李飞飞的World Labs发布Atlas,能用图片重建3D场景、指定镜头走位,生成最长1分钟、1440p的视频。9月22日,国内的PixVerse发布R2,主打长时间记忆,玩家可以用文字、语音、动作实时改变正在生成的世界,剧情当场生成。海外,谷歌DeepMind的Genie 3已经能让人实时探索虚拟3D环境。

10月7日,谷歌与Unity联合公布Playground和即将推出的Unity Spark,用户用自然语言就能创建、分享小游戏。

当然,最令行业震惊的,是9月28日,AMD突然宣布以约82亿美元全股票收购World Labs。

一家有资金、有团队、刚发新模型的公司,为什么这么快选择卖掉?李飞飞的解释是:下一代AI需要模型研究、系统和芯片紧密配合,加入AMD能换来工程和硬件实力。

这件事对田柯宇是双重信号。一方面,它给世界模型投资人指了一条清晰的退出路,赛道估值被重新点燃;另一方面,连李飞飞都承认,单靠模型团队已经不够了,胜负手正在转向算力、成本和工程系统——而这恰好是田柯宇押注"便宜一个数量级"的原因。他等于用一个10人的团队,去赌AMD用82亿美元想买的同一个答案。

五源资本、IDG资本为何愿意投资一家没有产品的十人公司?一个可能的答案是,田柯宇正在尝试解决世界模型最昂贵的问题:算力成本。

世界模型开始赚钱

目前离客户最近的,是三维内容制作。

World Labs的Marble已经按月收费:标准版20美元,专业版35美元,最高一档95美元,并提供API和企业合作入口。用户输入文字或照片,就能生成可探索的三维空间,导出场景文件,继续交给设计或游戏工具加工。9月发布的新模型Atlas进一步展示了按指定镜头轨迹生成最长一分钟、1440p视频的能力,不过完整模型仍处早期访问阶段。

世界模型解决广告公司、影视工作室和游戏开发者最讨厌的返工。导演觉得镜头太高,希望降下来20厘米;美术人员希望把房间里的沙发换个位置。如果每次调整都要重生成、重新布置,AI带来的效率就会被抵消。能让同一套场景反复修改、导出、进入原有生产流程,才有机会变成软件预算。

今年8月,World Labs披露,制作公司Promise为Paramount+和CBS的节目《Harlan Coben’s Final Twist》重建了十个历史犯罪现场。部分地点已经消失,团队手里只有旧照片或历史影像。

Promise先修复图片,再用Marble生成三维环境,交给美术人员补齐缺失部分、修正细节,最后把场景放到LED摄影棚中拍摄。

而创意平台Magnific则把Marble接入3D Scenes工具。营销人员可以把参考图片变成三维环境,在里面摆放产品、调整镜头并取景。一组广告需要多个角度时,可以围绕同一个场景继续拍摄,不必每次重新描述、重新生成。

对投资人来说,更大的故事在工厂、物流和自动驾驶。机器人如果能在电脑里完成大量训练和测试,就能减少昂贵的真实设备试错。这个需求并非凭空想象。

今年3月,ABB机器人宣布将英伟达Omniverse能力接入RobotStudio工业软件,富士康正在试点相关技术,用于消费电子精密装配。ABB给出的目标是部署成本最多降低40%、产品上市时间缩短50%。

自动驾驶汽车需要测试雨雪天气、道路施工和突然出现的障碍。靠真实车辆去路上碰,既慢,也难以反复遇到同一种情况。机器人要进入不同家庭、仓库和商店,同样需要大量环境检验能力。

世界模型提供的机会,是批量生成这些环境,让企业把更多测试放进电脑。

2月6日,Waymo发布基于Google DeepMind Genie 3的世界模型。公司当时披露,其车辆已完成近2亿英里的全无人驾驶,而虚拟环境中的驾驶里程达到数十亿英里。

内容、机器人、自动驾驶,三条路都有机会,风险却完全不同。通用模型需要持续烧钱扩大领先,应用公司必须做销售和交付,被收购则取决于少数战略买家的意愿。

本文不构成任何投资建议。