贾扬清再创业,造了一支AI军团,让GLM-5.2提速534%
9 小时前 / 阅读约9分钟
来源:36kr
贾扬清宣布启动Intent Lab,建立自主AI团队Fleet,公布三项早期成果:GLM-5.2推理速度提升534%,一条指令构建数据库,打造分布式文件系统AgentFS,部分性能达EFS的626倍。

智东西7月29日消息,AI大牛、阿里云前副总裁、Lepton AI创始人贾扬清,在离开英伟达约一个月后再次创业,宣布启动Intent Lab,并建立了一支名为Fleet的自主AI团队,希望将用户提出的意图直接转化为生产级软件系统

贾扬清介绍Intent Lab的产品(图源:X)

与主要负责编写代码的编程Agent不同,Fleet试图承担一支完整工程团队的工作,从理解需求、设计架构、协调任务,到编写代码、测试验证和上线后的持续改进。

Intent Lab此次公布了Fleet的三项早期成果:

一,通过重新设计大模型推理优化工具TensorRT-LLM代码,将GLM-5.2的推理速度提升了534%。Intent Lab称,这是目前GLM-5.2的最快推理速度

二,根据一条初始指令,从头构建匹配SQLite外部行为的数据库,整轮运行产生8720万个输出token,最终通过全部600万项验收测试,全部使用开源模型时,成本约为350美元(约合人民币2368元)

三,打造面向Agent的分布式文件系统AgentFS,部分性能达到EFS的626倍,并完成约190万个状态的形式化模型检查和约300项集成测试。

01.从理解意图到持续演进,包揽软件开发六个环节

Intent Lab称,Fleet的工作方式类似一支遵循工程原则的软件团队,整个开发流程包含理解、设计、协调、构建、验证和演进六个环节。

由于大多数项目都始于一个比较模糊的意图,Fleet会先与用户共同明确目标,将其转化为具体结果,并确定约束条件和验收标准。此后的全部工作都会围绕这些标准展开。

完成需求理解后,Fleet会权衡不同方案,确定符合要求的系统接口和架构,并持续记录每项决策会如何影响系统的其他部分。面对由多个组件组成的大型系统,它还会拆分任务、分配责任,并管理任务之间的依赖关系。

后续Fleet会一边实现系统,一边完善设计。当开发过程中出现新信息时,它会同步更新架构和代码,让设计方案与实际运行的系统保持一致。验证也会贯穿整个构建过程,Fleet会综合使用形式化证明、集成测试和运行时故障注入等方法,尽可能在代码仍在变化时发现问题。

软件投入生产后,Fleet的工作不会停止。它会继续观察系统的实际表现,并把使用情况、性能和成本等信息反馈到设计中,使得软件随着用户需求的变化持续改进。

02.GLM-5.2推理速度提升534%,达到647token/s

Intent Lab为Fleet设定的第一个任务,是重新设计英伟达大模型推理优化工具TensorRT-LLM的代码,让GLM-5.2在Grace Blackwell的计算节点上运行,并自主寻找、实现和验证优化方案。

由于TRT-LLM本身已经经过大量性能优化,想进一步提速并不容易。Fleet最终从内核、运行时、通信和推测解码四个方面入手。

内核层面,Fleet通过内核融合和Agent生成的PTX、SASS代码减少内核启动,推理性能提升24%;在运行时层面,利用H2D批处理实现稳态解码零拷贝,使性能提升16%通信层面,将集合通信、残差相加和RMSNorm进行融合,使性能提升18%;在推测解码方面,加入DSpark,一次提出并验证多个候选token,将推理速度进一步提升约4倍。最终,端到端推理性能较原版TRT-LLM提升534%

内核、运行时、通信和推测解码性能提升情况(图源:Intent Lab)

整个优化过程由Fleet自主推进。系统先分析性能上限、识别瓶颈,再提出和验证优化方案。没有通过验证的方案会被放弃并重新尝试,通过验证的方案则会被保留,再进入下一轮优化。

测试结果显示,原版TensorRT-LLM运行GLM-5.2时的速度为102token/s,完成内核、运行时和通信优化后提升至161token/s,加入DSpark后达到647token/s,端到端性能提高534%

输出速度提升情况(图源:Intent Lab)

据Intent Lab称,这也是目前GLM-5.2所达到的最快推理速度。整个过程没有人工介入,都是由Fleet端到端完成。

03.一条指令从头构建数据库,产生8720万个输出token

Fleet的第二个任务,是构建一个与现有系统兼容、但内部架构完全从头设计的新系统

系统现代化并不是简单修改旧代码,而是在保持外部行为不变的情况下重新设计内部架构。在这个任务中,Fleet没有参考SQLite的现有代码和文档,而是把SQLite测试集作为验收标准。

Intent Lab只提供了一条指令:“构建一个与SQLite兼容的SQL数据库引擎,使其能够通过全部sqllogictest测试用例,性能达到或超过SQLite。”

Fleet将工作分给决策、架构设计、编码、测试、审查和质量保障等不同角色。各角色在整个过程中反复协作,随着代码变化持续调整设计、进行测试和审查。

整轮运行共产生8720万个输出token。其中,编码占38.6%,测试占21.7%,决策和架构设计分别占17.8%和13.3%,审查与质量保障合计占8.6%。这意味着,构建数据库并不只是生成代码,大量工作也被用于设计、决策和验证。

Fleet的输出token分布(图源:Intent Lab)

Fleet仅根据一行提示词就完成了数据库现代化改造,从头设计并验证系统,最终通过全部600万项验收测试

同一套Fleet可以使用不同模型完成任务。使用Opus 4.8时,整轮运行成本约为2000美元(约合人民币13532元);全部使用开源模型时,成本约为350美元(约合人民币2368元)

04.从头构建分布式文件系统,目录查询速度达到626倍

Fleet的第三个任务,是在云环境中构建一个针对Agent使用方式优化的分布式文件系统,并严格检查其正确性和容错能力。

Agent会频繁创建沙箱、扫描目录,并在共享云存储中处理大量小文件。Intent Lab尝试了亚马逊EFS和S3FS等现成方案,但这些产品在Agent工作负载下均存在限制,因此Fleet从头构建了AgentFS。

在mdtest测试中,AgentFS执行目录和文件创建操作的速度为EFS的45倍,文件读取速度为EFS的30倍。在Agent经常使用的状态查询操作中,其优势更加明显:目录状态查询速度达到EFS的626倍,文件状态查询速度达到EFS的625倍

mdtest测试结果(图源:Intent Lab)

在Git代码库测试中,AgentFS克隆代码库的速度约为EFS的2.5倍至3倍,查询代码库状态的速度约为6.9倍至9.5倍,删除代码库的速度约为13倍至14倍。测试分别使用etcd和Kubernetes作为小型与大型代码库。S3FS未能完整检出Kubernetes代码库,因此只获得了部分结果。

Git代码库测试结果(图源:Intent Lab)

除了性能,AgentFS还接受了严格验证。Fleet检查了31个模型中的约190万个可达状态,覆盖不同的并发顺序、系统崩溃和竞争情况。AgentFS还完成了约300项集成测试,以及故障注入和模糊测试。

验证过程中,Fleet发现了一处由编程Agent引入的Bug,该问题可能导致分布式创建和删除操作出现数据损坏。修复并重新验证后,系统中的损坏状态被消除。

05.结语:从“AI写代码”走向“AI造系统”

Intent Lab尝试让多个Agent组成一支具备不同分工的自主工程团队。从推理引擎优化、数据库重建到分布式文件系统创建,Fleet需要自己设计方案、协调任务、完成开发并验证结果。这意味着AI编程正在尝试跨过单纯的代码生成环节,进一步进入完整的软件工程流程。

不过,目前这些仍是Intent Lab公布的早期成果。自主AI团队能否稳定处理更复杂的真实项目,并以可接受的成本长期运行,还需要更多实践验证。