将27B模型“塞进”手机,PrismML推动AI进化从规模转向“智能密度”
5 小时前 / 阅读约9分钟
来源:36kr
PrismML提出提升AI模型“智能密度”新范式,通过压缩模型降低对内存、算力和能耗的占用。推出1-bit Bonsai 8B和Bonsai 27B模型,解锁混合部署架构,使AI能在本地高效运行。

AI模型的Scaling Law现在没有走到尽头,无论是在语言大模型,多模态模型,还是物理AI的模型,提升算力,增大规模,仍可以看到性能的提升。

但是用大算力在Scaling的道路上狂奔,这个范式已经没有新意。而且大尺寸的模型,并不适合所有场景,尤其在物理AI领域,要受到端侧设备的算力,能耗,体积的限制。

由Caltech(加州理工)教授创立的PrismML,正向着不同于传统范式的方向推进。相比继续Scaling算力和模型规模,它将重点放在提升模型的“智能密度”上。

PrismML此前种子轮合计募集1625万美元,Khosla Ventures和Cerberus Ventures参投。据报道,加州理工学院也参与了融资,并与Google共同向公司提供算力支持。

加州理工教授要走一条不同于传统Scaling Law的路

Babak Hassibi是PrismML的联合创始人兼CEO,他同时是加州理工学院电气工程、计算与数学科学教授。他的联合创始人还有Sahin Lale、Omead Pooladzandi和Reza Sadri。

PrismML的创始团队,图片来源:PrismML

Babak Hassibi长期研究信息论、信号处理、控制、优化和机器学习。早在1990年代,他便参与提出神经网络剪枝方法Optimal Brain Surgeon,通过二阶信息识别模型中的冗余参数。他此前还联合创办自动驾驶感知公司Neural Propulsion Systems并担任CTO,具备将算法、芯片和硬件系统结合的产业经验。

Sahin Lale是PrismML联合创始人兼研究联席负责人。他在加州理工学院获得电气工程博士学位,长期研究动态系统、强化学习和自适应控制,之后曾在Neural Propulsion Systems从事算法研发。

Omead Pooladzandi是PrismML联合创始人兼研究联席负责人。他博士毕业于UCLA,研究重点是二阶优化、数据高效训练和模型泛化。

Reza Sadri是PrismML联合创始人兼战略副总裁。他长期从事数据库、高性能存储和机器学习基础设施,曾创办Levyx,也在Instacart负责机器学习基础设施团队,后来进入加州理工学院负责AI Bootcamp,主要承担公司的系统工程、产品化和商业化工作。

增加AI模型的训练算力,尺寸和训练数据,确实仍可以增强AI模型的性能,但这些AI模型的部署,就必须依赖庞大的数据中心基础设施。

这形成一个结构性的限制:受制于延迟、硬件性能和隐私风险,最强的模型被锁在大型计算集群和专用基础设施中,而手机、笔记本、汽车、机器人、企业本地环境这些端侧和边缘的环境,实时且安全的AI体验一直难以实现。

PrismML试图解决的,就是这个问题:让强大的AI在本地实现高效、安全且更快速的运行;同时让数据中心用更少的资源提供更强的计算能力,摆脱失控的能源成本。

他们希望开创一种全新的AI范式:模型能适应多样化的硬件环境,并在单位算力和能耗下释放最大的智能潜力。

具体而言,PrismML通过尽量无损地压缩AI模型,大幅降低其对内存、算力和能耗的占用,让模型能力逐步摆脱对参数规模和基础设施持续扩张的依赖。

与其他公司以4-bit、8-bit精度训练后量化不同,PrismML并非只压缩部分权重,或以少量高精度层维持模型能力,而是将Embedding、Attention、MLP和输出层等整个语言网络改造成二值或三值权重。

在二值模型中,每个权重只表示正、负两种状态,每128个权重共享一个FP16缩放系数,实际平均占用约1.125 bit;三值模型增加零状态,实际平均占用约1.71 bit,以稍大的体积换取更高的能力保留。

注:模型权重可以理解为神经网络内部的“调节旋钮”。传统模型会精确记录每个旋钮的具体数值,二值只记录正、负方向,三值再增加零状态,从而用更少数据近似保存原有模型能力。

它还为这些权重开发专用推理内核,运行时直接读取压缩格式,无需重新展开为FP16,从而同时减少模型体积、内存带宽和推理过程中的数据移动。

PrismML提出了评判模型的一个新概念,就是模型的智能密度,用于衡量模型单位部署体积能够提供多少能力。进一步而言,它希望提高模型在有限内存、功耗和部署空间下所能承载的有效智能。

Bonsai 27B与同参数规模其他模型的智能密度(每GB)对比,图片来源:PrismML

它们在2026年3月推出了全球首批具备商业可行性的1-bit大语言模型——1-bit Bonsai 8B。这个模型在整个神经网络中采用了自研的1-bit模型设计:嵌入层(embeddings)、注意力层、多层感知机层(MLP layers)以及语言模型头均为1-bit,是一个端到端原生1-bit模型。

可以在手机本地运行的1-bit Bonsai 8B,体积比其它同参数模型小10倍以上,性能却相差无几,图片来源:PrismML

相比 Llama3 8B,它体积缩小14 倍,速度提升 8 倍,能效提高 4-5 倍,它的大小仅为1.15 GB,足以轻松“装入”一部 iPhone 17 Pro。

它也可以运行在电脑上,根据PrismML自己的数据,1-bit Bonsai 8B运行在搭载M4 Pro芯片的Mac电脑上,推理速度达到131 tokens/秒;使用RTX 4090显卡推理,速度可达 368 tokens/秒;而在iPhone 17 Pro Max上,速度约为 44 tokens/秒。

他们最新的模型是Bonsai 27B,基于 Qwen3.6 27B 打造,也是同等能力级别中首款可在手机上运行的模型。

用GeForce RTX 5090推理,Bonsai 27B的1-bit版本速度最高可达163 tokens/秒,三值版本可达134 tokens/秒。在搭载M5 Max芯片的Mac上,其1-bit 版本速度最高为87 tokens/秒,三值版本为58 tokens/秒。

Bonsai 27B可通过MLX在苹果设备(Mac、iPhone、iPad)上原生运行,也可通过CUDA在 NVIDIA GPU上运行。

Bonsai 27B的意义在于,27B尺寸的模型,可以实现更复杂的工作,例如:多步推理、结构化工具调用、视觉任务,以及能够在漫长步骤中始终保持连贯的“计算机操作(computer-use)”智能体循环。

Bonsai 8B和Bonsai 27B ,解锁了一种全新的系统架构:混合部署。即把非极限和隐私敏感型任务路由给能力过硬的本地模型,同时将云端前沿模型保留给最困难的步骤。这将使智能体系统的单任务成本呈断崖式下降。

在应用上,当高级模型变得足够小巧、快速且高效,足以在本地运行时,AI产品的设计空间将更宽广,例如:全天候运行的端侧智能体、实时响应的机器人、安全可靠的企业级Copilot、离线智能,以及专为受限环境(如带宽、功耗或合规限制阻碍了高级模型落地的场景)打造的AI原生产品。

AI模型的下一轮进化,可能从追求规模转向提升“智能密度”

过去几年,AI模型沿着Scaling Law不断扩张:更多参数、更多数据、更大算力。它推动了能力跃升,也让模型越来越依赖数据中心、内存、带宽和电力。

当AI进入企业系统、机器人、汽车和智能设备,这条路径开始碰到自己的边界。企业需要能让自己专有数据保持隐私,物理AI的终端,无论是机器人、汽车还是手机/耳机,需要在真实环境中持续感知、判断和行动。它们都要求智能能够在本地运行,而模型体积和能耗正成为新的约束。

这意味着,AI模型的下一轮进化可能从追求绝对规模,转向提升“智能密度”:让每个bit、每GB内存和每单位能耗承载更多能力。模型的进步,也将从单纯扩大规模,走向对智能本身的压缩、重构。

我们或许正站在下一个十字路口。过去的问题是如何获得更多智能,接下来的问题是如何让智能进入更多设备和场景。浓缩智能由此不再只是效率提升,它可能改变模型的演进方向,也重新定义AI产品的边界。未来的AI将分布在云端、边缘,以及两者之间的所有位置。

下一轮模型竞争,可能将由谁能以更小的资源代价,把更强的智能带入更广阔的现实世界来定义。