今年新发布的手机,厂商开始花大量时间讲同一句话:我们的手机,能本地跑大模型,不联网。不调云端。芯片自己算。
不只手机,眼镜、汽车座舱,也在做同样的事。
这件事放在两年前讲,你大概率会觉得是个噱头;放在2026年,它确实开始变成常态了。
为什么偏偏是今年?是三条原本各自独立的技术曲线,在2026年,第一次同时走到了同一个位置了。
第一样:模型越来越「浓缩」了。
2024年底,清华孙茂松、刘知远团队和开源社区
他们的结论比较直接,大模型的能力密度,大约每100天翻一倍。
什么概念呢?每隔三个多月,你只需要一半大小的模型,就能达到跟现在最强的模型一样的水准。
跟摩尔定律放一块看更有意思,芯片在同样价格下的算力,大概每两年翻一倍。模型呢?
一百天;一边是两年,一边是一百天;前者决定你的手机能塞进多大的模型,后者决定塞进去之后它能有多聪明。
这事儿不光是理论。
截至今年7月,清华的MiniCPM系列在全球已经被下载了3800万次,GitHub上超过14万颗星;今年5月发布的MiniCPM5,参数量只有1B,效果比三个月前发布的Qwen3.5-2B还要好,体积砍半,反而更聪明。
第二样:芯片终于够快了。
模型再聪明,最终得跑在硅片上,你得有足够快的芯片,这条线,2026年才算真正跨过了一道坎。
我特意查了一下,高通骁龙8 Elite Gen5,AI算力到了100 TOPS;联发科天玑9500,超性能NPU的峰值也是100 TOPS,而且功耗比上一代砍了一半多,还支持一种叫低比特推理的技术,让模型跑起来更省电。
PC端的骁龙X2 Elite,NPU也有80 TOPS。
你可能对这些数字没什么感觉,记住一件事就够了:这批芯片真正装进量产手机,时间点正好卡在2025年底到2026年。
第三样:拿到了「准入证」。
这条线不在技术范畴里,它的约束力一点都不比前两条小,没有它,前面两样再好也等于零。
今年7月15日,国家网信办发了一份公告,7款手机端侧的AI服务完成了备案:但有个细节很多人没注意,目前全国做完备案的生成式AI服务已经快一千款了。
专门给手机端侧列一张清单,这是第一次,这张清单里最能说明问题的是谁呢?苹果。
Apple Intelligence在2024年6月的WWDC上就亮相了。端侧基础模型大约30亿参数,技术上两年前就准备好了。
它在中国市场等了两年半,最后国行版的AI能力,交给阿里
三条线放一块:模型每百天浓缩一倍,百TOPS芯片今年铺开,合法开机的许可7月8日生效。同一年汇合,落地才成立。
......
不过这里有一个细节,100 TOPS这个数字,值得讲一下。
如果你去问做端侧部署的工程师,他大概率会说:这个数,参考价值有限,决定手机能跑多大模型的,从来不是它。
TOPS是纸面算力,翻译过来就是「每秒能做多少次运算」,端侧真正卡脖子的地方在哪呢?
内存容量、内存带宽、数据搬运、缓存管理;很多时候模型是被内存拖慢的,路太窄,车再快也跑不起来。
这话听着抽象,我给你举个例子。
iOS上有个机制叫Jetsam,一个App占的内存超了限,系统直接把它杀掉,连个弹窗都不给。安卓那边也有,叫LMK,一样的逻辑。
所以,端侧跑大模型,你得给系统和其他App预留三到四成内存,手机标称8GB,真正能给模型用的,远没有8GB。
这就是端侧、云端最本质的区别。
云端约束是钱,不够加机器就行了;端侧的约束是物理,内存就这么多、电池就这么大、散热就靠那一点面积。
于是每一类设备,都被自己的内存预算和功耗预算,锁死在一个很窄的尺寸区间里。
智源发了份《端侧智能2026》,里面有一张表,我觉得是最有价值的东西,它把不同设备能塞进多大的模型,按照INT4量化口径估了一遍:

你把这张表看一遍,规律很直接:
越贴身、越省电、越要求实时的设备,能装的模型越小;越是电源管够、散热空间大的,尺寸越往上走。
眼镜为什么只有1B到3B?它得挂在你鼻梁上。
一副国产无屏AI眼镜的整机重量,普遍控制在40克以内,最轻的35.5克;这个重量里要塞进电池、摄像头、扬声器、主控芯片。
留给内存和散热的,就指甲盖那么点空间。
AI盒子为什么能到70B+?它插着电,放桌上,可以塞大内存,可以做主动散热,不受那份罪。
手机夹在中间,3B到4B;是它得跟相机、导航、后台服务抢同一块内存。大家都在排队吃饭,谁也别想多占。
这张表还有一个动态的部分:格子会变大。
我查了下,座舱主控芯片从高通8295往8397、8797迭代,本地能承载的模型规模也从大约0.9B涨到了4B到8B,旗舰平台已经能摸到14B。
同一个品类,两年时间,尺寸区间往上抬了一个数量级,多模态座舱智能体这件事,就是这么成立的。
我拿面壁的MiniCPM-V 4.6举个例子,1.3B参数,Q4量化之后连视觉编码器一块打包,整体部署体积大概1.6GB,能在6GB内存的手机上跑。
1.3B,正好落在「手机3B到4B」这个格子的下沿。1.6GB的体积,对6GB内存的手机来说完全安全;他们从一开始就是照着这个约束设计的。
那另一个问题就来了:为什么端侧模型厂商全都在死磕量化?
说到底,量化就是连接「模型能干什么」和「硬件跑得动什么」之间的一座桥。
端侧这个行当里,能不能在精度、体积、速度三者之间找到最优平衡点,已经成了衡量一家模型厂商工程能力的标尺。
还有一件事,挺容易被忽略的,你手机跑大模型,最要命的是能跑多久。
手机持续高负载会怎么样?发烫,降频,电量掉,系统抢资源;麻烦的是,很多端侧AI要做的事,偏偏就是长时间挂着的那种。
于是整个端侧推理的思路就得跟着变,现在得比「谁能稳定跑一个下午还不烫手」。
不能只看第一个词出得多快,还得看费多少电、烫不烫、放后台会不会被杀。
最后给你一个数:端侧模型的上下文长度,通常只敢开到512到2048;云端呢,随随便便128K。为什么差这么多?会吃内存,内存吃超了,系统就会把软件杀掉,你还敢开吗?
......
内存不敢开大,是硬件不让,还有一种不敢,跟硬件没关系。那七款完成备案的,拿到了牌照,这牌照到底值什么?我给你拆开看。
咱们这套制度:你要向国内公众提供生成式AI服务,得走大模型备案;安全评估报告、语料标注规则、拦截关键词列表、评估测试题集,先交这些。
过属地网信办,再做技术测试、专家评审,最后中央网信办终审。流程是真的重。
苹果等了两年半,就等这玩意儿,拿到牌以后,你的东西就不一样了;系统级权限、跨应用调度、开机自启的智能体,只有持牌方配碰。
你会看到一个现象:拿到牌这批,带着牌往下走了。
华为AI眼镜跑自家的小艺,小米AI眼镜接小爱,
第二层,租牌的。如果自己不炼模型,只是调别人备过案的API,走的程序叫登记。
调用情况说明、服务协议、内容安全管理制度等等,这些乱七八糟的一套,交到省级网信办,省里点头给你个上线编号,不用上中央终审,圈里实操下来,大概四到五个月。
比备案轻多了。代价两个。
第一个,只能租,不能改。你调用的模型做了微调,或者喂了自己语料训练,就不满足登记条件,被踢回去走完整备案。
这事儿放在端侧这个行当里,很要命;端侧AI最值钱的是什么?本地个性化、私有数据适配、越用越懂你。三件事,全踩在「改没改模型」这条线上。
第二个,牌是别人的。
Rokid把「可自由切换
影目的INMO AIR3、GO2接大模型做同传,微光科技的玄景M6接
租牌的人在变多,我查了下,网信办自己的数字:2025年底,748款备案、435款登记;今年6月底,988款备案、598款登记。半年时间,登记多了163款,涨幅比备案还快。
而且这张牌是明牌。网信办要求所有上线的生成式AI应用,在显著位置公示模型名称和备案号。你用的是谁家的,写在那。
还有一件事,很多做硬件的会低估:没牌,你连渠道都进不去。
AI陪伴、AI绘画、AI写作这些品类,安全评估报告没有、备案没有,就不给上架;今年4月网信办启动了一轮专项行动,重点整治的头一条就是没按规定备案登记,第一阶段处置了1.4万多款违规AI产品。
第三层,这个行业里最不起眼的一群人。可能也是最舒服的。
《生成式人工智能服务管理暂行办法》第二条:利用生成式AI技术,向境内公众提供生成文本、图片、音频、视频等内容的服务。
卖芯片的不在里面。
瑞芯微、恒玄科技、星宸科技、全志科技、晶晨股份,它们卖的就是那块硅片,让模型能在设备上跑起来。一张证不用办。
这一层靠什么吃饭?终端出货。
A股有个现成的窗口:到7月20号,AI眼镜产业链60多家公司发了上半年业绩预告;大家在预告里说的驱动因素是什么?存储芯片暴增、终端放量。没一家提合规。
牌照是别人的事,牌照决定终端能不能上架卖,终端卖多少,决定它们出多少货。这条链,隔了一层。
三层。持牌的带着牌往下走,租牌的等四个月拿个编号,不碰牌的一张证不用办。谁苦谁甜,自己心里有数。
......
说了这么多能跑通的,来说说跑不通的。三件事,现在还堵着。
第一件:你做的模型,换了芯片就不好使。
云端就那几种架构,端侧不一样。你去数数,手机里跑AI的芯片,高通是一套,联发科是一套,每套还有自己的工具链、自己的规则。
这还只是手机,加上PC、汽车、机器人、IoT模组,每家都自己搞一套。
结果就是:在这块芯片上跑得飞起,换一块,重来;N个模型乘M种芯片乘K种终端,根本适配不完。
麻烦还不只是活多,主流AI开发到今天,默认就是给英伟达优化的。
全球海量的开源模型、算子,都在CUDA上跑,国产芯片算力做得再好,没人给你写适配,你就接不住社区的更新速度。
智源今年搞了个FlagOS,就想解决这事儿。
我查了下,3月发的2.0版本,统一算子库497个,覆盖了18家厂商、32款芯片;实测把Qwen的CUDA依赖全换了,推理性能从原来35%提到了接近最优的95%。
听着不错,支持32款。到32款上都好用,中间还有得磨。
第二件:三角,你只能选两样。端侧做AI,精度、省电、便宜,三件事互相打架。
你要模型聪明,就得做大;做大了吃内存、吃电、手机发烫。你要省电,就得把模型压小、精度往下砍。压狠了,变傻。
你要便宜,就用低端芯片,低端芯片内存小、NPU慢,大模型根本塞不进去。
这三件事的边界在物理手里,制程往前走一步、内存带宽提一档,它才勉强往外挪一丝。急不来。
你可能想起前面说的密度定律,模型每百天浓缩一倍,不就是在破这个三角吗?没有。
密度定律干的活,是把三角的边界往外推。推的是边界,三角还在,任何一个时间点上,还是只能选两样。
第三件:最赚钱的事和最省事的办法,撞车了。
端侧AI到底比云端强在哪?数据不出你的手机,模型认得你,越用越懂你;终端厂商愿意掏钱,掏的就是这个。
要做到越用越懂你,模型就得改,调一调,喂点你自己的数据继续训;还记得登记那事吗?模型改过了,登记就不算了,得回去排备案。
租牌的人怎么办?两条路。
不改模型,保四五个月上线,产品就是个壳,问什么都回答个通用的;要么把个性化做深,做出别人做不了的东西,代价是回去排队。
谁都没错;合规问你「模型是谁的」,产业问你「模型有多懂我」,两把尺子,量的压根不是同一件事。
大厂不受这个罪,自己持牌,爱怎么改怎么改。
这条约束的真正效果是:它把个性化这条最值钱的路,留给了一开始就有牌的那批人。
核心数据参考:
[1].中央网信办公开公告及《生成式人工智能服务管理暂行办法》、智源研究院《端侧智能2026》报告、清华大学密度法则研究成果(Nature Machine Intelligence)、智源社区FlagOS 2.0发布信息

