今年,AI玩家纷纷扎进AI办公赛道,它们要革命的可不止你的Office软件,盯上的是一个万亿美元级别的大市场。阿里的“小章鱼”在这场争夺里,正快速伸出触手。
一个月前,阿里把
9月4日,这只刚满月的“小章鱼”已入住3000多万人的电脑,其中有一半是企业用户。汽车、金融、医药、供应链、餐饮龙头们,借“小章鱼”之手把阿里的AI基座Qwen,接进研发、财务、供应链、门店运营等真实业务流程。
这件事发生在AI行业最焦虑的当下。大模型竞争激烈到只能“各领风骚几个月”,新模型、Benchmark和产品能力几周一轮刷新;为了不掉队,AI大厂不断融资、买卡、扩数据中心,Capex军备竞赛越打越贵,投资者们想知道,这些投入什么时候能真正赚回钱?
近三十年的toB基因,让阿里早早参透了故事的走向。
随着今年Qwen跨过“自主化Agent”的能力临界点,
也就是说,只要

过去两年,大模型行业很容易陷入一种“单点领先焦虑”:今天谁登顶Benchmark,明天谁把上下文再拉长一倍,后天又有人把Coding分数刷到新高。模型能力持续跃升,但领先窗口越来越短,格局始终在洗牌。
如果把视角从模型榜单拉到商业化,焦虑感反而轻很多。
Chatbot订阅先证明,人愿意直接为智能买单;Coding工具再向前一步,AI开始交付可以真正运行的代码,客户愿意为其节省的工程师时间付费;Agent和Coworker则把商业化继续向工作结果推进,模型能够自己规划步骤、调用工具、处理错误,把一件事情从头做到尾。
能力每往前一级,客户购买的东西都会离最终经济结果更近。这个变化,会改写AI玩家的收入天花板。
一家企业愿意花多少钱买Office、CRM、ERP,大致有数;但为了完成研发、财务、法务、采购、销售、客服等知识工作,一家公司每年的投入可能高出一个数量级。
一个直观的例子是财务场景。红杉资本在一篇研报指出,一家公司可能每年只花1万美元购买财务软件,却愿意花12万美元请会计完成结账。工具预算只是很小的一块,真正肥沃的市场一直藏在工作本身。
也就是说,AI最容易渗透的并非是大家印象里的低技能劳动,而是那些规则复杂、但规则明确的白领工作。未来,当AI交付结果,就有机会进入专业服务预算。要知道,全球知识工作者工资支出约30万亿美元,ARK Invest预计,这一数字到2030年可超过45万亿美元。
Agent的商业化空间,就是沿着这条缝隙打开的。
理论上,只要AI创造的价值高于完成任务所消耗的Token成本,企业就有继续增加调用的动力。这里出现了“杰文斯悖论”的苗头:Token越便宜,企业反而越有动力让AI给组织提效;单位智能成本下降,最终可能换来更大的总调用量。
眼下,长安汽车已经将

这几组数字很接近企业关心的ROI。
两天缩短到5分钟,可以换算资深工程师工时;工作量降低九成,可以计算组织成本;几万份调研从数天变成半天,对应的则是决策周期。企业开始帮阿里回答一个过去很难答的话题:用AI到底能省多少钱?
更多行业也在跑类似的账。
传化集团把
从制造到金融、医药、餐饮,这些行业的共通点很清楚:先找到一段规则相对明确、结果可验证、过去需要大量人工完成的工作,让Agent接走一部分。
企业Agent的市场就是这样一
传统SaaS的收入往往随着人头数增长,一家1000人的企业通常只需要1000套左右办公账号;Agent对应的是Task,一个员工每天可以产生几十个任务,一家公司一天可能产生几万甚至几十万个任务。
AI承担的工作越多,Token消耗越大,市场规模也就越接近企业实际付出的劳动成本。这也是为什么沙利文预计,未来中国Agent市场约九成收入会来自B端。
上线一个月,
企业Agent的难点也从这里开始。
让一个员工用AI报告写快一点很容易,让一家企业整体效率提升要复杂得多。销售需要同时访问客户记录、库存和报价权限;研发需要理解历史项目、产品文档和供应链信息;财务工作又涉及规则、审批和数据权限。一项工作往往横跨多人、多个系统和大量历史上下文。
第一步是连接。
企业真正用起来之后,这些“手脚”会继续伸向CRM、ERP和内部系统。

销售人员可以在钉钉中发起需求,
第二步是上下文。
第三步是Skill。
可以说,过去难以进入软件系统的经验,通过Context和Skill变成可被Agent反复调用的企业数字资产。
产品还在继续往多人协作走。
过去一个月,
这也意味着,
万亿美元市场能不能真正落地,最后还要回到一件事:模型和Agent能不能持续把更长、更完整、更专业的工作接下来。加码B端,就是

进入企业之后,
这套能力牵引机制,已经先在Coding上跑起来。代码天然拥有高密度、可验证的反馈:能不能运行、测试是否通过、Bug有没有修掉,都有明确答案。模型在这些环境里练出来的,也不只是写代码,而是长程规划、工具调用、错误恢复和持续执行等更通用的Agent能力。
METR的最新研究也显示,前沿AI Agent能够可靠完成的任务时长仍在快速增长。2024年以来,50%成功率对应的任务时长约每89天翻倍;其任务集主要用于衡量研究和软件工程所需能力。
当这一套能力成熟,就可以继续向更复杂、更高价值的专业工作迁移。今天模型可以连续几个小时理解代码库、调用工具、发现错误再重新规划,下一步同类能力就有机会被泛化到安全、财务分析、IT运维、供应链等场景。每一代Qwen能承担的工作更完整,
企业场景又会继续把这条能力曲线往前拉。
从整理信息到调用业务系统,从单点任务到跨系统流程,从几分钟的工作到数小时甚至更长周期的执行,真实任务会不断暴露模型在规划、可靠性、上下文理解和错误恢复上的短板,再牵引模型、Harness和工具体系继续优化。
最终形成一套长期机制:先在可验证的任务中把Agent能力练出来,再把能力迁移到新的专业场景;新场景提出更复杂的任务,再继续推动下一代能力升级。
对企业来说,模型能力和Harness协同每提升一级,就意味着更多完整工作可以交给
这种能力迁移和解锁新场景的速度,才是
Qwen负责生产智能,
这些环节开始形成一条完整的商业闭环。
Qwen的Max版本能力越强,
AI的“回头钱”,开始沿着这条飞轮回来。更重要的是,这套闭环也会沉淀出另一层系统壁垒。
Benchmark冠军可以几周换一次,一个新Agent功能也可能迅速被复制;但
时间越长,
这可能才是“小章鱼”最值得看的地方。它一头抓着Qwen,一头连接阿里云,再把触手伸进企业的数据、工具、组织和流程。过去看起来分散的模型、云、钉钉和AI应用,围绕“把工作做完”形成一套自增强闭环。
模型会继续卷,Capex也会继续增长,但企业真实需求已经开始把阿里的AI投入变成收入。面向更广阔的知识劳动价值池,AI只要逐渐接走其中一部分工作,就能打开新的市场空间。
一只刚满月的“小章鱼”,已经先替阿里伸进去了几只触手。
