截至2026年8月,
近期
一开始的大模型是能聊,后来发展为能写能看,

图片来源:网络
此前传统意义上的AI助手,一般止步于帮你写报告、生成图片等,但并没有真正进入到用户的操作系统去执行任务。现在
需要注意的是,使用该功能需在
在外界看来,
一个是看的问题,即视觉感知,AI需要能够实时看到电脑屏幕的内容,同时理解图标、按钮、输入框等的意义,
一个是规划的问题,在理解屏幕内容的基础上,像人一样制定操作秩序;
一个是操作的问题,也就是精准执行,根据规划,移动鼠标、点击坐标、键盘输入灯,都需要精准控制。
当然,用户也可以实时查看

图片来源:上游新闻
目前,大模型的参数量竞赛渐渐退潮,“谁能把能力落到实处”开始成为真正拉开差距的转向。此次
看一看周围,Windows仍然是全球范围内办公场景的主流操作系统,对于职场的办公人士来说,大量的核心工作流都运行在Windows环境中。相比于移动端或Web端,PC端依然拥有更丰富的软件生态以及更适用于负责的操作场景,这也就给AI代理执行提供了发挥价值的基础。
再则,“本地电脑”往往意味着数据安全和隐私可控。虚拟桌面操作在本地环境中完成,用户的屏幕信息、操作行为不需要上传到远程服务器进行处理,可以沿用之前的信任基础,相比于云端远程操控,本地化的虚拟桌面在安全感上更有优势。
如果把视角扩展得更宏观一点,这也代表了AI行业的一个分支趋势,大模型能力不仅仅是云端,还要下沉到终端。随着端侧模型能力的提升和本地推理框架的成熟,将来会有越来越多的AI功能在用户自己的设备上运行。

图片来源:风芒新闻
所有的产品,其技术进步最终都是要为人服务的,所以用户的体验尤为重要。
以前用户与AI的共处,通常由用户扮演指挥员角色,我们告诉AI需求,比如写一个活动方案或者撰写一段报告内容,AI把我们想要的呈现出来,最终需要用户自己去执行。
当用户说“帮我做一份报价清单”,AI会生成一份文档,但打开Excel、筛选数据、以及后续的插入图表、调整格式,这些步骤仍然需要用户亲力亲为。在这种场景下,AI是一个顾问参谋,但始终无法替用户走完最后一公里。
而
接下来用户不用自己动手,
对于用户而言,这是一种体验的跃升,AI现在不是工具了,变成你的代理人,这是一种从被动到主动的跨越。先不说其他的,对于日常工作中那些枯燥重复性高且流程化的任务,绝对是一次效率革命。

图片来源:网络
我们再把视角拉远一点,
首先是人机分工的变化。过去的几十年,计算机的普及重塑了人类的工作方式,但人机之间有个清晰的分工界定,人主要是做决策创意,机器是计算执行。现在,AI代理的出现正在模糊这条界定线,相比与计算机的机械,AI能够理解人的意图,还能自己动手完成任务,这个时候,人做什么,机器做做什么,就需要被重新划分。未来的工作场景,人的角色大概率会转向目标设定、质量把控和价值判断,AI进行执行,完成分工的上移。
其次是软件界面的变化。我们回想一下,在操作电脑的时候,是不是依循打开软件-点击菜单-输入文字-保存文件,大致这样的步骤来进行的?而当AI能在后台自动完成所有操作,我们就不需要复杂的菜单和各种各样的快捷键,而是用语言告诉AI“我要什么”。软件的界面就会从“给人看的”变成“给AI看的”,而人只需要看到最终结果。
最后是劳力定义的变化。人力、引擎力,现在AI代理在虚拟桌面的执行力本质上是一种数字劳动力,它不需要休息,可以一个力当三个力使用,对于企业而言,意味着大量流程性工作的自动化成为可能。对于个人而言,个体的生产力上限也将被大幅抬高。
其实除了

图片来源:
AI代理帮我们解放双手固然可喜,但是技术都有双面性,随之而来的问题我们也得审视。
比如关于稳定性。人类对本地电脑的探索尚且没有结束,
另外,办公过程中往往涉及跨系统、跨平台、跨账号的复杂协作,像是多个浏览器标签页之间切换信息等,
还有就是大众普遍关注的安全与信任问题。尽管本地电脑在隐私层面有所保障,但因为涉及到授权,若是授权机制不够精细,AI的行为缺乏足够的透明度,用户的信任恐怕会大打折扣。用户需要的是在享受足够便利的同时,又始终保持行为操作的掌控感。

图片来源:官网截图
对于用户而言,虚拟桌面功能其实是重塑了AI与用户的关系,AI现在不仅是顾问,且完成了最后一公里。当AI代理时代来临,人机分工、劳力定义,甚至于软件界面等都将发生各种变化,AI厂商纷纷入局,
从微观层面看,这是
我们或许还无法准确预言AI代理时代的全貌,但可以确定的是,当AI会看会动,它就不再只是屏幕那一端的一个对话框,而是开始真正走进我们的数字生活,成为一个可以并肩工作的伙伴。
