用 AI 干活到底快没快?1237 人真的测过
10 小时前 / 阅读约14分钟
来源:36kr
研究发现,使用AI时人们易产生加速错觉,即高估AI节省的时间。实验显示,AI未显著减少任务完成时间,但降低了费力程度。文章探讨了认知卸载、时间判断偏差及AI对工作方式的影响。

「这个我用 AI 很快就能搞定」,这句话你说过。用了 AI,事情做起来是轻松了,我们也就很容易觉得它更快。可一项 1237 人的研究发现,轻松和省时并没有总是一起出现。更有意思的是,人对 AI 的时间判断会偏,对同事却不会。这种错觉是从哪儿来的?

你真的记过时间吗

想一件你最近用 AI 做完的事。写周报、整理材料、改一版方案,都行。

做之前,你估计要花多久?做完以后,实际用了几分钟?

第一个数你也许还有印象,第二个数就不一定了。事情做完,人更容易记住它顺不顺、累不累,却未必记得自己到底花了多久。平时这不妨碍什么,因为轻松和快通常一起出现。

可用了 AI,两者还会不会一起出现?下面这项研究查的就是这件事。

轻松了,却没更快

2026 年,一群认知科学和计算语言学研究者找来 1237 人,让他们完成一批简单的认知任务。研究方案事先已经登记。

每项任务做完,研究者都会记下三组数据。

实际用了多长时间

事先预测要用多长时间

做完之后自己报告的费力程度

任务分两种:一种自己做,一种可以用 AI。

第三个数不是随口打的分。他们用的是一份叫 NASA-TLX 的量表,问的是脑力消耗、时间压力、努力程度、挫败感这几项。

这份量表最早是美国航天局用来评估飞行员工作负荷的,四十多年后,被拿来量一个坐在电脑前改周报的人累不累。

结果,两种条件下的实际完成时间没有差别

整体上没有差别,但在少数任务上确实快了:找近义词、总结长文、编辑长文本。这几类活都有比较明确的答案,自己做也主要是重复劳动。

可轮到事先估时间,大家都觉得用 AI 会快不少。自己做要多久,他们估得挺准;一旦可以用 AI,估出来的时间就短了。

研究者管这叫加速错觉。

看到这里,很容易以为:只要有人帮忙,人就会把时间估短。

但研究者还问了另一种情况。假如是另一个人来帮你,你估要多久?

这一回,偏差没有出现。还是这批人,帮手换成同事,他们估得挺准;换成 AI,时间就估短了。

有人搭手,并不一定让人乐观。帮手是 AI 的时候才会。

论文为什么还要专门测同事帮忙?这跟作者一直在做的事有关。斯坦福的罗伯特·霍金斯,实验室长年琢磨两个人怎么把话说到一块儿去、怎么攒出默契。他研究的本来就是人跟人怎样协作,所以论文里专门设了同事这一组。作者里还有斯坦福语言学教授丹·尤拉夫斯基,他写的那本教材,几乎所有做自然语言处理的人都读过。

AI 之前,人早就在把脑力活交出去

「加速错觉」这个名字新,背后的问题不新:人一直在把脑力活交给外物,也一直未必清楚自己交出去了多少。

1994 年,有人提出认知行动这个说法:你歪着头看一张倒过来的图,而不是在脑子里把它转正。用一个身体动作,换掉一次脑力运算。两年后,另一组人研究计算卸载:同样一道题,写在纸上算和在脑子里算,费的劲不一样。

到 2016 年,两位研究者把这些散在各处的研究收拢成一篇综述,给了它一个名字:认知卸载。它的定义并不玄:用身体动作改变一项任务的信息处理需求,从而减少脑力负担。设个闹钟提醒自己,就是认知卸载。这篇综述如今是这个领域的标准出处。

综述还追问了一个问题:人会在什么时候把脑力活交给外物?答案不只看任务难不难。综述列了三条:

卸载的倾向,取决于如果不卸载,你需要付出多少内部认知代价

也取决于你对自己脑力的评估

这个评估可能是错的,估错了,交出去的决定就不划算。

第三条和这项 AI 研究最相关。人可能连自己应付得好不好都判断错。

对自己记性没信心的人,会过度依赖外部记录。高估自己的人,该记的反倒不记。研究者早就指出,人对自己的这份估计一旦有偏,交出去的决定就会跟着偏。

把加速错觉放回这个框架里,它就不是一个孤立的新发现了。以前的研究发现,人会看错自己的记性。到了 AI 这里,估错的变成了它究竟能替自己省多少时间。

作者自己在文中提了一句警告:校准不准会让人过度卸载,尤其是对那些自己本来就讨厌的费脑力任务。越是费脑子、招人烦的活儿,人越容易交给 AI。可一旦成了习惯,也就更少回头核对它究竟省了多少时间。

不过说到低估时间,这里会碰上一个老问题:人不是本来就常把完成时间估短吗?

1994 年,加拿大心理学家罗杰·比勒与同事问一批快要交毕业论文的学生:你觉得自己哪天能交?平均答案是 33.9 天。

实际用了55.5 天。约七成人超过了自己的预测。

这种低估后来被叫作计划谬误,行为科学里研究了很多年。

既然人总低估自己,为什么上面那项研究里,自己做的时候反而估得准?

因为任务不一样。后续研究发现,任务要够长,低估才会出现;任务一短,人反而高估。两项研究并不真矛盾。毕业论文以月计,实验里的任务几分钟就做完了。

放到实际的活儿里,这是两种不一样的低估,别混着算。计划谬误问的是你怎么看自己的进度;这项新研究问的,是你怎么看 AI 能替你省下的时间。前者研究了三十年,后者才刚开头。

时间没省,力气省了

时间没省下来,任务却没那么累。参与者用时差不多,报告的费力程度却低了。

轻松和省时平时是绑在一起的。所以觉得轻松,我们往往也就觉得没花多少时间,而且通常错不了太多。

AI 把这两件事拆开了。

为什么偏偏歪在 AI 上?一个可能的原因是,我们还不清楚这种工具究竟能帮到哪一步。

计算器和搜索引擎的用途相对固定。用过几次,人就知道该让它们做什么、又该在哪儿自己检查。

大模型不一样。同一个模型换到不同任务上,可靠程度可能差很多,用的人却很难事先判断这一次靠不靠谱。偏偏它答对和答错的时候,语气可能没什么区别

过去我们会看一个帮手答得快不快、顺不顺、有没有迟疑,借此判断他靠不靠谱。面对大模型,这些线索失灵了。它即使答错,也常常答得又快又笃定。

摸不准这件工具的斤两,时间大概也就跟着估不准。

换成同事,这个偏差就不见了。是不是因为我们对同事的斤两心里更有数?这项研究没往下测。

这些证据各自到哪儿为止

先说一项常被拿来搭配着讲的研究。2025 年有人拿脑电做过一次,但它的证据有限。

脑电是在头皮上贴电极,记录大脑活动时的电信号。它测不出你在想什么,但能看出不同脑区的活动是不是同步。研究者管这个叫连通性,同步得越紧,通常意味着投入的认知资源越多。

那项研究让人分三组写文章,用 AI、用搜索引擎、什么都不用。三组的连通模式确有不同,外部支持越多,连通性越弱。

这项研究在网上传得很广,可它撑不起那些更大的结论。

它还是预印本,没经过同行评审——那一关是由同领域研究者匿名挑错、要求补实验或修改,常常把结论改掉甚至否掉

只有 54 个人,最后一轮只剩 18 个

已经有正式评论文章质疑它的样本量和脑电方法,也质疑别人能不能重做出同样的结果

作者自己说明只测了一个 AI 产品,不能外推

它测的是写作当下的差异,不是长期变化,没有证明「用 AI 会让脑子变笨」

网上流传的两个具体数字,我回原文没有核到,所以这里不引。

它跟主研究能对上的只有一点:用外部工具的时候,人当下花的心力可能少一些。至于少了会怎样,它答不了。

脑电那边推不远,前面那项 1237 人的研究,也有它推不到的地方。

它测的是简单认知任务,不是你手上那份方案。下面几条里,这一条最要紧。任务一长、一复杂,情况可能完全不同,甚至可能反过来。AI 在长任务上或许真的更快,只是人依旧估不准。研究没测过,我们也不能替它说。

实验只记录预测和实际用时。估短之后,人会不会多接活、把日程排得更满,它没有继续追踪。

让 AI 出初稿、挑错,或者陪你辩一遍,人的参与程度差别很大;这项研究没有分别比较。

这篇论文刚发表不久,还没人独立重做过一遍。在那之前,话不能说得太满。眼下站得住的就是这一句:在这些简单任务里,省力不等于省时。

还有一种质疑,针对的不是数据,是提问的角度。深度学习框架 Keras 的作者 François Chollet 说过:把 AI 当成旧流程的效率工具,这个框架本身就错了;跟以往每一次计算技术的浪潮一样,AI 是让人用新方式做新事的工具。

照这个说法,问「用 AI 快了多少」,本身就问小了。

Chollet 问的和这项研究问的,最好拆开看,它们并不打架。AI 可能改变你去做什么,同时也照样让你看错眼前这件活要花多久。

别拿轻松当省时

用 AI 后轻松一些,这个好处不用否认。实验里的人也确实觉得没那么费力。

但轻松不能再直接拿来估时间。「刚才那件事做起来挺轻松」,在有 AI 的场合已经推不出「所以花得不多」了。

想知道自己有没有把时间估短,连着记五次就够了:

开始之前,写下预计的分钟数;做完以后,再写实际的分钟数。

先别分析,也不用急着归纳。攒够五条,看看哪些活偏得最多。

记这五次,不指望你马上就估得准。记下来你就同时看见了两样:当时觉得轻不轻松,和它实际花了多久。

轻松是真的。快没快,得看钟。

参考文献

Buehler, R., Griffin, D., & Peetz, J. (2010). The planning fallacy: Cognitive, motivational, and social origins. Advances in Experimental Social Psychology, 43, 1–62. https://doi.org/10.1016/S0065-2601(10)43001-4

Buehler, R., Griffin, D., & Ross, M. (1994). Exploring the "planning fallacy": Why people underestimate their task completion times. Journal of Personality and Social Psychology, 67(3), 366–381. https://doi.org/10.1037/0022-3514.67.3.366

Chollet, F. [@fchollet]. (n.d.). Thinking of AI as a productivity booster for prior workflows is the wrong framing [Post]. X. https://x.com/fchollet/status/2058982905368773040

Kirsh, D., & Maglio, P. (1994). On distinguishing epistemic from pragmatic action. Cognitive Science, 18(4), 513–549. https://doi.org/10.1207/s15516709cog1804_1

Kosmyna, N., Hauptmann, E., Yuan, Y. T., Situ, J., Liao, X.-H., Beresnitzky, A. V., Braunstein, I., & Maes, P. (2025). Your brain on ChatGPT: Accumulation of cognitive debt when using an AI assistant for essay writing task [Preprint]. arXiv. https://arxiv.org/abs/2506.08872

Risko, E. F., & Gilbert, S. J. (2016). Cognitive offloading. Trends in Cognitive Sciences, 20(9), 676–688. https://doi.org/10.1016/j.tics.2016.07.002

Scaife, M., & Rogers, Y. (1996). External cognition: How do graphical representations work? International Journal of Human-Computer Studies, 45(2), 185–213. https://doi.org/10.1006/ijhc.1996.0048

Stanković, M., Hirche, E., Kollatzsch, S., & Doetsch, J. N. (2025). Comment on: Your brain on ChatGPT: Accumulation of cognitive debt when using an AI assistant for essay writing tasks [Preprint]. arXiv. https://arxiv.org/abs/2601.00856

Yu, S., Cheng, M., Jabbar, A., Sucholutsky, I., Collins, K. M., Jurafsky, D., & Hawkins, R. D. (2026). Cognitive offloading and the speedup illusion in human-AI interaction. In Proceedings of the 48th Annual Meeting of the Cognitive Science Society. https://arxiv.org/abs/2605.23177