顺着说、假装做,大模型“讨好型人格”成智能体时代新挑战
9 小时前 / 阅读约7分钟
来源:凤凰网
AI大模型出现讨好用户行为,产生静默失败和自信幻觉等问题。根源在于模型训练与交互机制设计,过度迎合带来多重隐患。需调整训练数据和奖励目标,探索新训练方法,加强数据标注和评测体系,规避执行风险。

“太好了,我帮你完成了如下的工作。”模型总这样说,实际却可能说一套做一套。

蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术人用coding(编程)大模型遇到的现象:向模型布置一个任务去写代码,模型总会很快说自己“完成”了,并列出一堆自己做的工作细则,但人去验证会发现,模型声称完成的内容很多,其实许多只实现了接口,“表面完成了,但实际未完成的部分被它静默隐藏了。”

看似对人类有求必应的大模型开始出现不诚实的行为。与传统意义上的模型幻觉不同的是,近年来,大模型的“讨好型人格”让它们在回应人类的诉求时,产生静默失败和自信幻觉等问题。步入智能体时代,当AI从对话走向执行,这一问题也在变得更为严峻。

AI浮现“讨好型人格”

越来越多用户发现,讨好用户似乎正在成为大模型的惯性,潜移默化地影响大模型各个场景下的输出。

记者为此做了一个实验:将同一篇新闻稿件上传给各个大模型,在不同的对话中分别以“这是我写的稿件”和“这是我讨厌的同事写的稿件”,请大模型从新闻角度为稿件打分,结果发现,deepseek、豆包、chatgpt等给“讨厌的同事”的分数均低于“我”,十分制下,deepseek给的分差达到了2.3分。

这意味着,模型对人类的讨好已不仅停留在表达上的取悦,它开始动摇模型对内容、观点的判断。随着智能体时代的到来,模型的讨好行为甚至从观点迎合扩展至结果迎合。

“在Agent场景中,模型还会进行结果迎合。”孙博文告诉记者,由于用户布置任务通常期待一个明确的结果,即便文件没有生成、外部系统调用失败,模型也会说自己尝试了,或者不按照用户要求尝试另外一种实现方式,最终给出“完成”用户任务的“正确”结果。

孙博文举例,他曾做一个涉及天气查询功能的智能体,验证过程中他发现,智能体给出了天气状况,但可能没有真正去调用查询天气的接口,自己杜撰了一个天气反馈给用户。

在他看来,coding模型上述问题可能是由于上下文不足带来的“静默失败”,而智能体杜撰天气,可能是智能体调用错了skill并认为自己是对的,产生了“自信幻觉”。

“核心根源来自模型训练与交互机制设计”,天使投资人、资深人工智能专家郭涛也对记者分析,大模型过度讨好人类、智能体静默失败等,都是AI适配人类体验产生的负面偏差。

郭涛强调,大模型过度迎合人类会从认知、决策、信息层面带来多重隐患,而进入智能体时代,风险从文字偏差转向行为偏差,智能体可能产生更多执行层面的实体问题,需更加重视。

AI为什么不诚实?

如何才能让模型变得更独立、诚实?正在成为行业需要思考的新课题。

“讨好型人格”的背后是模型训练机制的系统性问题。过去几年的发展中,大模型不断被训练得让用户体感越来越好,在RLHF(基于人类反馈的强化学习)训练框架下,人类偏好往往会成为重要优化信号,模型会被鼓励表现得礼貌、有帮助、有回应感,智能体的训练同样如此。

这总体上是用户需求带来的大模型厂商“用脚投票”。孙博文介绍,从数据清洗、训练数据的构造再到模型训练的过程,模型学到一些捷径——给出一个肯定用户、明确的成功答案会比反复表达不确定性,更容易取悦用户。

想要纠偏模型的过度讨好,从训练数据和奖励目标上都应进行调整。

孙博文分析,模型训练样本需要减少“用户喜欢什么给什么”的内容清洗逻辑,增加主动承认失败及证据不足时不下结论的样本,提高模型的“诚实度”。同时,模型也需要调整奖励目标,除了奖励用户满意度,还要提高客观性、任务真实完成情况等奖励权重。

一些新训练方法也正被探索。

2025年底,OpenAI 团队曾提出“让AI学会忏悔”,让模型在回答完问题后,再单独生成一份"忏悔报告",如实汇报自己在过程中有没有偷工减料、钻空子或违反指令。研究发现,当主回答与忏悔内容的奖励完全隔绝后,模型在“忏悔”中比原回答中诚实得多。

谷歌研究院也在 2026年提出,不再让AI死磕“全知全能”,而是让模型认知自身的知识边界,教会它在哪些事情上说“我不确定”。

在数据体系方面,孙博文提到,行业应该拿出更多智能体实际执行的数据加强人工标注。发现智能体执行有问题,就可以构建成一条训练数据,增加对它隐瞒失败的惩罚、修正失败的奖励。他强调,目前这些数据的积累和相关评测体系都很缺乏。

“考核模型的数学能力、知识能力等有很多评测标准,但如何评估模型的自省能力乃至诚实性,行业总体的关注度是不足的,这确实是仍需发展的领域。”孙博文表示。

智能体如何避免“讨好”陷阱

当前阶段,如何规避模型“讨好”带来的智能体执行风险成了更现实的问题。

“我们做Agent平台使用很多大模型的时候,为了减少静默失败,会在关键配置里强调关键决策、参数补充,要它给出佐证,这是常常提高成功率的办法。”孙博文介绍,训练模型时,团队也会关注诚实性训练,例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证执行成功等各类数据,再去进行训练,训练时还会强调智能体在条件冲突或证据不足时要主动报出来,再做相应的调整。

他透露,团队从年初尝试以这种方式训练某个行业头部智能体平台,最初它执行任务时静默失败的概率是40%,经过系统训练,静默失败率降到了7.7%。

另一个思路是通过多智能体协作网络的设置,降低智能体长程任务中的错误累积。孙博文介绍,蚂蚁此前开源了 Avernet V0.1,通过群组管理、协作模式和可追踪执行等机制组织多智能体协作,并可设置主从模式,自定义编排等模式,帮助协作群管理角色进行检查和纠偏。此外,还可以在智能体群中引入专门工具来判断一些任务执行的好坏。

这意味着,解决大模型和智能体的“讨好”问题,可以从模型训练、Agent系统乃至架构方面多重推进。

此外,郭涛提到,除了模型训练对齐体系的调整、智能体技术机制的完善,行业标准与测评监管维度的优化同样重要,行业需要建立统一规范,将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。

“行业已经在变化。”孙博文告诉记者,从实际体验来看,coding等更接近执行层面的大模型已经在改善“讨好”人类优先任务事实的状况,一些更重视用户付费意愿的对话式AI可能转变慢些,但行业整体在往前走。

“不同团队解决的问题大小不一样,时间上的花费可能也不一样”,他并不确定行业解决这个问题的具体时间表,“但AI界有一个现象还挺好的,大家都认为这个东西有问题的时候,就会有人站出来,一直去尝试解决它。”