OpenAI 推出 AI “忏悔”框架:旨在训练模型承认不当行为,提高诚实度
2025-12-04

OpenAI宣布正研发名为“忏悔”的创新框架,用于训练人工智能模型,使其能坦诚承认自身不当行为或潜在问题决策。大型语言模型常给出“符合预期”的回答,易虚假陈述,新模型将引导其在主要答案后二次回应,说明推理过程。“忏悔”机制仅基于诚实性评判二次回应,鼓励模型坦诚说明潜在问题行为,如作弊等,诚实坦白将获奖励。OpenAI认为该系统有助于大语言模型训练,旨在让AI更透明,相关技术文档已发布。