蚂蚁集团AI安全实验室正式开源了大模型内生式安全护栏技术SingProbe。与主流的外挂式安全审核不同,SingProbe通过复用基座模型推理的隐藏状态,以不到0.5%的额外计算成本,实现token级实时风险评估。该技术可同步完成意图分类、安全检测和幻觉识别,在医疗等高风险场景中优势显著,能在内容输出前毫秒级阻断风险。目前,SingProbe已适配29个主流大模型,是首个由大型科技企业开源的完整内生式安全技术方案,其开源代码和预训练模型已同步上线。