蚂蚁发布大模型安全护栏SingProbe
2 小时前

2026年9月14日,蚂蚁集团AI安全实验室发布并开源大模型内生式安全护栏SingProbe。该技术复用基座模型推理隐藏状态,以不足0.5%的额外计算开销,实现token级实时风险评估,适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源大模型,并接入SGLang、vLLM推理框架。SingProbe通过轻量探针在生成过程中逐token实时输出风险信号,实现“边生成边识别”,有效防止违规信息传播。相关代码、模型和评测基准已同步开源,供全球开发者参考使用。