蚂蚁集团AI安全实验室近日开源大模型内生式安全护栏技术SingProbe。该技术区别于外挂式安全审核模式,复用基座模型推理过程中的隐藏状态,以不足0.5%的额外计算开销进行Token级实时风险评估,并支持意图分类、安全检测和幻觉识别,可在内容生成前实现毫秒级风险阻断。SingProbe目前已适配29个主流大模型,代码与预训练模型已同步发布。官方信息显示,该项目是首个由大型科技企业开源的完整内生式安全技术解决方案,可用于医疗等高风险场景的内容安全控制。
蚂蚁集团AI安全实验室近日开源大模型内生式安全护栏技术SingProbe。该技术区别于外挂式安全审核模式,复用基座模型推理过程中的隐藏状态,以不足0.5%的额外计算开销进行Token级实时风险评估,并支持意图分类、安全检测和幻觉识别,可在内容生成前实现毫秒级风险阻断。SingProbe目前已适配29个主流大模型,代码与预训练模型已同步发布。官方信息显示,该项目是首个由大型科技企业开源的完整内生式安全技术解决方案,可用于医疗等高风险场景的内容安全控制。