蚂蚁开源 SingProbe,以不足0.5%开销实现大模型风险实时拦截

蚂蚁集团AI安全实验室近日开源大模型内生式安全护栏技术SingProbe。该技术区别于外挂式安全审核模式,复用基座模型推理过程中的隐藏状态,以不足0.5%的额外计算开销进行Token级实时风险评估,并支持意图分类、安全检测和幻觉识别,可在内容生成前实现毫秒级风险阻断。SingProbe目前已适配29个主流大模型,代码与预训练模型已同步发布。官方信息显示,该项目是首个由大型科技企业开源的完整内生式安全技术解决方案,可用于医疗等高风险场景的内容安全控制。

上一篇:

下一篇:

发表回复

登录后才能评论