Innate Safety: SingProbe开源释放内生防护能力

2026年国家网络安全宣传周期间,蚂蚁AI安全实验室正式开源大模型内生式安全护栏SingProbe,同步开放代码、模型与评测基准。该系统通过复用模型推理过程中的内部状态,在生成过程中同步输出风险信号,实现与解码同步运行的安全检测。
核心硬信息如下:
- 发布时间:2026年国家网络安全宣传周期间
- 适配模型数量:29个主流开源大模型
- 适配模型系列:Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等
- 推理框架支持:SGLang、vLLM
- 生产环境实测开销:解码阶段额外开销低于0.5%
- 评测基准:同步开放流式安全评测基准SingStreamBench
技术路径:从外置审核到运行时探针
当前大模型安全防护普遍依赖外置护栏模型,即对输入或输出内容进行独立审核。这种方式通用性强,但需额外处理待审核内容,增加计算与部署成本;若等待完整回答生成后再检查,风险响应可能滞后。
SingProbe的反差在于:实验室评测显示,其flash版本在回答安全分类与流式安全检测任务上超过所选公开基线,而在幻觉检测任务上与参考基线基本持平——这意味着它在不牺牲幻觉检测能力的前提下,实现了对安全风险的更优识别。
该技术本质上属于学界探索的"运行时探针"(Run-time Probe)路径,即在模型内部部署轻量探测模块。SingProbe填补了此前研究到工程落地之间的鸿沟,通过模型适配与推理框架集成,为开发者提供即插即用的方案。
具体工作方式为:模型在解码时,探针同步读取中间层状态,持续输出三项风险评分——用户意图偏离度、回答安全风险、幻觉风险。应用系统无需等待整段回答结束,即可据此触发告警、中止生成或启动重生成。
##SingProbe与外置护栏对比
| 对比维度 | SingProbe(内生式) | 外置护栏模型 |
|---|---|---|
| 检测时机 | 与生成过程同步,解码中实时输出 | 通常在输入或输出阶段触发 |
| 附加开销 | 解码阶段额外开销低于0.5% | 需额外推理流程,成本随检查频率线性增长 |
| 响应延迟 | 低,风险信号随生成实时产生 | 可能需等待完整回答完成 |
| 部署复杂度 | 可集成至现有推理流程 | 需独立部署审核服务 |
##落地路径:医疗场景已实现按需纠偏
研发团队已开展场景验证。在医疗内容生成中,SingProbe-Med仅在风险达到阈值后,对局部高风险内容进行干预。在AntAngelMed-100B医疗评测中,完整干预能够纠正基线模型中25.03%原本出错的回答,证明内生风险信号可用于生成过程的精准纠偏。
项目开放形式完整:
- 代码与集成说明:GitHub开源
- 模型:Hugging Face发布
- 评测基准:SingStreamBench同步上线Hugging Face
SingProbe支持独立部署,亦可与外置护栏联合使用,为开发者提供灵活的渐进式集成路径。
读者落地建议
建议立即尝试的场景:
- 已使用SGLang或vLLM部署大模型服务,需在不显著增加延迟前提下提升安全防护能力的团队
- 在的回答质量中已观察到高频幻觉或安全敏感内容生成的业务场景(如健康咨询、资料问答)
建议再观察的场景:
- 待适配模型未在当前29个支持列表中,且需定制新模型适配到生产环境的团队(可等待后续版本扩展支持)
- 对实时性要求极端严苛(如毫秒级响应)且风险容忍度较高的功能型应用
写在最后
SingProbe的开源标志着安全护栏从"事后补救"向"过程内嵌"的技术演进。当检测开销压低至0.5%阈值以下,内生式防护具备了大规模落地的工程基础,为大模型应用从"能用"迈向"敢用"提供了关键基础设施。

