Featured image of post 蚂蚁开源大模型安全护栏SingProbe:内生式防护,开销低于0.5%

蚂蚁开源大模型安全护栏SingProbe:内生式防护,开销低于0.5%

蚂蚁AI安全实验室开源Run-time Probe技术落地成果,适配29个开源模型,解码阶段额外开销低于0.5%。

Innate Safety: SingProbe开源释放内生防护能力

Innate Safety: SingProbe开源释放内生防护能力
Innate Safety: SingProbe开源释放内生防护能力|新闻截图

2026年国家网络安全宣传周期间,蚂蚁AI安全实验室正式开源大模型内生式安全护栏SingProbe,同步开放代码、模型与评测基准。该系统通过复用模型推理过程中的内部状态,在生成过程中同步输出风险信号,实现与解码同步运行的安全检测。

核心硬信息如下:

  • 发布时间:2026年国家网络安全宣传周期间
  • 适配模型数量:29个主流开源大模型
  • 适配模型系列:Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等
  • 推理框架支持:SGLang、vLLM
  • 生产环境实测开销:解码阶段额外开销低于0.5%
  • 评测基准:同步开放流式安全评测基准SingStreamBench

技术路径:从外置审核到运行时探针

当前大模型安全防护普遍依赖外置护栏模型,即对输入或输出内容进行独立审核。这种方式通用性强,但需额外处理待审核内容,增加计算与部署成本;若等待完整回答生成后再检查,风险响应可能滞后。

SingProbe的反差在于:实验室评测显示,其flash版本在回答安全分类与流式安全检测任务上超过所选公开基线,而在幻觉检测任务上与参考基线基本持平——这意味着它在不牺牲幻觉检测能力的前提下,实现了对安全风险的更优识别。

该技术本质上属于学界探索的"运行时探针"(Run-time Probe)路径,即在模型内部部署轻量探测模块。SingProbe填补了此前研究到工程落地之间的鸿沟,通过模型适配与推理框架集成,为开发者提供即插即用的方案。

具体工作方式为:模型在解码时,探针同步读取中间层状态,持续输出三项风险评分——用户意图偏离度、回答安全风险、幻觉风险。应用系统无需等待整段回答结束,即可据此触发告警、中止生成或启动重生成。

##SingProbe与外置护栏对比

对比维度SingProbe(内生式)外置护栏模型
检测时机与生成过程同步,解码中实时输出通常在输入或输出阶段触发
附加开销解码阶段额外开销低于0.5%需额外推理流程,成本随检查频率线性增长
响应延迟低,风险信号随生成实时产生可能需等待完整回答完成
部署复杂度可集成至现有推理流程需独立部署审核服务

##落地路径:医疗场景已实现按需纠偏

研发团队已开展场景验证。在医疗内容生成中,SingProbe-Med仅在风险达到阈值后,对局部高风险内容进行干预。在AntAngelMed-100B医疗评测中,完整干预能够纠正基线模型中25.03%原本出错的回答,证明内生风险信号可用于生成过程的精准纠偏。

项目开放形式完整:

  • 代码与集成说明:GitHub开源
  • 模型:Hugging Face发布
  • 评测基准:SingStreamBench同步上线Hugging Face

SingProbe支持独立部署,亦可与外置护栏联合使用,为开发者提供灵活的渐进式集成路径。

读者落地建议

读者落地建议
读者落地建议|新闻截图

建议立即尝试的场景:

  • 已使用SGLang或vLLM部署大模型服务,需在不显著增加延迟前提下提升安全防护能力的团队
  • 在的回答质量中已观察到高频幻觉或安全敏感内容生成的业务场景(如健康咨询、资料问答)

建议再观察的场景:

  • 待适配模型未在当前29个支持列表中,且需定制新模型适配到生产环境的团队(可等待后续版本扩展支持)
  • 对实时性要求极端严苛(如毫秒级响应)且风险容忍度较高的功能型应用

写在最后

SingProbe的开源标志着安全护栏从"事后补救"向"过程内嵌"的技术演进。当检测开销压低至0.5%阈值以下,内生式防护具备了大规模落地的工程基础,为大模型应用从"能用"迈向"敢用"提供了关键基础设施。