AI Guardrail
AI 防护控制
AI 防护控制是业界统称,用来找出、限制、拦截、修改不安全的 AI 输入、输出或操作,或把它交给人员审核。它不是单一标准工具。
另一个例子
财务助理收到 180,000 元的转账请求,超过 50,000 元的自动执行上限。固定的授权规则会拦截转账并交给人工批准;只在提示中写一句安全规则,不能当作安全边界。
主要部分
- 01明确风险
- 02强制执行点
- 03经测试响应
什么时候用
描述有明确威胁、检查点、处理方式和失败规则,而且能分层测试的控制措施时,可以使用这个词。
什么时候不要用
不要说单个防护控制就能让系统安全,也不要只靠模型不确定的输出来决定授权。
代码里的名称
risk signal → deterministic policy → allow/block/escalate 上线前要检查
检查模型与提示词版本、参考数据、有版本号的评估集与指标。验证答案能否连回来源证据,也要检查工具权限与隐私。再检查常见失败、拒答、安全备用做法与人工复核。也要检查监控、成本、速度与恢复方式。
预期结果:使用或评估 AI 防护控制 (AI Guardrail),让 AI 行为可以衡量,也能连回证据。 用户场景:财务助理收到 180,000 元的转账请求,超过 50,000 元的自动执行上限。固定的授权规则会拦截转账并交给人工批准;只在提示中写一句安全规则,不能当作安全边界。 AI 方法或概念:AI 防护控制 (AI Guardrail)。 适用理由:描述有明确威胁、检查点、处理方式和失败规则,而且能分层测试的控制措施时,可以使用这个词。 不应使用的情况:不要说单个防护控制就能让系统安全,也不要只靠模型不确定的输出来决定授权。 AI 要求:定义输入与参考证据。设置模型和工具权限。使用有版本号的评估数据与指标。说明失败、拒答、隐私、速度与成本限制。 运营防护:保留可查询记录,并隐藏其中的敏感数据。提供用户看得懂的安全备用做法。标出必须由人工复核的步骤,并定义模型或提示词的恢复方式。 验收标准:在有版本号的评估集上记录当前基线与目标。测试边界案例与恶意输入。验证安全备用做法、监控、权限与恢复方式。 证据与限制(证据边界):没有一份官方标准能涵盖全部内容。不同团队、平台或框架的用法可能不同。 待确认:目标任务、模型与版本、评估负责人、参考数据、风险阈值、工具权限,以及生产环境的安全备用做法。
检查这份需求
请 AI 编程助手检查当前如何使用 AI 防护控制 (AI Guardrail)。 定义:AI 防护控制是业界统称,用来找出、限制、拦截、修改不安全的 AI 输入、输出或操作,或把它交给人员审核。它不是单一标准工具。 生产环境检查:检查模型与提示词版本、参考数据、有版本号的评估集与指标。验证答案能否连回来源证据,也要检查工具权限与隐私。再检查常见失败、拒答、安全备用做法与人工复核。也要检查监控、成本、速度与恢复方式。 修改程序前,先列出看到的证据、缺口、严重程度,以及最小且安全的修正。