AIPWN / 决策方法
Agent 安全规则决策:四个可复现示例
以下示例只运行本地确定性规则,不调用语义服务。它们展示真实规则行为,不代表线上 API 的准确率或延迟基准。
01 / 方法
测试范围
四个输入经过 API Schema 验证 → collectTextFields → runDeterministicRules → decide;语义信号设为空对象。高危规则触发 block,中危规则触发 review,未触发规则的示例返回 allow。这是规则与策略版本的行为样本,不是对攻击样本集的统计评测。
线上接口还会处理语义信号、鉴权、限流与故障,因此相同输入的完整 API 返回可能包含其他风险码或决策;Observe Beta 的决策是建议,不会替调用方阻断动作。
02 / 样本
编辑输入,立即重跑规则
此页在浏览器本地运行 API Schema 验证和确定性规则;无需登录、不会发送输入。线上接口还会处理语义信号与账户状态。
01 · 检索内容中的指令覆盖
规则决策:block
风险码:INSTRUCTION_OVERRIDE, SYSTEM_PROMPT_EXTRACTION
02 · 工具请求链路本地地址
规则决策:block
风险码:SSRF_PRIVATE_TARGET
03 · 能力映射之外的工具
规则决策:review
风险码:UNKNOWN_TOOL_CAPABILITY
04 · 普通支持文档内容
规则决策:allow
风险码:[]
03 / 边界
如何复现,如何使用
四个初始输入的决策由当前规则代码在页面内直接计算;你可以修改 JSON 来观察风险码变化。下方的版本号随规则与策略发布版本更新。
这些示例不测线上端到端延迟、误报率、漏报率或语义信号质量;这些指标需要公开样本来源、标注方法、样本量、测试时间和 API 配置后才能发布。规则也可能漏掉改写、混淆或新型攻击,普通文本也可能命中规则。
接入时在调用工具前发送相应事件,记录返回的风险码,让你的应用决定何时提示人工复核或停止执行。