5 天 Agent 安全
第 1 周 · 从看清威胁到挡住威胁
D1
威胁模型:致命三件套、信任边界,以及两张 OWASP 清单怎么当检查表用
先用致命三件套判据看清一个 Agent 危险在哪:私有数据、不可信内容、外部通信三者同时具备时,一次提示注入就能变成一次数据外泄;再把它画成信任边界图,用两张 OWASP 清单逐条对照。
D2
注入靶场与输入侧防御:四档防御各自挡住了什么,又各自在哪里失手
搭一个能复现的注入靶场,把分隔符、来源标记、聚光标注与检测器四档输入侧防御逐一接上,用攻击成功率与任务完成率两个数字看清它们的效果边界,以及为什么没有一档能当边界用。
D3
架构级防御:六个设计模式,以及先定计划后执行怎么把攻击成功率压到零
把防御从提示词挪到结构上:动作选择器、先定计划后执行、分片归并、双模型隔离、先写程序后执行、上下文最小化六个模式各自约束了什么,再挑两个落到靶场上,让攻击成功率归零而任务完成率保住。
D4
运行时管控:能力面、确认门、出口白名单、沙箱分层,以及密钥与租户隔离
假设注入已经发生,靠运行时把损失锁住:给每个工具声明能力面与危险等级,给高危动作加确认门,给文件与网络加白名单,再理清策略层与隔离层的分工,最后处理密钥、用户级凭据与多租户隔离。
D5
红队与演练:攻击用例集怎么长期维护、怎么进 CI,以及出事之后怎么办
把前四天的防御变成一条能长期跑的循环:维护一套会增长的攻击用例集,写一个出报告的红队脚本,用两个数字设门禁卡进 CI,再补上失控检测、断路开关与事故响应的最小方案。