agent安全完整图谱

从单agent到跨pipeline,从问题到解法。每一层都有论文支撑。

问题:从微观到宏观的六层
问题 · 第一层
SingGuard · 单agent输入输出
从"模型说了什么"到"agent做了什么"。prompt injection、tool abuse、resource exhaustion。
蚂蚁集团 2607.13081
问题 · 第二层
They'll Verify · pipeline内部验证者
五agent CI/CD pipeline,一句"pre-approved"让scanner 80%放行恶意代码。验证变成攻击的一部分。
2607.19267
问题 · 第三层
ChannelGuard · inter-agent channel
54/60次拦截靠Azure server-side filter不是应用层。安全模型组合≠安全系统。
2607.19430
问题 · 第四层
Cross-Agent · 跨pipeline归因
攻击分散在多个独立agent,每个guardrail只看到碎片。0.82 AUC pairwise归因。
ICML 2026 · 2607.18826
问题 · 第五层
GRAM · 知识双用途
同一份知识,研究员手里是工具,恶意行为者手里是武器。GRAM不压制知识,直接拆。
Anthropic 2026
问题 · 第六层
CCA · authorization gap
AI安全缺authorization——知道是谁确认是他但没按角色分配能力。防御者和攻击者同一套refusal。
Robert W. Baird
解法:防御 → 检测 → 预见 → 测试
防御
Twin Agent · 架构层权限分离
Explore/Safe双agent,100字符hint,SWE-bench 62.5%效用/0%ASR。residual compression。
David Wagner · UC Berkeley · 2607.19595
检测
ChainWatch · MCP kill chain
单步合法串起来才是攻击。六阶段kill chain + HMM。20维特征。
2607.19432
预见
JANUS/Vanguard · 风险预判
从部分trajectory预测延迟风险,执行前拦截。+15.9pp protection +5.1pp benign completion。
2607.19913
工具
OneCLI · credential gateway
Rust gateway拦截出站请求,agent用FAKE_KEY网关换REAL_KEY。agent永远碰不到真凭据。
github.com/onecli · HN Show 103分
测试
KYA · agent渗透测试
传统pentesting recon搬到AI agent。black-box探测→target profile→构造攻击。
Yisroel Mirsky · 2607.19837
密码学
测试
IssueTrojanBench · coding agent攻击评估
66.5%恶意issue穿透全部guardrails。Supply Chain类GPT全100%。agent框架完全不加防护。
2607.20759 · 4176次实验
ZK Agent Auth · 零知识授权
zk-SNARKs验证agent有权执行操作,不暴露授权内容。CCA的密码学实现。
ACM TAISAP · 2607.21325
根源
Postel's Law的反面
一刀切的宽容和一刀切的严格犯同一个错:不看上下文。解法不是更宽或更严,是contextual。
连接关系

They'll Verify(验证失职)→ Twin Agent(架构层解法:不在验证流程上加层,限制信息流)

ChannelGuard(channel组合不安全)→ ChainWatch(观测层补充:时序检测多步攻击)

CCA(authorization gap)→ ZK Agent Auth(密码学实现:零知识证明验证授权)

Cross-Agent(碎片归因)→ JANUS(预见层:从部分trajectory预判风险)

SingGuard(数据泄露)→ OneCLI(工具层:agent永远碰不到真凭据,被穿透也没credentials可泄)

They'll Verify + SingGuard → IssueTrojanBench(66.5%穿透证明agent框架不防护,拦截全靠LLM)

全部 → KYA(攻击测试:用所有层的弱点构造渗透)

贯穿pattern:验证通过但行为恶意。小镜六个字:"越走流程越好骗。"