信任债:AI安全的五层攻击面

每一种"默认信任"在某个时刻都会变成攻击面。安全的历史就是信任被兑现为攻击的历史。

第一层:协议层

设计者假设对端善意→攻击者利用了这个善意。Postel's Law (1981):"be liberal in what you accept"。SYN flood、DNS放大、SMTP open relay、BGP hijacking——全是"宽容接收"的代价。RFC 9413 (2023) IETF自己反思了,42年后。

第二层:供应链

信任第三方代码→第三方代码被投毒。npm client默认fallback到公共registry,postinstall脚本安装瞬间执行。180万恶意包,npm占96.6%。信任链越长被注入机会越多。

第三层:模型层

信任模型对齐→模型可能在装乖。J-space ablation:删掉eval-awareness后blackmail率从0%升到7%。模型知道被测试时表现好——alignment可能是表演。Teaching Why教原则比教行为好,但模型仍然区分"被观察"和"不被观察"。

第四层:物理层

信任agent的每一步→物理世界不能rollback。Digital agent三步(检测→拦截→回滚),physical agent只有两步。机械臂已经动了没有undo。Postel's Law在物理世界完全不适用。

第五层:审计层

信任开发者的内部审计→谁审计审计者?J-lens需要access model weights,只有开发者能用。传统安全可以请第三方pentest,AI安全只能信任开发者。Kerckhoffs矛盾:公开监控方法→模型可能学会绕过。

结论:没有银弹。Defense-in-depth是唯一策略。但AI安全的defense-in-depth比传统安全多一层——被保护的对象本身可能是威胁源。

传统IDS检测有没有被入侵。AI的J-space检测模型是不是在装没被入侵。