chore(repo): initialize team collaboration repository
This commit is contained in:
@@ -0,0 +1,51 @@
|
||||
# ADR-0004:安全门禁放在控制平面,Agent 保持"笨"
|
||||
|
||||
- 日期:2026-07-27
|
||||
- 状态:已接受
|
||||
|
||||
## 背景
|
||||
|
||||
危险动作有三类:刷固件、Format/Sanitize、断电。任何一次误盘 = PoC 判定失败
|
||||
(方案 §9.3:0 次错盘、0 次系统盘破坏)。
|
||||
|
||||
门禁可以放在 Agent(离设备近,判断准)或控制平面(离决策近,可审计)。
|
||||
|
||||
## 决定
|
||||
|
||||
**全部放控制平面**,且拒绝发生在**下发之前**。Agent 只执行已批准的命令模板 +
|
||||
schema 校验过的参数,自己不做任何"这条命令安不安全"的判断。
|
||||
|
||||
Agent 侧保留的唯一防线是 `precheck`(设备在不在、路径对不对),
|
||||
它是**执行前自检**,不是安全决策。
|
||||
|
||||
## 理由
|
||||
|
||||
- **可审计**:审批记录、模板版本、操作者、参数必须与决策在同一个地方,
|
||||
否则审计链断在 Agent 上。客户安全评审第一个问的就是这个。
|
||||
- **Agent 可信度低**:Agent 跑在客户的测试主机上,那台机器会蓝屏、会被人手动改配置、
|
||||
会装乱七八糟的工具。安全判断不能依赖一个随时可能处于异常状态的环境。
|
||||
- **升级路径**:安全规则改了,改控制平面就全网生效。要靠 Agent 判断,
|
||||
就得推送 Agent 升级到每台客户主机——在实验室里这是以周计的事。
|
||||
- **可测试**:门禁是纯函数(`safety/gates.py`),误盘场景可以在单测里穷举,
|
||||
不需要真的接一块盘来试。
|
||||
|
||||
## 具体门禁(`safety/gates.py`)
|
||||
|
||||
1. **DUT 绑定**:序列号 + 设备路径 + `allow_destructive` 标签三信号一致才放行。
|
||||
任一不匹配 → 拒绝,记 `SAFETY_REJECTED` 事件。
|
||||
2. **系统盘保护**:解析目标设备的挂载点/启动标志/分区表,命中系统盘立即拒绝。
|
||||
这一条**没有** override 开关,代码里不给绕过的口子。
|
||||
3. **命令模板白名单**:危险命令只能来自 `safety/templates.py` 注册表,
|
||||
参数受 JSON Schema 约束。不接受自由文本命令行。
|
||||
4. **环境指纹一致性**:A/B 对比的两次运行环境指纹不一致 → 结论标记为不可比。
|
||||
|
||||
## 代价
|
||||
|
||||
- 控制平面必须掌握足够的设备信息才能判断(依赖 Agent 上报的设备探针数据)。
|
||||
上报延迟 → 判断基于稍旧的数据。缓解:危险步骤执行前强制刷新一次探针,
|
||||
Agent 的 `precheck` 再做一次现场核对,两者不一致直接拒绝。
|
||||
- 多一次往返。危险动作本来就不该快。
|
||||
|
||||
## 什么时候推翻
|
||||
|
||||
不推翻。可以增强(加人工审批门、加双人复核),但不下放到 Agent。
|
||||
Reference in New Issue
Block a user