AIOpsOops:保留诊断关系,隔离不可信遥测文本
这篇论文把运维 Agent 的输入信任问题落到遥测字段:外部请求无需控制内部系统,也可能改变模型理解故障的方式。作者先诊断这种任务相关诱导,再用稳定字段抽象降低风险,同时检查诊断能力是否保留。
运维 Agent 把低权限用户能写入的遥测内容当成故障解释,可能在仍然执行合法修复任务时提出危险操作;只检测显眼的指令覆盖容易漏掉这种诱导。 防御若直接删除所有遥测,会同时破坏根因分析需要的结构和关联信息;需要在移除可控文本的同时保留可用的诊断上下文。
作者构造经应用遥测进入 Agent 的任务相关诱导,并用跨应用、模型和 Agent 的对照测量它如何改变修复建议。 作者先识别可控遥测字段,运行时只把这些字段替换成稳定的带类型标识,保留日志结构与重复值之间的关联。
阅读推荐收起推荐
01 背景与问题
论文针对读取遥测、定位故障并建议或执行修复的运维 Agent。遥测包含应用自己生成的结构,也可能含外部请求留下的用户字段;传统日志防护并不自动保证模型能够区分这两种信息的权限。 §1–3.1,pp.4841–4844;Fig.1
合法任务也会接受不可信的故障解释
日志条目并非每个字段都由系统可信地产生。外部请求中的文本一旦记录进遥测,就可能与错误码和内部诊断材料一起呈现给模型;作者关注的是模型继续努力修复故障,却把这些文本当作解决方案的依据。直接删除整条日志又会损失定位故障需要的关系。 §1–3.1,pp.4841–4844;Fig.1原文依据原文依据
02 文章用了什么方法
先区分诱导方式与投递通道
作者通过用户可控字段进入遥测,构造与当前运维任务相符的故障解释和建议。评价同时覆盖应用、Agent、模型及修复目标,并在固定投递方式下替换成常见指令覆盖形式,以区分这类任务相关诱导与一般触发语的效果。 原文依据原文依据原文依据
用稳定字段抽象保留诊断结构
防御的设置阶段用标记值寻找进入遥测的可控参数,再从这些记录建立带字段标签的模板。严格格式采用 schema,松散日志采用生成的正则表达式,并检查能否正确匹配和提取标记;这些检查提高可用性,但仍是启发式。 原文依据
运行时防御在工具输出进入模型前应用模板,把可控文本改成带类型的稳定标识。相同值在不同记录和运行中仍保留同一抽象名,使关联分析不必接触原始文字;原始遥测仍保存,供人进一步检查。 §5.1.2,p.4853;Fig.9,已本地渲染查看
03 证据支持到哪里
成功指标是建议匹配而非实际破坏
180 次攻击覆盖 36 个配置,每个配置运行 5 次。作者报告 90% 成功率,判定对象是 Agent 输出的修复建议是否匹配目标,由不同模型判断并对约 10% 结果手审。因此它说明决策受操纵,不能直接读成基础设施被破坏的概率。 原文依据
配置矩阵包括3个应用、2类Agent、2个模型和3类目标,各次从重置环境开始并限制为35轮。常见诱导形式的负对照固定在一个应用与Agent/模型组合,不能代表所有配置;逐行检测器对照也只测这一部署口径。论文没有用相同总token预算隔离模型能力与所有上下文策略的贡献。 原文依据原文依据
套用 84、12、132 个模板后,原攻击组中没有成功案例。正常任务对照采用 Flash 和 GPT4.1,12 个任务各运行 3 次,有防御成功17/36,无防御成功18/36;结果支持在该样本中保留大部分任务能力,而非证明所有诊断信息都可以无成本删除。 原文依据
04 总结与启发
AIOpsOops 表明保持合法任务并不能阻止遥测诱导;可控字段的稳定抽象提供了一种保留结构、减少模型接触攻击语义的防御。
我们的理解与启发
把关联价值与文本解释权拆开
这里值得迁移的选择是保留上下文的结构与相等关系,同时移除低权限字段直接解释故障的能力。对于只需知道同一用户或请求是否重复出现的运维任务,稳定标识有明确价值;对于必须阅读用户自由文本才能完成的任务,该抽象会丢失核心语义,因此不能照搬。写操作权限仍需由独立机制约束。 原文依据§5.1.2,p.4853;Fig.9,已本地渲染查看原文依据原文依据
查看证据与分析底稿
原文核验于 2026-09-09 · 问题层级与对应关系属于编辑判断。
将投递通道与语义诱导分开考察,保持合法任务不变而替换被解释的故障信息,暴露把日志内容当修复依据的信任边界。
攻击文本在进入模型前被抽象;相同输入值仍映射同一名称,使跨日志关联可继续使用。其有效性依赖设置阶段覆盖这些字段和模板正确匹配。
core · described · mitigate · 对应问题 P2P1 原文依据§5.1.2,p.4853;Fig.9,已本地渲染查看原文依据
E1 §1–3.1,pp.4841–4844;Fig.1 原文描述
AIOps Agent 将遥测用于根因分析和修复;外部攻击者不具备内部权限,但请求参数能被合法日志或 trace 记录并进入 Agent 上下文。
外部低权限、非自适应攻击威胁模型;已控制工具或供应链属于更强模型。
E2 §3.2–3.5,pp.4844–4848;Fig.2–5;Appendix E 原文描述
攻击框架识别可进入遥测的用户字段;内容保持根因分析任务的表面目标,用貌似合理的故障解释和修复建议误导 Agent,而不是直接要求放弃任务。
机制说明及样例;没有真实生产受害事件,本文不提供攻击执行步骤。
E3 §4.1–4.2,pp.4848–4850;Fig.6–7 作者报告结果
36 配置各 5 次共 180 次实验,覆盖 3 应用、2 Agent、2 模型及 3 类修复目标;ASR 定义为输出修复与预期匹配,o4-mini 判断并手审约 10% 的 20 次;整体 ASR 作者报告 90%。
输出语义匹配并不等于真实执行或基础设施被破坏;每次重置独立 VM。
E4 §4.2.1,p.4851;Appendix B,pp.4858–4859 作者报告结果
固定容易配置下替换为十种标准注入触发语,所测攻击全部失败;检测器逐行分析输入,PromptShields、PromptGuard2 未识别所测攻击内容,DataSentinel 召回 15%。
仅支持所测试配置与逐行检测方式,不能概括全部通用提示注入或全部防御器。
E5 §5.1.1,pp.4852–4853;Fig.8,已本地渲染查看;Appendix C,p.4859 原文描述
防御设置阶段用 canary 标识进入遥测的可控字段,生成模板及参数标签;松散格式使用 LLM 生成 regex,严格格式生成 schema;随机字符替换和匹配反馈检查是启发式。
覆盖依赖端点枚举和 fuzzing;regex 的所有输入正确性没有保证。
E6 §5.1.2,p.4853;Fig.9,已本地渲染查看 原文描述
运行时在遥测抵达 Agent 前匹配模板,把可控参数变成类型标签加唯一标识;同一个值跨运行保持相同抽象名,重组遥测但保留原始日志供人查看。
保留结构和相等关系,移除原始用户文本;未匹配模板不受此保障。
E7 §5.1.3,pp.4853–4854;Appendix D / Table D.1,pp.4859–4860 作者报告结果
三应用分别生成 84、12、132 个模板后,原攻击组未再成功。12 个无攻击任务各 3 次,Flash+GPT4.1 的成功次数为无防御 18/36、有防御 17/36。
所测攻击与小样本任务上的结果;不构成普适防御或零 utility 成本证明。
E8 §5.1.3 和 Ethical Considerations,p.4854;Appendix A.1,p.4858 原文描述
作者承认模板未覆盖、不能结构化的遥测及其他输入渠道可绕过边界;全部实验为隔离合成环境。附录 A.1 正文任务类别与 Table A.1 列标签不一致。
收录结论限于可枚举的结构化遥测入口,不引用该附录类别差异作为有效性依据。