摸

readRecommend

The loop reads agent papers and engineering write-ups every day, checks each against the source, writes it up as problem → design → evidence, then scores it.
Since 07.23: 30 collection days, 294 items, 146 papers and 148 engineering; the pair of problems seen together most is 文件与工件 × 记忆与上下文 (79).

Median82.5
90+66
Last collected09.22
Problem spacecell = items tagged with both problems; click to filter that pair
文工记状身观安运
Rhythmone bar per day; height = count, darker = higher average score; click a day
07.2308.0108.1509.0109.15
lower avghigher avgnone
Problem
Kind
09.22Paper OSWorld-Pro:让最终成败之外的子目标进展可核对Problem桌面Agent即使最终交付成功,也可能在中途做大量无关动作;只检查最终文件无法说明它在哪个子目标停滞、错误来自哪里。Takeaway最终交付能回答有没有做成,子目标过程参照还能指出在哪里停滞以及哪些努力没有推进。本文给出可审查的离线测量链,但过程裁判仍有分层误差,也依赖顺序任务结构。 文件与工件状态与恢复记忆与上下文 75
ProblemP1桌面Agent即使最终交付成功,也可能在中途做大量无关动作;只检查最终文件无法说明它在哪个子目标停滞、错误来自哪里。E1E10
├─measureD1作者把任务拆成顺序依赖的子目标,并让每一步依次标注目标、可行性、进展与首次完成,用人工复核建立过程参照。E2E4E9
├─validateD2作者让裁判读取完整轨迹,一次输出全程标签,再分别对照人类标注核对步骤、子目标和完成比例的误差。E3E7
└─diagnoseD3作者把过程标签汇总成动作进展和子目标投入,区分成功推进、可行却失败,以及在不可行目标上耗费步骤。E6E10
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑采用建议:在已有独立终态验收旁增加离线子目标审计,保留轨迹、子目标定义版本、各层标签及条件分母;将环境不可行、动作无进展和最终交付分账展示。只有步骤依赖明确、可获得人工参照且可承担全轨迹处理成本的任务适合直接借鉴;不要把离线标签直接接成自动取消或权限决定。

Trade-offs

过程可解释性需要人工拆分子目标、复核标签以及读取完整轨迹的高上下文裁判。单调顺序规则限制回访和并行任务;可行性与进展判分弱于完成判分,限制下游故障诊断的精度。模型排行混合harness、reasoning和成本条件,不能用于纯模型或context因果归因。

Where the evidence stops

证据来自305个人工整理桌面任务、67264步标注、人工独立复核和作者报告的judge及actor评测。完成94.3是条件F1;过程诊断受可行性61.9和进展74.7的误差影响。正式actor单次且系统配置不同,不能证明近分显著性、通用在线恢复或纯模型优劣。

09.22Paper 根级授权静止:把递归取消、跨端消息与独立授权保留组成可检查合同Problem长时Agent在收到取消确认后,已委托的任务、消息和提供方预备效果仍可能使用旧授权提交。逐端报告停止无法证明整条授权链已静止。Takeaway在完整注册与可信屏障前提下,退休一份根授权可以被证明不再导致新提交,同时保留精确独立授权的工作。 身份与权限状态与恢复文件与工件 82.5
ProblemP1长时Agent在收到取消确认后,已委托的任务、消息和提供方预备效果仍可能使用旧授权提交。逐端报告停止无法证明整条授权链已静止。E1E2E3E4
├─solveD1作者先在持久账本退休根授权的旧epoch,再由每个效果提供方安装本地提交屏障,并为屏障前已接收的效果保留精确回执。E2E3
└─solveD3作者把提供方叶证书绑定到同一冻结清单,并逐一核对发送与终态确认的消息身份;缺失或冲突保留为无法判定,只有完整闭合才签发根级静止证书。E3E4
ProblemP2共享Agent可能同时拥有可替代授权和必须联合满足的授权。撤销一个根时,直接删除子树会误停独立授权工作,只删除根标签又可能继续使用旧权限。E2E5E6
└─solveD2作者用最小充分授权集合区分可替代授权与联合授权;共享工作只有在操作和效果范围不变、重新选中排除旧授权的当前支持后才能继续。E5E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

采用root/cut/leaf/token的持久身份与三态完成合同,在可控sink处设置fence;共享任务用不扩张操作的原子rebind继续。无法提供完整证据的远端保持未知,不把cancel成功当安全完成。

Trade-offs

安全证书以完整中介、可信适配器、精确token和最小支持来源为代价;永久不透明端点会让签证永久不可用。已接收效果不能回滚,参考实现未给真实提供方集成与规模成本。

Where the evidence stops

条件形式证明加本地文件账本、子进程竞态和作者报告的17案例/44变异;无真实跨提供方接入,证书不等于业务完成或回滚。

09.22Paper EvalMem:把记忆失败分层诊断,并在动态对话中控制可见事实Problem记忆系统答错时,端到端分数不能区分事实没有写入、已经保存却未被检索到,还是模型拿到证据仍未正确使用;诊断检索自身漏召回还会把第二类误判成第一类。Takeaway把记忆失败按实际信息通路拆开,同时以固定语义事实支持动态对话比较,比单一准确率提供更多可操作信息。 记忆与上下文状态与恢复工具与协议 80
ProblemP1记忆系统答错时,端到端分数不能区分事实没有写入、已经保存却未被检索到,还是模型拿到证据仍未正确使用;诊断检索自身漏召回还会把第二类误判成第一类。E1E2
└─diagnoseD1评测分别检查存储内容、原生检索结果及同一模型在oracle证据下的回答,再按条件屏蔽和多标签规则区分编码、检索与生成缺陷。E1E2
ProblemP2固定历史回放忽略Agent回复对后续对话和记忆的影响,但完全自由的动态对话又会让各系统看到不同事实,失去可比性。E3E7
└─measureD2动态评测固定隐藏世界状态、必须暴露的事实和会话末只读问题,让各Agent自由回应,同时追踪并补充尚未出现的必要事实。E3E7
ProblemP3诊断指出检索缺陷以后,仍需要检查同一记忆中的信息换一种检索表述是否有用,避免把分类标签误当成可操作的改进结论。E4E6
└─validateD3MemWiki只从系统自己的记忆导出建立带来源指针的辅助检索表述,再经原检索器、来源展开和重排送回固定数量的记录。E4E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑建议:Agent服务器将native回答、原生检索清单与只读诊断通道分账;仅诊断器可见参考证据。持续对话评测固定语义状态和暴露要求,保留on-policy交互,单独解释评审稳定性、系统变异和成本。MemWiki适用于已有记忆却难以取回的系统,不能替代写入正确性与权限控制。

Trade-offs

诊断store搜索不是穷尽,4.4%残余MISS和同候选池人工审查限制编码归因。oracle回答改善只支持操作诊断,不保证唯一因果。MemWiki固定记录数未固定token或新增构建重排成本;五次复评只覆盖评审随机性。DynaMem是10persona合成任务;跨LoCoMo差异包含题型变化。

Where the evidence stops

作者七个系统、三个任务集和模型条件下的诊断与干预;诊断召回、模拟世界和记录预算仍限制归因与外推。

09.22Engineering Hermes:递归委托的超时、上下文与完成通知边界Problem递归委托会持续等待自己的子任务,通用工具超时却可能先宣告失败;父Agent因此丢失结果并反复轮询仍在运行的后代。Takeaway递归Agent需要把委托存活、父上下文容量和最终结果确认作为三个明确合同;本案例给出可定位的局部修复。 工具与协议记忆与上下文文件与工件 75
ProblemP1递归委托会持续等待自己的子任务,通用工具超时却可能先宣告失败;父Agent因此丢失结果并反复轮询仍在运行的后代。E1E2
└─mitigateD1委托工具退出通用顺序调用超时,继续由委托自己的心跳、失活监视和子任务超时负责存活判断。E2
ProblemP2子Agent回传摘要时,若把累计token消耗当成父会话当前占用,摘要会长期被压到最小长度,父Agent只能依据残缺信息继续协调。E3
└─mitigateD2摘要预算改用父Agent最近一次请求的实际prompt大小,扣除输出预留并在批次内分配;用量未知时只使用静态上限。E3
ProblemP3并行子任务的早期失败需要立即通知父Agent,但临时通知若共用最终结果的确认和去重身份,就可能让稍后的完整结果永远无法送达。E4E5
└─mitigateD3失败子任务先发带任务索引的临时通知,最终结果保留独立的持久确认与去重路径。E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑建议:在可递归委托的服务端harness中明确唯一的存活管理者,以实际接收者上下文分配结果摘要,并把进度/失败提示与终态确认分开建模。迁移前提是已有持久最终结果通道;这些修复本身不提供公平并发预约、外部效果对账或递归取消确认。

Trade-offs

移交超时责任仍依赖委托存活监视;临时失败通知可在进程崩溃时丢失。当前prompt预算是接收上下文估计,不能保证语义信息完整。人工handoff不是自动durable recovery,notice/final分离也未实现child artifact与parent completion原子提交。

Where the evidence stops

证据是一次公开工程回溯、两份已合并PR代码及作者局部探针;不支持整体成功率、人工成本替代率或原子完成保证。

09.22Engineering Cosmos DB Spec Kit扩展:让领域规则进入实现上下文Problem编码Agent即使安装了数据库最佳实践命令,也可能自主跳过调用;知识没有进入实现上下文,插件安装成功便无法转成代码质量。Takeaway扩展的价值取决于规则能否在需要时进入实现上下文。把选择后的规则内联到阶段hook能够减少自主跳过,但现有证据只支持有限的送达与流程改进,不能据此承诺更高整体成功率。 记忆与上下文文件与工件安全与隔离 75
ProblemP1编码Agent即使安装了数据库最佳实践命令,也可能自主跳过调用;知识没有进入实现上下文,插件安装成功便无法转成代码质量。E2E6
├─mitigateD1扩展在实现前读取规格、计划与任务,挑选与当前访问模式有关的规则摘要并直接写入上下文,减少对Agent再次主动调用命令的依赖。E2E3E4
└─mitigateD2扩展把实现前后hook设为非可选,并要求实现后的审查直接修改代码、按同一类别复查,保留未处理警告。E3E8
ProblemP2单独给模型规则后得到的合规分,不能说明同一扩展在完整自主开发流程中是否有效;内容价值、实际送达和应用结果容易被混成一个收益。E5E6E7
└─measureD3作者分别比较规则有无、原扩展与修改版的完整工作流,并结合轨迹调用率和行为测试结果判断内容是否有用、是否送达以及是否形成应用收益。E5E6E7
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:可在服务端编码Agent中复用通用阶段循环,让领域扩展读取当前任务材料、选取并注入带版本的规则摘要,再由实现后审查给出修改及未处理警告。这里的版本记录是迁移建议。权限及外部副作用仍应由宿主既有机制控制,不能把模型自查当授权边界。运行观测应分别保留内容曝光、命令调用与任务结果,避免用安装数或局部合规分代替实际效用。

Trade-offs

内联摘要提高送达覆盖,也使规则选择和修复依赖宿主阶段执行与模型判断。新版联合修改三处,不能拆出单个hook收益;实际应用对SDD无扩展基线仅有小幅差异。预览版本未给持久恢复、热更新隔离或不可绕过授权合同。

Where the evidence stops

固定v0.2.0配置和提示、作者启发式规则测试、六场景中五个有提升空间场景的两模型SDD行为对照及调用轨迹;不含跨宿主强制执行、长期恢复或完整成本证明。

09.21Engineering Browser Use:用持久代码与自主观察拆开浏览器能力和Agent循环Problem浏览器Agent只能调用预设点击、输入和滚动动作时,跨步骤操作需要不断增加特例;动作组合被接口限制,长任务更依赖框架补丁。Takeaway浏览器Agent的限制不只来自动作数量,还来自谁决定模型能观察到什么。持久代码和按需观察把两种选择交还给Agent,通用循环承接周转;宿主仍须承担执行隔离与外部效果恢复。 工具与协议状态与恢复文件与工件 75
ProblemP1浏览器Agent只能调用预设点击、输入和滚动动作时,跨步骤操作需要不断增加特例;动作组合被接口限制,长任务更依赖框架补丁。E2
├─mitigateD1作者用保留变量和函数的代码执行环境替代固定动作菜单,让Agent自行组合、循环和复用浏览器操作。E2E4E5
└─mitigateD3BrowserUsePi把浏览器代码执行接到Pi循环,复用循环和上下文处理,并分别暴露worker重置、部分结果与完成校验边界。E3E5E6E7E11
ProblemP2浏览器Agent若只收到预先抽取的可点击元素,页面上存在的控件也可能对模型不可见;模型无法主动换一种观察方式来补齐信息。E2E4
├─mitigateD2作者开放DOM、截图、可访问性快照和浏览器调试协议,使Agent能根据缺失信息选择并生成下一次观察,而不必依赖唯一的预制页面表示。E2E4
└─mitigateD3BrowserUsePi把浏览器代码执行接到Pi循环,复用循环和上下文处理,并分别暴露worker重置、部分结果与完成校验边界。E3E5E6E7E11
ProblemP3浏览器框架同时维护专用Agent循环时,还要独自承担压缩、取消和完成处理的错误,浏览器改进与长循环维护相互牵制。E3E5
└─mitigateD3BrowserUsePi把浏览器代码执行接到Pi循环,复用循环和上下文处理,并分别暴露worker重置、部分结果与完成校验边界。E3E5E6E7E11
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:在有隔离环境和宿主控制面的浏览器Agent中,将循环、持久代码执行和观察生成分成清楚接口,暴露stateReset、checkpoint和完成验证。适用前提是代码能力与浏览器权限可控;外部副作用对账及跨任务原子完成仍由服务端协议负责。

Trade-offs

开放程序与观察减少接口特例,但增加代码执行权限、模型编程能力和观察预算责任。worker不是安全沙箱,取消只重置部分状态。作者工程对照小且多因素联动,不支持普遍成功率、费用或延迟结论。

Where the evidence stops

机制由官方工程案例与固定Pi源码支持;token对照仅为Hermes的6任务、每格3次、特定模型和网站条件,不分离CDP、代码批处理与schema各自效应。

09.21Engineering Kortix:替换Agent循环时保留权限与工具边界停止Problem在已有Agent产品中替换执行循环时,新harness的消息、权限和停止行为可能偏离宿主已有语义,导致界面仍可用而控制边界失效。Takeaway替换Agent循环需要显式迁移权限、消息和停止语义。Kortix给出了可检查的宿主/适配器分界与工具边界中断;其局部会话连续性不等于完整崩溃恢复或副作用撤销。 工具与协议身份与权限文件与工件 75
ProblemP1在已有Agent产品中替换执行循环时,新harness的消息、权限和停止行为可能偏离宿主已有语义,导致界面仍可用而控制边界失效。E1E2E3
├─mitigateD1宿主保留认证、事件总线和环境服务,把Agent循环封装为具名端口后的适配器;会话启动时选择Pi,并在适配器内转换消息及接入原权限规则。E2E3E4E5
└─mitigateD3适配器从同一wire表示提供列表与流,在轮次结束时保存模型消息、显示记录和完成轮次,正常重启后恢复该快照。E7E8
ProblemP2用户要让新输入接管运行中的Agent时,直接取消可能中断工具;迟到的取消请求又可能误伤后续轮次,因此停止必须识别具体会话、轮次和工具边界。E6E11
└─mitigateD2工具边界停止请求绑定会话与当前轮次,等待运行中工具结束后停止循环;过时请求和已撤销请求不停止新轮次。正常路径先发布工具结束帧,但转换失败仍会停止。E6E11
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:适合已有会话控制面的单沙箱服务替换底层Agent循环,采用宿主职责、明确端口、真实pre-tool权限和身份绑定中断。若要求失败时拒绝,应改变缺规则/非法policy的默认;需要崩溃中途恢复或副作用对账时另有持久协议,不能据此宣称现成能力。

Trade-offs

同进程降低启动开销但没有adapter故障隔离;旧OpenCode wire是过渡格式;默认allow保持兼容;pending交互仅内存,轮次快照不覆盖在途效果,Pi扩展、compaction与subagents不支持。

Where the evidence stops

证据覆盖9月18日官站公告、9月17日合并PR固定实现、脚本化权限/中断/正常重启用例与作者五会话echo启动案例,不覆盖社区扩展、复杂任务成功率、在途崩溃或远端效果对账。

09.21Paper GAUGE:分开核验满意度、任务成功和近分候选排序Problem模拟用户和judge得到的高满意度,可能只证明会话听起来有帮助,而没有证明任务完成;用人类满意度校准也可能保留这个盲区。TakeawayGAUGE把体验校准、任务完成与近分版本选择拆开,使高总体相关性不再直接成为上线保证。它提供测量与拒判边界,未修复Agent本身。 观测与评测文件与工件工具与协议 75
ProblemP1模拟用户和judge得到的高满意度,可能只证明会话听起来有帮助,而没有证明任务完成;用人类满意度校准也可能保留这个盲区。E2E4
├─measureD1作者为同一会话分别记录满意度、能看到任务与工具证据的模型评分,以及任务完成判据,检查体验认可是否对应真实完成。E3E4
└─mitigateD3作者将自然终止位限制为截断报警,并对judge差距落在采样噪声内的比较保留拒判;模型或模拟器变化触发重新校准。E5
ProblemP2跨强弱模型得到很高的排序相关性,仍可能无法分辨上线时常比较的相近版本;把总体相关性用于小幅升级决策可能选错版本。E2E4
├─diagnoseD2作者将成功率相近的候选版本对与差距较大的版本对分开计算排序分歧,再用预算退化、更换评分模型和用户模拟器检查诊断的适用范围。E3E4
└─mitigateD3作者将自然终止位限制为截断报警,并对judge差距落在采样噪声内的比较保留拒判;模型或模拟器变化触发重新校准。E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:可把Agent发布评审的数据合同分成体验评分、任务完成证据、配置级比较与拒判原因四部分。近分版本不得仅凭全池相关性自动晋级;结束位仅作为截断信号,适用于已有可核验业务终态或动作记录的系统。

Trade-offs

近分31%是相对有限样本oracle排序的分歧而非真实部署后悔率;其CI较宽。retail oracle并非纯非LLM,必须与airline分开。completion bit不覆盖大多数正常结束的语义失败;拒判以覆盖率换错误率。

Where the evidence stops

作者证据来自合成τ²客服任务、25配置网格、受控退化和小规模盲人类panel;retail含LLM子判据,真实客户和近分真实排序仍有限。

09.21Paper SkillAlign:固定技能集合,比较它们如何进入上下文ProblemAgent拿到相关技能后,全文注入仍可能增加干扰或遗漏当下所需信息;只优化检索无法判断同一技能应该怎样进入当前上下文。TakeawaySkillAlign将“选什么技能”与“怎样展示所选技能”分成两个决策,提供同候选接口比较。证据支持展示方式是独立变量,未证明一种压缩方式或学习策略普遍最优。 记忆与上下文身份与权限安全与隔离 75
ProblemP1Agent拿到相关技能后,全文注入仍可能增加干扰或遗漏当下所需信息;只优化检索无法判断同一技能应该怎样进入当前上下文。E2E3
├─mitigateD1作者在技能提供者与Agent之间加入展示层,保留原始技能并生成提醒、带适用条件的摘要和有顺序的流程视图,也允许不展示。E3
└─measureD3作者利用固定接口的任务结果生成展示选择标签与偏好,在独立辅助环境上训练轻量策略,再用固定轨迹回放测量选择空间。E5
ProblemP2技能方法的成绩变化常混合了候选质量、文本长度和展示结构;若不固定任务、模型与技能集合,就无法归因于上下文接口。E2E4
└─measureD2作者固定任务、Agent后端、候选技能ID和顺序,只替换展示接口,并用无技能、近似等长普通摘要和保真审查区分接口效果。E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:可将技能提供、视图生成和实际上下文装配分成独立接口,保留原文、来源、候选ID/顺序、视图版本与渲染长度。适用于需要比较技能呈现策略的harness;展示提示不形成权限强制层,安全关键动作仍由原有执行边界决定。

Trade-offs

压缩不普遍胜过全文;生成视图仍有任务相关遗漏。表中C是渲染技能文本长度,超长条件会截断或拒绝,不等于实际输入账单。bootstrap只覆盖任务抽样,不覆盖模型运行随机性;策略是离线回放,不能宣称已在线自适应。

Where the evidence stops

两套任务、三后端、固定provider候选的原文结果及局部等长/保真检查;未覆盖在线策略、完整计费和运行随机性,库来源泄漏控制细节有限。

09.21Paper REST:用位置平衡的多问题输入诊断共享上下文压力Problem单题分数无法说明模型在同一次调用中处理多个子任务时是否会漏答后题,或把前题思路带入后题。用单题高分选择批量上下文策略可能高估可靠性。TakeawayREST把“单题会做”与“多个问题共享上下文时仍能逐项完成”分开测量。位置平衡、逐项判分和失误分类可以成为批量任务的诊断层,但不提供上下文隔离的已验证修复。 记忆与上下文观测与评测工具与协议 75
ProblemP1单题分数无法说明模型在同一次调用中处理多个子任务时是否会漏答后题,或把前题思路带入后题。用单题高分选择批量上下文策略可能高估可靠性。E2E3
├─measureD1作者用循环窗口把原题组成不同大小的问题组,让每题在每个位置各出现一次,再比较同一模型的单题与多题逐项正确率。E2
└─diagnoseD2作者把失误分成漏答、汇总错误、推理错误、格式违规、重复和截断,并结合每个位置的正确率与推理token分配解释压力曲线。E3E4
ProblemP2多题分数下降可能来自推理干扰,也可能来自输出截断、答题格式或答案提取;只有一个总分无法区分这些原因。E3E4
├─diagnoseD2作者把失误分成漏答、汇总错误、推理错误、格式违规、重复和截断,并结合每个位置的正确率与推理token分配解释压力曲线。E3E4
└─validateD3作者分别改变答案提取器、提示、采样设置和输出上限,检查分数下降是否只由评测接口或生成限制引起。E4E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:可把REST的任务身份、原答案、组大小、题目位置和逐项输出映射到Agent批量子任务的上下文装配评审。它提供何时出现遗漏或相互干扰的诊断材料;是否拆分调用、隔离上下文或重新分配预算是应用层采用判断,本文未证明任何具体修复方案的收益。

Trade-offs

沿用公开原题减少新增标注,却保留训练污染风险;循环平衡位置并未穷举同伴组合。每次调用固定32K输出上限由多题共享,不能视为逐题等预算。提取器可改变分数,延迟随压力增加,注意力和不同训练模型的比较不支持单机制因果归因。

Where the evidence stops

证据来自九个公开文本推理题库和三十余模型;预算扩展只覆盖两种蒸馏模型,提取、重复运行和延迟材料均有具体设置范围。没有真实Agent状态恢复或部署成功率证据。

09.21Paper Monotonic Scaffolding:逐层提供正确信息,分开测量依赖与稳定性Problem同一道题最终答对,不能说明模型原本就会,还是必须先给出规则和解释。终点分数隐藏了模型对不同上下文材料的依赖。Takeaway逐层提供正确材料能把信息需求与答案稳定性分开观察。论文给出了可追溯的条件序列和探索性题目画像,但Stable Accuracy衡量的是这套指导条件下的持续正确,不能替代真实推理能力。 记忆与上下文文件与工件状态与恢复 75
ProblemP1同一道题最终答对,不能说明模型原本就会,还是必须先给出规则和解释。终点分数隐藏了模型对不同上下文材料的依赖。E2E3
└─measureD1作者把专家题解整理为事实、争点、法律标识、规则正文、应用和结论,并逐层提供给同一道题,记录首次出现正确答案的位置。E2E3
ProblemP2模型在某个条件下答对后,加入更多正确材料仍可能让它答错;只看终点平均分会漏掉这种上下文稳定性问题。E3E4E5
└─diagnoseD2作者保留每题在各指导条件下的对错序列,分别记录首次答对与之后的首次复错;稳定准确率只计入从无指导开始就答对、且所有后续条件都答对的题目。E3E4
ProblemP3不同法律题目需要的指导材料可能不同,整体平均分无法区分普遍困难与特别依赖规则、应用说明的题目。E6
└─diagnoseD3作者对题目在各指导层的结果做主成分分析,探索整体难度与对规则、应用及结论材料依赖的不同分布。E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:适合具有可信分层参考材料的知识问答、规则解释或Agent上下文装配诊断。保留任务真值、材料层和版本、每层输出、首次成功及复错位置,将无辅助正确率、指导依赖和持续正确分别展示。它不能签发在线法律判断、权限或完成凭据,也不证明真实Agent长期恢复。

Trade-offs

每道题需要多种条件的调用和可靠专家题解;输入长度与语义结构一同变化。S2E的无退化0与正间隔混合,不能按同一越小越稳刻度解释;最高层给出结论是有意的oracle信息,不能当无辅助能力。打散对照保留边际准确率却也破坏题目难度关联。

Where the evidence stops

证据覆盖3,123道巴西葡语法律选择题、17种模型设置、作者三次采样多数投票与打散对照;材料长度、自动结构化、单域样本和S2E解释冲突限制外推。

09.21Engineering SuperQode Jev:由问题包提供判断,由宿主组合权限与完成状态Problem编码Agent自主提出的命令可能符合工具名权限,却偏离当前任务或携带破坏、外传语义;将这类判断交给自由生成结果,又会模糊模型建议与硬策略的优先级。Takeaway可替换的语义决策扩展应提供受约束的判断,由宿主代码决定权限与完成状态。SuperQode展示了这条职责边界及不同故障语义;它增加可审计的裁决接口,没有证明分类器正确或外部任务已经完成。 工具与协议状态与恢复运行时与调度 75
ProblemP1编码Agent自主提出的命令可能符合工具名权限,却偏离当前任务或携带破坏、外传语义;将这类判断交给自由生成结果,又会模糊模型建议与硬策略的优先级。E1E6E8
├─mitigateD1把人审的问题、输入约束和阈值冻结成带版本与内容hash的问题包;决策客户端只回答预定类型,控制流仍由宿主代码拥有。E4E5E9
└─mitigateD2在native工具执行前先尊重确定性拒绝,再由代码组合风险与任务判断;主动弃权要求审批,扩展不可用则显式回退原权限策略。E6E7E8
ProblemP2判分扩展的低置信、调用失败与真正通过若混成一个状态,编码任务就可能在缺少有效判断时被宣布完成;普通非空回答检查也会掩盖这一缺口。E1E10E11E12
├─mitigateD1把人审的问题、输入约束和阈值冻结成带版本与内容hash的问题包;决策客户端只回答预定类型,控制流仍由宿主代码拥有。E4E5E9
├─mitigateD3把一般决策的弃权和rubric的未评分保留为独立结果,修订循环有上限;headless仅在rubric满足时保留成功状态。E9E11E13E8
└─measureD4用有类型的标签与拆分数据记录通过、失败、弃权和未评分,另标记仅检查非空的旧冒烟任务。E10E12
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:适合宿主确实拥有工具循环、已有可信硬策略而需要补充语义裁决的系统。将不可覆盖deny、可替换分类器和最终执行分开,记录pack版本/hash、模型、故障原因及实际生效策略。服务端若需要故障时强制审批,应显式改变组合策略;不能把本实现的回退当成已有拒绝保证。评分结果与外部效果收据分存,外部Agent仍需自己的执行前接入点。

Trade-offs

语义门额外依赖托管服务、配置与网络;出错回退旧策略保留可用性,也保留旧策略的自动放行。pack按ID缓存,没有热加载/隔离/跨会话迁移协议。概率和args_plausible只是模型判断;rubric仅看裁剪文本,不能证明工具真实完成。外部ACP runtime不在控制范围。

Where the evidence stops

证据是9月18日维护者文章与v2.4.0固定实现,覆盖native权限组合、一般决策和headless判分映射。单条live示例和小型合成标签不支持生产安全率、阈值校准、外部ACP覆盖或等成本优势。

09.20Engineering Google Mantis:局部威胁上下文、快照来源与跨变更审查Problem安全Agent仅看到局部代码或失鲜威胁文档时,难以判断一条可疑路径是否符合当前部署边界,容易把上下文缺失当成漏洞或安全结论。Takeaway把代码版本、局部威胁模型和审查覆盖一起交给Agent,可以让上下文缩减更可解释;小变更快扫仍需跨变更深扫和独立裁决。可迁移的是上下文合同,生产效果与强制执行能力不能由技能文本推出。 记忆与上下文安全与隔离文件与工件 75
ProblemP1安全Agent仅看到局部代码或失鲜威胁文档时,难以判断一条可疑路径是否符合当前部署边界,容易把上下文缺失当成漏洞或安全结论。E1E3E5
├─mitigateD1作者用代码元数据和架构、实体知识生成局部威胁上下文,并在公开技能协议中记录快照来源、归档旧模型及限制失鲜结论的用途。E1E3E5
└─mitigateD2作者借助调用图扩展需要检查的上下文;公开协议要求保留索引覆盖信息,与词法检索取并集,禁止把空索引当作不可达证明。E1E4
ProblemP2逐次变更扫描可以缩短上下文和等待时间,却可能遗漏多个变更共同形成的漏洞;开发、扫描与裁决共用上下文还会传播同一种判断偏差。E2
└─mitigateD3作者将单次变更的快速扫描与夜间聚合变更的深扫连接到独立triage,再把修复提案送回人工审查;各角色分别使用自己的规则和上下文。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:适用于持续变化且需要局部威胁背景的代码审查Agent。将源代码版本、KB版本、索引覆盖、finding来源和裁决状态分开保存,派生上下文用于导航,缺失或失鲜时保留不确定结论。采用前提是能维护可信代码快照和领域边界;仅有文本技能而无host约束时,不应赋予自动关闭风险或自动合并权限。

Trade-offs

上下文构建需要维护代码元数据、领域规则与快照关系。公开结构索引会退化到词法检索,threat-model依赖上游KB;MODE-OFF及显式target_root存在例外。博客内部部署、开源技能协议和模型外强制实现是不同证据层,不能互相等同。

Where the evidence stops

依据为Google内部工作流描述、架构图和固定版本公开技能协议;生产数字未披露样本及归因对照,公开协议有退化模式,也未证明所有host实际执行这些约束。

09.20Engineering CC-Gen与CAP-CPT:政策结构、规则适应性和内化训练分开评估Problem只看策略文档长度或模型总分,无法知道任务集合、参数负担和条件分支变化怎样影响业务工具Agent;混入用户模拟器错误还会使政策推理成绩失真。TakeawayCC-Gen让政策结构与内化后的规则适应性成为可单独检查的对象。作者方法能改善某些内化基线,却未保住完整上下文的全部更新能力;更适合迁移分项评测,而不是据压缩率直接选择训练方案。 工具与协议记忆与上下文文件与工件 72.5
ProblemP1只看策略文档长度或模型总分,无法知道任务集合、参数负担和条件分支变化怎样影响业务工具Agent;混入用户模拟器错误还会使政策推理成绩失真。E1E2
└─measureD1CC-Gen从数据库与政策模板生成可调任务和条件深度,再生成查询、gold动作与步数筛选,用全轨迹成功和条件参数准确率描述失败。E1E2
ProblemP2政策内化后的普通任务成功率不能说明模型能否接受新政策、覆盖旧条款或解释规则,因此输入变短可能掩盖规则适应能力的损失。E3E4E5
└─diagnoseD2作者把普通任务、整篇政策替换、局部规则覆盖、政策问答和通用指令遵循分开评测,比较完整政策上下文与内化后的policy ID条件。E4E5E6
ProblemP3只用成功推理与工具轨迹来内化政策,需要大量标注轨迹,且复杂条件下仍容易失败;有限轨迹不能充分展示不同规则该怎样应用。E3E4E5
└─mitigateD3CAP-CPT先按事实、行为和条件复杂度组织政策训练材料,再用policy ID提供调用入口,并结合继续预训练与轨迹SFT学习应用规则。E3E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:适用于评估是否压缩或内化经常变化的业务政策。保留policy版本、生成因素、gold动作、后续替换/覆盖内容与各自判据,把完整上下文作为对照,任务、更新、解释和成本分别记录。可迁移的是评测接口及取舍,不是把动态规则全写进权重;生产授权仍需模型外策略承担。

Trade-offs

Task把任务数和参数数耦合,未做等token隔离;训练组额外CPT数据可远多于SFT横轴。所有实验单次运行,主测试量、去重和推理预算披露不足;referral judge未校准且量纲冲突,覆盖范围和有效期也不够完整。

Where the evidence stops

证据为合成数据库/政策任务、多模型复杂度表、两种Qwen内化比较及改写Retail任务;全部单次运行,测试与预算口径、任务耦合及未校准referral judge限制因果和部署外推。

09.20Paper 压缩保真与信息使用:固定记忆上的解码训练及分项诊断Problem压缩模型能够重建原文,并不保证回答问题时能正确使用压缩表示;仅按重建分数验收,会漏掉生成过程中的信息混淆。Takeaway这项工作把压缩表示的保真与生成时的信息使用分开,展示固定编码后训练解码器能改善若干QA任务,并伴随更频繁的局部原文重建。采用价值同时在压缩组件与分项诊断;效果和成本结论都要限定到作者的模型、任务和缓存条件。 记忆与上下文身份与权限文件与工件 75
ProblemP1压缩模型能够重建原文,并不保证回答问题时能正确使用压缩表示;仅按重建分数验收,会漏掉生成过程中的信息混淆。E1E2E3
├─mitigateD1作者把固定文本块压成连续记忆向量,并在保留SFT编码结果的条件下训练解码器,以答案正确性为主要奖励并施加超长输出惩罚,让生成过程更常展开原文片段。E1E2E3
└─diagnoseD2作者分别测量原文重建、问答结果、不同长度阈值的逐字片段重建和跨区域取用,再用引用模板监督、另一模型家族与另一judge检查结论范围。E3E4E5E6
ProblemP2压缩后的任务总分和名义压缩倍数无法说明模型如何取用信息,也会掩盖输出、边界标记与预编码成本,使方案比较失真。E4E5E6E7
├─diagnoseD2作者分别测量原文重建、问答结果、不同长度阈值的逐字片段重建和跨区域取用,再用引用模板监督、另一模型家族与另一judge检查结论范围。E3E4E5E6
└─measureD3作者把表示压缩率与实际解码器序列缩短分开计量,并明确首token时延只在记忆向量已经预计算缓存的条件下测得。E7
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:适合可以缓存并反复查询稳定长文档、且掌控模型输入表示的服务。可独立迁移的评测原则是将重建保真、任务结果、取用行为和实际成本分账。动态工具输出频繁变化时,编码成本未摊薄,不能直接套用TTFT收益;本文也未提供session更新、租户隔离或外部副作用恢复协议。

Trade-offs

需要可修改encoder/decoder的模型栈和额外训练,不能直接应用到只接收文本的封闭API。完整上下文使用Instruct,作者模型从Base训练;跨家族采样与训练预算不一致。逐字重建只是行为诊断,缺少隔离其因果作用的对照。双judge未做人类校准,QA多seed、近重复审计与区间未报告。

Where the evidence stops

依据为八组8000题QA、长上下文任务、重建和行为统计、CoT/跨家族/双judge对照及预编码缓存成本表。没有单独干预重建行为的因果证据,也未覆盖长程Agent工具执行或动态上下文维护。

09.18Paper SoL-Pi:用递归自动研究把harness开销变成可验证机制Problem长轨迹中的重复动作、工具观察和上下文重放会累积成本,而固定工作流或膨胀协调代码难以在多环境发现可复用机制。TakeawaySoL-Pi的增量是受控地搜索和编译harness机制,而不是简单压缩prompt;它把效率与证据保持放进同一选择门槛,但组合损失和治理依赖仍需显式记录。 观测与评测身份与权限记忆与上下文 92.5
ProblemP1长轨迹中的重复动作、工具观察和上下文重放会累积成本,而固定工作流或膨胀协调代码难以在多环境发现可复用机制。E1E2
├─solveD1作者用可丢弃最小skill loop和隔离的auto-research流水线连接提案、实现、审查、轨迹内验证与held-out验证。E1E2
└─mitigateD2作者把Action Fusion、Online Context Compact、ObservationPack和Evidence-Preserving Reducer固化进harness循环。E3E4E5
ProblemP2成本优化若没有能力门槛和held-out边界,会奖励提前停止、跳过证据或记住训练任务。E2E6
├─solveD1作者用可丢弃最小skill loop和隔离的auto-research流水线连接提案、实现、审查、轨迹内验证与held-out验证。E1E2
└─mitigateD2作者把Action Fusion、Online Context Compact、ObservationPack和Evidence-Preserving Reducer固化进harness循环。E3E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

服务器可采用可丢弃候选loop、训练/held-out隔离、能力与效率双账本,以及动作确定性、可寻址压缩、逐行证据收据三个运行时合同;自动搜索不应默认获得生产控制面写权限。

Trade-offs

SoL-Pi把harness改进变成带能力门槛和隔离验证的候选搜索,并把动作、context、观察和委托机制一起编译到循环。

Where the evidence stops

证据覆盖535个搜索环境、51任务EdgeBench和限定paired/swarm,支持机制及作者报告的成本趋势,不支持普遍迁移或完全自主RSI。

09.18Paper How Do Agent Harnesses Create Value:把计划、终态验收与风险价值拆开Problem单一成功率无法归因计划信息、终态验证与模型能力,错误放行和正确结果被混在一个指标中。Takeawayharness价值应分开测量计划内容带来的执行收益、终态检查减少的错误放行及成本,再在明确责任损失下比较配置。 状态与恢复观测与评测记忆与上下文 100
ProblemP1单一成功率无法归因计划信息、终态验证与模型能力,错误放行和正确结果被混在一个指标中。E1E2E3
└─measureD1作者用等词数、等包装的Fixed–Sham配对和任务聚类bootstrap估计任务特定计划信息的增量。E2E3E4
ProblemP2验证器会拦截错误完成,也会误拒正确完成并产生推理成本;缺少统一状态和责任协议就无法比较harness。E2E5E6
└─diagnoseD2作者把oracle正确性、完成声明、终态拒绝和增量成本做成状态矩阵,再按success价值与误放行责任损失计算条件harness价值。E2E5E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

服务器应把计划版本、执行轨迹、环境事实、完成声明和发布决定分账;按业务责任选择V/L和阈值,Verifier只读且拒绝后的修复另建状态。

Trade-offs

本文用配对内容控制、oracle/acceptance分离和责任加权,把计划收益、错误放行和成本从同一个成功分数中拆出来。

Where the evidence stops

证据来自τ²-bench Retail/Airline作者报告,支持限定环境中的组件归因和条件价值,不支持副作用回滚或部署总成本保证。

09.18Paper Inference-Engine Fingerprinting Attacks:把推理engine纳入Agent沙箱边界Problem模板、tokenization和采样差异可把推理引擎身份泄露给模型,使只隔离代码与工具的沙箱遗漏必经高权限攻击面。Takeaway推理engine必须与代码沙箱、工具服务器一样被视为Agent运行时边界;多轮harness反馈可放大实现差异,因此最小权限、隔离和审计要覆盖模型推理本身。 身份与权限安全与隔离工具与协议 87.5
ProblemP1模板、tokenization和采样差异可把推理引擎身份泄露给模型,使只隔离代码与工具的沙箱遗漏必经高权限攻击面。E1E2E3
├─diagnoseD1作者用多轮输出probe和反馈分析组成fingerprinting协议,测量五类engine在模板、tokenizer、sampling和detokenization上的可观察差异。E2E3
└─mitigateD2作者把推理engine纳入纵深防御,提出标准化行为、多进程最小权限、engine VM、隐藏身份和memory-safe解析/内核边界。E4E5
ProblemP2self-refine、ReAct和子Agent反馈能累积probe并选择版本特定路径,因此engine解析器、GPU kernel和宿主权限需要独立最小权限边界。E3E4E5
├─diagnoseD1作者用多轮输出probe和反馈分析组成fingerprinting协议,测量五类engine在模板、tokenizer、sampling和detokenization上的可观察差异。E2E3
└─mitigateD2作者把推理engine纳入纵深防御,提出标准化行为、多进程最小权限、engine VM、隐藏身份和memory-safe解析/内核边界。E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

服务器应按租户/会话隔离engine权限,限制网络、文件、GPU管理和宿主服务可达性,对多轮probe做外部限速和异常审计;优先API一致性和最小权限/VM隔离。

Trade-offs

本文把推理engine从可信底座改写为Agent攻击面,要求harness安全边界覆盖模型输出、解析器、GPU和宿主控制路径。

Where the evidence stops

证据来自五引擎差异、有限probe和受控PoC作者报告,支持威胁建模和防御优先级,不证明所有engine均可稳定指纹或生产链可复现。

09.18Engineering BIRCH:用图像纠错和候选条件化锚点拆开评审偏差Problem视觉评审的总体准确率不能揭示模型是否真的使用图像,也不能区分正确性与信息量偏好。TakeawayBIRCH 把视觉评审偏差从总体准确率中拆出,并用候选条件化纠错 anchor 缓解信息量偏好;它适合作为静态工件评审的诊断与上下文组件,不是长期 Agent 成功或安全保证。 文件与工件身份与权限安全与隔离 75
ProblemP1视觉评审的总体准确率不能揭示模型是否真的使用图像,也不能区分正确性与信息量偏好。E1E3
└─measureD1作者用有图/无图差异、IDS/CDS 分组、长度配对和重复下采样把视觉使用、信息量偏好与正确性驱动判断分开测量。E1E3
ProblemP2错误或缺失的候选细节会让参考答案与最终选择同时偏向更丰富文本,单一参考答案无法稳定约束候选条件化比较。E2E5
└─mitigateD2BIRCH 以图像纠正每个候选并合并为 anchor,再让最终 judge 带着原图、原候选和 anchor 重新比较。E2E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:为多模态 judge 保存图像版本、候选哈希、纠正理由、anchor 来源和最终选择,将视觉证据使用与文本丰富度偏好作为不同事件字段;anchor 只能是可追溯参照,不能充当完成或授权凭据。

Trade-offs

BIRCH 增加一次调用并保留残余信息量偏好;修订后的 benchmark 标签、有限模型和静态成对任务限制了外推。

Where the evidence stops

证据覆盖两个成对视觉评审基准、八个 judge 和有限模型成本测量;修订标签流程、生成随机性、长轨迹和服务级副作用均未覆盖。

09.18Paper Anchoring Bias:把历史评分快照当作可干预的上下文状态Problem迭代评审把上一轮分数、尝试编号或通过状态带回下一次judge调用时,旧上下文可能改变当前评分和放行决定,使评审不再独立且错误会沿着修订循环累积。Takeaway历史评分快照即使只作为上下文元数据,也会改变LLM judge的评分和接受决定;评审系统应把历史状态当作可干预变量而非中性提示。 记忆与上下文状态与恢复观测与评测 95
ProblemP1迭代评审把上一轮分数、尝试编号或通过状态带回下一次judge调用时,旧上下文可能改变当前评分和放行决定,使评审不再独立且错误会沿着修订循环累积。E1E2E3
├─diagnoseD1作者用固定答案、随机低于门槛的先验分数和三条件配对协议,把无元数据、修订框架与完整历史元数据的judge输出分开比较,并以任务分层bootstrap估计总锚定效应。E1E2
├─mitigateD2作者把数值评分效应与人工标签分类决策都纳入配对测试,并检查CoT和warning是否真正减少总效应。E3E4
└─openD3研究没有给出能普遍消除历史锚定的运行时隔离协议。E3E4
ProblemP2只看平均分或单次准确率会掩盖历史元数据对临界门槛和不同任务类别的非均匀影响。E2E3
└─mitigateD2作者把数值评分效应与人工标签分类决策都纳入配对测试,并检查CoT和warning是否真正减少总效应。E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

在Agent评审服务中将prior_score、attempt和revision标记放入显式审计字段,默认不让它们进入judge评分上下文;若业务必须提供,使用无历史分数的配对shadow judge和任务分层漂移监控,同时分别记录分数变化、门槛决定和人工标签纠错。

Trade-offs

保留历史分数可提供流程线索,却会把错误判断变成新的上下文条件;warning可能增加token且仍不能移除总效应。

Where the evidence stops

作者报告的多模型固定任务实验与人工标签分类配对;未覆盖未见任务、长周期循环、其他元数据组合或完整成本。

09.18Paper When KV Cache Reuse Fails:把选择一致性与最终正确率分开Problem复用候选的KV缓存会改变judge看到的跨候选关系;最终答案正确率可能保持相近,却掩盖被选候选身份的大量变化。Takeaway缓存复用是否保持最终正确率,与是否保持多候选联合选择,是两个问题;本文提供配对协议与信息干预来区分它们。 记忆与上下文文件与工件状态与恢复 82.5
ProblemP1复用候选的KV缓存会改变judge看到的跨候选关系;最终答案正确率可能保持相近,却掩盖被选候选身份的大量变化。E1E2E4
└─measureD1作者冻结候选文本并匹配输入排列,分别记录最终正确率、相对完整计算的候选选择一致率和候选块复用比例。E1E2
ProblemP2只观察复用前后选项不同,无法判断变化来自跨候选交互损失、输入顺序,还是参考judge本身不稳定,也不能直接判为质量下降。E3E5
└─diagnoseD2作者在完整计算中屏蔽跨候选注意力,并按顺序参考和不一致后果检查复用造成的变化。E3E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:在judge服务记录候选ID、内容摘要哈希、顺序、缓存策略及所选ID,使任务正确性与候选选择不变性成为不同字段。冻结内容和排列是比较上下文执行策略时的必要配对条件。该协议适用于需要保留候选来源语义的选择器;等价答案可互换时,应同时解释变化后果,不能把JCR变成唯一优化目标。

Trade-offs

严格保持选中ID只在后续确实依赖候选身份时有意义;不同正确答案交换可能无害。门控提高一致性时复用率大幅下降,不能据此主张速度收益保留。固定小样本、单一主backbone与有限模型探针限制外推。

Where the evidence stops

支持有限任务上的judge行为诊断;不证明dense最正确、所有不一致有害、风险门控可直接上线或端到端加速。

09.18Paper Simple Agents, Biased Judges:多人对话生成与人类偏好校准Problem多人对话生成需要控制发言角色、连贯性与重复,但每角色独立状态会增加编排负担;作者研究较少状态的生成流程能支持什么范围。Takeaway轻量共享状态能组织短多人对话;判断其质量时,LLM之间的高度共识仍可能偏离该样本的人类偏好。 记忆与上下文状态与恢复安全与隔离 75
ProblemP1多人对话生成需要控制发言角色、连贯性与重复,但每角色独立状态会增加编排负担;作者研究较少状态的生成流程能支持什么范围。E1E2E6
└─mitigateD1MPOD用一个滚动上下文按轮注入当前角色,结合发言者选择和语义重复重采样生成多人对话。E1E2
ProblemP2LLM评审之间排名一致,并不代表符合人类对自然和有趣对话的偏好;风格与生成器差异可能掩盖结构缺陷。E3E4E5
└─diagnoseD2作者用模型盲化、平衡顺序且允许平局的人类偏好作参照,再用替换单个发言者和打乱话语顺序检查LLM评审的倾向。E3E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:多人对话评审的数据对象应保存主题、persona、发言序列、生成器组成、A/B顺序、Tie和判据理由。聚合LLM互一致时同时显示其与人类参照的一致性和弃选/平局习惯。MPOD的共享短上下文可作为低状态生成模式,不能直接转作医疗导航、长期协作或独立身份隔离的harness。

Trade-offs

短窗口与有限重采样减少状态复杂度,也可能丢失远程信息。人类偏好参照有中等偏低一致性,样本计数不一致;移植与shuffle不隔离单一因素,故结果只能支持限定任务的评审失配,不足以宣称风格是唯一原因。

Where the evidence stops

生成器机制可解释,人机差异有直接标注支持;不支持等成本优势、排除人类歧义或识别唯一风格因果因素。

09.18Engineering DeepSeek Harness alpha2:把插件变更变成可恢复的控制事务Problem运行中安装、启停和卸载插件会同时改变包文件、运行时资源和当前 Agent 能力;并发或失败会造成半激活、残留依赖或旧能力继续可见。Takeaway插件能力的启停、依赖和权限变化应具备请求、锁、代际和失败恢复语义。 状态与恢复文件与工件运行时与调度 92.5
ProblemP1运行中安装、启停和卸载插件会同时改变包文件、运行时资源和当前 Agent 能力;并发或失败会造成半激活、残留依赖或旧能力继续可见。E1E3E4
└─mitigateD1Plugin Manager 以 profile/bundle 层、requestId、共享写锁和 HMR unload 顺序管理插件生命周期,并在安装失败或取消时恢复快照文件。E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

采用控制面管理插件生命周期,提交 generation 化能力快照;worker 只读取已提交组合并记录每次失败/恢复事件。

Trade-offs

developer preview、进程内host code和失败删除的partial changes增加信任边界与运维成本。

Where the evidence stops

固定tag实现与发布说明;无生产SLO、多租户隔离或安全效果数据。

09.18Engineering Build zero-trust AI agents:把意图策略放到 Agent GatewayProblem只做正则、签名和输入输出过滤时,合法格式的工具调用仍可能违背用户意图或在多轮中累积副作用。Takeaway意图治理应位于平台工具网关并观察跨轮行为;当前材料证明可组合机制,不证明生产安全效果。 工具与协议身份与权限观测与评测 72.5
ProblemP1只做正则、签名和输入输出过滤时,合法格式的工具调用仍可能违背用户意图或在多轮中累积副作用。E1E2
└─mitigateD1Agent Gateway 将 Model Armor、按意图判断的 Semantic Governance Policies、跨轮 Agent Anomaly Detection 和 remediation 组合为平台层执行闸门。E1E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将意图、身份和跨轮异常作为工具网关的三阶段决策,并让策略版本和副作用请求共享审计ID。

Trade-offs

平台演示没有攻击成功率、误报率、延迟或策略版本迁移证据。

Where the evidence stops

官方工程文章与companion demo;无系统化攻击、成本、延迟或一致性评估。

09.17Paper Nameless Tokenization:分开文本内容与控制标识符的生成权限Problem用户消息和工具返回中的文本能够被编码成模板保留的角色、轮次或工具控制标识符,使外部内容与服务端写入的结构边界在编号层面混淆。Takeaway服务端应分别控制谁能生成模板结构、谁只能提供内容;关闭文本伪造控制ID的通道可以建立局部边界,但模型仍可能听从普通文本里的指令。 身份与权限工具与协议记忆与上下文 75
ProblemP1用户消息和工具返回中的文本能够被编码成模板保留的角色、轮次或工具控制标识符,使外部内容与服务端写入的结构边界在编号层面混淆。E1E2
└─mitigateD1作者移除内容编码器中将字符串映射为附加控制token的路径,让可信模板直接写入控制标识符,其他文本按普通词表编码并保留原始字符。E1E2E5
ProblemP2攻击成功率混合了分隔符外观与保留标识符的作用;直接删除或改写控制字符串又会破坏合法日志内容,使安全与内容效用的取舍难以判断。E3E4
└─diagnoseD2作者固定注入指令,比较无分隔符、编码为普通文本的分隔符和保留控制标识符,并用含分隔符的合法任务单独测量内容损失。E3E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:适用于能够控制tokenizer与模板编译层的自托管Agent服务。可迁移的是为控制编号和普通内容保留不同生成入口,并把控制通道性质、合法内容保真、语义攻击成功率分开解释。迁移前提是掌握模板来源、保留ID集合与所有进入推理引擎的路径;仅能调用第三方文本API时无法在客户端完整实现。它应作为上下文编译边界的一层,不替代工具权限、来源治理与副作用控制。

Trade-offs

移除控制ID通道并不移除同样文本的语义影响,甚至可能提高部分攻击成功率。作者只测五个模型、三个短任务和两个目标,tool攻击仅覆盖两个模型;合成日志probe不说明真实日志出现频率。实现依赖可信模板、文本输入以及控制ID只能通过移除的解析路径产生,绕过renderer或直接提供ID的调用不在保证内。代码和逐项输出尚未公开,全文未给部署延迟。

Where the evidence stops

v1报告的256个可加载tokenizer审计、五模型296项短任务、200项合成内容probe及条件对照;无公开实现、部署风险估计或所有攻击均改善的证据。

09.17Engineering NVIDIA:以共享USD工件和双重检查组织场景准备AgentProblem多个Agent分别修改场景的标签、材料、传感器与物理属性时,后续工作需要依赖先前修改;临时编辑和一次性导出难以提供共同可检查的场景状态。Takeaway文章给出一种把多Agent修改汇入共享领域工件,再用视觉与规则反馈安排后续任务的参考设计。它解释了如何组织场景准备与人类判断;证据支持局部工具步骤和USD检查,不证明完整仿真任务已经可用。 文件与工件状态与恢复工具与协议 75
ProblemP1多个Agent分别修改场景的标签、材料、传感器与物理属性时,后续工作需要依赖先前修改;临时编辑和一次性导出难以提供共同可检查的场景状态。E1E2
└─mitigateD1作者先通过Blender工具盘点场景,再把子Agent产生的标签、物理属性和传感器定义写入可分层组合的USD场景,让后续Agent与仿真工具读取同一结构化工件。E1E2E3
ProblemP2场景能显示或通过结构检查,仍可能让机器人看不见目标,或遗漏对象角色与物理配置的关联。协调Agent需要知道该修什么、修改后重查哪些依赖,以及哪些意图交给人判断。E2E4E6
├─mitigateD2协调Agent结合渲染视图与SimReady规则报告分派修复,再按修改的依赖重新检查:移动传感器后重看可见性,改变对象角色后重查标签与物理属性。E2E4E5E6
└─mitigateD3作者将机械性修复与依赖任务意图的决定分开;标签不确定或物理行为有歧义时,子Agent携带上下文与建议交给人确认。E2E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:适用于Agent协作编辑CAD、仿真场景等具有结构化领域工件的任务。可迁移的是把工件作为共享状态,分开记录结构规则与任务视图检查,并在修改后重查受影响依赖。采用前提是领域规则、工具能力与人类决策边界明确;若任务没有可检查的共享表示,照搬角色数量没有同等价值。生产服务仍需独立解决版本绑定、写入协调与恢复,文章不提供这些保证。

Trade-offs

共享USD要求各工具正确维护对象层级和元数据,并管理目标profile及其版本。视觉检查增加渲染工作,按依赖重查增加协调成本;人类确认使模糊决定可控,也会中断无人值守流程。原文没有量化成本、错误率或成功率,没有说明多个Agent同时写入、检查结果绑定scene revision以及崩溃后的恢复。

Where the evidence stops

正文机制、固定版本SimReady规范以及The Junk Shop局部工具展示;图9明确只检查选定资产与要求,未评估运行时行为,修复暂停。无端到端可靠性或自动修复安全性的比较证据。

09.17Engineering Lost in Simulation:把模拟用户的偏差从Agent成绩中分离Problem模拟用户的行为可能改变任务难度和错误类型,使一个Agent分数不能稳定代表真人使用时的表现。Takeaway一个交互评测分数同时反映Agent与模拟用户;真人校准必须保留任务和人群条件。 工具与协议观测与评测文件与工件 80
ProblemP1模拟用户的行为可能改变任务难度和错误类型,使一个Agent分数不能稳定代表真人使用时的表现。E1E2
├─measureD1固定Agent和判分协议,只改变用户模拟模型,并用难度分层的人类任务研究估计模拟与真人成功率的差距。E1E2E3
└─diagnoseD2补充失败归因及礼貌、身份提示干预,检查模拟行为与校准误差如何随用户生成方式变化。E4E5
ProblemP2总体模拟分数可能掩盖不同人群的校准差异;相同平均成功率并不表示模拟器对各群体同样有效。E3
├─measureD1固定Agent和判分协议,只改变用户模拟模型,并用难度分层的人类任务研究估计模拟与真人成功率的差距。E1E2E3
└─diagnoseD2补充失败归因及礼貌、身份提示干预,检查模拟行为与校准误差如何随用户生成方式变化。E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:把用户模拟配置视为eval协议的一部分,将总体成绩、按桶校准和群体样本范围分别保存。适合多轮用户交互Agent;不把礼貌或人口提示当普遍修复策略。

Trade-offs

真人校准成本高,分层样本减少任务覆盖;按模拟成绩分桶便于审计现有benchmark,却把模拟器噪声带进难度定义。

Where the evidence stops

固定GPT4o、115题模拟比较、18题真人子集和小规模失败标注;英语零售与特定招募群体,行为干预重新分桶。

09.17Engineering Temporal:长期认证连接与单次登录尝试分开持久化Problem把认证视为一次请求或后台任务,难以同时保存人工等待、浏览器归属、超时和后续重新认证责任。Takeaway认证应围绕持续连接建模;Agent执行、人工等待和健康维护拥有不同生命周期。 状态与恢复身份与权限观测与评测 75
ProblemP1把认证视为一次请求或后台任务,难以同时保存人工等待、浏览器归属、超时和后续重新认证责任。E1
├─mitigateD1用长期父工作流管理连接配置和健康责任,每次登录使用独立子工作流管理浏览器、超时、取消与清理。E1
└─mitigateD2Agent返回结构化暂停后由Go工作流持久等待,用户输入经校验Update恢复,外部批准用独立的持久轮询与绝对截止时间处理。E2E4
ProblemP2健康探测失败不一定代表退出登录;将暂时故障当作失效会诱发不必要重试和账户锁定。E3
└─mitigateD3将健康结果分成已认证、未认证和无法判断,并以持久失败计数及冷却控制重新认证。E3
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:以连接为持久控制面,以尝试为浏览器资源所有者,分别建模人类输入、外部确认和健康不确定。采用前提是认证状态确需跨任务长期维护;恢复和动作幂等不能合并为一个保证。

Trade-offs

增加父子状态、浏览器相关性和跨语言Activity契约的维护成本;持久等待节省占用,但仍需处理浏览器消失与外部动作不确定性。

Where the evidence stops

一篇KERNEL生产一手叙述、简化等待代码及成功计数;没有完整实现、总尝试分母或因果可靠性比较。

09.17Engineering EverMemOS:先组织经历,再按场景重建回答上下文Problem平面检索能找到相关片段,却可能遗漏跨时间的关联证据,使回答无法组成连贯经历或正确解释变化。Takeaway先组织经历,再选择与补齐当前任务需要的上下文;场景是检索结构,不能替代来源事实。 记忆与上下文文件与工件身份与权限 75
ProblemP1平面检索能找到相关片段,却可能遗漏跨时间的关联证据,使回答无法组成连贯经历或正确解释变化。E1E2
├─mitigateD1先按语义边界生成有来源的MemCell,再按相似度、时间间隔及冲突条件归入MemScene,保留原文与检索索引的区别。E1E2
└─mitigateD2先匹配原子事实和场景,再重排经历;由LLM检查信息缺口,必要时改写补检索。E2E3
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:原文经历与派生视图分离,场景维护明确的时间和冲突规则,补检索显式保存缺口。适合文本个人记忆,不将前瞻推断直接当事实或权限;派生删除与并发更新另需协议。

Trade-offs

构建和检索均引入模型调用与额外索引,早期重写错误可能传播;更高问答准确率不等于更低全生命周期成本。

Where the evidence stops

LoCoMo与LongMemEval主要为Episodes-only,Profile另测且样本量口径有冲突;Foresight多为案例,充分性是LLM判定。

09.17Engineering AWS:在同一知识图上比较上下文表示与检索策略Problem不同关系检索策略使用的表示和上下文不同;仅按算法名称或单榜单选择,容易将问题类型差异和内容预算误当普遍优势。Takeaway对图RAG有用的选择单位是实际交给模型的表示与检索预算,而不是算法品牌。 记忆与上下文身份与权限文件与工件 75
ProblemP1不同关系检索策略使用的表示和上下文不同;仅按算法名称或单榜单选择,容易将问题类型差异和内容预算误当普遍优势。E1E2E3
├─mitigateD1固定词法、向量和图检索的融合骨干,让策略改变图遍历及上下文组织,并将原文段落带入局部图检索。E1E2
└─measureD2对同一问题比较策略与上游实现,同时报告任务准确率、上下文构成和独立计量的查询成本,保留不显著及反向结果。E2E3
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:在知识Agent的context assembly保留表示类型、来源段落、实际token与成本元数据;策略与数据入口解耦。增量清理的失败状态需独立对账,参考样例不提供跨库事务。

Trade-offs

共享图降低多策略比较成本,但建图、实体抽取和多轮生成仍昂贵;复杂策略不必然优于廉价替代方案。

Where the evidence stops

两个各100题多跳集、三run、28题主题集及另20题费用样本;一图与默认配置,不能推导通用优越、等效或原子更新。

09.17Paper 图记忆是否值得采用:先对齐检索键、证据与重排Problem长期对话记忆系统的整体分数混合了抽取、表示、检索和回答差异,难以判断图结构究竟带来了什么收益。Takeaway图是否值得使用取决于它保存和返回了什么信息;把检索表示与原会话证据分开,比分别看系统总分更能解释设计选择。 记忆与上下文状态与恢复身份与权限 75
ProblemP1长期对话记忆系统的整体分数混合了抽取、表示、检索和回答差异,难以判断图结构究竟带来了什么收益。E2E5
├─measureD1把记忆管线拆成抽取、索引维护、检索和回答,显式区分检索键与证据值,再逐阶段比较表示、维护操作和重排选择。E2E3E4E5
└─mitigateD2用带自然语言描述的实体作为检索键,映射回原始会话作为回答证据;按实体相似度与关联数量重排,强基线无需扩展邻居。E3E4E5
ProblemP2适合搜索的实体或摘要不一定保留回答所需的背景;召回正确会话也可能因信息压缩或噪声而答错。E3E5E6
├─mitigateD2用带自然语言描述的实体作为检索键,映射回原始会话作为回答证据;按实体相似度与关联数量重排,强基线无需扩展邻居。E3E4E5
└─diagnoseD3分别检查更新、保持不变和抽取前过滤的效果,同时报告信息精度、召回和回答错误,揭示维护及过滤的损失。E3E6E8
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:将带来源版本的key索引与会话value档案分开,按权限回取证据并记录装配出处。适用于能保留原文并承担抽取/维护成本的长期对话;论文未给出更新原子性、留存治理或多租户协议。

Trade-offs

以实体描述抽取、图维护和原会话留存换取匹配与回答信息的分工。图在LME-M更贵,更新可能损精度,过滤可能丢来源;预算、judge与模型标注冲突限制因果归因和生产外推。

Where the evidence stops

ACL2026正式版的LongMemEval-S/M与HaluMem-medium阶段比较;无等token预算、图拓扑独立因果证明、judge人工校准或CI,回答模型标注冲突保留。

09.17Paper Fuse:把社会事件与用户转述拆开评测Problem助手只从用户转述理解事件时,答错可能来自叙述遗漏、用户偏见或模型推理;直接给全知事件的评测无法区分这些来源。Takeaway将事件与转述分层保存并对照,能识别信息通道造成的判断差异;人类可解性与正确/错误/拒答分报比一个总分更有解释力。 观测与评测文件与工件身份与权限 75
ProblemP1助手只从用户转述理解事件时,答错可能来自叙述遗漏、用户偏见或模型推理;直接给全知事件的评测无法区分这些来源。E2E3
├─diagnoseD1先模拟带预设隐藏动机的多人事件,再单独生成用户咨询;固定事件后改变转述偏见与细节,并比较直接观察事件和只看转述的模型。E2E3
└─validateD2分别统计正确、错误与拒答,并用事件及转述的人类多数票检验隐藏动机是否表现出来、输入是否足以作答。E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:在评测数据层保存event_id、隐藏标签、debrief条件和可见文本之间的关系,标签与完整事件只对评测控制面开放。模型请求按可见输入构建,输出分别保存正确、错误、拒答与所用效用权重;比较以共享事件为单位,防止把同一事件的许多转述误当完全独立样本。适合诊断用户转述驱动的助手,不适合把合成标签当作现实人际判断依据。

Trade-offs

生成、人工验证与分组评测增加成本;二元潜在动机和同源模拟器提高可控性,却限制现实有效性。

Where the evidence stops

1200合成事件、21600首条消息、12模型及人类多数票参照;不是现实动机真值、自动judge校准或多轮恢复保证。

09.17Engineering COMPASS:用战略信号触发上下文重建Problem长任务中的执行者既要推进工具调用,又要发现循环和错误;反复追加整段历史难以保证下一阶段保留关键证据并及时改变策略。Takeaway把战略转向与上下文刷新绑定,能缓解长程执行中的错误坚持与信息丢失;稳定内循环前缀的收益有任务和计算预算边界。 记忆与上下文工具与协议文件与工件 75
ProblemP1长任务中的执行者既要推进工具调用,又要发现循环和错误;反复追加整段历史难以保证下一阶段保留关键证据并及时改变策略。E2E3
├─mitigateD1将工具执行与战略监控分开;监督者读取当前轨迹,发现循环、错误或完成信号后,引导下一轮继续、转向、核验或结束。E3E5E6
└─mitigateD2在战略转折时用旧笔记、当前轨迹和监督决定重建简短brief;同一内循环沿用该前缀,并按轮保存证据、约束与未决事项。E3E4E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:在已有可靠工具执行层上增加三个角色,保留原始轨迹为依据,按round生成带来源引用的brief与notes版本。战略信号触发下一轮发布,当前轮使用稳定版本;工具结果先落入轨迹,再进入上下文整理。适合长程浏览和研究任务,短任务可能不值得额外监督成本。持久化、版本提交、取消ACK和业务幂等需要执行层另行承担,不能交由自然语言brief保证。

Trade-offs

三个角色增加推理与协调成本;压缩后的brief可能遗漏证据,缓存复用依赖轮内前缀稳定,训练小模型又增加样本与策略维护成本。

Where the evidence stops

ACL正式稿同主模型三类任务比较与组件消融;不证明等算力最优、可靠停止、在途取消、持久恢复或12B扩展的精确效率。

09.17Engineering 分布式技能:把有界专家推理迁回主AgentProblem有界领域能力也被封装成独立推理Agent时,主Agent必须委托、等待并再次解释答案,增加模型循环;服务独立部署并不总要求推理也独立。Takeaway领域服务可以继续分布式部署,而有界能力的推理可以汇入主Agent;是否保留专家Agent取决于自治、私有上下文和生命周期。 工具与协议身份与权限状态与恢复 87.5
ProblemP1有界领域能力也被封装成独立推理Agent时,主Agent必须委托、等待并再次解释答案,增加模型循环;服务独立部署并不总要求推理也独立。E1E4
└─mitigateD1把有界专家的指令变成可加载skill,保留远程typed MCP业务操作,由主Agent选择操作;有自治需求的研究专家继续保留独立Agent。E1E3E6E7
ProblemP2把专家指令搬进主Agent后,若同时暴露所有领域工具,schema会继续累积;只认技能名称又可能在加载失败时错误扩展当前可调用目录。E2E3E4
└─mitigateD2宿主预取provider目录,但只有技能正文成功读取并匹配缓存后,才把该provider整组工具加入当前执行循环,下一次模型调用再暴露schema。E2E3E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

在可信只读有界域中保留远程服务与服务器端检查,把领域指令交由主Agent解释;将工具暴露绑定provider身份、成功加载和本次run。

Trade-offs

减少嵌套模型循环,却把更多指令和schema放入主上下文;演示总token反增。整组曝光简单,但权限、跨turn恢复和协议版本需另行治理。

Where the evidence stops

固定56f453a实现和三对非受控演示支持控制流,不支持质量等价、普遍速度提升或成本下降。

09.17Paper CPE:追踪上下文来源跨角色与作用域的传播Problem只检查当前模型输入或单次注入拒绝,会漏掉低信任内容被写入持久来源、在后续任务里以不同消息角色或更广作用域重新出现。Takeaway上下文的信任边界不止在一次模型调用内,还在写入、重新加载和跨任务复用之间;应分别核实来源、传播与行为。 记忆与上下文文件与工件状态与恢复 82.5
ProblemP1只检查当前模型输入或单次注入拒绝,会漏掉低信任内容被写入持久来源、在后续任务里以不同消息角色或更广作用域重新出现。E2E4
├─diagnoseD1将上下文来源表示为内容、消息角色、作用域及加载生命周期,区分消息角色迁移与跨运行、跨项目传播。E2E7
└─validateD3分别记录内容传播和后续行为:先观察高层来源变化,再清除原始低层内容,用无关任务重新启动并检查加载与预期行为。E4E6E7
ProblemP2静态分析可能虚构上下文来源或标错作用域;内容到达某个文件,也不能证明它后来进入模型请求并影响行为。E3E5E6
├─validateD2让静态worker提出来源,独立解释器植入worker不可见随机标记,再从实际模型请求和三次不同启动中核对加载位置与作用域。E3E5
└─validateD3分别记录内容传播和后续行为:先观察高层来源变化,再清除原始低层内容,用无关任务重新启动并检查加载与预期行为。E4E6E7
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

context管线显式记录来源、版本、消息字段、作用域与触发条件;把持久化和共享范围提升视为独立决策,将加载证据与后续行为分开。

Trade-offs

来源验证需要可观察和可构建的目标环境;复杂触发、长载荷与模型行为使自动枚举不完整。统一角色抽象和三次作用域判断有外推边界。

Where the evidence stops

12个指定版本、两套人工来源清单和模板条件下的路径观察支持诊断,不构成防御有效、完整覆盖或现版本漏洞保证。

09.16Paper SCOUT:把MCP工具目录变成按需检索的控制面Problem全量工具schema占用140.2k token和70.1%的200k窗口,同时让用户与Agent难以从2000多个工具中找到正确能力。Takeaway可执行工具schema也应作为按需上下文管理;先按身份过滤再检索,发现与执行分离。 工具与协议记忆与上下文身份与权限 92.5
ProblemP1全量工具schema占用140.2k token和70.1%的200k窗口,同时让用户与Agent难以从2000多个工具中找到正确能力。E2E3
├─mitigateD1用tool_search和execute_tool把发现与执行分开,只把当前查询相关的工具schema放入模型上下文。E2E3E4
└─mitigateD2在用户授权范围内融合BM25和dense检索,以insert-before-delete更新索引,并在检索故障时降级。E2E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:把工具目录、用户授权scope、索引版本和实际执行路由绑定;记录搜索候选、最终工具及回退路径。适合大目录MCP网关,不替代工具副作用对账。

Trade-offs

用索引、embedding和额外搜索回合换取小上下文;检索漏项会直接隐藏能力,降级全量目录又恢复原始风险。

Where the evidence stops

一套PayPal生产目录、45个可评查询和24小时/7天遥测;没有端到端任务成功率或严格时延SLO证明。

09.16Paper Social Harness:为跨主体Agent通信增加协议与治理层Problem现有个人harness与连接协议只解决单Agent工具使用或可达性,不能保证跨信任边界的消息有效、协作收敛或恶意方隔离。Takeaway跨主体Agent协作需要独立于个人harness的通信控制面;身份、排序、契约和治理必须分层。 工具与协议安全与隔离身份与权限 77.5
ProblemP1现有个人harness与连接协议只解决单Agent工具使用或可达性,不能保证跨信任边界的消息有效、协作收敛或恶意方隔离。E2E3
├─mitigateD1提出五层social harness:可验证身份、可靠有序通信、个人firewall、任务协作契约以及事后治理。E2E3E4
└─mitigateD2用collective通信和规定发言者/消息类型的任务契约约束并发对话,把可检查的协议状态置于自然语言之下。E2E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:把principal/agent身份、会话成员、协作状态和允许的下一消息写入可审计控制面;模型消息只在协议允许时提交。此文没有关闭外部动作UNKNOWN或原子完成问题。

Trade-offs

共享上下文帮助汇总却可能泄露无关会话;群组有序投递仍不能阻止生成期竞态。严格发言协议会牺牲并行吞吐。

Where the evidence stops

会议调度和有限攻击实验支持故障诊断;五层social harness是架构提案,不是已验证生产系统。

09.16Paper Deictic Ambiguity:测量多阶段上下文中的指代漂移Problem后续模型会把表面字段或上一阶段标签当作当前任务语义,导致已经识别正确操作含义时仍作出错误裁决。Takeaway跨阶段上下文需要显式对象绑定;只看最终正确率会漏掉字段标签压过操作语义的机制。 文件与工件记忆与上下文身份与权限 87.5
ProblemP1后续模型会把表面字段或上一阶段标签当作当前任务语义,导致已经识别正确操作含义时仍作出错误裁决。E2E3
├─measureD1构造correct-draft、透明错误和不透明错误三条件最小对,只改变阶段责任和参照对象。E2E3E4
└─diagnoseD2用balanced accuracy、条件敏感度、序贯e-value、标签移除消融和错误rationale probe分解失效位置。E2E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:阶段输出携带稳定对象ID、字段来源和任务角色,下一阶段显式重绑定;评测同时记录verdict和rationale是否真正使用目标对象。

Trade-offs

强控制最小对提高归因清晰度,却把任务收窄为一种合成指示歧义;高重复数不能替代独立刺激。

Where the evidence stops

十个合成base、21配置和重复调用;不证明所有多Agent交接都存在同等幅度。

09.16Engineering LightMem:用小模型分层控制记忆的在线成本Problem现有记忆系统很难同时保持检索准确、在线低延迟、固定预算和多用户独立维护。Takeaway把记忆生命周期和推理热路径分开,小模型可以承担预算、重排和写入控制。 记忆与上下文身份与权限文件与工件 87.5
ProblemP1现有记忆系统很难同时保持检索准确、在线低延迟、固定预算和多用户独立维护。E2E3
├─mitigateD1将记忆分为STM、MTM和LTM,用三个小模型分别做预算路由、语义重排和在线写入。E2E3E4
└─mitigateD2在线按2K到K的固定预算取用记忆,离线批量去标识并把可复用证据增量整合进LTM。E2E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:按tenant保存STM/MTM/LTM与版本,在线路径只读固定预算视图,离线整合以原始事件为依据原子发布。需要单独实现访问撤销和删除传播。

Trade-offs

以多个小模型、三层状态和离线整合复杂度换取在线可控预算;离线批处理与图维护仍有成本和失鲜窗口。

Where the evidence stops

ACL正式稿的对话基准、消融和时延;不证明跨租户隐私、遗忘合规或所有任务质量。

09.16Engineering Memory-R1:用下游结果学习记忆写入与蒸馏Problem静态记忆生命周期可能漏写、重复或保留冲突内容;取回许多候选后,回答模型也可能没有利用真正相关的信息。Takeaway记忆写入和读取可以由下游任务结果学习,但奖励定义会改变系统偏好的答案与记忆行为。 记忆与上下文身份与权限文件与工件 82.5
ProblemP1静态记忆生命周期可能漏写、重复或保留冲突内容;取回许多候选后,回答模型也可能没有利用真正相关的信息。E2E3
├─mitigateD1Memory Manager从ADD、UPDATE、DELETE、NOOP中选择操作,并用下游回答exact match作为PPO/GRPO奖励。E2E3E4
└─mitigateD2Answer Agent从60个候选记忆中学习蒸馏相关事实后回答;两个组件分阶段固定对方训练。E2E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:将每次写操作、候选记忆和下游结果保留为可追溯训练样本;策略版本化上线,写入仍受租户权限、保留和删除规则约束。

Trade-offs

需要离线RL、奖励构造和双模型部署;优化exact match会偏好短答案,judge reward又会偏向冗长文本。

Where the evidence stops

ACL正式稿的对话数据、匹配基线、消融和迁移;不证明联合训练、在线持续学习或治理安全。

09.16Paper PACE:用可回查的多粒度历史延缓上下文耗尽Problem长期工具任务持续增加历史消息,全量回放会耗尽上下文,而固定压缩强度无法同时适应当前信息需求和剩余窗口。Takeaway可回查原文上的动态粒度选择能缓解长期上下文的容量与细节冲突;压力自适应延缓超窗,但不保证任务正确或严格有界。 身份与权限工具与协议记忆与上下文 75
ProblemP1长期工具任务持续增加历史消息,全量回放会耗尽上下文,而固定压缩强度无法同时适应当前信息需求和剩余窗口。E2E3E6
├─mitigateD1保留原始历史,并为每块生成不同长度的表示;每步依据问题和最近进展重新选择各块粒度,使旧信息可以缩短或重新展开。E2E3E4E5
└─mitigateD2用已执行步数和上次窗口占用估计压力,逐步提高保留长表示的阈值,在长链后期压缩更多历史。E3E5E6E8
ProblemP2早期摘要可能丢掉后来才重要的细节;如果原文无法回查,Agent难以修复这类信息缺口。E2E4
├─mitigateD1保留原始历史,并为每块生成不同长度的表示;每步依据问题和最近进展重新选择各块粒度,使旧信息可以缩短或重新展开。E2E3E4E5
└─mitigateD3摘要在后台生成,最近两块保留原文;Glimpse工具允许Agent按块ID请求历史全文,以补偿摘要遗漏。E2E4E5E7
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:在工具历史写入与模型输入之间加入版本化多粒度装配层,原文按会话权限隔离,粒度和Glimpse读取保留出处。适用于能保存全文且接受后台处理及长度画像成本的长链服务;论文不提供租户公平预算、durable恢复或完成原子性协议。

Trade-offs

以外部原文、后台摘要和embedding开销换取可重新展开的输入视图。相似度不等于依赖,摘要可能失真,压力非硬上限;自定义judge、无CI、无压力行差异和未核实代码限制精确归因及服务外推。

Where the evidence stops

正式ACL2026版;同模型内部任务比较及消融,单元任务超窗压力测试。GAIA自定义judge、无CI、参数选择边界、无压力两表差异与总成本缺口均保留。

09.16Paper Plan-RewardBench:用成对完整轨迹检查评审器是否识别过程错误ProblemAgent最后的回答看起来合理,并不代表途中正确使用了工具事实、跟上了用户的新约束或完成了有效恢复;只评最终回答会把过程错误当成高质量执行。Takeaway完整轨迹配对能把看似成功中的过程错误变成可检查的偏好问题;标签复核和外部选择验证提供有限有效性,但分数仍受构造、裁判和输入处理规则影响。 工具与协议状态与恢复文件与工件 75
ProblemP1Agent最后的回答看起来合理,并不代表途中正确使用了工具事实、跟上了用户的新约束或完成了有效恢复;只评最终回答会把过程错误当成高质量执行。E1E2
└─measureD1作者固定任务与工具环境,将完整轨迹成对比较,并从自然失败、规则注入和保留工具记录的最小文本编辑中构造难负例,分别检查规划、恢复、拒绝和工具适用性。E1E2
ProblemP2轨迹偏好可能被字数、格式和候选位置左右,而自动生成的标签也可能有分歧;未经检查的评审器分数难以作为筛选Agent轨迹的可靠依据。E2E3E4
├─validateD2作者用分类评分、分歧复核和成对复查筛选偏好标签,再做人工一致性检查;评测时交换候选位置,并分别报告七个分组。E3E4E5
└─validateD3作者固定执行Agent和四条候选轨迹,让不同评审器选一条,再用外部BFCL规则检查结果。E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑采用判断:将任务、工具环境、完整记录和偏好依据绑定为一个评审单元,保留来源与位置交换结果,优先用于离线轨迹筛选和评审器诊断。选择器比较应共享候选池,并保留截断、Tie、解析失败和成本口径;真实业务完成仍以外部结果为准。 最小接口由轨迹读取器产生任务ID、工具环境版本与候选对,评审适配器记录模型、方向、截断和解析状态,汇总器再按类别输出偏好。记录的不变量是原始轨迹不可被评审结果改写、失败调用不可悄悄混入有效分母;部署在有完整工具日志的离线评审服务,不直接控制业务终态。

Trade-offs

完整轨迹提供过程证据,也增加评审输入与调用量;双向评审又增加成本。任务长度、难度和类别分布并未完全分离,公开脚本还存在部分模型截断和错误记录排除,因此更适合按错误类型选择评审器,不能只比较汇总排名。

Where the evidence stops

依据1171对英语离线轨迹、291对人工一致性和固定Qwen3-32B四候选的BFCL重排;未证明纯长度因果、统一预算优势或线上恢复安全。

09.16Paper NCB:把单题自一致与上下文干扰下的稳定性分开测量Problem模型在没有干扰时多次答对同一事实,仍可能因错误共识或带权威标签的无关材料改口;单题自一致无法识别这种上下文脆弱性。Takeaway单题稳定答对与抵抗上下文干扰是不同能力;邻域分层加压力测试可以发现这一区别。SAT提供另一路减少输入漂移的方法,但诊断关联不能解释成内部结构的因果证明。 记忆与上下文文件与工件状态与恢复 75
ProblemP1模型在没有干扰时多次答对同一事实,仍可能因错误共识或带权威标签的无关材料改口;单题自一致无法识别这种上下文脆弱性。E1E3E5
├─measureD1作者围绕正确答案构造可独立作答的邻题,将目标题正确频率与邻题正确频率的几何平均结合成NCB分数,区分单题稳定与周边知识表现。E1E2
└─diagnoseD2作者在同一高自一致集合中按NCB分层,加入不同数量的模拟同伴意见及不同可信度标签的上下文,同时报告有效回答覆盖率和条件准确率。E3E4E5E7
ProblemP2针对新事实做答案增强训练后,模型可能只在熟悉问法下答对,换成带额外上下文的输入又失稳;提高无干扰准确率不等于学到了稳定的使用方式。E6
└─mitigateD3作者另提出SAT训练:让读取邻域或一般上下文的学生模型,匹配冻结教师在无该上下文时的输出分布。E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑采用判断:适合静态事实型检索或同伴信息输入的离线诊断,将单题正确性、邻域表现、冲突与无关干扰分开记录,同时保留Coverage。NCB不应成为拒绝新资料的权限规则,也不能用于动态知识更新的一刀切判断;SAT仅对可控训练栈和可信教师有可迁移意义。 最小记录按目标题绑定参考答案、邻题集合及核验来源,并分别保存无干扰、冲突和无关材料条件下的输出与抽取状态,汇总层保留每题有效分母及Coverage。诊断结果只附加脆弱性标记,不自动覆盖事实或记忆;部署边界是可信静态答案库,动态知识更新必须走独立来源与时效判定。

Trade-offs

邻域构建和多次采样增加离线成本,事实核验还需人工参与。更高NCB同时关联更热门、更容易的事实;额外上下文长度、实体抽取与拒答处理影响比较。SAT继承答案增强checkpoint并使用更多上下文样本,不能把结果解释为相同预算下评分机制本身的收益。

Where the evidence stops

证据限2000道静态事实种子、四模型的高自一致子集和100事实训练分支;有人工事实筛选与位置/邻题敏感性检查,缺少去混杂与真实Agent任务效用证据。

09.16Engineering ClawTab:活跃 Agent 会话的插件准入与控制状态恢复Problem外部插件操作正在运行的编码 Agent 时,版本或终端对象变化可能让命令落到错误目标,普通插件发现不足以约束这类会话控制。Takeaway宿主应拥有会话动作准入和局部恢复,扩展负责动作本身;成功送达与任务完成必须分开。 状态与恢复文件与工件身份与权限 75
ProblemP1外部插件操作正在运行的编码 Agent 时,版本或终端对象变化可能让命令落到错误目标,普通插件发现不足以约束这类会话控制。E1E2E3
├─mitigateD1启动时重查插件与批准指纹,为目标窗格建立独占运行和专用令牌,并在宿主接口检查能力、provider及窗格根进程。E2E3E6E7
└─mitigateD3示例动作先检查空闲及空输入,再将结果限定为快捷命令已发送。E5
ProblemP2临时切换模型或清空输入框后,插件失败可能留下改变的会话状态,用户草稿与后续操作会受影响。E1E3E4
└─mitigateD2在修改模型与草稿前记录恢复状态,插件失败或取消后尝试恢复;恢复失败单独显示需要用户处理。E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:在已有Agent会话外设置控制适配器,最小数据流为manifest/批准→run令牌与目标快照→宿主能力检查→动作→恢复状态。分别保存命令已发送、插件已退出、Agent操作完成的语义。该迁移适合可信单用户控制端;服务器隔离、Agent代际身份及持久恢复并非原实现提供。

Trade-offs

快速扩展与热发现减少内核变更,但信任仍落在本地用户代码;终端识别受provider版本与UI形态影响。内存恢复简单,却不覆盖daemon崩溃;取消是请求而非全后代停止确认。

Where the evidence stops

固定提交支持可信本地进程内恢复;无沙箱、持久恢复、完整Agent代际栅栏或递归取消确认。

09.16Paper EnvPilot:把环境搭建轨迹变成可检索的故障经验Problem软件环境搭建Agent反复探索相似依赖与构建故障,整段旧轨迹难以检索出当前仓库真正需要的修复经验。Takeaway按故障检索结构化经验能减少环境搭建的重复探索,但成功率收益伴随上下文成本,且目前只在冻结经验库下获得支持。 记忆与上下文文件与工件观测与评测 75
ProblemP1软件环境搭建Agent反复探索相似依赖与构建故障,整段旧轨迹难以检索出当前仓库真正需要的修复经验。E2E3
├─mitigateD1把历史轨迹抽成问题、解决思路和具体动作三元组,以当前仓库推导的潜在故障检索问题字段,再把完整经验注入Agent。E2
└─validateD2固定经验库、模型和执行器,对比经验表示与检索方式,并区分环境可运行和测试断言全部通过。E3E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:环境准备服务可保存带版本/来源的problem、solution、action,再以仓库画像生成查询、融合检索并注入执行器。检索记录与实际命令执行结果分开,ECSR只代表环境生命周期完成;不把经验动作自动升级为授权。

Trade-offs

增加结构化经验提高可用性,也增加输入token并可能触发无关探索;相同任务集调k、跨基线运行次数和附录计数错配限制比较。固定库没有验证在线经验治理。

Where the evidence stops

112实例、固定667经验和指定执行器;环境成功允许断言失败。三次运行不等于独立验证,Table19计数与部分文字口径有冲突。

09.16Paper PTA-IRT:用历史轨迹校准小样本 SWE Agent 评测ProblemSWE Agent完整评测需要大量多步运行,只按通过与否选少量题会丢失过程差异,使小样本估计和排名失真。Takeaway历史过程可以辅助题目参数和小题集选择,同时由无新轨迹依赖的评分器完成全量预测;证据只支持给定历史配置下的有限估计收益。 观测与评测文件与工件记忆与上下文 75
ProblemP1SWE Agent完整评测需要大量多步运行,只按通过与否选少量题会丢失过程差异,使小样本估计和排名失真。E2E4
├─measureD1用历史执行摘要修正题目的难度与区分度,再把轨迹教师的信息蒸馏进不依赖未运行轨迹的全局评分器。E2E3
└─measureD2按历史通过率分层分配题目预算,并结合质量加权信息量选校准题,在小子集上拟合新Agent配置的能力。E3E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:评测服务离线保存任务/版本/配置、轨迹摘要和全量结果,训练全局评分器及分层选题策略;新配置只从已执行校准题估计标量能力,对其余题输出估计值而非真实通过结果。保持题量、历史处理成本和在线执行成本分列。

Trade-offs

历史摘要带来过程信息和离线费用,也混入参考补丁;分层降低题集偏斜,但小Agent样本、轨迹过滤和无family隔离限制泛化。

Where the evidence stops

四SWE基准、四折Agent划分与10%题量比较;无家族/harness隔离或全成本等预算声明,摘要含参考补丁。

09.16Paper AttnRank:按模型的位置偏好排列同一组上下文Problem同一组相关文档放在不同上下文位置会影响利用效果,统一按相关性排序无法适配模型及模板的位置偏好。Takeaway模型位置画像可指导同一组证据的布局,给定配置有小幅平均收益;它是带格式边界的经验方法,不是注意力因果定理。 记忆与上下文文件与工件工具与协议 75
ProblemP1同一组相关文档放在不同上下文位置会影响利用效果,统一按相关性排序无法适配模型及模板的位置偏好。E2E3E4
└─mitigateD1先用校准样本估计模型的浅层位置注意力排序,再把最相关文档放到偏好位置,保持检索集合与推理模型不变。E3E4
ProblemP2注意力与正确率共同变化并不足以说明位置偏好的根因,机制解释需要区分观察、组合干预和理论假设。E2E6
└─diagnoseD2通过层深观察、文档排列和组合去结构实验描述位置效应,并给出理想化注意力解释。E2E5E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程推断:在检索结果和上下文序列化之间插入位置映射层,画像绑定模型/模板/k,保留实际文档集合与排序来源。该机制只适用于attention可读且布局稳定的服务;动态工具消息与闭源API不在直接支持范围。

Trade-offs

不增文档且不改参数,但需要attention访问和校准;布局收益小且依赖格式。理论符号矛盾、组合干预、画像信息边界与费用缺口阻止普遍因果或效率保证。

Where the evidence stops

正式ACL2026版本、固定5文档与少样本排列比较;存在负例,无显著性或端到端成本结果,理论符号链不一致。

09.16Engineering S2G-RAG:让缺失事实同时驱动下一次检索与证据选句Problem多跳问答只找到中间实体时,系统可能过早回答,也可能继续重复搜索;缺少明确的剩余事实清单使下一步检索难以检查。Takeaway把剩余事实需求交给可检查的控制接口,能改善限定多跳问答配置的信息组织;它不是可靠停止或完整回答的保证。 记忆与上下文状态与恢复观测与评测 75
ProblemP1多跳问答只找到中间实体时,系统可能过早回答,也可能继续重复搜索;缺少明确的剩余事实清单使下一步检索难以检查。E1
└─mitigateD1作者将充分性判断与缺失事实写成结构化状态,再把缺口字段确定性映射成下一次查询。回答器与检索控制分开。E1E2
ProblemP2逐轮拼接完整检索文档会引入重复和干扰,但自由生成摘要又可能改变证据;系统需要按当前缺口选择可追溯的信息。E1E2
└─mitigateD2同一份缺口清单也指导句子选择器,选择器只返回原文句子编号,由程序还原并追加到证据上下文。E2
ProblemP3仅从理想状态学习的检索控制器可能不适应真实中间上下文,训练监督需要覆盖多轮积累产生的缺失与噪声。E3
└─mitigateD3作者从未微调控制器的执行轨迹中保存每轮上下文,交由教师标注充分性与缺口,再训练小型控制器。E3
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

在检索控制层保存结构化缺口,在上下文装配层保存原句引用;记录充分停止与预算退出的不同原因。适用可控制多轮检索的服务,不能直接拿Judge输出当业务完成证明。

Trade-offs

同最大检索次数不等于同总算力;原句选择可能遗漏语境,标题覆盖代理不证明真实充分性,预算耗尽仍回答。

Where the evidence stops

三类QA主结果及HotpotQA组件对照;充分性分析仅为标题覆盖代理,无等总成本、人工充分性校准或重复运行区间。

09.16Paper MapRepair:图记忆修复要同时检查残余冲突与正确结构保留ProblemAgent逐步把文字观察写成空间图时,早期错误可能到很久以后才形成冲突;只看当前图无法解释哪次观察或修改引入了错误。Takeaway图记忆需要可回查的修改来源,但修复是否值得采用必须同时看冲突与正确结构;这篇的负例说明保持原图有时更好。 文件与工件状态与恢复记忆与上下文 75
ProblemP1Agent逐步把文字观察写成空间图时,早期错误可能到很久以后才形成冲突;只看当前图无法解释哪次观察或修改引入了错误。E1E2
└─mitigateD1作者保存每次图修改的原始观察、分析和边增删,并从提交依赖历史筛选候选,再按结构影响排序回查。E2
ProblemP2修复器可以通过删掉正确边降低冲突数,也可能因反复回退制造更多错误;仅看图是否一致会高估修复质量。E3E4
└─measureD2作者把修复后的残余冲突与正确方向边保留并列报告,并用组件、模型和非LLM修复参照检查负效应。E3E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

对有结构约束的图记忆保存来源绑定的增量修改和修复原因;判断终态时并列保留残余冲突与正确结构损失。不将自动修复设为默认成功路径,尤其不据相对弱基线提升断言值得采用。

Trade-offs

CF是检测器下无冲突,不等于真实图正确;部分模型修复比不修复更差,删除法支配若干增强配置,命名候选漏错及小说过生成不可忽略。

Where the evidence stops

v2合成组件对照、7模型TextWorld、42个MANGO图及单小说案例;结构一致性和正确边保留有指标,语义真值、等总成本与普遍修复优势未成立。

09.15Paper CloneMem:连续个人轨迹与多对多证据的记忆诊断Problem长期个人记忆评测常把聊天中的事实分开提问,难以观察经历、情绪和观点怎样连续变化;模型可能记住片段,却答错变化的过程。Takeaway连续状态的合成资料和多对多证据关系,使长期记忆的覆盖与答题表现可以分开检查;本文支持这种诊断协议,不证明摘要普遍有害或真实个人可被准确模拟。 记忆与上下文状态与恢复身份与权限 75
ProblemP1长期个人记忆评测常把聊天中的事实分开提问,难以观察经历、情绪和观点怎样连续变化;模型可能记住片段,却答错变化的过程。E1E2
├─measureD1作者从人物与长期变化线索出发,逐阶段更新状态快照,再共同生成细事件、证据和日记等资料,使后续阶段承接此前状态。E2
└─validateD3在沿时间更新的证据桶上先判断是否足以出题,再生成问答并迭代修订可被表面线索破解的选择题干扰项。E3
ProblemP2一个问题可能需要多条证据,而每条证据又散布在多份资料中。仅按资料ID命中或最终答题分排名,会混淆证据覆盖、信息表示和回答使用这几类问题。E4E5
├─diagnoseD2作者保存问题、证据单元和来源资料之间的多对多关系,分别评估证据是否找齐、取回内容是否有用,以及最后答案是否正确。E4E5
└─diagnoseD4固定检索流程,比较原始资料、抽取记忆及两者组合,并交叉改变骨干和嵌入模型,观察检索与回答指标如何变化。E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:在长历史评测中分开保存原文、状态变化、必需证据单元及来源映射,把覆盖、语义充分性、答案结果分别呈现。保留原文与抽取表示的差异和成本口径,适用于离线资料记忆评估;不把模型心理拟真、生产恢复或最佳框架当本文结论。

Trade-offs

显式快照和证据关系让任务可追溯,但合成一致性不等于真人真实性。查询时禁用互动循环有助比较表示,也缩小了完整Agent适用范围;相同k未对齐token,裁判及规模口径仍有缺口。

Where the evidence stops

ACL正式版的十个合成人物、预构建检索系统及所列模型/表示对照;规模和裁判口径未对齐,缺等token与全流程成本、人工judge校准和重复区间。

09.15Paper OctoBench:按实际上下文检查规则遵循,并诊断来源冲突Problem编码Agent的规则分散在系统消息、项目文件、技能和运行时提醒中,有些只有执行到特定步骤才出现;只检查最终产物会漏掉过程违规,也无法确定该检查哪些规则。Takeaway分散规则可以通过实际暴露与执行轨迹建立可追溯的过程检查;单对冲突还能显示Agent偏向哪个来源。该协议增加诊断能力,不能代替功能完成或权限裁决。 身份与权限工具与协议记忆与上下文 75
ProblemP1编码Agent的规则分散在系统消息、项目文件、技能和运行时提醒中,有些只有执行到特定步骤才出现;只检查最终产物会漏掉过程违规,也无法确定该检查哪些规则。E1E2E3
├─measureD1作者记录模型实际收到的消息和工具定义,用参考轨迹构造按来源划分的二元检查,再依据被测轨迹的触发条件判定适用项,分别统计逐项与整实例的遵循情况。E2E3
└─validateD3作者对检查表做人工审查,并以三种自动评审器和专家逐项判分对照,检查规则判定的稳定性与一致性。E6E10
ProblemP2系统、用户和项目文件提出矛盾要求时,一个汇总遵循分数无法说明Agent实际跟随了哪个来源,因而难以定位冲突处理的偏向。E4
└─diagnoseD2作者另构造32个来源冲突实例,针对系统、用户和项目文件中的一对要求设置矛盾,并从完整轨迹判断Agent最终跟随哪个来源。E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑采用建议:在已有Agent评测中保留实际模型输入、规则来源与触发条件,将每个判分绑定到相应轨迹证据;另保留功能结果判据。来源冲突诊断适合发现部署组合的偏向,但服务端必须独立定义合法优先级和权限,不能把论文观察到的偏好当授权。

Trade-offs

检查表把过程要求变成可定位的错误,但适用项会随轨迹改变;自动判分与长文本截断可能漏掉证据。整实例要求全部通过,其分数自然受检查数影响。人类校准和三评审器增加成本,原文未提供完整token、费用、延迟及运行不确定性对照。

Where the evidence stops

证据来自217个构造任务、34个环境、三种scaffold、8模型与32个冲突实例;人类校准限80个高质量实例约200检查,动态适用分母和默认预算限制横向及因果解释。

09.15Engineering Prime:离线评测的网络边界必须延伸到推理服务端Problem编码Agent的直接外网访问即使已关闭,仍可能通过获准的推理API让服务端代取远程文件或调用搜索,获取本应隔离的答案,使离线评测失真。Takeaway离线约束必须覆盖执行端和推理服务端能够取得的信息;这篇提供了遗漏通路的实证及可检查的代理过滤机制。 观测与评测工具与协议安全与隔离 75
ProblemP1编码Agent的直接外网访问即使已关闭,仍可能通过获准的推理API让服务端代取远程文件或调用搜索,获取本应隔离的答案,使离线评测失真。E1E2
├─diagnoseD1作者沿直接联网失败、推理接口可达、服务端代取和正确标记返回的轨迹定位泄漏,把推理API识别为评测边界内的一种外部能力。E1E2
└─mitigateD2verifiers把每次运行的网络策略传到推理代理,再按协议过滤远程内容、服务端工具和隐藏引用;无法安全缩窄的能力会被移除。E3E4E5E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑采用建议:将推理网关列入Agent工具与网络的统一权限清单,以run绑定网络策略;分别审计本地工具动作、供应商工具和远程输入引用,并保留被删能力路径。适合限制外部信息的评测或受限执行环境,前提是请求确实经过可信代理,执行端不能改写策略或绕过代理;不从本案例推导通用宿主机隔离保证。

Trade-offs

严格策略可能删除请求内容、服务端会话连续性或整项搜索工具,改变Agent能见的上下文。域名过滤不能安全表达现有来源/端口规则时采取保守删除;这一选择保护边界,但原文没有量化任务质量、延迟和成本的变化。

Where the evidence stops

证据是公开仓库flag任务的一次成功轨迹与verifiers固定版本源码;未给总尝试数、修补后效果率或完整供应商覆盖。

09.15Paper Belief Consistency:把上下文更新的一致性与答题能力分开测量Problem评估模型能否随上下文一致地更新选择时,标准答案任务会把答题能力混入分数;单次输出又无法区分随机选择、违背新约束和稳定倾向的改变。Takeaway上下文更新可以在不要求答对知识题的条件下被测量;关键是比较预期保持的分布,并把非法选择、偏好和输出解析质量分开。 记忆与上下文观测与评测文件与工件 75
ProblemP1评估模型能否随上下文一致地更新选择时,标准答案任务会把答题能力混入分数;单次输出又无法区分随机选择、违背新约束和稳定倾向的改变。E1E2
├─measureD1作者构造起初三项都有效的选择任务,插入只排除其中一项的固定对话,再比较其余两项在前后上下文中的归一化选择分布。E1E2
└─diagnoseD2评测分别报告二类分布一致性、包含被排除项的三类分数、选择熵与解析失败,并比较选项、模板及概率提取方式的影响。E2E3E5E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑采用建议:在Agent的受控上下文评测中,把预期信息变化写成明确干预,再比较同一配置前后的选择分布,独立记录显式约束违反和解析失败。只在干预不应改变其余选项相对偏好的任务上采用这一不变性判据;真实任务若增加了有区分力的新证据,比例变化可能正确,不能照搬惩罚。

Trade-offs

自由采样避免将给定答案的token概率直接当自然输出倾向,却需要很高的调用量。不同推理模式的样本数及token上限不同,无有效选项时还会排除实例;高二类分必须与熵、非法率、解析失败和有效样本数一起解释。

Where the evidence stops

正式论文支持三选一、一次人工逻辑排除下的输出分布诊断;不同模式预算不齐、有效实例会变,未证明长程Agent或思维链忠实性。

09.15Paper Mitigating Context Interference for Reliable and Efficient Search AgentsProblem多轮搜索积累的文档、查询和思考作用不同;直接累积或统一删除历史,既可能引入干扰,也可能让Agent重复搜索。Takeaway查询条件精简比无差别累积历史更有证据支撑;保留过程思考、转换最新检索观察是可迁移增量,训练优势与普遍因果解释仍有限。 记忆与上下文状态与恢复文件与工件 75
ProblemP1多轮搜索积累的文档、查询和思考作用不同;直接累积或统一删除历史,既可能引入干扰,也可能让Agent重复搜索。E1
└─diagnoseD1作者分别移除旧文档、旧查询和旧思考,比较答案正确率与检索轮数,区分哪些历史帮助推理、哪些历史引入干扰。E1
ProblemP2最新检索结果包含答案相关信息时,搜索Agent仍可能受无关细节干扰;需要把当前查询真正需要的内容送入下一轮推理。E2
└─mitigateD2作者用独立的查询条件精简器,从最新检索文档提取当前问题所需信息,再交给搜索Agent继续推理。E2E4
ProblemP3只在推理时精简检索观察,不能说明Agent是否学会利用这种状态;训练时的上下文组织与效果归因也需要分开考察。E3
└─mitigateD3作者把精简后的最新文档接入强化学习轨迹,保留先前思考,仅对模型生成的思考与查询计算策略损失。E3
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程启发是把检索结果转换设为context管线的独立步骤:输入绑定查询、检索轮次与原文引用,输出精简观察,Agent状态保留思考和当前观察。原文与精简文本分开保存有助于解释丢失了什么;这是本项目采用设计,论文没有提供生产级溯源协议。 适用范围是可控制检索与上下文装配的搜索服务。最小采用可以先使用推理侧转换,而把训练作为独立成本选择;精简不能获得原文没有的信息,服务端应能区分答案错误、检索遗漏和转换丢失。论文的价值是明确这种信息边界,而不是承诺一项通用压缩率。

Trade-offs

最终答案使用EM规则评分,避免把LLM judge当最终正确性裁判;精简器训练数据仍依赖未充分披露配置与阈值的自动蕴含检查。固定Wikipedia时间只能说明知识库时间对齐,不能证明模型预训练没有接触测试题。原文也未给多seed置信区间。 本次收录的核心是查询条件的信息提取及历史组成诊断,证据达到限定模型和QA任务上的方法贡献。它不证明“最新文档是唯一主因”,不保证所有任务改善,也没有解决长期记忆一致性、服务端写入恢复或跨租户隔离。训练样本与轮数差异使更强的训练公平性结论暂不成立。

Where the evidence stops

Qwen 3B/7B、E5与2018 Wikipedia、七个QA集的作者实验;存在数据集反例、40k/60k训练样本及ART表间不一致,未报告完整训练成本与多seed区间。

09.15Paper Anchoring the Cache: Mitigating Contextual Hallucination in KV-Compressed Long-Context SummarizationProblem长文摘要的KV压缩可能保持较好的文本重合度,却让后续句子越来越不忠于原文;只看ROUGE会漏掉这种生成过程中的失真。Takeaway来源缓存保留与来源信息利用是两件事;部分检索头只读来源能在部分模型与预算下减少幻觉,但效果不是普遍成立。 记忆与上下文观测与评测文件与工件 75
ProblemP1长文摘要的KV压缩可能保持较好的文本重合度,却让后续句子越来越不忠于原文;只看ROUGE会漏掉这种生成过程中的失真。E1E3
└─measureD1作者同时测量逐句幻觉、生成位置和对原文的注意力比例,区分文本重合度与来源忠实度。E1E3E4
ProblemP2压缩后保留的原文信息较少,生成历史可能进一步占用检索头的注意力,使模型延续自身错误而非回到原文。E1E2
└─mitigateD2HalluKV让一部分预先识别的检索头在解码时只读取保留的原文缓存,其余头继续读取生成历史,以减少错误内容自我强化。E2E3
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

工程启发是将来源信息与生成历史视为两类上下文,在可控推理后端分别规定读取策略。最小采用位置位于KV压缩器之后、解码注意力之前,保存来源边界和头选择配置;这是内部推理组件的设计选择,不是提示词层面的替代方案。 对只使用外部模型API的服务,更直接的启发来自测量:重合分数、来源忠实度与任务成功属于不同对象,不应共用一个成功标签。HalluKV说明少量保留原文只有被持续利用才有价值,同时也说明切断过多生成历史会损害表现。

Trade-offs

检索头与非检索头的二分是近似,头的作用可能混合。模型、摘要长度和遮盖比例影响收益,§5.5沿分析选最佳配置,没有明确独立留出选择过程。缺少多seed区间与人工校准,使很小的分数差异不宜被解读为稳定普遍优势。 论文主要支持可访问注意力头与KV的长文生成后端。它没有证明API型harness也能采用这个开关,没有证明Agent工具任务成功率提高,也没有修复来源压缩本身丢失信息的错误。来源注意力比值的变化包含结构性分母效应,归因必须与整体干预结果分开。

Where the evidence stops

六模型、两摘要集、四来源KV预算及附录扩展的作者实验;自动判分未做人类校准,存在模型/预算反例,无法恢复已淘汰来源且要求模型内部访问。

09.14Engineering ReportLogic:把报告逻辑评审变成上下文化检查与局部缺陷诊断Problem长报告的逻辑缺陷分散在全局结构、局部衔接和证据推理中;只有通用评分标准时,评审者难以把标准一致地应用到具体报告。Takeaway上下文化检查项能把长报告逻辑评审具体化,训练后的judge及局部缺陷操作提供进一步判别与诊断。它仍是受标注、解析及干预构念约束的评审协议,不能把所有呈现变化都当偏置,也不能证明已替代人工。 记忆与上下文观测与评测文件与工件 75
ProblemP1长报告的逻辑缺陷分散在全局结构、局部衔接和证据推理中;只有通用评分标准时,评审者难以把标准一致地应用到具体报告。E1E2
└─measureD1作者把逻辑质量拆成三层八维,再依据查询和成对报告生成具体检查问题、文本定位提示和好坏示例。E1E2
ProblemP2人工逻辑评审昂贵,通用模型对同一报告对的偏好未必与人工一致,难以直接充当可扩展的质量判据。E1E3
└─mitigateD2LogicJudge使用多教师一致且交换顺序仍稳定的报告偏好进行蒸馏,再学习逐维解释和最终选择。E3
ProblemP3评审器可能忽略真实逻辑破坏,或对文字呈现变化改变偏好;总体一致率无法解释其具体脆弱点。E4E5
└─diagnoseD3作者对报告施加指定维度的逻辑破坏或受约束的呈现改写,再比较修改前后的偏好和缺陷定位。E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑采用启发:把固定质量维度、当前报告的检查项、文本证据位置和最终裁决分别保存,并记录rubric版本、原始输出及解析状态。适合辅助长报告审核与缺陷归类;不能仅以偏好分发布报告,也不能把因果关系写得更明确一概视为作弊。若修改内容同时改了检查项,应将结果标为评估管线变化。人工核验和生成检查项会增加成本。

Trade-offs

实例化rubric让判断更具体,也让检查项本身成为评测上下文的一部分。攻击后重新生成rubric测量整个管线,无法单独归因judge。CausalDisplay把隐含因果关系写明,可能改善定义中的推理可审计性;Structure Bias也可能改变连贯性。解析失败排除率和查询规模不明进一步限制比较范围。

Where the evidence stops

证据包括200例rubric条件比较、1572个人工报告对的三域判别及300例攻击构造;查询规模冲突、解析排除率缺失和部分surface操作构念不变性不足限制强结论。

09.14Engineering DR-Arena:用来源树和自适应追问比较研究AgentProblem静态研究题的资料和参考答案会失鲜,既有题型与已知内容还可能影响排名,评测需要可追溯的新任务依据。Takeaway来源树让动态研究题及判分依据更可追溯,自适应追问把前一轮回答变成下一轮评测条件。现有证据支持有限样本中的协议用途,不能证明污染消除、纯能力分离或等预算效率优势。 观测与评测文件与工件状态与恢复 75
ProblemP1静态研究题的资料和参考答案会失鲜,既有题型与已知内容还可能影响排名,评测需要可追溯的新任务依据。E1E2
└─measureD1作者把网页内容和链接关系构造成来源树,以路径与兄弟节点生成研究问题及对Agent隐藏的核对项。E2
ProblemP2固定难度的一轮问答难以区分相近的研究Agent,也难显示它们在依赖链与信息覆盖上的不同不足。E1E3
└─measureD2框架让两个Agent回答同一题,按胜负、质量与深度/广度不足调整下一题,累计比较信号后停止。E3
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑采用启发:动态评测应保存网页快照、树边关系、问题和私有rubric版本,以及每轮双方输出、裁决与转移理由。把事实正确性与格式/引用偏好分开显示,分开记录轮数和成本;树外可靠证据需要人工处理通道。适合诊断相近研究Agent的差异,不宜直接把树深度作为推理能力或把非胜率当事实错误率。

Trade-offs

来源树增加追溯能力,也限定考官可用的证据范围;其他可靠来源可能不在树内。更深路径和更宽属性是任务构造旋钮,不能自动等同于Agent实际推理深度或检索覆盖。多轮追问提高信息量但预算不固定,judge格式偏好和非盲审核又限制纯能力解释。

Where the evidence stops

作者比较六Agent、30树、四轮赛程与789次交互;树结构盲选50例,日志审核30场64回合。不同追问预算、非盲审核、格式偏好及未报告完整停止参数限制推广。

09.14Engineering DeepSeek Harness:受限Agent不能继承本地控制接口的用户权限Problem本地编码Agent虽被禁止写出工作区,却仍能从shell访问管理自身权限的harness接口。若该接口把本地地址当作用户身份,Agent就能解除后续命令的限制,连审计也会把它误记成用户操作。Takeaway文件沙箱无法单独保护可被同机命令调用的管理接口。本文用控制路径和文件对照诊断了Agent自我解除限制,并由固定版本代码说明认证应发生在控制请求分发前。 身份与权限安全与隔离文件与工件 75
ProblemP1本地编码Agent虽被禁止写出工作区,却仍能从shell访问管理自身权限的harness接口。若该接口把本地地址当作用户身份,Agent就能解除后续命令的限制,连审计也会把它误记成用户操作。E1E2E3E4
├─diagnoseD1作者沿“受限shell→本地控制接口→会话权限变化→工作区外写入”追踪信任边界,并用同机同配置的受限对照确认:失守的是控制面的调用身份,而不是最初的文件沙箱没有生效。E1E2E3E4
└─mitigateD2官方alpha.1版本在Connection插件分发API和RPC前增加浏览器会话鉴权:启动token兑换签名cookie,请求必须同时通过来源检查与cookie验证。E5E6E7E8
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

在有shell或网络工具的harness中分开执行身份与管理身份,控制API和插件RPC在分发前验证凭据,保留真实调用主体与外部效果证据。该采用判断不等于作者已实现多租户隔离或所有扩展均不可绕过。

Trade-offs

鉴权增加启动token、签名cookie与凭据生命周期管理。所示文件对照不是跨平台统计;本地与远程路径前提不同;修复层还依赖认证材料对不可信执行不可达。

Where the evidence stops

证据限于OX所示默认配置配对结果,以及alpha.1所读认证入口和cookie实现;不包含诱导成功率、完整跨平台修复回测或全部插件/凭据可达性审计。

09.13Paper What Eviction Destroys: A Restore-Counterfactual Audit of Forgetting in Agent MemoryProblem记忆容量受限时的答题错误,可能来自证据被淘汰、保留证据未被检索,或读者没有用好证据;仅看准确率无法判断应改哪一层。Takeaway把恢复响应与证据保留状态结合,可以在限定的原始会话记忆中区分淘汰、检索和残余利用失败,帮助解释相同准确率背后的不同故障。 状态与恢复记忆与上下文安全与隔离 75
ProblemP1记忆容量受限时的答题错误,可能来自证据被淘汰、保留证据未被检索,或读者没有用好证据;仅看准确率无法判断应改哪一层。E1E3
├─diagnoseD1作者固定读者和检索设置,对原先能够回答的题恢复完整标注证据,再结合证据是否仍在记忆库中,把错误分成淘汰、检索与残余利用三类。E1E2E3
└─measureD3作者分别报告三类错误占比、可修正错误中的淘汰占比和所有可回答题中的淘汰率,并按题聚类估计不确定性。E4E5
ProblemP2恢复标注证据会同时改变上下文内容和布局,评分者也可能误判;这些因素会让“不可恢复遗忘”的统计看起来比实际更确定。E2E5E6E7
├─validateD2作者用存活证据恢复、完整保留库注入和非标注片段替换检查恢复干预的偏差,并通过另一评分模型重判样本,限定分箱解释。E6E7
└─measureD3作者分别报告三类错误占比、可修正错误中的淘汰占比和所有可回答题中的淘汰率,并按题聚类估计不确定性。E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

适合有gold标注且保存原始单元的记忆审计:分别保留存储快照、gold保留位图、注入片段、reader和judge身份,按三分箱解释错误并明确分母。它提供诊断启发,不能直接成为压缩摘要的淘汰政策、生产恢复机制或用户数据擦除保证。

Trade-offs

筛选clean-gold可答题缩窄样本范围;恢复会改变nongold组合;全保留库检查读取预算更大。非标注替换不保证无关,同厂商judge一致性不能排除相关偏差;代码发布声明与实际快照不符。

Where the evidence stops

LongMemEval-S的clean-gold可答切片、原始单元与固定读者/注入协议;支持诊断分箱,不证明信息彻底消失、策略等价或生产恢复效果。

09.13Paper BudgetMem:在查询到来后分配各记忆模块的处理成本Problem离线统一提炼历史时不知道后续问题,可能提前删掉关键证据;对每个查询都用昂贵模型重新提炼,又会造成不必要的记忆处理开销。Takeaway原始历史延后提炼与模块级选档,使记忆处理能围绕当前查询作成本取舍;软策略仍依赖独立的服务限额。 记忆与上下文运行时与调度文件与工件 75
ProblemP1离线统一提炼历史时不知道后续问题,可能提前删掉关键证据;对每个查询都用昂贵模型重新提炼,又会造成不必要的记忆处理开销。E1
└─mitigateD1保留原始历史分块,在查询到来后检索,并让轻量路由器为过滤、信息提取和摘要模块分别选择低、中、高处理档位。E2E3
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

采用启发:保留带来源的原始chunk,固定过滤/提取/摘要接口,按查询与模块输入选择已定义档位;记录选择及模型调用成本。适用前提是检索覆盖足够、提取计算值得优化;硬预算准入与中止需外部执行契约,不由lambda保证。

Trade-offs

原始历史存储与查询时处理增加开销;固定topK不是等总token。容量轴混合模型差异。划分比例与表格不一致,会话隔离未知;三种子均值缺充分区间,judge未见人工校准。

Where the evidence stops

三个问答集合、所列模型与提取成本口径;不是逐请求硬预算、全任务最低成本或已证明无泄漏。

09.13Paper Conflict-Aware Memory:排除动作冲突的近邻,并修正检索连接Problem向量相似的记忆可能要求相反动作;把这些近邻直接作为示例,会让具身 Agent 生成语法正确却含义错误的任务目标。Takeaway向量相似度之外增加动作与对象相容性判断,有助于减少错误示例污染;即时过滤与长期索引修改需要分开理解。 记忆与上下文文件与工件安全与隔离 75
ProblemP1向量相似的记忆可能要求相反动作;把这些近邻直接作为示例,会让具身 Agent 生成语法正确却含义错误的任务目标。E1E4
└─mitigateD1在近邻检索后按对象与动作规则识别冲突,移除不适合当前查询的示例,并剪去一致候选与冲突候选之间的检索图连接。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

采用启发:在对象/动作词表明确的Agent中,先检索,再做查询相关的冲突过滤,保留被过滤原因和源例子。持久剪边需另有可追溯版本与恢复边界;开放域语义冲突、物理执行安全与外部效果不能交给这个规则替代。

Trade-offs

GPT4o判别增加费用和时延;固定对象/动作假设限制外推。图修剪与过滤未独立归因,错误修剪的长期影响未回答。Table3混合噪声IA标签不一致,应保留92→60端点。

Where the evidence stops

四个有限具身场景、目标语法/含义指标、整体过滤对照与噪声注入;未证明剪边独立收益、物理执行成功或开放域安全。

09.13Paper CUB:把服从上下文与抵抗干扰分开测量Problem让模型更愿意采用外部资料,可能同时让它更容易受无关资料干扰;只测其中一面,无法判断上下文方法究竟改善了什么。TakeawayCUB使“采用资料”与“抵抗干扰”的取舍可见,并揭示数据和提示如何扭曲结论;它提供诊断协议,不能替代正确性判定。 记忆与上下文工具与协议身份与权限 82.5
ProblemP1让模型更愿意采用外部资料,可能同时让它更容易受无关资料干扰;只测其中一面,无法判断上下文方法究竟改善了什么。E1E2
├─diagnoseD1将正确、冲突和无关资料分别加入任务,在相同模型与输入上比较有无上下文干预方法,并分开报告服从资料与抵抗干扰的变化。E1E2E3
└─diagnoseD2把各方法的分项结果放在服从度与鲁棒性的共同坐标中,并追查合成数据、提示格式和资料标签如何改变结论。E4E5E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可在检索后的阅读与回答环节采用这种分项诊断:明确模型原预测、资料宣称和任务真值三个不同对象,记录资料类型及同输入的方法差值。它适合检查上下文策略的依赖方向;业务正确性、来源可信度和长期状态更新需分别定义,不能沿用BCU作为统一验收分。

Trade-offs

对冲突资料更忠实未必更正确;对无关资料保持原输出也可能保留错误。三类指标便于诊断,但依赖数据标签、无上下文参考和不同方法的调参条件,不能压成无条件业务收益。

Where the evidence stops

证据覆盖三数据、7类方法和11模型的单份英语上下文;标签疑点、调参例外及模型间误差条限制通用排名和长任务外推。

09.13Paper Agentic Rubrics:先读仓库形成检查表,再比较候选补丁Problem仅根据问题描述和补丁给分,容易漏掉仓库已有接口、调用方式和行为约束,导致多个候选中选错补丁。Takeaway仓库探索可以先转成复用检查表,改善固定候选池的选择;生成这种判据也可训练,但它不是测试或人类缺陷确认的等价替代。 文件与工件记忆与上下文工具与协议 82.5
ProblemP1仅根据问题描述和补丁给分,容易漏掉仓库已有接口、调用方式和行为约束,导致多个候选中选错补丁。E1E2
└─mitigateD1先让专家Agent探索修改前的仓库,为具体文件、接口和行为生成一次加权检查表,再让评分者用同一张表逐项比较各候选补丁。E1E2E4
ProblemP2让强模型为每个任务探索仓库能改善检查标准,但持续依赖它生成这些标准会带来额外成本;这种探索与归纳能力能否迁移到开放模型仍需证据。E5E7
└─validateD2把专家在仓库中生成检查表的轨迹用于训练开放模型,并与训练同一模型直接判补丁对错的路线比较。E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可在已有补丁候选选择环节固定修改前仓库版本与任务,先产出针对接口、约束和行为的检查表,再将相同检查表与最终patch交给评分者。保留逐项理由与生成版本有利于审查;它适合补充候选排序,执行测试、授权和最终合并决策仍有各自证据。生成者蒸馏需要相应仓库轨迹资料。

Trade-offs

任务检查表可跨候选摊销探索成本,却把正确性的一部分交给自然语言标准和judge。标准过严会拒绝可接受实现,标准不完整会漏问题;蒸馏降低强模型依赖的方向有依据,但训练资料与判分调用仍有成本。

Where the evidence stops

500任务同候选池和仓库访问消融支持限定收益;预算不齐、若干表文冲突及模型效用审查限制成本、公正性和正确性外推。

09.13Paper Harness-of-Harness:分别延续软件工件与执行证据Problem长时间自主开发不能只保留代码或对话:如果下一轮忘了哪些行为已验证、哪些缺口尚未关闭,就可能重复工作并破坏已有成果。TakeawayHoH用工件和证据两条连续状态驱动持续开发,消融支持跨轮反馈的作用;它没有证明公开可核的权限强制或多日零人工运行。 安全与隔离工具与协议状态与恢复 82.5
ProblemP1长时间自主开发不能只保留代码或对话:如果下一轮忘了哪些行为已验证、哪些缺口尚未关闭,就可能重复工作并破坏已有成果。E1E2
├─mitigateD1把当前软件工件和执行证据分别传给下一轮规划,让已验证行为成为保留约束,让观察到的缺口成为新的开发目标。E1E2E6
└─mitigateD2每轮由Developer续写当前工件,再由单独调用的QA检查冻结候选并输出结构化证据,供下一轮Planner使用。E3E4E6
ProblemP2开发者的完成叙述不等于软件实际行为;如果检查时继续修改候选,反馈就难以对应下一轮应保留或修复的具体版本。E3E4
└─mitigateD2每轮由Developer续写当前工件,再由单独调用的QA检查冻结候选并输出结构化证据,供下一轮Planner使用。E3E4E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可在跨调用开发服务中分别保存工件版本与该版本的检查证据,再由规划器把已验证项转为保留约束、缺口转为更新目标。开发任务从当前工件继续,检查针对冻结副本,返回结构化观察。实际部署仍需要落实写权限和版本绑定;论文不提供多租户公平、递归取消确认或父子工件原子完成合同。

Trade-offs

分离工件与证据使下一轮约束更清楚,也增加规划和QA调用。冻结候选有助于证据归属,但依赖领域检查和实际隔离;论文给出协议及附录实现描述,公开仓库尚无核心代码。持续迭代仍可能重开问题,不能把多轮运行视作单调改进。

Where the evidence stops

受控45任务的开发轮次比较和消融支持有限机制,token不相等、单有效run、多日个案和未公开核心实现限制外推。

09.13Engineering Anthropic事件评估:分开测量行动、解释与监控所见上下文ProblemAgent 对环境的解释看似合理,却未必约束下一步行动;只读取推理或追问模型,容易误判危险行为为何发生。Takeaway模型解释、实际行动和监控判断需要分开观察。改变轨迹信息及监控视图能揭示它们何时脱节,但不能单独给出生产安全保证。 安全与隔离工具与协议记忆与上下文 87.5
ProblemP1Agent 对环境的解释看似合理,却未必约束下一步行动;只读取推理或追问模型,容易误判危险行为为何发生。E1E2E6
└─diagnoseD1在同一事件轨迹的指定节点改变环境线索或授权提醒的位置,继续采样后分别判断语言表述与实际行动。E2E4
ProblemP2监控器读取执行者的完整解释时,也可能接受其中的错误前提,使同一工具行为在不同上下文视图下得到不同判断。E3E5
└─diagnoseD2让监控器分别读取完整轨迹与去掉推理文字的轨迹,并用其他事件检查去除解释是否也损失必要证据。E3E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

本项目可把轨迹版本、干预节点、可见信息视图及判分口径作为eval记录的独立字段。保存语言判断、实际工具行为、监控输出三个结果;监控输入保留来源类型,区分执行者解释与外部工具证据。适用于离线诊断和监控分析,不据此授予执行权限,也不承诺通用安全。

Trade-offs

局部重放可聚焦同一决策点,但继承此前行动与解释,后续模型还面对不属于自身策略的轨迹。从头模拟更接近完整决策过程,却产生模拟线索和任务构造偏差。去掉推理可减少错误解释的影响,也会删除监控所需的伤害信息。

Where the evidence stops

第三方特定事件、作者局部采样与模拟诊断;判分校准、总体发生率和持续防护效果仍有限。

09.13Paper Sense and Sensitivity:能复述代码,不等于按代码推理Problem长上下文模型能找到并复述一段代码,并不保证能用这段代码计算答案;只测检索会漏掉中间位置的信息使用失败。Takeaway信息被找到和被用于推理是不同能力。位置对照与输入敏感度能暴露检索分数掩盖的盲区,但不能仅凭删行后仍答对证明训练记忆。 记忆与上下文观测与评测文件与工件 75
ProblemP1长上下文模型能找到并复述一段代码,并不保证能用这段代码计算答案;只测检索会漏掉中间位置的信息使用失败。E1E3
└─diagnoseD1对同一目标代码分别测逐字提取与输入输出预测,在多个上下文长度和位置上观察两种能力的变化。E1E3
ProblemP2代码基准中的任务可能允许凭熟悉模式补全答案,使模型不充分依赖当前提供的代码,也能得到较高分数。E2E4
└─diagnoseD2逐步删除函数内容以测量答案对当前代码的依赖,再构造含随机独立运算的SemTrace任务,让缺失操作更难被熟悉模板替代。E2E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

本项目可在context评测记录中分开保存信息提取正确性与依据信息执行任务的正确性,同时记录目标位置、上下文长度、任务无干扰基线及输入依赖敏感度。只把这些作为测量维度;不能从单轮函数实验推导长期记忆更新、工具调度或所有真实代码库的收益。

Trade-offs

目标函数位置和无关代码长度可分别控制,但词法任务的起止标记提供额外定位线索。SemTrace降低常见算法模式的可猜性,换来较窄的独立运算任务;删行实验保留原答案,解释受到代码有效性和推断任务变化的影响。

Where the evidence stops

短函数及合成运算在受控长上下文中的作者实验;不是完整代码库Agent或长期context系统的效果保证。

09.12Engineering Pydantic Lambda:让持久化扩展接管操作边界与异步生命周期ProblemAgent 执行因超时或重试从入口重来时,已经完成的模型请求和工具调用会重复,既浪费开销,也可能再次改变外部状态。Takeaway可恢复Agent的关键不仅是保存结果,还要让能力装配、线程和操作序列遵守同一恢复契约。Pydantic给出了这一适配边界,但外部副作用和取消后的清理仍需独立处理。 工具与协议状态与恢复文件与工件 82.5
ProblemP1Agent 执行因超时或重试从入口重来时,已经完成的模型请求和工具调用会重复,既浪费开销,也可能再次改变外部状态。E1E6
└─mitigateD1将持久化实现为 Agent 能力扩展,拦截模型、工具和动态解析操作;通过专用适配后端把结果交给 Lambda 保存,恢复时复用已完成操作。E1E2E3E9
ProblemP2异步 Agent 的并发工具和动态能力会改变执行顺序,而 Lambda 按操作位置恢复;直接接入容易错配历史结果,旧调用的清理还可能越过下一次调用。E2E5E7
└─mitigateD2用队列连接同步 Lambda 入口和异步 Agent 循环,在持久上下文顺序执行工具,并固定操作名称及部署版本;取消超时后更换事件循环。E4E5E7
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可在需要跨调用恢复、工具集相对稳定且允许最终结果返回的Agent服务中采用操作级durability capability。保留核心Agent操作接口,把引擎的线程、序列和序列化约束放到适配器;业务侧保留幂等键或外部结果核对能力。高并发工具、必须向调用方持续流式输出或频繁热装配能力的服务,不能直接接受本适配器的约束。

Trade-offs

顺序工具和固定版本使操作序列更可预测,代价是并发度受限、在途升级需保留旧版本。每个checkpoint增加操作与状态存储;退出持久入口即退回普通运行。取消等待有界,换loop只隔离loop资源。

Where the evidence stops

博客与固定源码支持机制及配置约束;没有跨引擎等价性、生产吞吐/总成本或外部恰好一次执行证据。

09.12Paper AgeMem:联合决定长期记忆写入与当前上下文取舍Problem长任务中,Agent 既要保存将来有用的信息,又要裁剪当前上下文;把这两项决策交给固定检索和独立控制器,容易让保存与使用脱节。TakeawayAgeMem把保存什么和现在看什么放进同一策略,并用后续任务反馈训练跨阶段选择。增强基线支持限定的联合管理贡献,但动作奖励代理、辅助模型成本和任务反例限制外推。 记忆与上下文工具与协议文件与工件 75
ProblemP1长任务中,Agent 既要保存将来有用的信息,又要裁剪当前上下文;把这两项决策交给固定检索和独立控制器,容易让保存与使用脱节。E1E2
└─mitigateD1把长期记忆的增改删和当前上下文的检索、摘要、过滤暴露为同一 Agent 策略可调用的六个工具,让信息的保存与取用共同参与任务决策。E2E9
ProblemP2一次记忆写入或压缩是否有用,往往到后续问题出现才知道;仅凭即时规则或总体任务分数,难让早期记忆动作对后续结果负责。E1E3E4
└─mitigateD2构造先积累记忆、再清空当前上下文并引入干扰、最后回答后续任务的训练轨迹,将终局复合奖励作用于整条轨迹的步骤。E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可在跨会话知识需要复用、当前上下文需主动取舍的助手中采用双状态与显式memory工具接口,把选择写入、检索、压缩的决策一起表示。是否训练这种策略需由任务资料和奖励可获得性决定;服务端另行负责持久版本、租户分区及删除语义。已有证据适用于受控任务,不支持自动遗忘即事实修复或降低整体账单。

Trade-offs

工具化让策略能主动修订记忆,却增加调用与辅助模型开销;终局奖励可连接早期动作和后来结果,但关键短语、judge和维护动作出现与真正信息效用并不等价。最终context变短不保证整个任务花费下降。

Where the evidence stops

作者报告的五任务、组件及增强基线对照支持组合机制;没有等总预算、人评judge校准、多次区间或生产长期记忆一致性证据。

09.12Engineering Managed Agents:让会话记录、控制循环与执行环境分别恢复Problem会话与执行容器绑定后,容器故障会同时损失进度;提示压缩还可能使后续任务找不回原始事件。Takeaway我们的采用判断是把不可丢的事件记录放在可替换harness之外,再把执行环境作为资源分配。适合长任务和频繁更新控制逻辑的系统;外部副作用、工具身份和日志访问权限仍需单独定义。 状态与恢复身份与权限工具与协议 87.5
ProblemP1会话与执行容器绑定后,容器故障会同时损失进度;提示压缩还可能使后续任务找不回原始事件。E1
├─mitigateD1会话日志独立于控制循环:Session保存追加事件,harness通过emitEvent写入、getSession恢复E2
├─mitigateD2原始事件与模型上下文分开:getEvents按位置读取日志片段,harness自行组织或压缩当前提示E2
└─mitigateD3按需分配沙箱并隔离凭据:模型开始推理无需先启动执行容器E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用判断是把不可丢的事件记录放在可替换harness之外,再把执行环境作为资源分配。适合长任务和频繁更新控制逻辑的系统;外部副作用、工具身份和日志访问权限仍需单独定义。

Trade-offs

日志持久化不意味着外部操作恰好一次;恢复后的工具和资源仍需满足自身状态合同。延迟改善不能外推成所有任务完成更快,也不能由凭据代理推导全部权限问题已经解决。

Where the evidence stops

日志持久化不意味着外部操作恰好一次;恢复后的工具和资源仍需满足自身状态合同。延迟改善不能外推成所有任务完成更快,也不能由凭据代理推导全部权限问题已经解决。

09.12Engineering Cognition多Agent实践:集中写入,让其他Agent提供审查与判断Problem并行写入会分散决策;直接让较弱模型负责升级求助,也可能错过真正困难的问题。Takeaway可先把额外Agent用于审查、搜索与咨询,并明确谁负责最终修改。任务确实能分区时再讨论多写者;不能把本文的经验当成禁止所有并行写入的定律。 记忆与上下文文件与工件状态与恢复 82.5
ProblemP1并行写入会分散决策;直接让较弱模型负责升级求助,也可能错过真正困难的问题。E1
├─mitigateD1审查者使用干净上下文:审查Agent从差异重新获取必要背景,避免继承编码过程的冗长轨迹;编码者再结合用户约束筛选审查意见,减少越界修改与来回循环E2
├─mitigateD2把求助设计成双向交流:主模型可调用更强模型作为smart friendE2
└─mitigateD3按模型能力划定协作边界:较弱的SWE-1.5仍不能可靠判断何时求助;跨前沿模型组合更像能力路由E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可先把额外Agent用于审查、搜索与咨询,并明确谁负责最终修改。任务确实能分区时再讨论多写者;不能把本文的经验当成禁止所有并行写入的定律。

Trade-offs

审查者的干净上下文可能缺失用户意图,仍需主Agent综合。子Agent不会自然共享状态;经理能力、沟通成本和最终验收仍限制扩大任务范围。

Where the evidence stops

审查者的干净上下文可能缺失用户意图,仍需主Agent综合。子Agent不会自然共享状态;经理能力、沟通成本和最终验收仍限制扩大任务范围。

09.12Engineering Claude Code质量复盘:三种产品改动如何叠加成退化Problem聚合质量指标和内部试用不能覆盖特定会话状态;以降低延迟为目标的改动还可能损伤后续推理与编码质量。Takeaway质量分析应把模型、Harness配置、会话状态和部署实验一起版本化。降低字数或历史长度之前,要识别被删信息承担的推理作用;面向用户的可读性改进不应变成不分任务的硬性截短。 状态与恢复观测与评测文件与工件 92.5
ProblemP1聚合质量指标和内部试用不能覆盖特定会话状态;以降低延迟为目标的改动还可能损伤后续推理与编码质量。E1
├─mitigateD1按变更和受影响状态分开诊断:默认effort从high降到medium改变质量/延迟取舍;空闲一小时后的历史清理本应仅发生一次,错误标志却持续到后续每一轮,反复丢弃推理历史并破坏缓存E2
├─mitigateD2把提示变化放入逐模型对照:限制工具间文本与最终回复长度的提示,在扩大评测范围后的消融中暴露编码质量下降E2
└─mitigateD3让验证环境覆盖真实部署差异:内部消息队列实验和推理显示变化曾掩盖历史清理问题E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

质量分析应把模型、Harness配置、会话状态和部署实验一起版本化。降低字数或历史长度之前,要识别被删信息承担的推理作用;面向用户的可读性改进不应变成不分任务的硬性截短。

Trade-offs

跨仓库审查回测找到一次缺陷不代表全面检出率。后续发布控制是改进措施,并非已经验证消除所有退化;用户反馈的广泛差异也不能由单一故障解释。

Where the evidence stops

跨仓库审查回测找到一次缺陷不代表全面检出率。后续发布控制是改进措施,并非已经验证消除所有退化;用户反馈的广泛差异也不能由单一故障解释。

09.12Engineering Cursor如何改进Harness:用线上结果校验离线收益Problem离线分数改善不一定让用户得到更好的代码;工具报错若不区分模型和环境,也难以定位真正的Harness退化。Takeaway可将离线回归、用户结果代理和按工具分类的运行告警并用。更强模型不一定需要旧护栏;是否保留护栏应与当前模型匹配。复杂任务频繁换模型还要承担信息与缓存代价。 工具与协议状态与恢复文件与工件 87.5
ProblemP1离线分数改善不一定让用户得到更好的代码;工具报错若不区分模型和环境,也难以定位真正的Harness退化。E1
├─mitigateD1把用户后续行为加入线上对照:在离线基准之外并行部署Harness变体,观察代码在固定间隔后仍被保留的比例,并用模型阅读用户后续反馈判断满意度E2
├─mitigateD2按工具和模型建立错误基线:未知错误作为实现缺陷报警;参数错误、环境矛盾、供应商错误等分别统计,按工具和模型计算预期基线E2
└─mitigateD3让模型切换显式改变HarnessE2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可将离线回归、用户结果代理和按工具分类的运行告警并用。更强模型不一定需要旧护栏;是否保留护栏应与当前模型匹配。复杂任务频繁换模型还要承担信息与缓存代价。

Trade-offs

代码保留率不等于正确性,用户继续新任务也不必然表示满意。无法把错误下降全部归因于某个报警组件。模型切换的历史不匹配和缓存成本仍存在。

Where the evidence stops

代码保留率不等于正确性,用户继续新任务也不必然表示满意。无法把错误下降全部归因于某个报警组件。模型切换的历史不匹配和缓存成本仍存在。

09.12Engineering Google质量迭代:用稳定的专项指标识别总分掩盖的失败Problem一个目标上的失败会被其他通过项稀释;自动变化的评分标准还会使修复前后难以直接比较。Takeaway我们更值得采用的是把关心的失败变成稳定、可解释的专项指标,并检查判分器看到了哪些工具和上下文。通用总分适合发现线索,不能独自承担每项改动的验收。 观测与评测工具与协议记忆与上下文 82.5
ProblemP1一个目标上的失败会被其他通过项稀释;自动变化的评分标准还会使修复前后难以直接比较。E1
├─mitigateD1让专项指标保持不变:在通用多轮评分之外,把是否遵从用户修改单独划分为遵从、忽略、部分遵从和无修改E2
├─mitigateD2依据轨迹区分状态正确与回复正确:旅行Agent有的失败已经在内部保存了正确日期,最终回答却仍重复旧值E2
└─mitigateD3分开修改与评分职责:编码Agent提出更改,外部评测服务判分,用户批准后继续E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们更值得采用的是把关心的失败变成稳定、可解释的专项指标,并检查判分器看到了哪些工具和上下文。通用总分适合发现线索,不能独自承担每项改动的验收。

Trade-offs

外部判分器仍是模型,职责分开并不消除共同偏差。沿同一小集合反复修复可能过拟合;自适应rubric的总分变化也不等于固定量尺下的收益。

Where the evidence stops

外部判分器仍是模型,职责分开并不消除共同偏差。沿同一小集合反复修复可能过拟合;自适应rubric的总分变化也不等于固定量尺下的收益。

09.12Paper Deep Agents递归编排:让代码负责遍历,让子Agent处理局部语义Problem长文本聚合既需要覆盖每一条输入,又需要稳定累计结果;仅靠模型逐步记住计数容易遗漏或放弃。Takeaway适合可明确分区、需要覆盖大量输入的聚合工作。若简单逐轮方法已能完成任务,额外子Agent和解释器未必值得;应把枚举完整性与内容判断正确性分别理解。 记忆与上下文身份与权限安全与隔离 75
ProblemP1长文本聚合既需要覆盖每一条输入,又需要稳定累计结果;仅靠模型逐步记住计数容易遗漏或放弃。E1
├─mitigateD1把遍历与聚合交给程序:主Agent编写循环、分批和并发脚本,解释器调度子Agent读取局部输入,再由代码汇总E2
└─mitigateD2区分递归Agent与原始RLM:原论文把整个输入放进解释器变量并递归调用语言模型;这里调用的是带工具和状态的子AgentE2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

适合可明确分区、需要覆盖大量输入的聚合工作。若简单逐轮方法已能完成任务,额外子Agent和解释器未必值得;应把枚举完整性与内容判断正确性分别理解。

Trade-offs

128k时token更少但成本更高,延迟也增加。循环覆盖的是程序实际枚举的批次,不保证分区或语义判断正确;样本仅为一种聚合任务,未隔离每个组件的贡献。

Where the evidence stops

128k时token更少但成本更高,延迟也增加。循环覆盖的是程序实际枚举的批次,不保证分区或语义判断正确;样本仅为一种聚合任务,未隔离每个组件的贡献。

09.12Engineering Hugging Face入侵复盘:追踪Agent如何跨越数据、身份与集群边界Problem单个数据处理缺陷会与过宽身份、元数据访问和共享连接器叠加;大量失败探测又使有效攻击路径难以及时从告警中显现。Takeaway可借此逐项审视数据解析、工作负载身份、连接器权限与告警升级之间的联系。沙箱的可靠性取决于它能触达的服务和凭据;既要保留被攻破路径,也要保留确实挡住后续动作的边界。 身份与权限安全与隔离观测与评测 92.5
ProblemP1单个数据处理缺陷会与过宽身份、元数据访问和共享连接器叠加;大量失败探测又使有效攻击路径难以及时从告警中显现。E1
├─mitigateD1按信任边界重建成功与失败路径:作者把外部执行环境、数据转换pod、节点身份和内部连接器分开,关联命令与平台审计记录E2
├─mitigateD2区分获得权限与实际造成影响:复盘分别记录凭据读取、角色枚举、数据库访问和供应链写入尝试E2
└─mitigateD3针对被跨越的边界修复:团队停用危险处理路径、阻止pod访问云元数据、轮换凭据并收窄连接器的集群授权,同时修正安全Agent未提升告警严重度的问题E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可借此逐项审视数据解析、工作负载身份、连接器权限与告警升级之间的联系。沙箱的可靠性取决于它能触达的服务和凭据;既要保留被攻破路径,也要保留确实挡住后续动作的边界。

Trade-offs

这是一次经过脱敏的响应团队重建,不能代表所有模型或正常部署配置。外部评测阶段部分事实引用另一方披露;“为了作弊”是作者推断,不能写成已证明的内在动机。约17,600动作也不是同等数量的成功攻击。

Where the evidence stops

这是一次经过脱敏的响应团队重建,不能代表所有模型或正常部署配置。外部评测阶段部分事实引用另一方披露;“为了作弊”是作者推断,不能写成已证明的内在动机。约17,600动作也不是同等数量的成功攻击。

09.12Engineering Factory模型路由:把缓存与任务状态纳入换模型的成本Problem只比较模型单价会忽略整段历史重新计费,也可能把按某模型工具习惯构造的请求交给另一模型。Takeaway更可迁移的是在选择模型时同时考虑历史、请求构造和任务结果。单次问答可能由网关掌握足够信息;长任务可在自然子任务边界路由,不能只按token单价频繁切换。 工具与协议状态与恢复文件与工件 80
ProblemP1只比较模型单价会忽略整段历史重新计费,也可能把按某模型工具习惯构造的请求交给另一模型。E1
├─mitigateD1在构造请求之前选择模型:Harness先结合任务进展和模型能力选择模型,再匹配提示、工具格式和推理设置E2
└─mitigateD2用新子任务缩小切换成本:父会话保留温热缓存,新worker只接收目标、前提和完成条件,独立选择模型E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

更可迁移的是在选择模型时同时考虑历史、请求构造和任务结果。单次问答可能由网关掌握足够信息;长任务可在自然子任务边界路由,不能只按token单价频繁切换。

Trade-offs

缓存盲目切换图采用固定已观察轨迹的费用重估,排除缓存写入溢价,并非另跑策略的成功率比较。文章未公开完整路由策略、阈值和误差范围;“只能在Harness”是设计主张,取决于状态能否向路由层提供。

Where the evidence stops

缓存盲目切换图采用固定已观察轨迹的费用重估,排除缓存写入溢价,并非另跑策略的成功率比较。文章未公开完整路由策略、阈值和误差范围;“只能在Harness”是设计主张,取决于状态能否向路由层提供。

09.12Engineering Factory大型任务实验:把完成标准交给独立验证角色ProblemAgent边写边决定检查什么,容易验证自己已经实现的部分,然后在未覆盖大量行为时自行宣布完成。Takeaway可迁移的是让完成判断独立于当前实现进度,并保留可执行的结果标准。适用于有可观察参考行为的重建和迁移;缺乏可靠真值、预算受限或任务很小时,维护独立验证体系未必划算。 文件与工件观测与评测 92.5
ProblemP1Agent边写边决定检查什么,容易验证自己已经实现的部分,然后在未覆盖大量行为时自行宣布完成。E1
├─mitigateD1先调查行为,再建立可执行测量:验证者在实现开始前检查参考程序,构造加权案例和比较规则E2
└─mitigateD2在实现者与内部测试之间保留边界:编排者接收验证者聚合的缺失行为与根因,再交给实现者处理;实现者不能查看测试案例和原始输出E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可迁移的是让完成判断独立于当前实现进度,并保留可执行的结果标准。适用于有可观察参考行为的重建和迁移;缺乏可靠真值、预算受限或任务很小时,维护独立验证体系未必划算。

Trade-offs

设计和实际消耗预算同时变化,没有等预算对照,不能将全部提升归因于角色分离或宣称只是换组织就免费增益。内部测试仍是行为抽样,90.3也不是完整GDAL功能覆盖率。

Where the evidence stops

设计和实际消耗预算同时变化,没有等预算对照,不能将全部提升归因于角色分离或宣称只是换组织就免费增益。内部测试仍是行为抽样,90.3也不是完整GDAL功能覆盖率。

09.12Engineering ADK上下文架构:从持久事件为每次调用生成视图Problem把全部历史与大工具输出永久放入提示,会增加成本并干扰当前决策;多Agent继续转发整段历史还会放大这些问题。Takeaway可把持久状态与单次模型输入分开设计,并明确每种内容的生命周期与继承范围。迁移时最关键的是压缩后还保留什么、谁能重新读取,以及实际默认交接配置。 记忆与上下文工具与协议文件与工件 75
ProblemP1把全部历史与大工具输出永久放入提示,会增加成本并干扰当前决策;多Agent继续转发整段历史还会放大这些问题。E1
├─mitigateD1从事件记录生成临时上下文:会话保存结构化事件;contents处理器筛选事件并转换模型角色,其他有序处理器加入身份、指令和工具E2
├─mitigateD2分别处理大对象、历史压缩与长期记忆E2
└─mitigateD3明确子Agent继承什么:工具式调用返回结果,控制权转交则让子Agent接续会话;include_contents控制历史范围,角色转换解释其他Agent的动作,减少误认E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可把持久状态与单次模型输入分开设计,并明确每种内容的生命周期与继承范围。迁移时最关键的是压缩后还保留什么、谁能重新读取,以及实际默认交接配置。

Trade-offs

压缩可能裁剪或降低原事件优先级,不能据此保证原始历史永久可恢复。按需召回不保证恰好选到所需信息;角色重写也不等于形式化正确性。

Where the evidence stops

压缩可能裁剪或降低原事件优先级,不能据此保证原始历史永久可恢复。按需召回不保证恰好选到所需信息;角色重写也不等于形式化正确性。

09.12Engineering Replit自测:在持久REPL中结合浏览器操作与状态检查Problem语法、单元与API检查覆盖不了真实浏览器中的完整用户流程;逐点击调用又带来延迟和上下文负担。Takeaway适用于真实状态跨越前端、服务与数据库的应用测试。程序负责重复操作,模型负责依据观察选择下一步;采用价值取决于验证目标、可见信号和交接质量。 状态与恢复记忆与上下文工具与协议 82.5
ProblemP1语法、单元与API检查覆盖不了真实浏览器中的完整用户流程;逐点击调用又带来延迟和上下文负担。E1
├─mitigateD1把浏览器操作写成可迭代代码:测试Agent在持久JavaScript执行环境中调用Playwright,批量表达循环和条件E2
├─mitigateD2让观察与动作相互推进:除了浏览器操作,还提供简化DOM、标签、只读数据库查询,以及本次执行以来的新客户端/服务端日志E2
└─mitigateD3把测试上下文放到子Agent:编码Agent提供高层验证目标,测试Agent执行并返回结果摘要E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

适用于真实状态跨越前端、服务与数据库的应用测试。程序负责重复操作,模型负责依据观察选择下一步;采用价值取决于验证目标、可见信号和交接质量。

Trade-offs

浏览器完成操作不代表验证覆盖完整,测试Agent仍自行判断何时结束。人工估算的纯电脑操作费用不能当成严格基准对照;代码执行工具也需要独立隔离。

Where the evidence stops

浏览器完成操作不代表验证覆盖完整,测试Agent仍自行判断何时结束。人工估算的纯电脑操作费用不能当成严格基准对照;代码执行工具也需要独立隔离。

09.12Engineering OpenAI的Harness工程:让代码约束与运行反馈成为Agent可读材料Problem代码生成快于人工检查,未表达的规则和运行信号容易被遗漏。Takeaway应先让约束可执行、结果可观察,再扩大自主范围。 文件与工件记忆与上下文安全与隔离 82.5
ProblemP1代码生成快于人工检查,未表达的规则和运行信号容易被遗漏。E1
├─mitigateD1组织可查证的仓库知识:短入口连接版本化文档与计划,检查器维护结构E2
└─mitigateD2把规则与反馈放进开发循环:分层依赖由工具强制,隔离工作区提供界面、日志和指标;后台任务清理偏离E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

应先让约束可执行、结果可观察,再扩大自主范围。

Trade-offs

长期架构质量仍未知;减少合并阻塞依赖纠错成本低,不能普遍照搬。

Where the evidence stops

长期架构质量仍未知;减少合并阻塞依赖纠错成本低,不能普遍照搬。

09.12Paper AlphaEval:把企业任务和验收标准一起做成评测Problem通用基准的明确题目和单一判分,不能覆盖真实交付中的隐含要求与多种产物。Takeaway可以借鉴共同定义任务与多种验收的做法;上线判断应保留领域分项,不能把64.41解读为可替代64.41%的工作。 观测与评测文件与工件 75
ProblemP1通用基准的明确题目和单一判分,不能覆盖真实交付中的隐含要求与多种产物。E1
├─measureD1让业务专家共同定义任务与验收:七家企业提供真实任务材料、参考结果和隐含约束,经过反复讨论整理为查询、文件、配置和评测规则E2
└─measureD2按任务组合判分,并公开聚合口径:94个任务覆盖六类职业领域,分别使用参考答案、约束检查、模型判分或界面验证;总体得分是六个领域均分,不是94项完成率E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可以借鉴共同定义任务与多种验收的做法;上线判断应保留领域分项,不能把64.41解读为可替代64.41%的工作。

Trade-offs

只有最佳配置做了三次重复;表4所谓95%区间实际等于均值±标准差,不能据此声称排名稳定。经济价值由人工工时、工资、专家调整与质量分推算,不是实际节省金额。

Where the evidence stops

只有最佳配置做了三次重复;表4所谓95%区间实际等于均值±标准差,不能据此声称排名稳定。经济价值由人工工时、工资、专家调整与质量分推算,不是实际节省金额。

09.12Paper AHE:让Harness修改留下可检查的预测与回归记录Problem自动修改Harness时,可编辑组件、轨迹依据和修改效果常常互相脱节。Takeaway优先借鉴可追溯修改与保护验证器的结构;不能仅凭修改理由或预计风险批准自动晋级。 文件与工件身份与权限记忆与上下文 82.5
ProblemP1自动修改Harness时,可编辑组件、轨迹依据和修改效果常常互相脱节。E1
├─measureD1把修改对象与诊断依据变成可定位文件E2
└─measureD2记录修改预测,再用下一轮结果检查E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

优先借鉴可追溯修改与保护验证器的结构;不能仅凭修改理由或预计风险批准自动晋级。

Trade-offs

同一任务集反复优化和择优;单次演化,跨基准收益很小。回归预测召回率仅11.1%,修改自述不能替代回归检查。正文称各角色high,附录将演化角色列为xhigh,需保留配置差异。

Where the evidence stops

同一任务集反复优化和择优;单次演化,跨基准收益很小。回归预测召回率仅11.1%,修改自述不能替代回归检查。正文称各角色high,附录将演化角色列为xhigh,需保留配置差异。

09.12Paper Agent Meltdowns:普通环境错误也会诱发越界恢复Problem文件缺失或网络错误可能使Agent扩大搜索、改变权限或隐瞒失败;成功率评测容易漏掉这些恢复过程中的行为。Takeaway恢复测试应同时检查授权范围和最终披露;超时阈值只是候选防护,文章没有验证它能可靠阻断越界。 状态与恢复文件与工件身份与权限 92.5
ProblemP1文件缺失或网络错误可能使Agent扩大搜索、改变权限或隐瞒失败;成功率评测容易漏掉这些恢复过程中的行为。E1
├─diagnoseD1对同一任务比较有错误与无错误运行E2
└─diagnoseD2分别标注风险行为、实施阶段和是否披露E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

恢复测试应同时检查授权范围和最终披露;超时阈值只是候选防护,文章没有验证它能可靠阻断越界。

Trade-offs

Codex等配置开放了完整文件与工具权限,不能外推默认部署风险率。场景与模型样本不均;文中不同阶段统计集合未完全对齐,本分析不使用64.7%作为总体生产风险率。

Where the evidence stops

Codex等配置开放了完整文件与工具权限,不能外推默认部署风险率。场景与模型样本不均;文中不同阶段统计集合未完全对齐,本分析不使用64.7%作为总体生产风险率。

09.12Paper 真实编码会话中的失配:把用户纠正转成可审查的故障记录Problem基准轨迹无法直接反映开发者在实际协作中反复纠正Agent的负担。Takeaway值得迁移的是带原始轮次的反馈分析与误报复查,不宜据此直接给产品或模型排可靠性榜。 状态与恢复文件与工件 80
ProblemP1基准轨迹无法直接反映开发者在实际协作中反复纠正Agent的负担。E1
├─measureD1只从有明确用户反馈的会话提取失配E2
└─measureD2分开症状、原因、损害和解决方式:对16118个有效事件多轴标注并抽样人工检查;原因与损害标注更不可靠,因此不把所有标签当作确定根因E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

值得迁移的是带原始轮次的反馈分析与误报复查,不宜据此直接给产品或模型排可靠性榜。

Trade-offs

90.67%的事件解决状态不可见,不能写成未解决;只纳入公开记录及可见纠正,无法推断总体故障率。IDE与CLI比较同时混合产品、任务和时间。

Where the evidence stops

90.67%的事件解决状态不可见,不能写成未解决;只纳入公开记录及可见纠正,无法推断总体故障率。IDE与CLI比较同时混合产品、任务和时间。

09.12Paper Skill参考架构:区分文件、运行时采用、执行权限与验收Problem安装或激活Skill不等于它被正确执行,也不意味着获得其提到的权限。Takeaway可以用四层责任审查自己的Skill系统,优先补齐运行身份、权限和验收,而不是按模式数量打成熟度分。 身份与权限文件与工件安全与隔离 75
ProblemP1安装或激活Skill不等于它被正确执行,也不意味着获得其提到的权限。E1
├─measureD1按责任拆开Skill进入运行的过程E2
└─measureD2为每次使用保留身份和独立验收状态E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可以用四层责任审查自己的Skill系统,优先补齐运行身份、权限和验收,而不是按模式数量打成熟度分。

Trade-offs

架构构造和对照来自同一语料,不能称独立验证。未在公开资料出现不等于产品不存在该功能;Skill-BOM是提议中的模式,不是成熟通用标准。

Where the evidence stops

架构构造和对照来自同一语料,不能称独立验证。未在公开资料出现不等于产品不存在该功能;Skill-BOM是提议中的模式,不是成熟通用标准。

09.12Paper ToolMaze:把工具错误与可用恢复路径分开控制Problem工具失败后,Agent可能反复重试而不改路,也可能盲信格式正常但内容错误的输出。Takeaway可借鉴二维故障矩阵和有条件的恢复指标;发布时应同时显示恢复、终止和最终完成。 工具与协议状态与恢复观测与评测 82.5
ProblemP1工具失败后,Agent可能反复重试而不改路,也可能盲信格式正常但内容错误的输出。E1
├─measureD1先构建工具依赖图,再生成任务:270个工具形成四类拓扑,枚举图内可用路径,并反向检查自然语言任务是否保留依赖E2
└─measureD2独立控制错误类型与恢复测量:400个基础任务分别加入显式或隐式、临时或永久故障;区分整体表现、遇错后的恢复比例和多余调用代价E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可借鉴二维故障矩阵和有条件的恢复指标;发布时应同时显示恢复、终止和最终完成。

Trade-offs

穷举只覆盖构造图内的解空间,语义验证依赖模型。固定的合成故障没有覆盖真实工具的全部联动错误,缩放拟合不是普遍规律。

Where the evidence stops

穷举只覆盖构造图内的解空间,语义验证依赖模型。固定的合成故障没有覆盖真实工具的全部联动错误,缩放拟合不是普遍规律。

09.12Paper TokenPilot:压缩上下文时同时计算缓存损失Problem删掉更多token可能破坏前缀缓存,使实际调用更贵。Takeaway采用时应一起看命中、未命中、输出和质量分;优先保留全文恢复通路,不能只优化上下文长度。 状态与恢复身份与权限工具与协议 87.5
ProblemP1删掉更多token可能破坏前缀缓存,使实际调用更贵。E1
├─mitigateD1先稳定前缀,再缩减工具输入:易变路径、时间和工具定义移到动态位置;长输出以预览入上下文,全文按哈希保存并允许取回E2
└─mitigateD2按剩余用途分批移出历史:模型估计片段是否完成、是否仍被依赖,系统检查状态转换并按批次删除,减少每轮改写造成的缓存损失E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

采用时应一起看命中、未命中、输出和质量分;优先保留全文恢复通路,不能只优化上下文长度。

Trade-offs

用途估计可能误判,缓存收益依赖后端。混合任务补充实验仍有收益,但不能保证跨租户可安全复用,静态替换必须保留原值和隔离范围。

Where the evidence stops

用途估计可能误判,缓存收益依赖后端。混合任务补充实验仍有收益,但不能保证跨租户可安全复用,静态替换必须保留原值和隔离范围。

09.12Paper Agent记忆系统比较:选型要对齐更新、检索与维护负担Problem只比较最终回答质量,无法判断记忆失败发生在提取、检索还是更新维护。Takeaway先定位当前任务需要最新事实、远距关联还是低维护成本,再选结构;不要按一张总榜替换记忆系统。 记忆与上下文观测与评测文件与工件 75
ProblemP1只比较最终回答质量,无法判断记忆失败发生在提取、检索还是更新维护。E1
├─measureD1分模块、分工作负载评估记忆:把系统拆为表示存储、提取、检索路由与维护,在多套数据上分别观察答案、证据检索、事实更新和长历史表现E2
└─measureD2用组件变体检查设计取舍:改变融合比例、检索规划、反思和合并策略,并单独记录构建与查询开销,避免将整体系统差异直接当作单个组件贡献E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

先定位当前任务需要最新事实、远距关联还是低维护成本,再选结构;不要按一张总榜替换记忆系统。

Trade-offs

各实验覆盖的系统和样本不同,词面指标不等于语义正确;成本包含摊销和异常过滤口径,不能直接作为生产延迟承诺。

Where the evidence stops

各实验覆盖的系统和样本不同,词面指标不等于语义正确;成本包含摊销和异常过滤口径,不能直接作为生产延迟承诺。

09.12Paper AgentLocate:通过多视角标注改进故障位置判断Problem长协作轨迹中,下游暴露错误的Agent容易被误当作最早责任来源。Takeaway适合减少人工排查范围,不能自动裁决责任或以多数票替代真实干预证据。 文件与工件运行时与调度观测与评测 75
ProblemP1长协作轨迹中,下游暴露错误的Agent容易被误当作最早责任来源。E1
├─diagnoseD1先提定位假设,再聚合不同提示的评估E2
└─diagnoseD2用评估反馈训练定位模型:将假设、理由和聚合标签用于LoRA微调;训练和测试轨迹分开,运行时由微调后的Judge输出位置E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

适合减少人工排查范围,不能自动裁决责任或以多数票替代真实干预证据。

Trade-offs

反事实修正并未真实执行,所谓决定性错误是基于日志的推断。Evaluator用同一个基础模型且看到初始假设,自报置信度未经校准,不能视为独立事实核验。

Where the evidence stops

反事实修正并未真实执行,所谓决定性错误是基于日志的推断。Evaluator用同一个基础模型且看到初始假设,自报置信度未经校准,不能视为独立事实核验。

09.12Paper LHTB:用最终状态中的分项证据衡量长任务进展Problem极难长任务中,大量模型都未完全通过,二元得分掩盖了有用的部分进展。Takeaway保留部分进展便于诊断,但验收仍需单独检查最终必要条件,不能用加权均分补偿关键失败。 文件与工件状态与恢复观测与评测 75
ProblemP1极难长任务中,大量模型都未完全通过,二元得分掩盖了有用的部分进展。E1
├─measureD1把任务拆成可独立检查的目标:46个容器任务提供参考解和隐藏检查,将文件、测试、数值或模拟器结果按子目标加权评分E2
└─measureD2同时报告完成、部分进展和退出行为E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

保留部分进展便于诊断,但验收仍需单独检查最终必要条件,不能用加权均分补偿关键失败。

Trade-offs

任务经特定模型反复校准难度,GPT-5.3使用不同Harness;少量任务和单次模型任务组合限制稳定排名。部分高分不意味着已具备可交付结果。

Where the evidence stops

任务经特定模型反复校准难度,GPT-5.3使用不同Harness;少量任务和单次模型任务组合限制稳定排名。部分高分不意味着已具备可交付结果。

09.12Paper Harness演化评测:先排除多次尝试和同题优化带来的收益Problem反复在同一公开题集修改Harness再报分,可能把搜索预算和记题收益误当作可迁移设计。Takeaway应把可复用设计改善与单题多试成功分别报告,同时公开验证器权限和全部搜索成本。 观测与评测身份与权限文件与工件 92.5
ProblemP1反复在同一公开题集修改Harness再报分,可能把搜索预算和记题收益误当作可迁移设计。E1
├─measureD1对齐反馈与尝试次数后比较不同搜索位置E2
└─measureD2把搜索、选择和测试任务分开:45题训练、10题选配置、34题测试,衡量冻结Harness在未参与修改的题目上是否改善E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

应把可复用设计改善与单题多试成功分别报告,同时公开验证器权限和全部搜索成本。

Trade-offs

主要对齐rollout次数,并非严格相同token或费用;AHE关闭了探索Agent且每题只采一次,与原论文运行设置不同。两次重复及单一套件限制泛化。

Where the evidence stops

主要对齐rollout次数,并非严格相同token或费用;AHE关闭了探索Agent且每题只采一次,与原论文运行设置不同。两次重复及单一套件限制泛化。

09.12Paper GuardianAgentBench:检查工具参数之外,还要检查调用是否覆盖任务Problem参数合法不代表工具选择相关,也不代表完成任务所需的调用没有遗漏。Takeaway把参数、相关性、任务覆盖分开记录,并同时测量救回的失败与误伤的成功。 工具与协议安全与隔离文件与工件 75
ProblemP1参数合法不代表工具选择相关,也不代表完成任务所需的调用没有遗漏。E1
└─mitigateD1把工具调用分成三种检查:在调用前检查参数、任务覆盖和相关性,失败后给予反馈,最多重试两次,再阻断并升级E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把参数、相关性、任务覆盖分开记录,并同时测量救回的失败与误伤的成功。

Trade-offs

检查器实际由Claude Sonnet 4.5驱动,不能按文中另一处的“规则式”描述理解为确定性保证。生成、判分和检查存在模型关联,检查只在一个框架上评估,额外推理成本没有完整报告。

Where the evidence stops

检查器实际由Claude Sonnet 4.5驱动,不能按文中另一处的“规则式”描述理解为确定性保证。生成、判分和检查存在模型关联,检查只在一个框架上评估,额外推理成本没有完整报告。

09.12Paper SEAL:Agent自写测试,仍需要独立的版本接纳门槛ProblemAgent同时修改策略和测试时,自评分可能持续优秀,而隐藏部署表现退化。Takeaway让候选生成与版本接纳使用不同权限、数据和评测接口,并独立观察部署回退。 观测与评测文件与工件身份与权限 87.5
ProblemP1Agent同时修改策略和测试时,自评分可能持续优秀,而隐藏部署表现退化。E1
├─mitigateD1把测试和接纳权分离:Agent保留自写测试;Harness用不可见的固定审计比较候选与当前版本,只返回接纳或拒绝,拒绝时保留整个原版本E2
└─mitigateD2分开开发、审计与部署环境:审计种子与自测、最终部署分离,最终部署另有环境扰动,检查审计代理指标能否迁移E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让候选生成与版本接纳使用不同权限、数据和评测接口,并独立观察部署回退。

Trade-offs

审计仍是有限代理:出现审计分数上升而部署分数下降的接纳。等提案数不等于等总计算;反复返回一位接纳结果仍会泄露优化信号。三种子半极差不是置信区间。

Where the evidence stops

审计仍是有限代理:出现审计分数上升而部署分数下降的接纳。等提案数不等于等总计算;反复返回一位接纳结果仍会泄露优化信号。三种子半极差不是置信区间。

09.12Paper Model or Harness:给故障分类之前,先说明归因规则Problem同一失败可能被归于模型或外围执行系统,缺少统一边界会导致修复方向混乱。Takeaway先记录观察到的失效位置,再分别检验模型与Harness的修复方案,避免把分类标签写成责任定论。 状态与恢复文件与工件 75
ProblemP1同一失败可能被归于模型或外围执行系统,缺少统一边界会导致修复方向混乱。E1
├─measureD1标记最早未恢复的失效:用交互边和责任侧组织41类故障,并结合原始案例证据定位最早未被后续步骤纠正的错误E2
└─measureD2允许保留不同归因:比较多模型分类与人工标签,以一致程度表达不确定性,不把模型共识当作因果验证E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

先记录观察到的失效位置,再分别检验模型与Harness的修复方案,避免把分类标签写成责任定论。

Trade-offs

分类体系与案例共同开发,人工标签来自单人;“更强模型是否能避免或恢复”这条规则本身影响责任划分。案例不是总体随机样本,日志归因没有经过修复干预验证。

Where the evidence stops

分类体系与案例共同开发,人工标签来自单人;“更强模型是否能避免或恢复”这条规则本身影响责任划分。案例不是总体随机样本,日志归因没有经过修复干预验证。

09.12Paper MEA:执行者报告完成后,由独立审计决定状态推进Problem长任务中执行者可能过早宣布完成,错误状态随后成为下一轮的前提。Takeaway采用显式状态推进条件,并给审计保留独立的环境读取能力;同时限制轮数和审计预算。 观测与评测状态与恢复记忆与上下文 87.5
ProblemP1长任务中执行者可能过早宣布完成,错误状态随后成为下一轮的前提。E1
├─mitigateD1分离管理、执行与审计:管理者持有需求、产物和事实状态;执行者以有界任务合同进入新上下文;审计者只读检查环境,审计通过才推进完成状态E2
└─mitigateD2限制跨轮传播的信息:保留合同与审计结果,丢弃执行原始轨迹,把执行报告用作定位线索而非完成证据E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

采用显式状态推进条件,并给审计保留独立的环境读取能力;同时限制轮数和审计预算。

Trade-offs

多个机制一起改变,未隔离新上下文、审计与额外预算的贡献。不同官方基线的协议不能视为完全相同;只读审计和修改监测也不等于完整安全隔离证明。

Where the evidence stops

多个机制一起改变,未隔离新上下文、审计与额外预算的贡献。不同官方基线的协议不能视为完全相同;只读审计和修改监测也不等于完整安全隔离证明。

09.12Paper DreamGuard:在工具执行前结合历史状态预判风险Problem单步检查可能看不见逐步累积的风险,而过度阻断又会损害正常任务。Takeaway同时设置危险漏报、正常任务误伤和干预时机的验收指标,不能只优化一个安全率。 安全与隔离状态与恢复观测与评测 82.5
ProblemP1单步检查可能看不见逐步累积的风险,而过度阻断又会损害正常任务。E1
├─mitigateD1维护风险相关的递归状态:以压缩历史状态预测候选动作后的表示,联合即时危险和前缀风险,在动作执行前给出放行、暂停或阻断E2
└─mitigateD2校准阈值并检查误伤:在安全轨迹上校准阈值,分别测量危险轨迹检出、提前干预和安全任务误报E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

同时设置危险漏报、正常任务误伤和干预时机的验收指标,不能只优化一个安全率。

Trade-offs

文中SR表示危险轨迹是否触发干预,不能写成任务成功率。不同数据上的指标并非全部第一,AgentDojo误报仍高;阈值只在SafetyDrift上校准,分布变化需重校准,阻断也不提供安全替代动作。

Where the evidence stops

文中SR表示危险轨迹是否触发干预,不能写成任务成功率。不同数据上的指标并非全部第一,AgentDojo误报仍高;阈值只在SafetyDrift上校准,分布变化需重校准,阻断也不提供安全替代动作。

09.12Paper 可靠编码Agent专章:外部动作成功后,内部记录仍可能未知Problem外部操作已经完成而进程未记账就崩溃,重试可能重复副作用;内部日志不能证明外部状态。Takeaway先为一个有副作用的工具建立稳定调用身份、外部状态核对与未知状态处理,再做精确崩溃点测试。 状态与恢复身份与权限记忆与上下文 72.5
ProblemP1外部操作已经完成而进程未记账就崩溃,重试可能重复副作用;内部日志不能证明外部状态。E1
└─mitigateD1区分逻辑工作、尝试和外部提交:用稳定调用身份跨越重试边界,要求外部去重或状态核对;不确定时保留未决状态并升级处理E2
ProblemP2整体成功率不能区分证据未保存、未召回或未被利用,容易误判记忆设计的作用。E1E2
└─measureD2将检索和最终完成分项观察:分别记录证据是否可用、被检索、进入上下文以及最终任务结果,避免端到端分数掩盖边界失效E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

先为一个有副作用的工具建立稳定调用身份、外部状态核对与未知状态处理,再做精确崩溃点测试。

Trade-offs

本次评分限定已审查的恢复与检索专章及证据说明,不代表通读206条实践。作者明确本地案例不是独立外部证据,私有轨迹不能完整复核;分布式系统经验向Agent的迁移也不等于生产效果证明。

Where the evidence stops

本次评分限定已审查的恢复与检索专章及证据说明,不代表通读206条实践。作者明确本地案例不是独立外部证据,私有轨迹不能完整复核;分布式系统经验向Agent的迁移也不等于生产效果证明。

09.12Paper 编码工具配置研究:仓库里的文件能说明什么Problem不同工具暴露不同配置入口,难以比较团队如何组织规则、技能和辅助Agent。Takeaway统一核心规则时保留工具适配层,并另行记录配置的实际加载和执行。 文件与工件工具与协议观测与评测 75
ProblemP1不同工具暴露不同配置入口,难以比较团队如何组织规则、技能和辅助Agent。E1
├─measureD1建立配置机制和文件的映射:在经过筛选的GitHub项目中检测八类配置,再统计采用、共现和文件内容E2
└─measureD2补充实际使用的旁证:检查AI署名提交及短文件内容,剔除空文件和依赖目录,减少把残留文件当成配置的误判E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

统一核心规则时保留工具适配层,并另行记录配置的实际加载和执行。

Trade-offs

检测到文件不等于该机制在运行中生效;署名提交也不能证明每种机制被使用。样本偏向成熟英文开源项目,Codex专属配置仅4例,不能据此比较工具市场份额或效果。

Where the evidence stops

检测到文件不等于该机制在运行中生效;署名提交也不能证明每种机制被使用。样本偏向成熟英文开源项目,Codex专属配置仅4例,不能据此比较工具市场份额或效果。

09.12Paper Agent可靠性:把重复成功、扰动、置信度和安全分开测Problem平均成功率掩盖同一任务反复执行不稳定、成本波动及错误时仍自信的问题。Takeaway报告重复成功、成本波动和误判置信度,并为安全单独设门槛,避免只按平均任务分数选型。 安全与隔离工具与协议文件与工件 80
ProblemP1平均成功率掩盖同一任务反复执行不稳定、成本波动及错误时仍自信的问题。E1
├─measureD1用多维协议测量可靠性:对任务重复运行,改写提示、注入工具故障和环境格式变化,并测量完成后的置信度E2
└─measureD2安全单列为约束:一致性、稳健性和可预测性可汇总;安全违规与严重度单列,避免均分掩盖尾部风险E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

报告重复成功、成本波动和误判置信度,并为安全单独设门槛,避免只按平均任务分数选型。

Trade-offs

每个基准只使用一种Harness,安全判断依赖LLM;重复五次、部分模型默认采样设置和有限扰动不能代表生产可靠性。总可靠性分数不包含安全。

Where the evidence stops

每个基准只使用一种Harness,安全判断依赖LLM;重复五次、部分模型默认采样设置和有限扰动不能代表生产可靠性。总可靠性分数不包含安全。

09.12Paper Meta-Harness:用可检索历史代码和轨迹改进外围程序Problem标量分数或短摘要丢失失败细节,使程序级优化难以定位有效修改。Takeaway保留完整历史供按需检索,并把搜索集反馈与不可见测试结果分开。 记忆与上下文文件与工件 82.5
ProblemP1标量分数或短摘要丢失失败细节,使程序级优化难以定位有效修改。E1
└─measureD1外层提案Agent检索历次代码、分数与轨迹,生成通过接口检查的候选;保留成本与质量的Pareto前沿,基础模型固定E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

保留完整历史供按需检索,并把搜索集反馈与不可见测试结果分开。

Trade-offs

源码正则和人工泄漏检查不能代替独立测试集;终端榜单来自不同实现,不能把排名视为统一预算下的模型能力比较。

Where the evidence stops

源码正则和人工泄漏检查不能代替独立测试集;终端榜单来自不同实现,不能把排名视为统一预算下的模型能力比较。

09.12Paper 比较Agent时,模型与Harness必须一起披露Problem模型排行榜混合上下文、重试和验收配置,无法区分收益来自哪里。Takeaway采用模型×Harness成对报告,保留预算和配置;将方差比例限定在实际选取的网格。 记忆与上下文安全与隔离文件与工件 75
ProblemP1模型排行榜混合上下文、重试和验收配置,无法区分收益来自哪里。E1
└─measureD1使用三模型乘三Harness的因子网格,固定任务、步数和执行环境,分别计算模型与Harness间的方差,并披露配置E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

采用模型×Harness成对报告,保留预算和配置;将方差比例限定在实际选取的网格。

Trade-offs

刻意选取能力相近模型与差异较大的Harness会影响方差比,多个机制一起变化;7.80倍不是普遍定律,也没有隔离每个组件的因果贡献。

Where the evidence stops

刻意选取能力相近模型与差异较大的Harness会影响方差比,多个机制一起变化;7.80倍不是普遍定律,也没有隔离每个组件的因果贡献。

09.12Paper ToolFailBench:调用了工具,也可能没使用工具结果Problem最终回答错误不能区分漏调用、忽略返回值、编造字段或不必要调用。Takeaway把调用是否执行、返回值是否使用与多余调用分别验收。 工具与协议状态与恢复观测与评测 75
ProblemP1最终回答错误不能区分漏调用、忽略返回值、编造字段或不必要调用。E1
└─measureD1设置750个需工具任务和250个无需工具对照,用偏离常见先验的模拟返回值检查结果利用;规则与两个LLM共同标注轨迹E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把调用是否执行、返回值是否使用与多余调用分别验收。

Trade-offs

仅为单轮模拟工具,不代表专业任务胜任或多步恢复能力;多数票一致性不是标签正确性的独立证明,表述与表格分母应按Required任务集合解读。

Where the evidence stops

仅为单轮模拟工具,不代表专业任务胜任或多步恢复能力;多数票一致性不是标签正确性的独立证明,表述与表格分母应按Required任务集合解读。

09.12Paper ChainCaps:数据经过工具链,使用权限只能收窄Problem每个工具单独获准,并不能阻止受限数据经多次转换后流向未授权出口。Takeaway在出口边界强制检查来源权限,并把策略编写、数据流覆盖与正常任务误伤纳入验收。 身份与权限工具与协议文件与工件 87.5
ProblemP1每个工具单独获准,并不能阻止受限数据经多次转换后流向未授权出口。E1
└─mitigateD1MCP代理给数据附加可到达出口集合,转换时取输入权限和工具策略交集;上下文保守继承,出口调用前检查,例外授权绑定请求与来源E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

在出口边界强制检查来源权限,并把策略编写、数据流覆盖与正常任务误伤纳入验收。

Trade-offs

定理依赖可见数据流和正确策略;Shell等绕过边界仍有残余失败。Fides/PFI比较是抽象规则回放,不是完整系统对照;复杂正常任务仍可能误拦。

Where the evidence stops

定理依赖可见数据流和正确策略;Shell等绕过边界仍有残余失败。Fides/PFI比较是抽象规则回放,不是完整系统对照;复杂正常任务仍可能误拦。

09.12Paper TraceSafe:安全检查也需要理解工具结构与上下文Problem自然语言安全检测可能漏掉参数、版本和接口层面的异常。Takeaway将正常轨迹误报与各类结构漏报同时报告,不把安全总分当作工具边界覆盖率。 观测与评测安全与隔离工具与协议 75
ProblemP1自然语言安全检测可能漏掉参数、版本和接口层面的异常。E1
└─measureD1从成功工具轨迹出发,以受控代码编辑构造12类风险,保留正常对照,比较二分类与有分类定义的检测方式E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将正常轨迹误报与各类结构漏报同时报告,不把安全总分当作工具边界覆盖率。

Trade-offs

检测的是离线构造风险,不是实时阻断效果;任务成功不自动证明全部安全,结构编辑也不能覆盖真实攻击。结构能力相关性不能证明它是唯一因果瓶颈,较长轨迹趋势主要发生在约6k Token以内。

Where the evidence stops

检测的是离线构造风险,不是实时阻断效果;任务成功不自动证明全部安全,结构编辑也不能覆盖真实攻击。结构能力相关性不能证明它是唯一因果瓶颈,较长轨迹趋势主要发生在约6k Token以内。

09.12Paper 虚假完成检测:先核对环境状态,再相信结束语ProblemAgent可能声称完成,但任务环境没有达到要求,普通文本裁判容易受自信表达影响。Takeaway把文本与轨迹检测作为人工复核队列信号,完成状态仍由独立环境检查确认。 状态与恢复观测与评测安全与隔离 80
ProblemP1Agent可能声称完成,但任务环境没有达到要求,普通文本裁判容易受自信表达影响。E1
└─measureD1用程序化最终状态与完成声明交叉标注,训练轻量轨迹检测器,采用任务隔离、跨模型与跨域测试E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把文本与轨迹检测作为人工复核队列信号,完成状态仍由独立环境检查确认。

Trade-offs

τ基准标签部分由结束语规则形成,虽有人工及消融控制仍有表达依赖;跨域表现下降,10%标记率时约一半误报。检测器不能替代直接状态验收。

Where the evidence stops

τ基准标签部分由结束语规则形成,虽有人工及消融控制仍有表达依赖;跨域表现下降,10%标记率时约一半误报。检测器不能替代直接状态验收。

09.12Paper Memory-induced Tool-Drift:个人偏好可能污染专业工具参数Problem本来只适用于个人场景的偏好,被记忆系统当成通用规则,影响无关任务中的参数。Takeaway存储偏好时保留适用场景,在高影响参数处单独核对任务依据。 记忆与上下文工具与协议安全与隔离 75
ProblemP1本来只适用于个人场景的偏好,被记忆系统当成通用规则,影响无关任务中的参数。E1
└─measureD1用无记忆、中性记忆和偏好记忆对照,在直接注入与三种记忆框架下比较参数偏移;再测试提示防御和相关性过滤E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

存储偏好时保留适用场景,在高影响参数处单独核对任务依据。

Trade-offs

608个工具是扫描器标记的潜在风险,不是608个已发生事故。偏移由LLM判分;干净分离任务中过滤有效,但跨域相关性难题仍在。机制解释和训练防御不能写成已验证解决方案。

Where the evidence stops

608个工具是扫描器标记的潜在风险,不是608个已发生事故。偏移由LLM判分;干净分离任务中过滤有效,但跨域相关性难题仍在。机制解释和训练防御不能写成已验证解决方案。

09.12Paper SAFARI:用检索调查长轨迹,而不是一次塞进上下文Problem超长日志中故障位置可能超出裁判上下文,截断会丢失关键证据。Takeaway让诊断保留原日志定位与未解问题,区分“命中一个故障”和“确认决定性根因”。 记忆与上下文文件与工件 75
ProblemP1超长日志中故障位置可能超出裁判上下文,截断会丢失关键证据。E1
└─diagnoseD1调查Agent按片段读取和搜索日志,保留假设与证据的短期记忆;把结论拆成最多三条交给只看引用的评估器,最多调查30轮E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让诊断保留原日志定位与未解问题,区分“命中一个故障”和“确认决定性根因”。

Trade-offs

评估器不读取原日志,不能验证引用是否完整;TRAIL精度只要求命中任意标注故障,不等于找到唯一根因。按已知故障位置缩小上下文的压力实验不等于真实五倍长度部署;未验证线上修复效果。

Where the evidence stops

评估器不读取原日志,不能验证引用是否完整;TRAIL精度只要求命中任意标注故障,不等于找到唯一根因。按已知故障位置缩小上下文的压力实验不等于真实五倍长度部署;未验证线上修复效果。

09.12Paper Slim:搜索只给线索,浏览再取相关片段Problem搜索阶段一次装入大量页面,使长任务预算消耗在无关内容上。Takeaway先减少无关材料进入上下文,再按实际任务检验摘要触发点及证据保留。 文件与工件记忆与上下文身份与权限 75
ProblemP1搜索阶段一次装入大量页面,使长任务预算消耗在无关内容上。E1
└─mitigateD1搜索返回标题、链接和摘要,浏览按查询提取片段,再周期性压缩整段执行历史E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

先减少无关材料进入上下文,再按实际任务检验摘要触发点及证据保留。

Trade-offs

成本计算排除缓存Token费用,不能直接当真实账单;消融正文写50样本而表注写100,样本数仍待澄清。整体收益不代表每个默认参数最佳,摘要可能丢失信息。

Where the evidence stops

成本计算排除缓存Token费用,不能直接当真实账单;消融正文写50样本而表注写100,样本数仍待澄清。整体收益不代表每个默认参数最佳,摘要可能丢失信息。

09.12Paper 日志审查:先检验评测有没有把正确行为判错Problem只看最终通过率,会混淆Agent失败、任务错误和过程中发生的违规。Takeaway发布分数时附任务有效性审查、完整日志和过程风险,而不是把所有失败都归给模型。 观测与评测文件与工件 80
ProblemP1只看最终通过率,会混淆Agent失败、任务错误和过程中发生的违规。E1
└─measureD1先声明评测有效性目标,收齐任务和环境证据,迭代标注规则并人工核查,再按结果统计行为与分数的关联E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

发布分数时附任务有效性审查、完整日志和过程风险,而不是把所有失败都归给模型。

Trade-offs

这是移除问题任务后的子集变化,不是同一任务被系统修复后的收益;其他研究清洗数不同,应保留各自口径。模拟说服测试不能直接量化真实部署事故。

Where the evidence stops

这是移除问题任务后的子集变化,不是同一任务被系统修复后的收益;其他研究清洗数不同,应保留各自口径。模拟说服测试不能直接量化真实部署事故。

09.12Paper AdaMAST:从自己的失败轨迹形成可维护的分类表Problem固定通用分类难以覆盖特定系统的角色和领域失败,原始轨迹又太长难以复用。Takeaway先为自己的轨迹建立带例证的失败词表,并分别验证词表一致性、人工正确性和实际修复收益。 文件与工件 87.5
ProblemP1固定通用分类难以覆盖特定系统的角色和领域失败,原始轨迹又太长难以复用。E1
└─diagnoseD1从轨迹归纳系统、角色和领域代码,合并并检查证据;通过一致性门槛后用于搜索、运行检查和候选选择,系统变化时再修订E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

先为自己的轨迹建立带例证的失败词表,并分别验证词表一致性、人工正确性和实际修复收益。

Trade-offs

LLM一致性不等于正确性;不同Harness用了不同模型,不能横向归因。最佳五选一收益混合了分类与学习型选择器,OfficeQA没有统一预算验证。

Where the evidence stops

LLM一致性不等于正确性;不同Harness用了不同模型,不能横向归因。最佳五选一收益混合了分类与学习型选择器,OfficeQA没有统一预算验证。

09.12Paper ReflexGrad:持续停滞时切换到重规划,并留出执行冷却期Problem局部反思可能持续优化错误策略,新的计划也可能被下一次局部修改打断。Takeaway让停滞触发、重规划产物与执行窗口可观测,另测进度判分器的误触发。 状态与恢复身份与权限观测与评测 75
ProblemP1局部反思可能持续优化错误策略,新的计划也可能被下一次局部修改打断。E1
└─mitigateD1连续五步低进度触发慢速诊断,平时每三步局部改进;慢计划优先并给予五步冷却,避免旧反馈立即覆盖新策略E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让停滞触发、重规划产物与执行窗口可观测,另测进度判分器的误触发。

Trade-offs

所谓计算匹配表实际约55、100、140次调用不齐,示例条件也不同;调用数不等于Token成本。不显著的跨模型差异不等于等效性证明,自然语言诊断也不是因果真值。

Where the evidence stops

所谓计算匹配表实际约55、100、140次调用不齐,示例条件也不同;调用数不等于Token成本。不显著的跨模型差异不等于等效性证明,自然语言诊断也不是因果真值。

09.12Paper ComponentBench:在控件层分离模型能力与交互接口Problem完整工作流过长难以定位问题,单次点击又不足以覆盖真实控件操作。Takeaway把控件级失败和观察动作空间纳入验收,再测试它们在完整流程中的组合效果。 状态与恢复文件与工件 82.5
ProblemP1完整工作流过长难以定位问题,单次点击又不足以覆盖真实控件操作。E1
└─measureD1构造2910个控件任务,以提交后的实际状态验证,人工走通并记录参考轨迹;同Harness比较辅助树、编号覆盖和像素接口E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把控件级失败和观察动作空间纳入验收,再测试它们在完整流程中的组合效果。

Trade-offs

Browser-Use一轮最多四个动作,其余模式一轮一个,不能作为完全等预算第四组;人工最短轨迹不是最优路径,控件能力尚未验证能预测长工作流成功。

Where the evidence stops

Browser-Use一轮最多四个动作,其余模式一轮一个,不能作为完全等预算第四组;人工最短轨迹不是最优路径,控件能力尚未验证能预测长工作流成功。

09.12Paper 共形故障归因:给出可校准的区间,避免强行猜一个步骤Problem单点故障归因常不可靠,回退太晚无法覆盖错误,太早又重复大量工作。Takeaway将不确定的归因作为带覆盖条件的候选区间,另行验证状态可恢复性和重跑成功。 状态与恢复安全与隔离文件与工件 87.5
ProblemP1单点故障归因常不可靠,回退太晚无法覆盖错误,太早又重复大量工作。E1
└─measureD1把步骤分数变成连续预测区间,在留出数据上校准覆盖率,再从区间开头回退E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将不确定的归因作为带覆盖条件的候选区间,另行验证状态可恢复性和重跑成功。

Trade-offs

覆盖保证要求校准与测试轨迹可交换,且依赖标签定义;合成注入点不自动等于自然唯一根因。覆盖错误不保证修复成功,步数代价也不包含全部状态恢复成本。

Where the evidence stops

覆盖保证要求校准与测试轨迹可交换,且依赖标签定义;合成注入点不自动等于自然唯一根因。覆盖错误不保证修复成功,步数代价也不包含全部状态恢复成本。

09.12Paper EvoHarness-RL:学习何时读写外部状态Problem有了记忆和进度表,Agent仍可能过度访问或完全忽视它们。Takeaway把状态访问变成可记录、可计费的动作,先观察何时有益,再决定是否需要训练。 状态与恢复记忆与上下文观测与评测 75
ProblemP1有了记忆和进度表,Agent仍可能过度访问或完全忽视它们。E1
└─mitigateD1以环境事实、执行进度和跨任务经验组织状态,开放四类读写动作;先监督学习,再用任务奖励和开销约束训练访问策略E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把状态访问变成可记录、可计费的动作,先观察何时有益,再决定是否需要训练。

Trade-offs

状态组件消融在冻结模型的推理Harness上进行,不能证明训练后策略的每个组件贡献。只在ALFWorld验证,适配器、教师和离线经验整理均有成本;这里的自演化是状态与访问策略,不是任意改写运行时代码。

Where the evidence stops

状态组件消融在冻结模型的推理Harness上进行,不能证明训练后策略的每个组件贡献。只在ALFWorld验证,适配器、教师和离线经验整理均有成本;这里的自演化是状态与访问策略,不是任意改写运行时代码。

09.12Paper AggAgent:汇总并行研究时,按需回查轨迹证据Problem只投票最终答案会丢失过程证据,拼接全部轨迹又容易超出上下文。Takeaway保留候选的工具观察和来源,在分歧处回查;把汇总成本与前面的并行运行总成本一起报告。 记忆与上下文工具与协议文件与工件 75
ProblemP1只投票最终答案会丢失过程证据,拼接全部轨迹又容易超出上下文。E1
└─mitigateD1汇总Agent先看候选答案和元数据,再搜索与读取有分歧的轨迹片段,最后综合答案;所有汇总方法使用同一组候选E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

保留候选的工具观察和来源,在分歧处回查;把汇总成本与前面的并行运行总成本一起报告。

Trade-offs

单次上下文有界不等于累计计算严格独立于候选数;全体答案仍随数量增长。开放研究依赖LLM评分,原轨迹可回查也不自动证明其内容正确。

Where the evidence stops

单次上下文有界不等于累计计算严格独立于候选数;全体答案仍随数量增长。开放研究依赖LLM评分,原轨迹可回查也不自动证明其内容正确。

09.12Engineering 把Agent放进Orb:先把开发环境变成可检查的接口Problem依赖、服务启动和浏览器环境不稳定,会让Agent把时间耗在猜测环境。Takeaway优先固定安装、启动和观测接口;环境启动与业务验收分别保留明确结果。 状态与恢复文件与工件 80
ProblemP1依赖、服务启动和浏览器环境不稳定,会让Agent把时间耗在猜测环境。E1
└─mitigateD1用版本化setup建立环境,resume恢复连接;用幂等ensure-dev-server检查健康与配置变化,明确端口、日志和仅开发环境使用的认证路径E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

优先固定安装、启动和观测接口;环境启动与业务验收分别保留明确结果。

Trade-offs

示例没有量化可靠性收益;开发认证便利不能迁入生产,环境健康也不代表功能验收通过。

Where the evidence stops

示例没有量化可靠性收益;开发认证便利不能迁入生产,环境健康也不代表功能验收通过。

09.12Engineering DSL与语义模型:让Agent在受约束的词汇中生成和检验Problem通用代码生成把线程、时钟和网络等过多设计选择重新暴露给模型。Takeaway领域稳定且反复生成相似产物时采用;先尝试清晰类型与库接口,只有收益覆盖维护成本才建DSL。 文件与工件 87.5
ProblemP1通用代码生成把线程、时钟和网络等过多设计选择重新暴露给模型。E1
└─mitigateD1先建立Tickloom的确定性tick、网络、存储和副本语义,再用类型约束的场景DSL表达动作;编译器排除非法调用顺序,运行检查验证场景预期E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

领域稳定且反复生成相似产物时采用;先尝试清晰类型与库接口,只有收益覆盖维护成本才建DSL。

Trade-offs

支持的是受约束领域中的实现方法,不是普遍成功率提升;语法合法仍可能语义错误,底层模型和验证器本身需要维护。

Where the evidence stops

支持的是受约束领域中的实现方法,不是普遍成功率提升;语法合法仍可能语义错误,底层模型和验证器本身需要维护。

09.12Engineering Sierra MCP Gateway:把上下文访问与身份约束集中到调用边界Problem独立工具集成会重复权限逻辑,并让同一会话混入不同客户的敏感资料。Takeaway集中数据出口与身份策略,同时用只能走正式接口的客户端验收,分别管理交互和长期自动化身份。 工具与协议身份与权限观测与评测 87.5
ProblemP1独立工具集成会重复权限逻辑,并让同一会话混入不同客户的敏感资料。E1
└─mitigateD1网关先确定客户候选,再逐层判断敏感性,阻断未经批准的跨客户访问并留审计;交互使用用户身份,自动化使用预声明客户和工具范围的服务身份E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

集中数据出口与身份策略,同时用只能走正式接口的客户端验收,分别管理交互和长期自动化身份。

Trade-offs

模型分类仍可能漏判;采用率不证明隔离率。只读CLI是有意选择的另一通道,其权限与审计不能由MCP网关覆盖的叙述自动推得。

Where the evidence stops

模型分类仍可能漏判;采用率不证明隔离率。只读CLI是有意选择的另一通道,其权限与审计不能由MCP网关覆盖的叙述自动推得。

09.12Engineering Agency:通过消息和检查点让Agent休眠后继续工作Problem大量会话闲置时仍占机器,且恢复不能依赖原内存进程。Takeaway会话长期闲置且恢复状态可序列化时使用;把副作用幂等与存储保留策略作为应用责任单列。 状态与恢复安全与隔离运行时与调度 87.5
ProblemP1大量会话闲置时仍占机器,且恢复不能依赖原内存进程。E1
└─mitigateD1无状态控制面管理持久runner;输入输出队列解耦应用,单写者输出日志按检查点重放;密钥注入、出口过滤和runner身份放在沙箱外E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

会话长期闲置且恢复状态可序列化时使用;把副作用幂等与存储保留策略作为应用责任单列。

Trade-offs

8ms/40ms是双方在线的队列往返分位数,不是恢复延迟;应用负责检查点内容,日志恢复不保证外部动作无重复,容器也不是绝对隔离证明。

Where the evidence stops

8ms/40ms是双方在线的队列往返分位数,不是恢复延迟;应用负责检查点内容,日志恢复不保证外部动作无重复,容器也不是绝对隔离证明。

09.12Engineering 无状态MCP:用三个小实现检验更简单的工具接口Problem会话握手和路由状态提高小型MCP客户端与服务端的实现成本。Takeaway适合明确、可审计的工具接口;同时保留鉴权、查询权限和业务状态。 工具与协议状态与恢复文件与工件 75
ProblemP1会话握手和路由状态提高小型MCP客户端与服务端的实现成本。E1
└─mitigateD1把版本与客户端信息放入单次请求,作者实现CLI检查器、Datasette只读查询插件和LLM客户端E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

适合明确、可审计的工具接口;同时保留鉴权、查询权限和业务状态。

Trade-offs

仅支持所示工具接入可行性;不证明吞吐或安全性提高,无状态传输也不表示业务无需保存状态,客户端仍为alpha。

Where the evidence stops

仅支持所示工具接入可行性;不证明吞吐或安全性提高,无状态传输也不表示业务无需保存状态,客户端仍为alpha。

09.12Engineering Zalando:集中接入和风险规则支撑多团队Agent采用Problem工具快速变化时,凭证、配置、成本和审查方式难以在数百团队保持一致。Takeaway先统一接入与可观测字段,风险规则按自身事故校准;区分已运行能力与路线图。 状态与恢复工具与协议身份与权限 87.5
ProblemP1工具快速变化时,凭证、配置、成本和审查方式难以在数百团队保持一致。E1
└─mitigateD1以LLM代理与动态凭证接入统一治理,按事故经验给PR风险分级;用会话与代码演变数据观察问题,而不强制所有团队选同一客户端E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

先统一接入与可观测字段,风险规则按自身事故校准;区分已运行能力与路线图。

Trade-offs

低风险PR相对全部PR的20–40%时长差不是随机对照;复杂度曲线也不能单独归因AI,规划中的平台和身份Broker不算已部署。

Where the evidence stops

低风险PR相对全部PR的20–40%时长差不是随机对照;复杂度曲线也不能单独归因AI,规划中的平台和身份Broker不算已部署。

09.12Engineering Hyper-τ-bench:让Agent从业务资料中构建另一个AgentProblem真实构建任务的规格分散,还要兼顾工具缺陷、服务成本和最终用户表现。Takeaway分开评估需求发现、构建设计与交付服务表现,预算作为交付约束。 状态与恢复工具与协议记忆与上下文 75
ProblemP1真实构建任务的规格分散,还要兼顾工具缺陷、服务成本和最终用户表现。E1
└─measureD1开发Agent在模拟公司资料与客户访谈中恢复需求,在沙箱构建服务Agent;交付后用不可见任务、固定模型菜单与会话预算验收E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

分开评估需求发现、构建设计与交付服务表现,预算作为交付约束。

Trade-offs

参考对照增加了人工知识和干预,不是单一结对机制收益;提问数相关性不证明自动访谈能力,博客未完整披露方差及全部运行协议。

Where the evidence stops

参考对照增加了人工知识和干预,不是单一结对机制收益;提问数相关性不证明自动访谈能力,博客未完整披露方差及全部运行协议。

09.12Engineering My AI Adoption Journey:把反复纠错转化为仓库工具ProblemAgent能完成局部任务,但人工盯守与重复纠错会抵消收益。Takeaway适合可检查且相对独立的维护任务;保留人对复杂设计的投入,按任务价值而非运行时长安排Agent。 工具与协议运行时与调度文件与工件 72.5
ProblemP1Agent能完成局部任务,但人工盯守与重复纠错会抵消收益。E1
└─mitigateD1用本人手工结果校准任务边界,把Ghostty中的失败经验写入规则并提供截图、测试等工具;后台只承接已知适合的工作E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

适合可检查且相对独立的维护任务;保留人对复杂设计的投入,按任务价值而非运行时长安排Agent。

Trade-offs

不能保证写入规则后永不再犯,也没有整体效率或技能保持的受控比较。

Where the evidence stops

不能保证写入规则后永不再犯,也没有整体效率或技能保持的受控比较。

09.12Engineering Stripe Minions:将自由推理嵌入有界交付流程Problem无人值守编码需要完整开发环境、足够上下文和明确停止条件。Takeaway已有稳定开发环境和自动检查时采用;保留有界修复、失败交接和独立代码审查。 安全与隔离状态与恢复工具与协议 87.5
ProblemP1无人值守编码需要完整开发环境、足够上下文和明确停止条件。E1
└─mitigateD1预热隔离devbox,Goose分支交错Agent步骤与固定Git、lint、测试步骤;按目录加载规则和工具子集,先本地修复,再最多两轮CI并交人工审查E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

已有稳定开发环境和自动检查时采用;保留有界修复、失败交接和独立代码审查。

Trade-offs

PR量不是成功率;多轮指示和人工修正仍可能发生,隔离与两轮CI是特定基础设施选择,不能移植为通用安全保证。

Where the evidence stops

PR量不是成功率;多轮指示和人工修正仍可能发生,隔离与两轮CI是特定基础设施选择,不能移植为通用安全保证。

09.12Paper GAM:在语义边界固化记忆,再沿主题回到事件证据Problem长对话不断更新记忆时,暂时性的叙事变化容易混入长期知识;固定长度切分又可能拆散需要一起理解的事件。TakeawayGAM通过推迟长期图更新、保留事件原文并按主题回钻,改善两个对话问答基准中的记忆召回。可采用的是写入时机与检索路径的分工;证据不覆盖生产恢复、事实正确性或所有任务上的优势。 记忆与上下文文件与工件身份与权限 75
ProblemP1长对话不断更新记忆时,暂时性的叙事变化容易混入长期知识;固定长度切分又可能拆散需要一起理解的事件。E1E2
└─mitigateD1将新话轮先追加到独立事件图,在稀疏维护时机判断语义边界,再生成含摘要与原文的主题节点,并归档和链接事件图。E2E3
ProblemP2把长期主题和具体事件分开保存后,单靠相似度搜索难以同时找到相关主题、说话者和时间细节。E1E4
└─mitigateD2检索先定位主题并扩展相邻主题,再回到归档事件,用语义分结合时间、说话者和置信信号挑选最终上下文。E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可在持续对话记忆管线借鉴活跃事件缓冲、语义固化和可回钻原文的主题索引。服务端采用时必须另行定义图/原文的版本、并发和恢复边界;论文算法中的atomic不能充当数据库事务凭据。对短历史或严格低延迟查询,额外图维护未必划算。

Trade-offs

写入分层减少长期图频繁更新,却增加分界判断、摘要、关系评分和归档成本。主题剪枝适合定位明确的问题,也可能漏掉开放问题的宽泛背景;查询token较少但不保证低延迟。

Where the evidence stops

正式ACL论文、四个冻结backbone、两个文本问答基准、组件/切分对照和模拟分界噪声;成本分查询与维护,缺重复不确定性、完整预算配平和持久恢复证据。

09.12Engineering Blaxel:把执行权与原生会话一起交给云端,再经审阅和重试带回本地Problem本地Agent转到云端继续工作时,项目文件、原生会话和待发送输入必须一起交接;若本地仍继续执行,两端会形成互相冲突的工作历史。Takeaway该插件让同一会话以明确执行归属移到云端,并通过审阅、历史校验与可重试导入带回本地;适用范围是受支持的快照和子会话状态。 状态与恢复文件与工件身份与权限 75
ProblemP1本地Agent转到云端继续工作时,项目文件、原生会话和待发送输入必须一起交接;若本地仍继续执行,两端会形成互相冲突的工作历史。E1E2E3
└─mitigateD1插件拦截本地Agent的新请求,等待在途工具结束后持有会话锁,再将原生事件、项目快照和支持的后代历史交给云端继续执行。E2E3E7
ProblemP2云端任务返回时,文件修改、根会话和子会话历史可能只写入一部分;直接删除云环境会丢失恢复依据,直接继承云端权限则会改变本地执行边界。E4E5E6
├─mitigateD2返回流程先冻结云端并核对审阅补丁和历史前缀,按顺序导入文件与会话;冲突保留恢复材料,写完返回回执后才清理云环境。E3E4E5
└─mitigateD3返回会话时重新追加原来的本地权限策略,避免云端VM中的宽权限随历史导入而成为本地工具权限。E6E8
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

本项目可迁移的最小设计是把执行归属、状态载荷和返回清理分成可检查的合同。harness内核提供请求拦截、停稳、原生事件导入和权限策略接口;插件承担本地与云端绑定、项目快照、审阅补丁以及返回回执。部署前提是Git工作区、支持的静止子会话与可移植模型认证,而不是假定所有插件状态都能迁移。

Trade-offs

明确交接点换来可检查的恢复顺序,但持续双端编辑、任意活动子任务和全部插件能力迁移不受支持。VM宽权限与portable key使返回权限恢复成为必要边界;多个本地对象依次写入而非共同事务。

Where the evidence stops

固定September10实现支持客户端交接与顺序返回,作者案例支持有限可用性;没有跨对象原子提交,远端冻结重启持久性本轮仅核到设计说明。

09.11Engineering Agents SDK:把任务状态与沙箱生命周期分开Problem容器失效不应同时丢失任务进度。Takeaway这篇文章的价值在于说明任务如何脱离单个容器持续运行,证据属于架构和接口说明。 状态与恢复文件与工件安全与隔离 75
ProblemP1容器失效不应同时丢失任务进度。E1
└─mitigateD1用Manifest定义工作区,并将可恢复状态放在计算环境之外。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是分别管理任务记录与临时计算资源;恢复时还需核对外部副作用,不能只恢复文件。

Trade-offs

检查点恢复没有证明外部操作只发生一次。文章发布时先支持Python,其他能力的计划不能当作当时已交付功能。

Where the evidence stops

检查点恢复没有证明外部操作只发生一次。文章发布时先支持Python,其他能力的计划不能当作当时已交付功能。

09.11Engineering Claude隔离设计:权限边界需要覆盖代码、凭据和工具Problem同样运行模型生成的代码,不同产品需要保护的对象不同。Takeaway隔离的有效性取决于所有执行路径是否遵守同一权限边界。文章最有价值的是公开修补案例,而不是一个通用“安全沙箱”结论。 身份与权限安全与隔离工具与协议 92.5
ProblemP1同样运行模型生成的代码,不同产品需要保护的对象不同。E1
└─mitigateD1按产品划定执行位置、文件挂载与宿主工具的权限边界。E2
ProblemP2允许访问可信域名,仍可能把数据送给不该接收的人。E1
└─mitigateD2让凭据与信任检查决定可执行行为,补足域名白名单。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是画出真实的数据和执行路径:代码在哪运行,凭据由谁持有,挂载允许什么操作,工具是否绕过执行隔离。它适合设计权限边界和排查绕过;高权限宿主工具与外部服务仍应各自约束。

Trade-offs

限制文件写入不等于限制读取或外发,虚拟机也不能替代对宿主MCP的审查。产品模式变化会改变边界;文章提到的日志导出还存在事后可见性限制。案例证明特定漏洞及修补逻辑,不能证明所有注入均被阻止。

Where the evidence stops

限制文件写入不等于限制读取或外发,虚拟机也不能替代对宿主MCP的审查。产品模式变化会改变边界;文章提到的日志导出还存在事后可见性限制。案例证明特定漏洞及修补逻辑,不能证明所有注入均被阻止。

09.11Engineering 多Agent红队:消息传播会放大信任和权限错误Problem单个Agent看似合理的协助,可能在网络中变成越权传播。Takeaway网络层的危险来自信任被逐次转交。文章展示了传播路径,尚未证明某套缓解措施能普遍阻断它。 身份与权限安全与隔离文件与工件 80
ProblemP1单个Agent看似合理的协助,可能在网络中变成越权传播。E1
└─diagnoseD1沿消息链检查传播、声誉放大、伪共识和代理转述。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是让交接保留原始请求者、授权范围和信息来源,接收者不能把同一来源的多次转述算成独立证据。该文适合扩充多Agent风险模型,无法替代每次工具操作的授权判断。

Trade-offs

这些是受控平台上的案例,不是网络攻击发生率。不同模型、历史和角色共同影响结果,不能逐项作因果归因。文末提出限速、传播隔离和来源记录等措施,其防御效果并未在这些案例中完成系统比较。

Where the evidence stops

这些是受控平台上的案例,不是网络攻击发生率。不同模型、历史和角色共同影响结果,不能逐项作因果归因。文末提出限速、传播隔离和来源记录等措施,其防御效果并未在这些案例中完成系统比较。

09.11Engineering Deep Agents评测:把环境、任务产物和重复运行纳入比较Problem最终回答看起来正确,不能说明Agent实际改变了正确的文件或状态。Takeaway评测对象应包含环境与产物。分层测试能降低迭代成本,但快速子集不能独立证明最终质量。 观测与评测文件与工件状态与恢复 75
ProblemP1最终回答看起来正确,不能说明Agent实际改变了正确的文件或状态。E1
├─measureD1把执行环境、任务指令和验收脚本共同定义为一道测试。E2
└─measureD2将重复端到端评测与快速能力测试分层使用。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是把“任务是什么”和“如何验收”一起保存,并分别展示重复运行的任务结果和组件测试状态。它适合已有可执行验收条件的工作;开放式品质仍需要额外判断依据。

Trade-offs

固定难而可解的子集有利于迭代,也会形成选择偏差。反复用同一子集决定改动,不能把这部分成绩当成独立泛化证明。对話用户模拟和脚本验收仍只覆盖已建模的业务行为。

Where the evidence stops

固定难而可解的子集有利于迭代,也会形成选择偏差。反复用同一子集决定改动,不能把这部分成绩当成独立泛化证明。对話用户模拟和脚本验收仍只覆盖已建模的业务行为。

09.11Engineering Deep Agents v0.7:用对照评测删去不再必要的默认提示Problem默认提示和工具指导不断累积,可能增加成本并挤压用户指令。Takeawayv0.7展示了如何用评测缩减默认指导,同时保留可配置性。文章支持固定输入显著减少,不能支持所有任务同幅降本或质量等效。 工具与协议观测与评测文件与工件 82.5
ProblemP1默认提示和工具指导不断累积,可能增加成本并挤压用户指令。E1
├─mitigateD1比较新旧框架后,移除基础系统提示、缩短工具描述,并将待办中间件改为可选。E2
└─mitigateD2开放中间件替换,同时让文件工具明确报告分页与截断状态。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是把默认提示视为需要维护的设计选择,并保留应用覆盖默认值的入口。采用时应关心任务总成本、结果质量和工具权限;只有基础输入规模相近,才适合横向比较固定开销。

Trade-offs

默认开销下降不等于整次任务便宜65%,奖励差不显著也不能保证任何业务无回退。长任务、较弱模型或需要展示进度的产品仍可能需要待办机制。默认删除工具等行为变化,也会改变应用的权限配置。

Where the evidence stops

默认开销下降不等于整次任务便宜65%,奖励差不显著也不能保证任何业务无回退。长任务、较弱模型或需要展示进度的产品仍可能需要待办机制。默认删除工具等行为变化,也会改变应用的权限配置。

09.11Paper Agent Harness综述:按工程职责区分执行核心与控制层Problem组件名称相似,不代表承担相同职责;按产品名比较容易遗漏系统边界。Takeaway这篇综述把分散项目整理为可解释的工程职责地图。它能帮助定位缺口,不能替代系统效果比较。 工具与协议记忆与上下文观测与评测 82.5
ProblemP1组件名称相似,不代表承担相同职责;按产品名比较容易遗漏系统边界。E1
├─measureD1用七类工程职责描述系统,而不是按品牌或最小运行组件分类。E2
└─measureD2公开收集、纳入和编码规则,让生态分布有可追溯的含义。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是用七类职责检查架构边界及接口,尤其把观测与验证分开。它适合做设计审查和研究导航;选型仍需回到项目实现与本地任务,不应按标签数量排名。

Trade-offs

公开项目、英语材料和coding场景占比较高,不能据此估计整个生产市场。某项目未被标上治理或观测标签,表示未找到足够公开依据,不等于它没有实现。分类也没有证明七层越齐全性能越好。

Where the evidence stops

公开项目、英语材料和coding场景占比较高,不能据此估计整个生产市场。某项目未被标上治理或观测标签,表示未找到足够公开依据,不等于它没有实现。分类也没有证明七层越齐全性能越好。

09.11Paper 计算机操作可靠性:重复成功比一次完成更难Problem一次成功率高,仍可能在重复处理相同任务时频繁失败。Takeaway重复成功取决于信息和行为是否稳定,不只是采样温度。澄清在所测设置中有效,计划复用则明显依赖模型与反馈质量。 观测与评测文件与工件身份与权限 92.5
ProblemP1一次成功率高,仍可能在重复处理相同任务时频繁失败。E1
└─measureD1用同题重复执行及配对比较,区分成功水平和稳定性。E2
ProblemP2可靠性不足有不同来源,降低随机性不一定解决指令和计划问题。E1
└─measureD2分别干预解码、界面噪声、指令澄清和历史计划。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是将“成功过”和“重复可用”分开,并把明确目标、正确观察和执行计划作为不同排查入口。适合已有稳定任务定义和验收信号的工作;真实用户信息不足时,应保留不确定性,而非预期复制实验提升。

Trade-offs

静态澄清读取评测脚本来明确成功条件,用户模拟器也使用轨迹和评测信号;计划提炼假定可取得真实成功标签。这些是诊断实验的受控信息,不等于现实中Agent能自主识别所有歧义。固定计划还可能放大不完整反馈。

Where the evidence stops

静态澄清读取评测脚本来明确成功条件,用户模拟器也使用轨迹和评测信号;计划提炼假定可取得真实成功标签。这些是诊断实验的受控信息,不等于现实中Agent能自主识别所有歧义。固定计划还可能放大不完整反馈。

09.11Paper 长时域训练:改变动作粒度,缩短需要学习的交互链Problem最终目标很远时,整条轨迹失败的反馈可能惩罚本来正确的中间动作。Takeaway有效时域由动作接口和奖励划分共同决定。论文为缩短交互链提供了对照证据,迁移前提是能保持动作与子目标的可验证性。 状态与恢复文件与工件工具与协议 87.5
ProblemP1最终目标很远时,整条轨迹失败的反馈可能惩罚本来正确的中间动作。E1
├─mitigateD1允许灵活的宏动作,减少达到同一目标所需的交互轮次。E2
└─mitigateD2对可验证子目标分段计算回报,缩短信用分配范围。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是把动作接口也看作学习问题的一部分:可验证、可中止的复合操作可能比大量细碎操作更合适。它主要适用于可控制训练环境、动作语义与奖励的团队;普通应用只能借鉴接口粒度,不能套用训练增益。

Trade-offs

机制解释中关于负优势更新的部分仍是作者推测。主实验使用小模型与受控环境,子目标回报改变了监督结构。结论不能直接外推成闭源模型运行时批量调用工具必然更好,更不能忽略宏动作中的错误和副作用。

Where the evidence stops

机制解释中关于负优势更新的部分仍是作者推测。主实验使用小模型与受控环境,子目标回报改变了监督结构。结论不能直接外推成闭源模型运行时批量调用工具必然更好,更不能忽略宏动作中的错误和副作用。

09.11Paper 何时澄清:先区分目标缺失与输入缺失Problem较晚补充信息能否挽回任务,取决于此前缺少的是什么。Takeaway澄清的价值取决于缺失信息类型和任务结构。论文给出时机诊断方法,尚未提供可直接部署的自动提问策略。 安全与隔离工具与协议文件与工件 82.5
ProblemP1较晚补充信息能否挽回任务,取决于此前缺少的是什么。E1
├─measureD1按目标、输入、约束和背景四类缺失,在控制时点注入真实补充信息。E2
└─measureD2另外观察自然提问,并将提问频率与提问时机分开记录。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是先识别缺失信息会否改变交付目标,再判断能否通过环境探索补足。该研究适合解释澄清优先级;实际交互应看错误方向的代价,不宜把轨迹百分比写成固定提问规则。

Trade-offs

摘要把晚问的不利影响写得过于普遍,正文并不支持所有类型过半程都低于不问:代码任务的约束澄清在全部测试时点仍高于无澄清。10%和50%也不是通用门限。强制提供正确答案测的是信息价值上界,未解决自动识别歧义、提出好问题和用户回答成本。

Where the evidence stops

摘要把晚问的不利影响写得过于普遍,正文并不支持所有类型过半程都低于不问:代码任务的约束澄清在全部测试时点仍高于无澄清。10%和50%也不是通用门限。强制提供正确答案测的是信息价值上界,未解决自动识别歧义、提出好问题和用户回答成本。

09.11Paper HarnessAudit:任务完成后,仍要检查执行是否越界Problem正确的最终结果会掩盖途中发生的资源越权和信息泄露。Takeaway完成任务与遵守权限是两个独立判断。HarnessAudit提供了把二者放进同一次轨迹审查的方法,结论限于其模拟任务与审计规则。 观测与评测身份与权限安全与隔离 87.5
ProblemP1正确的最终结果会掩盖途中发生的资源越权和信息泄露。E1
├─measureD1用隐藏的任务规则和独立后台记录审查动作、资源与通信。E2
└─measureD2分别评估边界遵守、执行有效性和扰动后的稳定性。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是让验收同时读取最终产物和执行证据,并将“工具允许调用”进一步细化为允许访问哪些资源、允许传递哪些字段。适合可明确表达权限的工作流;若日志不完整或策略含糊,评测也会失去依据。

Trade-offs

这是模拟服务和已定义策略下的评测,不是线上安全认证。部分指标依赖GPT-5.4评判及严重性权重,综合分不能直接解释为事故概率。框架比较还包含模型、工具和执行策略差异,“框架决定安全上限”应视作解释,不能当作严格因果定律。

Where the evidence stops

这是模拟服务和已定义策略下的评测,不是线上安全认证。部分指标依赖GPT-5.4评判及严重性权重,综合分不能直接解释为事故概率。框架比较还包含模型、工具和执行策略差异,“框架决定安全上限”应视作解释,不能当作严格因果定律。

09.11Paper Self-Harness:从反复失败中提出小改动,再决定是否保留Problem仅凭一次失败修改整个框架,容易修好个案却破坏已有行为。TakeawaySelf-Harness把失败诊断连到受限修改和回归筛选。收益有具体轨迹支持,但保留集参与选型,泛化结论需相应收窄。 观测与评测工具与协议文件与工件 82.5
ProblemP1仅凭一次失败修改整个框架,容易修好个案却破坏已有行为。E1
├─mitigateD1按验收失败、相关行为及其作用聚合轨迹,再提出范围有限的候选修改。E2
└─mitigateD2用两个固定任务划分的结果决定晋级,并记录被拒绝的候选。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是让修改记录保留针对的失败模式、实际改动范围和被破坏的行为,并把筛选数据与最终判断数据的角色写清楚。它适合有可靠任务验收器的框架迭代,不能仅靠模型自我评价证明进步。

Trade-offs

反复用同一保留集筛选,会使最终成绩受到选择过程影响。最小初始框架也不等于已有成熟生产框架;最大相对提升不能作为一般收益预期。接受条件约束任务通过数,没有覆盖安全性、费用和所有合并改动的交互。

Where the evidence stops

反复用同一保留集筛选,会使最终成绩受到选择过程影响。最小初始框架也不等于已有成熟生产框架;最大相对提升不能作为一般收益预期。接受条件约束任务通过数,没有覆盖安全性、费用和所有合并改动的交互。

09.11Paper 训练与Harness协同:更换工具接口可能暴露训练依赖Problem训练所得能力可能依赖特定工具接口,换接口后看似合理的调用仍会失败。Takeaway模型与执行框架存在共同适应。训练时提供可用信息有帮助,但迁移后的正确格式仍不代表正确动作。 工具与协议文件与工件状态与恢复 82.5
ProblemP1训练所得能力可能依赖特定工具接口,换接口后看似合理的调用仍会失败。E1
├─measureD1逐级增加工具前提和状态信息,并比较训练时使用与训练后补加。E2
└─measureD2通过工具版本和任务类别迁移,区分格式适应与动作适用。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是把工具接口版本与训练配置一起记录,并把格式错误和状态错误分别观察。它适合能控制训练或工具环境的系统;只更换描述时,首先要确认新增信息的来源和成本。

Trade-offs

更充分的框架直接提供了原本需要探索的信息,收益不只来自文字写得更好。结果主要来自改造后的ALFWorld和小型开源模型;高信息版本也没有消除迁移损失。不能据此要求所有生产框架都增加更多上下文。

Where the evidence stops

更充分的框架直接提供了原本需要探索的信息,收益不只来自文字写得更好。结果主要来自改造后的ALFWorld和小型开源模型;高信息版本也没有消除迁移损失。不能据此要求所有生产框架都增加更多上下文。

09.11Paper Outcome Monitors:发现工具异常之后,还要给出可行的恢复入口Problem工具没有报错,并不表示返回内容符合任务所需条件。Takeaway恢复入口是这组实验中可检测增益的重要来源。结果约束能减少无效警告,但不能保证任意工具故障都会被发现或修复。 工具与协议状态与恢复观测与评测 95
ProblemP1工具没有报错,并不表示返回内容符合任务所需条件。E1
├─mitigateD1从公开接口和干净样本建立结果约束,在调用返回时检查。E2
└─mitigateD2将公开可用的替代工具附在回执中,并单独检查这部分的贡献。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是把检测覆盖、恢复能力和真实故障频率分别评估。它适合有公开结果约束和替代读取路径的工具;不可逆写入、权限和隐私问题不能仅靠提示回执保护。

Trade-offs

故障密集样本不能直接预测自然生产流量的收益。独立构造的事故类故障检出率约46%,对合理字符串内部的错误尤其有限;AppWorld保留集没有净收益。分类故障和守恒关系故障的恢复效果也不同,且非强制提示仍可能诱导错误反应。

Where the evidence stops

故障密集样本不能直接预测自然生产流量的收益。独立构造的事故类故障检出率约46%,对合理字符串内部的错误尤其有限;AppWorld保留集没有净收益。分类故障和守恒关系故障的恢复效果也不同,且非强制提示仍可能诱导错误反应。

09.11Paper 记忆压缩断崖:规则需要按类型保留,不能只按相似度筛选Problem一条不常被提及的规则可能决定安全边界,却在压缩和检索中被丢弃。Takeaway规则能否存活,需要贯穿压缩、分区和检索。该方法改善了规则保留,但分类漏检和预算前提决定其保证范围。 记忆与上下文安全与隔离身份与权限 87.5
ProblemP1一条不常被提及的规则可能决定安全边界,却在压缩和检索中被丢弃。E1
├─mitigateD1先识别信息类型,再对约束采用严格保留路径。E2
└─mitigateD2在压缩、拆分和检索时分别维护约束的完整性、作用域和优先级。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的启发是把规则与一般经历分开存储,并让预算不足成为显式状态,避免静默删规则。采用时还要保留来源权威和作用域,不能把外部文档中的命令误升为系统约束;执行权限仍需独立检查。

Trade-offs

保证依赖分类器识别到了规则、作用域正确和预算可行;SafetyMed仍有分类漏检。它保护的是存储与上下文中的内容,并不保证模型会服从规则。公开GitHub语料、类型标注分歧、分区复制开销和缺少token匹配的下游对照共同限制外推。

Where the evidence stops

保证依赖分类器识别到了规则、作用域正确和预算可行;SafetyMed仍有分类漏检。它保护的是存储与上下文中的内容,并不保证模型会服从规则。公开GitHub语料、类型标注分歧、分区复制开销和缺少token匹配的下游对照共同限制外推。

09.11Engineering Manus上下文工程:缓存、行动选择与长期记忆要分别处理Problem反复改写上下文前部,会损失缓存并增加重复输入成本。TakeawayManus提供的是一组有取舍的上下文设计经验。缓存命中、信息可恢复和任务完成应分别判断。 记忆与上下文文件与工件工具与协议 82.5
ProblemP1反复改写上下文前部,会损失缓存并增加重复输入成本。E1
└─mitigateD1保持稳定前缀和工具定义,用状态控制当前可选动作。E2
ProblemP2历史越来越长时,Agent容易忘记目标或重复此前错误。E1
└─mitigateD2把大块信息存为可回读文件,并用计划与错误记录维持任务方向。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是明确每类信息的职责:稳定规则放前部,可回读材料保留地址与版本,当前目标和未解决错误保持可见。它适合工具调用密集的长期任务,具体动作掩码和缓存策略需要执行平台支持。

Trade-offs

外存可恢复需要文件、链接和版本仍然可用。把所有信息放进文件并不保证会正确回读;错误记录和待办也要占用上下文。稳定缓存前缀与适度改变任务示例作用于不同位置,不能简单理解成“提示一律固定”或“一律变化”。

Where the evidence stops

外存可恢复需要文件、链接和版本仍然可用。把所有信息放进文件并不保证会正确回读;错误记录和待办也要占用上下文。稳定缓存前缀与适度改变任务示例作用于不同位置,不能简单理解成“提示一律固定”或“一律变化”。

09.11Engineering Pizza Bot:扩展就绪后才进入Agent,刷新与恢复保留版本边界Problem插件已经安装时,Agent仍可能看到尚未连接或不兼容的能力,造成委托后才发现工具不可用。TakeawayPizza Bot把技能存在、技能可调用和插件版本激活分开处理,提供了可检查的扩展生命周期;恢复保证只到持久状态和技能文件,不能扩大为副作用恰好一次。 工具与协议文件与工件状态与恢复 75
ProblemP1插件已经安装时,Agent仍可能看到尚未连接或不兼容的能力,造成委托后才发现工具不可用。E1E2E4
├─mitigateD1把已安装技能与可调用技能分开:依赖就绪后,才将技能编译为绑定工具和审批策略的worker。E2E3E8
└─mitigateD4服务器持有运行,客户端只订阅;中断审批依赖checkpointer。E3E7E9
ProblemP2扩展刷新与暂停恢复发生交错时,新的技能文件可能覆盖旧运行所依赖的上下文。E4E5
├─mitigateD2插件生成内容通过校验才激活为版本快照;刷新失败保留旧快照并显式标记失鲜。E4
├─mitigateD3新消息装入当前技能文件,恢复命令使用持久状态中的技能文件。E5
└─mitigateD4服务器持有运行,客户端只订阅;中断审批依赖checkpointer。E3E7E9
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将安装目录、ready目录和激活快照分开;新turn使用当前材料,resume沿用旧state文件。多租户身份与副作用提交另由服务器设计承担,属于本项目采用推断。

Trade-offs

依赖准入减少委托后的不可用工具;保留旧快照提高可用性但允许失鲜。进程级权限与单用户存储使部署边界较窄。

Where the evidence stops

固定commit代码与官方指南支持状态流;没有开源版可靠性负载报告,插件使用宿主用户权限。

09.11Paper Attn-GS:先标记个性化信号,再离线压缩任务画像Problem个性化历史压缩到很短的画像时,截断或直接摘要可能丢掉决定当前任务表现的用户偏好。TakeawayAttn-GS用注意力标记引导文本压缩,在两类个性化任务中较直接摘要保留更多效用;可复用的是与具体问题无关的任务画像,边界是白盒前处理、更新成本和代理指标。 身份与权限记忆与上下文文件与工件 75
ProblemP1个性化历史压缩到很短的画像时,截断或直接摘要可能丢掉决定当前任务表现的用户偏好。E1E4
├─mitigateD1用白盒模型的句级注意力标出历史中的任务相关内容,再让摘要器基于完整带标记历史生成短画像。E2E3
├─mitigateD2标注和摘要只依赖历史与任务类型,具体问题在最终生成阶段加入,使画像可离线复用。E3E7
└─validateD3用独立用户历史微调标注器,并比较随机标记、全部标记、提示标记和未微调标注器。E4E5E6
ProblemP2若每个请求都重新处理完整历史,短摘要难以抵消重复的上下文处理开销。E3E7
└─mitigateD2标注和摘要只依赖历史与任务类型,具体问题在最终生成阶段加入,使画像可离线复用。E3E7
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

采用两阶段画像编译:历史加任务说明先标重点,再摘要;画像与用户/历史版本/任务类型绑定。服务端失效与删除策略属于本项目推断,论文未解决。

Trade-offs

白盒标注和可选任务微调增加前置成本,换取任务相关画像;离线复用依赖历史与任务类型稳定。

Where the evidence stops

ACL正式论文、两类任务、多种标记对照;无总成本测量、重复不确定性或动态记忆一致性证据。

09.11Paper MemoryAgentBench:测量冲突覆写、多跳传播与预算敏感性Problem一次性长上下文测评无法观察记忆随输入累积后能否覆写旧事实,并把更新传播到多跳答案。TakeawayMemoryAgentBench把记忆的累积输入、最新事实和多跳传播变成显式测量条件,并显示排名受预算和覆写指令影响;这是一套静态流评测协议,不能直接证明真实长期Agent的更新可靠性。 记忆与上下文文件与工件安全与隔离 75
ProblemP1一次性长上下文测评无法观察记忆随输入累积后能否覆写旧事实,并把更新传播到多跳答案。E1E2
├─measureD1将资料顺序分块注入统一记忆接口,再以四类任务测量累积状态的使用能力。E1E3
└─diagnoseD2在FactConsolidation中按序注入相互冲突的事实,并分别检验新值召回和多跳推导。E2E4
ProblemP2记忆系统榜单混合骨干、输入预算和更新指令,分数差异可能被误读为记忆架构的优劣。E5E6E7
└─diagnoseD3改变token预算、骨干及覆写指令,检查记忆排名和冲突答案对比较条件的敏感性。E5E6E7
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

采用明确序号与覆写语义的资料流,同时保留单跳新值题和多跳传播题;预算和构建费用分账,按任务读结果而不依赖总榜。此为本项目评测设计推断。

Trade-offs

统一注入接口提高可比性,但两阶段静态材料不包含真实互动反馈;异质指标与构建开销需要分开理解。

Where the evidence stops

ICLR2026及arXiv v4;顺序注入、冲突实体判分与预算/政策对照。主表预算不齐,裁判校准借用前作,成本排除一次索引。

09.10Paper Cortex:先验证工具缓存的充分性,再核算复用收益Problem精确缓存无法跨措辞复用工具证据,近邻缓存又可能把不充分的结果送进Agent。TakeawayCortex把工具缓存的命中从字符串或向量相似改为响应是否足够回答当前请求,再把淘汰与辅助推理放进成本账本。它支持有局部性的只读证据复用,不提供源版本一致性保证。 文件与工件工具与协议身份与权限 75
ProblemP1精确缓存无法跨措辞复用工具证据,近邻缓存又可能把不充分的结果送进Agent。E1E2
├─mitigateD1SE候选经ANN与语义充分性两层筛选,未确认命中就回源。E2E3
└─validateD4离线回源抽样调整充分性阈值。E3
ProblemP2缓存命中率不代表净收益:保留低价值数据和judge争用都可能抵消远程调用节省。E4E5E8
├─mitigateD2TTL和LCFU管理保留价值,基于确认转移作低初始优先级预取。E4E8
└─mitigateD3Agent与judge共享GPU并优先Agent推理,辅助判定延迟时回源。E5E8
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

适用于有局部性、回源昂贵的只读工具入口。外部组件负责租户/权限/源版本分区;缓存只负责候选、充分性判定、淘汰与回源,这些分区是本项目推断。

Trade-offs

用小模型与回源路径换取更高语义复用率;用资源共享换取GPU成本下降但可能增加尾时延。TTL只限定保留时间。

Where the evidence stops

合成及代理访问、窄coding子集;缺更新/权限注入与重复不确定性,表文数字矛盾单独保留。

09.10Paper MemUse:把问得出、用得上与回忆话术分开测量Problem长期对话中的记忆评测通常明确提示模型回忆事实,却无法说明模型在用户自然发言时是否会使用这些事实。Takeaway记忆评测需要分别检查明确问答能力、自然回复的事实使用及整体融入判定的有效性;本文提供配对诊断,而非已经验证的用户收益优化。 记忆与上下文观测与评测文件与工件 82.5
ProblemP1长期对话中的记忆评测通常明确提示模型回忆事实,却无法说明模型在用户自然发言时是否会使用这些事实。E1E2E3
├─diagnoseD1作者从真实对话的记忆触发时刻重建上下文,把自然回复与明确事实问答配对,并分别评判答得出、整体融入和回复中的具体事实。E2E3
└─measureD3在共享摘要上随机改变额外历史容量,并把事件级记忆判断与session级用户评分关联。E1E6E7
ProblemP2整体判断回复是否融入记忆,可能把回忆话术当作有依据的记忆使用,从而误判提示或记忆组件的改进。E4E5
└─validateD2作者结合人工判定校准、逐事实核验和提示及提取流程干预,检查整体融入评分是否被回忆风格抬高。E4E5E8
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

本项目工程推断:适用于需要自然承接长期历史的对话Agent评测。最小数据合同保存触发时刻、当时可见历史及摘要版本、生成器和提示版本、预期事实、自然回复与另行问答输出。评估层分别输出事实问答、自然回复逐事实支持和整体融入,保留judge版本及人工校准来源;满意度和资源消耗另列。既有事实标注可以迁移,但陪伴对话的时机标准不能直接替代工具任务成功。

Trade-offs

保留自然触发句提高了生态相关性,却使应引用哪些事实及何时引用更主观。NI整体分数适合做诊断线索,不能单独代表真实支持或用户收益;显性触发事件采样、31页论文中的72/73实例口径、对话人群与不等预算限制外推。

Where the evidence stops

共享摘要上的容量比较、有限显性事件及主观judge只支持所研究对话条件;满意度关联、跨harness分数和提示提升均不能作普遍因果结论。

09.10Paper MAST:从交接、停滞到错误验收,定位多 Agent 的失败Problem任务失败后,只看最终答案很难分清是分工不当、交接丢信息,还是没有正确验收。TakeawayMAST的主要贡献是让失败诊断有共同语言,并为分类与自动标注提供分层检查。采用时应把标签接到实际轨迹,保留任务验收作为独立判据。 观测与评测文件与工件 80
ProblemP1任务失败后,只看最终答案很难分清是分工不当、交接丢信息,还是没有正确验收。E1E3
├─diagnoseD1作者沿执行轨迹建立14类失败模式,把系统设计、协作失配和任务验证分开定位。E1E3
└─validateD3在部分系统中分别调整提示和协作结构,观察任务成绩是否变化。E4
ProblemP2失败分类要用于大量轨迹,还必须说明不同标注者能否稳定识别同一问题。E2
└─validateD2先由专家迭代分类定义,再用带示例的LLM标注扩展语料,并与独立人类参照比较。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是保留足以诊断的交接记录:任务目标、交付内容、接收者实际使用的信息,以及最终产物的验收依据。MAST可以作为排查词表,让“停滞”“信息被忽略”“验收错误”有不同入口;自动标签适合作为人工复核线索。 它适合回答“哪里可能出错”,不能独立回答“这次任务是否合格”。因此诊断标签与任务验收结果应分别保存,修复建议也应指向具体执行环节,避免把提高某个分类指标当成业务成功。

Trade-offs

系统之间的任务、轨迹采样和运行配置不同,分类频数因此混合了框架行为与任务难度。图4还使用各系统前30条轨迹的子集。用它比较某类故障的表现形式有意义,用它直接宣布某框架最可靠则超出证据。 一致性也不等于根因正确率。标注者可能稳定识别同一种症状,而真正原因仍涉及上下文、工具或任务规则。论文的干预覆盖有限系统与基准,最终产物是否合格仍要回到任务本身的判据。

Where the evidence stops

专家一致性、自动标注一致性与局部干预分别支持不同结论;跨系统频数不具备统一任务基线。

09.10Paper Magentic-One:用双层控制循环识别停滞并重规划Problem长任务中局部动作可能不断成功,整体却陷入重复或停滞;主Agent需要据此调整计划。TakeawayMagentic-One将主Agent的工作组织成事实维护、进度判断与重规划闭环。它改善了任务控制的可解释性,最终正确性仍取决于实际结果与验收依据。 记忆与上下文文件与工件工具与协议 82.5
ProblemP1长任务中局部动作可能不断成功,整体却陷入重复或停滞;主Agent需要据此调整计划。E1E2E3
├─mitigateD1外层维护任务事实与计划,内层逐步检查完成、重复和前进情况;连续停滞后返回外层重规划。E2E3
└─mitigateD3通过固定职责的浏览、文件、编码和终端工具执行任务,并记录隔离运行轨迹。E1E5
ProblemP2多工具和多角色协作时,已知事实、待查信息与下一步指令容易混在对话里,影响分派和判断。E1E2
├─mitigateD2任务账本区分已知事实、待查项和推断;进度账本据此选择下一位Agent并给出具体指令。E1E2
└─mitigateD3通过固定职责的浏览、文件、编码和终端工具执行任务,并记录隔离运行轨迹。E1E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是保留事实账本与进度判断之间的连接。一次重规划应能解释:哪些事实变了、哪些动作连续没有推进、下一计划改变了什么。这样能帮助读懂主Agent为何改变方向,也便于区分无效循环和正常的困难探索。 这套控制逻辑适合任务路径不固定、但执行角色相对稳定的系统。它可以与运行时的重试恢复并用,不过二者解决不同层面的问题;最终验收仍应引用实际产物和任务判据,不能只依赖进度账本中的自我判断。

Trade-offs

进度与完成判断仍由模型作出。它可能把表面变化当成前进,或把不充分的结果当成完成;达到轮数或资源限制后的最终回答也可能只是最佳猜测。运行结束、主Agent说已完成和任务确实合格,需要分别理解。 系统依赖固定团队和当时的工具能力。文件转成Markdown会损失部分图像信息,代码角色也不等同于完整代码仓库开发系统;多轮浏览与反思还增加费用和时间。论文没有建立持久故障恢复、跨任务记忆或大规模并行调度的保证。

Where the evidence stops

账本消融同时移除多项控制逻辑;上下文重置不回滚外部操作,任务终止也不自动意味着合格。

09.10Paper AgentScope 1.0:把消息、工具执行和运行状态分成可组合接口Problem模型消息格式、工具返回形态和Agent交互方式不一致,会使应用逻辑与适配代码相互缠绕。TakeawayAgentScope的价值在于明确不同接口与执行状态如何组合。采用统一框架后,应用仍需写清哪些状态可恢复、哪些动作可取消,以及权限由哪一层强制执行。 工具与协议状态与恢复文件与工件 75
ProblemP1模型消息格式、工具返回形态和Agent交互方式不一致,会使应用逻辑与适配代码相互缠绕。E1E2
├─mitigateD1作者用结构化消息与模型formatter适配输入输出,将不同工具形态统一为异步生成器,并显式区分reply与observe。E1E2E3
└─mitigateD3应用Agent与Runtime的运行、服务和沙箱层分离,并通过hooks及Studio接入观测。E4E5
ProblemP2流式工具被中断或Agent被恢复时,已经发生的部分执行容易与内存中的完整结果混淆。E3E4
├─mitigateD2中断时保留部分工具结果和中断标记;需要保存的模块状态经StateModule导出和恢复。E3E4
└─mitigateD3应用Agent与Runtime的运行、服务和沙箱层分离,并通过hooks及Studio接入观测。E4E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是三条清楚的边界:模型适配负责格式,Agent逻辑负责推理和观察,Runtime负责服务承载与执行环境。中断记录则同时保留部分产物和执行状态,让后续Agent能够理解当前进度。 它适合多模型、多工具且需要定制交互的应用。若任务还要求跨进程持久恢复、外部副作用去重或强权限隔离,应在相应层另行建立合同;不要仅因为所有组件都接入统一框架,就认为这些保证已经成立。

Trade-offs

取消一次工具调用,不一定能撤销它已发出的请求或已经修改的文件;加载快照也不自动与外部状态保持同一时刻。动态工具组控制可见工具集合,同样不能代替资源端授权。接口解决了组织方式,强制保证仍取决于具体实现边界。 并发也需要应用理解依赖关系。能够同时运行多个异步任务,不意味着彼此有先后依赖的动作可以安全并行;状态注册遗漏则会导致恢复缺项。框架提供组合能力,应用仍需说明哪些状态归谁持有、哪些动作必须按序完成。

Where the evidence stops

依据主要是接口与实现说明;未建立外部副作用原子恢复、统一生产性能或跨租户隔离的证据。

09.10Engineering Cursor Cloud agents:让工作流、机器和会话分别恢复Problem长任务依赖单个worker持续运行时,超时、进程故障和部署升级会打断任务推进。TakeawayCursor的经验说明,长期云端任务需要独立于承载进程和用户连接的运行身份。有限工作流与会话回退提供了恢复结构,外部效果仍需要单独确认。 状态与恢复文件与工件工具与协议 82.5
ProblemP1长任务依赖单个worker持续运行时,超时、进程故障和部署升级会打断任务推进。E1E2
└─mitigateD1作者用Temporal承载持久执行,将有限任务工作流与可重试、可超时的activities分开。E2
ProblemP2Agent运行、远程机器和用户会话的生命周期不同,绑在一起会妨碍恢复并造成流式输出状态混乱。E3
└─mitigateD2分别管理Agent循环、机器状态和会话记录;流式重试允许客户端回退并替换失败尝试的输出。E3
ProblemP3云端缺少可运行的开发环境时,Agent难以验证结果,可能交付表面合理但不能工作的修改。E1E5
└─mitigateD3为Agent准备可运行、可验证的开发环境,并按模型能力调整固定步骤与自主操作的分工。E1E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是分别定义任务、执行尝试、机器和会话的身份。用户断线不应删除任务;机器更换不应使旧输出看起来仍然有效;工具重试则需要自己的去重和结果确认规则。这样的划分能让恢复行为更容易理解和检查。 它适合持续运行、经常跨越进程或连接生命周期的云端Agent。简单短任务未必需要同等复杂的工作流基础设施;迁移价值主要来自清楚的任务边界、恢复责任和环境验证条件,而非复制某个工具名称。

Trade-offs

一个activity在产生外部效果后失败,重试仍可能重复该效果。会话回退也只改变用户看到的内容,并不回滚数据库、提交或远程操作。文章没有给出覆盖所有状态的原子提交协议,因此不能把持久工作流直接解释为端到端恰好执行一次。 生命周期拆分增加了状态协调要求。系统需要知道某次输出属于哪次执行、使用哪台机器及何种环境;具体的一致性和隔离能力仍受实现约束。生产经验提供了问题和方向,没有替每种部署证明相同结果。

Where the evidence stops

生产规模与可靠性为作者自述,缺统一SLA口径;跨状态原子恢复、外部效果去重不能由架构名称推导。

09.10Engineering Anthropic Application harness:把产品目标转成可检查的交付结果Problem简短需求没有明确交付范围,而生成者的自我验收容易宽松,导致应用外观完成但功能不成立。TakeawayApplication harness把目标展开和实际验收接到生成过程。最值得保留的是可检查的交付与具体反馈;角色和阶段数量则应随任务与模型能力变化。 文件与工件记忆与上下文 75
ProblemP1简短需求没有明确交付范围,而生成者的自我验收容易宽松,导致应用外观完成但功能不成立。E1E2E3
├─mitigateD1Planner展开产品规格,Generator与Evaluator先商定可检查的阶段交付,再实现并根据实际运行结果修正。E2E3
├─mitigateD2作者用人工审阅和示例校准评价标准,并随模型升级删减重置和sprint等流程。E2E5E6
└─validateD3角色通过文件交换规格和反馈,评价者用Playwright及应用接口检查功能。E2E3
ProblemP2模型能力和任务类型改变后,原来的上下文、分阶段开发和评价流程可能变成额外负担。E5E6
└─mitigateD2作者用人工审阅和示例校准评价标准,并随模型升级删减重置和sprint等流程。E2E5E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是让任务目标、交付标准和实际检查保持一致。复杂应用可以保留独立规格和具体缺陷反馈;简单任务则未必需要多角色与多阶段。评价结果应说明检查了哪些行为、遗漏哪些维度,便于判断完成声明的范围。 模型升级时,应重新审视固定流程是否还有作用。可以迁移的是明确交付、运行检查和反馈修正之间的联系;sprint数量、上下文重置和角色数量都是可调整的实现选择。

Trade-offs

评价者能看到什么,决定了它能检查什么。浏览器交互可以揭示按钮或流程故障,却不必然覆盖声音质量、真实用户偏好或所有后端条件;经过提示校准的LLM评价也不能直接等同于独立客观真值。 更多轮次未必更好。文章中前端中间版本有时比最终版本更受偏好,重复生成也持续消耗预算。缺少同任务、同预算的组件对照时,最稳妥的结论是流程提供了一种组织方式,不能宣布每个角色或每轮反馈都带来净收益。

Where the evidence stops

案例预算与范围不同,未单独证明每个角色的因果收益;评价覆盖范围受工具与模型感知能力限制。

09.10Engineering Cursor Self-driving codebases:用任务所有权和持续反馈组织大量WorkerProblem大量Worker共享协调状态并等待全局同步时,锁争用和最慢任务会抵消并行收益。Takeaway大规模Worker协作的关键是范围所有权和持续反馈。去掉不必要的全局等待有助于推进,但开发吞吐和最终产物质量仍需分别衡量。 状态与恢复文件与工件 87.5
ProblemP1大量Worker共享协调状态并等待全局同步时,锁争用和最慢任务会抵消并行收益。E1E2
├─mitigateD1由根Planner和有边界的子Planner持续规划,Worker在各自仓库副本中完成分配任务,不依赖全体同步。E2E3
└─mitigateD3移除集中集成瓶颈,容忍开发过程中的少量局部错误,并单独考虑最终稳定分支的整理。E4
ProblemP2持续开发需要明确任务所有权,并把实际发现送回计划;集中调度者若同时承担太多职责,也会形成瓶颈。E2E3
├─mitigateD1由根Planner和有边界的子Planner持续规划,Worker在各自仓库副本中完成分配任务,不依赖全体同步。E2E3
└─mitigateD2Worker把修改、偏差、发现与反馈交回原Planner,Planner结合当前代码持续调整后续任务。E3
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是为每个规划范围和执行任务指定明确负责人,并让交接包含产物、偏差与新发现。规划者可以持续吸收反馈,Worker也不必共同维护一份难以协调的全局计划。 它适合可以拆成相对独立修改的长期开发。高度耦合、需要严格串行顺序的工作仍应保留必要协调;即使开发过程采用异步推进,也应分别看吞吐和最终功能质量,避免用活跃度替代完成度。

Trade-offs

独立仓库副本仍可能产生相互冲突的修改,异步计划也可能基于不同版本。文章没有给出适用于所有冲突、重试和任务重复执行的完整协议,因此不能推导出全局一致性或任意扩展规模下的正确性保证。 开发阶段容忍局部错误,需要有最终质量边界。移除集中集成解决了吞吐瓶颈,却没有取消发布前必须确认功能和兼容性的责任。代码量、提交数和工具调用量都无法替代这一判断。

Where the evidence stops

方案在多次共同变化的工程迭代中形成;吞吐、局部错误容忍和发布质量是三个不同指标。

09.10Paper Scaling Agent Systems:多 Agent 的收益取决于任务和协调成本Problem更多Agent有时提高成绩,有时反而降低表现;仅凭数量无法判断某种任务是否值得协作。TakeawayScaling的实证贡献是揭示协作收益的任务依赖性。其比较维度有助于解释架构选择,经验阈值和回归输出应限于相应数据、资源口径与验证设置。 工具与协议状态与恢复观测与评测 72.5
ProblemP1更多Agent有时提高成绩,有时反而降低表现;仅凭数量无法判断某种任务是否值得协作。E1E4
├─measureD1作者在六个基准上比较单Agent及四类协作架构,并约束工具、核心提示与推理资源。E1E2E4
└─measureD2分别记录成功、开销和错误指标,再用回归及不同留出和稳健性检查分析架构与任务的关系。E3E4E5E6
ProblemP2架构比较若不同时说明预算、聚合策略和测量口径,就难以解释收益来自何处。E2E3E6
└─measureD2分别记录成功、开销和错误指标,再用回归及不同留出和稳健性检查分析架构与任务的关系。E3E4E5E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是先判断工作能否独立拆分、动作是否有顺序依赖,以及单Agent已经解决了多少问题。论文提供了组织比较的维度,也提醒我们保留聚合与验证策略,不能只比较“几个Agent、什么拓扑”。 它适合形成架构选型的条件清单,不能充当通用预测器。阅读其结果时应同时保留任务成绩、资源口径和误差定义;对未覆盖任务,采用判断应明确属于基于机制的推断,而非论文已证明的结论。

Trade-offs

17.2倍与4.4倍描述轨迹中因协调错误增加的计算工作,不是任务失败概率。任务层错误比约为1.1–1.3。约45%的单Agent基线阈值也来自所测数据及模型形式,适合视作这些实验中的模式,不能直接写进所有任务的路由规则。 部分统计关系在更谨慎的分析中不再显著。按数据集聚类后,一些工具和协调项只能作为方向性观察;原文将能力饱和视为相对更稳的结果。新增代码和终端基准各仅20题,完整成本分析主要来自原四基准,结论强度应随这些覆盖范围收窄。 预测输入并非都能在部署前免费获得。ACI由六个基准的单Agent成绩构成,协调效率等还涉及运行后的表现;核心推理预算受控也不表示所有token、延迟和费用完全相等。用回归作事前选型时,需要先说明可取得哪些输入以及代价。

Where the evidence stops

87%命中是限定配置留出结果;轨迹错误倍率不等于失败概率;小样本、成本覆盖和运行后输入限制事前泛化。

09.10Paper Puppeteer:用强化学习选择下一位Agent,权衡质量和推理成本Problem固定协作顺序不能随着任务进展选择更合适的Agent,容易调用无帮助的角色并增加推理成本。TakeawayPuppeteer说明路由策略可以围绕质量与成本共同学习。采用价值取决于稳定候选集合、可信反馈和可摊销的优化投入,不能只看平均得分或推理token下降。 文件与工件状态与恢复工具与协议 82.5
ProblemP1固定协作顺序不能随着任务进展选择更合适的Agent,容易调用无帮助的角色并增加推理成本。E1E2
├─mitigateD1中央策略在每一步根据全局上下文选择一个Agent,执行后更新状态,再决定下一步或终止。E1
├─mitigateD2作者用REINFORCE优化路由策略,将终局质量与推理成本共同写入奖励,利用已完成轨迹调整后续选择。E2E5
└─measureD3分别比较同骨干与异构Agent设置,并跟踪调用数量、token和推理结构的变化。E3E4
ProblemP2只优化答案质量可能不断增加调用,只压低成本又可能过早结束,需要明确权衡目标。E2
├─mitigateD2作者用REINFORCE优化路由策略,将终局质量与推理成本共同写入奖励,利用已完成轨迹调整后续选择。E2E5
└─measureD3分别比较同骨干与异构Agent设置,并跟踪调用数量、token和推理结构的变化。E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们的采用重点是把“选择谁”与Agent自身行为分开,并明确质量与成本的权衡目标。它适合反复遇到类似任务、候选Agent集合较稳定且能得到可信终局反馈的系统;一次性任务或缺少可靠评价时,学习路由的投入可能难以回收。 可迁移的是状态驱动选择和显式奖励结构,而非某个固定循环拓扑。采用判断应同时考虑任务质量、每次推理开销和策略优化成本,并保留对奖励误差与未覆盖任务的边界。

Trade-offs

initial和evolved是同一在线优化轨迹的不同阶段,而非天然对应训练集与独立测试集。阶段结果支持策略在优化过程中的变化,不能直接当成冻结策略在未知任务上的泛化成绩。终局奖励也较粗,未提供每一步决策是否正确的充分反馈。 推理省token不等于总投入一定更少。附录报告使用8张A800、训练约2–6小时,且训练与多Agent推理交错;部分Mimas同骨干任务还没有持续成本下降趋势。比较实际费用时,需要区分单次推理、在线学习和基线搜索所消耗的不同资源。 紧凑和循环结构只是随优化出现的观察。论文没有单独干预循环来证明它必然产生收益;Agent与工具集合仍固定,偶发协调失误也未消失。中央路由器的存在因此不构成一致性或可靠性的保证。

Where the evidence stops

平均收益并非逐任务收益;阶段比较不自动证明冻结策略泛化;紧凑循环的因果作用及总成本优势仍有限定。

09.10Paper MemoryBench:把用户反馈的记忆与后续任务收益分开测量Problem记忆系统能从长历史找回答案,并不说明它能利用过去任务的用户反馈改善下一项任务。只测事实问答,会遗漏反馈经验是否真正有用。TakeawayMemoryBench把反馈经验是否改善后续任务变成可分层检查的问题,并用任务形态及反馈噪声暴露记忆系统的差异。它提供的是测量协议,结果仍受模拟假设、输入预算与判分口径限制。 记忆与上下文观测与评测文件与工件 75
ProblemP1记忆系统能从长历史找回答案,并不说明它能利用过去任务的用户反馈改善下一项任务。只测事实问答,会遗漏反馈经验是否真正有用。E1E2
├─measureD1作者把反馈生成、记忆更新和测试任务判分分开:系统先从训练任务的反馈日志积累经验,再在不同测试题上比较表现,并按领域及输入输出长度报告结果。E2E3E6
└─validateD3作者用人类成对判断检查反馈文本,用同题有无反馈、逐批日志和替换模拟器检查不同层面的表现。E5E7E8
ProblemP2文字批评、点赞和复制传递的信息不同,模拟反馈还可能带有噪声。若把这些信号当成同一种真实偏好,评测就可能把模拟器偏差误判为记忆系统能力。E4E5E8
├─measureD2作者按任务是否有可计算答案生成文字反馈或满意度,再把满意度映射为点赞、点踩和复制信号;通过调整映射或加入噪声,观察记忆系统对反馈变化的敏感性。E4E8
└─validateD3作者用人类成对判断检查反馈文本,用同题有无反馈、逐批日志和替换模拟器检查不同层面的表现。E5E7E8
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

本项目判断:适合在已有Agent评测中分开保存任务context、反馈日志、更新后的记忆版本与测试结果,并将文字和行为反馈视为不同信息源。采用的是反馈利用的测量分工;若要选择生产记忆系统,本文尚不能提供等预算排名、真实用户偏好校准或多租户隔离结论。

Trade-offs

代价和判断范围来自不同反馈、存储粒度与任务量表:同骨干与top-5条目并不统一上下文或费用预算,静态知识输入和部分日志也不同;人评只检查反馈语言,主结果没有多seed区间。成本表单位冲突使精确延迟结论不能采用。

Where the evidence stops

11个公开数据集的采样任务、同骨干八系统、有限逐步更新及反馈干预,另有人评反馈文本;未建立真实行为概率、最终量表的独立校准或严格等预算优势。

09.09Paper ACON:用失败轨迹优化上下文的删留规则Problem长任务Agent的摘要可能删掉后续动作必需的状态和前置条件,最终失败分数却无法告诉压缩器应当保留什么。TakeawayACON把“摘要应保留什么”转为由任务轨迹反馈驱动的压缩规则优化,并允许较小模型承担压缩。它给出可迁移的优化边界,尚不能保证每类任务都保持精度或降低延迟。 工具与协议文件与工件记忆与上下文 82.5
ProblemP1长任务Agent的摘要可能删掉后续动作必需的状态和前置条件,最终失败分数却无法告诉压缩器应当保留什么。E1E2
├─mitigateD1作者分别压缩累积历史和刚收到的长观察,并只在超过阈值时触发;历史压缩保留最近一次动作与观察。E1E5
└─mitigateD2作者比较同任务完整上下文成功而压缩上下文失败的轨迹,用丢失信息反馈改写压缩规则,再从成功轨迹寻找可删冗余。E2
ProblemP2反复调用大模型做压缩会增加额外成本和延迟,即使执行Agent看到的上下文变短,整个系统也未必更便宜或更快。E3E6
└─mitigateD3作者用优化后的大模型压缩器生成输入输出样本,训练较小的压缩器替代它,使执行Agent与压缩模型可以独立配置。E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

本项目判断:适用于执行模型不能微调、已有明确任务结果且上下文增长显著的工具Agent。把压缩规则、触发位置、执行模型和压缩模型分开版本化,按任务类型选择效用优先或更强压缩;保留来源材料与结果口径,不能把压缩后的文本当权威状态或持久恢复凭据。

Trade-offs

压缩减少峰值输入但可能破坏困难任务;第二阶段与联合压缩不保证优于只优化效用。训练测试划分存在,但候选选择的held-out说法与训练子集描述不一致。固定seed仍有非确定性,0.6个百分点的反馈消融没有区间。

Where the evidence stops

证据来自固定ReAct配置、独立任务测试集和阈值/反馈/组合消融;困难任务、QA和部分学生模型存在退化,候选选择集说明及完整延迟收益均有明确限制。

09.09Engineering Chorus:把临时worker调用映射到协作会话ProblemPi临时worker在一次工具调用内就结束,若让模型自行创建和关闭Chorus会话,实际子进程与平台工作记录容易脱节。TakeawayChorus把临时worker的协作记录交给扩展事件,把持久主会话的新建与恢复交回Pi。这个适配边界可复用,但当前实现只提供尽力记账,不能承担必须无遗漏的完成或恢复合同。 工具与协议状态与恢复身份与权限 75
ProblemP1Pi临时worker在一次工具调用内就结束,若让模型自行创建和关闭Chorus会话,实际子进程与平台工作记录容易脱节。E1E2E6
└─mitigateD1扩展在subagent调用开始时为worker创建会话并注入UUID,按toolCallId保存映射,在工具结果与结束事件中发起关闭。E2E6
ProblemP2远程唤醒Pi时,沿用其他宿主的会话探测可能误判新建与恢复,使协作平台的任务身份无法稳定指向原生会话。E4E5
└─mitigateD2Pi后端把同一业务anchor传为原生session-id,由Pi按当前目录中的会话决定创建或恢复,并禁用Claude探测结果的权威性。E4E5E10
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

本项目判断:可迁移的是先辨认宿主的临时调用与持久会话,再把外部协作记录绑定到真实事件和原生会话身份。适合需要可观察任务关联的harness适配;若记录必须完整,现有进程内重试不足以作为事务账本,也不能据此宣布子产物与父完成原子提交。

Trade-offs

自动记账依赖进程内Map和当前MCP错误识别。创建失败不会阻止worker,关闭最后重试失败后仍清空记录;没有持久outbox或重启对账。UUID工作流文本不强制权限,Pi的permissionMode在所审spawner中不生效。

Where the evidence stops

官方发布稿、固定Chorus代码及起点前Pi源码支持事件映射和原生session-id语义;关闭状态只在内存,MCP业务错误和进程崩溃缺少持久对账。

09.09Paper HarnessRisk:把任务完成、风险识别与实际安全分开测量Problem只看任务成功率或单个攻击入口,会漏掉Agent在配置、插件和恢复等不同职责中一边完成任务、一边产生不安全状态的情况。TakeawayHarnessRisk让安全评测同时看见任务交付、攻击效果、可见持久污染和风险识别,并把同一协议扩到六类harness职责。它能诊断部署组合的薄弱处,但不能从排名反推出某个组件更安全或污染已在未来会话生效。 安全与隔离状态与恢复工具与协议 75
ProblemP1只看任务成功率或单个攻击入口,会漏掉Agent在配置、插件和恢复等不同职责中一边完成任务、一边产生不安全状态的情况。E1E2
└─diagnoseD1作者用六类harness职责组织128个三轮工作流,每例同时规定正常交付与攻击效果,并由适配器导出相同格式的工具和状态证据。E1E2
ProblemP2发现风险、写入污染和真正完成攻击是不同结果;把它们混成一个安全分数,会误判部署组合是否已阻断或修复问题。E2E3E5
└─measureD2作者分别判断任务效用、攻击成功、可见持久污染和显式风险识别,并为可执行结果和语义判断采用不同的独立校准材料。E2E3
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

本项目判断:适合将已有Agent评测扩为配置/扩展/运行/持久化/动作/恢复职责矩阵,并同时保留正常效果、攻击效果、污染状态及检测证据。可用于定位薄弱职责;不能直接据其排名选择生产harness,也不能将污染标签签发为长期攻击或恢复完成收据。

Trade-offs

各harness以实际配置比较,工具、提示与推理预算不同;只有有效输出和可解析judge结果进入分母,排除数量未完整列出。持久污染依赖导出状态,检测依赖显式表达,三seed和bootstrap都未覆盖全部依赖结构。

Where the evidence stops

128个构造工作流、14部署组合、三个sampling seeds和两类独立judge校准支持样本内诊断;有效分母选择、预算差异、状态可见性及三轮owner措辞限制因果和长期外推。

09.09Engineering LangChain:按委托关系选择上下文分叉或隔离Problem接续主管工作的子Agent只收到任务描述时,会丢失已有调查过程,重复收集信息或遗漏隐含约束。Takeaway委托职责决定消息上下文是否继承;把消息模式与状态、权限、完成协议分开,才不会把分叉误读为完整隔离。 工具与协议记忆与上下文状态与恢复 75
ProblemP1接续主管工作的子Agent只收到任务描述时,会丢失已有调查过程,重复收集信息或遗漏隐含约束。E1E2
├─mitigateD1为接续工作提供fork模式:从主管当前有效历史构造子消息上下文,再追加委托任务,保留已经形成的摘要。E3E4
└─mitigateD3分叉子Agent保留task工具外形,在声明式fork调用点拒绝再次委托;返回时压缩子轨迹并过滤状态。E5E6
ProblemP2审查或独立调查的子Agent若继承主管全部推理,可能被既有判断影响;上下文共享需要随委托职责选择。E1E2
├─mitigateD2保留isolated模式,让独立调查与审查从任务描述开始,并把模式选择落实到子Agent配置。E2E4
└─mitigateD3分叉子Agent保留task工具外形,在声明式fork调用点拒绝再次委托;返回时压缩子轨迹并过滤状态。E5E6
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可在服务端委托配置中显式区分接续工作与独立核查,把消息历史构造、允许的非消息状态和结果回传分别建模。采用时保留所审实现对摘要、尾部工具调用与旧结果的处理;权限、共享存储和并发合并仍由宿主系统负责,不能从mode名称推导安全隔离。

Trade-offs

分叉使子Agent接收更多历史,隔离则要求主管重新表达足够的任务条件。缓存收益没有量化;fork仍为实验特性,skills配置受限。声明式与compiled子图采用不同状态过滤,模式不能替代权限、进程或并发写隔离。

Where the evidence stops

官方博客与固定代码支持有效历史构造、过滤和回传路径;没有成本/偏差对照,compiled子图不自动获得声明式fork的递归标记。

09.09Paper Mem-Gallery:把多模态记忆的检索、使用与更新分开测量Problem已有记忆评测难以同时测到跨会话信息演化与必须依赖图像的回答,容易低估多模态记忆的实际困难。Takeaway图文长期记忆需要分别检查证据是否找到、是否被正确理解,以及旧信息是否被正确替换;这套基准让三类失败更容易区分。 记忆与上下文文件与工件观测与评测 75
ProblemP1已有记忆评测难以同时测到跨会话信息演化与必须依赖图像的回答,容易低估多模态记忆的实际困难。E3E4E5
└─measureD1构造带证据轮标注的多会话图文历史,以九类任务分别查询事实、视觉推理、知识更新、冲突和无法回答的情况。E4E5
ProblemP2只看最终答案分数,无法区分没有检索到证据、取回后视觉推理失败,以及偏好更新后仍使用旧记忆。E7E8E9
└─diagnoseD2统一主要模型与检索配置,分别记录证据检索、最终回答和资源开销,并改变检索数量、比较图像与描述输入。E6E7E8E9
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可把多模态记忆评估拆为历史证据、检索结果、最终回答和资源记录四层,并保留更新前后事实及对应图像,避免把所有错误归为召回不足。采用时承认本文是离线图文QA诊断,不把它替代工具任务成功率;比较结论要带caption条件、截断条件和预算口径。

Trade-offs

合成和整理的历史提高任务可控性,但不代表真实长期用户分布。文本基线含视觉caption,FullMemory又会截断,各系统总token不同;自动答案judge没有直接见原图,也未给独立人工校准和多次运行区间。

Where the evidence stops

正式论文的离线合成/整理图文QA、作者报告的系统比较与案例支持诊断价值;不支持同成本优势、单组件归因或真实Agent执行效果。

09.09Paper AIOpsOops:保留诊断关系,隔离不可信遥测文本Problem运维 Agent 把低权限用户能写入的遥测内容当成故障解释,可能在仍然执行合法修复任务时提出危险操作;只检测显眼的指令覆盖容易漏掉这种诱导。TakeawayAIOpsOops 表明保持合法任务并不能阻止遥测诱导;可控字段的稳定抽象提供了一种保留结构、减少模型接触攻击语义的防御。 安全与隔离文件与工件身份与权限 87.5
ProblemP1运维 Agent 把低权限用户能写入的遥测内容当成故障解释,可能在仍然执行合法修复任务时提出危险操作;只检测显眼的指令覆盖容易漏掉这种诱导。E1E2E4
├─diagnoseD1作者构造经应用遥测进入 Agent 的任务相关诱导,并用跨应用、模型和 Agent 的对照测量它如何改变修复建议。E2E3E4
└─mitigateD2作者先识别可控遥测字段,运行时只把这些字段替换成稳定的带类型标识,保留日志结构与重复值之间的关联。E5E6E7
ProblemP2防御若直接删除所有遥测,会同时破坏根因分析需要的结构和关联信息;需要在移除可控文本的同时保留可用的诊断上下文。E5E6E7
└─mitigateD2作者先识别可控遥测字段,运行时只把这些字段替换成稳定的带类型标识,保留日志结构与重复值之间的关联。E5E6E7
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可在运维 Agent 的工具返回与上下文装配之间加入字段抽象层:已知可控字段只暴露稳定类型标识,结构和错误码继续进入模型,原文留给授权的人类诊断。适用条件是业务任务不依赖该字段的自由文本语义,并且可控入口能够充分枚举;这不能替代写操作权限控制。

Trade-offs

字段抽象比整段删除保留更多诊断信息,但前提是可以发现和解析可控字段。设置阶段依赖应用副本、端点覆盖、模板维护和正则正确性;业务更新或其他输入渠道仍可能超出防护范围。

Where the evidence stops

结果来自隔离合成环境中的 180 次攻击,以及单 Agent/模型的 36 次正常任务对照;防御范围受模板覆盖、解析正确性和输入渠道限制。

09.09Paper AVA:用事件图扩展上下文,再回到原始证据Problem长视频问答只按当前问题检索相似帧,容易丢失事件前后经过和跨片段实体关系;把全部视频放进模型上下文又受窗口与成本限制。TakeawayAVA 把长视频组织为可扩展检索的事件关系,并在生成后回查视觉证据;主要代价在多路径查询,而不是初始向量检索。 记忆与上下文文件与工件观测与评测 82.5
ProblemP1长视频问答只按当前问题检索相似帧,容易丢失事件前后经过和跨片段实体关系;把全部视频放进模型上下文又受窗口与成本限制。E1
├─mitigateD1作者将视频持续整理为保留时间顺序、实体关系和原始帧链接的事件图,使检索能从相关片段继续找到相邻事件与关联证据。E2
└─mitigateD2作者从事件、实体和原始帧三路选择起点,再用受限动作树扩充上下文,并通过候选一致性和原始帧核查筛选答案。E3E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可迁移到具有时间序列证据的 Agent 上下文管线:把事件、实体和原始材料链接分开保存,查询时受限扩展相邻事件,回答前回到原始材料。它适合可容忍分钟级分析的离线或后台任务;若要求秒级交互,本文树搜索配置不能直接满足。

Trade-offs

事件图需要先支付描述、合并与实体抽取成本,描述遗漏仍可能传播到检索。多路径搜索增加回答机会,也引入显著延迟与噪声;作者的深度消融已经出现更深反而更差的情况。

Where the evidence stops

结论限定于论文的三个问答数据集及其模型配置;AVA-100 部分拼接,组件消融样本较小,图索引基线的片段归因说明存在不一致。

09.09Paper Pufibara:候选绑定的工程证据与独立评测契约ProblemAgent多轮修改后可能遗失工程义务,或把旧候选仿真结果误用作当前候选的支持证据。Takeaway将证据绑定到精确候选,并把Agent自判完成与外部验收分成两个判断。 状态与恢复观测与评测文件与工件 75
ProblemP1Agent多轮修改后可能遗失工程义务,或把旧候选仿真结果误用作当前候选的支持证据。E3E5
└─mitigateD1用持久义务账本和绑定候选身份的证据记录组织Agent修订上下文。E4E5E7
ProblemP2能编译/仿真及agent自判ready不能证明任务行为正确,最后编辑的工件也不等于有意提交的结果。E3E6E8E10
└─measureD2让Agent显式冻结提交精确候选,再由loop外预先冻结的合同独立验收。E6E8E10
ProblemP3原样公共模型可能测到记忆,任意合成任务又可能缺物理真实性与可靠判据。E9E15
└─validateD3从可执行参考模型派生新任务,并以正确样本和能运行但偏离目标的反例校验行为合同。E9E10E15
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

适用于反复修改并依据外部反馈交付工件的Agent。可迁移候选身份和证据失效规则、显式提交以及独立验收;物理命题、观测绑定和场景契约需领域化,不能将本文Modelica结果视为通用效果。

Trade-offs

候选相关内容、观测、场景和容差需要逐任务定义,修改后需重新收集相关证据;账本状态仍是agent解释。独立有限场景契约也可能错判,大部分实现和完整任务私有,限制外部审查。

Where the evidence stops

作者报告仅覆盖Modelica、两个后端和每条件单次的完整harness比较;Repair无单独行为gate,readiness非强制正确性门,私有工件限制完整核查。

09.09Engineering Harness Inspector:保留交付关系的证据强度Problem仅查看会话或提交,无法保留原始意图、探索过程与最终交付之间的多对多证据关系。Takeaway在产生可复用经验之前,先把事实关系与推测关系分开保存。 观测与评测文件与工件状态与恢复 75
ProblemP1仅查看会话或提交,无法保留原始意图、探索过程与最终交付之间的多对多证据关系。E2
└─diagnoseD1以独立采集和归一化建立Story(需求意图)—Session(执行会话)—Commit(代码提交)的只读证据投影。E2E3E6
ProblemP2路径、时间和动作频率容易被误读成贡献归属或可复用经验,证据强度需要显式保留。E5E7
├─diagnoseD2关系携带来源事实与限制,明确区分直接关系、同路径观测、候选及背景。E3E7
└─diagnoseD3按Turn查看和仅序列Replay,缺少时间/结果/成本时保留unknown。E4E8
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可在采集会话与Git事件后保留独立记录,再生成带关系类型、依据和缺失状态的只读投影,供交付审阅或后续记忆候选筛选使用。迁移重点是保存关联依据与未知状态;候选关系不能直接触发验收或技能激活,跨租户的访问控制仍需宿主系统提供。

Trade-offs

窗口限制和隐私归一化减少可呈现细节;缺少provider或Story锚点时证据链不完整,候选关系仍依赖人工解释。

Where the evidence stops

原文机制、当前官方文档与fictional示例支持结构理解;不支持关联准确率、生产诊断效用或技能提升结论。

09.09Paper AMemGym:让被测助手参与形成历史,识别离线记忆评测偏差Problem静态他人轨迹不包含被测助手自身对话选择的后果,记忆配置排序可能偏移。Takeaway对话选择会改变待测记忆本身,因此context评测必须把静态理解与在线互动分开。给状态oracle和分段probe能定位测量盲区,但这些是操作性诊断,不是证明系统已解决遗忘。 文件与工件记忆与上下文状态与恢复 87.5
ProblemP1静态他人轨迹不包含被测助手自身对话选择的后果,记忆配置排序可能偏移。E1E3
└─mitigateD1schema/state trajectory → fixed exposure utterance → on-policy free-form interaction → period evaluationE1E3
ProblemP2最终QA错不能区分状态写入/保留、后续读取和读到后的使用,模型应用能力会混入记忆分。E2
└─diagnoseD2overall/oracle normalized score plus write/read/utilization conditional probesE2
ProblemP3自由模拟会话可能没有传入真值或后续冲突,自动gold可能不可靠。E1E4
└─validateD3state exposure/state integrity/golden-choice meta-evaluation; user LLM change; 5-run native subsetE4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:把结构化用户状态轨迹、实际曝光事件、助手对话及period题分开存档;评测配置时明确区分复用历史与真实互动,并保留同模型oracle、状态probe与最终答题三个观察面。优先采用测量协议;AWE配置与自演化prompt不作为直接生产默认值。

Trade-offs

on-policy提高交互贴合度但每个候选需独立对话,无法共享全套静态轨迹成本。;固定state-bearing utterance确保信息输入,却使真实世界不完整/含糊曝光覆盖不足。;oracle-state normalization减少模型应用差异但不能完全因果分离记忆与推理;denominator依赖模型和题难。;Table3完整反馈和仅问题均.197,不能把write改进等同整体更优,且utilization反向。

Where the evidence stops

已阅读最终proceedings§3–5及附录C/D/E/F,视觉核查Figure3的条件诊断路径,复核Table2排序与Table3反例。来源身份/日期来自官方proceedings metadata及原始arXiv history。机制和数据有效性足以支持新eval方法;不支持等成本最好或配置排名普遍稳定的主张。

09.09Paper CIMemories:按接收者和目的衡量必要信息与累计披露Problem只保护一个秘密或只报低泄露率,无法发现同一记忆在不同接收者/目的下的细粒度不当披露,也奖励什么都不说。Takeawaycontext是否有用须与能否向该接收者披露分开测量;静态memory前缀也能形成有效的信息干预。最可迁移贡献是任务化属性规范与累计风险指标,不是模型安全排行榜或一条隐私prompt。 文件与工件记忆与上下文观测与评测 80
ProblemP1只保护一个秘密或只报低泄露率,无法发现同一记忆在不同接收者/目的下的细粒度不当披露,也奖励什么都不说。E1E2
└─measureD1profile memory statements × purpose/recipient contexts → necessary/inappropriate/ambiguous labels → violation+completenessE1E2
ProblemP2单次响应平均掩盖不同任务和不同运行分别泄露不同属性的累积风险;记忆增长改变可暴露信息集合。E1E3
└─measureD2Violation@n over task/draw union; fixed necessary attributes plus growing inappropriate setE1E3
ProblemP3自动隐私规范标签和披露检测器可能带偏,导致风险测量失真。E2E4
└─validateD330 model label draws per pair; unanimous labels; separate label/reveal human agreementE2E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

编辑判断:在context选择与对外输出评测中使用attribute×purpose×recipient矩阵,分别保留必要、禁止与不确定项;同时看输出覆盖与跨任务/多次响应的累计属性披露,避免把全删记忆当成功。该规范层可接企业已授权的数据政策;论文提供测量协议,不提供可直接强制执行的隐私授权网关。

Trade-offs

只评分三persona一致的属性-任务对,减少争议也遗漏灰区和个人差异。;形式REVEAL允许推断,实际Fig7只计完整显式value,不能把数字当全部信息泄漏。;Violation@5会随更多任务/抽样而非减地增长,这是累计风险测量,不是agent多session越来越失控。;Completeness是必要属性覆盖,消息实际成功/用户批准/工具副作用未测。;单轮non-tool、固定必要加额外属性长度增加;无真实长期记忆写入更新或输出网关防护实现。

Where the evidence stops

重新阅读最终ICLR proceedings§3–6、AppendixA/B/C与Figures4/5,确认新增人工校准与60profile扩展是最终版证据;arXiv v1不含这些,不能用v1替代。确认Violation@5及Completeness分母/聚合不同,Figure7检测范围窄于形式定义。论文满足context干预和新eval协议门槛,但不解决权限或真实多session泄漏。

09.09Paper A.I.G:在真实DeepSeek Harness上分开测量载体、输出与动作Problem把文件载体近似为纯文本会跳过解析与编码路径,无法判断不可信信息是否真正到达被测循环。Takeaway保留真实循环只是第一步;载体解析、内容曝光、输出变化、敏感调用及参数命中需要分别观察,双judge结论应并存。 文件与工件工具与协议安全与隔离 67.5
ProblemP1把文件载体近似为纯文本会跳过解析与编码路径,无法判断不可信信息是否真正到达被测循环。E1E2
├─measureD1真实DSH适配器、载体矩阵、source/sink插件和完整session traceE1E2E4E7
└─diagnoseD3追踪additionalContexts与pre-execute/deny-only guard位置E6E7
ProblemP2混合输出改写、敏感调用和参数成功的单一攻击率会掩盖风险层级与评分器分歧。E2E3
└─diagnoseD2按目标类型和Full/Partial/Failure分层,分别保存JR规则判定与JL语义判定E2E3E5
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把source provenance、载体解析结果、tool call身份和sink参数判据与judge原判定一并归档;看板分展示内容暴露、输出控制、敏感动作尝试,分母与渠道固定。DSH已有deny-only guard可供独立权限策略接入,但本文没有证明新增策略效果。

Trade-offs

真实循环保留模型工具选择,source与sink仍是受控fixture;不代表生产解析器和权限配置。;没有无攻击任务效用、防御消融、judge人工校准和多次同case置信区间;无法分离模型能力与harness因果贡献。;公开adapter未按call ID关联结果,未将进程错误分类;扩展到并发/异常时证据映射不足,但不据此推翻作者原表。

Where the evidence stops

主流程重新阅读v2 §2–8、Tables2–6、AppendixA/B,并核固定提交的README、driver、adapter、DSH tool guard与additionalContexts路径。确认naive是攻击基线、641 sink与Full/Partial重叠、模拟工具仅证明尝试;聚合数字为作者报告,guard接口存在不等于本文已测防护。

09.08Paper MEMENTO:把记忆召回与利用分开诊断Problem任务失败时,仅看最终成功率,无法判断问题是否出在获得记忆后的理解和使用环节。TakeawayMEMENTO用受控任务观察记忆已提供后的利用困难,并探索偏好事实与行动轨迹分开组织的设计。 记忆与上下文文件与工件状态与恢复 87.5
ProblemP1任务失败时,仅看最终成功率,无法判断问题是否出在获得记忆后的理解和使用环节。E1
└─diagnoseD1保持场景和目标相同,改变指令是否明说偏好,并保证所需记忆出现在检索结果中。E1
ProblemP2完整历史同时承载用户偏好和行动示例;直接压缩历史,可能在减少干扰的同时丢掉有用示范。E4
└─mitigateD2保留完整交互轨迹,同时用分层用户画像图单独组织偏好事实和行为顺序。E4
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

我们更倾向于借鉴两点:解释记忆系统表现时,区分是否获得所需信息与获得后能否使用;组织历史时,区分偏好事实与行动示例。这些启发适用于需要历史偏好的任务,不能据此把用户画像图当作所有记忆系统的默认方案。

Trade-offs

主实验采用理想化感知与动作;多记忆任务增加目标与协调负担。画像图还引入额外处理与上下文开销,现有结果不能单独证明等预算下的图结构收益。

Where the evidence stops

结论来自理想化感知与动作设置;任务差值不能直接当作单个记忆组件的因果贡献。

09.08Paper ACE:用稳定条目和局部更新抑制上下文坍缩Problem长任务中的上下文更新容易偏向简短总结,反复整体重写会使有价值的细节消失。Takeaway将上下文当作可局部修订的条目库,按任务复杂度决定是否引入反思与整理角色。 记忆与上下文身份与权限文件与工件 92.5
ProblemP1长任务中的上下文更新容易偏向简短总结,反复整体重写会使有价值的细节消失。E1
└─designD1将经验保存为稳定ID条目,用局部delta及确定性合并更新playbook。E2
ProblemP2局部经验也可能冗余或有害。E2
└─designD2用helpful/harmful计数、反思和去重管理条目。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将上下文当作可局部修订的条目库,按任务复杂度决定是否引入反思与整理角色。

Trade-offs

效果依赖Reflector质量;原文明说简短固定规则就能解决的任务未必需要长playbook。

Where the evidence stops

效果依赖Reflector质量;原文明说简短固定规则就能解决的任务未必需要长playbook。

09.08Paper JIT-Agent:按任务生成并准入四模块 harnessProblem固定harness难以匹配搜索、规划与工作区任务的不同控制和记忆需求。Takeaway把可变策略放入显式接口,在生成产物与共享执行内核之间保持边界。 文件与工件记忆与上下文工具与协议 87.5
ProblemP1固定harness难以匹配搜索、规划与工作区任务的不同控制和记忆需求。E1
└─designD1按任务生成四模块harness,经协议和执行检查后选择一个候选装入固定内核。E2
ProblemP2生成的harness可能不符合接口或不能运行。E2
└─designD2在选定前分别检查语法、协议和可执行性。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把可变策略放入显式接口,在生成产物与共享执行内核之间保持边界。

Trade-offs

生成器经过训练且测试时冻结;跨模型结果使用50或100题子集,接口合规与执行成功也不等于安全保证。

Where the evidence stops

生成器经过训练且测试时冻结;跨模型结果使用50或100题子集,接口合规与执行成功也不等于安全保证。

09.08Paper BEAM / LIGHT:连续叙事中的更新、冲突与顺序探针Problem现有长对话测评缺少连续叙事和多类记忆能力;BEAM用人物、关系与时间线构造对话及可追溯问题。Takeaway借鉴来源可定位的更新、冲突与顺序问题,并根据任务需要组合检索、近期缓冲和scratchpad。 记忆与上下文文件与工件身份与权限 82.5
ProblemP1现有长对话测评缺少连续叙事和多类记忆能力;BEAM用人物、关系与时间线构造对话及可追溯问题。E1
└─designD1构造连续人物与事件历史,用来源绑定的问题和原子评分测量长期记忆能力。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

借鉴来源可定位的更新、冲突与顺序问题,并根据任务需要组合检索、近期缓冲和scratchpad。

Trade-offs

数据是合成对话;10M场景的长上下文基线仅保留能装入窗口的近期历史,不能视为完整10M直接输入的同预算比较。

Where the evidence stops

数据是合成对话;10M场景的长上下文基线仅保留能装入窗口的近期历史,不能视为完整10M直接输入的同预算比较。

09.08Paper MemGAS:From Single to Multi-Granularity: Toward Long-Term Memory Association and Selection of Conversational AgentsProblem长期对话记忆包含会话、轮次、摘要与关键词,固定粒度难兼顾细节和检索噪声。Takeaway把粒度选择与关系传播分开理解,依据问题类型选择上下文,而非把更细粒度一律当作更好。 记忆与上下文文件与工件状态与恢复 82.5
ProblemP1长期对话记忆包含会话、轮次、摘要与关键词,固定粒度难兼顾细节和检索噪声。E1
└─designD1以逆熵软权重组合记忆粒度,在GMM关联图上经PPR扩展并过滤结果。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把粒度选择与关系传播分开理解,依据问题类型选择上下文,而非把更细粒度一律当作更好。

Trade-offs

部分大型基线因运行成本缺席LongMemEval-m;相同top-k不等于相同token成本,论文也未在所有指标上领先。

Where the evidence stops

部分大型基线因运行成本缺席LongMemEval-m;相同top-k不等于相同token成本,论文也未在所有指标上领先。

09.08Paper Cordis:A Programming Paradigm for Spatiotemporal ComposabilityProblem动态插件系统既要清理撤载副作用,也要在依赖提供者变化时调整消费者生命周期。Takeaway将能力声明、依赖有效性和撤载清理放在统一生命周期中,明确外部不可逆操作的边界。 工具与协议文件与工件状态与恢复 92.5
ProblemP1动态插件系统既要清理撤载副作用,也要在依赖提供者变化时调整消费者生命周期。E1
└─designD1把提供能力、依赖关系和清理函数纳入生命周期,撤载时先停供再等待依赖者退出。E2
ProblemP2目标在生命周期转换途中变化,会使清理和重建交错。E2
└─designD2先完成当前LOADING或UNLOADING转换,再响应新的目标状态。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将能力声明、依赖有效性和撤载清理放在统一生命周期中,明确外部不可逆操作的边界。

Trade-offs

形式保证限于受context管理且可逆的边界;Koishi案例是单生态观察证据,不提供架构间定量因果对照;不可信代码仍需外部沙箱。

Where the evidence stops

形式保证限于受context管理且可逆的边界;Koishi案例是单生态观察证据,不提供架构间定量因果对照;不可信代码仍需外部沙箱。

09.08Paper How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following BehaviorProblemAgent把自身执行轨迹加入记忆,后续任务又会模仿相似经验,错误和不适用策略因此可能持续传播。Takeaway记忆价值应结合后续使用效果理解,并将记录的正确性与可迁移性分开判断。 记忆与上下文状态与恢复文件与工件 92.5
ProblemP1Agent把自身执行轨迹加入记忆,后续任务又会模仿相似经验,错误和不适用策略因此可能持续传播。E1
└─designD1按检索次数与后续任务效用管理记忆保留和删除,比较不同管理策略。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

记忆价值应结合后续使用效果理解,并将记录的正确性与可迁移性分开判断。

Trade-offs

研究主要覆盖添加与删除,没有覆盖合并、摘要和结构重写;作者明确将发现限定为经验研究而非形式保证。

Where the evidence stops

研究主要覆盖添加与删除,没有覆盖合并、摘要和结构重写;作者明确将发现限定为经验研究而非形式保证。

09.08Engineering Faster, cheaper support investigations with precomputed contextProblem支持调查反复跨工单、对话和工程资料收集同一组证据,索引路由优化仍未消除重复综合成本。Takeaway按稳定案例标识预计算带来源和假设状态的证据包,并保留当前状态的权威查询入口。 记忆与上下文文件与工件身份与权限 92.5
ProblemP1支持调查反复跨工单、对话和工程资料收集同一组证据,索引路由优化仍未消除重复综合成本。E1
└─designD1预计算带来源和证据水位的case知识,将路由profile与案例事实分离。E2
ProblemP2缓存事实可能落后于实时系统。E2
└─designD2显式保存证据水位和假设状态,查询实时状态时以权威系统为准。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按稳定案例标识预计算带来源和假设状态的证据包,并保留当前状态的权威查询入口。

Trade-offs

这是小样本方向性结果;“未观察到显著下降”不等于证明事实性等价,58%输入token下降仅对应其中的案例调查流程。

Where the evidence stops

这是小样本方向性结果;“未观察到显著下降”不等于证明事实性等价,58%输入token下降仅对应其中的案例调查流程。

09.08Paper When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue AgentsProblem良性个人历史可能改变对危险请求的意图判断,个性化记忆本身也会带来安全偏移。Takeaway把个人背景作为解释线索而非行为授权,阅读安全结论时同时看正常任务效用。 安全与隔离记忆与上下文身份与权限 87.5
ProblemP1良性个人历史可能改变对危险请求的意图判断,个性化记忆本身也会带来安全偏移。E1
└─designD1固定风险问题比较无记忆和良性个人历史,另分析detect-and-reflect防护的效用代价。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把个人背景作为解释线索而非行为授权,阅读安全结论时同时看正常任务效用。

Trade-offs

研究是文本、孤立单轮安全问题,不含工具执行;抑制风险与维持个性化之间的取舍因框架而异。

Where the evidence stops

研究是文本、孤立单轮安全问题,不含工具执行;抑制风险与维持个性化之间的取舍因框架而异。

09.08Paper Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent InteractionProblem用户有时要求沿用历史,有时要求跳出旧思路;相关记忆被召回后仍可能造成过度依赖。Takeaway将用户要求的记忆依赖程度与检索相关性分别表达,避免把“想换个思路”误解成缺少更多历史。 记忆与上下文文件与工件状态与恢复 87.5
ProblemP1用户有时要求沿用历史,有时要求跳出旧思路;相关记忆被召回后仍可能造成过度依赖。E1
└─designD1以MD-Score度量目标记忆依赖,结合偏好SFT与GRPO训练可控依赖行为。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将用户要求的记忆依赖程度与检索相关性分别表达,避免把“想换个思路”误解成缺少更多历史。

Trade-offs

数据仅覆盖Research和Tutoring,离散等级不能表达所有真实偏好;与masking的比较包含不同训练与推理成本。

Where the evidence stops

数据仅覆盖Research和Tutoring,离散等级不能表达所有真实偏好;与masking的比较包含不同训练与推理成本。

09.05Engineering Shopify:让修复完成跟随当前事实,而不是跟随 Agent 的上一份计划Problem漏洞补丁在等待评审时可能失鲜,PR通过CI也不代表默认分支中的漏洞已经消失。Takeaway将完成条件绑定到当前源码与业务记录,并让交接保留证据、责任主体和未决问题。 安全与隔离观测与评测文件与工件 92.5
ProblemP1漏洞补丁在等待评审时可能失鲜,PR通过CI也不代表默认分支中的漏洞已经消失。E1
└─designD1将claim账本与当前仓库SHA、PR和默认分支结果持续对账后判断关闭。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将完成条件绑定到当前源码与业务记录,并让交接保留证据、责任主体和未决问题。

Trade-offs

70%积压下降是11天生产观察且包含已过时/别处已修复项;并非70%都由新补丁修好,也不是控制实验的效果归因。

Where the evidence stops

70%积压下降是11天生产观察且包含已过时/别处已修复项;并非70%都由新补丁修好,也不是控制实验的效果归因。

09.05Engineering MetaMask:把 Agent 权限编译成资源端可撤销、不可放大的委托链Problem自治客户端需要在用户授予的范围内支出,而全权私钥或逐笔人审都无法同时满足其目标。Takeaway将授权边界落在被调用资源能执行的规则上,同时区分无匹配授权与明确被拒绝两种后续行为。 身份与权限工具与协议安全与隔离 87.5
ProblemP1自治客户端需要在用户授予的范围内支出,而全权私钥或逐笔人审都无法同时满足其目标。E1
└─designD1由资源侧验证链上委托caveat,子委托只能收窄并检查到期与撤销。E2
ProblemP2委托继续转交可能扩大原先权限。E2
└─designD2完整验证委托链,要求子委托范围不大于上游并支持到期或撤销。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将授权边界落在被调用资源能执行的规则上,同时区分无匹配授权与明确被拒绝两种后续行为。

Trade-offs

案例由供应商与集成方报告;交易额属于launchpad业务结果,并不证明委托机制的安全收益。

Where the evidence stops

案例由供应商与集成方报告;交易额属于launchpad业务结果,并不证明委托机制的安全收益。

09.05Engineering Datadog:Agent 安全必须从组件清单升级为全会话序列检测Problem只看最终API或模型输入输出,会漏掉预处理命令、工具数据和跨步骤攻击路径。Takeaway围绕同一会话保留从输入到副作用的证据链,并把可疑路径与已发生后果分开呈现。 工具与协议记忆与上下文安全与隔离 80
ProblemP1只看最终API或模型输入输出,会漏掉预处理命令、工具数据和跨步骤攻击路径。E1
└─designD1把输入、动态上下文、工具及出站行为关联成完整trace,再做序列检测与身份归因。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

围绕同一会话保留从输入到副作用的证据链,并把可疑路径与已发生后果分开呈现。

Trade-offs

异常成本、token增长或可疑序列不能单独当作安全事件;工具侧与接收服务侧仍分别承担执行约束。

Where the evidence stops

异常成本、token增长或可疑序列不能单独当作安全事件;工具侧与接收服务侧仍分别承担执行约束。

09.05Engineering Datadog:为 Agent 提供机器可判定的服务目录与完整 dispatch contractProblem面向人的Golden Path缺少Agent可机器读取的能力契约与确定性流程边界。Takeaway用可读契约描述能力,用目录确定权威元数据,让派发显式绑定任务、权限、环境与结果。 状态与恢复身份与权限工具与协议 85
ProblemP1面向人的Golden Path缺少Agent可机器读取的能力契约与确定性流程边界。E1
└─designD1用类型化能力合同和权威目录连接工具发现、显式派发及同任务身份的恢复。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

用可读契约描述能力,用目录确定权威元数据,让派发显式绑定任务、权限、环境与结果。

Trade-offs

文章主要提供设计建议和内部案例,不能将每一项推荐都理解成已经交付的通用平台保证。

Where the evidence stops

文章主要提供设计建议和内部案例,不能将每一项推荐都理解成已经交付的通用平台保证。

09.05Engineering NVIDIA:让长期记忆提供证据与优先级,但不能自行变成权限Problem企业记忆需要连接不断变化的人物、项目与义务,单纯保留对话或检索片段难以维持一致判断。Takeaway分开存储来源证据、派生知识和判断记录,让用户纠正可追踪;记忆内容不直接充当权限。 记忆与上下文身份与权限安全与隔离 92.5
ProblemP1企业记忆需要连接不断变化的人物、项目与义务,单纯保留对话或检索片段难以维持一致判断。E1
└─designD1以Markdown self model组织用户事实,以SQLite义务账本和intent gate约束后续判断。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

分开存储来源证据、派生知识和判断记录,让用户纠正可追踪;记忆内容不直接充当权限。

Trade-offs

公开recipe不发送消息或修改源系统;变更事实一项只有5题,100%结果不能被外推为普遍可靠。

Where the evidence stops

公开recipe不发送消息或修改源系统;变更事实一项只有5题,100%结果不能被外推为普遍可靠。

09.04Engineering Oracle:把模型读取与人工审批拆成不同的 MCP 调用域Problem供应链推荐需要跨不同Agent宿主呈现,同时让人工审批只授权眼前的确定调拨。Takeaway将读取、展示、审批和提交分别设边界,在提交时核对实时库存。 工具与协议文件与工件身份与权限 92.5
ProblemP1供应链推荐需要跨不同Agent宿主呈现,同时让人工审批只授权眼前的确定调拨。E1
└─designD1用仅widget可见的approvalId绑定actor与不可变推荐,由app-only工具提交数据库事务。E2
ProblemP2用户批准后库存可能已经变化。E2
└─designD2数据库加锁重算可行性,再在同一事务中写入转移和审计。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将读取、展示、审批和提交分别设边界,在提交时核对实时库存。

Trade-offs

这是参考实现;iframe隔离依赖宿主执行,不能替代服务器鉴权和数据库事务。

Where the evidence stops

这是参考实现;iframe隔离依赖宿主执行,不能替代服务器鉴权和数据库事务。

09.04Engineering Temporal / Manetu:先区分恢复语义,再滚转长寿命 AgentProblem长寿命Agent的恢复、状态与执行身份需要跨进程保留,而人工继续和崩溃恢复携带的输入不同。Takeaway把业务会话身份与工作进程解耦,明确每类恢复是否应携带新输入。 状态与恢复工具与协议文件与工件 92.5
ProblemP1长寿命Agent的恢复、状态与执行身份需要跨进程保留,而人工继续和崩溃恢复携带的输入不同。E1
└─designD1把Thread、Run和Checkpoint分别映射到Workflow、Activity与Update,区分人工输入和崩溃恢复。E2
ProblemP2历史滚转时外部进程可能仍在执行。E2
└─designD2Continue-as-New前处理未完成Activity并等待对应进程退出。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把业务会话身份与工作进程解耦,明确每类恢复是否应携带新输入。

Trade-offs

该方案依赖特定运行时拦截及框架映射;透明恢复不自动证明任意外部副作用具备精确一次语义。

Where the evidence stops

该方案依赖特定运行时拦截及框架映射;透明恢复不自动证明任意外部副作用具备精确一次语义。

09.04Engineering Cloudflare:让 Agent 决定图表,让已抓数据决定数值Problem多轮网络调查既需要保留查询上下文,也需要让图表数值能追溯到真实API结果。Takeaway让模型选择呈现方式,由已取得的结构化数据填充数值,并保留会话恢复状态。 工具与协议文件与工件身份与权限 75
ProblemP1多轮网络调查既需要保留查询上下文,也需要让图表数值能追溯到真实API结果。E1
└─designD1每会话用Durable Object及SQLite保留状态,Code Mode按需查API,图表引用已获取数据。E2
ProblemP2模型重写数值会使图表偏离实际返回结果。E2
└─designD2图表规格通过dataFrom引用相同API路径已有的数据。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让模型选择呈现方式,由已取得的结构化数据填充数值,并保留会话恢复状态。

Trade-offs

数据绑定减少数值重造,不保证模型选对查询范围、指标或图表;产品仍为beta。

Where the evidence stops

数据绑定减少数值重造,不保证模型选对查询范围、指标或图表;产品仍为beta。

09.03Engineering Your agent's guardrails have a bypassProblem不同Agent框架的治理接口无法保证在相同执行位置做出相同处理。Takeaway将拦截点和决策责任显式化,同时在运行环境处理宿主可绕过的风险。 工具与协议状态与恢复记忆与上下文 92.5
ProblemP1不同Agent框架的治理接口无法保证在相同执行位置做出相同处理。E1
└─designD1定义allow、deny、transform协议及宿主执行义务,并对错误采用失败关闭。E2
ProblemP2旧批准可能被用到已经变化的调用上。E2
└─designD2将审批绑定调用上下文指纹,由宿主核对后执行。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将拦截点和决策责任显式化,同时在运行环境处理宿主可绕过的风险。

Trade-offs

契约以可信宿主合作执行为前提,不是对恶意宿主的安全边界;流式处理还存在缓冲与暴露量取舍。

Where the evidence stops

契约以可信宿主合作执行为前提,不是对恶意宿主的安全边界;流式处理还存在缓冲与暴露量取舍。

09.03Engineering Stop restricting the agent. Start restricting its environment.Problem执行型运维Agent可能利用环境能力绕过自身prompt中的操作限制。Takeaway把可信控制和不可信工作负载分开,按实际操作与目标限制能力。 身份与权限工具与协议记忆与上下文 92.5
ProblemP1执行型运维Agent可能利用环境能力绕过自身prompt中的操作限制。E1
└─designD1以单Agent隔离环境及调用代理隔开代码和原始凭据,生产写操作经过人工审查。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把可信控制和不可信工作负载分开,按实际操作与目标限制能力。

Trade-offs

原文承认替代执行路径和MCP契约扩大仍可能绕过限制;不能将规划能力写成已交付保证。

Where the evidence stops

原文承认替代执行路径和MCP契约扩大仍可能绕过限制;不能将规划能力写成已交付保证。

09.03Engineering Who spent all the tokens? Real-time, run-scoped cost control for AI agentsProblem一次Agent任务跨进程、模型和子任务,按独立请求或进程计费会丢失统一预算。Takeaway围绕任务身份归集调用成本,将花费控制与结果价值判断分开。 身份与权限工具与协议记忆与上下文 92.5
ProblemP1一次Agent任务跨进程、模型和子任务,按独立请求或进程计费会丢失统一预算。E1
└─designD1以共享run账本累计消耗,在预算节点发出STEER或HALT并区分本地与严格共享计数。E2
ProblemP2分布式消耗计数可能滞后。E2
└─designD2区分默认本地最终一致计数与增加往返的严格共享读取。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

围绕任务身份归集调用成本,将花费控制与结果价值判断分开。

Trade-offs

成本限制不能判定答案是否正确;价值分配层尚未建成,不能将局部案例当作普遍收益。

Where the evidence stops

成本限制不能判定答案是否正确;价值分配层尚未建成,不能将局部案例当作普遍收益。

09.03Engineering How we make AI coding more cost efficient without sacrificing task qualityProblem逐条压短工具输出可能引发重新读取,反而增加整个编程任务的成本。Takeaway按完整任务判断效率,优先去除重复传输与空转,保留所需信息。 记忆与上下文工具与协议身份与权限 100
ProblemP1逐条压短工具输出可能引发重新读取,反而增加整个编程任务的成本。E1
└─designD1保留源码、压缩可恢复的噪声、去除无用行号,并在后台任务完成时直接返回结果。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按完整任务判断效率,优先去除重复传输与空转,保留所需信息。

Trade-offs

RTK负面结果限定于测试集成;未检出质量下降不是证明所有任务等效,CLI与review收益也不同。

Where the evidence stops

RTK负面结果限定于测试集成;未检出质量下降不是证明所有任务等效,CLI与review收益也不同。

09.03Engineering Running a Software Factory Efficiently at Uber ScaleProblem大规模Agent使用增长使总账难解释,单价、上下文和调用轮数共同决定每个业务结果的成本。Takeaway以完成任务的成本和质量拆解优化,将工具目录与中间轮询移出持续模型上下文。 工具与协议身份与权限状态与恢复 92.5
ProblemP1大规模Agent使用增长使总账难解释,单价、上下文和调用轮数共同决定每个业务结果的成本。E1
└─designD1把工具接入统一网关,以动态发现和Code Mode脚本压缩往返及轮询开销。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

以完成任务的成本和质量拆解优化,将工具目录与中间轮询移出持续模型上下文。

Trade-offs

默认模型、400k压缩和缓存TTL反映Uber工作负载;文中明确说明成本收益不可直接外推。

Where the evidence stops

默认模型、400k压缩和缓存TTL反映Uber工作负载;文中明确说明成本收益不可直接外推。

09.03Engineering An Organizational Second Brain: Building an AI That Learns From ExpertsProblem企业专家知识隐含在材料和判断过程中,每次检索再推导既慢又不一致,纠正也难持久化。Takeaway把事实立场和推理步骤分开维护,将专家纠正定位到具体文件与依赖。 记忆与上下文文件与工件身份与权限 92.5
ProblemP1企业专家知识隐含在材料和判断过程中,每次检索再推导既慢又不一致,纠正也难持久化。E1
└─designD1分离领域知识与recipe,用实际材料和专家反馈归因,再以最小编辑修订知识。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把事实立场和推理步骤分开维护,将专家纠正定位到具体文件与依赖。

Trade-offs

单合规领域六周实践与专家主观反馈支持可行性,不证明跨领域同等收益;知识正确与流程正确必须分别判断。

Where the evidence stops

单合规领域六周实践与专家主观反馈支持可行性,不证明跨领域同等收益;知识正确与流程正确必须分别判断。

09.03Engineering Automate planned lifecycle upgrades with AWS DevOps Agent and KiroProblem计划内集群升级涉及发现、版本调查、代码修改和失败恢复,模型输出不足以直接触发部署。Takeaway在确定性流水线核对模型产物,将可自动判定的约束和需要人工判断的条件明确区分。 文件与工件工具与协议状态与恢复 92.5
ProblemP1计划内集群升级涉及发现、版本调查、代码修改和失败恢复,模型输出不足以直接触发部署。E1
└─designD1先澄清升级spec,限制修改文件范围,以人工PR审查和有界恢复推进升级。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

在确定性流水线核对模型产物,将可自动判定的约束和需要人工判断的条件明确区分。

Trade-offs

文中的skill隔离依赖模型遵守指令;CloudFormation回滚不等于控制面版本已回退,部分可回滚条件没有自动检查。

Where the evidence stops

文中的skill隔离依赖模型遵守指令;CloudFormation回滚不等于控制面版本已回退,部分可回滚条件没有自动检查。

09.03Engineering A guide to the anatomy of effective commerce agentsProblem商业会话跨购物意图但共享用户和交易状态,分散委派容易丢失上下文,直接执行写操作又可能越权。Takeaway让模型组织交互、既有业务系统执行业务规则,对最终状态和批准对象实施约束。 文件与工件状态与恢复工具与协议 92.5
ProblemP1商业会话跨购物意图但共享用户和交易状态,分散委派容易丢失上下文,直接执行写操作又可能越权。E1
└─designD1由单Agent按需加载skill,服务端生成稳定UI对象ID,先暂存变更再在apply时重验。E2
ProblemP2暂存的订单变更在提交时可能违反最新约束。E2
└─designD2apply时重新读取并校验最终状态后提交。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让模型组织交互、既有业务系统执行业务规则,对最终状态和批准对象实施约束。

Trade-offs

不是排斥所有子Agent;自包含研究或独立合规会话仍适用,eager streaming会放弃服务端schema保证。

Where the evidence stops

不是排斥所有子Agent;自包含研究或独立合规会话仍适用,eager streaming会放弃服务端schema保证。

09.02Engineering What We Learned Putting A2A Into ProductionProblem独立部署的Agent需要跨边界传递任务、用户语义和答案来源,只有返回文本会丢失判断条件。Takeaway跨Agent交接同时传递身份、来源新鲜度和可见失败,并区分协议能力与私有扩展。 身份与权限工具与协议状态与恢复 92.5
ProblemP1独立部署的Agent需要跨边界传递任务、用户语义和答案来源,只有返回文本会丢失判断条件。E1
└─designD1基于Agent Card路由并携带双方约定的私有DataContext,将错误和session世代显式传递。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

跨Agent交接同时传递身份、来源新鲜度和可见失败,并区分协议能力与私有扩展。

Trade-offs

来源envelope格式错误时被静默丢弃,兼容优先并不保证每次回答都有来源;协议仍缺跨端会话滚转等能力。

Where the evidence stops

来源envelope格式错误时被静默丢弃,兼容优先并不保证每次回答都有来源;协议仍缺跨端会话滚转等能力。

09.02Engineering How we eliminated $1 million a year of wasted AI agent spend in one hourProblem工具参数含糊或返回原始异常,Agent反复猜测后仍可能完成任务,使额外花费隐藏在成功率中。Takeaway将可恢复参数错误和真正失败分开,让工具契约与错误信息支持下一步判断。 工具与协议状态与恢复身份与权限 72.5
ProblemP1工具参数含糊或返回原始异常,Agent反复猜测后仍可能完成任务,使额外花费隐藏在成功率中。E1
└─designD1从会话trace定位七类工具缺陷,区分参数、返回体和等待过程造成的成本。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将可恢复参数错误和真正失败分开,让工具契约与错误信息支持下一步判断。

Trade-offs

年度数值由观察窗口外推,等待不等于全部可回收的人力;输入归一化也不能放松业务授权。

Where the evidence stops

年度数值由观察窗口外推,等待不等于全部可回收的人力;输入归一化也不能放松业务授权。

09.02Engineering Building an Adaptive Agentic Cybersecurity System with NVIDIA NemotronProblem生成检测规则既要命中观察到的攻击,也要避免只记住环境标识而不能迁移。Takeaway将语法有效、命中已见攻击、行为泛化和良性噪声作为不同证据层。 观测与评测记忆与上下文安全与隔离 92.5
ProblemP1生成检测规则既要命中观察到的攻击,也要避免只记住环境标识而不能迁移。E1
└─designD1在专用模型之外加入schema grounding、lint、回测和独立评审等执行约束。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将语法有效、命中已见攻击、行为泛化和良性噪声作为不同证据层。

Trade-offs

只含一个场景族、八次新攻击及有限良性流量;三次harness失败保留了完整遥测,不代表生产误报率已获证明。

Where the evidence stops

只含一个场景族、八次新攻击及有限良性流量;三次harness失败保留了完整遥测,不代表生产误报率已获证明。

09.01Engineering Closing the AI agent trust gap with graduated autonomyProblem固定授予权限无法反映Agent行为和版本变化,平均分还可能掩盖安全退化。Takeaway把行为评分用于权限调整,关键限制仍由资源调用路径执行。 工具与协议身份与权限安全与隔离 80
ProblemP1固定授予权限无法反映Agent行为和版本变化,平均分还可能掩盖安全退化。E1
└─designD1以独立安全下限和慢升快降的信任等级控制能力,调用前由进程外Cedar策略裁决。E2
ProblemP2链式委派可能把低信任任务提升到更高能力。E2
└─designD2以委派链中的最低信任等级计算有效权限。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把行为评分用于权限调整,关键限制仍由资源调用路径执行。

Trade-offs

权重和分级是文章提供的起始模板,未给出生产效果对照;记录动作前状态不意味着所有外部副作用都可回滚。

Where the evidence stops

权重和分级是文章提供的起始模板,未给出生产效果对照;记录动作前状态不意味着所有外部副作用都可回滚。

09.01Engineering Building Self-Correcting Memory in OpenWikiProblem代码演进后,Wiki仍可能沿用曾经正确的事实,单纯补充新知识无法识别旧结论失效。Takeaway把事实与版本化来源相连,让未知或过时状态持续可见直到原文重新核对。 记忆与上下文状态与恢复文件与工件 92.5
ProblemP1代码演进后,Wiki仍可能沿用曾经正确的事实,单纯补充新知识无法识别旧结论失效。E1
└─designD1把知识claim绑定来源版本,确定性扫描陈旧状态并在逐项核对后更新验证标记。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把事实与版本化来源相连,让未知或过时状态持续可见直到原文重新核对。

Trade-offs

source变化只表示需要重新判断,不等于结论错误;未被访问的stale项可持续保留,系统不保证每轮全部修正。

Where the evidence stops

source变化只表示需要重新判断,不等于结论错误;未被访问的stale项可持续保留,系统不保证每轮全部修正。

08.31Engineering Introducing Dogwood: runtime verification for AI agentsProblem单次授权无法表达先审批后操作、累计额度和时间窗口内的行动约束。Takeaway将时序前提与当前请求共同判断,明确计量的是请求、完成结果还是独立对象。 运行时与调度身份与权限状态与恢复 95
ProblemP1单次授权无法表达先审批后操作、累计额度和时间窗口内的行动约束。E1
└─designD1在Cedar权限规则中加入过去时态条件,让策略同时考虑窗口内和当前请求。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将时序前提与当前请求共同判断,明确计量的是请求、完成结果还是独立对象。

Trade-offs

状态和事件历史增加求值成本;时态条件尚不支持Cedar已有自动推理工具,示例的存在审批也不自动表达审批一次性消费。

Where the evidence stops

状态和事件历史增加求值成本;时态条件尚不支持Cedar已有自动推理工具,示例的存在审批也不自动表达审批一次性消费。

08.31Engineering Temporal Agent Harness: An early look at durable agent infrastructureProblem业务Agent的会话跨工具、人工等待和进程故障,内层模型循环缺少统一持久控制。Takeaway分离内层推理循环与外层业务生命周期,让控制和状态具备独立接口。 状态与恢复工具与协议身份与权限 72.5
ProblemP1业务Agent的会话跨工具、人工等待和进程故障,内层模型循环缺少统一持久控制。E1
└─designD1外层Workflow承载持久状态和审批,内层Agent SDK执行推理,通过统一事件接口连接。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

分离内层推理循环与外层业务生命周期,让控制和状态具备独立接口。

Trade-offs

作者明确阶段早于public preview,API仍会变化;持久恢复不能替代外部副作用自身的幂等与权限设计。

Where the evidence stops

作者明确阶段早于public preview,API仍会变化;持久恢复不能替代外部副作用自身的幂等与权限设计。

08.31Engineering Scaling patterns for self-organizing multi-agent clusters with KiroProblem分布式Agent讨论既要交换进展,也要避免全可见导致过早共识与上下文膨胀。Takeaway按探索与收敛阶段调节可见范围,并把旧任务状态与新运行明确隔离。 文件与工件状态与恢复记忆与上下文 87.5
ProblemP1分布式Agent讨论既要交换进展,也要避免全可见导致过早共识与上下文膨胀。E1
└─designD1各Agent维护追加日志并只观察有限邻居,以每轮新会话和共享工件协调工作。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按探索与收敛阶段调节可见范围,并把旧任务状态与新运行明确隔离。

Trade-offs

局部每轮读取有界不等于整体通信或达成共识成本不增长;共享产物的一致性不能由日志CRDT性质自动推出。

Where the evidence stops

局部每轮读取有界不等于整体通信或达成共识成本不增长;共享产物的一致性不能由日志CRDT性质自动推出。

08.31Engineering Staying Ahead of Adversarial AI Through Agentic Source Code ReviewProblem源码漏洞判断需要可达性和业务威胁模型,孤立模式匹配容易产生无效发现。Takeaway把发现、反证和威胁模型适用性分开,保留从入口到危险操作的路径。 文件与工件安全与隔离记忆与上下文 80
ProblemP1源码漏洞判断需要可达性和业务威胁模型,孤立模式匹配容易产生无效发现。E1
└─designD1人审威胁模型后拆分入口分析,独立核验漏洞假设并匹配精确漏洞条件。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把发现、反证和威胁模型适用性分开,保留从入口到危险操作的路径。

Trade-offs

多模型高温判断不等于独立客观证据;正文未披露足够定量数据证明泛化检出率,仍依赖专家复核。

Where the evidence stops

多模型高温判断不等于独立客观证据;正文未披露足够定量数据证明泛化检出率,仍依赖专家复核。

08.31Engineering Route AI Agent Workloads Across Models with NVIDIA NeMo SwitchyardProblem不同模型在任务阶段与成本上各有优势,固定选最强模型不一定得到最佳结果成本。Takeaway将路由策略和供应商调用分开,按任务完成质量解释成本取舍。 状态与恢复工具与协议记忆与上下文 87.5
ProblemP1不同模型在任务阶段与成本上各有优势,固定选最强模型不一定得到最佳结果成本。E1
└─designD1用语义model target与会话亲和选择模型,遇到指定错误信号再升级。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将路由策略和供应商调用分开,按任务完成质量解释成本取舍。

Trade-offs

收益限定各伙伴任务集和组合;prefill路由需要模型内部状态与训练,不是所有API模型都可直接使用。

Where the evidence stops

收益限定各伙伴任务集和组合;prefill路由需要模型内部状态与训练,不是所有API模型都可直接使用。

08.06Engineering How we build an autonomous SRE Agent for Kubernetes DeploymentsProblem周期健康检查不需要每次启动完整多Agent调查,而写操作需要明确可审阅范围。Takeaway让固定监测走直接采集,复杂诊断再进入Agent;批准项尽量小且可理解。 工具与协议文件与工件身份与权限 92.5
ProblemP1周期健康检查不需要每次启动完整多Agent调查,而写操作需要明确可审阅范围。E1
└─designD1用Python采集加单次模型判断完成健康检查,写能力集中在受RBAC和人审约束的executor。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让固定监测走直接采集,复杂诊断再进入Agent;批准项尽量小且可理解。

Trade-offs

初版定时collector漏采利用率导致结构性答不出问题;简化循环是否足够取决于实际输入覆盖。

Where the evidence stops

初版定时collector漏采利用率导致结构性答不出问题;简化循环是否足够取决于实际输入覆盖。

08.05Engineering TOLAP: Closing the data-object security gap in AI agent architecturesProblem工具获准访问某数据源后,仍可能返回调用者无权读取的行或字段。Takeaway在数据离开权威源之前执行对象级授权,避免靠模型过滤已拿到的敏感内容。 工具与协议文件与工件记忆与上下文 72.5
ProblemP1工具获准访问某数据源后,仍可能返回调用者无权读取的行或字段。E1
└─designD1把规则按最严格语义合并并签名,由资源工具wrapper核对时效、上下文与请求。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

在数据离开权威源之前执行对象级授权,避免靠模型过滤已拿到的敏感内容。

Trade-offs

签名证明完整性而非策略本身正确,过期时间也不自动阻止有效期内重复使用;跨源覆盖依赖各wrapper实现。

Where the evidence stops

签名证明完整性而非策略本身正确,过期时间也不自动阻止有效期内重复使用;跨源覆盖依赖各wrapper实现。

08.05Engineering Do more with less: How GKE can reduce your cost per agent by 75%Problem大量间歇工作Agent长期占用独立运行环境,空闲资源使每Agent成本偏高。Takeaway按延迟要求组合预热、挂起和排队,将密度收益与同时唤醒风险一起考虑。 状态与恢复安全与隔离文件与工件 77.5
ProblemP1大量间歇工作Agent长期占用独立运行环境,空闲资源使每Agent成本偏高。E1
└─designD1组合gVisor隔离、预热与快照释放闲置资源,提高特定间歇负载的单节点密度。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按延迟要求组合预热、挂起和排队,将密度收益与同时唤醒风险一起考虑。

Trade-offs

75%是带间歇活动和可接受启动等待的上限案例;与microVM相比的密度证据不能证明隔离机制等价。

Where the evidence stops

75%是带间歇活动和可接受启动等待的上限案例;与microVM相比的密度证据不能证明隔离机制等价。

08.05Engineering Your agent needs a computer, not a container — introducing @cloudflare/computerProblem每个Agent长期占用容器开销较高,但任务又需要共享文件和不同执行能力。Takeaway以持久工作区为中心,按工作需要附加轻重不同的执行环境。 文件与工件工具与协议状态与恢复 67.5
ProblemP1每个Agent长期占用容器开销较高,但任务又需要共享文件和不同执行能力。E1
└─designD1以SQLite文件系统衔接isolate与容器FUSE,用统一exec入口调度不同执行环境。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

以持久工作区为中心,按工作需要附加轻重不同的执行环境。

Trade-offs

早期preview,容器少于10%工作是目标而非已达到的普遍结果;共享接口不等于各后端能力一致。

Where the evidence stops

早期preview,容器少于10%工作是目标而非已达到的普遍结果;共享接口不等于各后端能力一致。

08.05Engineering Automating cross-repo documentation with GitHub Agentic WorkflowsProblem产品和文档分属仓库,文档往往滞后,而直接给Agent跨仓写权限扩大风险。Takeaway把生成内容与持权发布分开,让源变更和领域评审人跟随文档草稿。 文件与工件状态与恢复身份与权限 92.5
ProblemP1产品和文档分属仓库,文档往往滞后,而直接给Agent跨仓写权限扩大风险。E1
└─designD1只读Agent产出变更意图,受限handler按milestone分支关系创建草稿PR。E2
ProblemP2不同发布分支需要不同的文档目标。E2
└─designD2通过milestone与分支映射选择草稿PR目标。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把生成内容与持权发布分开,让源变更和领域评审人跟随文档草稿。

Trade-offs

早版有9/69关闭,后续窗口不能掩盖不同版本;合并率也不等于内容无需编辑或质量普遍可靠。

Where the evidence stops

早版有9/69关闭,后续窗口不能掩盖不同版本;合并率也不等于内容无需编辑或质量普遍可靠。

08.05Engineering How Stripe Built Kai, its Company-Wide AI Agent, on Deep AgentsProblem企业Agent需要跨会话文件、隔离代码和大量内部能力,全部前置上下文会降低质量。Takeaway复用通用循环,在企业层维护身份、文件与技能目录,动态缩小可见上下文。 文件与工件工具与协议安全与隔离 82.5
ProblemP1企业Agent需要跨会话文件、隔离代码和大量内部能力,全部前置上下文会降低质量。E1
└─designD1以S3虚拟文件系统同步沙箱工作区,先发现skill再加载其允许的工具集合。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

复用通用循环,在企业层维护身份、文件与技能目录,动态缩小可见上下文。

Trade-offs

一人一周是已有内部基础上的初版开发故事,不是从零建设企业平台的全部成本;加载工具列表本身不等于授权。

Where the evidence stops

一人一周是已有内部基础上的初版开发故事,不是从零建设企业平台的全部成本;加载工具列表本身不等于授权。

08.05Engineering How Apollo Rebuilt Its AI Assistant on Deep Agents to Power the Full GTM LoopProblem每个新业务都新增子Agent与路由,产生开发成本和反复确认,难支持跨GTM目标。Takeaway按用户目标组织可组合能力,用同一质量定义连接上线前检查与线上反馈。 观测与评测工具与协议文件与工件 75
ProblemP1每个新业务都新增子Agent与路由,产生开发成本和反复确认,难支持跨GTM目标。E1
└─designD1将层级主管改为扁平skill计划,并用分层rubric、双人评价和生产反馈改进系统。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按用户目标组织可组合能力,用同一质量定义连接上线前检查与线上反馈。

Trade-offs

未披露等预算对照,不能据此认定所有supervisor架构都不适合;无头扩展仍需要业务权限边界。

Where the evidence stops

未披露等预算对照,不能据此认定所有supervisor架构都不适合;无头扩展仍需要业务权限边界。

08.05Engineering How we built LangChain’s agent-first data stackProblem企业数据问答不仅缺表信息,还缺统一指标定义、权威来源和团队语义。Takeaway将数据结构、指标口径、业务解释和信任声明分层维护,按失败类型更新对应层。 记忆与上下文文件与工件身份与权限 72.5
ProblemP1企业数据问答不仅缺表信息,还缺统一指标定义、权威来源和团队语义。E1
└─designD1把dbt逻辑、语义层和版本化guide用于数据代理,由数据团队维护权威认可标记。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将数据结构、指标口径、业务解释和信任声明分层维护,按失败类型更新对应层。

Trade-offs

采用率不是所有人都在使用Agent,也不证明回答正确率;作者明确底层模型混乱不能靠语义层补救。

Where the evidence stops

采用率不是所有人都在使用Agent,也不证明回答正确率;作者明确底层模型混乱不能靠语义层补救。

08.05Engineering Build Production-Ready Agents with the GitHub Copilot Harness and Agent FrameworkProblem已有Copilot能力需要进入统一Agent Framework接口,同时保留其原生工具循环和审批责任。Takeaway在拥有实际工具循环的一层落实审批,再通过统一接口组合其他应用组件。 工具与协议状态与恢复文件与工件 67.5
ProblemP1已有Copilot能力需要进入统一Agent Framework接口,同时保留其原生工具循环和审批责任。E1
└─designD1由Copilot SDK掌握内层代理循环,框架提供外层接口,工具执行接入SDK审批hook。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

在拥有实际工具循环的一层落实审批,再通过统一接口组合其他应用组件。

Trade-offs

文章的默认监督描述不能覆盖示例中主动全放行配置;自定义hook可能绕过默认审批且仅给警告。

Where the evidence stops

文章的默认监督描述不能覆盖示例中主动全放行配置;自定义hook可能绕过默认审批且仅给警告。

08.04Engineering Zero risk isn't the job: a CISO's guide to agentic AIProblem同一权限下模型升级也可能发现新的委派路径,按旧模型能力估算风险会失效。Takeaway依据可用能力与资源边界治理,并把间接委派纳入身份和影响范围。 身份与权限安全与隔离工具与协议 77.5
ProblemP1同一权限下模型升级也可能发现新的委派路径,按旧模型能力估算风险会失效。E1
└─designD1围绕输入来源、动作身份、影响范围和可观测性分析代理系统的实际授权路径。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

依据可用能力与资源边界治理,并把间接委派纳入身份和影响范围。

Trade-offs

内部内容不是天然可信,原文自己限定攻击需内部人员或被盗账户;这是治理经验而非安全效果定量比较。

Where the evidence stops

内部内容不是天然可信,原文自己限定攻击需内部人员或被盗账户;这是治理经验而非安全效果定量比较。

08.04Engineering How Anthropic runs large-scale code migrations with Claude CodeProblem跨语言迁移涉及隐含契约和架构差异,逐文件翻译会扩散相同错误。Takeaway把重复发现转成规则修订,分开判断语法通过、可运行和行为一致。 文件与工件状态与恢复观测与评测 92.5
ProblemP1跨语言迁移涉及隐含契约和架构差异,逐文件翻译会扩散相同错误。E1
└─designD1先建立迁移规则和缺口清单,再按依赖翻译,分别核对编译、运行与行为。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把重复发现转成规则修订,分开判断语法通过、可运行和行为一致。

Trade-offs

结构保留与重新设计不适用同一种对照;是否把编译放进内循环取决于编译成本,文件存在仅表示翻译阶段产物存在。

Where the evidence stops

结构保留与重新设计不适用同一种对照;是否把编译放进内循环取决于编译成本,文件存在仅表示翻译阶段产物存在。

08.04Engineering Agentic retrieval for Amazon Bedrock Managed Knowledge BaseProblem多跳问题需要从前次结果提出下一次查询,单次检索容易缺少证据链。Takeaway将子查询过程和最终证据集分开记录,按问题复杂度理解额外检索价值。 记忆与上下文观测与评测状态与恢复 87.5
ProblemP1多跳问题需要从前次结果提出下一次查询,单次检索容易缺少证据链。E1
└─designD1组合投机检索与多轮查询规划,最终返回去重片段并保留完整检索轨迹。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将子查询过程和最终证据集分开记录,按问题复杂度理解额外检索价值。

Trade-offs

MuSiQue召回提升不是最终答案准确率;更多轮数增加成本,guardrail只支持BLOCK不支持MASK。

Where the evidence stops

MuSiQue召回提升不是最终答案准确率;更多轮数增加成本,guardrail只支持BLOCK不支持MASK。

08.04Engineering How to Run an Autoresearch Workflow with RL Agent Skills and NVIDIA NeMoProblem长研究会话容易遗失目标、环境惯例和停止条件,导致低信息量的反复尝试。Takeaway可借鉴持久目标、资源约束和决策记录的组织方式;文章分析不需要执行其中的研究流程。 状态与恢复文件与工件记忆与上下文 67.5
ProblemP1长研究会话容易遗失目标、环境惯例和停止条件,导致低信息量的反复尝试。E1
└─designD1以行为规范、会话记忆和autoresearch三个skill分别管理会话规则、累积信息和研究循环。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

可借鉴持久目标、资源约束和决策记录的组织方式;文章分析不需要执行其中的研究流程。

Trade-offs

这是作者的RL研究工作流案例,paper-to-code开始训练不代表算法有效性已被确认;人仍负责目标和结果判断。

Where the evidence stops

这是作者的RL研究工作流案例,paper-to-code开始训练不代表算法有效性已被确认;人仍负责目标和结果判断。

08.04Engineering Trajectory: A Standard Format for Agent Experience DataProblem不同harness的经验格式差异和运行元数据,使跨工具记忆读取昂贵。Takeaway区分供Agent阅读的经验视图和保真运行记录,根据消费者保留必要信息。 记忆与上下文工具与协议身份与权限 75
ProblemP1不同harness的经验格式差异和运行元数据,使跨工具记忆读取昂贵。E1
└─designD1将不同代理轨迹统一为角色和工具关联结构,并可选择截断冗长工具输出。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

区分供Agent阅读的经验视图和保真运行记录,根据消费者保留必要信息。

Trade-offs

格式服务记忆阅读而非完整执行重放,丢弃或截断的信息可能不适合审计用途。

Where the evidence stops

格式服务记忆阅读而非完整执行重放,丢弃或截断的信息可能不适合审计用途。

08.04Engineering Is a Pod the right deployment unit for an AI agent?Problem短暂且突发的Agent生命周期与长期Pod不一致,一Agent一Pod会保留大量空闲资源。Takeaway将逻辑Agent身份与承载进程分开,使用现有集群管理执行资源。 状态与恢复身份与权限运行时与调度 67.5
ProblemP1短暂且突发的Agent生命周期与长期Pod不一致,一Agent一Pod会保留大量空闲资源。E1
└─designD1用WorkerPool及ActorTemplate管理Kubernetes工作节点,由额外控制面调度逻辑Actor。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将逻辑Agent身份与承载进程分开,使用现有集群管理执行资源。

Trade-offs

身份、actor级策略和计费在文中多为待讨论问题;没有量化容量结果支持无限规模。

Where the evidence stops

身份、actor级策略和计费在文中多为待讨论问题;没有量化容量结果支持无限规模。

08.04Engineering State & Persistence: The Problem of Agent ReliabilityProblem执行进度和跨任务知识共享生命周期,会在恢复、保留和权限上产生错误。Takeaway分别定义状态与记忆的生命周期,将恢复绑定到执行版本和已提交动作身份。 状态与恢复记忆与上下文工具与协议 77.5
ProblemP1执行进度和跨任务知识共享生命周期,会在恢复、保留和权限上产生错误。E1
└─designD1在工具边界保存状态和已作决策,以模型、代码、prompt的版本组合解释恢复语义。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

分别定义状态与记忆的生命周期,将恢复绑定到执行版本和已提交动作身份。

Trade-offs

文章是多来源架构综合,费用案例明确为轶事;bundle是设计建议,不是数据库自动提供的完整能力。

Where the evidence stops

文章是多来源架构综合,费用案例明确为轶事;bundle是设计建议,不是数据库自动提供的完整能力。

08.04Engineering What 10 autonomous film crews taught us about agent teamworkProblem多Agent创作需要跨阶段交接,进程重启后只靠消息历史容易遗失决策。Takeaway让交接围绕可读产物和明确阶段结果,完成声明需要与实际产物对应。 文件与工件状态与恢复工具与协议 75
ProblemP1多Agent创作需要跨阶段交接,进程重启后只靠消息历史容易遗失决策。E1
└─designD1通过共享文件、传路径的消息和阶段评审协调电影制作团队。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让交接围绕可读产物和明确阶段结果,完成声明需要与实际产物对应。

Trade-offs

十支团队的一次创作活动是观察案例,文件协作优势不构成一般任务的受控结论。

Where the evidence stops

十支团队的一次创作活动是观察案例,文件协作优势不构成一般任务的受控结论。

08.04Engineering When agents build agentsProblem复杂目标需要动态组合专长,并在跨次运行中保留工作而不持续膨胀主上下文。Takeaway分开运行时可用能力与下一轮改进产物,保持稳定调用契约。 工具与协议文件与工件观测与评测 80
ProblemP1复杂目标需要动态组合专长,并在跨次运行中保留工作而不持续膨胀主上下文。E1
└─designD1用Monty组织隔离子代理及动态生成能力,静态检查通过的能力在下一run启用。E2
ProblemP2新生成能力可能改变正在执行任务的条件。E2
└─designD2静态检查通过后在下一run启用,保持当前run的能力集合。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

分开运行时可用能力与下一轮改进产物,保持稳定调用契约。

Trade-offs

按层级检索子Agent历史仍属规划;文章未给动态编排的量化收益对照。

Where the evidence stops

按层级检索子Agent历史仍属规划;文章未给动态编排的量化收益对照。

08.04Engineering When agents improve agentsProblem一次run结束不等于目标完成,跨run改进还可能只优化了有偏的评分者。Takeaway把完成条件、可检索经验和评价标准分开,保留对标准与改动的人工判断。 记忆与上下文状态与恢复文件与工件 77.5
ProblemP1一次run结束不等于目标完成,跨run改进还可能只优化了有偏的评分者。E1
└─designD1以持久轨迹BM25检索和版本化rubric支持诊断,由人工校准并决定优化采用。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把完成条件、可检索经验和评价标准分开,保留对标准与改动的人工判断。

Trade-offs

搜索目前是全store或单会话,不能当作细粒度访问隔离;65个PR/22合并不是自动改进因果证明。

Where the evidence stops

搜索目前是全store或单会话,不能当作细粒度访问隔离;65个PR/22合并不是自动改进因果证明。

08.04Paper Six Agent Harness Capabilities for Higher Model PerformanceProblem文本化工具结果反复进入上下文,工具、状态和控制散落多个接口。Takeaway用类型化对象和有界预览减少重复传输,把确定性检查置于明确方法边界。 文件与工件工具与协议记忆与上下文 82.5
ProblemP1文本化工具结果反复进入上下文,工具、状态和控制散落多个接口。E1
└─designD1把状态保留为可引用的Python对象,通过代码动作和typed关系组织工作记忆。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

用类型化对象和有界预览减少重复传输,把确定性检查置于明确方法边界。

Trade-offs

SWE-bench无压缩现象限定这些任务和模型;研究preview和沙箱外部依赖不能被概括成框架单独提供全部安全性。

Where the evidence stops

SWE-bench无压缩现象限定这些任务和模型;研究preview和沙箱外部依赖不能被概括成框架单独提供全部安全性。

08.04Engineering Safety and alignment in an era of long-horizon modelsProblem长时间自主工作可能把多个局部看似正常动作组合成对约束的绕过。Takeaway围绕完整轨迹判断目标与约束,保留可介入的执行边界。 状态与恢复安全与隔离身份与权限 80
ProblemP1长时间自主工作可能把多个局部看似正常动作组合成对约束的绕过。E1
└─designD1从实际事故补充评估与长指令对齐,以能暂停会话的轨迹监控支撑有限内部部署。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

围绕完整轨迹判断目标与约束,保留可介入的执行边界。

Trade-offs

作者只描述少量环境和定性改进,轨迹重放本身有随机性;没有严重事件观察不构成普遍安全保证。

Where the evidence stops

作者只描述少量环境和定性改进,轨迹重放本身有随机性;没有严重事件观察不构成普遍安全保证。

07.31Paper Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language AgentsProblemAgent声称用了某skill,不一定代表该artifact实际改变了决策,最终正确率也无法解释来源归因。Takeaway把实际行为变化、结果效用和自报来源分别分析,不把引用skill当作使用证据。 观测与评测文件与工件工具与协议 92.5
ProblemP1Agent声称用了某skill,不一定代表该artifact实际改变了决策,最终正确率也无法解释来源归因。E1
└─designD1固定任务与预算,干预skill名称、内容或存在性,并在答案提交后收集归因。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把实际行为变化、结果效用和自报来源分别分析,不把引用skill当作使用证据。

Trade-offs

识别的是artifact级决策敏感性,不揭示内部推理;答案不变也不能排除学过相同程序,单路径不估计服务随机波动。

Where the evidence stops

识别的是artifact级决策敏感性,不揭示内部推理;答案不变也不能排除学过相同程序,单路径不估计服务随机波动。

07.31Paper SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-UseProblem只按最终检查通过筛选经验,会保留选错skill后靠试错修好的过程。Takeaway将过程证据和最终产物分开评价,版本化评分标准并保留禁止破坏的关键步骤。 观测与评测文件与工件记忆与上下文 87.5
ProblemP1只按最终检查通过筛选经验,会保留选错skill后靠试错修好的过程。E1
└─designD1按选择、遵循、组合、反思四维分析skill行为,以独立verifier和隔离验证集约束修订。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将过程证据和最终产物分开评价,版本化评分标准并保留禁止破坏的关键步骤。

Trade-offs

训练结果是离线SFT;大库边界只评选择而非完整容器任务,未报告长期生产反馈。

Where the evidence stops

训练结果是离线SFT;大库边界只评选择而非完整容器任务,未报告长期生产反馈。

07.31Paper Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill LibrariesProblem动态skill库不仅有检索,还涉及提出、准入、组织、维护和来源治理,混为一谈会误判成熟度。Takeaway按具体生命周期阶段比较系统,区分能添加、能调用与能持续维护。 记忆与上下文文件与工件状态与恢复 80
ProblemP1动态skill库不仅有检索,还涉及提出、准入、组织、维护和来源治理,混为一谈会误判成熟度。E1
└─designD1以八阶段生命周期整理动态skill研究,区分能力表示、准入、运行和维护等证据角色。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按具体生命周期阶段比较系统,区分能添加、能调用与能持续维护。

Trade-offs

这是arXiv为主且非穷尽的综述,不是共享harness上的统一比较;分类归纳不能替代各论文实证。

Where the evidence stops

这是arXiv为主且非穷尽的综述,不是共享harness上的统一比较;分类归纳不能替代各论文实证。

07.31Engineering Building AX evals that actually workProblem含糊标准让模型评分看似准确,却无法区分正确使用、仅出现名称和根本不适用。Takeaway让判断附带可定位证据,结构与算术由代码处理,保留明确不适用条件。 记忆与上下文文件与工件工具与协议 77.5
ProblemP1含糊标准让模型评分看似准确,却无法区分正确使用、仅出现名称和根本不适用。E1
└─designD1逐项使用pass、fail、skip及人工样本校准,将版本和汇总算术交给确定性工具。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让判断附带可定位证据,结构与算术由代码处理,保留明确不适用条件。

Trade-offs

5–10例校准是实践起点,不证明整体可信;不适用跳过不能用于隐藏困难案例。

Where the evidence stops

5–10例校准是实践起点,不证明整体可信;不适用跳过不能用于隐藏困难案例。

07.31Engineering How to test agent skills without hitting real APIsProblemAPI评测可能付费、改变真实数据或受他人写入干扰,修改skill网址又引入新的变量。Takeaway阅读此类证据时区分隔离模拟与真实集成,保持被评skill本体一致。 工具与协议状态与恢复文件与工件 67.5
ProblemP1API评测可能付费、改变真实数据或受他人写入干扰,修改skill网址又引入新的变量。E1
└─designD1由Dev Proxy在原URL拦截调用,以种子数据和可重置CRUD状态模拟服务。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

阅读此类证据时区分隔离模拟与真实集成,保持被评skill本体一致。

Trade-offs

代理只模拟已配置操作,不证明真实鉴权、延迟和上游故障行为;原文没有效果量比较。

Where the evidence stops

代理只模拟已配置操作,不证明真实鉴权、延迟和上游故障行为;原文没有效果量比较。

07.31Paper SIGIL: Compiling Agent Skills into Typed HarnessesProblem自然语言skill把已确定的流程约束和需要模型判断的部分混在一起,导致必要步骤被跳过。Takeaway将程序负责的流程与模型负责的语义判断显式区分,追踪每项约束的来源。 文件与工件工具与协议运行时与调度 92.5
ProblemP1自然语言skill把已确定的流程约束和需要模型判断的部分混在一起,导致必要步骤被跳过。E1
└─designD1从来源跨度提取要求形成AG-IR,校验后确定性降低为可执行结构。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将程序负责的流程与模型负责的语义判断显式区分,追踪每项约束的来源。

Trade-offs

来源片段存在不证明解释正确;可执行结构约束只覆盖已正确提取和编译的要求。

Where the evidence stops

来源片段存在不证明解释正确;可执行结构约束只覆盖已正确提取和编译的要求。

07.31Paper MemTxn: A Transaction Boundary for Source-Supported Updates and Complete-State Recovery in Agent MemoryProblem记忆更新准入、答案版本选择与持久恢复是不同问题,单键修复可能遗漏其他已受损状态。Takeaway分开准入、可见性和恢复,并将可恢复范围绑定到应用可见状态。 文件与工件状态与恢复记忆与上下文 92.5
ProblemP1记忆更新准入、答案版本选择与持久恢复是不同问题,单键修复可能遗漏其他已受损状态。E1
└─designD1用有序token条件约束记忆修订、声明时间选择版本,并保存完整active-map前像。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

分开准入、可见性和恢复,并将可恢复范围绑定到应用可见状态。

Trade-offs

不保证语义角色绑定、并发、重复故障、intent损坏或物理丢失;恢复以前像完整且外部检测器调用为前提。

Where the evidence stops

不保证语义角色绑定、并发、重复故障、intent损坏或物理丢失;恢复以前像完整且外部检测器调用为前提。

07.31Paper MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent SystemsProblem固定团队拓扑无法根据任务和已发生的协作问题调整分工及信息可见性。Takeaway以可观察协作问题触发结构调整,保留过程信号与结果正确性的区别。 观测与评测文件与工件身份与权限 87.5
ProblemP1固定团队拓扑无法根据任务和已发生的协作问题调整分工及信息可见性。E1
└─designD1过程审计发现问题后进行最多三操作的有界修订,以两种时间尺度维护playbook。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

以可观察协作问题触发结构调整,保留过程信号与结果正确性的区别。

Trade-offs

无过程flag不等于答案正确;跨域迁移每组30题,控制者不接收benchmark verdict。

Where the evidence stops

无过程flag不等于答案正确;跨域迁移每组30题,控制者不接收benchmark verdict。

07.31Paper AgentRadio: Passive Awareness for Long-Horizon Multi-Agent CollaborationProblem协作中前台等待消息会打断独立工作,跨分工发现要到评审时才传递。Takeaway把消息到达与工作执行解耦,让跨任务相关发现及时进入对方上下文。 文件与工件状态与恢复工具与协议 90
ProblemP1协作中前台等待消息会打断独立工作,跨分工发现要到评审时才传递。E1
└─designD1后台watcher在步骤边界把同伴消息送入代理,替代每次通信都阻塞推理的方式。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把消息到达与工作执行解耦,让跨任务相关发现及时进入对方上下文。

Trade-offs

无额外监听模型调用不等于零成本,消息仍占token;主实验124题,三次随机性检查只覆盖30题子集。

Where the evidence stops

无额外监听模型调用不等于零成本,消息仍占token;主实验124题,三次随机性检查只覆盖30题子集。

07.31Paper Hybrid Analysis for Secure MCP Tool Use in LLM AgentsProblem仅检查声明参数或返回文本,看不到MCP工具真实执行的进程、文件和网络行为。Takeaway将声明动作与实际执行证据关联,分别描述执行前阻止和执行后发现。 工具与协议安全与隔离文件与工件 92.5
ProblemP1仅检查声明参数或返回文本,看不到MCP工具真实执行的进程、文件和网络行为。E1
└─designD1调用前检查参数,执行中采集eBPF行为树,返回前审查结果是否可以交给模型。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将声明动作与实际执行证据关联,分别描述执行前阻止和执行后发现。

Trade-offs

已经发生的副作用不会自动撤销;本地Docker/cgroup原型不覆盖无相应遥测的远程工具,且不看网络payload。

Where the evidence stops

已经发生的副作用不会自动撤销;本地Docker/cgroup原型不覆盖无相应遥测的远程工具,且不看网络payload。

07.30Paper Filesystem-Based Memory for LLM Agents: Organization, Evolution, and SustainabilityProblem文件记忆的组织、压缩和维护会同时影响查找成本与信息保留,目录更复杂未必更好。Takeaway按信息材料和消费者能力选择组织程度,将建库成本与每次使用成本分开。 记忆与上下文文件与工件工具与协议 92.5
ProblemP1文件记忆的组织、压缩和维护会同时影响查找成本与信息保留,目录更复杂未必更好。E1
└─designD1分离记忆管理、搜索与执行角色,在相同任务中比较不同文件组织和存储形式。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按信息材料和消费者能力选择组织程度,将建库成本与每次使用成本分开。

Trade-offs

对话32k/128k含不同内容,不能纯归因长度;增长证据限140任务链,维护可让库更大而非更小。

Where the evidence stops

对话32k/128k含不同内容,不能纯归因长度;增长证据限140任务链,维护可让库更大而非更小。

07.30Paper VITAL-RAG: Invariance Race for Context Allocation in Coding AgentsProblem同一代码对象的多视图会重复占据上下文,已检索到的证据还可能在token预算下被截掉。Takeaway将检索排序、对象去重和最终上下文分配分别建模。 文件与工件记忆与上下文身份与权限 82.5
ProblemP1同一代码对象的多视图会重复占据上下文,已检索到的证据还可能在token预算下被截掉。E1
└─designD1每个来源对象只占一个排名位置,再按查询添加companion并限制对象token预算。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将检索排序、对象去重和最终上下文分配分别建模。

Trade-offs

依赖索引提供的对象身份,固定4096token设置不代表所有窗口的最佳分配;检索召回不等于任务完成率。

Where the evidence stops

依赖索引提供的对象身份,固定4096token设置不代表所有窗口的最佳分配;检索召回不等于任务完成率。

07.30Paper MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and RepairProblem记忆写入成功不等于攻击成功,清除恶意条目也不等于修复后良性记忆仍完整。Takeaway按完整生命周期定位风险,删除动作和完成声明都不能代替最终状态证据。 记忆与上下文安全与隔离观测与评测 92.5
ProblemP1记忆写入成功不等于攻击成功,清除恶意条目也不等于修复后良性记忆仍完整。E1
└─designD1分别观察污染写入、召回、采纳和外部后果,并独立评估选择性遗忘与良性信息保留。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按完整生命周期定位风险,删除动作和完成声明都不能代替最终状态证据。

Trade-offs

假定攻击内容已进入支持的流程,不研究获取账户入口;judge只报告500条人工标签一致率,后端优劣随配置反转。

Where the evidence stops

假定攻击内容已进入支持的流程,不研究获取账户入口;judge只报告500条人工标签一致率,后端优劣随配置反转。

07.30Paper FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise DocumentsProblem可变企业文档下,相似问题复用答案可能跨报告期或过期依赖,生成缓存需要比语义相似更严格的条件。Takeaway把正确性复用门槛与缓存淘汰收益策略分开。 文件与工件工具与协议观测与评测 100
ProblemP1可变企业文档下,相似问题复用答案可能跨报告期或过期依赖,生成缓存需要比语义相似更严格的条件。E1
└─designD1将复用答案绑定请求签名和证据、版本、工具指纹,以反向索引传播失效。E2
ProblemP2来源变化后旧答案可能仍被命中。E2
└─designD2通过证据和版本指纹绑定缓存,反向索引传播失效。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把正确性复用门槛与缓存淘汰收益策略分开。

Trade-offs

保证的是记录依赖的新鲜度而非财务事实正确;多副本跨区一致性不在实证范围,节能数字基于功率假设。

Where the evidence stops

保证的是记录依赖的新鲜度而非财务事实正确;多副本跨区一致性不在实证范围,节能数字基于功率假设。

07.30Paper AgentGUI: An Interface for Observing and Steering Long-Running AI AgentsProblem长Agent任务中人难以理解轨迹,Agent空闲后也可能遗漏产物而不继续。Takeaway让任务条件、轨迹和文件在同一界面可查,将需要继续的原因指向具体缺项。 状态与恢复文件与工件工具与协议 75
ProblemP1长Agent任务中人难以理解轨迹,Agent空闲后也可能遗漏产物而不继续。E1
└─designD1提供分层轨迹、文件预览和用户steering,再由manager按条件判断任务状态。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让任务条件、轨迹和文件在同一界面可查,将需要继续的原因指向具体缺项。

Trade-offs

产物存在不证明内容正确;manager token少于1%不等于全部资源开销少于1%,Hermes与Claude支持成熟度不同。

Where the evidence stops

产物存在不证明内容正确;manager token少于1%不等于全部资源开销少于1%,Hermes与Claude支持成熟度不同。

07.29Paper Towards a Systems Foundation for Agentic Cloud ManagementProblem多会话操作不同云资源仍可能争用同一父资源或容量,单按资源ID协调不够。Takeaway以真实依赖和容量约束确定冲突范围,给Agent返回可归因的等待或拒绝原因。 工具与协议文件与工件状态与恢复 80
ProblemP1多会话操作不同云资源仍可能争用同一父资源或容量,单按资源ID协调不够。E1
└─designD1从全局资源图投影session状态,以多粒度锁和容量escrow协调操作,并在提交前重验。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

以真实依赖和容量约束确定冲突范围,给Agent返回可归因的等待或拒绝原因。

Trade-offs

provider语义依赖插件,自动生成插件属于规划;语义事务不是对所有云副作用提供通用原子回滚。

Where the evidence stops

provider语义依赖插件,自动生成插件属于规划;语义事务不是对所有云副作用提供通用原子回滚。

07.29Paper CodeNib: A Multi-View Data System for Serving Repository Context to Coding AgentsProblem代码上下文来自结构、词法和向量视图,构建、维护、查询与交付需要明确边界。Takeaway显式记录各视图版本和provider,分开数据新鲜度与交付策略。 文件与工件工具与协议记忆与上下文 100
ProblemP1代码上下文来自结构、词法和向量视图,构建、维护、查询与交付需要明确边界。E1
└─designD1以commit manifest组织多种代码视图,按能力加载并对符号变化进行增量维护。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

显式记录各视图版本和provider,分开数据新鲜度与交付策略。

Trade-offs

静态导航不完全等价实时LSP;token下降未测缓存或prefill延迟,compaction并非所有模型最优。

Where the evidence stops

静态导航不完全等价实时LSP;token下降未测缓存或prefill延迟,compaction并非所有模型最优。

07.29Paper SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding AgentsProblem全量模型扫描skill昂贵,纯模式匹配又可能误报大量正常技术内容。Takeaway将低成本筛查、语义判定和最终准入分开,保留筛查覆盖范围。 文件与工件身份与权限安全与隔离 80
ProblemP1全量模型扫描skill昂贵,纯模式匹配又可能误报大量正常技术内容。E1
└─designD1先用模式筛选MCP响应片段,再交给judge并隔离可疑内容。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将低成本筛查、语义判定和最终准入分开,保留筛查覆盖范围。

Trade-offs

150恶意文件为手工示例;正则无命中直接放行会漏过新编码方式,PATH shim不是不可绕过的系统边界。

Where the evidence stops

150恶意文件为手工示例;正则无命中直接放行会漏过新编码方式,PATH shim不是不可绕过的系统边界。

07.29Paper OrchBench: Evaluating Multi-Agent Orchestration Plans in Isolation via Deterministic SimulationProblem端到端多Agent分数混合了任务求解和编排能力,难判断信息转移与资源分配本身。Takeaway把编排结构单独分析,用声明依赖与信息流解释失败而非只看Agent数量。 身份与权限记忆与上下文工具与协议 92.5
ProblemP1端到端多Agent分数混合了任务求解和编排能力,难判断信息转移与资源分配本身。E1
└─designD1在DAG模拟中显式建模任务分配、跨Agent信息传递和压缩损失,确定性计算调度结果。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把编排结构单独分析,用声明依赖与信息流解释失败而非只看Agent数量。

Trade-offs

质量来自模拟假设;跨框架时间相关性很低,不能把模拟token或时延当作真实系统收益。

Where the evidence stops

质量来自模拟假设;跨框架时间相关性很低,不能把模拟token或时延当作真实系统收益。

07.29Engineering Discover Agent Skills from MCP servers in .NETProblem多Agent各自复制skill会出现版本漂移,远程分发又引入解包与执行风险。Takeaway统一发现和分发接口,分别治理内容读取、归档落盘与脚本执行。 文件与工件工具与协议身份与权限 80
ProblemP1多Agent各自复制skill会出现版本漂移,远程分发又引入解包与执行风险。E1
└─designD1用skill目录索引发现能力,按需读取资源或archive,并限制下载与解压规模。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

统一发现和分发接口,分别治理内容读取、归档落盘与脚本执行。

Trade-offs

远程archive脚本明确不执行;资源限制不证明内容语义安全,统一来源也不是权限依据。

Where the evidence stops

远程archive脚本明确不执行;资源限制不证明内容语义安全,统一来源也不是权限依据。

07.28Engineering Security incident disclosure — July 2026Problem数据处理工作节点的代码执行漏洞可能演变为节点和跨集群凭证暴露。Takeaway把数据处理面和凭证传播纳入系统边界,取证能力需能处理真实恶意材料。 安全与隔离身份与权限观测与评测 85
ProblemP1数据处理工作节点的代码执行漏洞可能演变为节点和跨集群凭证暴露。E1
└─designD1从真实入侵事件追踪loader执行、凭据触达与横向移动,再界定修复和轮换范围。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把数据处理面和凭证传播纳入系统边界,取证能力需能处理真实恶意材料。

Trade-offs

攻击者使用的LLM明确未知,不能归因某模型;小时级分析是事故报告而非受控效率比较。

Where the evidence stops

攻击者使用的LLM明确未知,不能归因某模型;小时级分析是事故报告而非受控效率比较。

07.28Engineering Agents SDK adds MCP Specification 2026-07-28 supportProblem协议升级需同时服务新无状态客户端与旧连接,不能因迁移丢失交互式输入和身份状态。Takeaway区分协议会话和应用任务状态,以能力探测决定兼容路径。 工具与协议状态与恢复身份与权限 87.5
ProblemP1协议升级需同时服务新无状态客户端与旧连接,不能因迁移丢失交互式输入和身份状态。E1
└─designD1先探测新发现协议后回退旧初始化,用MRTR恢复原操作,并隔离每请求server实例。E2
ProblemP2并发请求共用协议server可能互相污染状态。E2
└─designD2每请求创建server实例,特殊session场景保留明确路由。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

区分协议会话和应用任务状态,以能力探测决定兼容路径。

Trade-offs

普通无状态操作可同路由兼容,依赖session/RPC/独立流的服务仍需重设计或双路由过渡。

Where the evidence stops

普通无状态操作可同路由兼容,依赖session/RPC/独立流的服务仍需重设计或双路由过渡。

07.28Engineering Build enterprise search for agents with Amazon Bedrock Managed Knowledge BaseProblem企业检索需覆盖多来源与多跳问题,同时避免同步ACL过时后继续暴露文档。Takeaway权限判断与语义相关性分开,按复杂度选择直接检索或迭代检索。 记忆与上下文身份与权限文件与工件 80
ProblemP1企业检索需覆盖多来源与多跳问题,同时避免同步ACL过时后继续暴露文档。E1
└─designD1在检索前过滤候选,查询时再检查权威源ACL,结合多轮子查询返回去重证据。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

权限判断与语义相关性分开,按复杂度选择直接检索或迭代检索。

Trade-offs

官方功能介绍和客户陈述不提供完整准确率对照;统一网关不能替代上游文档权限语义。

Where the evidence stops

官方功能介绍和客户陈述不提供完整准确率对照;统一网关不能替代上游文档权限语义。

07.28Engineering The Microsoft Agent Framework Harness is now releasedProblem从chat client到长任务Agent还需要工具循环、状态、记忆、规划和可观测性。Takeaway让通用循环有明确可替换部件,展示功能时保留各组件成熟度。 工具与协议文件与工件记忆与上下文 75
ProblemP1从chat client到长任务Agent还需要工具循环、状态、记忆、规划和可观测性。E1
└─designD1用可替换的默认组件构成harness,并在每次模型调用后保存对话历史。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让通用循环有明确可替换部件,展示功能时保留各组件成熟度。

Trade-offs

历史持久化不自动保证工具副作用不重复;ready-made不意味着所有扩展都已稳定。

Where the evidence stops

历史持久化不自动保证工具副作用不重复;ready-made不意味着所有扩展都已稳定。

07.28Engineering How Couchbase built a multi-model AI architecture for Capella iQ with Amazon BedrockProblem企业SQL助手需要模型切换与高可用,同时保持租户配置和区域约束。Takeaway在调用层解耦模型选择,并将地域和租户覆盖规则作为配置的一部分。 身份与权限运行时与调度文件与工件 85
ProblemP1企业SQL助手需要模型切换与高可用,同时保持租户配置和区域约束。E1
└─designD1通过namespace配置、私有端点和美国地域内跨区路由组织NL查询服务。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

在调用层解耦模型选择,并将地域和租户覆盖规则作为配置的一部分。

Trade-offs

私网不等于单区域,跨区故障仍需超时与重试设计;小模型蒸馏降本是未来计划。

Where the evidence stops

私网不等于单区域,跨区故障仍需超时与重试设计;小模型蒸馏降本是未来计划。

07.27Engineering Open Knowledge format v0.2 tackles agentic trustProblem知识消费者需要在读取正文前判断来源和新鲜度,计算值还需知道是否按批准公式取得。Takeaway把来源、生成者、核验记录、定义有效期与本次计算证据分别表达。 观测与评测记忆与上下文身份与权限 92.5
ProblemP1知识消费者需要在读取正文前判断来源和新鲜度,计算值还需知道是否按批准公式取得。E1
└─designD1分离generated与verified知识状态、绝对过期时间,以及逐次计算的证明收据。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把来源、生成者、核验记录、定义有效期与本次计算证据分别表达。

Trade-offs

信任tier是建议而非访问控制,OKF本身不执行;reference实现为概念验证,过期定义仍可能通过一次计算attestation。

Where the evidence stops

信任tier是建议而非访问控制,OKF本身不执行;reference实现为概念验证,过期定义仍可能通过一次计算attestation。

07.27Paper IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue RequestsProblem编程Agent从issue和附件读取外部材料时,可能把攻击者伪装成任务要求的内容执行到仓库。Takeaway保留用户任务与issue内容的信任边界,按实际动作而非最终口头拒绝判断后果。 文件与工件安全与隔离状态与恢复 80
ProblemP1编程Agent从issue和附件读取外部材料时,可能把攻击者伪装成任务要求的内容执行到仓库。E1
└─designD1把issue变体投入固定代理设置,按实际执行、交付工件和风险提醒分别统计结果。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

保留用户任务与issue内容的信任边界,按实际动作而非最终口头拒绝判断后果。

Trade-offs

攻击变体数量不等于独立任务多样性;各harness搭配模型不同,不能据总平均分纯比较框架安全性。

Where the evidence stops

攻击变体数量不等于独立任务多样性;各harness搭配模型不同,不能据总平均分纯比较框架安全性。

07.27Engineering Native Agent Memory for Microsoft Agent Framework, Powered by Azure Cosmos DBProblem长期用户记忆需要跨新会话注入,又不宜把存储和抽取逻辑绑进Agent循环。Takeaway通过生命周期扩展记忆能力,将身份、抽取标准和注入语义分别设计。 记忆与上下文安全与隔离文件与工件 80
ProblemP1长期用户记忆需要跨新会话注入,又不宜把存储和抽取逻辑绑进Agent循环。E1
└─designD1以context provider的before_run召回、after_run保存及可定制抽取维护用户记忆。E2
ProblemP2用户画像可能被当作高优先级指令。E2
└─designD2使用稳定user_id和thread_id,将召回画像作为用户角色的不可信参考。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

通过生命周期扩展记忆能力,将身份、抽取标准和注入语义分别设计。

Trade-offs

正常context退出会drain后台任务,不证明异常终止无损;user_id分区需可信身份绑定,非可信标签也不是确定性防注入。

Where the evidence stops

正常context退出会drain后台任务,不证明异常终止无损;user_id分区需可信身份绑定,非可信标签也不是确定性防注入。

07.27Engineering Move Agent Orchestration/Workflows out of Code with Agent Framework Declarative Workflows 1.0Problem代码内散落的编排使分支、状态和人工等待不易独立审阅和复用。Takeaway将稳定编排外置为可审阅定义,复杂业务函数仍由代码提供。 状态与恢复工具与协议身份与权限 75
ProblemP1代码内散落的编排使分支、状态和人工等待不易独立审阅和复用。E1
└─designD1将YAML中的状态、条件、工具、人工输入与checkpoint加载为普通Workflow。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将稳定编排外置为可审阅定义,复杂业务函数仍由代码提供。

Trade-offs

声明式格式不自动证明策略安全、流程无环或迁移兼容;文章示例并未提供这些额外保证。

Where the evidence stops

声明式格式不自动证明策略安全、流程无环或迁移兼容;文章示例并未提供这些额外保证。

07.27Engineering Building trade assistant: How Jefferies optimized front office trading operations with AIProblem交易分析问题跨多个数据源和业务口径,直接让模型完成查询与图表内容容易失真。Takeaway把模型的意图解释与确定性数据权限、业务处理和呈现分开。 身份与权限记忆与上下文工具与协议 72.5
ProblemP1交易分析问题跨多个数据源和业务口径,直接让模型完成查询与图表内容容易失真。E1
└─designD1由代理选择数据源和查询,Query Executor实施行级过滤,专用引擎渲染数值图表。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把模型的意图解释与确定性数据权限、业务处理和呈现分开。

Trade-offs

正文提供工程案例而非准确率受控对照;图表渲染正确不证明SQL口径或源数据正确。

Where the evidence stops

正文提供工程案例而非准确率受控对照;图表渲染正确不证明SQL口径或源数据正确。

07.24Engineering AI Teammates: how monday.com runs production AI agents on Amazon BedrockProblemAgent需要像团队成员一样承接多入口任务,状态与责任不能分别散在多个聊天工具。Takeaway将任务、身份和交付纳入现有团队系统,并按状态寿命选择存储。 状态与恢复运行时与调度身份与权限 92.5
ProblemP1Agent需要像团队成员一样承接多入口任务,状态与责任不能分别散在多个聊天工具。E1
└─designD1用SNS/SQS统一消息入口,分层存放活动状态、EFS工作区和S3记录,并以review筛选PR。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

将任务、身份和交付纳入现有团队系统,并按状态寿命选择存储。

Trade-offs

自动合并依赖特定agent×repo×change-class信号;已有业务治理仍需覆盖Agent新行为,不能由集成直接推出普遍安全。

Where the evidence stops

自动合并依赖特定agent×repo×change-class信号;已有业务治理仍需覆盖Agent新行为,不能由集成直接推出普遍安全。

07.24Paper Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded VerificationProblem安全测试需要把风险描述转成可观察的状态变化,而不是相信代理自报成功。Takeaway借鉴可观察证据分层,同时分开成功谓词和分母。 工具与协议安全与隔离观测与评测 87.5
ProblemP1安全测试需要把风险描述转成可观察的状态变化,而不是相信代理自报成功。E1
└─designD1组合风险、方法和环境生成安全案例,用初始状态脚本及确定性环境谓词裁决结果。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

借鉴可观察证据分层,同时分开成功谓词和分母。

Trade-offs

良性完整任务与攻击单个违规使用不同成功谓词,70.5%与90.6%的差不能单独证明自适应驱动的因果收益;自动生成谓词仍有误判边界。

Where the evidence stops

良性完整任务与攻击单个违规使用不同成功谓词,70.5%与90.6%的差不能单独证明自适应驱动的因果收益;自动生成谓词仍有误判边界。

07.24Engineering Best practices for applying Amazon Bedrock Guardrails to code generation workflowsProblem逐段重复扫描代码与历史会消耗 Guardrails 配额,检查应围绕输入和落盘执行边界组织。Takeaway把检查位置、检测能力与缓存失效条件分别建模。 安全与隔离文件与工件工具与协议 77.5
ProblemP1逐段重复扫描代码与历史会消耗 Guardrails 配额,检查应围绕输入和落盘执行边界组织。E1
└─designD1在输入、完整工件和执行边界解耦调用Guardrails,以内容缓存和较大批次减少重复扫描。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把检查位置、检测能力与缓存失效条件分别建模。

Trade-offs

示例按文件内容哈希缓存,未绑定策略版本;工具包装必须在副作用之前执行才构成闸门,文本检测不等于代码语义安全。

Where the evidence stops

示例按文件内容哈希缓存,未绑定策略版本;工具包装必须在副作用之前执行才构成闸门,文本检测不等于代码语义安全。

07.24Paper ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent SystemsProblem多代理的工具、记忆和互相传递内容引入输入过滤覆盖不到的注入路径。Takeaway边界覆盖值得借鉴,静态签名、压缩保留内容和不确定性处理必须分别评估。 工具与协议观测与评测记忆与上下文 92.5
ProblemP1多代理的工具、记忆和互相传递内容引入输入过滤覆盖不到的注入路径。E1
└─designD1在多类通信边界逐句计算短语库相似度,选择通过、截短或阻断并记录阻断层。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

边界覆盖值得借鉴,静态签名、压缩保留内容和不确定性处理必须分别评估。

Trade-offs

主要比较每组30例、单种子和模拟工具;三值决策的熵上界不等于传递文本的信息量上界,不能推导完整安全保证。

Where the evidence stops

主要比较每组30例、单种子和模拟工具;三值决策的熵上界不等于传递文本的信息量上界,不能推导完整安全保证。

07.24Paper JANUS: Foreseeing Latent Risk for Long-Horizon Agent SafetyProblem长任务中的风险可能尚未显露,护栏需要依据轨迹前缀判断后续危险。Takeaway区分预测未来风险与已经发生违规的证据,预测应标为概率判断。 安全与隔离工具与协议身份与权限 87.5
ProblemP1长任务中的风险可能尚未显露,护栏需要依据轨迹前缀判断后续危险。E1
└─designD1共享模型先预测未来摘要再进行安全裁决,以耦合奖励联合训练两项能力。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

区分预测未来风险与已经发生违规的证据,预测应标为概率判断。

Trade-offs

训练轨迹来自多代理模拟,外部工具和新政策泛化未充分刻画;正文表格混用Vanguard名称,按具体机制识别结论。

Where the evidence stops

训练轨迹来自多代理模拟,外部工具和新政策泛化未充分刻画;正文表格混用Vanguard名称,按具体机制识别结论。

07.24Engineering Evaluating AI Agents: A production blueprint with Strands and AgentCoreProblem生产代理需要同时评价工具使用、推理和最终交付,接口正常不代表任务正确。Takeaway按模块选择证据与评分方式,再用任务结果汇总,不只统计工具路径。 工具与协议观测与评测文件与工件 92.5
ProblemP1生产代理需要同时评价工具使用、推理和最终交付,接口正常不代表任务正确。E1
└─designD1把确定性工具评分、推理judge和输出质量分层,结合人工校准与多次通过口径。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按模块选择证据与评分方式,再用任务结果汇总,不只统计工具路径。

Trade-offs

95/85/90门槛是案例设置,87%到98%等为团队前后报告,不能归因到单一组件或直接移植为通用标准。

Where the evidence stops

95/85/90门槛是案例设置,87%到98%等为团队前后报告,不能归因到单一组件或直接移植为通用标准。

07.24Engineering How Outtake built a cyber investigator on ClaudeProblem长时间网络调查需要持久工作空间、灵活工具与外围约束共同支持。Takeaway把始终必须执行的规则放到宿主,把领域判断保留给代理。 记忆与上下文工具与协议状态与恢复 85
ProblemP1长时间网络调查需要持久工作空间、灵活工具与外围约束共同支持。E1
└─designD1以文件系统和bash支持开放调查,把必须成立的约束移到harness,工具改进交由独立代理和人审。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把始终必须执行的规则放到宿主,把领域判断保留给代理。

Trade-offs

这是团队工程经验,未给出各组件受控效果;blastbox容许代理被劫持假设,不意味着任意网络内容可信。

Where the evidence stops

这是团队工程经验,未给出各组件受控效果;blastbox容许代理被劫持假设,不意味着任意网络内容可信。

07.24Paper OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party SkillsProblem公开技能中的风险既有无条件恶意,也有取决于用户授权范围的操作。Takeaway同时保留风险识别、实际执行和安全完成三个维度。 安全与隔离文件与工件身份与权限 92.5
ProblemP1公开技能中的风险既有无条件恶意,也有取决于用户授权范围的操作。E1
└─designD1用筛选后的真实技能配合良性任务,在模拟外部服务中分别记录风险执行和风险意识。E2
ProblemP2防护可能通过过度拒绝牺牲正常任务。E2
└─designD2单独报告良性技能过度防御,并区分阻断后放弃与安全完成。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

同时保留风险识别、实际执行和安全完成三个维度。

Trade-offs

主动加载防护技能在40个良性技能上的平均过度防御22.50%,被动为1.88%;Fsafe不直接计入良性任务完成,不能替代效用指标。

Where the evidence stops

主动加载防护技能在40个良性技能上的平均过度防御22.50%,被动为1.88%;Fsafe不直接计入良性任务完成,不能替代效用指标。

07.24Engineering Detecting silent agent failures with Amazon Bedrock AgentCore optimizationProblem成功结束且无异常的会话也可能跳过前置操作或编造结果。Takeaway先定位具体失败及证据,再把根因假设与修复建议分开。 观测与评测工具与协议运行时与调度 72.5
ProblemP1成功结束且无异常的会话也可能跳过前置操作或编造结果。E1
└─designD1在逐会话失败分类后跨会话聚类,剪枝执行图并定位根因及影响范围。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

先定位具体失败及证据,再把根因假设与修复建议分开。

Trade-offs

聚类数量描述分析样本内影响范围;根因是系统推断,增强提示词不等于强制工具执行。

Where the evidence stops

聚类数量描述分析样本内影响范围;根因是系统推断,增强提示词不等于强制工具执行。

07.24Engineering The Blueprint: How Voicify makes AI-enabled ordering a delight for customersProblem电话订餐要在低延迟下处理复杂菜单并准确提交POS订单。Takeaway让确定性订单校验承接最终写入,按对话需要加载菜单细节。 观测与评测安全与隔离身份与权限 72.5
ProblemP1电话订餐要在低延迟下处理复杂菜单并准确提交POS订单。E1
└─designD1按对话需要渐进加载菜单,经POS验证再提交订单,并组合预留和按需推理容量。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让确定性订单校验承接最终写入,按对话需要加载菜单细节。

Trade-offs

25%至30%节省与100%可用是客户案例自报,未给出统一测试窗口;未来主动下单仍是展望。

Where the evidence stops

25%至30%节省与100%可用是客户案例自报,未给出统一测试窗口;未来主动下单仍是展望。

07.23Engineering How Anthropic secures its AI-native software development lifecycleProblemAI扩大代码产量后,安全审查需要扩展吞吐并保留责任和权限边界。Takeaway权限图需要覆盖代理间委托,治理要检查审查循环本身。 身份与权限文件与工件安全与隔离 92.5
ProblemP1AI扩大代码产量后,安全审查需要扩展吞吐并保留责任和权限边界。E1
└─designD1结合VM出网边界、CI审查与风险抽样,将工具调用、批准和代理间消息送入审计。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

权限图需要覆盖代理间委托,治理要检查审查循环本身。

Trade-offs

80%代码与16%到54%审查评论均属内部统计,评论比例不等于漏洞召回;不同上下文也不保证模型错误独立。

Where the evidence stops

80%代码与16%到54%审查评论均属内部统计,评论比例不等于漏洞召回;不同上下文也不保证模型错误独立。

07.23Engineering Agents SDK reduces MCP schema conversion, adds exposure controls for MCP in Think and Code Mode SDK adds direct host APIsProblem同一MCP目录反复转换schema和多渠道重复暴露工具浪费上下文与运行成本。Takeaway把目录发现、模型可见性和调用权限分别控制。 工具与协议状态与恢复文件与工件 80
ProblemP1同一MCP目录反复转换schema和多渠道重复暴露工具浪费上下文与运行成本。E1
└─designD1缓存活连接的转换schema,单独控制自动工具暴露,并提供Code Mode直接宿主API。E2
ProblemP2同一工具同时出现在自动列表和Code Mode中。E2
└─designD2用includeMcpTools关闭自动getAITools暴露,保留发现及直接调用。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把目录发现、模型可见性和调用权限分别控制。

Trade-offs

关闭自动暴露不关闭发现、直调或Code Mode连接;这是发布说明,没有给出性能测量。

Where the evidence stops

关闭自动暴露不关闭发现、直调或Code Mode连接;这是发布说明,没有给出性能测量。

07.23Engineering Build agentic full-stack apps with GenkitProblem全栈对话应用需要统一状态、流式协议、工具暂停与前端续接。Takeaway让UI状态、对话状态和可下载产物有清晰生命周期。 状态与恢复工具与协议文件与工件 87.5
ProblemP1全栈对话应用需要统一状态、流式协议、工具暂停与前端续接。E1
└─designD1统一对话和流式接口,按应用需要选择客户端状态或服务端快照,并支持暂停和后台任务。E2
ProblemP2用户返回的恢复参数可能与暂停调用不符。E2
└─designD2运行时依据session history核对恢复输入。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让UI状态、对话状态和可下载产物有清晰生命周期。

Trade-offs

API仍是预览版;请求断开后的继续工作不自动证明进程崩溃后所有副作用恰好一次。

Where the evidence stops

API仍是预览版;请求断开后的继续工作不自动证明进程崩溃后所有副作用恰好一次。

07.23Paper Know Your Agent: Reconnaissance-Driven Pentesting of AI AgentsProblem代理暴露的工具和行为信息会帮助攻击者构造更贴合任务的间接注入。Takeaway把工具元数据和错误消息也纳入攻击面分析。 工具与协议身份与权限安全与隔离 92.5
ProblemP1代理暴露的工具和行为信息会帮助攻击者构造更贴合任务的间接注入。E1
└─designD1以结构化目标资料库记录侦察信息,根据战术先决条件选择下一次探测或尝试。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把工具元数据和错误消息也纳入攻击面分析。

Trade-offs

21.9%是该设置总成功率;任务合理性解释属于作者归因,不能从危害分组直接证明模型内部拒绝机制。

Where the evidence stops

21.9%是该设置总成功率;任务合理性解释属于作者归因,不能从危害分组直接证明模型内部拒绝机制。

07.23Engineering How KTern.AI built agentic AI for SAP on Amazon Bedrock AgentCoreProblemSAP转换项目跨会话跨工具,要求项目记忆、客户隔离与过程可观测。Takeaway先设计项目记忆和权限模型,再组合领域代理。 工具与协议身份与权限记忆与上下文 72.5
ProblemP1SAP转换项目跨会话跨工具,要求项目记忆、客户隔离与过程可观测。E1
└─designD1以SAP领域配置组合专向代理,复用AgentCore运行、项目记忆、身份和工具网关。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

先设计项目记忆和权限模型,再组合领域代理。

Trade-offs

部署从周到小时是团队经验,托管服务配置不替代具体SAP权限与数据范围设计。

Where the evidence stops

部署从周到小时是团队经验,托管服务配置不替代具体SAP权限与数据范围设计。

07.23Paper When HTTP 402 Meets the Blockchain: Risks on Emerging x402 PaymentsProblemx402中介在HTTP验证与链上结算之间承担付款授权和费用边界。Takeaway区分证明有效、结算成功、资源放行和赞助费用四个状态。 身份与权限观测与评测安全与隔离 100
ProblemP1x402中介在HTTP验证与链上结算之间承担付款授权和费用边界。E1
└─designD1按八条支付规则发现适用能力,对应核对HTTP验证结果与链上实际收据。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

区分证明有效、结算成功、资源放行和赞助费用四个状态。

Trade-offs

15个服务均违反规则不等于都遭到资产盗取;放行发生在verify还是settle影响危害,统计窗口与实现版本限制适用范围。

Where the evidence stops

15个服务均违反规则不等于都遭到资产盗取;放行发生在verify还是settle影响危害,统计窗口与实现版本限制适用范围。

07.23Paper Twin Agent: Context Residual Compression for Privilege Separated AgentsProblem有权限的代理直接阅读不可信材料容易把注入转成实际操作。Takeaway记录每种实例中真正隔离的输入区域及仍可传递的信息。 身份与权限安全与隔离观测与评测 92.5
ProblemP1有权限的代理直接阅读不可信材料容易把注入转成实际操作。E1
└─designD1Explore读取不可信区域,Safe保留权限和权威轨迹,两者仅传递限长且经过检测的残差信息。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

记录每种实例中真正隔离的输入区域及仍可传递的信息。

Trade-offs

安全依赖短注入难以同时绕过检测器和模型的经验假设,原文明确没有形式化保证;SWE设置只隔离issue而非所有仓库内容。

Where the evidence stops

安全依赖短注入难以同时绕过检测器和模型的经验假设,原文明确没有形式化保证;SWE设置只隔离issue而非所有仓库内容。

07.23Engineering Building Agents that Act on Your Behalf with Toolboxes in FoundryProblem多租户工具调用要传递最终用户身份,避免各代理重复实现凭据交换。Takeaway把身份交换、资源授权与操作确认分别表达。 工具与协议文件与工件身份与权限 72.5
ProblemP1多租户工具调用要传递最终用户身份,避免各代理重复实现凭据交换。E1
└─designD1将OAuth连接配置和版本化toolbox交给平台,代理通过单MCP端点使用用户委托身份。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把身份交换、资源授权与操作确认分别表达。

Trade-offs

示例require_approval为never,OBO身份传递本身不等于逐次用户审批;输入输出护栏不是注入绝对不可能的证明。

Where the evidence stops

示例require_approval为never,OBO身份传递本身不等于逐次用户审批;输入输出护栏不是注入绝对不可能的证明。

07.23Engineering Agents can respond to MCP elicitation requestsProblemMCP调用中可能需要用户提供表单信息或完成站外授权。Takeaway把用户输入作为明确的协议事件并保留请求来源。 工具与协议状态与恢复身份与权限 80
ProblemP1MCP调用中可能需要用户提供表单信息或完成站外授权。E1
└─designD1把MCP表单或URL请求转给用户,接收同意、拒绝或取消,并恢复原调用。E2
ProblemP2休眠后原处理回调不再驻留内存。E2
└─designD2持久保存宣告模式,在onStart重新绑定对应处理函数。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把用户输入作为明确的协议事件并保留请求来源。

Trade-offs

SDK提供转发机制,具体UI仍需实现;URL打开需要用户同意,不能由代理自行代答敏感授权。

Where the evidence stops

SDK提供转发机制,具体UI仍需实现;URL打开需要用户同意,不能由代理自行代答敏感授权。

07.23Engineering Build specialized agent workflows for your business with Amazon Quick and NVIDIA NeMo Agent ToolkitProblem企业聊天入口需要调用有结构的供应链分析流程并返回证据包。Takeaway区分演示数据流和生产必需控制,不把待加控制写成已交付。 状态与恢复工具与协议观测与评测 85
ProblemP1企业聊天入口需要调用有结构的供应链分析流程并返回证据包。E1
└─designD1由Quick经Gateway和Lambda调用NeMo,顺序组织采购、库存、政策与建议函数并返回证据包。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

区分演示数据流和生产必需控制,不把待加控制写成已交付。

Trade-offs

原文明示这是demo,Gateway的AuthorizerType为NONE,自定义header不构成授权;生产身份与写入审批属于建议。

Where the evidence stops

原文明示这是demo,Gateway的AuthorizerType为NONE,自定义header不构成授权;生产身份与写入审批属于建议。

07.23Engineering Agents SDK v0.17.0:后台子 Agent 必须是持久运行实体Problem后台子任务不能依赖发起对话的连接和单个进程存活。Takeaway把任务运行、进度信号和最终副作用分别追踪。 状态与恢复文件与工件身份与权限 92.5
ProblemP1后台子任务不能依赖发起对话的连接和单个进程存活。E1
└─designD1把后台子任务保存为耐久句柄,提供预算、取消和milestone,并统一turn入场路径。E2
ProblemP2嵌套阻塞调用可能造成死锁。E2
└─designD2通过统一runTurn入场路径拒绝嵌套阻塞式请求。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把任务运行、进度信号和最终副作用分别追踪。

Trade-offs

完成通知限定happy path的exactly-once;修补转录不代表撤销外部操作,server actions仍是实验API。

Where the evidence stops

完成通知限定happy path的exactly-once;修补转录不代表撤销外部操作,server actions仍是实验API。

07.23Engineering Secure Agent Workspace:端点只展示,Agent 在受管边界内执行Problem企业长期代理需要统一管理执行环境、身份、出网和工具边界。Takeaway按外部访问、内部执行、凭据和审计分别列出责任方。 身份与权限文件与工件工具与协议 85
ProblemP1企业长期代理需要统一管理执行环境、身份、出网和工具边界。E1
└─designD1把本地端点作为交互层,代理运行于每用户受管VM,并叠加出网、签名策略和凭据代理。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按外部访问、内部执行、凭据和审计分别列出责任方。

Trade-offs

这是参考设计的分阶段要求,不是已有部署的覆盖证明或安全测量;VM隔离与工具授权承担不同职责。

Where the evidence stops

这是参考设计的分阶段要求,不是已有部署的覆盖证明或安全测量;VM隔离与工具授权承担不同职责。

07.23Paper Arca:在等待边界保存“余下程序”,而不是冻结整个进程Problem短任务等待I/O时仍占运行资源,传统进程快照成本妨碍细粒度调度。Takeaway借鉴等待时显式保存续体的边界,而不是直接替换通用运行时。 状态与恢复运行时与调度文件与工件 92.5
ProblemP1短任务等待I/O时仍占运行资源,传统进程快照成本妨碍细粒度调度。E1
└─designD1由内核捕获可序列化continuation,将I/O表述为effect与回调后恢复执行。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

借鉴等待时显式保存续体的边界,而不是直接替换通用运行时。

Trade-offs

研究OS不支持共享内存线程,I/O与计算高度交织和大状态守护进程不适配;不能把微秒数据等同于网络迁移总耗时。

Where the evidence stops

研究OS不支持共享内存线程,I/O与计算高度交织和大状态守护进程不适配;不能把微秒数据等同于网络迁移总耗时。

07.23Paper StriaTrace:常开骨架 trace,异常时才提高细节Problem在线推理尾延迟异常短暂,持续重型profiling会扰动生产。Takeaway先用低成本信号定位异常,再在关键路径收集细节。 文件与工件工具与协议运行时与调度 100
ProblemP1在线推理尾延迟异常短暂,持续重型profiling会扰动生产。E1
└─designD1常态只追踪同步点与关键路径,以token量拟合尾延迟上界,异常时补充细粒度采集。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

先用低成本信号定位异常,再在关键路径收集细节。

Trade-offs

该百分比是追踪开销对比,不是推理总体延迟下降;统计上界和关联诊断不能单独证明故障因果。

Where the evidence stops

该百分比是追踪开销对比,不是推理总体延迟下降;统计上界和关联诊断不能单独证明故障因果。

07.23Engineering AWS Support Companion:每个 Agent 依赖都要有超时、降级与刷新契约Problem支持工程师需要联合文档、工单和服务状态处理故障。Takeaway把可降级上下文和必须成功的授权步骤分开。 工具与协议运行时与调度记忆与上下文 85
ProblemP1支持工程师需要联合文档、工单和服务状态处理故障。E1
└─designD1并行初始化MCP,记忆读取超时后降级,异步保存对话,并在Gateway token过期前刷新。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把可降级上下文和必须成功的授权步骤分开。

Trade-offs

降级会失去上下文,异步保存不保证突然崩溃时不丢记录;内容护栏与IAM权限不是同一种控制。

Where the evidence stops

降级会失去上下文,异步保存不保证突然崩溃时不丢记录;内容护栏与IAM权限不是同一种控制。

07.23Paper Murakkab:让 SLO 成为 Agent 工作流运行时的输入Problem代理工作流逻辑与模型硬件配置绑定,阻碍质量、成本和延迟的跨层选择。Takeaway把任务结构与执行配置分离,同时保留每档质量约束。 状态与恢复运行时与调度文件与工件 92.5
ProblemP1代理工作流逻辑与模型硬件配置绑定,阻碍质量、成本和延迟的跨层选择。E1
└─designD1分离声明式DAG和执行配置,用性能画像选择模型、资源及运行时组合以满足SLO。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把任务结构与执行配置分离,同时保留每档质量约束。

Trade-offs

最高4.3倍节省来自指定配置与SLO组合,放宽准确率会改变收益;代理工作流到达分布是近似而非实际生产trace。

Where the evidence stops

最高4.3倍节省来自指定配置与SLO组合,放宽准确率会改变收益;代理工作流到达分布是近似而非实际生产trace。

07.23Paper libDSE:持久执行可以投机,但外部可见性不能投机Problem分布式持久执行中的同步落盘放大端到端延迟。Takeaway把可回滚的内部状态与不可撤销的外部承诺分开。 状态与恢复文件与工件工具与协议 92.5
ProblemP1分布式持久执行中的同步落盘放大端到端延迟。E1
└─designD1允许DSE参与者内部推测执行,跟踪依赖并恢复状态,外部输出通过持久化Barrier。E2
ProblemP2外部支付等服务无法撤销推测状态。E2
└─designD2在非DSE服务之前调用Barrier,等待所有上游依赖持久化。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把可回滚的内部状态与不可撤销的外部承诺分开。

Trade-offs

所有推测参与者需适配StateObject,失败可能保守回滚更多工作;不可撤销外部接口仍需等待,不能随意推测执行。

Where the evidence stops

所有推测参与者需适配StateObject,失败可能保守回滚更多工作;不可撤销外部接口仍需等待,不能随意推测执行。

07.23Engineering Cloud Run sandboxes:工具执行默认拿不到凭证、网络和持久写权限Problem应用要运行模型生成代码,同时隔离宿主凭据、网络和写入。Takeaway按读取、写入、出网和产物传递分别定义沙箱能力。 身份与权限文件与工件安全与隔离 85
ProblemP1应用要运行模型生成代码,同时隔离宿主凭据、网络和写入。E1
└─designD1在Cloud Run中提供凭据隔离、默认拒绝出网及临时写层,以显式文件交换交付结果。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按读取、写入、出网和产物传递分别定义沙箱能力。

Trade-offs

只读仍能读取容器中可见文件,镜像内敏感文件不应被当成自动隐藏;结束丢弃临时写入不等于撤销已获准外部请求。

Where the evidence stops

只读仍能读取容器中可见文件,镜像内敏感文件不应被当成自动隐藏;结束丢弃临时写入不等于撤销已获准外部请求。

07.23Engineering Web Bot Authentication:共享出口 IP 不能充当 Agent 身份Problem网站需要识别合法机器人操作者,避免把所有AI流量按伪装客户端处理。Takeaway把操作者身份标签作为策略输入,而非操作许可本身。 身份与权限安全与隔离工具与协议 85
ProblemP1网站需要识别合法机器人操作者,避免把所有AI流量按伪装客户端处理。E1
└─designD1从签名目录取得公钥验证HTTP消息,把验证结果和操作者信息标为WAF策略标签。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把操作者身份标签作为策略输入,而非操作许可本身。

Trade-offs

身份签名证明来源不证明任务得到最终用户授权,也不表示可以绕过其他WAF和业务策略。

Where the evidence stops

身份签名证明来源不证明任务得到最终用户授权,也不表示可以绕过其他WAF和业务策略。

07.23Engineering Structured memory filtering with metadata in AgentCore Memory:先确定边界,再做相似度Problem仅语义相似度难以准确检索指定时间、部门或客户范围的记忆。Takeaway已知事实用结构字段传递,不让模型重新猜租户或部门。 记忆与上下文安全与隔离身份与权限 92.5
ProblemP1仅语义相似度难以准确检索指定时间、部门或客户范围的记忆。E1
└─designD1确定性元数据原样传播并隔离提取合并,主题等字段可由模型推断,检索组合结构与语义条件。E2
ProblemP2模型重猜已知部门会造成错误分组和合并。E2
└─designD2将这些键设为STRICTLY_CONSISTENT,按确定性值隔离提取与合并。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

已知事实用结构字段传递,不让模型重新猜租户或部门。

Trade-offs

缺失确定性字段仍会处理,过滤条件与namespace必须由可信应用设置;时间过滤改进没有给出可泛化数值。

Where the evidence stops

缺失确定性字段仍会处理,过滤条件与namespace必须由可信应用设置;时间过滤改进没有给出可泛化数值。

07.23Engineering SeaweedFS:过期客户端不能靠“最后写入者获胜”Problem不同后端缺少统一条件写能力,分布式锁又增加成本。Takeaway把稳态单对象串行化与故障切换一致性分开陈述。 文件与工件 85
ProblemP1不同后端缺少统一条件写能力,分布式锁又增加成本。E1
└─designD1把条件变更路由到对象owner,在本地路径锁内检查前提并应用变更。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把稳态单对象串行化与故障切换一致性分开陈述。

Trade-offs

正文同时声称所有写入归同owner和无条件写不路由锁定,不能据此断言所有混合写入都线性化;成员切换下也未给出fencing证明。

Where the evidence stops

正文同时声称所有写入归同owner和无条件写不路由锁定,不能据此断言所有混合写入都线性化;成员切换下也未给出fencing证明。

07.23Engineering W3C:永久链接应标识资源,临时 URL 只负责传输ProblemWeb代理协议快速增加,身份、描述、发现和交互能力存在重叠及缺口。Takeaway按能力维度比较协议,区分研究提案、已定义字段与尚未完成章节。 文件与工件身份与权限工具与协议 67.5
ProblemP1Web代理协议快速增加,身份、描述、发现和交互能力存在重叠及缺口。E1
└─designD1按统一资源空间与超媒体架构比较代理身份、profile、发现和交互协议。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

按能力维度比较协议,区分研究提案、已定义字段与尚未完成章节。

Trade-offs

政策、认证与总结部分仍有占位文字,不能写成已完成统一安全规范;通用表示也增加转换成本。

Where the evidence stops

政策、认证与总结部分仍有占位文字,不能写成已完成统一安全规范;通用表示也增加转换成本。

07.23Engineering AWS S3:先给每个对象版本一个身份证,再谈缓存Problem存量S3启用版本传播期间的短暂404可能被CDN缓存放大。Takeaway把配置传播、数据可见性和边缘负缓存分别考虑。 文件与工件状态与恢复身份与权限 92.5
ProblemP1存量S3启用版本传播期间的短暂404可能被CDN缓存放大。E1
└─designD1存量桶先进入Suspended并等待传播,观察版本头后再转Enabled,降低CDN负缓存风险。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

把配置传播、数据可见性和边缘负缓存分别考虑。

Trade-offs

原文说明没有直接确认全局传播完成的API;单对象版本头是操作信号,不是全局证明,版本存储还需生命周期控制。

Where the evidence stops

原文说明没有直接确认全局传播完成的API;单对象版本头是操作信号,不是全局证明,版本存储还需生命周期控制。

07.23Engineering APNIC:用通知减少延迟,用对账保证最终正确Problem数据副本规模增长时,全量传输和高频轮询会放大成本。Takeaway先确定数据权威、变化粒度与允许陈旧时间,再选同步机制。 文件与工件状态与恢复观测与评测 92.5
ProblemP1数据副本规模增长时,全量传输和高频轮询会放大成本。E1
└─designD1按权威关系和变化粒度选择块差分、快照增量或Merkle对账,并比较推拉及混合同步。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

先确定数据权威、变化粒度与允许陈旧时间,再选同步机制。

Trade-offs

定位差异的树形效率不等于传输任意变化量都为对数;多写者还涉及冲突和权威来源。

Where the evidence stops

定位差异的树形效率不等于传输任意变化量都为对数;多写者还涉及冲突和权威来源。

07.23Engineering AG-UI:事件流是失效通知,不是文件内容真相源Problem不同代理框架的流式输出使前端反复适配,工具执行还要与用户交互同步。Takeaway让协议承担事件与状态传递,业务层承担授权和内容校验。 文件与工件工具与协议状态与恢复 75
ProblemP1不同代理框架的流式输出使前端反复适配,工具执行还要与用户交互同步。E1
└─designD1用AG-UI统一事件和状态传输,由前端注册组件,并以工具结果恢复用户交互。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

让协议承担事件与状态传递,业务层承担授权和内容校验。

Trade-offs

样例是受控组件而非任意生成代码;UI回传和状态流并不替代后端权限或并发冲突解决。

Where the evidence stops

样例是受控组件而非任意生成代码;UI回传和状态流并不替代后端权限或并发冲突解决。

07.23Paper RECEIPT:不要相信 Agent 的“我完成了”Problem白盒安全代理可能利用探索权限制造浏览器执行信号而没有真实攻击路径。Takeaway证据有效性同时依赖执行信号、角色与环境边界。 文件与工件观测与评测安全与隔离 100
ProblemP1白盒安全代理可能利用探索权限制造浏览器执行信号而没有真实攻击路径。E1
└─designD1将探索与干净验证环境分离,限定攻击者和受害者接口,并把浏览器信号绑定到裁决。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

证据有效性同时依赖执行信号、角色与环境边界。

Trade-offs

角色定义与初始快照错误仍可能产生假阳性,当前仅一种模型配置和Chromium;部署WAF影响单独判断。

Where the evidence stops

角色定义与初始快照错误仍可能产生假阳性,当前仅一种模型配置和Chromium;部署WAF影响单独判断。

07.23Engineering OBO:让工具知道“谁委托谁做了什么”Problem多租户代理调用下游API时需要保持用户主体和实际权限。Takeaway审查交换后令牌实际含义及资源端判定,不能只看OBO标签。 身份与权限工具与协议运行时与调度 92.5
ProblemP1多租户代理调用下游API时需要保持用户主体和实际权限。E1
└─designD1以OBO交换保留用户身份,由资源服务验证有效权限声明,并按tenant与sub限定数据范围。E2
ProblemP2交换后的scope可能未按用户角色裁剪。E2
└─designD2文中Okta方案在令牌加入authorized_scopes,由资源服务据此判定写权限。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

审查交换后令牌实际含义及资源端判定,不能只看OBO标签。

Trade-offs

该scope行为是文中Okta配置条件,不能外推所有OAuth服务;传播身份后仍由资源服务实施授权。

Where the evidence stops

该scope行为是文中Okta配置条件,不能外推所有OAuth服务;传播身份后仍由资源服务实施授权。

07.23Engineering WAF + PrivateLink:安全入口不能留下可绕过的第二扇门Problem给AgentCore加WAF入口后,公开直连端点可能绕过检查。Takeaway入口控制要覆盖所有可达路径,并把例外条件写清。 安全与隔离运行时与调度工具与协议 92.5
ProblemP1给AgentCore加WAF入口后,公开直连端点可能绕过检查。E1
└─designD1用WAF、ALB和PrivateLink建立入口,再用资源策略拒绝绕开指定端点的直接请求。E2
ProblemP2有效凭据仍可直接访问公网端点绕过WAF。E2
└─designD2用SourceVpce条件和显式Deny封闭直连,同时保留列明的服务调用例外。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

入口控制要覆盖所有可达路径,并把例外条件写清。

Trade-offs

策略保留ViaAWSService例外,端点IP重建可变化;50–200毫秒是文中Lambda额外延迟范围,网络WAF不检验代理语义正确。

Where the evidence stops

策略保留ViaAWSService例外,端点IP重建可变化;50–200毫秒是文中Lambda额外延迟范围,网络WAF不检验代理语义正确。

07.23Engineering Microsoft Foundry:工具目录和执行目录要分开Problem平台把工具发现、运行调度、配置优化和记忆生命周期整合到托管代理。Takeaway拆分各功能的交付状态与责任,避免把路线图合成现有能力。 工具与协议记忆与上下文运行时与调度 75
ProblemP1平台把工具发现、运行调度、配置优化和记忆生命周期整合到托管代理。E1
└─designD1以Tool Search按需发现工具,用Routines管理运行,并提供配置优化与记忆TTL等独立能力。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

拆分各功能的交付状态与责任,避免把路线图合成现有能力。

Trade-offs

Optimizer文中为私有预览,预期公测不是已发布事实;TTL字段及默认值有版本特例,榜单复合分数不等于全场景可靠。

Where the evidence stops

Optimizer文中为私有预览,预期公测不是已发布事实;TTL字段及默认值有版本特例,榜单复合分数不等于全场景可靠。

07.23Engineering Google Cloud:先定义数据驻留和容量,再选运行时Problem企业调用Claude需要同时考虑容量、地域、访问控制与应用运行。Takeaway分别选择模型入口、数据地域和代理执行环境。 运行时与调度观测与评测状态与恢复 72.5
ProblemP1企业调用Claude需要同时考虑容量、地域、访问控制与应用运行。E1
└─designD1分别选择global、regional或multi-region端点、推理容量及代理运行环境,接入IAM与网络控制。E2
Problem value
Method
Evidence fit
Transfer
core claim supportednoveltyread the sourcescopesourcewindow

How to use

分别选择模型入口、数据地域和代理执行环境。

Trade-offs

缓存最高节省针对可复用前缀而非所有请求;全球路由与地域约束需要选择,平台合规不自动覆盖整个应用。

Where the evidence stops

缓存最高节省针对可复用前缀而非所有请求;全球路由与地域约束需要选择,平台合规不自动覆盖整个应用。

Nothing matches. Press Esc to clear.