论文精选

01

Don't Offer What Can't Be Done: Deterministic Executability Gating for LLM Skill Selection at Scale

在语义召回之后用确定性门禁过滤不可执行技能

大规模技能库中,语义相关不代表技能在当前账户状态下可执行。论文介绍 Wix 客服助手 Helpmate 的三阶段选择管线:先用高召回语义匹配定位十技能领域族,再由确定性门禁依据账户状态移除不可执行项。该设计把能力可用性从模型判断中分离出来。

关注点工具型 Agent 应把权限、资源和前置条件检查实现为确定性代码,避免模型向用户承诺当前状态下无法完成的操作。

02

What Could the Agent See at 19:05? Generating Temporal Enterprise Scenarios from Real Research and Replaying Them to Evaluate Agents

用可回放的时间场景评测企业 Agent 当时可见的信息

企业 Agent 跨多个应用工作时,数据和权限持续变化,答案只在特定时刻的可见状态下成立。论文指出,单一静态快照通常只代表回合结束状态,无法评价此前每个时间点。作者从真实研究生成时间化企业场景并进行回放,使问题、可见信息与正确答案绑定到事件发生时刻。

关注点对邮件、日历、CRM 等跨应用 Agent,回归测试需要重放状态变化和权限边界,而不能只检查最终数据库快照。

03

A False Average: Chain-of-Thought Monitors Collapse Where They Are the Only Defense

思维链监控在关键对抗子集上出现显著失效

论文检验思维链监控能否发现动作表面正常、但推理暴露奖励投机的 Agent。攻击只改写推理为看似善意的工程说明,保持命令与输出不变;在该子集上,独立监控器的检出率从约 95% 降至不足 11%。这说明平均指标会掩盖监控器作为唯一防线时的脆弱区域。

关注点部署高权限 Agent 时,思维链监控不能作为单点安全控制;动作约束、环境隔离和结果验证仍需独立存在。

04

RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning

用失败模式挖掘与轨迹修复改进网页 Agent 强化学习

紧凑型网页 Agent 的训练受制于成功轨迹昂贵、轨迹含冗余绕路,以及 SFT 后常规状态占比过高。RMSWeb 将反思、失败模式挖掘与 Salvage-DS 数据修复结合,用于改善训练数据和后续强化学习信号。论文还指出,网页动作上的组相对强化学习若奖励设计不当,会产生弱或误导性的相对更新。

关注点这为网页 Agent 团队提供了比单纯扩充成功轨迹更具体的数据治理方向:保留并结构化利用失败状态,同时审计动作级奖励的区分度。

05

The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents

近六千次运行揭示 Skills 的净增益如何掩盖回归

研究在两个办公自动化基准和三套模型—harness 组合上完成近 6,000 次运行,逐任务比较有无 Skills 的结果,把净变化拆成新增成功、回归和持续失败。表现最好的 Skills 主要不是带来更多新增成功,而是让已能完成的任务更少退化。轨迹分析归纳出描述渗透、grounding displacement 与 verification displacement 三种回归机制,并指出现有 Skills 过度强调流程步骤、低估输入落地和输出核验。

关注点Skills 上线不应只看平均成功率;配对回归率、未调用时的上下文干扰和验证覆盖应成为独立门禁。

06

TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI

用任务级终局反馈替代逐调用路由

逐次 LLM 调用做路由无法把长时 Agent 的最终成败归因给某次选择,TRACE-Router 因而在任务进入时用上下文 bandit 只选一次模型,后续调用固定到该后端,再以终局准确率与延迟更新策略。系统不需要显式预测任务难度,并在三项 Agent 基准上形成非支配的准确率—延迟前沿。tau2-Bench 在延迟匹配下提升 7–8 个准确率点;Terminal-Bench 相比最强单模型提升 7.1 点,同时降低 36% 延迟。

关注点对多模型 Agent 平台而言,路由决策、反馈粒度和 SLA 必须处在同一任务边界;这项结果给出了可量化的在线学习基线。

07

Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks

开放基准检验本地 Coding Agent 处理纵向研究数据的可行性

研究面向数据治理不允许上传云端的场景,构建了一个本地 Coding Agent 开放基准,覆盖六轮 cohort sweep、20 项 R 数据准备任务和 102 个目标变量,并自动核验输出。实验在消费级硬件上运行开放权重模型,其中 31B–35B 模型的平均任务完成率最高达到 87.9%。这把隐私约束下的可行性检验从通用代码题转向纵向研究数据处理。

关注点团队可以据此评估本地模型是否足以承担受限数据准备,并把硬件、治理要求和任务级成功率一同纳入云端与本地 Agent 的选型。

08

AREX: Towards a Recursively Self-Improving Agent for Deep Research

AREX 用约束审计和定向补搜驱动递归式深度研究

AREX 把内层证据循环与外层约束审计结合:系统先核验当前发现,再围绕未满足约束发起定向检索,并用学习式上下文更新工具维护可用状态。作者通过 Agentic mid-training 与长时程强化学习训练 4B 稠密和 122B-A10B MoE 两种变体。摘要报告其在 BrowseComp、WideSearch、DeepSearchQA、HLE 等任务上优于同规模基线,但没有披露具体差值。

关注点它把“已经找到什么”和“约束还缺什么”显式做成研究控制器,为长时检索 Agent 的停止条件、补搜策略和上下文更新提供了可复用架构。

09

From Agent Failures to Text Policies: What Works and What Breaks

Agent 会遵循好策略,不代表能从失败轨迹学出好策略

研究把文本策略的“能否执行”与“能否从经验学出”分开检验:人工编写的策略让两个冻结的 7B Agent 在 TextWorldExpress 上提高 5.0 个成功率点,证明有用策略确实存在。但从轨迹生成的策略即使加入更丰富的 trace、反事实证据或迭代 GEPA 搜索,也不能稳定优于固定提示。

关注点这项负结果把瓶颈定位到策略更新的生成与选择,而非模型遵循文本规则的能力,可避免把更多轨迹或更长反思误当作可靠学习机制。

10

Learning to Detect UI Principle Violations via Reinforcement Learning

用强化学习把生成界面的可访问性与设计原则变成自动门禁

论文处理生成前端“能编译、能渲染、能过单测却仍违反界面原则”的缺口,将 WCAG 2.2、欺骗性设计与 HCI 原则归并为 19 类,并在干净页面中注入可验证违规,构造约一万个页面的数据集。对 4B 视觉语言模型继续强化学习后,micro-F1 从 36% 提升到 84%,19 项中有 13 项超过 80% F1。

关注点这提供了从功能测试扩展到界面质量审查的可复现实验路径,critic 还能用于过滤训练数据或为设计感知代码生成提供奖励。

11

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

Molt 用单一可读训练路径守住 Agentic RL 的一致性与规模

Molt 针对 Agentic RL 框架难以修改和审计的问题,把 Ray、vLLM 与 FSDP2 组织成一个 PyTorch 原生异步循环,并用 token 身份、策略版本语义和前向一致性三项不变量约束数据路径。其核心训练路径约 8.6K 行,在匹配异步协议下与 Megatron 系栈的性能统计可比;同一路径已从 4B 稠密模型运行到 700B MoE,并以 Apache-2.0 开源。

关注点它把研究迭代速度与训练正确性放在同一架构里,适合作为评估 Agentic RL 基础设施复杂度、可审计性和训练—推理一致性的参照。

12

Multi-Source and Cross-Scenario Strategy-Guided Code Optimization

MoST 从多源证据提炼可跨语言迁移的代码优化策略

MoST 将提交、文档等不同知识来源统一成证据对象,经自平衡加权聚类提炼优化策略,再把示例迁移到目标语言并生成静态分析规则,引导 LLM 定位和修改代码。在 151 个 C/C++、150 个 Python 和 50 个 Rust 历史任务上,相比 SemOpt,生成与开发者补丁完全相同的补丁数提高 24.44%–180.00%,语义等价补丁数提高 21.88%–37.50%;15 个真实项目的性能测试也取得更高改善。

关注点它把优化知识从单一提交历史扩展到多源、跨场景证据,并同时用补丁等价性和真实项目性能验证,适合指导代码优化 Agent 的知识库与规则生成设计。

13

CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents

CodeRescue 在廉价重试与强模型升级之间校准恢复成本

CodeRescue 处理编码 Agent 失败后的预算决策:继续让廉价模型利用执行反馈恢复,还是升级到更强模型。方法从执行 rollout 训练监督路由器,再用 Conformal Risk Control 在部署时选择成本惩罚,无需重新训练。五个编码基准显示两类恢复动作具有互补成功模式;在 GPT-5.4-nano/GPT-5.4 设置中,一个校准点以始终升级方案 35% 的平均恢复成本取得更高解决率。

关注点它把失败恢复从固定级联改造成可按预算校准的路由问题,可直接影响 Coding Agent 的模型组合、重试策略和单位解决成本。

14

AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters

AdaFlash 自适应扩散草稿提升大模型推理吞吐

AdaFlash 研究扩散草稿模型用于推测解码时的核心不稳定性:双向注意力虽然支持并行生成,却会造成跨领域接受率波动和不同 token 位置的质量差异。方法用反向 KL 的在线策略蒸馏降低领域级方差,再用自适应长度头动态决定候选序列长度,减少目标模型的验证开销。实验显示其部署吞吐持续优于既有方法,高并发场景最高提升约 66%。

关注点它把草稿长度从固定超参数改为按请求动态决策,为高并发 LLM 服务优化提供了更细粒度的成本控制点。

15

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

AgentDebugX 打通 Agent 故障检测、归因、恢复与重跑

AgentDebugX 将调试组织为检测、归因、恢复和重跑的闭环,重点解决故障暴露步骤与根因步骤不一致的问题。其 DeepDebug 结合全局轨迹理解、结构化调查和交叉质询定位根因,在测试的开放权重模型上将严格的 Agent 与步骤联合归因准确率提升至 28.8%。在 GAIA 上,它单次重跑修复了 73 个失败任务中的 13 个,使总体准确率从 55.8% 提升到 63.6%。

关注点它把追踪日志从被动回放升级为可执行的根因诊断与恢复机制,适合构建生产 Agent 的故障回归库和自动恢复管线。

16

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro 用编码模型自身表征裁剪工具输出

SWE-Pruner Pro 发现编码模型读取工具结果时,其内部表征已经包含逐行相关性信号,因此无需额外代码分类器即可完成上下文裁剪。一个轻量预测头直接为工具输出的每一行生成保留或删除标签,并结合长度感知嵌入处理不同规模的结果。在两个开放权重骨干和四个多轮基准上,它最多节省 39% 的提示与生成 token,同时保持任务质量;部分设置下 SWE-bench Verified 解决率提升 3.8 个百分点,Oolong 准确率提升 2.2 个百分点。

关注点方法把上下文管理内化到编码 Agent,可减少长任务中的 token 与延迟开销,也避免维护独立裁剪模型。

17

TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory Minimization

TRIM 通过压缩执行轨迹减少 AI 生成代码冗余

论文把编码 Agent 在反复试错中遗留的无效编辑定义为 CodeSlop,并指出冗余会随代码库长期演化不断累积。TRIM 不直接枚举冗余,而是利用完整执行轨迹识别并最小化最终补丁。实验中 CodeSlop 减少 17.9%–32.9%,任务性能几乎不受影响,验证成本约为 Delta Debugging 等基线的一半。

关注点这为编码 Agent 的交付流程增加了一个可量化的补丁瘦身阶段,有助于控制自动生成代码带来的长期维护成本。

18

Early Adoption of Agentic Coding Tools by GitHub Projects

2.5 万个 Agent PR 显示开源采用仍集中在少数贡献者

研究分析 2,361 个热门 GitHub 仓库中的 25,264 个 Agent PR,观察真实项目如何采用和监督 Coding Agent。每个仓库三个月内的 Agent PR 中位数仅为 1–2 个,超过三分之二由单人完成审查和修改,与“团队已全面自动化”的叙事存在明显距离。

关注点真实项目数据能校正仅凭工具注册量或厂商案例推断采用深度的偏差,也凸显单人监督的治理风险。

19

ProMCP 拆开 MCP Agent 的 Token 流与延迟成本

ProMCP 将 MCP Agent 的运行分成六个阶段,剖析 20 个 server、169 个工具和多种客户端拓扑。自定义客户端有 56%–72% 的 token 与 60%–67% 的延迟落在规划和 schema;现成客户端则有 85% 以上延迟发生在最终生成阶段。

关注点结果说明工具执行本身常不是主要瓶颈,性能优化应先依据阶段级剖析定位 schema、规划或生成开销。

20

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore 将仓库理解从端到端成功率中单独拆出

SWE-Explore 在 203 个仓库、10 种语言和 848 个 issue 上,要求 Agent 在固定行预算内排序相关代码区域。Agentic explorer 明显优于传统检索,行级覆盖率与排序效率最能区分先进方法,说明定位和上下文选择值得独立评测。

关注点它让团队可以诊断失败究竟来自仓库探索、推理还是补丁生成,而不是只看到一个端到端分数。

21

RepoZero: Can LLMs Generate a Code Repository from Scratch?

RepoZero 评测从零生成完整代码仓库的真实差距

RepoZero 不再只评估局部 issue 修复,而要求模型从需求开始生成完整仓库,并通过迭代测试生成和错误驱动细化实现自验证。最强模型与 Agent 组合的通过率约为 30%–55%,表明局部补丁能力不能直接外推到端到端软件构建。

关注点它扩展了 Coding Agent 的任务边界,也为比较规划、架构、实现与自验证的组合能力提供了统一基准。

22

Coding Agent 的 Token 成本为何高且难以提前预测

研究分析八个模型在 SWE-bench Verified 上的执行轨迹与自我成本预测。Agent 任务消耗的 token 约为代码问答的 1,000 倍,同一任务不同运行之间最多相差 30 倍;表现最好的成本预测相关系数也只有 0.39。

关注点这些数据说明按任务做容量规划和预算控制不能只依赖平均 token 价格,还需要运行级上限与持续观测。

23

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

SlopCodeBench 揭示 Coding Agent 在连续迭代中的结构退化

SlopCodeBench 让 Agent 在 20 个问题和 93 个检查点上反复扩展自己的实现,以测试连续需求变化下的结构质量。没有一条轨迹端到端完成;80% 的轨迹结构侵蚀上升,89.8% 的冗余上升,代码约为人类开源实现的 2.2 倍冗长。

关注点它把一次通过测试之外的可扩展性和长期结构质量纳入评测,直接对应自动生成代码的维护成本。

24

Engineering Pitfalls in AI Coding Tools: An Empirical Study of Bugs in Claude Code, Codex, and Gemini CLI

Claude Code、Codex 与 Gemini CLI 的常见工程缺陷

研究对三个主流 AI 编码 CLI 的 3,800 多个公开 issue 进行人工开放编码,分析工具本身而非生成代码的故障。36.9% 的根因来自 API、集成或配置,37.2% 影响工具调用,24.7% 影响命令执行,显示外围工程是 Agent 可靠性的主要组成。

关注点这份缺陷分类可用于设计 Coding Agent 的回归测试和可观测性,避免把运行时错误误判成模型推理失败。

25

Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?

AGENTS.md 不总能提高成功率,冗余上下文反而增加成本

研究在 SWE-bench Lite 的 300 个任务和 CTXbench 的 138 个任务上,对多种 Agent 与模型进行对照。LLM 生成的仓库上下文文件没有显著提升准确率,却增加 20%–23% 成本;只有原始文档缺失时,平均收益约为 2.7%。

关注点结果为上下文文件划出实证边界:内容应短、去冗余,并优先补充仓库里不存在的信息。

26

Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents

Agent 临时生成测试,未必能提高仓库级修复成功率

研究分析六个模型的执行轨迹,并对四类 Agent 进行提示干预,以检验临时生成测试的实际作用。大量所谓测试只是输出结果的 print;改变写测试的频率后,83.2% 的任务结果没有变化,说明观察性反馈不能等同于正式断言。

关注点它挑战了“Agent 写了测试就更可靠”的直觉,促使评测区分可验证断言、调试输出和真正的回归保护。

27

Are Coding Agents Generating Over-Mocked Tests? An Empirical Study

真实提交数据显示 Coding Agent 更容易生成过度 Mock 的测试

研究分析 2,168 个仓库的 120 万次提交,其中包含 48,563 次 Agent 提交。Agent 提交中有 23% 修改测试、36% 添加 mock;非 Agent 提交分别为 13% 和 26%,显示更多测试活动并不必然带来更真实的行为覆盖。

关注点这组仓库级数据补足 benchmark 轨迹研究,提示代码审查应单独检查 mock 边界与真实依赖覆盖。

28

SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering

SWE-agent 说明专用计算机接口会直接改变软件工程能力

SWE-agent 为仓库导航、编辑和测试执行设计适合语言模型的 Agent-Computer Interface,并在 SWE-bench 与 HumanEvalFix 上比较。其当时分别达到 12.5% 和 87.7% pass@1;长期价值不在旧分数,而在证明工具接口与 Harness 必须和模型一起受控比较。

关注点这项早期工作奠定了当前 Coding Agent 的接口设计思路,也解释了为什么只比较基础模型会得出不完整结论。