论文精选

01

CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents

CodeRescue 在廉价重试与强模型升级之间校准恢复成本

CodeRescue 处理编码 Agent 失败后的预算决策:继续让廉价模型利用执行反馈恢复,还是升级到更强模型。方法从执行 rollout 训练监督路由器,再用 Conformal Risk Control 在部署时选择成本惩罚,无需重新训练。五个编码基准显示两类恢复动作具有互补成功模式;在 GPT-5.4-nano/GPT-5.4 设置中,一个校准点以始终升级方案 35% 的平均恢复成本取得更高解决率。

关注点它把失败恢复从固定级联改造成可按预算校准的路由问题,可直接影响 Coding Agent 的模型组合、重试策略和单位解决成本。

02

AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters

AdaFlash 自适应扩散草稿提升大模型推理吞吐

AdaFlash 研究扩散草稿模型用于推测解码时的核心不稳定性:双向注意力虽然支持并行生成,却会造成跨领域接受率波动和不同 token 位置的质量差异。方法用反向 KL 的在线策略蒸馏降低领域级方差,再用自适应长度头动态决定候选序列长度,减少目标模型的验证开销。实验显示其部署吞吐持续优于既有方法,高并发场景最高提升约 66%。

关注点它把草稿长度从固定超参数改为按请求动态决策,为高并发 LLM 服务优化提供了更细粒度的成本控制点。

03

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

AgentDebugX 打通 Agent 故障检测、归因、恢复与重跑

AgentDebugX 将调试组织为检测、归因、恢复和重跑的闭环,重点解决故障暴露步骤与根因步骤不一致的问题。其 DeepDebug 结合全局轨迹理解、结构化调查和交叉质询定位根因,在测试的开放权重模型上将严格的 Agent 与步骤联合归因准确率提升至 28.8%。在 GAIA 上,它单次重跑修复了 73 个失败任务中的 13 个,使总体准确率从 55.8% 提升到 63.6%。

关注点它把追踪日志从被动回放升级为可执行的根因诊断与恢复机制,适合构建生产 Agent 的故障回归库和自动恢复管线。

04

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro 用编码模型自身表征裁剪工具输出

SWE-Pruner Pro 发现编码模型读取工具结果时,其内部表征已经包含逐行相关性信号,因此无需额外代码分类器即可完成上下文裁剪。一个轻量预测头直接为工具输出的每一行生成保留或删除标签,并结合长度感知嵌入处理不同规模的结果。在两个开放权重骨干和四个多轮基准上,它最多节省 39% 的提示与生成 token,同时保持任务质量;部分设置下 SWE-bench Verified 解决率提升 3.8 个百分点,Oolong 准确率提升 2.2 个百分点。

关注点方法把上下文管理内化到编码 Agent,可减少长任务中的 token 与延迟开销,也避免维护独立裁剪模型。

05

TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory Minimization

TRIM 通过压缩执行轨迹减少 AI 生成代码冗余

论文把编码 Agent 在反复试错中遗留的无效编辑定义为 CodeSlop,并指出冗余会随代码库长期演化不断累积。TRIM 不直接枚举冗余,而是利用完整执行轨迹识别并最小化最终补丁。实验中 CodeSlop 减少 17.9%–32.9%,任务性能几乎不受影响,验证成本约为 Delta Debugging 等基线的一半。

关注点这为编码 Agent 的交付流程增加了一个可量化的补丁瘦身阶段,有助于控制自动生成代码带来的长期维护成本。

06

Early Adoption of Agentic Coding Tools by GitHub Projects

2.5 万个 Agent PR 显示开源采用仍集中在少数贡献者

研究分析 2,361 个热门 GitHub 仓库中的 25,264 个 Agent PR,观察真实项目如何采用和监督 Coding Agent。每个仓库三个月内的 Agent PR 中位数仅为 1–2 个,超过三分之二由单人完成审查和修改,与“团队已全面自动化”的叙事存在明显距离。

关注点真实项目数据能校正仅凭工具注册量或厂商案例推断采用深度的偏差,也凸显单人监督的治理风险。

07

ProMCP 拆开 MCP Agent 的 Token 流与延迟成本

ProMCP 将 MCP Agent 的运行分成六个阶段,剖析 20 个 server、169 个工具和多种客户端拓扑。自定义客户端有 56%–72% 的 token 与 60%–67% 的延迟落在规划和 schema;现成客户端则有 85% 以上延迟发生在最终生成阶段。

关注点结果说明工具执行本身常不是主要瓶颈,性能优化应先依据阶段级剖析定位 schema、规划或生成开销。

08

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore 将仓库理解从端到端成功率中单独拆出

SWE-Explore 在 203 个仓库、10 种语言和 848 个 issue 上,要求 Agent 在固定行预算内排序相关代码区域。Agentic explorer 明显优于传统检索,行级覆盖率与排序效率最能区分先进方法,说明定位和上下文选择值得独立评测。

关注点它让团队可以诊断失败究竟来自仓库探索、推理还是补丁生成,而不是只看到一个端到端分数。

09

RepoZero: Can LLMs Generate a Code Repository from Scratch?

RepoZero 评测从零生成完整代码仓库的真实差距

RepoZero 不再只评估局部 issue 修复,而要求模型从需求开始生成完整仓库,并通过迭代测试生成和错误驱动细化实现自验证。最强模型与 Agent 组合的通过率约为 30%–55%,表明局部补丁能力不能直接外推到端到端软件构建。

关注点它扩展了 Coding Agent 的任务边界,也为比较规划、架构、实现与自验证的组合能力提供了统一基准。

10

Coding Agent 的 Token 成本为何高且难以提前预测

研究分析八个模型在 SWE-bench Verified 上的执行轨迹与自我成本预测。Agent 任务消耗的 token 约为代码问答的 1,000 倍,同一任务不同运行之间最多相差 30 倍;表现最好的成本预测相关系数也只有 0.39。

关注点这些数据说明按任务做容量规划和预算控制不能只依赖平均 token 价格,还需要运行级上限与持续观测。

11

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

SlopCodeBench 揭示 Coding Agent 在连续迭代中的结构退化

SlopCodeBench 让 Agent 在 20 个问题和 93 个检查点上反复扩展自己的实现,以测试连续需求变化下的结构质量。没有一条轨迹端到端完成;80% 的轨迹结构侵蚀上升,89.8% 的冗余上升,代码约为人类开源实现的 2.2 倍冗长。

关注点它把一次通过测试之外的可扩展性和长期结构质量纳入评测,直接对应自动生成代码的维护成本。

12

Engineering Pitfalls in AI Coding Tools: An Empirical Study of Bugs in Claude Code, Codex, and Gemini CLI

Claude Code、Codex 与 Gemini CLI 的常见工程缺陷

研究对三个主流 AI 编码 CLI 的 3,800 多个公开 issue 进行人工开放编码,分析工具本身而非生成代码的故障。36.9% 的根因来自 API、集成或配置,37.2% 影响工具调用,24.7% 影响命令执行,显示外围工程是 Agent 可靠性的主要组成。

关注点这份缺陷分类可用于设计 Coding Agent 的回归测试和可观测性,避免把运行时错误误判成模型推理失败。

13

Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?

AGENTS.md 不总能提高成功率,冗余上下文反而增加成本

研究在 SWE-bench Lite 的 300 个任务和 CTXbench 的 138 个任务上,对多种 Agent 与模型进行对照。LLM 生成的仓库上下文文件没有显著提升准确率,却增加 20%–23% 成本;只有原始文档缺失时,平均收益约为 2.7%。

关注点结果为上下文文件划出实证边界:内容应短、去冗余,并优先补充仓库里不存在的信息。

14

Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents

Agent 临时生成测试,未必能提高仓库级修复成功率

研究分析六个模型的执行轨迹,并对四类 Agent 进行提示干预,以检验临时生成测试的实际作用。大量所谓测试只是输出结果的 print;改变写测试的频率后,83.2% 的任务结果没有变化,说明观察性反馈不能等同于正式断言。

关注点它挑战了“Agent 写了测试就更可靠”的直觉,促使评测区分可验证断言、调试输出和真正的回归保护。

15

Are Coding Agents Generating Over-Mocked Tests? An Empirical Study

真实提交数据显示 Coding Agent 更容易生成过度 Mock 的测试

研究分析 2,168 个仓库的 120 万次提交,其中包含 48,563 次 Agent 提交。Agent 提交中有 23% 修改测试、36% 添加 mock;非 Agent 提交分别为 13% 和 26%,显示更多测试活动并不必然带来更真实的行为覆盖。

关注点这组仓库级数据补足 benchmark 轨迹研究,提示代码审查应单独检查 mock 边界与真实依赖覆盖。

16

SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering

SWE-agent 说明专用计算机接口会直接改变软件工程能力

SWE-agent 为仓库导航、编辑和测试执行设计适合语言模型的 Agent-Computer Interface,并在 SWE-bench 与 HumanEvalFix 上比较。其当时分别达到 12.5% 和 87.7% pass@1;长期价值不在旧分数,而在证明工具接口与 Harness 必须和模型一起受控比较。

关注点这项早期工作奠定了当前 Coding Agent 的接口设计思路,也解释了为什么只比较基础模型会得出不完整结论。