AI Engineering Daily

01

16 个 Agent 的小型业务复盘:关键规则最终都移出了提示词

作者用约 16 个 Claude 与 Codex Agent 处理获客、CRM、内容和会议准备,报告 214 封冷邮件获得 3.3% 回复率,并独立找到一个试点客户。主要故障是文案 Agent 虚构产品能力;仅写入提示的禁令无法根除问题,后来增加独立 QA Agent,按允许声明清单拒绝草稿。禁止联系名单等不可妥协规则进一步下沉到 API 层,由发送端点直接拒绝。

关注点这份小样本生产复盘提供了从提示约束迁移到声明核验和代码门禁的具体路径,也提醒团队把 Agent 的价值与真实漏斗结果和拒绝记录连接起来。

02

选 Copilot 还是原始 API,关键在于团队要负责哪一层

GitHub 将 Copilot 与原始模型 API 的差异拆成工作流责任:模型调用之外,还包括上下文选择、工具、重试、日志、安全、仓库指令、组织策略与从 Issue 到已审查 PR 的交付路径。其受控评测固定模型、任务、上下文、推理强度、工具和 MCP 服务,在五个基准上比较 Harness;GitHub 称 Copilot CLI 在多数配置中以更少 token 达到任务解决率持平。BYOK 则保留 Copilot 的 Harness 和集成,由外部提供商承担模型账单。

关注点团队可以据此把“模型单价”改写为“完成任务所需的系统所有权与总成本”,更清楚地判断购买工具、嵌入 SDK 或自建 Agent 平台。

03

Claude Code 2.1.217 收紧工作区隔离与子 Agent 资源边界

Claude Code v2.1.217 修复后台会话未规范化符号链接工作目录的问题,避免会话越出预期工作区;同时为 CLAUDE.md 或 SKILL.md 路径的 brace expansion 加入预算上限,防止启动时 OOM 或卡死。版本默认最多并发 20 个子 Agent,默认禁止子 Agent 再嵌套派生,并让 --max-budget-usd 在达到上限后拒绝新任务并停止正在运行的后台 Agent。更新还修复截断 MCP 输出长期占用完整结果内存、企业 TLS/OAuth/代理设置失效等问题。

关注点这组改动把工作区、内存、并发、嵌套和费用从提示约定变成运行时强制边界,适合用作多 Agent 执行环境的控制项清单。

04

CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents

CodeRescue 在廉价重试与强模型升级之间校准恢复成本

CodeRescue 处理编码 Agent 失败后的预算决策:继续让廉价模型利用执行反馈恢复,还是升级到更强模型。方法从执行 rollout 训练监督路由器,再用 Conformal Risk Control 在部署时选择成本惩罚,无需重新训练。五个编码基准显示两类恢复动作具有互补成功模式;在 GPT-5.4-nano/GPT-5.4 设置中,一个校准点以始终升级方案 35% 的平均恢复成本取得更高解决率。

关注点它把失败恢复从固定级联改造成可按预算校准的路由问题,可直接影响 Coding Agent 的模型组合、重试策略和单位解决成本。

05

GitHub 用采用阶段而非活跃人数衡量 Copilot 影响

GitHub 新增 Copilot usage metrics impact dashboard,把用户分成被动、代码优先、Agent 优先以及多 Agent 或 Copilot App 四类。每类展示月均合并 PR、合并速度中位数、用户占比与人均每日代码行数,并提供六个月的群体变化和 PR 吞吐趋势。分类沿用 usage metrics API 的 ai_adoption_phase,依据滚动 28 天产品使用行为生成。

关注点它提供了一套从席位活跃度走向采用深度与交付结果的度量框架,但团队仍应结合质量、返工和业务结果避免把代码行数单独当作生产力。

06

1192 次对话显示:文档搜索是产品 Agent 的核心工具

kapa.ai 检查了内嵌产品 Agent 的 1192 次对话:它有约 30 个原生工具和一个知识库搜索工具,后者调用量几乎等于其他工具总和。32.1% 的对话里,文档用于回答原生工具未覆盖的产品问题;约 7% 的对话同时调用原生工具与文档,以组合当前账户状态与产品语义。更关键的是,Agent 会先查文档理解“负面反馈”等业务概念,再映射到实际存在的 downvote 和反馈过滤器,说明文档也参与规划,而不只负责回答。

关注点设计产品 Agent 时,文档不只是 RAG 兜底,而是工具选择和语义映射的控制面;这组真实使用数据可指导工具接口与知识库预算。

07

把 Agent 限定在生成制品,让确定性流水线负责执行

Alex Merced 提出“Agent 生成、制品执行”:模型在开发阶段生成 SQL、dbt 模型、流水线代码和测试,运行时只执行已版本化、评审和验证的确定性制品。文章用五级确定性阶梯区分聊天复制、临时 Agent 查询、人工评审制品、自动验证制品和由定时 Agent 提交 PR 的维护体系,并给出只读凭据、dry-run、schema pinning、语义层和 golden dataset 等控制。核心边界是探索可以非确定,但进入生产或对外引用的数字必须提升为可追溯、可重跑的仓库制品。

关注点对用 Codex、Claude Code 等处理数据任务的团队,这是一套可以直接转写为 AGENTS.md、hooks 和 CI 门禁的工程规范。

08

面向 Agent 的平台工程需要统一身份、上下文与治理模型

文章认为内部开发平台的消费者正在从人类开发者扩展到会部署应用、分析遥测和调用运维流程的 Agent,因此平台不能只增加一组 AI API。它提出把应用、资源和 Agent 同时建模为一等软件资产,为人和 Agent 提供不同接口但一致的身份、权限、策略和审计控制。文章以 OpenChoreo 为例,说明 Kubernetes 记录、GitOps、MCP 和共享上下文模型如何组合成统一操作平面。

关注点这套模型把 Agent 平台建设落到既有平台工程职责上,可用于审视身份隔离、依赖图、审计轨迹和共享上下文是否真正一致。

09

AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters

AdaFlash 自适应扩散草稿提升大模型推理吞吐

AdaFlash 研究扩散草稿模型用于推测解码时的核心不稳定性:双向注意力虽然支持并行生成,却会造成跨领域接受率波动和不同 token 位置的质量差异。方法用反向 KL 的在线策略蒸馏降低领域级方差,再用自适应长度头动态决定候选序列长度,减少目标模型的验证开销。实验显示其部署吞吐持续优于既有方法,高并发场景最高提升约 66%。

关注点它把草稿长度从固定超参数改为按请求动态决策,为高并发 LLM 服务优化提供了更细粒度的成本控制点。

10

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

AgentDebugX 打通 Agent 故障检测、归因、恢复与重跑

AgentDebugX 将调试组织为检测、归因、恢复和重跑的闭环,重点解决故障暴露步骤与根因步骤不一致的问题。其 DeepDebug 结合全局轨迹理解、结构化调查和交叉质询定位根因,在测试的开放权重模型上将严格的 Agent 与步骤联合归因准确率提升至 28.8%。在 GAIA 上,它单次重跑修复了 73 个失败任务中的 13 个,使总体准确率从 55.8% 提升到 63.6%。

关注点它把追踪日志从被动回放升级为可执行的根因诊断与恢复机制,适合构建生产 Agent 的故障回归库和自动恢复管线。

11

Anthropic 公开 AI 原生 SDLC 的安全控制闭环

Anthropic 称 Claude 目前编写约 80% 的合并代码,工程师季度交付量相较 2021–2025 年平均提高 8 倍,安全团队因此重构计划、编码、CI、部署与监控控制。它把组织知识接入项目安全评审,用 CLAUDE.md 与 Skills 回写已知缺陷模式,在 PR 阶段并行运行职责隔离的 Agent 审查与 SAST,并通过远程虚拟机和出站白名单限制提示注入后的影响范围。要求 Agent 为发现提供证据后,获得实质性审查意见的 PR 占比从 16% 升至 54%;团队估计约三分之一过去的 claude.ai 事故可被现有自动化捕获。

关注点这给出了高代码产出场景下组合 AI 审查、确定性扫描、人类审批和 SIEM 审计的真实数据,而不只是原则性安全建议。

12

Cloudflare 让每个 Devin 会话运行在独立容器沙箱

Cloudflare 发布 Devin Outposts 模板,把每个 Devin 会话放进独立的 Cloudflare Container,由 Worker 协调会话生命周期。定时触发器每分钟轮询待运行会话并启动专属容器;挂起时把 /root、/workspace 和 /opt/devin-persistent 归档到 R2,恢复时还原,终止时删除容器与检查点。部署同时创建 Worker、Container 与 cron trigger,并把服务令牌存为 Worker Secret;文档明确检查点不是连续备份,且单个压缩包受 R2 5 GiB 上传限制。

关注点这是 Coding Agent 隔离运行、持久化和回收的一套可复用参考架构,清楚揭示了控制面、执行面与状态存储的边界。

13

Datadog 用规范与确定性内核约束 Claude Code 的长任务

Datadog 称全体工程师都使用 AI 编码工具,其中至少三分之二由 Claude Code 驱动;当 Agent 会话延长到数天后,瓶颈从生成转向对工具、胶水代码和生产行为的验证。其 Temper 让 Agent 生成行为、数据与授权三类规范,而不是直接把自由生成代码当作运行产物;确定性内核依次执行符号推理、可达状态穷举、带故障注入的可复现模拟和随机属性测试。团队此前用 Claude Code 构建的 Kafka 可比流处理服务显示出 2–5 倍潜在成本优势,但仍把生产硬化视为独立阶段。

关注点它把“Agent 写代码”改造成“Agent 写可证明规范”,为长任务中的生成速度与验证能力失衡提供了具体架构。

14

Harness 把 Agent 的构建、评测、发布与治理纳入统一生命周期

Harness Agent DLC 将 Agent 作为可版本化的软件制品纳入现有交付平台,覆盖构建、评测、存储、部署、运行和治理。方案用多维评分替代传统二元测试,把生产输入回流到评测集,并记录提示、Skill、MCP 服务、模型和策略的来源与依赖。部署侧把托管 Agent Runtime 与 Kubernetes 服务放进同一条交付管线,复用渐进发布、审批和回滚控制。

关注点它给出了把非确定性 Agent 接入成熟 SDLC 控制面的完整产品化路径,尤其适合比较评测门禁、制品追踪和运行时治理的边界。

15

OpenHands 1.47.0 加固云端 Agent 的身份与自动化链路

OpenHands cloud 1.47.0 将 Agent Canvas 置于 SaaS 身份验证之后,并修复云启动中的 Agent Profile 应用、自动化登录跳转和托管 LLM 密钥刷新等问题。运行时 API 的幂等读取新增一次超时重试,临时身份提供方错误不再直接登出用户,API 密钥验证的 last_used_at 写入也做了去抖。版本同时升级 Vite 修复 CVE-2026-53571,显示产品成熟度工作主要落在权限、会话连续性和凭据生命周期。

关注点这些变化比新增一个 Agent 能力更接近生产痛点:身份边界、短暂故障容错和密钥刷新会直接决定长任务是否稳定可控。

16

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro 用编码模型自身表征裁剪工具输出

SWE-Pruner Pro 发现编码模型读取工具结果时,其内部表征已经包含逐行相关性信号,因此无需额外代码分类器即可完成上下文裁剪。一个轻量预测头直接为工具输出的每一行生成保留或删除标签,并结合长度感知嵌入处理不同规模的结果。在两个开放权重骨干和四个多轮基准上,它最多节省 39% 的提示与生成 token,同时保持任务质量;部分设置下 SWE-bench Verified 解决率提升 3.8 个百分点,Oolong 准确率提升 2.2 个百分点。

关注点方法把上下文管理内化到编码 Agent,可减少长任务中的 token 与延迟开销,也避免维护独立裁剪模型。

17

TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory Minimization

TRIM 通过压缩执行轨迹减少 AI 生成代码冗余

论文把编码 Agent 在反复试错中遗留的无效编辑定义为 CodeSlop,并指出冗余会随代码库长期演化不断累积。TRIM 不直接枚举冗余,而是利用完整执行轨迹识别并最小化最终补丁。实验中 CodeSlop 减少 17.9%–32.9%,任务性能几乎不受影响,验证成本约为 Delta Debugging 等基线的一半。

关注点这为编码 Agent 的交付流程增加了一个可量化的补丁瘦身阶段,有助于控制自动生成代码带来的长期维护成本。

18

Early Adoption of Agentic Coding Tools by GitHub Projects

2.5 万个 Agent PR 显示开源采用仍集中在少数贡献者

研究分析 2,361 个热门 GitHub 仓库中的 25,264 个 Agent PR,观察真实项目如何采用和监督 Coding Agent。每个仓库三个月内的 Agent PR 中位数仅为 1–2 个,超过三分之二由单人完成审查和修改,与“团队已全面自动化”的叙事存在明显距离。

关注点真实项目数据能校正仅凭工具注册量或厂商案例推断采用深度的偏差,也凸显单人监督的治理风险。

19

SWE-Bench Pro 约三成任务可能有缺陷,评测数据也需要质检

OpenAI 通过自动筛查、多个调查 Agent、五名工程师独立复核和争议升级流程审查 SWE-Bench Pro。Agent 管线标出 27.4% 的破损任务,人工标注为 34.1%,综合估计约 30%,说明任务定义和测试缺陷会显著影响前沿 Coding Agent 的排名结论。

关注点它提醒团队把 benchmark 数据集当作需要版本化、复核和持续维护的工程制品,而不是不可质疑的真值。

20

ProMCP 拆开 MCP Agent 的 Token 流与延迟成本

ProMCP 将 MCP Agent 的运行分成六个阶段,剖析 20 个 server、169 个工具和多种客户端拓扑。自定义客户端有 56%–72% 的 token 与 60%–67% 的延迟落在规划和 schema;现成客户端则有 85% 以上延迟发生在最终生成阶段。

关注点结果说明工具执行本身常不是主要瓶颈,性能优化应先依据阶段级剖析定位 schema、规划或生成开销。

21

AI SDK 7 将持久执行、审批、沙箱与观测做成运行时原语

Vercel 在 AI SDK 7 中把持久执行、超时、人工审批、沙箱和统一观测做成 SDK 原语,并提供连接 Claude Code、Codex 等外部 Harness 的适配层。审批参数由 HMAC 绑定,OpenTelemetry 覆盖完整执行链,反映生产 Agent 基础设施正在形成共同边界。

关注点它是一份较完整的生产运行时能力清单,可用来检查自建 Agent 平台缺少哪些可靠性和治理控制。

22

Hugging Face 用完整轨迹评测工具版本对 Agent 的影响

Hugging Face 在相同硬件上比较模型、工具版本与任务组合,并记录完整过程成本,以判断 API、CLI、文档和样例是否让 Agent 绕远路。此前一轮 CLI 优化减少了 1.3–1.8 倍 token,个别任务最高达到 6 倍,说明软件接口本身会直接影响 Agent 效率。

关注点这把“是否方便 Agent 使用”转成可重复的产品指标,可用于回归测试工具、文档与 SDK 版本。

23

Coding Agent 没有消除领域专长带来的成功率差异

Anthropic 用隐私保护的会话级分类器估计用户专长和任务成功,并控制任务与用户特征。严格验证的成功率从新手的 15% 上升到中级以上用户的 28%–33%,说明同一 Agent 的结果仍显著依赖使用者能否判断、引导和校验。

关注点这为培训、权限和审查流程提供了依据:部署 Coding Agent 不能把人的领域知识从系统模型中删掉。

24

腾讯披露 Coding Agent 在大型工程组织中的落地路径

腾讯把 IDE、插件与 CLI 接入代码评审、测试、运维和平台治理,描述 Coding Agent 如何进入现有研发流程。公司自报相关工具覆盖超过 95% 的工程师,整体编码时间缩短 40%;这些数字来自厂商自身口径,但提供了中国大型组织的规模化采用样本。

关注点它补充了英文研究较少覆盖的中国企业实践,也显示普及率之外仍需追问治理、质量和计量口径。

25

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore 将仓库理解从端到端成功率中单独拆出

SWE-Explore 在 203 个仓库、10 种语言和 848 个 issue 上,要求 Agent 在固定行预算内排序相关代码区域。Agentic explorer 明显优于传统检索,行级覆盖率与排序效率最能区分先进方法,说明定位和上下文选择值得独立评测。

关注点它让团队可以诊断失败究竟来自仓库探索、推理还是补丁生成,而不是只看到一个端到端分数。

26

Anthropic 如何在产品中用硬隔离控制 Claude 的最大损害

Anthropic 比较短暂容器、人机监督沙箱和隔离虚拟机,并把防护分布在模型、执行环境与外部内容三层。操作系统级沙箱使权限提示减少 84%,文章也披露多个信任边界错误,用真实问题解释为什么环境隔离不能由模型守卫替代。

关注点它给出了按风险选择隔离强度的实务框架,并把提示注入后的最大影响范围作为核心设计指标。

27

OpenAI 内部如何限制 Codex 的执行权限与影响范围

文章说明 OpenAI 如何组合沙箱、审批、网络策略、凭据管理、强制配置和 Agent 原生审计,让 Codex 获得足够执行能力而不拥有无限权限。文中给出可执行的配置样例和审批边界,并把控制分别放在运行环境、外部访问和组织策略层。

关注点它把最小权限、审计和人工审批落到实际 Coding Agent 部署控制面,可直接用于检查企业内部运行边界。

28

RepoZero: Can LLMs Generate a Code Repository from Scratch?

RepoZero 评测从零生成完整代码仓库的真实差距

RepoZero 不再只评估局部 issue 修复,而要求模型从需求开始生成完整仓库,并通过迭代测试生成和错误驱动细化实现自验证。最强模型与 Agent 组合的通过率约为 30%–55%,表明局部补丁能力不能直接外推到端到端软件构建。

关注点它扩展了 Coding Agent 的任务边界,也为比较规划、架构、实现与自验证的组合能力提供了统一基准。

29

Google Agents CLI 把创建、评测与部署压缩到同一接口

Agents CLI 用机器可读命令统一 Agent 的创建、评测、基础设施即代码、CI/CD、部署和发布,减少跨云组件查文档和切换接口造成的上下文碎片。它同时提供面向 Agent 的模式与供人类重复执行的确定性命令。

关注点这展示了开发工具如何把 Agent 可操作性作为接口设计目标,并保留人类可审计、可重放的执行路径。

30

Coding Agent 的 Token 成本为何高且难以提前预测

研究分析八个模型在 SWE-bench Verified 上的执行轨迹与自我成本预测。Agent 任务消耗的 token 约为代码问答的 1,000 倍,同一任务不同运行之间最多相差 30 倍;表现最好的成本预测相关系数也只有 0.39。

关注点这些数据说明按任务做容量规划和预算控制不能只依赖平均 token 价格,还需要运行级上限与持续观测。

31

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

SlopCodeBench 揭示 Coding Agent 在连续迭代中的结构退化

SlopCodeBench 让 Agent 在 20 个问题和 93 个检查点上反复扩展自己的实现,以测试连续需求变化下的结构质量。没有一条轨迹端到端完成;80% 的轨迹结构侵蚀上升,89.8% 的冗余上升,代码约为人类开源实现的 2.2 倍冗长。

关注点它把一次通过测试之外的可扩展性和长期结构质量纳入评测,直接对应自动生成代码的维护成本。

32

长时间应用开发需要结构化交接与独立评价回路

Anthropic 针对上下文饱和后任务目标和实现状态逐渐漂移的问题,采用任务分解、结构化交接、上下文重置和 planner–generator–evaluator 三 Agent 架构。独立评价标准在多小时全栈应用构建中形成纠错闭环,使新的上下文窗口可以继承可验证状态而非完整历史。

关注点方法把长任务可靠性建立在状态交接和独立验证上,比单纯扩大上下文或延长一次会话更易维护。

33

Engineering Pitfalls in AI Coding Tools: An Empirical Study of Bugs in Claude Code, Codex, and Gemini CLI

Claude Code、Codex 与 Gemini CLI 的常见工程缺陷

研究对三个主流 AI 编码 CLI 的 3,800 多个公开 issue 进行人工开放编码,分析工具本身而非生成代码的故障。36.9% 的根因来自 API、集成或配置,37.2% 影响工具调用,24.7% 影响命令执行,显示外围工程是 Agent 可靠性的主要组成。

关注点这份缺陷分类可用于设计 Coding Agent 的回归测试和可观测性,避免把运行时错误误判成模型推理失败。

34

CORPGEN 用并发依赖与任务重排测试真实工作的 Agent

Microsoft Research 构建持续五小时、每项包含 10–30 个步骤的多时间跨度任务环境,以补足单任务 benchmark 对真实工作的简化。并发任务从 12 增至 46 时,完成率从 16.7% 降到 8.7%;改进记忆隔离和调度后,最佳系统达到基线完成率的 3.5 倍。

关注点它把记忆污染、调度压力和依赖变化纳入评测,更接近生产 Agent 同时处理多项工作的真实失败模式。

35

GitHub 把 Coding Agent 的自审查与安全扫描放进 PR 流程

GitHub 为 Copilot coding agent 增加模型选择、自审查、安全扫描、自定义 Agent 和云端到 CLI 的上下文交接。代码、密钥与依赖扫描被嵌入 Agent 工作流,同时保留分支、日志与人工评审,使后台生成的 PR 在进入合并前经过统一控制。

关注点它说明代码托管平台如何让 Agent 服从既有 PR 治理,而不是另建一条缺少审计的自动化旁路。

36

METR 修正开发者生产力实验:选择偏差让效应量失真

METR 复盘第二轮实地试验的招募、任务选择和计时偏差,解释 AI 普及后随机分配“无 AI”条件为何更难成立。原始结果转向小幅加速但置信区间跨零;团队最终认为选择偏差使效应量不可靠,并公开调整实验设计。

关注点这篇方法修正比单个正负生产力数字更有价值,也提醒读者审查样本选择和任务口径是否随工具普及而变化。

37

Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?

AGENTS.md 不总能提高成功率,冗余上下文反而增加成本

研究在 SWE-bench Lite 的 300 个任务和 CTXbench 的 138 个任务上,对多种 Agent 与模型进行对照。LLM 生成的仓库上下文文件没有显著提升准确率,却增加 20%–23% 成本;只有原始文档缺失时,平均收益约为 2.7%。

关注点结果为上下文文件划出实证边界:内容应短、去冗余,并优先补充仓库里不存在的信息。

38

当代码主要由 Agent 生成,仓库本身需要怎样设计

OpenAI 复盘一个从空仓库开始、持续五个月并投入内部使用的产品实验,讨论如何用架构约束、系统记录、反馈回路和持续清理控制自动生成代码的熵。实验最初由三名工程师推进,累计约 100 万行代码和 1,500 个 PR;团队估计交付速度约为手写代码的十倍,同时明确长期维护风险仍待观察。

关注点这篇文章把重点从提示技巧转向仓库结构和反馈系统,适合作为 Agent-first 团队设计工程环境的参考。

39

Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents

Agent 临时生成测试,未必能提高仓库级修复成功率

研究分析六个模型的执行轨迹,并对四类 Agent 进行提示干预,以检验临时生成测试的实际作用。大量所谓测试只是输出结果的 print;改变写测试的频率后,83.2% 的任务结果没有变化,说明观察性反馈不能等同于正式断言。

关注点它挑战了“Agent 写了测试就更可靠”的直觉,促使评测区分可验证断言、调试输出和真正的回归保护。

40

基础设施噪声会怎样改变 Agent 编码评测结果

Anthropic 在固定模型、Harness 和任务的条件下,只改变 Terminal-Bench 与 SWE-bench 的资源上限,以测量基础设施造成的混杂。Terminal-Bench 的极端配置相差 6 分;SWE-bench 在五倍内存下高出 1.54 分,表明资源限制足以改变系统比较。

关注点这为评测复现增加了硬件、容器和超时配置的最低报告要求,也解释了部分跨平台分数差异。

41

Are Coding Agents Generating Over-Mocked Tests? An Empirical Study

真实提交数据显示 Coding Agent 更容易生成过度 Mock 的测试

研究分析 2,168 个仓库的 120 万次提交,其中包含 48,563 次 Agent 提交。Agent 提交中有 23% 修改测试、36% 添加 mock;非 Agent 提交分别为 13% 和 26%,显示更多测试活动并不必然带来更真实的行为覆盖。

关注点这组仓库级数据补足 benchmark 轨迹研究,提示代码审查应单独检查 mock 边界与真实依赖覆盖。

42

多 Agent 何时有效:任务可分解性比 Agent 数量更重要

Google Research 控制比较 180 个配置、五种架构和四类基准,研究数量与拓扑何时带来收益。独立并行架构把错误放大 17.2 倍,中心协调架构为 4.4 倍;其预测器对未见配置有 87% 的概率选中最优架构。

关注点结果提供了比“增加更多 Agent”更可靠的决策依据:先判断任务可分解性、工具密度与协调成本。

43

拆解 Codex Agent Loop:模型能力如何变成可执行工作流

OpenAI 逐步拆解 Codex 在提示、推理、工具调用、环境观察与再次推理之间的循环,并把 Agent 的行为解释为模型与执行 Harness 的系统结果。文章同时链接到 Codex CLI 的具体实现,说明运行时如何把模型输出转换成可追踪的动作。

关注点它提供了理解 Coding Agent 执行机制的最小模型,便于区分模型能力、工具接口与 Harness 设计各自造成的效果。

44

Agentic Engineering Patterns:把验证置于生成速度之前

Simon Willison 将分散的 Coding Agent 实践整理成系统指南,16 章覆盖 Git、子 Agent、测试驱动开发、先运行测试、人工验证和线性走查。完整案例持续强调可理解性、可回退性和证据,而不是把一次生成成功当作工程完成。

关注点它提供了一套厂商之外、可直接执行的工作方法,适合作为团队使用 Codex 或 Claude Code 的操作基线。

45

有效上下文工程:把每轮输入当作有限的注意力预算

Anthropic 将不断增长的历史、工具定义和外部数据视为需要每轮动态策展的有限注意力预算。目标不是装入最多信息,而是选择最小的高信号 token,并通过工具设计、记忆和压缩减少重叠指令与无效历史。

关注点它连接提示、工具、记忆与上下文压缩,为长任务中的信息选择提供了比扩大窗口更稳定的设计原则。

46

用人类任务时长衡量 AI 能完成多长的软件工程任务

METR 将任务对应的人类专家耗时与模型成功率结合,拟合 50% 和 80% 成功率的任务时间跨度,以建立跨难度和模型代际的共同尺度。历史估计显示该跨度约每七个月翻倍,但作者同时强调任务集、专家耗时和成功口径带来的不确定性。

关注点它为“能力在增长”提供了比单一 benchmark 更可解释的尺度,也明确了把实验任务外推到真实项目时的限制。

47

Building Effective Agents:只在可测量收益出现时增加复杂度

Anthropic 总结 prompt chain、routing、parallelization、orchestrator-worker、evaluator-optimizer 与自治 Agent 等模式,并区分固定工作流和动态决策。文章建议从最简单方案开始,只在评测显示改善时增加复杂度,同时保留环境真值、停止条件与沙箱。

关注点虽然早于主时间窗,它仍是比较近半年复杂 Harness 方案的最小架构基线,可防止无依据地堆叠 Agent。

48

SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering

SWE-agent 说明专用计算机接口会直接改变软件工程能力

SWE-agent 为仓库导航、编辑和测试执行设计适合语言模型的 Agent-Computer Interface,并在 SWE-bench 与 HumanEvalFix 上比较。其当时分别达到 12.5% 和 87.7% pass@1;长期价值不在旧分数,而在证明工具接口与 Harness 必须和模型一起受控比较。

关注点这项早期工作奠定了当前 Coding Agent 的接口设计思路,也解释了为什么只比较基础模型会得出不完整结论。