每周一篇
工程师视角。

Agent、Tool use、长上下文、Coding Agent —— 从构建者角度精读 arXiv 新论文,四语同步,每周六更新。

RSS 订阅 →

评估failure-modes
13 分钟

别只看排行榜:真正干掉生产 Agent 的 6 种失败模式

最新 arXiv 论文(Rao 等人,2026)对 27 个 Agent 基准和 4300 条失败轨迹做了元分析。6 种失败模式解释了其中 89%——而排行榜真正在考的只有其中 2 种。给所有把 Claude Code 推进生产环境的工程师的一份实战地图。

subagentsCoding Agent
12 分钟

FastContext:仓库探索,值得单独派一个子 Agent

arXiv 新论文(Kim et al., 2026)指出:仓库探索和补丁生成本就是两种能力,拆开跑能在 SWE-Bench 上多拿 5.5 分,还能省 60% token。给做 Claude-Code 循环的同学的一份精读。

context-managementCoding Agent
13 分钟

Self-GC:让 Agent 自己给上下文做垃圾回收

arXiv 新论文(Sun et al., 2026)把 Agent 上下文变成模型可以 fold、mask、prune 的一等对象。结果:同样的 token 预算下轨迹长 3–5 倍,也让写 Claude Code 风格循环的人有了更干净的心智模型。

长上下文Coding Agent
13 分钟

编码 Agent 才是真正的长上下文处理器:Duke 新论文到底说明了什么

arXiv 新论文(Cao et al., 2026)显示:现成的编码 Agent 在五个基准上平均超越 SOTA 长上下文系统 17.3%。本文拆解到底发生了什么变化、为什么奏效,以及可以直接照搬到你自己 Agent 里的做法。