每週一篇
工程師視角。

Agent、Tool use、長上下文、Coding Agent —— 從開發者角度精讀 arXiv 新論文,四語同步,每週六更新。

RSS 訂閱 →

評估failure-modes
13 分鐘

別只盯著排行榜:真正搞垮生產 Agent 的 6 種失敗模式

最新 arXiv 論文(Rao 等人,2026)針對 27 個 Agent benchmark 與 4,300 條失敗軌跡做了元分析。6 種失敗模式解釋了其中 89%——而排行榜真正在測的只有其中 2 種。獻給每一位把 Claude Code 推到生產環境的工程師的一份實戰地圖。

subagentsCoding Agent
12 分鐘

FastContext:倉庫探索,值得單獨派一個 sub-agent

arXiv 新論文(Kim et al., 2026)主張:倉庫探索本來就是跟補丁生成不同的能力,把兩件事拆開跑,SWE-Bench 直接多拿 5.5 分,還省 60% token。給在做 Claude Code 迴圈的人的一份精讀。

context-managementCoding Agent
13 分鐘

Self-GC:讓 Agent 自己幫上下文做垃圾回收

arXiv 新論文(Sun et al., 2026)把 Agent 上下文變成模型可以 fold、mask、prune 的一等物件。結果:同樣的 token 預算下軌跡長 3–5 倍,也讓寫 Claude Code 風格迴圈的人有了更乾淨的心智模型。

長上下文Coding Agent
13 分鐘

編碼 Agent 才是真正的長上下文處理器:Duke 新論文究竟說了什麼

arXiv 新論文(Cao et al., 2026)顯示:現成的編碼 Agent 在五個基準上平均超越 SOTA 長上下文系統 17.3%。本文拆解到底發生了什麼變化、為什麼奏效,以及可以直接搬到你自己 Agent 裡的做法。