// 論文精読
週に一本、
エンジニア視点で。
エージェント、ツール使用、長文脈、コーディングエージェント —— arXiv の新着論文を開発者視点で精読、四言語同時、毎週土曜更新。
13 分
リーダーボードの向こう側:本番の Agent を殺す 6 つの失敗モード
最新の arXiv 論文(Rao et al., 2026)が 27 個の Agent ベンチマークと 4,300 件の失敗トラジェクトリをメタ分析。6 つの失敗モードでその 89% が説明でき、しかもリーダーボードが本当に測っているのはそのうちの 2 つだけ。Claude Code を本番投入するすべてのエンジニアに贈るフィールドマニュアル。
12 分
FastContext:リポジトリ探索は専用のサブエージェントに任せろ
arXiv の新作論文(Kim et al., 2026)は、リポジトリ探索がパッチ生成とは別物の能力だと主張する。分離すれば SWE-Bench で +5.5 ポイント、トークンは 60% 削減。Claude Code 風ループを組む人向けの精読。
13 分
Self-GC:Agent に自分でコンテキストを GC させる
arXiv の新作論文(Sun et al., 2026)は、Agent のコンテキストをモデル自身が fold・mask・prune できるファーストクラスのオブジェクトに変える。結果:同じ token 予算で軌跡が 3〜5 倍長くなり、Claude Code 風のループを組む人にとってよりクリーンなメンタルモデルが得られる。
13 分
Coding Agent こそが真の長コンテキスト処理器:Duke 論文が本当に示したこと
arXiv の新しい論文(Cao et al., 2026)は、既製の Coding Agent が 5 つのベンチマークで SOTA の長コンテキストシステムを平均 17.3% 上回ったことを示している。何が変わったのか、なぜ機能するのか、自分の Agent に取り入れるべきポイントを解説する。