週に一本、
エンジニア視点で。

エージェント、ツール使用、長文脈、コーディングエージェント —— arXiv の新着論文を開発者視点で精読、四言語同時、毎週土曜更新。

RSS 購読 →

評価failure-modes
13 分

リーダーボードの向こう側:本番の Agent を殺す 6 つの失敗モード

最新の arXiv 論文(Rao et al., 2026)が 27 個の Agent ベンチマークと 4,300 件の失敗トラジェクトリをメタ分析。6 つの失敗モードでその 89% が説明でき、しかもリーダーボードが本当に測っているのはそのうちの 2 つだけ。Claude Code を本番投入するすべてのエンジニアに贈るフィールドマニュアル。

subagentsコーディングエージェント
12 分

FastContext:リポジトリ探索は専用のサブエージェントに任せろ

arXiv の新作論文(Kim et al., 2026)は、リポジトリ探索がパッチ生成とは別物の能力だと主張する。分離すれば SWE-Bench で +5.5 ポイント、トークンは 60% 削減。Claude Code 風ループを組む人向けの精読。

context-managementコーディングエージェント
13 分

Self-GC:Agent に自分でコンテキストを GC させる

arXiv の新作論文(Sun et al., 2026)は、Agent のコンテキストをモデル自身が fold・mask・prune できるファーストクラスのオブジェクトに変える。結果:同じ token 予算で軌跡が 3〜5 倍長くなり、Claude Code 風のループを組む人にとってよりクリーンなメンタルモデルが得られる。

ロングコンテキストコーディングエージェント
13 分

Coding Agent こそが真の長コンテキスト処理器:Duke 論文が本当に示したこと

arXiv の新しい論文(Cao et al., 2026)は、既製の Coding Agent が 5 つのベンチマークで SOTA の長コンテキストシステムを平均 17.3% 上回ったことを示している。何が変わったのか、なぜ機能するのか、自分の Agent に取り入れるべきポイントを解説する。