大規模モデルが長時間のタスクにおいて繰り返し「記憶を失う」こと、つまりタスクの初期目標を忘れてしまうという問題は、インテリジェントエージェント業界全体に長年残っていた課題です。その根本的な原因はモデル自体にあるのではなく、モデルを取り囲む「実行フレームワーク」にある可能性があります。AWSが公開した自律クラウドプログラミングエージェント設計ガイドでは、この問題点を非常に明確に指摘しています。浅層的なエージェントは長期間のタスクにおいてコンテキストのオーバーフロー、外部からの干扰による話題の逸脱、そして状態の維持が困難になることがわかっています。この問題を修正するためには、「モデル以外のすべてを管理するハarness」というものが必要です。
複数の主要なフレームワークを比較した新しい研究では、この外側の構造を明らかにしました。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex、Amazon Bedrock AgentCoreはそれぞれ4つの「エンジン」——コンテキスト予算、圧縮、待办状況、セッション間メモリ——を使って、浅層的なループを長時間のタスクに対応できる深い知能体に変えるのです。
最も直感に反する点は、コンテキスト窓を大きくしても問題が解決しないということです。ChromaのContext Rotレポートは18種類の大規模モデルを評価し、単純な検索タスクにおいても入力が長くなるほどモデルが信頼できなくなることを発見しました。Anthropicはこれを以下のように説明しています:アテンション機構はn個のトークンに対してn²のペア関係を生成します。1つずつトークンが増えれば増えるほど、限られた「アテンション予算」が消費され、コンテキストは限られた資源であり、バケツではありません。Manusはまた、典型的なタスクでは約50回のツール呼び出しを行い、入出力比はほぼ100:1であると述べています。最初の指示は徐々にウィンドウの中間へと移動し、これはまさに記憶の劣化が起こる場所です。
第1のエンジンは、コンテキスト予算とオフロードです。Deep Agentsは出荷時に2つの硬質なルールを設定しています。ツールの返却が20,000トークンを超える場合、それをファイルシステムに書き込み、パスと先頭の10行のプレビューのみを保持します。会話コンテキストがウィンドウの85%を超えたら、古い編集呼び出しがポインタに切り替えられます。Claude Codeは同様の論理をロード前に適用し、自動的に記憶を200行または25KBに制限します。MCPツールモードではデフォルトで名前のみを表示し、必要に応じて取得します。AWS AgentCoreのデモはさらに徹底的です。調整者が並列に3つのブラウザサブエージェントを派生させ、それぞれが独立したMicroVM内で動作します。分析サブエージェントは構造化された結果のみを受け取り、予定されている時間は4〜6分で、シーケンシャルな処理では最大3倍遅くなります。
第2のエンジンは圧縮です。オフロードが十分でない場合、フレームワークは上限に近い対話を要約して再起動します。Claude Codeの圧縮ヒントはアーキテクチャ決定と未解決のバグを保持し、冗長な出力を捨てます。その後、最近の変更された最大5つのファイルを再度読み込み、スキル本文を再び挿入します。また、完全な元の記録はディスクに書き込まれており、要約された事実は後で再確認できます。Deep Agentsは「目標を守る」ことを構造的な特性として扱い、要約ドキュメントには会話の意図、生成された製品、および次のステップの3つのフィールドを専用に分けます。圧縮はAPI層まで下がっており、OpenAI Responses APIは`compact_threshold`を通じてサーバーサイドでの圧縮を提供しており、Codexはこれによって長時間のプログラミングタスクを支えています。Claudeプラットフォームではカスタム命令を書ける圧縮編集項目を提供しています。
第3のエンジンは待辦状況と「呪文」です。Manusの方法はシンプルで、`todo.md`を作成し、1つずつ項目を重ねてチェックしていくことで、目標をコンテキストの末尾に念じ込むようにし、「中央に埋もれてしまう」漂移を防ぎます。しかし、この方法は常に効果的とは限りません。Deep Agentsは2026年7月のv0.7で、評価の結果、待辦機能をオフにすると報酬がわずかに高くなり、コストが低いことが判明したため、待辦ミドルウェアをオプションに変更しました。一方、LangChainは長時間のタスク、弱いモデル、進捗を表示するインターフェースでは待辦機能を再び有効にするよう推奨しています。
第4のエンジンは跨セッションメモリです。Claude Codeは毎回圧縮後にディスクからCLAUDE.mdと自動記憶を再注入します。AgentCore Memoryはバックグラウンドで抽出戦略を実行し、次回の調整者は再考することなく直接呼び出すことができます。しかしスイス連邦工科大学チューリッヒの研究は一石を投じました。AGENTS.mdのようなコンテキストファイルは通常、成功率を向上させることはないものの、推論コストを20〜23%上昇させることがわかりました。一度再ロードするたびにアテンション予算に対する固定税を払うことになります。したがって、Claude CodeはCLAUDE.mdを200行以内に抑えることを提案しています。
研究の最後に注意喚起されています。フレームワークが本当に「目標をつかんでいる」かどうかは、強制的に圧縮をトリガーするテストによって検証されるべきです。最も警戒すべき失敗は、エージェントが要約した後すぐに明確化を尋ねたり、タスクの完了を誤って宣言してしまうことです。言い換えれば、長距離の旅で迷わずに進めるために必要なのは、モデルの大きさではなく、フレームワークのこれらのエンジンがどれだけ正確に調整されているかなのです。
VIP会員