大模型在長任務裏反覆"失憶"、跑着跑着就忘了最初目標,這個困擾整個智能體行業的老毛病,根源可能不在模型本身,而在包裹模型的"執行框架"。AWS 一份自主雲編程智能體設計指南把問題點得很直白:淺層智能體在長週期裏會遭遇上下文溢出、被幹擾而跑題,並且無法維持狀態。而修好這層的,是負責管理"除模型之外一切"的 harness。
一份盤點多家主流框架的新研究把這層外殼掀開了。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore 各自用四臺"發動機"——上下文預算、壓縮、待辦狀態、跨會話記憶——把淺層循環變成能扛住長任務的深智能體。
最反直覺的一點是,把上下文窗口做大並不解決問題。Chroma 的 Context Rot 報告評估了18款大模型,發現即便在簡單檢索任務上,輸入越長模型越不可靠。Anthropic 給出的解釋是:注意力機制對 n 個 token 會生成 n² 的兩兩關係,每多一個 token 都在消耗一筆有限的"注意力預算",上下文是邊際遞減的資源,不是個桶。Manus 還透露,一個典型任務要調約50次工具、輸入輸出比接近100:1,最初那條指令會慢慢漂向窗口中段——恰恰是回憶退化的位置。
第一臺發動機是上下文預算與卸載。Deep Agents 出廠就寫死了兩條硬規則:工具返回超過20000token 就寫進文件系統、只留路徑加前10行預覽;會話上下文超過窗口85% 時,舊編輯調用被截斷成指針。Claude Code 把同樣邏輯用在加載前,自動記憶限200行或25KB,MCP 工具模式默認只列名字、按需拉取。AWS AgentCore 的演示更徹底:協調器並行派生3個瀏覽器子智能體,各自待在獨立 MicroVM 裏,分析子智能體只收結構化結果,全程預期4到6分鐘,串行則會慢最多3倍。
第二臺是壓縮。當卸載不夠,框架就把接近上限的對話摘要後重啓。Claude Code 的壓縮提示會保留架構決策和未解決 bug、丟掉冗餘輸出,並在壓縮後重讀最近修改的至多5個文件、重新注入技能正文;它還把完整原始記錄寫進磁盤,被摘要掉的事實日後能找回。Deep Agents 更把"保住目標"做成結構特性,摘要文檔專門分出會話意圖、已生成產物和下一步三個字段。壓縮已下沉到 API 層:OpenAI Responses API 用 `compact_threshold` 提供服務端壓縮,Codex 正是靠它撐住長編程任務;Claude 平臺則給出可寫自定義指令的壓縮編輯項。
第三臺是待辦狀態與"唸咒"。Manus 的做法很樸素——建一個 `todo.md` 一步步重寫打勾,等於把目標念進上下文末尾,推開"淹沒在中間"的漂移。不過它並非穩賺:Deep Agents 在2026年7月的 v0.7裏,因評估顯示關掉待辦反而獎勵略高、成本更低,把待辦中間件改成了可選;LangChain 仍建議對長任務、弱模型和需展示進度的界面重新打開。
第四臺是跨會話記憶。Claude Code 每次壓縮後都從磁盤重注 CLAUDE.md 和自動記憶;AgentCore Memory 在後臺跑抽取策略,讓協調器下次直接召回而非重研。但蘇黎世聯邦理工的研究潑了冷水:AGENTS.md 這類上下文文件通常不提升成功率,卻讓推理成本漲20% 到23%,每次重載都是對注意力預算的固定徵稅。Claude Code 因此建議把 CLAUDE.md 壓在200行以內。
研究最後提醒,框架是否真"抓得住目標"得靠強制觸發壓縮的測試驗證——最該警惕的失敗,是智能體在摘要後立刻反問澄清,或錯誤宣佈任務完成。換句話說,讓智能體在長路上不迷路,拼的不是模型有多大,而是框架這幾臺發動機調得有多細。
VIP會員