エージェントに過去の経験から学ばせた「エージェンティック・メモリ」を組み込むことは、一見すると単に過去の教訓を抽出し、文脈に再注入するだけで実現できるように思われます。
しかし、Hugging Faceによる評価では、このメモリの与え方にはモデルごとの適切な「投与量」が存在することが明らかになりました。
本研究では、30Bの密なモデルから最先端のプロプライエタリシステムに至るまで、合計8つの異なるモデルで評価を実施しました。
その結果、エージェンティック・メモリは単にオン/オフする機能ではなく、モデルの能力に合わせて調整する必要があることが判明しました。
ALTK-Evolveという手法は、重み更新や人間の注釈なしに、エージェント自身の過去の軌跡から再利用可能なガイドラインを抽出し、推論時に注入することを可能にします。
評価から得られた重要な知見は、モデルの能力レベルによって最適なメモリの与え方が異なるという点です。
具体的には、十分な処理能力を持つ「余裕のある強力なモデル」には、すべてのガイドラインセットを適用することが望ましいとされました。
例えば、DeepSeek-V3.2 (671B MoE)は、完全な自己生成ガイドラインセットを与えられた際に、タスク完了率が9.5パーセンテージポイント向上しました。
一方、能力が低いモデルでは、コンパクトなコアとタスクごとの検索を組み合わせたアプローチが最も効果的であり、飽和したモデルでは測定可能な向上が見られませんでした。
さらに、検索によるガイドラインの利用(Curated retrieval)は、高い精度と低コストの両方を実現する選択肢として示されています。
具体例として、gpt-oss-120bは、わずか5%のトークン増加でタスク完了率が16.1パーセンテージポイント向上しました。
また、プロンプトキャッシングを利用することで、完全なガイドラインセットであっても実運用におけるコストを抑えることが可能です。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。