1. 論文が実際に比較したもの

Nature Machine Intelligenceは2026年7月24日、Google資金の研究を掲載した。単独、独立並列、統括役を持つ中央型、対等通信の分散型、両者を合わせたハイブリッドを比較し、指示、ツール、システム全体の計算上限を揃えた。

260構成は検索、金融、計画、職場業務、ソフトウェア工学、端末操作の6ベンチマークと、OpenAI、Google、Anthropic系統を含む。別々の商品デモ比較より厳密だが、将来の全システムを決める普遍法則ではない。

2. 平均0%が隠す正反対の結果

全体の平均改善は0.0%だったが、ばらつきは極めて大きい。中央型はFinance Agentで単独基準より80.8%向上し、独立型は順次性の強いPlanCraftで70%低下した。

金融が簡単で計画が難しいというだけではない。金融調査は開示、ニュース、事業影響に分けてから統合できる。PlanCraftは共有された連続状態が必要で、圧縮された引継ぎが次の行動に必要な制約を落とし得る。

  • 並列可能:独立した証拠を集めて統合する。
  • 順次型:各行動が次に必要な状態を変える。
  • 開放・曖昧型:通信が不確実性を複製し得る。
  • 強い基準線:改善余地が小さく調整税が目立つ。

3. 45%の境界は便利だが法則ではない

研究者は単独エージェント性能およそ45%を経験的な境界として推定した。それを超えるとチーム改善は起きにくく、SWE-bench VerifiedとTerminal-Benchの16検証構成で改善・悪化の方向を94%一致させた。

著者はこれを普遍的なスケーリング則でなく実務的選択規則と明記する。各検証セルは20件で、個別信頼区間も広い。45%を超えたら中止するのではなく、追加調整により強い証拠を求める目安だ。

4. 調整税は時間と費用に現れる

費用追跡部分では、ハイブリッドは単独の6.2倍、中央型は3.8倍、分散型は3.6倍のターンを使った。総推論上限を一致させたため、チームは予算を分岐に分け、通信と統合にも支払った。

エージェントSaaS購入では重要だ。呼出し・トークン課金は小さな精度向上を不採算にし得る一方、高額な誤りを防ぐ、または並列調査を早めるなら追加費用は合理的だ。精度だけでなく千トークン当たり成功、遅延、再試行を測る。

5. この研究が証明していないこと

全チームが失敗する、または一つのモデル系統が常に勝つ証拠ではない。全ベンチマークを支配した系統はなく、いくつかの方向的効果は保守的な統計補正後に有意でなかった。実験後に出た全モデルも代表しない。

身体エージェント、複数利用者、長期の現場フィードバックも対象外だ。SWE-benchとTerminal-Benchは各20件。モデルは同一領域内の保留構成で最適構成を87%選んだが、未知領域の絶対性能予測は弱かった。

6. 日本・アジア企業の導入手順

契約前に実業務20〜50件を選び、単独エージェントの基準線を残す。並列・順次性、誤りの価格、遅延、トークンを定義し、専門役2〜3体と統括役だけを試す。デモが賢く見えるからと10体から始めない。

日本語・アジア業務では、引継ぎ中の言語と現地規制文脈の保持も試す。法務、財務、出典担当は並列調査できるが、統括役は証拠と留保を残す必要がある。改善が費用とリスクを上回らなければ、単独型は安いだけでなく優れた構成だ。

  • ツール、指示、計算予算を固定する。
  • 自社業務で単独基準を作る。
  • 成功、費用、遅延、誤り増幅を同時に測る。
  • 証拠が分割できる時に増やし、依存が深い時は減らす。
  • 金融、法務、高影響判断には人の承認を置く。