論文解説 11 min read

オープンソースLLMエージェントの多段階API連携を強化するEDGE:新ベンチマークKOPA-Benchで実証

オープンソースLLMエージェントが複数ステップのAPI呼び出しで性能不足という課題に対し、韓国公共API対応の新ベンチマークKOPA-Benchと、実行に基づくデータ合成手法EDGEが提案されました。この研究により、小規模モデルでも大規模モデルに匹敵する多段階ツール呼び出し性能を実現し、政府機関におけるオンプレミスLLMの利用促進に貢献します。

AI Frontier 編集部 によって編集・公開

導入

近年、データ主権に関する規制が世界的に強化される中、政府機関や公共機関では、データガバナンスを確保しつつ効率的なサービス提供が求められています。その解決策として、オープンソースかつオンプレミス環境で動作する大規模言語モデル(LLM: Large Language Model)エージェントの導入に注目が集まっています。これらのLLMエージェントは、既存のシステムやデータベースと連携するために、Application Programming Interface(API)を呼び出す「ツール利用(Tool-Calling)」の能力が不可欠です。

しかし、現在のオープンソースLLMは、特に複数のAPIを順序立てて呼び出す「多段階(Multi-Step)ツール呼び出し」において、その性能が大きく不足しているという課題を抱えています。複数のAPIを連携させて複雑なタスクをこなすには、各ツールの出力が次のツールの入力となるように論理的な推論を行い、適切にシーケンスを組み立てる高度な能力が必要です。この性能ギャップを客観的に評価するための適切なベンチマークも不足しており、さらに高性能なLLMエージェントを訓練するための高品質なデータも十分に存在しませんでした。

本論文では、この課題に対し、韓国の公共APIを対象とした新しいベンチマーク「KOPA-Bench」と、多段階ツール呼び出しのための訓練データを効率的に合成する手法「EDGE」を提案しています。これにより、オープンソースのLLMエージェントが、より実践的な環境で高性能を発揮するための道筋を示しています。

この研究の新規性

この研究の主な新規性は、以下の2点に集約されます。

  1. 実世界に基づいた多段階ツール呼び出しベンチマーク「KOPA-Bench」の提案 既存のツール呼び出しベンチマークは、単一のツール利用や比較的単純なシナリオに焦点を当てていることが多く、実際の公共機関の業務で必要とされる複雑な多段階ツール呼び出し能力を十分に評価できるものがありませんでした。KOPA-Benchは、145の実際の公共APIタスクで構成されており、オープンソースLLMの性能不足を客観的に測る初めてのベンチマークとなります。

  2. ライブAPI実行に基づく動的なデータ合成手法「EDGE」の確立 多段階ツール呼び出しの性能向上には、質の高い訓練データが不可欠ですが、これを手作業で作成するのは非常にコストがかかります。EDGE (Execution-grounded Dynamic Graph for tool-calling data synthEsis) は、ライブAPIへの実際の呼び出し結果に基づき、実行可能な多段階のツール呼び出しシーケンスを自動的に合成する画期的な手法です。これにより、人手によるアノテーションに頼らず、大量かつ高品質な訓練データを効率的に生成できるようになりました。

これらの新規性により、本研究は、オープンソースかつ比較的小規模なLLMであっても、適切な訓練データとファインチューニングを行うことで、大規模モデルに匹敵する高度な多段階ツール呼び出し能力を獲得できる可能性を示しました。

技術的な核心

KOPA-Bench: 韓国公共APIベンチマーク

KOPA-Benchは、韓国の実際の公共APIを対象とした多段階ツール呼び出しベンチマークです。合計145のリアルワールドタスクで構成されており、例えば「特定の地域の天気情報を取得し、その情報に基づいて最適な交通手段を提案する」といった、複数のAPI連携を必要とする複雑なシナリオを想定しています。このベンチマークは、単なるAPI呼び出しの正確性だけでなく、複数のAPIを論理的に連鎖させ、最終的なタスク目標を達成する能力を評価するように設計されています。これにより、モデルが実用的なエージェントとして機能するかを客観的に測定することが可能になります。

EDGE: 実行に基づく動的なグラフを用いたデータ合成

EDGEは、多段階ツール呼び出しの訓練データを自動で合成するための強力な手法です。その核心は、API間の依存関係を動的なグラフとして構築し、実際にAPIを呼び出すことで実行可能なパスを検証する点にあります。

  1. ツールの依存関係グラフ構築 まず、利用可能なAPI(ツール)の定義(スキーマ)を解析します。各APIの入力パラメータと出力形式を分析し、「あるAPIの出力が、別のAPIの入力として利用可能か」という依存関係を推定します。これにより、APIをノード、依存関係をエッジとする潜在的なグラフを構築します。

  2. 実行に基づく動的検証 (Execution-grounded Dynamic Graph) 一般的なグラフ構築手法では、スキーマ上は接続可能に見えても、実際のAPI呼び出しではエラーになったり、意味のない結果になったりすることがあります。EDGEでは、この課題を解決するため、構築した潜在的なグラフの各エッジ(ツール間の接続)に対して、実際にライブの公共APIを呼び出して検証を行います。具体的には、合成された仮の入力値でAPIを呼び出し、成功したかどうか、また出力が次のAPIに妥当な入力として渡せるかを確認します。この「ライブ実行による検証」を通じて、実際に機能する有効なツール間の連携パスのみを「検証済みリンク」として保持します。これにより、現実世界で機能する高品質なデータのみを生成できます。

  3. 多段階の実行軌跡合成 検証済みリンクで構成された動的グラフ上で、さまざまな開始点から探索アルゴリズム(例:深さ優先探索や幅優先探索など)を用いて、複数のAPIを連鎖させた実行可能な「軌跡(trajectories)」を合成します。これらの軌跡は、タスク開始から最終的な目標達成までの一連のツール呼び出しと、それぞれの呼び出しにおける入力・出力を含んでいます。これにより、人手による手間をかけずに、LLMが多段階のツール呼び出しを学習するための大量の訓練データを生成することが可能になります。

  4. GRPOによるファインチューニング 合成されたデータセットは、強化学習の一種であるGRPO (Generalized Policy Optimization) を用いてLLMをファインチューニングするために利用されます。GRPOは、エージェントが環境と相互作用しながら、より良い行動戦略を学習するためのアルゴリズムです。このプロセスを通じて、LLMは合成された多段階のツール呼び出し軌跡から、より複雑なタスクを効率的かつ正確に実行する能力を獲得します。

実験結果と評価

本研究では、EDGEで合成されたデータセットとGRPOによるファインチューニングの有効性を、KOPA-Benchおよび既存のBFCLベンチマークで評価しています。

その結果、EDGEによってファインチューニングされた90億パラメータ(9B)のモデルが、チューニングされていない同じファミリーの270億パラメータ(27B)のモデルと「ほぼ同等の性能(nearly matches)」を達成したことが報告されています。これは、モデルのパラメータ数が大幅に少ないにもかかわらず、EDGEによる高品質なデータ合成と効果的なファインチューニングによって、大規模モデルに匹敵する多段階ツール呼び出し能力を獲得できることを示しています。

さらに、KOPA-Benchだけでなく、既存のBFCLベンチマークにおいても、ファインチューニングされたモデルが大幅な性能改善を示しました。これらの結果は、EDGEが多様なドメインやタスクにおいて、オープンソースLLMの多段階ツール呼び出し能力を効果的に向上させることができる汎用性の高い手法であることを強く裏付けています。

実用への示唆

この研究は、日本のソフトウェアエンジニアやML/AI研究者にとって、いくつかの重要な示唆を与えています。

  1. 公共機関や企業のDX推進 データ主権やセキュリティ要件が厳しい公共機関や大企業では、オンプレミスで運用可能なオープンソースLLMエージェントへの需要が高まっています。本研究は、このような環境下で、複数の既存システム(API)を連携させる複雑な業務プロセスをLLMエージェントに自動化させるための、具体的な手法と評価基準を提供します。

  2. オープンソースLLMの活用促進 これまで大規模商用モデルに比べて性能が劣るとされてきたオープンソースLLMでも、特定のドメインに特化した高品質な訓練データを適切に与えることで、その能力を大幅に引き上げられることが示されました。これにより、限られたリソースでも高性能なLLMエージェントを開発できる可能性が広がります。

  3. ドメイン特化型エージェント開発への応用 EDGEのようなデータ合成手法は、特定の業界や企業独自のAPI群を持つ環境において非常に有効です。手作業でのアノテーションが困難な複雑なAPI連携シナリオでも、自動的に高品質な訓練データを生成し、ドメインに最適化されたLLMエージェントを効率的に開発するための強力なツールとなり得ます。日本の企業が持つレガシーシステムやSaaS(Software as a Service)連携の自動化に応用することで、業務効率化や新たなサービス創出に貢献できるでしょう。

  4. 訓練データ不足問題へのアプローチ 複雑なタスクのLLMエージェント開発における最大の課題の一つが、訓練データの不足です。EDGEは、実際のAPI実行を通じて検証されたデータを合成することで、この問題を根本から解決するアプローチを示しており、同様のデータ不足に直面する他の分野の研究開発にも応用できる可能性があります。

まとめ

本研究は、公共機関におけるオープンソースLLMエージェントの多段階ツール呼び出し能力の課題に対し、実世界に基づいたベンチマークKOPA-Benchと、ライブAPI実行に基づく動的なデータ合成手法EDGEを提案しました。

EDGEは、API間の依存関係をグラフ化し、実際のAPI呼び出しで有効性を検証しながら、実行可能な多段階のツール呼び出し軌跡を自動合成します。このデータを用いてGRPOによってファインチューニングされた9Bモデルは、未チューニングの27Bモデルに匹敵する性能を達成し、オープンソースかつ小規模なLLMでも高度なAPI連携能力を実現できることを実証しました。この成果は、データ主権が重視される環境でのLLMエージェントの導入を加速させ、より実用的で信頼性の高いAIエージェントの開発に大きく貢献するものです。

元論文

関連書籍・学習リソース


※ 本記事には Amazon アソシエイト・楽天アフィリエイト・A8.net 等のアフィリエイト広告が含まれる場合があります。リンクから商品・サービスが購入された場合、紹介料を受け取ることがあります。

Continue reading

全記事
Archive Home