論文解説 14 min read

大規模言語モデルの自律的ツール利用を強化するMidTool:中間学習データ合成のアプローチ

LLMのエージェント能力向上には汎用ツール利用が不可欠です。本記事では、中間学習に焦点を当てた新しいデータセット「MidTool」が、Qwenモデルでツール利用能力を大幅に改善した研究を紹介。実世界のタスクに応用できるAIエージェント開発への示唆を探ります。

AI Frontier 編集部 によって編集・公開

大規模言語モデル(LLM)は、私たちの日常やビジネスにおける多くの課題解決に貢献する可能性を秘めています。特に近年、LLMが単にテキストを生成するだけでなく、外部のツールを自律的に利用し、複雑なタスクをこなす「AIエージェント」としての能力が注目されています。

しかし、このエージェント能力、特に汎用的なツール利用能力の訓練にはまだ課題が残されています。既存の研究では、数学的な推論やソフトウェアエンジニアリングにおけるエージェント能力など、特定のドメインに焦点を当てた能力強化が進められてきましたが、カレンダー、Web検索、コード実行、文書解析といった多岐にわたる一般的なツールを状況に応じて適切に使いこなす能力については、十分に探索されていませんでした。

このような背景のもと、本論文では「MidTool」という新しいアプローチを提案しています。これは、大規模言語モデルがツールを効果的に利用するための能力を、モデルの「中間学習(mid-training)」という段階で集中的に育成するためのデータセット構築パイプラインです。この研究は、汎用的なツール利用能力もまた、他の重要なLLM能力と同様に、専用の中間学習から大きな恩恵を受けることを示しています。

この研究の新規性

この研究の最も重要な新規性は、LLMの学習プロセスにおける「中間学習」という段階に注目し、汎用ツール利用能力のために特化したデータセット「MidTool」を構築した点にあります。

これまでのLLMの学習は、大規模なテキストデータによる「事前学習(pre-training)」と、特定のタスクに適応させるための「事後学習(post-training)」や「ファインチューニング(fine-tuning)」が主な焦点でした。しかし、本研究では、事前学習と事後学習の間に位置する「中間学習」が、より高度な推論能力やエージェント能力の形成に不可欠であると考えています。

MidToolは、単にツールAPIの呼び出し方を教えるだけでなく、モデルが以下のような複雑な能力を獲得できるよう設計されています。

  • ツールの機能認識(Tool Affordances): 与えられたツールが「何ができるのか」を正確に理解する能力。
  • 文脈からの引数抽出(Ground Arguments from Context): ユーザーの指示や現在の状況(文脈)から、ツールを呼び出すために必要な引数を適切に特定し、抽出する能力。
  • ツール呼び出しワークフローの構成(Compose Tool Call Workflow): 複数のツールを組み合わせて、一連の論理的なステップ(ワークフロー)を構築し、目標を達成する能力。
  • 不完全な情報からの回復(Recover from Incomplete Information): 情報が不足している場合でも、質問をしたり、仮定を立てたりするなどして、問題を解決しようと試みる能力。

これらの能力は、従来の事後学習だけでは十分に引き出しにくい、より深い推論と計画のスキルを要します。MidToolは、実世界の多様なデータと、実際のツールAPIや複雑なスキルを模倣した合成された教師信号を組み合わせることで、これらの能力を効率的にモデルに学習させようとしています。

技術的な核心

MidToolの技術的な核心は、そのデータセット構築パイプラインと、それを活用した中間学習のプロセスにあります。

MidToolデータセット構築パイプライン: このパイプラインは、エージェント的ツール利用に必要な多様な知識と推論パターンをモデルに提供するために、以下の異なるソースのデータを組み合わせています。

  1. 大規模なウェブ、PDF、コードデータ: これらは、モデルが一般的な知識、ドキュメントの理解、コードの構造といった基本的な理解を得るための基盤となります。例えば、PDFから情報を抽出する方法や、コードスニペットから関数の使い方を学ぶといった能力の基礎を養います。

  2. 実世界のツールAPIからの合成された教師信号: 実際のツールAPI(例: カレンダーAPI、検索API、計算APIなど)の仕様や利用例に基づき、モデルがAPIを正しく呼び出すための知識を合成します。これには、APIの目的、必要な引数、返される結果の形式などが含まれます。これにより、モデルは単にAPIのドキュメントを読むだけでなく、実際にAPIを「使う」ための具体的な手順を学習します。

  3. MCP (Multi-level Chain-of-Thought Planning) スキルからの合成された教師信号: MCPは、複雑なタスクをより小さな、管理しやすいサブタスクに分解し、それぞれに適切なツールを適用するような多段階の推論プロセスを指します。MidToolは、このような思考の連鎖(Chain-of-Thought)を通じて、モデルが複雑な問題を計画的に解決する能力を合成データとして学習させます。これにより、モデルは複数のツールを順序立てて利用したり、条件分岐を考慮したりする高度なワークフローを構築できるようになります。

  4. 文書に基づいたワークフロー(Document-grounded workflows): 特定のドキュメント(例えば、製品マニュアルや会社の規定)から情報を抽出し、その情報に基づいてツールを呼び出すようなシナリオを想定したデータです。これは、LLMが情報を「読む」だけでなく、その情報に基づいて「行動する」能力を強化するために重要です。

これらの多様なデータソースを組み合わせることで、MidToolはモデルに、ツールの意味を理解し、文脈から関連情報を抽出し、複雑な問題を解決するためにツールを構成し、さらには不完全な情報に直面しても対応できる、強靭なツール利用能力を習得させます。

中間学習のプロセス: 構築されたMidToolデータセットは、事前学習済みのLLMに対して中間学習の段階で投入されます。この段階で、モデルは汎用的なツール利用に特化した知識、推論ロジック、問題解決パターンを深く学習します。これにより、モデルは後続の特定のタスクへのファインチューニング(事後学習)において、より効率的かつ高性能なエージェントとして振る舞うための強固な基盤を築くことができるのです。

実験結果と評価

本研究では、オープンソースのQwen3-4B-BaseおよびQwen3-8B-Baseモデルをベースラインとして、MidToolによる中間学習の有効性を評価しています。実験プロセスは以下の通りです。

  1. 中間学習: まず、Qwen3モデルをMidTool-Mixデータセットで中間学習を行います。MidTool-Mixは、MidToolの主要データに加えて、ウェブ、PDF、コードなどの一般的なデータソースも含むと考えられます。これにより、モデルは汎用的なツール利用能力の基礎を築きます。

  2. 後処理学習: 中間学習を終えたモデルに対し、さらに「教師ありファインチューニング(SFT)」と「強化学習(RL)」の両方を適用して後処理学習を行います。これは、より具体的なタスクへの適応と、望ましい行動の強化を目指すものです。

評価は、ツール利用能力を測るための複数のベンチマークで行われました。具体的には、BFCL、tau2-Bench、そしてMCP Universeというベンチマークが使用されています。これらのベンチマークは、それぞれ異なる側面からLLMのツール利用や推論能力を評価するために設計されたものです。

結果として、MidTool-Mixを用いて中間学習を行ったモデルは、ベースラインと比較して、これらのベンチマークにおいて一貫して下流タスクのパフォーマンスを向上させることが示されました。この性能向上は、教師ありファインチューニングと強化学習の両方の設定下で確認されており、MidToolによる中間学習がモデルの汎用ツール利用能力を効果的に強化することを示唆しています。

実用への示唆

MidToolの研究は、AIエージェントの開発に取り組む日本の技術者や研究者にとって、いくつかの重要な示唆を与えています。

まず、この研究は、大規模言語モデルが自律的にツールを使いこなす能力を向上させるために、「中間学習」というフェーズが極めて効果的であることを明確に示しています。これは、これまで事前学習と事後学習に偏りがちだったモデル開発のワークフローに、新たな最適化ポイントを提示するものです。特に、複雑な推論や計画が必要なエージェントシステムを構築する際には、MidToolのような専用の中間学習を導入することで、モデルの基礎能力を飛躍的に向上させられる可能性があります。

次に、MidToolのデータセット構築パイプラインは、高品質な訓練データを作成するための具体的なヒントを提供します。実世界のデータと、実際のツールAPIや複雑なスキルから「合成された教師信号」を組み合わせるアプローチは、限られたアノテーションリソースの中で、多様かつ網羅的な訓練データを作成する上で非常に有効です。これにより、特定のドメインに特化せず、様々な種類のツール(例えば、社内システムAPI、外部SaaS連携、データ分析ツールなど)を使いこなせる汎用AIエージェントの実現に貢献できるでしょう。

さらに、モデルがツールの機能認識、引数抽出、ワークフロー構成、不完全情報からの回復といった高度な能力を学習できることは、より頑健(ロバスト)で信頼性の高いAIエージェントの開発に繋がります。これにより、ユーザーの指示が曖昧であったり、想定外の状況に直面したりした場合でも、エージェントが自律的に問題を解決しようと試みる能力が高まります。これは、お客様サポート、業務自動化、パーソナルアシスタントなど、多岐にわたる実用アプリケーションにおいて、ユーザー体験を大きく向上させる要素となるはずです。

まとめ

本記事では、大規模言語モデルの汎用ツール利用能力を中間学習によって強化する新しいアプローチ「MidTool」を紹介しました。MidToolは、大規模なウェブデータ、PDF、コードに加え、実世界のツールAPIや複雑な思考プロセスから合成された教師信号を組み合わせることで、モデルがツールの機能認識、文脈からの引数抽出、ツール呼び出しワークフローの構成、不完全情報からの回復といった高度な能力を習得できるよう設計されています。

Qwen3モデルを用いた実験では、MidToolによる中間学習が、下流のツール利用タスクにおいてベースラインモデルのパフォーマンスを一貫して向上させることが確認されました。この結果は、汎用ツール利用能力も、他のLLMの重要な能力と同様に、専用の中間学習から大きな恩恵を受けることを示唆しています。

MidToolの研究は、より高度で自律的なAIエージェントの開発に向けた重要な一歩であり、今後のLLMの進化において中間学習の役割がますます重要になることを予感させます。日本の技術者や研究者の皆様が、この知見を自身のプロダクトや研究に応用することで、新たな価値創造に繋がることを期待いたします。

元論文

関連書籍・学習リソース


※ 本記事には Amazon アソシエイト・楽天アフィリエイト・A8.net 等のアフィリエイト広告が含まれる場合があります。リンクから商品・サービスが購入された場合、紹介料を受け取ることがあります。

Continue reading

全記事
Archive Home