論文解説 14 min read

ウェブエージェントの行動選択を革新:識別的なワールドモデル「Predicted-State Matching」を解説

ウェブエージェントの行動精度を飛躍的に向上させる新手法「Predicted-State Matching」を解説します。予測状態の識別能力を高めることで、従来のワールドモデルが抱えていた下流タスクとのミスマッチを解消し、タスク成功率を大幅に改善する技術詳細と実用への示唆を探ります。

AI Frontier 編集部 によって編集・公開

ウェブエージェントの課題を克服する新しいワールドモデル

近年、ウェブ上で様々なタスクを自動実行する「ウェブエージェント」の研究開発が活発です。これらのエージェントは、ウェブサイトを閲覧し、フォームに入力したり、情報を抽出したりといった複雑な操作を人間の指示に基づいて行います。その中核となる技術の一つが「ワールドモデル(環境モデル)」です。

ワールドモデルとは、エージェントが次にどのような行動を取るべきかを判断するために、現在の状態から次のウェブ状態を予測するモデルのことです。例えば、「このボタンをクリックしたら、次にどんなページが表示されるか」を事前にシミュレーションする役割を担います。ウェブエージェントは、この予測された状態に基づいて複数の候補となる行動の中から最適なものを選び、タスクを遂行していきます。

しかし、従来のワールドモデルには大きな課題がありました。多くの場合、ワールドモデルは「次のウェブ状態を正確に生成すること」を目的に教師あり学習で訓練されます。具体的には、HTML構造やAXTree(アクセシビリティツリー)のスナップショットといった固定的な表現を予測するのです。このアプローチは、予測された状態の「詳細な見た目」を再現することには長けていますが、エージェントの最終目標である「最適な行動選択」という下流タスクとの間にミスマッチが生じていました。

なぜなら、行動選択の精度を高めるためには、単に次の状態を正確に予測するだけでなく、「ある行動が他の行動と比べてどれだけ良い結果をもたらすか」という、行動間の違いを明確に識別できるような状態表現が求められるからです。既存のワールドモデルが生成する状態表現は、この「識別能力」が不足しているため、後続の行動をランク付けするモデル(ランカーモデルやProcess Reward Model; PRM)が真に効果的な行動を見極めることを難しくしていました。結果として、ウェブエージェントのタスク成功率が頭打ちになる原因となっていたのです。

今回ご紹介する論文では、この課題を解決するため、新しい学習目標「Predicted-State Matching (予測状態マッチング)」を導入した識別的なワールドモデルを提案しています。これは、ウェブエージェントの行動選択を根本から改善する可能性を秘めた画期的なアプローチと言えるでしょう。

この研究の新規性

本研究の最も重要な新規性は、従来のワールドモデルの学習目標を「次の状態を正確に予測すること」から「候補となる行動の中から真に最適な状態を識別できる表現を学習すること」へと大きく転換した点にあります。

既存のワールドモデルは、教師あり学習に基づいて、ある行動を取った際に得られるHTMLやAXTreeといったウェブ状態の具体的なスナップショットを生成するように訓練されます。これは、状態の「生成品質」を最大化することを目指しますが、異なる行動がもたらす状態間の微妙な違いや、その違いがタスクの成功にどう影響するかといった「識別情報」を効率的に捉えることを苦手としていました。言い換えれば、似たようなウェブページの状態表現が、実際には全く異なるタスクの進捗を意味する場合でも、その違いを明確に区別する能力に欠けていたのです。

これに対し、本研究が提案する「Predicted-State Matching」は、予測される状態表現が「真に望ましい結果状態」を、他の「代替行動によって到達する結果状態」から明確に区別できるように学習することを目的とします。これは、従来の生成モデル的なアプローチとは異なり、対照学習(Contrastive Learning)のような識別的な学習パラダイムにインスパイアされています。

このブレイクスルーにより、ワールドモデルは単に未来のウェブ状態を「予測」するだけでなく、それぞれの行動がタスクの進行に与える「価値の違い」を、その状態表現の中に織り込むことができるようになります。結果として、下流のランカーモデルやPRMが、より確信を持って最適な行動を選択できるようになり、ウェブエージェント全体の性能向上に直結します。

さらに、この研究では、複数の代替行動とその結果の状態がペアになった「分岐ウェブエージェントデータセット」を構築し、この新しい学習目標を効果的に訓練しています。これにより、現実世界の複雑なウェブ環境における多様な選択肢の中から、エージェントが適切な判断を下すための強固な基盤を提供している点も特筆すべき新規性と言えるでしょう。

技術的な核心

本研究の技術的な核心は、「Predicted-State Matching(予測状態マッチング)」と呼ばれる新しい学習目的と、それに基づいて訓練される「Discriminative World Models(識別的なワールドモデル)」にあります。

まず、識別的なワールドモデルは、従来のワールドモデルと同様に、現在のウェブ状態とエージェントが取る候補となる行動を入力として受け取ります。そして、その行動を取った場合に到達すると予測される次のウェブ状態の表現を生成します。しかし、この状態表現の学習方法が大きく異なります。

従来のワールドモデルが、予測された状態表現が実際の次のウェブ状態のグラウンドトゥルース(正解)とどれだけ「一致するか」を評価する損失関数(例えば、ピクセル単位のL1損失やHTMLトークンに対するクロスエントロピー損失)を用いて訓練されるのに対し、Predicted-State Matchingでは、予測された状態表現が「真の結果状態」と「代替行動による結果状態」をどれだけ明確に「区別できるか」を学習の目標とします。

具体的には、学習データとして、ある決定点において複数の代替行動とその結果として得られるウェブ状態の組が与えられます。例えば、あるWebページで3つのボタンA、B、Cがあり、それぞれをクリックした結果が状態SA、SB、SCとして観測されたとします。エージェントが実際にボタンAをクリックし、状態SAに遷移したとすると、SAが「真の結果状態」となります。一方で、SBやSCは「代替行動によって到達し得る結果状態」となります。

Predicted-State Matchingの学習プロセスでは、ワールドモデルが行動Aをシミュレーションして生成した予測状態表現が、実際の状態SAの表現に「近く」、かつ、行動BやCをシミュレーションして生成した予測状態表現は、状態SAの表現から「遠くなる」ように、モデルのパラメータを調整します。これにより、モデルは異なる行動がもたらす状態間の「意味的な距離」を学習し、真に望ましい状態とそうでない状態を明確に識別できるような表現空間を構築するのです。

この学習には、一般的に対照学習(Contrastive Learning)のフレームワークが用いられると考えられます。これは、ポジティブペア(真の結果状態とそれに対応する予測状態)の類似度を最大化し、ネガティブペア(代替行動の結果状態と真の予測状態)の類似度を最小化するような損失関数を用いることで実現されます。これにより、予測された状態表現は、ウェブエージェントが「どの行動が最もタスクを前進させるか」を判断するために必要な情報、つまり「識別力」を内在するようになります。

この識別的なワールドモデルは、その後、Process Reward Model (PRM)のようなランク付けモデルと組み合わせて使用されます。PRMは、エージェントの複数の候補行動それぞれについて、ワールドモデルが予測した状態表現を受け取り、それらの状態がタスクの成功にどれだけ寄与するかを評価し、最終的な行動のスコアを算出します。Predicted-State Matchingによって訓練されたワールドモデルは、PRMがより正確に状態の価値を評価し、最適な行動をランキングできるよう支援するのです。

このアプローチは、WebArena Go-Browseのような複雑なウェブ環境から派生した「分岐ウェブエージェントデータセット」で効果的に訓練されます。このデータセットは、エージェントが複数の選択肢を持つ実際の意思決定シナリオを豊富に含んでおり、識別的なワールドモデルの学習に理想的な環境を提供します。

実験結果と評価

本研究では、提案手法である「Predicted-State Matching」で訓練された識別的なワールドモデルの有効性を複数のベンチマークで検証しています。

まず、独自の「predicted-state matching benchmark」を用いた評価では、提案手法が、従来の教師あり次の状態予測(supervised next-state prediction)で訓練されたワールドモデルよりも優れた性能を示すことが確認されました。このベンチマークは、予測された状態表現が、真の結果状態と代替行動による結果状態をどれだけ効果的に区別できるかを直接測定するように設計されており、提案手法の核心的な目的が達成されていることを定量的に示しています。

次に、ウェブエージェントの行動選択性能を評価するためのベンチマークである「WebPRMBench」を用いた実験では、提案手法がProcess Reward Model(PRM)スタイルのアクションランキングにおいて顕著な改善をもたらすことが示されました。具体的には、行動情報のみを使用する「action-only PRMs」や、教師あり次の状態予測ワールドモデルを組み込んだPRMと比較して、本手法の識別的なワールドモデルと組み合わせたPRMがより高いランキング精度を達成しました。これは、ワールドモデルが生成する状態表現の識別能力が向上したことで、PRMがより正確に最適な行動を評価できるようになったことを意味します。

最後に、エンドツーエンドのタスク成功率を評価する「WebArena-Lite」ベンチマークでの実験結果も報告されています。この評価では、テスト時(推論時)の行動選択に本研究の識別的なワールドモデルを使用することで、ウェブエージェントの全体的なタスク成功率が向上することが示されました。これは、個々の構成要素の性能向上だけでなく、システム全体としての実用的な効果が確認されたことを意味します。より賢明な行動選択が可能になったことで、エージェントがより複雑なウェブタスクを効率的に、そして正確に完了できるようになったと言えるでしょう。

これらの結果は、Predicted-State Matchingが従来のワールドモデルの限界を克服し、ウェブエージェントの性能を飛躍的に向上させる強力なアプローチであることを明確に裏付けています。

実用への示唆

本研究で提案された識別的なワールドモデルは、ウェブエージェントの実用化において非常に大きな示唆をもたらします。以下に主な点を挙げます。

  1. ウェブエージェントの頑健性向上: 従来のワールドモデルが抱えていた「下流タスクとのミスマッチ」が解消されることで、エージェントはより確信を持って行動を選択できるようになります。これにより、ウェブサイトのUI(ユーザーインターフェース)がわずかに変更された場合や、予期せぬ要素が出現した場合でも、エージェントが適切な対応を取るための頑健性(ロバストネス)が向上すると期待できます。

  2. 複雑なウェブタスクへの適用拡大: 予測される状態表現がより識別的になることで、エージェントはより複雑で多段階なウェブタスクにも対応しやすくなります。例えば、特定の情報を探し出して複数ページにわたるフォームに入力したり、異なるウェブサービスを連携させたりといった高度なシナリオにおいても、より正確な意思決定が可能になるでしょう。これにより、データ収集、ウェブテスト、カスタマーサポートの自動化など、多岐にわたるビジネスプロセスへの応用が考えられます。

  3. より高度なAIアシスタントの開発: 人間が意図するタスクをウェブ上で代行するAIアシスタント(パーソナルAIエージェント)の実現にも貢献します。ユーザーの指示をより正確に解釈し、最適な行動を自動で実行できるようになることで、生産性向上やユーザーエクスペリエンスの改善に繋がります。

  4. 環境モデル設計へのパラダイムシフト: 本研究は、環境モデルの設計思想に一石を投じるものです。単に環境を正確に「生成」するだけでなく、エージェントの行動選択という最終目標に資する形で「識別」能力を高めることの重要性を示しました。これは、強化学習やプランニングが関わる他のドメイン(ロボティクス、ゲームAIなど)におけるワールドモデルやシミュレーターの開発にも、同様の考え方を適用する可能性を示唆しています。

  5. データ効率の改善: 分岐ウェブエージェントデータセットのような、多様な選択肢とその結果を含むデータセットの活用は、エージェントがより効率的に学習し、現実世界での汎化能力を高める上で不可欠です。このようなデータ収集・構築のアプローチは、今後のエージェント開発において重要な要素となるでしょう。

このように、本研究はウェブエージェント技術の進化において、実用面での大きなインパクトをもたらす可能性を秘めていると言えます。

まとめ

本記事では、ウェブエージェントの行動選択精度を向上させるための新しいアプローチとして、識別的なワールドモデルと「Predicted-State Matching」の概念を解説しました。

従来のワールドモデルが、次のウェブ状態を正確に「生成すること」に主眼を置いていたため、行動選択という下流タスクに必要な「識別能力」が不足しているという課題がありました。これに対し、本研究は、予測された状態表現が真の結果状態と代替行動による結果状態を明確に「区別できる」ように学習する新しい目的を導入することで、この課題を克服しました。

実験結果は、提案手法が予測状態のマッチングベンチマーク、WebPRMBenchでのアクションランキング、そしてWebArena-Liteにおけるエンドツーエンドのタスク成功率において、既存の手法を上回る性能を発揮することを示しています。これにより、ウェブエージェントはより複雑なタスクを、より頑健かつ正確に実行できるようになることが期待されます。

この研究は、ウェブエージェントの実用化を加速させるだけでなく、環境モデルの設計における新たなパラダイムを示唆しており、AI分野全体に広く影響を与える可能性を秘めていると言えるでしょう。

元論文

関連書籍・学習リソース


※ 本記事には Amazon アソシエイト・楽天アフィリエイト・A8.net 等のアフィリエイト広告が含まれる場合があります。リンクから商品・サービスが購入された場合、紹介料を受け取ることがあります。

Continue reading

全記事
Archive Home