会計業務AIの真の実力は?新ベンチマーク「APEX-Accounting」が示す最先端モデルの課題と可能性
最先端AIモデルが実際の会計業務をどこまでこなせるのか、MercorとRampが開発した新ベンチマーク「APEX-Accounting」が明らかにします。口座調整からレポート作成まで、専門家が設計したタスクで評価されたモデルの現状と課題、そして将来の可能性を探ります。
AIエージェントは自律的なAI研究を進められるか?未発表論文で試す「シャドウ評価」の初期検証
AIエージェントが自律的にAI研究を行う可能性について、未発表論文を用いた「シャドウ評価」による初期検証結果を解説します。現在のAIエージェントはエンジニアリング作業はこなせるものの、研究の核となる部分で課題を抱えていることが明らかになりました。
2026-07-30 AIニュース: MetaのAIエージェント展望、フィジカルAIの安全性、研究公開の課題、AIワームの脅威、政府AIの緊急活用
MetaのZuckerberg氏が個人AIエージェントの普及を予測。フィジカルAIにおける安全設計の重要性が高まる中、AIスタートアップの研究公開不足が指摘されています。また、Copilotを介したAIワームの脅威や、デジタル庁による緊急時の政府AI活用も注目されます。
$π\mathbf{R}^2$が実現する高反応ロボット操作:フローポリシーのリアルタイム課題を解決
$π\mathbf{R}^2$は、大規模事前学習済みモデルを活用したロボットのフローポリシーが抱えるリアルタイム応答遅延を解消します。自己受容感覚と視覚情報を分離し、遅延適応型スケジュールを導入。これにより操作の反応性が向上し、実機で成功率を30%改善。ロボット操作の課題を解決する画期的な技術です。
「バトンタッチ」で精度向上!軌道リレー型オンポリシー蒸留「Relay-OPD」がLLMの学習効率と堅牢性を高める
大規模言語モデルのオンポリシー蒸留における「Prefix Failure」を解決するRelay-OPDが登場。教示モデルが軌道をリレーすることで学習効率と精度を飛躍的に向上させ、数学的推論タスクで従来のOPDを大幅に上回り、トレーニング軌跡長も50%以上削減します。
2026-07-29 AIニュース: AI開発ペース調整論が活発化、Anthropicが暗号脆弱性発見
2026年7月29日のAI業界では、OpenAIやAnthropicの従業員がAI開発のペース調整を提言し、OpenAIのサム・アルトマンCEOも減速に言及。また、AnthropicのClaude Mythosが暗号アルゴリズムの新たな攻撃法を発見。OpenAI関連のセキュリティインシデントも報じられ、AIの安全性とリスクが改めて注目されています。
AIキャッチアップの時間を、 ほぼゼロに。
英語で書かれた研究論文や海外のAIニュースを読むのは時間がかかります。 AI Frontier は、そのハードルを下げるための実験的プロジェクトです。毎日公開される3本の記事から、あなたの関心に近いものだけ拾い読みしてください。
もっと詳しく