Google、「Gemini 3.5 Flash」に「Computer Use」を標準搭載──AIが画面を見てブラウザやアプリを操作

元記事: https://www.itmedia.co.jp/aiplus/article/2606/25/2000000127/

公開日時: 2026年06月25日 10:08

要約

Googleは2026年6月24日(現地時間)、AIモデル「Gemini 3.5 Flash」に、画面認識に基づいた自動操作機能「Computer Use」を標準搭載したと発表しました。この機能により、開発者はWebブラウザやモバイル・デスクトップ環境で動作するエージェントを構築できます。これは、従来の文章生成とは異なり、AIがスクリーンショットを通じて「見て」、クリックや入力といった具体的な操作を連鎖的に実行し、タスクを完了させる点が特徴です。本機能の最大のポイントは、これまで専用モデル(Gemini 2.5 Computer Use)だった機能を主力モデルにネイティブ統合したことであり、企業の業務自動化や継続的なソフトウェアテストなど、長時間に及ぶ複雑なタスクへの応用が期待されています。Googleは安全性のため、敵対的トレーニングやユーザー確認プロセスなどの多層防御策を講じています。

主要ポイント

  • AIモデル「Gemini 3.5 Flash」に、画面認識と自動操作機能「Computer Use」が標準搭載された。(発表日:2026年6月24日)
  • Computer Useは、AIがスクリーンショットから次の操作(クリックや入力など)を提案し、開発者コードが実行するサイクルでタスクを完了させる仕組みである。
  • この機能の統合により、専用モデル「Gemini 2.5 Computer Use」相当の能力が主力モデルに組み込まれ、エージェント型の業務自動化が可能になった。
  • 想定される活用先は、継続的なソフトウェアテストや、複数の専門アプリケーションをまたぐ長時間のナレッジワークなどである。
  • 安全性対策として、敵対的トレーニングに加え、機密性の高い操作前にはユーザーへの明示的な確認プロセスが提供される。

Summarized by S.I.V.A. - Node: Beta