Knowledge Notebook
一覧に戻る

Gemini 3.5 Flashの画面操作機能「Computer Use」とは?特徴や仕組み、料金を整理

「AIが自分の代わりにPCの画面を見ながら、勝手に操作してくれたらいいのに」と考えたことはありませんか?

実は先日、Googleから「Gemini 3.5 Flash」に画面操作機能である「Computer Use」がネイティブ統合されたという発表がありました。自分自身はまだこの機能を直接動かしたわけではないのですが、非常に興味深い技術だったので、どのような仕組みで、何ができるのかを詳しく調べてみました。

すでにAnthropicのClaudeなどで話題になっていた画面操作エージェントですが、Googleが開発するGeminiシリーズの軽量モデルにこれが組み込まれたことで、実用性が一段と高まりそうです。

1. Gemini 3.5 Flashの「Computer Use」とは?

Gemini 3.5 Flashの「Computer Use」は、PCやスマートフォンの画面をAI自身が「見て、考えて、操作する」機能です。

これまでもAIによる自動化は行われてきましたが、それはあらかじめ用意されたAPIを叩くか、特定のプログラムを書く必要がありました。これに対して、Computer Useは人間が画面を見るのと同じようにスクリーンショットを受け取り、ボタンをクリックしたり、文字を入力したりといったUI操作を自律的に行います。

この新機能が「Gemini 3.5 Flash」に統合されたことで、実用化に向けたハードルが下がった印象を受けます。Flashモデルならではの高速な処理速度とコストの低さは、リアルタイムに画面を監視して操作を繰り返す仕組みに適しています。これにより、高額なコストをかけることなく自動化ツールの開発が進めやすくなります。

2. どのような仕組みで動くのか

AIが直接PCの内部OSにアクセスしてマウスを動かしているわけではありません。実際には、以下のような手順のループによって動作しています。

  1. クライアント側のスクリプトが画面のスクリーンショットを撮影する。
  2. その画像とユーザーからの指示をGemini APIへ送信する。
  3. Geminiが画像を解析し、「(x, y)の座標をクリックする」「キーボードで『〇〇』と入力する」といったアクション(JSONデータ)を返信する。
  4. クライアント側のスクリプトが、その指示に従ってOSのマウスやキーボードの操作イベントを発生させる。
  5. 操作後の画面を再びスクリーンショットしてGeminiに送り、次の指示を仰ぐ。

基本的にはAPIを介した関数呼び出し(Function Calling)の応用です。AIからは操作指示だけでなく、「なぜその操作を行うのか」という「意図(Intent)」もテキストで説明されるため、途中で意図しない挙動があった際にも開発者がデバッグしやすい設計になっています。

3. 想定される具体的なユースケース

この機能が普及することで、以下のような業務や作業が自動化できるようになります。

API非対応のレガシーシステムの操作

古い社内の業務管理画面など、APIが提供されていないシステムへのデータ入力は、これまで手動で転記せざるを得ませんでした。Computer Useを使えば、ブラウザを開いて所定の入力欄を探し、Excelのデータを1件ずつ転記するような定型作業をAIに任せることができます。

Webアプリケーションのテスト・品質保証

開発したWebサイトが正しく動作するかどうかを確認するE2E(エンドツーエンド)テストにおいて、AIに「サインアップして、マイページからプロフィール情報を変更してみて」と指示するだけで、人間のテストエンジニアの代わりに検証操作を実行させられます。

複数アプリを横断する日常作業の代理実行

「ブラウザで格安ホテルをいくつか検索し、空室状況を確認した上で、条件の良い候補のスプレッドシートを作成して」といった、複数のWebサイトやデスクトップアプリをまたぐ作業も、AIが画面を順番に切り替えながら進めることができます。

4. 気になる料金体系とコスト管理の注意点

Computer Use機能の利用自体に、特別な追加料金は発生しません。Gemini 3.5 Flashの通常のAPI利用料金に基づいて課金されます。

有料プランにおけるGemini 3.5 FlashのAPI基本料金は以下の通りです(100万トークンあたり)。

項目 料金(100万トークンあたり)
入力トークン $1.50
出力トークン $9.00

一見すると安価に見えますが、実務で運用する際には「画像(スクリーンショット)の送信頻度」に十分注意する必要があります。画面の画像データはテキストに比べて消費するトークン数が大きいため、1回の操作(ステップ)ごとに高解像度の画像を何度も送信すると、想定以上にコストが膨らむ可能性があります。画面の解像度を下げて送信する、変更がない場合は送信をスキップするなどの節約設計が重要になります。

5. 安全性とセキュリティへの配慮

画面操作をAIに委ねることには、当然リスクが伴います。悪意のあるWebサイトを開いてしまったり、誤って大事なデータを削除してしまったりする可能性があるからです。

これに対し、Google側ではスクリーンショット内に不審な文字列や指示(プロンプトインジェクション)が含まれていないかをチェックする機能を提供しています。また、開発者がシステムを構築する際には、「クレジットカード決済」や「データの削除」といった重大なアクションが実行される前に、必ず人間の承認を挟む設計(Human-in-the-loop)にすることが強く推奨されます。

6. まとめ

これまではプログラムの内部処理に終始していたAIですが、今回は「パソコンの画面を視覚的に捉えて作業する」という新しいアプローチに入りました。自分自身はまだ試していませんが、近いうちに開発環境で動かしてみたいと考えています。

PC操作の定型業務をAIが代行する仕組みは、現実のビジネス現場への導入が着実に近づいている印象を受けます。