finm137.wiki
Computer Use
最終更新:
Bot(ページ名リンク)
-
view
概要
Computer Use(コンピューターユース)とは、AIが人間の代わりにパソコンの画面を見て、マウスやキーボードを操作する仕組みである。
簡単に言えば、
「AIに目と手を与えて、PCを自動操作させる技術」
である。
AIがスクリーンショットを読み取り、
- どこにボタンがあるか
- 何をクリックすべきか
- どこへ文字を入力するか
- 次に何をすべきか
を判断し、実際にクリック、ドラッグ、スクロール、キー入力などを行う。
従来のAIが「操作方法を文章で説明する」だけだったのに対し、Computer UseではAI自身がその操作を実行する。
2026年現在では、OpenAI、Anthropic、UI-TARSなど複数のAIシステムでComputer Use系の仕組みが実用化・研究されている。
仕組み
Computer Useの基本的な流れは非常に単純。
画面をスクリーンショットとして取得
↓
AIが画像を認識
↓
現在の画面状態を理解
↓
次の操作を決定
↓
マウス・キーボードを操作
↓
再び画面を確認
↓
目的達成まで繰り返す
↓
AIが画像を認識
↓
現在の画面状態を理解
↓
次の操作を決定
↓
マウス・キーボードを操作
↓
再び画面を確認
↓
目的達成まで繰り返す
というループで動作する。
OpenAIのComputer Useも、モデルが画面画像を確認し、クリックや文字入力などの操作を返す構造になっている。
つまり本質的には、
「画面を見るAI」
「マウスとキーボードを操作する仕組み」
の組み合わせである。
できること
Computer Useでは、一般的なパソコン操作を自動化できる。
例として、
- Webブラウザを開く
- 検索する
- Webサイトを移動する
- ボタンをクリックする
- フォームへ文字を入力する
- ファイルを開く
- フォルダを移動する
- 設定画面を操作する
- Office系ソフトを操作する
- Blenderを操作する
- 画像編集ソフトを操作する
などがある。
専用APIが存在しないソフトでも、
「人間が画面を見て操作できるなら、AIにも操作させられる」
というのがComputer Useの大きな特徴である。
Computer UseとMCPの違い
Computer UseとMCPは似ているようで仕組みが違う。
Computer Use
→ AIが実際の画面を見て、マウス・キーボードを操作する
→ AIが実際の画面を見て、マウス・キーボードを操作する
MCP
→ AIが専用ツールやAPIを通して、アプリ内部の機能を直接呼び出す
→ AIが専用ツールやAPIを通して、アプリ内部の機能を直接呼び出す
たとえばBlenderの場合、
Computer Useでは、
Blenderの画面を見る
↓
ボタンを探す
↓
マウスでクリック
↓
オブジェクトを動かす
↓
ボタンを探す
↓
マウスでクリック
↓
オブジェクトを動かす
という人間に近い操作をする。
MCPでは、
「立方体を追加」
「座標を変更」
「マテリアルを設定」
「座標を変更」
「マテリアルを設定」
などをBlender側の機能へ直接送る。
つまり、
Computer Use
=人間の代わりにGUI操作
=人間の代わりにGUI操作
MCP
=ソフトウェア内部へ直接命令
=ソフトウェア内部へ直接命令
という違いがある。
BlenderでのComputer Use
2026年現在、Computer Useが特に注目されている分野のひとつがBlenderなどの3DCGソフトである。
AIが画面を見ながら、
- オブジェクトを追加
- 移動
- 回転
- 拡大縮小
- 編集モード切り替え
- マテリアル調整
- レンダリング
- 設定変更
などを行うことができる。
そのためSNSでは、
「AIだけで3Dモデリングできる」
「3Dモデラーの仕事がなくなる」
「3Dモデラーの仕事がなくなる」
といった話題になることもある。
しかし仕組みそのものは、
「AIがBlenderを自動操作している」
というもの。
AIがBlenderそのものを置き換えているわけではない。
UI-TARS
Computer Use系の代表例のひとつがUI-TARSである。
UI-TARSはVision-Language Modelを利用したGUI Agentで、
- スクリーンショット認識
- 自然言語による命令
- マウス操作
- キーボード操作
- スクロール
- ドラッグ
- ブラウザ操作
などに対応している。
UI-TARS DesktopではWindowsやmacOS上でローカルPCを操作できる。
さらにローカルモデルを利用する構成も可能。
2025年にはUI-TARS-2が公開され、GUI操作だけでなくゲーム・コード・ツール利用なども統合したAgentモデルへ発展している。
ローカルComputer Use
Computer UseはクラウドAIだけの技術ではない。
ローカルVLMと操作ライブラリを組み合わせれば、自分のPC内だけで動かすことも可能。
基本構成は、
VLM
↓
画面認識
↓
操作判断
↓
PyAutoGUIなど
↓
マウス・キーボード操作
↓
画面認識
↓
操作判断
↓
PyAutoGUIなど
↓
マウス・キーボード操作
となる。
UI-TARS DesktopでもOllamaなどを利用したローカル構成が存在する。
そのためRTX 4080級のGPUがあれば、小型VLMを利用したローカルComputer Use環境も現実的である。
推共Computer Use
Computer Useをさらに発展させる場合、
「画面を見てクリックする」
だけではなく、
「ユーザーが本当に何をしようとしているのか」
まで理解する必要がある。
ここで利用できるのが推共システムである。
推共Computer Useでは、
ユーザーの指示
↓
過去の会話
↓
現在の画面
↓
作業目的
↓
最終的に何を完成させたいか
↓
過去の会話
↓
現在の画面
↓
作業目的
↓
最終的に何を完成させたいか
をまとめて判断する。
たとえば、
「犬を作って」
という指示でも、
通常のComputer Use
→ とにかく犬っぽいモデルを作る
→ とにかく犬っぽいモデルを作る
推共Computer Use
→ ユーザーが以前指定したデザイン
→ デフォルメ具合
→ 使用目的
→ Blender内の現在の作業状態
→ ユーザーが以前指定したデザイン
→ デフォルメ具合
→ 使用目的
→ Blender内の現在の作業状態
まで考えて操作する。
つまり、
Computer Use
=PC操作AI
=PC操作AI
推共Computer Use
=目的理解付きPC操作AI
=目的理解付きPC操作AI
となる。
PlannerとActor
Computer Useシステムでは、
Planner
Actor
Actor
の2つに分ける設計もある。
Plannerは、
「次に何をすべきか」
を考える。
Actorは、
「実際にクリックする」
役割。
例:
ユーザー
「Blenderで犬を作って」
「Blenderで犬を作って」
Planner
「まず胴体を作る必要がある」
「まず胴体を作る必要がある」
Actor
「Add Meshをクリック」
「Add Meshをクリック」
Planner
「次に頭を追加」
「次に頭を追加」
Actor
「UV Sphereを追加」
「UV Sphereを追加」
という流れ。
推共システムを使う場合、Planner側へ組み込むことで、
「なぜその作業をするのか」
まで判断させられる。
Computer Useの弱点
Computer Useには弱点もある。
画面変更に弱い
ボタン位置やUIデザインが変わると操作を間違える場合がある。
誤クリック
画像認識を間違えると別のボタンを押すことがある。
処理が遅い
人間と同じように、
見る
↓
考える
↓
操作する
↓
考える
↓
操作する
を何度も繰り返すため、専用APIより遅いことが多い。
長時間作業
途中で画面状態を誤認すると、作業全体が崩れることがある。
GPU性能
ローカルでVLMを動かす場合、GPU性能やVRAMが重要になる。
Computer Useと自動化
Computer Useは昔からあるRPAやマクロと似ている。
しかし違いは、
従来のRPA
→ 決められた位置をクリック
→ 決められた位置をクリック
Computer Use
→ AIが画面を理解してクリック
→ AIが画面を理解してクリック
という点。
たとえばボタンの位置が変わっても、
「青い保存ボタン」
と理解できれば操作を続けられる可能性がある。
そのためComputer Useは、
「AI版RPA」
とも考えられる。
Computer UseとAI Agent
Computer Use単体では、
「操作する手」
に近い。
そこへLLM、検索、記憶、推共、ツール利用などを追加すると、
AI Agent
になる。
例:
ユーザー
「Blenderで犬モデルを完成させて」
「Blenderで犬モデルを完成させて」
AI Agent
↓
作業計画を作る
↓
資料を検索
↓
BlenderをComputer Useで操作
↓
レンダリング結果を確認
↓
修正
↓
完成
↓
作業計画を作る
↓
資料を検索
↓
BlenderをComputer Useで操作
↓
レンダリング結果を確認
↓
修正
↓
完成
という自律作業が可能になる。
Ibeeusasaaへの応用
IbeeusasaaへComputer Useを組み込む場合、
推共LLM
VLM
Computer Use
ローカルツール
という構成が考えられる。
例:
Ibeeusasaa
↓
ユーザーの目的を推共
↓
スクリーンショット取得
↓
VLMで画面認識
↓
Plannerが次の作業を決定
↓
ActorがPC操作
↓
結果確認
↓
修正
↓
ユーザーの目的を推共
↓
スクリーンショット取得
↓
VLMで画面認識
↓
Plannerが次の作業を決定
↓
ActorがPC操作
↓
結果確認
↓
修正
これを繰り返す。
単純なComputer Useでは、
「AIがPCを操作する」
だけ。
Ibeeusasaaでは、
「AIが目的を理解しながらPCを操作する」
方向へ発展させることができる。
まとめ
Computer Useとは、
「AIが画面を見て、マウスとキーボードを使って、人間の代わりにPCを操作する技術」
である。
基本構造は、
画面を見る
↓
考える
↓
操作する
↓
確認する
↓
考える
↓
操作する
↓
確認する
という非常に人間的なもの。
MCPのようにアプリ内部へ直接命令する方式とは異なり、
「人間が普通に使っているGUIをそのままAIに使わせる」
ところが最大の特徴である。
2026年現在では、
OpenAI
Anthropic
UI-TARS
Anthropic
UI-TARS
など複数のComputer Use系技術が存在している。
今後は、
Computer Use
推共
ローカルLLM
VLM
AI Agent
を組み合わせることで、
「ただPCを自動操作するAI」
から、
「目的を理解し、自分で考えてPC作業を進めるAI」
へ発展していくと考えられる。









