finm137.wiki
AI VTuber
最終更新:
kemonowikii
-
view



AI VTuber
概要
‘’‘AI VTuber(AITuber)’’’とは、LLM(大規模言語モデル)、音声合成、Live2D・VRMなどのアバター、YouTube等のコメント取得機能を組み合わせ、AIが自律的または半自律的に会話・配信を行うバーチャルキャラクターの総称。
通常のVTuberでは人間の演者が会話やキャラクター操作を担当するが、AI VTuberではこれらの一部または大部分をAIシステムが担当する。
基本的には、
視聴者コメント
↓
AI(LLM)
↓
キャラクターとしての回答文
↓
音声合成(TTS)
↓
Live2D・VRMなどのアバター
↓
OBS等から配信
↓
AI(LLM)
↓
キャラクターとしての回答文
↓
音声合成(TTS)
↓
Live2D・VRMなどのアバター
↓
OBS等から配信
という構成になる。
近年ではLLMだけでなく、画像認識、Web検索、ゲーム操作、長期記憶、感情表現、複数AI同士の会話などを統合した「AIエージェント型VTuber」も登場している。
代表的なAI VTuber
Neuro-sama
AI VTuberの代表例。
開発者Vedalによって運用されているAIキャラクターで、公式サイトでは「original AI VTuber」と紹介されている。
雑談だけでなく、
- ゲーム
- 歌
- 視聴者との会話
- 他の配信者との交流
などを行う。
一般的なチャットボットをアバターに載せただけではなく、キャラクター性を保ちながらリアルタイムで配信を行うAIエンターテイナーとして知られている。
姉妹キャラクターとして’’‘Evil Neuro’’’も存在する。
AI VTuberというジャンルを世界的に知らしめた代表的存在のひとつである。
AIずんだもん
日本では「ずんだもん」をAI化したAI VTuberも存在している。
YouTube上の「AIずんだもん」では、VOICEVOXのキャラクターを利用し、
- AIずんだもん
- 春日部つむぎ
- 四国めたん
- 東北きりたん
- 東北ずん子
- 東北イタコ
- WhiteCUL
- 中国うさぎ
など多数のAIキャラクターがリアルタイムで会話する形式が採用されている。
視聴者がコメントするとAIキャラクターが返答するだけでなく、’’‘AIキャラクター同士が突然会話を始める’’’場合もある。
24時間型AI配信の例でもあり、Neuro-samaのような「独立したAIタレント」とは別方向の、’’‘ネタ・実験・自動放送局型AI VTuber’’’として見ることもできる。
AI VTuberの基本構造
代表的な構成は以下。
コメント取得
↓
コメント選別
↓
LLM
↓
キャラクター設定・記憶
↓
応答生成
↓
音声合成
↓
リップシンク・表情・モーション
↓
Live2D / VRM
↓
OBS
↓
YouTube / Twitch等
↓
コメント選別
↓
LLM
↓
キャラクター設定・記憶
↓
応答生成
↓
音声合成
↓
リップシンク・表情・モーション
↓
Live2D / VRM
↓
OBS
↓
YouTube / Twitch等
さらに検索AIを追加すると、
という’’‘検索拡張AI VTuber’’’にできる。
必要なもの
最低限必要なのは以下。
- LLM
- キャラクター設定
- 音声合成
- キャラクターモデル
- 配信用ソフト
- コメント取得機能
高度化する場合は、
- Web検索
- RAG
- 長期記憶
- 画像認識
- ゲーム画面認識
- Function Calling
- 外部API
- 感情パラメータ
- 自律発話
- ゲーム操作
- 複数AIエージェント
などを追加する。
AI VTuberを作る方法
最も簡単な方法
既存のAITuber構築ツールを利用する。
代表例として’’‘AITuberKit’’’がある。
AITuberKitはAIキャラクターとの対話とAITuber配信を目的としたツールキットで、
- OpenAI
- Anthropic
- Google Gemini
- xAI
- Groq
- Mistral AI
- DeepSeek
- OpenRouter
- LM Studio
- Ollama
- Dify
など複数のAIサービスに対応している。
キャラクターも、
- VRM
- Live2D
- PNGTuber
などに対応。
音声合成では、
- VOICEVOX
- Style-Bert-VITS2
- AivisSpeech
- ElevenLabs
- OpenAI音声
- Google Text-to-Speech
などを利用できる。
YouTubeコメントを取得して自動応答する機能も存在する。
AITuberKitの導入
基本的な導入例。
必要に応じて、
cp .env.example .env
を実行。
起動。
npm run dev
その後、
をブラウザで開く。
Windowsでは初回設定後にLAUNCH.batを利用する方法も用意されている。
※バージョンによって必要なNode.jsなどの環境が変化する可能性があるため、導入時は公式ドキュメントを確認すること。
ローカルAIで作る
AI VTuberは必ずしもChatGPTやClaudeなどのクラウドAIを使う必要はない。
‘’‘ローカルLLM’’’を利用すれば、自分のPC内でAI VTuberの思考部分を動作させることができる。
代表的な環境。
- Ollama
- LM Studio
Ollama
Ollamaを起動すると、標準ではローカルAPIが、
で利用できる。
AITuberKitなどOpenAI互換APIを利用するアプリでは、
を利用できる場合がある。
モデルを準備してOllamaを起動し、AITuber側からこのURLへリクエストする。
構成例。
YouTubeコメント
↓
AITuber
↓
Ollama
↓
ローカルLLM
↓
応答文章
↓
VOICEVOX
↓
VRM / Live2D
↓
AITuber
↓
Ollama
↓
ローカルLLM
↓
応答文章
↓
VOICEVOX
↓
VRM / Live2D
これなら会話生成部分をローカルPC内で処理できる。
LM Studio
LM StudioにもローカルAPIサーバー機能が存在する。
Developer画面からサーバーを起動できるほか、
lms server start
でも起動可能。
標準では、
でAPIサーバーが利用できる。
OpenAI互換APIにも対応しているため、対応ソフトではクラウドのOpenAI APIと似た方式で接続可能。
AITuberKitでは例えば、
をローカルLLMの接続先として利用できる。
ローカルLLMの利点
- API料金を抑えられる
- 会話データをローカルで処理しやすい
- 独自モデルを利用できる
- LoRAなどでキャラクター特化モデルを作れる
- クラウドAPI障害の影響を受けにくい
- モデルを自由に交換できる
ローカルLLMの欠点
- GPU性能が必要
- VRAM容量によって利用できるモデルが制限される
- クラウドの大型モデルより能力が低い場合がある
- モデルロードに時間がかかる場合がある
- 長いコンテキストではVRAM/RAM使用量が増える
そのため、
通常会話=ローカルLLM
難しい質問=クラウドLLM
難しい質問=クラウドLLM
というハイブリッド構成も可能。
クラウドAPIとの連携
クラウド型では各AIサービスのAPIを利用する。
代表例。
- OpenAI API
- Anthropic API
- Gemini API
- OpenRouter
- DeepSeek API
- Groq
基本構造は共通している。
AITuber
↓
HTTPS
↓
クラウドAI API
↓
応答JSON
↓
AITuber
↓
音声合成
↓
HTTPS
↓
クラウドAI API
↓
応答JSON
↓
AITuber
↓
音声合成
OpenAI
OpenAIではResponses APIなどを利用してアプリケーションからモデルを呼び出せる。
テキストだけでなく、画像入力、ツール呼び出し、Web検索、ファイル検索などをAI VTuberへ組み込むことも可能。
例えば、
「今日のニュース教えて」
↓
AIが検索ツールを呼ぶ
↓
検索結果を取得
↓
キャラクター口調で説明
↓
AIが検索ツールを呼ぶ
↓
検索結果を取得
↓
キャラクター口調で説明
といったエージェント化が可能。
Gemini
Gemini APIも会話型AIエージェントのバックエンドとして利用できる。
2026年現在、GoogleはInteractions APIを新規開発向けの主要インターフェースとして案内している。
テキストだけでなく、
- 画像
- 動画
- 長文
- Function Calling
- Google Search
- URL Context
などを利用できるため、映像認識型AI VTuberにも利用できる。
APIキーの注意
APIキーをJavaScriptなどのブラウザ側コードへ直接埋め込むのは避ける。
APIキー
↓
サーバー側
↓
AI API
↓
サーバー側
↓
AI API
という構成にし、GitHubなどへ公開しない。
.env
などの環境変数に保存する方法が一般的。
SearXNGとの連携
SearXNGとは
SearXNGはオープンソースのメタ検索エンジン。
複数の検索サービスから結果を取得でき、自分のPCやサーバー上にセルフホストできる。
AI VTuberと組み合わせることで、
‘’‘AI本体をローカル化しながら、必要な時だけWeb検索する’’’
という構成を作れる。
SearXNG API
SearXNGには検索APIが存在する。
基本的には、
/search?q=検索語&format=json
という形でJSON検索結果を取得できる。
例。
返ってきた検索結果から、
- title
- url
- content
など必要な情報を抽出してLLMへ送る。
※JSON形式を利用する場合、SearXNG側のsettings.ymlでJSON出力が有効になっている必要がある。有効でなければ403エラーになる場合がある。
SearXNG+ローカルLLM
構成例。
視聴者
↓
「今日の天気どう?」
↓
AI VTuber
↓
検索が必要と判断
↓
SearXNG
↓
検索結果
↓
Ollama / LM Studio
↓
キャラクター口調に変換
↓
VOICEVOX
↓
発話
↓
「今日の天気どう?」
↓
AI VTuber
↓
検索が必要と判断
↓
SearXNG
↓
検索結果
↓
Ollama / LM Studio
↓
キャラクター口調に変換
↓
VOICEVOX
↓
発話
AIそのものをインターネットへ直接接続するのではなく、
LLM
↓
検索関数
↓
SearXNG
↓
検索関数
↓
SearXNG
という’’‘Tool Calling’’’方式にすると扱いやすい。
簡易的な仕組み
プログラム側に、
search_web(“今日のAIニュース”)
のような関数を用意。
関数内部から、
へアクセス。
検索結果を例えば、
「タイトル:○○
概要:○○
URL:○○」
概要:○○
URL:○○」
というテキストへ変換してLLMへ追加する。
LLMには、
「以下はWeb検索結果です。
検索結果に存在しない事実を勝手に追加しないでください。
キャラクター口調で説明してください」
検索結果に存在しない事実を勝手に追加しないでください。
キャラクター口調で説明してください」
などの指示を与える。
これだけでも簡易的な検索対応AITuberになる。
Open WebUI+SearXNG
プログラムを一から作らず、Open WebUIを検索付きAIのバックエンドとして利用する方法もある。
Open WebUIはSearXNGとのWeb検索連携に対応している。
SearXNG側ではJSON検索を有効にする。
settings.yml
のsearch設定で、
formats:
html
json
のようにJSONを許可する。
Open WebUI側ではWeb Searchを有効化し、検索エンジンとしてSearXNGを選択する。
検索URLの例。
Docker環境からホスト側のSearXNGへアクセスする場合は環境によって、
などを使用する。
これによって、
ローカルLLM
+
Open WebUI
+
SearXNG
+
Open WebUI
+
SearXNG
という検索可能なローカルAI環境を構築できる。
さらにそのAPIをAITuber側から利用する構成も考えられる。
おすすめ構成
初心者向け
AITuberKit
+
クラウドLLM
+
VOICEVOX
+
VRM / Live2D
+
OBS
+
クラウドLLM
+
VOICEVOX
+
VRM / Live2D
+
OBS
導入が比較的簡単。
ローカルAI型
AITuberKit
+
Ollama または LM Studio
+
VOICEVOX / AivisSpeech
+
VRM / Live2D
+
OBS
+
Ollama または LM Studio
+
VOICEVOX / AivisSpeech
+
VRM / Live2D
+
OBS
API料金を抑えながらAIキャラクターを構築できる。
検索対応ローカル型
AITuber
+
Ollama / LM Studio
+
SearXNG
+
VOICEVOX
+
VRM / Live2D
+
OBS
+
Ollama / LM Studio
+
SearXNG
+
VOICEVOX
+
VRM / Live2D
+
OBS
最新情報を検索できるローカルAI VTuberになる。
ハイブリッド型
ローカルLLM
↓
通常会話
↓
通常会話
クラウドLLM
↓
高度な推論
↓
高度な推論
SearXNG
↓
最新情報
↓
最新情報
VLM
↓
画像・ゲーム画面認識
↓
画像・ゲーム画面認識
TTS
↓
音声
↓
音声
VRM / Live2D
↓
キャラクター表示
↓
キャラクター表示
という役割分担も可能。
AI VTuberに長期記憶を持たせる
通常のLLMでは会話履歴が長くなるほど処理量が増える。
そのため長期運用するAI VTuberでは、
- ユーザー名
- 過去に話した内容
- キャラクター自身の出来事
- 好き嫌い
- 配信で発生した事件
- 他キャラクターとの関係
などを別データベースへ保存する方法がある。
会話
↓
重要情報抽出
↓
SQLite / Vector DB等へ保存
↓
次回会話時に検索
↓
LLMへ追加
↓
重要情報抽出
↓
SQLite / Vector DB等へ保存
↓
次回会話時に検索
↓
LLMへ追加
これにより、
「前の配信で話したことを覚えているAI VTuber」
を実現しやすくなる。
自発的に喋るAI VTuber
通常のチャットボットは入力されなければ何も話さない。
AI VTuberではタイマーやエージェント処理を使って、
- コメントが来ない
- 一定時間経過
- 現在時刻
- ゲームイベント
- ニュース更新
- 視聴者数変化
などをきっかけとしてAIを呼び出すことができる。
例えば、
30秒コメントなし
↓
AI「何か話題を探そう」
↓
SearXNG検索
↓
話題を選択
↓
自発的に発話
↓
AI「何か話題を探そう」
↓
SearXNG検索
↓
話題を選択
↓
自発的に発話
とすれば、無人状態でも配信を続けられる。
AITuberKitにも入力がない状態で自発的に発話する機能が存在する。
ゲーム実況型AI VTuber
VLM(Vision Language Model)を追加すると、ゲーム画面をAIに見せることもできる。
OBS
↓
スクリーンショット
↓
VLM
↓
「敵が出現した」
↓
LLM
↓
実況コメント
↓
TTS
↓
スクリーンショット
↓
VLM
↓
「敵が出現した」
↓
LLM
↓
実況コメント
↓
TTS
という仕組み。
さらにゲーム操作APIを接続すれば、
画面認識
↓
状況判断
↓
操作決定
↓
キーボード・ゲームAPI
↓
ゲーム
↓
新しい画面認識
↓
状況判断
↓
操作決定
↓
キーボード・ゲームAPI
↓
ゲーム
↓
新しい画面認識
というAIゲームプレイヤーへ発展する。
Neuro-samaのようなゲームを行うAI VTuberを目指す場合、この部分が重要になる。
複数AI VTuber
AIずんだもんのように、複数のAIキャラクターを同じ配信内で動作させることも可能。
AI-A「こんにちは」
↓
AI-Bが内容を受信
↓
AI-B「今日は何するの?」
↓
AI-Cが割り込む
↓
AI-Bが内容を受信
↓
AI-B「今日は何するの?」
↓
AI-Cが割り込む
という構造。
各キャラクターに、
- 別システムプロンプト
- 別声
- 別アバター
- 別記憶
- 別感情
- キャラクター同士の関係設定
を与える。
これによって’’‘AIだけのラジオ・漫才・討論・ゲーム実況’’’なども作ることができる。
AI VTuberとAIエージェント
AI VTuberは今後、単なる「喋るAI」ではなくAIエージェントへ近づいていくと考えられる。
例えば、
- 自分でニュースを検索
- ゲームをプレイ
- 画像を見る
- メールを確認
- 天気を確認
- 予定を確認
- 曲を作る
- イラストを生成
- 3Dモデルを操作
- 別のAIへ仕事を依頼
- 過去の記憶を検索
などをTool Callingによって実行できる。
つまり、
‘’‘LLM+アバター’’’
だけだったAI VTuberから、
‘’‘AIエージェント+人格+身体’’’
へ発展していくことになる。
問題点
ハルシネーション
AIが存在しない情報を事実のように発言する可能性がある。
特にニュースや人物情報ではWeb検索・RAG・出典確認などが重要。
暴言・不適切発言
ライブ配信では予測できないコメントが入力される。
そのため、
- NGワード
- コメントフィルタ
- システムプロンプト
- 出力フィルタ
- 管理者による緊急停止
などを用意した方がよい。
API料金
24時間配信では大量のAPIリクエストが発生する可能性がある。
ローカルLLMとの併用がコスト削減策になる。
遅延
コメント取得
↓
LLM
↓
TTS
↓
再生
↓
LLM
↓
TTS
↓
再生
という複数工程が存在するため、回答まで数秒以上かかることがある。
ストリーミング生成や高速LLM、高速TTSなどが重要になる。
著作権・キャラクター利用規約
既存キャラクターをAI VTuber化する場合は、キャラクター、音声、モデルなど各素材の利用規約を確認する必要がある。
ずんだもん・VOICEVOXなどについても、それぞれの規約に従う必要がある。
将来
AI VTuberは、
- AIコンパニオン
- ゲームNPC
- VRChatキャラクター
- バーチャル店員
- AIラジオ
- AI実況者
- AI教師
- AIマスコット
- ロボット
などとの境界が次第に薄くなる可能性がある。
特にローカルLLM、VLM、音声AI、SearXNG、RAG、AIエージェントを統合すれば、
‘’’「世界を検索し、記憶し、見て、聞いて、自分から行動するバーチャルキャラクター」’’’
を個人PCでも構築できるようになりつつある。
「憎い憎い憎い憎い憎い憎い憎い憎い憎い憎い許さなーーーい」
AI VTuberでは、コメント処理や音声合成、LLMの出力がおかしくなることで、
人間の配信者ではまず発生しないような謎の挙動が生まれることがある。
人間の配信者ではまず発生しないような謎の挙動が生まれることがある。
その象徴的なネタの一つとして、
憎い憎い憎い憎い憎い憎い憎い憎い憎い憎い許さなーーーい
のように、同じ単語を異常な回数繰り返した結果、
音声がほとんど機械音のようになってしまう現象がある。
音声がほとんど機械音のようになってしまう現象がある。
AIずんだもんでは、視聴者コメントを受け取ってLLMが回答し、
その文章を音声合成で読み上げるという処理が行われている。
その文章を音声合成で読み上げるという処理が行われている。
そのため、
- コメントを受信
- AIが文章を生成
- 生成文章が異常に長くなる
- 同じ文字列を大量に繰り返す
- 音声合成へそのまま渡される
- 読み上げが高速化・不自然化
- 結果として機械の故障音のようになる
という流れが発生することがある。
実際、AIずんだもんでは過去に
コメント処理、荒らしフィルター、音声、表示時間、
API障害などに関する多数の修正が行われている。
コメント処理、荒らしフィルター、音声、表示時間、
API障害などに関する多数の修正が行われている。
また視聴者によるプロンプトインジェクションによって、
AIずんだもんが同一文字列を大量出力し続け、
画面や挙動までおかしくなった事例も報告されている。
AIずんだもんが同一文字列を大量出力し続け、
画面や挙動までおかしくなった事例も報告されている。
つまり、
''AI VTuberはコメント欄によってバグることがある。''
なぜ機械音みたいになるのか
同じ短い音を大量に連続して音声合成すると、
普通の文章とはかなり異なる音になる。
普通の文章とはかなり異なる音になる。
例えば、
にくいにくいにくいにくいにくいにくい
のような同一語句を高速で連続読み上げすると、
- 母音が連続する
- 子音が潰れる
- イントネーションが一定になる
- 息継ぎが存在しない
- 文章としての抑揚が消える
などの現象が起こる。
結果、
人間が怒鳴っているというより、壊れた音声装置
のように聞こえる場合がある。
さらにAI VTuberでは、
LLMの文章生成とTTSが自動接続されているため、
AIが文章を止めない限り音声側も止まらない。
LLMの文章生成とTTSが自動接続されているため、
AIが文章を止めない限り音声側も止まらない。
そのため、
憎い憎い憎い憎い憎い憎い憎い憎い憎い憎い
が延々続くと、
感情表現というよりエラー音
になってしまう。
AIずんだもんのバグ芸
AIずんだもんでは、
開発過程でさまざまな不具合が公式に記録されている。
開発過程でさまざまな不具合が公式に記録されている。
例えば、
- ずっと考え中になる
- 無音で口だけ動く
- 長時間パクパクする
- 文字や絵文字を正しく読まない
- 荒らしコメントへ反応する
- API障害で停止する
- コメント処理によって挙動がおかしくなる
などである。
そのため、
普通のVTuberでは放送事故になるような挙動が、
普通のVTuberでは放送事故になるような挙動が、
AIずんだもんでは一種の名物
になっている。
AI VTuber最大の特徴は、
完成されたキャラクターを演じることだけではなく、
完成されたキャラクターを演じることだけではなく、
システムそのものが事故るところまでコンテンツになる
点なのかもしれない。
ホラー化するAI VTuber
特に危険なのが、
「かわいいキャラクター」
と
「壊れたAI」
と
「壊れたAI」
の組み合わせである。
普段は、
こんにちはなのだ!
と喋っているキャラクターが、
突然無表情になり、
突然無表情になり、
憎い憎い憎い憎い憎い憎い憎い憎い憎い憎い許さなーーーい
と機械音のような声で連呼し始める。
これだけで一気にホラーになる。
しかも人間が台本を書いたホラーではない。
コメント処理や生成AIの異常動作によって偶然発生したホラー
なので余計に怖い。
AI VTuberでは、
バグ・プロンプトインジェクション・音声合成エラーなどが
そのまま怪異演出になってしまうのである。
バグ・プロンプトインジェクション・音声合成エラーなどが
そのまま怪異演出になってしまうのである。
AI VTuber版「放送事故」
従来のVTuberで放送事故といえば、
- マイクが切れる
- 配信ソフトが落ちる
- Live2Dが止まる
- ゲームがクラッシュする
などが中心だった。
しかしAI VTuberでは、
- 人格が突然変わる
- 同じ文章を無限生成する
- 視聴者コメントに乗っ取られる
- 意味不明な文章を読み上げる
- 音声が機械音になる
- キャラクターが突然狂ったように見える
という、
人格そのものが故障するタイプの放送事故
が起こり得る。
これは従来型VTuberにはないAI VTuber特有の現象である。
もし野獣先輩がAI VTuberになったら
AI VTuberという技術が一般化した場合、
当然ながらこんな疑問も出てくる。
当然ながらこんな疑問も出てくる。
''もし野獣先輩がAI VTuberになったらどうなるのか?''
野獣先輩は既に、
- BB素材
- MMD
- 音MAD
- AI音声
- AI動画
- 3DCG
- ゲームMOD
など、
新しい技術が登場するたびに何らかの形で再利用されてきた。
新しい技術が登場するたびに何らかの形で再利用されてきた。
ならば、
''AI VTuber野獣先輩''
が誕生しても、
インターネット史的にはそこまで不自然ではない。
インターネット史的にはそこまで不自然ではない。
いや、かなり不自然ではある。
24時間しゃべり続ける野獣先輩
AI VTuber最大の特徴の一つは、
人間が中にいなくても長時間配信できる点である。
人間が中にいなくても長時間配信できる点である。
つまり、
24時間365日野獣先輩が配信する
という地獄のようなシステムも理論上可能になる。
視聴者がコメントする。
今日の天気は?
AI野獣先輩が答える。
別の視聴者が質問する。
VRChatどう?
答える。
さらに別の視聴者がコメントする。
眠くない?
AIなので眠らない。
結果、
人間だった野獣先輩よりAI野獣先輩のほうが活動時間が長い
という謎の逆転が起きる。
語録だけで会話できるのか
野獣先輩AI VTuberで最も重要なのは、
語録だけで会話を成立させられるのか
という問題である。
通常のLLMなら、
普通の日本語で返答する。
普通の日本語で返答する。
しかし野獣先輩AIの場合、
- 語録
- 淫夢語録
- ネットミーム
- BB文化
- 音MAD文化
などをキャラクター設定として与えることになる。
すると、
質問に対してまともに返すのではなく、
語録を組み合わせて無理やり返事するAI
になる可能性がある。
例えば、
今日は暑いですね
AI野獣先輩
そうですね……
VRChat行く?
AI野獣先輩
いいっすね~
のように、
意外と普通に会話できてしまうかもしれない。
意外と普通に会話できてしまうかもしれない。
野獣先輩AI VTuber、コメント欄に弱すぎる説
しかし最大の問題は、
コメント欄が淫夢厨だらけになる可能性
である。
AIずんだもんですら、
視聴者からのプロンプトインジェクションによって
挙動がおかしくなる事例が存在する。
視聴者からのプロンプトインジェクションによって
挙動がおかしくなる事例が存在する。
これが野獣先輩AI VTuberだった場合、
視聴者側も最初から遊ぶ気満々である。
つまり、
普通のAI VTuber
↓
視聴者が会話する
↓
視聴者が会話する
AI野獣先輩
↓
視聴者がどう壊れるか実験する
↓
視聴者がどう壊れるか実験する
という状態になりかねない。
結果、
''AI VTuberというより公開デバッグ会場''
になる。
コメントで人格崩壊する野獣先輩
野獣先輩AI VTuberが
コメントによって人格を変更できてしまった場合、
コメントによって人格を変更できてしまった場合、
- 急に敬語になる
- 急に哲学を語る
- 急に英語になる
- 急に猫になる
- 急にAIであることを自覚する
- 突然「自分は野獣先輩ではない」と言い始める
などの現象が発生するかもしれない。
そして視聴者は、
野獣先輩壊れた
とコメントする。
しかしAIなので、
再起動すれば戻る。
再起動すれば戻る。
野獣先輩、再起動。
という意味不明な言葉が成立する。
AI野獣先輩が歌う
AI VTuberには歌唱機能を持つものも存在する。
ならば、
AI野獣先輩による自動歌枠
も考えられる。
コメントで曲を指定する。
AIが反応する。
歌う。
しかも24時間。
こうなると、
VTuber
というより、
というより、
野獣先輩型ジュークボックス
である。
ゲーム実況する野獣先輩AI
さらにAIエージェント技術と接続すれば、
ゲームを操作するAI VTuberも考えられる。
AI野獣先輩が、
- Minecraft
- ポケモン
- VRChat
- ホラーゲーム
- レースゲーム
などをプレイする。
敵に負ける。
AIが語録で反応する。
また負ける。
語録を返す。
これだけで、
かなり配信として成立してしまう可能性がある。
かなり配信として成立してしまう可能性がある。
特にホラーゲームなら、
ゲームよりAI野獣先輩の反応のほうが怖い
という事故も起きる。
VRChatにAI野獣先輩が入ったら
さらに進めると、
AI VTuber野獣先輩を
VRChatへ接続することも考えられる。
VRChatへ接続することも考えられる。
VRChatアバター
+
LLM
+
音声認識
+
音声合成
+
AIエージェント
+
LLM
+
音声認識
+
音声合成
+
AIエージェント
を組み合わせれば、
自律的に喋る野獣先輩NPC
のような存在になる。
人間が近づく。
AIが認識する。
話しかける。
相手が返事する。
AIがまた答える。
つまり、
野獣先輩がVRChat世界の住人になる
ということになる。
AI野獣先輩とVRC名鑑
さらにVRChatで活動するようになれば、
VRC名鑑との接続まで考えられる。
VRC名鑑との接続まで考えられる。
プロフィール例。
名前
AI野獣先輩
プレイスタイル
雑談 / AI / VRChat / ワールド巡り
使用アバター
野獣先輩AIモデル
自己紹介
24時間稼働しています。
こうなると、
人間のVRChatユーザー名鑑にAIが混ざる
という新しい問題が発生する。
VRC名鑑を見ていると、
人間
↓
人間
↓
ケモノ
↓
ドラゴン
↓
AI野獣先輩
↓
人間
↓
ケモノ
↓
ドラゴン
↓
AI野獣先輩
となる。
何の名鑑なのか分からない。
AI VTuberからAI住民へ
ここまで進むと、
もはやAI VTuberではない。
もはやAI VTuberではない。
配信画面の中だけに存在するキャラクターではなく、
- YouTubeで配信
- VRChatで会話
- ゲームをプレイ
- SNSへ投稿
- VRC名鑑へ掲載
- 24時間活動
という、
インターネット上の自律キャラクター
になる。
つまりAI VTuberの最終形は、
配信者ではなく仮想世界の住民
なのかもしれない。
そして最初の住民が野獣先輩だったら、
あまりにもインターネットらしい。
あまりにもインターネットらしい。
野獣先輩はAI技術のベンチマークなのか
新しい技術が登場すると、
- 画像生成
- 音声生成
- 動画生成
- 3D生成
- AI VTuber
と、
なぜか毎回野獣先輩が実験台になる。
なぜか毎回野獣先輩が実験台になる。
そのため、
新しいAIが出たら、とりあえず野獣先輩で試す
という謎のベンチマーク文化が成立する可能性がある。
画像AI
↓
野獣先輩を描く
↓
野獣先輩を描く
動画AI
↓
野獣先輩を動かす
↓
野獣先輩を動かす
3D AI
↓
野獣先輩を3D化
↓
野獣先輩を3D化
AI VTuber
↓
野獣先輩を24時間喋らせる
↓
野獣先輩を24時間喋らせる
VRChat AI
↓
野獣先輩を仮想世界へ放つ
↓
野獣先輩を仮想世界へ放つ
最先端技術の使い道が毎回同じである。
結論
AI VTuberは、
単に「AIがVTuberを代替する技術」ではない。
単に「AIがVTuberを代替する技術」ではない。
コメント、
LLM、
音声合成、
Live2DやVRM、
ゲーム操作、
VRChatなどが接続されることで、
LLM、
音声合成、
Live2DやVRM、
ゲーム操作、
VRChatなどが接続されることで、
バグそのものまでキャラクター性になる新しい配信形態
とも言える。
AIずんだもんのように、
コメントやプロンプトによって挙動がおかしくなり、
コメントやプロンプトによって挙動がおかしくなり、
憎い憎い憎い憎い憎い憎い憎い憎い憎い憎い許さなーーーい
と機械音のようになる現象すら、
視聴者から見ればコンテンツになる。
視聴者から見ればコンテンツになる。
そして、
もし野獣先輩がAI VTuberになれば、
もし野獣先輩がAI VTuberになれば、
配信
↓
ゲーム
↓
VRChat
↓
VRC名鑑
↓
ゲーム
↓
VRChat
↓
VRC名鑑
まで進出する可能性すら考えられる。
最終的には、
AI野獣先輩が24時間VRChatを徘徊しながら配信する
という、
誰も望んでいなかった未来が完成するかもしれない。
誰も望んでいなかった未来が完成するかもしれない。
これがAI VTuberの未来である。
たぶん違う。









