
有人看到一個虛擬角色在直播裡一邊玩遊戲一邊跟觀眾聊天,反應快到不像機器人,會忍不住想:這東西到底怎麼做出來的,我自己有沒有可能做一個。
我在規劃 AI VTuber 專案之前,先把整套系統拆成看得懂的零件,這篇是拆解後的白話版本。
AI VTuber 是把主播的腦換成會自己想事情的程式
虛擬主播直播露臉的是一個卡通角色,背後由真人講話、做表情帶動角色,這個真人叫「中之人」。AI VTuber 把中之人拿掉,換成一顆 AI 腦袋,角色自己講話、自己回觀眾留言,全場沒有真人在背後說話。
技術細節:VTuber 與 AI VTuber 的英文全稱
VTuber 全稱 Virtual YouTuber,虛擬主播;直播時操控卡通角色的真人稱為中之人。 AI VTuber 把中之人換成 AI,角色的對話由 AI 即時生成,沒有真人在背後說話。 目前最具代表性的案例是 Neuro-sama,一個會玩遊戲、唱歌、即時讀觀眾留言並回嘴的 AI 角色。
會直播的虛擬角色是七個零件接起來的
想像幫一個真人主播開台:一顆會思考的腦、一張會說話的嘴、一雙聽得懂話的耳朵、一張會動的臉、一雙看聊天室的眼睛、記得住事情的腦子,還有一台把畫面送出去的轉播車。
AI 主播需要的東西一樣,只是每樣都換成軟體。腦決定要說什麼,嘴把文字念成聲音,耳朵把聲音轉成文字,臉是一張分層插畫由專門軟體驅動眨眼與嘴型,眼睛即時抓聊天室留言,記憶讓角色記得剛聊過什麼,轉播車把畫面、背景、字幕組合起來送上直播平台。
技術細節:七個零件對應的術語
大腦=LLM 語言模型,靠 system prompt 系統提示設定人設。 嘴巴=TTS 文字轉語音,可用聲音克隆做出特定音色。 耳朵=ASR/STT 語音辨識,AI VTuber 多半用不到,可選用。 臉=Live2D 讓平面插畫分層動起來,VTube Studio 負責驅動與唇形同步。 眼睛=透過 YouTube 提供的 API 即時抓聊天室留言。 記憶=memory 系統,讓角色記得剛聊過什麼與自己的人設。 轉播車=OBS 推流軟體,把畫面編碼送上 YouTube;唇形同步常靠虛擬音訊線把聲音偽裝成麥克風訊號,軟體偵測到聲音就自動讓嘴巴開合,不用自己算嘴型。
觀眾留言到角色開口要在幾秒內跑完全程
七個零件接起來,跑一次「觀眾留言到角色回話」大概是這樣:
flowchart TD A[觀眾留言問今天午餐吃什麼] --> B[抓下留言文字] B --> C[大腦生成回答文字] C --> D[念成有角色音色的聲音] D --> E[嘴型自動對上聲音] D --> F[記住這輪聊了什麼] E --> G[畫面送上YouTube] G --> H[觀眾聽到看到角色回答]
慢一拍觀眾就覺得卡,電腦與顯示卡的力氣直接決定體驗。
現成的免費框架已經把零件組好
不用自己把零件一個個接起來,已經有人把整套組好、公開放上網路,拿來改就好。真正要自己動手的,是框架通常沒做的兩件事:自動推流到直播平台,以及一次管理多個角色、每天自動開播。
技術細節:三個開源框架
Open-LLM-VTuber 主打完全離線也能跑,文件清楚,適合新手起步。 AIRI 目前最活躍,開發目標是追上 Neuro-sama 的完成度。 Ikaros-521/AI-Vtuber 平台支援最廣,能直接接 YouTube、Twitch、Bilibili 等。
軟體幾乎不用錢,真正燒錢的是顯示卡夠不夠力
軟體大多免費,角色圖也有現成免費模型可用。成本卡在本地跑 AI 很吃顯示卡的記憶體:顯示卡不夠力體驗會卡,改租雲端則是二十四小時開著跑,很容易超出預算。
技術細節:省錢與燒錢的具體選項
TTS 推薦用開源工具 GPT-SoVITS,免費且效果夠用。 避免用 ElevenLabs 這類按量計費的服務,長時間直播下最貴方案也撐不住,還會超出預算。 雲端 LLM 可用免費額度,或一次性付費約 USD 10 的服務用很久。 顯卡不夠力時,租雲端顯卡二十四小時常開,一個月很容易超過台幣一兩千的預算。
手上的 GTX 1660 撐得住實驗但擠不下兩個工作
我手上這張顯卡是 GTX 1660,只有 6GB 顯示記憶體。這就像一間小套房,特大號床和書桌同時塞進去會擠不下,房間本身沒問題,是空間放不下。解法是分工:大腦丟去雲端跑,6GB 全部留給本地的嘴巴做即時語音。
技術細節:GTX 1660 的限制與因應
GTX 1660 有 6GB VRAM,同時跑 LLM 與 TTS 會爆記憶體。 建議 LLM 走雲端 API 省下顯卡資源,把 6GB 全部留給本地 TTS 做即時語音。 這代顯卡跑高精度運算較慢,但用量化過的小模型沒問題,現成框架預設就支援。
接下來分三步從一個角色講話開始做起
動手順序是:先用現成框架跑出一個會講話、有臉會動的角色;接上 YouTube,用短時段直播驗證整條流程;最後才擴成一群角色,每天自動開播。
還沒解決的事:角色的個性與主題方向還沒定案;語音要用誰的聲音當樣本還沒決定;「每天自動開播」的排程沒有現成方案,得自己處理。
相關連結
- AI-LLM-MOC — 本地模型、Ollama、量化等共通概念
- Hermes Desktop 設定 Gemma 4 E2B 教學 — 本地跑 LLM 的實作參考