有人看到一個虛擬角色在直播裡一邊玩遊戲一邊跟觀眾聊天,反應快到不像機器人,會忍不住想:這東西到底怎麼做出來的,我自己有沒有可能做一個。

我在規劃 AI VTuber 專案之前,先把整套系統拆成看得懂的零件,這篇是拆解後的白話版本。

AI VTuber 是把主播的腦換成會自己想事情的程式

虛擬主播直播露臉的是一個卡通角色,背後由真人講話、做表情帶動角色,這個真人叫「中之人」。AI VTuber 把中之人拿掉,換成一顆 AI 腦袋,角色自己講話、自己回觀眾留言,全場沒有真人在背後說話。

會直播的虛擬角色是七個零件接起來的

想像幫一個真人主播開台:一顆會思考的腦、一張會說話的嘴、一雙聽得懂話的耳朵、一張會動的臉、一雙看聊天室的眼睛、記得住事情的腦子,還有一台把畫面送出去的轉播車。

AI 主播需要的東西一樣,只是每樣都換成軟體。腦決定要說什麼,嘴把文字念成聲音,耳朵把聲音轉成文字,臉是一張分層插畫由專門軟體驅動眨眼與嘴型,眼睛即時抓聊天室留言,記憶讓角色記得剛聊過什麼,轉播車把畫面、背景、字幕組合起來送上直播平台。

觀眾留言到角色開口要在幾秒內跑完全程

七個零件接起來,跑一次「觀眾留言到角色回話」大概是這樣:

flowchart TD
A[觀眾留言問今天午餐吃什麼] --> B[抓下留言文字]
B --> C[大腦生成回答文字]
C --> D[念成有角色音色的聲音]
D --> E[嘴型自動對上聲音]
D --> F[記住這輪聊了什麼]
E --> G[畫面送上YouTube]
G --> H[觀眾聽到看到角色回答]

慢一拍觀眾就覺得卡,電腦與顯示卡的力氣直接決定體驗。

現成的免費框架已經把零件組好

不用自己把零件一個個接起來,已經有人把整套組好、公開放上網路,拿來改就好。真正要自己動手的,是框架通常沒做的兩件事:自動推流到直播平台,以及一次管理多個角色、每天自動開播。

軟體幾乎不用錢,真正燒錢的是顯示卡夠不夠力

軟體大多免費,角色圖也有現成免費模型可用。成本卡在本地跑 AI 很吃顯示卡的記憶體:顯示卡不夠力體驗會卡,改租雲端則是二十四小時開著跑,很容易超出預算。

手上的 GTX 1660 撐得住實驗但擠不下兩個工作

我手上這張顯卡是 GTX 1660,只有 6GB 顯示記憶體。這就像一間小套房,特大號床和書桌同時塞進去會擠不下,房間本身沒問題,是空間放不下。解法是分工:大腦丟去雲端跑,6GB 全部留給本地的嘴巴做即時語音。

接下來分三步從一個角色講話開始做起

動手順序是:先用現成框架跑出一個會講話、有臉會動的角色;接上 YouTube,用短時段直播驗證整條流程;最後才擴成一群角色,每天自動開播。

還沒解決的事:角色的個性與主題方向還沒定案;語音要用誰的聲音當樣本還沒決定;「每天自動開播」的排程沒有現成方案,得自己處理。

相關連結