GPT-SoVITS 與 Live2D 接線安裝指南

這篇記錄的是把一個只用 edge-tts 讀字幕、沒有臉的 AI VTuber prototype,接上「本地克隆聲線+Live2D 動臉+推流到 YouTube」的實際做法,重點在各個環節之間怎麼串起來,以及本地顯卡撐不撐得住。

適合已經有 Live2D、TTS 或直播軟體基礎知識,手上有 Windows 機器(測試環境是 GTX 1660、6GB VRAM)想自己接一套本地 AI VTuber 線路的人讀。

讀完可以知道:文字輸入到 Live2D 嘴巴同步開合這一段可以在本地跑通,但本地克隆聲線和推流到 YouTube,因為顯存限制,目前還沒能跟即時對話同時運作。

先讀 AI-VTuber 是什麼-白話入門 了解全貌。

TTS 聲音偽裝成麥克風,就能騙 VTube Studio 自動開合嘴巴

Live2D 模型的嘴巴不是被程式直接控制。業界常見做法是用虛擬音訊線,把 TTS 合成出來的聲音偽裝成麥克風輸入,VTube Studio 一聽到聲音音量在變化,就自動張合嘴巴,不需要另外寫嘴型動畫。

整條資料流是這樣走的:

flowchart TD
    A[觀眾留言] --> B[主程式接收]
    B --> C[LLM 產生回覆文字]
    C --> D[GPT-SoVITS 本地聲音克隆]
    D --> E[語音輸出]
    E --> F[VB-CABLE 虛擬音效卡]
    F --> G[VTube Studio 當成麥克風輸入]
    G --> H[依音量自動唇形同步]
    H --> I[Live2D 模型嘴巴開合]
    I --> J[OBS 擷取視窗畫面]
    J --> K[推送到 YouTube]
    E -.也可直接播放.-> L[喇叭]

只要有聲音「播放到 CABLE Input」,VTube Studio 就聽得到並開合嘴。正式跑的時候讓程式把語音只導去 CABLE Input,不動系統預設輸出。

免費不代表能商用,模型和聲音的授權要自己查清楚

免費素材不等於可以拿去營利。Live2D 模型分成幾種常見來源,授權條件差很多:

方案價格授權重點何時用
Live2D 官方範例模型(Hiyori 等)免費年營業額低於 1000 萬日圓可商用、直播、營利;需在說明欄掛 Live2D 版權聲明;禁止再散布或用於 NSFW先用這個跑通
azukistudio「Hamu」(Booth 商店)約 2400 日圓明寫直播與影片營利可以,收益歸使用者;需標示 credit想要辨識度再買
一般免費 freemium 模型0 元注意:很多免費版本寫明「商用不可」別拿去營利

挑模型時要看日文關鍵字:「商用利用 可/×」「配信」(直播)「収益化」(營利)「クレジット表記」(需標作者)「再配布禁止」(禁止再散布)。

聲音的參考樣本用 Mozilla Common Voice 中文 zh-TW,這是 CC0 公眾領域授權,最安全。GPT-SoVITS 的程式碼和預訓練權重都是 MIT 授權,可商用。

另外要注意 YouTube 從 2025 年 5 月 21 日起規定,AI 語音克隆內容上架要勾選「AI 合成揭露」。誠實揭露不影響營利,不揭露才會被罰。用 Common Voice 的匿名素材不對應真人,比較安全;不要拿名人或聲優的聲音去克隆。

6GB 顯卡沒辦法同時跑 VTube Studio 的臉部運算和 GPT-SoVITS 的語音合成

這是整條線接起來之後最重要的發現。GPT-SoVITS 要在 GTX 1660 上合成出聲音,精度必須設成 FP32(也就是 is_half: false)。1660 這張 Turing 世代的顯卡開 FP16 合成時會直接生成全靜音的音檔,檔案長度正常,但音量只有負 91 分貝,等於沒聲音,這是 Turing 16xx 系列的已知問題。

FP32 才會有聲音,代價是更吃顯存、速度更慢。單獨跑 GPT-SoVITS 時推理速度大約每秒 65 個迭代;但只要 VTube Studio 同時開著,顯存會被佔到剩不到 350MB,多出來的部分溢出到系統記憶體,推理速度掉到每秒 1.2 個迭代,慢了大約 50 倍,一句話要等上百秒。用 nvidia-smi --query-gpu=memory.used,memory.free,utilization.gpu --format=csv 可以直接看到這個溢出。

實驗階段先用 edge-tts 撐著,GPT-SoVITS 的設定、參考音檔、程式路由都保留在原地,之後換裝雲端 GPU 或升級顯卡再切換,.env 裡改一行設定就能切回克隆聲線。

語音送進 VB-CABLE 的路徑上,取樣率沒對齊嘴巴就是不會動

把語音送進 CABLE Input 這條路徑上,最常踩到的坑是取樣率沒對齊。如果送到 DirectSound 版本的 CABLE Input(原生 44100Hz),跟程式輸出的取樣率兜不起來,VTube Studio 的音量條會完全沒反應,嘴巴一動也不動,而且不會跳出任何錯誤訊息,只會覺得明明送了聲音卻沒用。

推流的部分,OBS 用 Spout2 或視窗擷取抓 VTube Studio 的畫面去背,串流金鑰指向 YouTube,先做短時段測試。

推理型 LLM 延遲太高,換非推理模型

免費的推理型模型(像 glm-4.5-air:free)會先想一大串才回答,還要排隊,延遲會拉到上百秒,不適合即時直播互動。改用非推理、MoE 架構的 qwen/qwen3-next-80b-a3b-instruct:free,中文能力夠強,延遲降到約 16 秒,才追得上直播節奏。要更穩定、更低延遲的話,還是得考慮付費模型。

打字到嘴巴同步已打通

目前已確認的部分:VTube Studio 載入範例模型會動;播放聲音到 CABLE Input 時嘴巴會自動開合;GPT-SoVITS API 單獨跑得起來,能合成出聲音,但和 VTube Studio 同時開會因為前面提到的顯存問題慢到不能用;用 edge-tts 代替克隆聲線時,「打字→講話→Live2D 嘴同步動」這一段已經整條打通。克隆聲線和推流到 YouTube 這兩塊還沒完全上線。

尚未驗證的部分:OBS 能不能抓到 VTube Studio 畫面並推流到 YouTube,這部分還沒做完整測試。

已知的地雷:免費 Live2D 模型常常禁止商用,要營利只能用掛授權聲明的官方範例,或另外買明寫可商用的款式;1660 顯存吃緊,GPT-SoVITS 推論前記得先關瀏覽器騰空間;YouTube 規定 AI 語音克隆內容要勾選揭露,誠實揭露不影響營利;GPT-SoVITS 的參考音檔要乾淨、3 到 10 秒、附逐字稿,音色和語速會直接決定輸出的聲音品質。

相關