
許多想做虛擬主播的人得先想辦法生一筆錢去租雲端運算,才能讓角色開口講話。我想知道,一台放在家裡好幾年的舊電腦,能不能養出會自己開口講話、自己開直播的虛擬主播,而且每個月只花一頓飯的錢就打平。
顯示卡記憶體只有 6GB,聰明的部分只好用租的
家裡那台顯卡的記憶體只有 6GB,這就像想在小套房塞一張特大號床,床本身沒問題,是房間放不下。夠聰明、能好好聊天的語言模型塞不進這台機器,所以我把「思考」這段外包給雲端服務,用多少算多少;「開口說話」這段留在本地跑,省下持續付費的語音合成費用。
技術細節:混合架構的分工
LLM 推理走 API(例如 OpenRouter),本地端只保留語音合成(如 GPT-SoVITS)與 Live2D 渲染。 硬體限制:GTX 1660,6GB VRAM,無 Tensor Core,FP16 效能不足以撐起聲線克隆等重運算任務。 每月預算抓在 USD 10-60 量級,視 API 用量浮動。
別自己重造輪子,先站在別人搭好的骨架上
從打字輸入、語言模型回話、轉成語音,到嘴型跟著聲音動,這條鏈已經有開源專案把零件串好了。我沒有從零寫起,而是挑一套現成框架當骨架,把力氣留給真正沒有人解過的部分:讓虛擬主播自己開話題、自己排程直播,還有多個角色同時上場時怎麼分工。這兩件事目前市面上沒有現成答案。
技術細節:起步用的框架
參考專案包含 AIRI、Open-LLM-VTuber 等,已整合 LLM、TTS、Live2D、推流四段流程。 打字→LLM→TTS→Live2D 唇形同步這條鏈已在單角色情境下跑通。
虛擬主播看起來像活的,靠三個工程手法疊出來
語言模型沒有真正的意識,聊完就忘,關掉視窗記憶就歸零。要讓它「看起來」活著,得靠三樣東西一起撐。第一是記憶,讓它記得上次聊過什麼,起步用最簡單的作法:寫一份事實清單,加上定期把對話濃縮成摘要,不用花錢就能做到。第二是主動權,平常虛擬主播都是被動等人打字,我加了一個排程器,沒人講話的時候也會定時問模型「你現在想說什麼」,讓它自己找話題、自己回應彈幕。第三是人設不能飄走,靠寫在系統提示裡的角色設定和記憶內容一起把人格鎖住。
這三樣堆出來的是工程上的錯覺,裡面沒有真的住著一個人格。如果要讓虛擬主播打遊戲,那是另一個量級的工程,需要模型看懂畫面,運算成本和延遲都會大幅增加,業界不少做法其實是真人在背後操作,AI 只負責嘴巴動。
技術細節:記憶的四個層次
由淺到深:事實清單 → 滾動摘要 → 向量庫 RAG → 知識圖譜。 起步階段只用「事實清單 + 滾動摘要」的純檔案作法,零成本可行。 打遊戲需要 VLM(視覺語言模型)持續解析畫面,成本與延遲都顯著上升,尚未納入這次範圍。
聲音模仿功能因為顯卡撐不住,先擱置沒解決
角色開口講話、嘴型對上聲音這條鏈已經能動,單一角色跑起來沒問題。但讓虛擬主播用特定人的聲線講話這件事,因為顯卡記憶體不夠,暫時做不到。技術路線已經打通,接下來打算先上 YouTube 短時段測試效果,驗證過後再考慮擴成一群角色同時經營,多角色怎麼分工調度,目前也還沒有現成做法可以照抄。另外要提醒自己,YouTube 開放營利本身有訂閱數與觀看時數的門檻,這是經營面必須先知道的現實。
graph LR A[打字輸入] --> B[語言模型 走API] B --> C[語音合成 走本地] C --> D[虛擬形象嘴型同步]
技術細節:三階段規劃與現況
階段一:單角色跑通(打字→LLM→TTS→Live2D 唇形同步),已完成。 階段二:上 YouTube 短時段驗證,規劃中,預計近期上線。 階段三:擴成多角色編排,尚無現成方案參考。 聲線克隆受限於 1660 的 VRAM 與 FP16 效能,暫時凍結。
相關內容:AI-VTuber-MOC、AI-VTuber 是什麼-白話入門、AI VTuber 的記憶與自主性設計、GPT-SoVITS 與 Live2D 接線安裝指南、專案復盤-MOC