許多想做虛擬主播的人得先想辦法生一筆錢去租雲端運算,才能讓角色開口講話。我想知道,一台放在家裡好幾年的舊電腦,能不能養出會自己開口講話、自己開直播的虛擬主播,而且每個月只花一頓飯的錢就打平。

顯示卡記憶體只有 6GB,聰明的部分只好用租的

家裡那台顯卡的記憶體只有 6GB,這就像想在小套房塞一張特大號床,床本身沒問題,是房間放不下。夠聰明、能好好聊天的語言模型塞不進這台機器,所以我把「思考」這段外包給雲端服務,用多少算多少;「開口說話」這段留在本地跑,省下持續付費的語音合成費用。

別自己重造輪子,先站在別人搭好的骨架上

從打字輸入、語言模型回話、轉成語音,到嘴型跟著聲音動,這條鏈已經有開源專案把零件串好了。我沒有從零寫起,而是挑一套現成框架當骨架,把力氣留給真正沒有人解過的部分:讓虛擬主播自己開話題、自己排程直播,還有多個角色同時上場時怎麼分工。這兩件事目前市面上沒有現成答案。

虛擬主播看起來像活的,靠三個工程手法疊出來

語言模型沒有真正的意識,聊完就忘,關掉視窗記憶就歸零。要讓它「看起來」活著,得靠三樣東西一起撐。第一是記憶,讓它記得上次聊過什麼,起步用最簡單的作法:寫一份事實清單,加上定期把對話濃縮成摘要,不用花錢就能做到。第二是主動權,平常虛擬主播都是被動等人打字,我加了一個排程器,沒人講話的時候也會定時問模型「你現在想說什麼」,讓它自己找話題、自己回應彈幕。第三是人設不能飄走,靠寫在系統提示裡的角色設定和記憶內容一起把人格鎖住。

這三樣堆出來的是工程上的錯覺,裡面沒有真的住著一個人格。如果要讓虛擬主播打遊戲,那是另一個量級的工程,需要模型看懂畫面,運算成本和延遲都會大幅增加,業界不少做法其實是真人在背後操作,AI 只負責嘴巴動。

聲音模仿功能因為顯卡撐不住,先擱置沒解決

角色開口講話、嘴型對上聲音這條鏈已經能動,單一角色跑起來沒問題。但讓虛擬主播用特定人的聲線講話這件事,因為顯卡記憶體不夠,暫時做不到。技術路線已經打通,接下來打算先上 YouTube 短時段測試效果,驗證過後再考慮擴成一群角色同時經營,多角色怎麼分工調度,目前也還沒有現成做法可以照抄。另外要提醒自己,YouTube 開放營利本身有訂閱數與觀看時數的門檻,這是經營面必須先知道的現實。

graph LR
    A[打字輸入] --> B[語言模型 走API]
    B --> C[語音合成 走本地]
    C --> D[虛擬形象嘴型同步]

相關內容:AI-VTuber-MOC、AI-VTuber 是什麼-白話入門、AI VTuber 的記憶與自主性設計、GPT-SoVITS 與 Live2D 接線安裝指南、專案復盤-MOC