Google 正式推出最新款人工智慧模型 Gemini 3.8 Live Avatar,將即時影片生成技術與語音對話系統相結合,為對話式 AI 帶來具備臉部表情與肢體動態的視覺形象。這項新工具能讓 AI 在聆聽與交談的同時呈現象徵性的數位角色,協助企業提升虛擬服務的互動體驗。
即時動態生成與多語言同步能力
Gemini 3.8 Live Avatar 的核心技術突破在于能以接近零延遲的速度生成影音內容。當使用者與系統交流時,AI 角色不僅能即時以語音回應,嘴型也會與發音保持精確同步,並搭配自然的臉部表情變化。在多語系支援方面,該模型涵蓋高達 97 種語言,且具備在對話中自由切換語言的能力,過程中能保持畫面安定度,避免影像出現異狀或唇型脫節的情況。此外,系統也能在說話當下同步於畫面展示輔助資訊,達成影音與文字內容的整合。
企業級客製化與安全性機制
該模型現階段專為企業級客戶(Gemini Enterprise)設計,目標市場涵蓋客戶服務、虛擬導覽、線上教育及內部助理等商業場景。企業既能選用系統預設的虛擬人像圖庫,亦能開發符合品牌形象的專屬數位角色。為了確保安全性與防止身分冒用,Google 導入了數位隱形水印(SynthID)技術,在生成的影片中嵌入不可見的識別標記,確保輸出內容具備可驗證的生成式 AI(Generative AI)特徵,以強化防護。
這代表什麼
對台灣企業與一般使用者而言,這項技術意味著客服與虛擬互動體驗將迎來質感上的提升。傳統的對話式機器人多半僅限於純文字或聲音輸出,過往的虛擬人像生成則需要耗費大量預算與事前錄製時間;而 Gemini 3.8 Live Avatar 實現了「即時動態生成」,讓中小企業也能以合理的成本建立代表自家品牌的「數位員工」。特別是在跨國貿易或觀光導覽領域,AI 角色支援近百種語言流暢切換的能力,有助於降低台灣企業進軍海外市場的語言與人力門檻,提供顧客如同與真人面對面溝通的流暢體感。
背景補充
在發布 Gemini 3.8 Live Avatar 之前,Google 才剛發表專注於改善音訊品質的 Gemini 3.8 快閃文字轉語音(Flash TTS)模型,並持續強化系統的即時視覺處理速度。面對領域內來自 OpenAI 與 Anthropic 等勁敵的激烈競爭,Google DeepMind 亦透露團隊正著手準備下一代旗艦模型 Gemini 4 的發布。儘管先前曾面臨產品延期的市場壓力,Google 近期的連續更新顯示其正在加速佈局多模態 AI(Multimodal AI)應用,試圖以完整的音訊與視覺組合重塑企業級市場的主導權。
常見問題
Gemini 3.8 Live Avatar 主要有哪些應用情境?
該模型主要針對企業客戶設計,適合應用於線上客服、互動式展覽導覽、企業內部培訓以及數位品牌大使等場合。
Live Avatar 支援哪些語言?切換語言時影音會卡頓嗎?
該模型支援 97 種語言,且支援在對話中直接切換語言,系統會自動調整對應嘴型與表情,維持穩定的畫面品質。
一般使用者現在可以使用 Gemini 3.8 Live Avatar 嗎?
目前該功能主要開放給企業用戶(Gemini Enterprise)訂閱使用,一般個人用戶暫未全面開放。