
本週爆紅的最新AI影片工具是HeyGen的Avatar V,於4月8日宣布,在X上已累積472,000次觀看。它能從一段15秒的網路攝影機錄影中,建立使用者臉部、聲音和手勢的逼真數位分身,然後無需任何專業設備,即可生成無限量的製片廠級影片。
HeyGen的官方發布頁面將Avatar V描述為建立在一個單一信念之上:其輸出必須足夠好,讓使用者願意為之背書,而不是「對AI來說還不錯」,而是「就是好」。該模型是根據HeyGen所謂的「時間性根植身份嵌入」(temporally grounded identity embedding)進行訓練,該嵌入從15秒的影片中建立,捕捉使一個人能夠在不同情境下被清晰識別的特定手勢和表情轉變。廣角、中景和特寫鏡頭都從一次錄製中保持一致。此過程無需攝影棚燈光和工作人員;一部標準手機或網路攝影機就足夠了。
核心設計原則是將身份與外觀分離。15秒的影片定義了一個人的動作方式。一張單獨的基礎照片定義了他們的外觀。然後,使用者可以自由改變外觀,同時動作仍然保持無誤地屬於他們。
大多數AI虛擬替身系統都只針對一個令人印象深刻的瞬間進行優化:螢幕截圖、短片,或是在一切都有利於模型的情況下進行的受控演示。它們在兩秒內看起來很清晰,但在二十秒內就會因臉部偏離來源而崩潰。Avatar V的設計目的正是為了在整個影片運行時長內保持一致,而不會出現這種漂移。HeyGen將此描述為身份一致性:從第一幀到最後一幀,無論是30秒的片段還是10分鐘的模組,都保持相同的臉部、相同的微表情和相同的存在感。
實際操作流程分為三個步驟:錄製一段15秒的影片,可選地錄製一個獨立的語音克隆,然後選擇一張基礎照片作為之後生成每個場景的身份參考。基於此,使用者可以編寫提示來生成新的服裝、場景和風格,或使用HeyGen的資料庫。成品影片可以以175種語言中的任何一種交付,並自動調整唇形同步以適應目標語言。HeyGen建議使用者在錄製時表現得富有表情,因為正如該公司所說:「你投入的能量,就是你得到的能量。」
正如crypto.news所報導,能夠降低專業內容製作成本和時間的AI工具,正在直接重塑2026年的企業人力配置決策。正如crypto.news所指出,AI內容工具的普及是機構投資者評估AI基礎設施支出持久性的關鍵變數。Avatar V現已透過HeyGen的付費方案全面提供,可存取平台完整系列的模板、翻譯和工作室工具。