
جدیدترین ابزار ویدیویی هوش مصنوعی که این هفته وایرال شد، آواتار V از HeyGen است که در 8 آوریل با 472,000 بازدید در X معرفی شد. این ابزار یک دوقلوی دیجیتالی فوتورئالیستی از چهره، صدا و حرکات کاربر را از یک ضبط 15 ثانیهای وبکم ایجاد میکند و سپس ویدیوی نامحدود با کیفیت استودیویی را بدون هیچ تجهیزات حرفهای تولید میکند.
صفحه رسمی معرفی HeyGen، آواتار V را بر اساس یک باور واحد توصیف میکند: خروجی باید به اندازهای خوب باشد که کاربران مایل باشند نام خود را پای آن بگذارند، نه فقط «برای هوش مصنوعی خوب»، بلکه «واقعا خوب». این مدل بر اساس آنچه HeyGen آن را «هویت نهفته با پایه زمانی» (temporally grounded identity embedding) مینامد، آموزش دیده است که از کلیپ 15 ثانیهای ساخته شده و حرکات و تغییرات حالت چهره خاصی را که یک فرد را در زمینههای مختلف قابل تشخیص میسازد، ثبت میکند. نماهای باز، فریمهای میانی و نماهای نزدیک، همگی از یک ضبط ثابت میمانند. این فرآیند نیازی به نورپردازی استودیویی و خدمه ندارد؛ یک تلفن یا وبکم استاندارد کافی است.
اصل کلیدی طراحی، جداسازی هویت از ظاهر است. کلیپ 15 ثانیهای نحوه حرکت یک فرد را تعریف میکند. یک عکس پایه جداگانه ظاهر آنها را تعریف میکند. سپس کاربران میتوانند ظاهر را آزادانه تغییر دهند در حالی که حرکت به طور غیرقابل انکاری متعلق به آنها باقی میماند.
اکثر سیستمهای آواتار هوش مصنوعی برای یک لحظه چشمگیر واحد بهینه شدهاند: اسکرینشات، کلیپ کوتاه، یا دموی کنترلشدهای که در آن همه چیز به نفع مدل عمل میکند. آنها در دو ثانیه واضح به نظر میرسند و در بیست ثانیه با انحراف چهره از منبع، دچار فروپاشی میشوند. آواتار V به طور خاص برای حفظ این ثبات در تمام مدت زمان یک ویدیو و بدون این انحراف طراحی شده است. HeyGen این را «ثبات هویت» (identity consistency) توصیف میکند: همان چهره، همان ریزتعبیرات، همان حضور از فریم اول تا آخر، در یک کلیپ 30 ثانیهای یا یک ماژول 10 دقیقهای.
گردش کار عملی سه مرحله دارد: ضبط یک ویدیوی 15 ثانیهای، به صورت اختیاری ضبط یک شبیهسازی صدای مستقل، سپس انتخاب یک عکس پایه به عنوان مرجع هویت برای هر صحنهای که پس از آن تولید میشود. از آن پایه، کاربران پرامپت مینویسند تا لباسها، تنظیمات و سبکهای جدید را تولید کنند، یا از کتابخانه HeyGen استفاده میکنند. ویدیوی نهایی میتواند به هر یک از 175 زبان با همگامسازی لب که به طور خودکار با زبان هدف تطبیق داده شده است، ارائه شود. HeyGen به کاربران توصیه میکند که هنگام ضبط بیانگر باشند، زیرا به گفته این شرکت، "انرژی که میگذارید، همان انرژی است که دریافت میکنید."
همانطور که crypto.news گزارش داده است، ابزارهای هوش مصنوعی که هزینه و زمان تولید محتوای حرفهای را کاهش میدهند، به طور مستقیم تصمیمات مربوط به نیروی انسانی شرکتها را در سال 2026 بازتعریف میکنند. همانطور که crypto.news اشاره کرده است، گسترش ابزارهای محتوای هوش مصنوعی یک متغیر کلیدی در نحوه ارزیابی دوام سرمایهگذاری زیرساختهای هوش مصنوعی توسط سرمایهگذاران نهادی است. آواتار V اکنون به طور کامل از طریق برنامههای پولی HeyGen در دسترس است، با دسترسی به مجموعه کامل قالبها، ابزارهای ترجمه و استودیو پلتفرم.