
تیم Qwen علیبابا سهشنبه گذشته Qwen Image 3.0 را معرفی کرد و هدف اصلی آن ربطی به زیبایی خروجیها ندارد. بلکه موضوع این است که آیا خروجی واقعاً میتواند در محیط کار مورد استفاده قرار گیرد.
اکثر ابزارهای تصویرسازی هوش مصنوعی—Reve, Nano Banana, Seedream—برای برتری در حوزههای خاصی طراحی شدهاند: خلاقیت، واقعگرایی، قابلیتهای ویرایش و غیره. Qwen Image 3.0 مسیری متفاوت را در پیش گرفته است. تیم Qwen در اطلاعیه رسمی خود نوشت: "Qwen-Image-3.0 فقط به دنبال 'زیبایی' نیست—بلکه به دنبال 'مفید بودن' است و تولید تصویر را به یک ابزار بهرهوری واقعاً قابل استقرار تبدیل میکند."
نقطه کانونی چیزی است که غول چینی علیبابا آن را محتوای غنی مینامد. این مدل تا ۴۵۰۰ توکن را میپذیرد که ۴.۵ برابر بیشتر از توانایی پردازش نسل قبلی است. توکنها واحدهای متنی هستند که یک هوش مصنوعی آنها را میخواند؛ توکن را تقریباً یک کلمه یا بخشی از کلمه تصور کنید، بنابراین ۴۵۰۰ توکن معادل چندین صفحه دستورالعمل جزئی است.
این میزان برای توصیف نُه پنل اینفوگرافیک جداگانه در یک پرامپت واحد و دریافت آنها به عنوان یک تصویر کامل کافی است.
علیبابا در وبلاگ خود نوشت: "کل تصویر بالا توسط Qwen-Image-3.0 در یک مرحله تولید شده است، نه اینکه از چندین تصویر کنار هم چیده شده باشد." هر پنل در دموی مربوطه شامل نمودارها، فرمولها، زیرنویسها و متون ریز مخصوص به خود است — که همه در یک مرحله رندر شده و پس از تولید مونتاژ نشدهاند.
این تنها مدلی است که میتواند این کار را بدون خطاهای عمده انجام دهد.
بخش دوم چیزی است که شرکت آن را جزئیات واقعی مینامد. به گفته تیم Qwen، این مدل "از رندر دقیق متنهایی به کوچکی ۱۰ پیکسل پشتیبانی میکند و جزئیاتی مانند منافذ پوست و تارهای مو را با تصویری واقعی و در سطح میکروسکوپی بازتولید میکند." ده پیکسل معادل حروف ریز است – از همان نوعی که در اعلامیههای دارویی میبینید. این مدل همچنین LaTeX – سیستم نوشتاری که محققان برای نوشتن معادلات پیچیده ریاضی استفاده میکنند – را به طور دقیق در نمونههای کامل مقالات دانشگاهی مدیریت میکند.
در تستهای معمول خود، ما به مدلها چند جمله میدهیم و نحوه پردازش آنها را ارزیابی میکنیم. Qwen Image 3.0، طبق وبلاگ رسمی علیبابا، قادر به تولید تصویر زیر بود.
ما این قابلیت را با استفاده از سریعترین پیکربندی مدل آزمایش کردیم. Qwen Image 3.0 توانست یک مقاله کامل از Decrypt را بازتولید کند. اجرای آن واقعاً چشمگیر بود، اما نتیجه بینقص نبود.
سومین ستون Qwen Image 3.0 دانش عمیق است. به گفته تیم Qwen، این مدل "از رندر بومی ۱۲ زبان پشتیبانی میکند، رابطهای اصلی مانند صفحات وب، بازیها و پخش زنده را شبیهسازی میکند و از دانش غنی جهانی بهره میبرد." همچنین به اینترنت متصل میشود تا دادههای زنده را دریافت کند، به این معنی که درخواست یک تصویر بصری پیشبینی آب و هوا برای یک شهر و تاریخ خاص، یک گرافیک دقیق و نه یک حدس، بازمیگرداند.
برای مثال، علیبابا عکسی از یک حشره روی برگ را به اشتراک گذاشت. این مدل توانست متن مرتبط را بر اساس درک خود از تصویر تولید کند.
علیبابا این ابزار را به استودیوهای طراحی، تیمهای محتوا، عملیات تجارت الکترونیک و مدرسانی که به انبوهی از داراییهای بصری آماده تولید نیاز دارند، پیشنهاد میکند.
البته لازم به ذکر است که در ارزیابی Qwen-Image-Bench خود علیبابا – یک معیار که کیفیت تصویر، زیباییشناسی و وفاداری به واقعیت را در ۱۸ مدل ارزیابی میکند – Qwen Image 2.0 Pro، پرچمدار قبلی، در جایگاه پنجم قرار گرفت. GPT Image 2 متعلق به OpenAI در صدر این رتبهبندی بود. مدل جدید ممکن است عملکرد بهتری داشته باشد، اما عرضه آن هیچ راه اندازهگیری شدهای برای تأیید این موضوع ارائه نمیدهد، زیرا بدون جدول معیار، وزنهای قابل دانلود یا گزارش فنی منتشر شد.
Qwen Image 1.0 با وزنهای باز تحت مجوز Apache 2.0 و گزارش فنی در همان روز عرضه شد. این نسخه اینگونه نبود. به عنوان بخشی از تلاشهای اخیر علیبابا در زمینه هوش مصنوعی، شواهد در اینجا تنها نمونههای تصویری دستچینشدهای هستند که این شرکت برای انتشار انتخاب کرده است. آزمایشهای API در chat.qwen.ai در دسترس هستند. قیمتگذاری هنوز اعلام نشده است.