صفحه اصلیمرکز اخبار LBank
هوش مصنوعی جدید Qwen Image 3 علی‌بابا می‌خواهد مفید باشد، نه فقط زیبا
alibaba-qwen-image-3-ai-useful-not-just-pretty
هوش مصنوعی جدید Qwen Image 3 علی‌بابا می‌خواهد مفید باشد، نه فقط زیبا
Qwen Image 3.0 روزنامه‌ها و شبکه‌های اینفوگرافیک متراکم را در یک مرحله تولید کرده و متن را تا ۱۰ پیکسل رندر می‌کند. نکته اینجاست: هیچ بنچمارکی ارائه نشده و وزنه‌های مدل آن نیز متن‌باز نیستند.
2026-07-22 منبع:decrypt.co

به‌طور خلاصه

  • Qwen-Image-3.0، که در ۲۱ جولای توسط تیم Qwen علی‌بابا منتشر شد، تا ۴۵۰۰ توکن دستورالعمل را می‌پذیرد.
  • این قابلیت، امکان تولید تک‌مرحله‌ای طرح‌بندی‌های پیچیده مانند روزنامه‌ها، استوری‌بردها و شبکه‌های متراکم اینفوگرافیک را فراهم می‌کند.
  • برخلاف نسخه قبلی، این نسخه بدون وزن‌های مدل باز، معیارها یا گزارش فنی منتشر شد؛ این مدل در chat.qwen.ai در دسترس است و قیمت‌گذاری API آن هنوز اعلام نشده است.

تیم Qwen علی‌بابا سه‌شنبه گذشته Qwen Image 3.0 را معرفی کرد و هدف اصلی آن ربطی به زیبایی خروجی‌ها ندارد. بلکه موضوع این است که آیا خروجی واقعاً می‌تواند در محیط کار مورد استفاده قرار گیرد.

اکثر ابزارهای تصویرسازی هوش مصنوعی—Reve, Nano Banana, Seedream—برای برتری در حوزه‌های خاصی طراحی شده‌اند: خلاقیت، واقع‌گرایی، قابلیت‌های ویرایش و غیره. Qwen Image 3.0 مسیری متفاوت را در پیش گرفته است. تیم Qwen در اطلاعیه رسمی خود نوشت: "Qwen-Image-3.0 فقط به دنبال 'زیبایی' نیست—بلکه به دنبال 'مفید بودن' است و تولید تصویر را به یک ابزار بهره‌وری واقعاً قابل استقرار تبدیل می‌کند."

نقطه کانونی چیزی است که غول چینی علی‌بابا آن را محتوای غنی می‌نامد. این مدل تا ۴۵۰۰ توکن را می‌پذیرد که ۴.۵ برابر بیشتر از توانایی پردازش نسل قبلی است. توکن‌ها واحدهای متنی هستند که یک هوش مصنوعی آن‌ها را می‌خواند؛ توکن را تقریباً یک کلمه یا بخشی از کلمه تصور کنید، بنابراین ۴۵۰۰ توکن معادل چندین صفحه دستورالعمل جزئی است.

این میزان برای توصیف نُه پنل اینفوگرافیک جداگانه در یک پرامپت واحد و دریافت آنها به عنوان یک تصویر کامل کافی است.

علی‌بابا در وبلاگ خود نوشت: "کل تصویر بالا توسط Qwen-Image-3.0 در یک مرحله تولید شده است، نه اینکه از چندین تصویر کنار هم چیده شده باشد." هر پنل در دموی مربوطه شامل نمودارها، فرمول‌ها، زیرنویس‌ها و متون ریز مخصوص به خود است — که همه در یک مرحله رندر شده و پس از تولید مونتاژ نشده‌اند.

این تنها مدلی است که می‌تواند این کار را بدون خطاهای عمده انجام دهد.

بخش دوم چیزی است که شرکت آن را جزئیات واقعی می‌نامد. به گفته تیم Qwen، این مدل "از رندر دقیق متن‌هایی به کوچکی ۱۰ پیکسل پشتیبانی می‌کند و جزئیاتی مانند منافذ پوست و تارهای مو را با تصویری واقعی و در سطح میکروسکوپی بازتولید می‌کند." ده پیکسل معادل حروف ریز است – از همان نوعی که در اعلامیه‌های دارویی می‌بینید. این مدل همچنین LaTeX – سیستم نوشتاری که محققان برای نوشتن معادلات پیچیده ریاضی استفاده می‌کنند – را به طور دقیق در نمونه‌های کامل مقالات دانشگاهی مدیریت می‌کند.

در تست‌های معمول خود، ما به مدل‌ها چند جمله می‌دهیم و نحوه پردازش آن‌ها را ارزیابی می‌کنیم. Qwen Image 3.0، طبق وبلاگ رسمی علی‌بابا، قادر به تولید تصویر زیر بود.

ما این قابلیت را با استفاده از سریع‌ترین پیکربندی مدل آزمایش کردیم. Qwen Image 3.0 توانست یک مقاله کامل از Decrypt را بازتولید کند. اجرای آن واقعاً چشمگیر بود، اما نتیجه بی‌نقص نبود.

سومین ستون Qwen Image 3.0 دانش عمیق است. به گفته تیم Qwen، این مدل "از رندر بومی ۱۲ زبان پشتیبانی می‌کند، رابط‌های اصلی مانند صفحات وب، بازی‌ها و پخش زنده‌ را شبیه‌سازی می‌کند و از دانش غنی جهانی بهره می‌برد." همچنین به اینترنت متصل می‌شود تا داده‌های زنده را دریافت کند، به این معنی که درخواست یک تصویر بصری پیش‌بینی آب و هوا برای یک شهر و تاریخ خاص، یک گرافیک دقیق و نه یک حدس، بازمی‌گرداند.

برای مثال، علی‌بابا عکسی از یک حشره روی برگ را به اشتراک گذاشت. این مدل توانست متن مرتبط را بر اساس درک خود از تصویر تولید کند.

علی‌بابا این ابزار را به استودیوهای طراحی، تیم‌های محتوا، عملیات تجارت الکترونیک و مدرسانی که به انبوهی از دارایی‌های بصری آماده تولید نیاز دارند، پیشنهاد می‌کند.

البته لازم به ذکر است که در ارزیابی Qwen-Image-Bench خود علی‌بابا – یک معیار که کیفیت تصویر، زیبایی‌شناسی و وفاداری به واقعیت را در ۱۸ مدل ارزیابی می‌کند – Qwen Image 2.0 Pro، پرچم‌دار قبلی، در جایگاه پنجم قرار گرفت. GPT Image 2 متعلق به OpenAI در صدر این رتبه‌بندی بود. مدل جدید ممکن است عملکرد بهتری داشته باشد، اما عرضه آن هیچ راه اندازه‌گیری شده‌ای برای تأیید این موضوع ارائه نمی‌دهد، زیرا بدون جدول معیار، وزن‌های قابل دانلود یا گزارش فنی منتشر شد.

Qwen Image 1.0 با وزن‌های باز تحت مجوز Apache 2.0 و گزارش فنی در همان روز عرضه شد. این نسخه این‌گونه نبود. به عنوان بخشی از تلاش‌های اخیر علی‌بابا در زمینه هوش مصنوعی، شواهد در اینجا تنها نمونه‌های تصویری دستچین‌شده‌ای هستند که این شرکت برای انتشار انتخاب کرده است. آزمایش‌های API در chat.qwen.ai در دسترس هستند. قیمت‌گذاری هنوز اعلام نشده است.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!