تیم Qwen وابسته به علیبابا، از نسل سوم مدل تصویرسازی خود با نام Qwen-Image-3.0 رونمایی کرد. تمرکز اصلی این نسخه بر تولید تصاویری است که نهتنها ظاهر خوبی داشته باشند، بلکه بهعنوان یک ابزار کاری واقعی در حوزههایی مانند طراحی روزنامه، استوریبورد و رابط کاربری قابل استفاده باشند. این مدل با قابلیتهای پیشرفته خود، گامی بلند در جهت تولید تصاویر کاربردی و آماده برای کارهای حرفهای برداشته است.
پشتیبانی از دستورات متنی طولانی تا ۴۵۰۰ توکن
مهمترین جهش فنی Qwen-Image-3.0، پشتیبانی از دستورهای متنی طولانی تا ۴۵۰۰ توکن است. این قابلیت به مدل اجازه میدهد تصاویر بسیار متراکم و پیچیده را در یک مرحله خلق کند. نمونه شاخصی که برای اثبات این توانایی منتشر شده، یک شبکه ۳ در ۳ شامل ۹ اینفوگرافیک کاملاً متفاوت در موضوعاتی مانند فیزیک، زیستشناسی و ریاضیات است که همگی با یک دستور ۳۷۰۰ توکنی تولید شدهاند.
دقت در جزئیات ریز و کیفیت نزدیک به عکس

دومین بهبود کلیدی، دقت در جزئیات ریز است. علیبابا ادعا میکند Qwen-Image-3.0 میتواند متون با اندازه فونت تنها ۱۰ پیکسل را خوانا رندر کند و بافتهایی مانند پوست، مو و کاغذ را با کیفیتی نزدیک به عکس بازتولید کند. خروجیهای نمایشدادهشده شامل یک صفحه کامل از مقاله دانشگاهی با معادلات چندخطی، صفحه اول شبیهسازیشده یک روزنامه و همچنین قابلیتهای ویرایشی مانند افزودن یادداشتهای دستنویس و ترمیم نقاشیهای سنتی آسیبدیده است.
دانش جهانی و قابلیتهای چندزبانه
سومین محور، بهکارگیری «دانش جهانی» در مدل است. این سیستم قادر به رندر بومی به ۱۲ زبان، بازتولید رابطهای کاربری مانند صفحات وب و حتی دریافت دادههای زنده از اینترنت برای تولید تصاویر است. برای نمونه، میتواند یک نقشه پیشبینی آبوهوا برای یک شهر و تاریخ مشخص تولید کند. علیبابا مجموع این توانمندیها را برای تولید محتوای حرفهای در بیش از ۱۰۰ سبک بصری، از جمله طراحی روزنامه، ماکتهای رابط کاربری و تصاویر تجارت الکترونیک، هدفگذاری کرده است.
رویکرد غیرمتنباز و غیبت اطلاعات فنی
معرفی Qwen-Image-3.0 با یک غیبت بزرگ همراه است. برخلاف نسلهای پیشین که با گزارش فنی، وزنهای متنباز و مجوز آپاچی ۲ منتشر میشدند، برای Qwen-Image-3.0 هیچ جدول بنچمارک، تعداد پارامتر، مجوز یا وزن قابل دانلودی ارائه نشده است. تمام ادعاهای مطرحشده صرفاً بر اساس تصاویر منتخبی است که علیبابا منتشر کرده و کاربران تنها از طریق پلتفرم Qwen Chat میتوانند مدل را آزمایش کنند.
این رویکرد در تضاد با رقبایی مانند تنسنت و Thinking Machines Lab است که مدلهای تصویری جدید خود را بهصورت متنباز عرضه کردهاند. بر اساس بنچمارک اختصاصی Qwen، یعنی Qwen-Image-Bench، نسل قبلی این مدل یعنی Qwen Image 2.0 Pro در رتبه پنجم کلی قرار داشت و مدلهای GPT Image 2 از OpenAI و مدلهای Nano Banana از گوگل صدرنشین بودند. باید دید که این تغییر رویه علیبابا در انتشار مدلهای خود، چه تأثیری بر جایگاه این شرکت در رقابت با سایر غولهای هوش مصنوعی خواهد داشت.

سینا علیپور
او دانشجوی رشته مهندسی کامپیوتر در مقطع کارشناسی است و فعالیت حرفهای خود را در عرصه رسانه از سال ۱۳۹۸ با یک بلاگ شخصی در حوزه فناوری آغاز کرده است. وی پس از مدتی به عنوان نویسنده آزاد در مجلههای آنلاین تکنولوژی فعالیت کرد و در حال حاضر، دبیر سرویس نقد و بررسی گجتهای هوشمند در یک مجله معتبر تکنولوژی است.