هوش مصنوعی چینی Qwen-Image-3.0 با عملکرد خیره‌کننده معرفی شد

هوش مصنوعی چینی Qwen Image 3.0 با عملکرد خیره‌کننده معرفی شد

تیم Qwen وابسته به علی‌بابا، از نسل سوم مدل تصویرسازی خود با نام Qwen-Image-3.0 رونمایی کرد. تمرکز اصلی این نسخه بر تولید تصاویری است که نه‌تنها ظاهر خوبی داشته باشند، بلکه به‌عنوان یک ابزار کاری واقعی در حوزه‌هایی مانند طراحی روزنامه، استوری‌بورد و رابط کاربری قابل استفاده باشند. این مدل با قابلیت‌های پیشرفته خود، گامی بلند در جهت تولید تصاویر کاربردی و آماده برای کارهای حرفه‌ای برداشته است.

پشتیبانی از دستورات متنی طولانی تا ۴۵۰۰ توکن

مهم‌ترین جهش فنی Qwen-Image-3.0، پشتیبانی از دستورهای متنی طولانی تا ۴۵۰۰ توکن است. این قابلیت به مدل اجازه می‌دهد تصاویر بسیار متراکم و پیچیده را در یک مرحله خلق کند. نمونه شاخصی که برای اثبات این توانایی منتشر شده، یک شبکه ۳ در ۳ شامل ۹ اینفوگرافیک کاملاً متفاوت در موضوعاتی مانند فیزیک، زیست‌شناسی و ریاضیات است که همگی با یک دستور ۳۷۰۰ توکنی تولید شده‌اند.

دقت در جزئیات ریز و کیفیت نزدیک به عکس

هوش مصنوعی چینی Qwen Image 3.0 با عملکرد خیره‌کننده معرفی شد
هوش مصنوعی چینی Qwen Image 3.0 با عملکرد خیره‌کننده معرفی شد

دومین بهبود کلیدی، دقت در جزئیات ریز است. علی‌بابا ادعا می‌کند Qwen-Image-3.0 می‌تواند متون با اندازه فونت تنها ۱۰ پیکسل را خوانا رندر کند و بافت‌هایی مانند پوست، مو و کاغذ را با کیفیتی نزدیک به عکس بازتولید کند. خروجی‌های نمایش‌داده‌شده شامل یک صفحه کامل از مقاله دانشگاهی با معادلات چندخطی، صفحه اول شبیه‌سازی‌شده یک روزنامه و همچنین قابلیت‌های ویرایشی مانند افزودن یادداشت‌های دست‌نویس و ترمیم نقاشی‌های سنتی آسیب‌دیده است.

دانش جهانی و قابلیت‌های چندزبانه

سومین محور، به‌کارگیری «دانش جهانی» در مدل است. این سیستم قادر به رندر بومی به ۱۲ زبان، بازتولید رابط‌های کاربری مانند صفحات وب و حتی دریافت داده‌های زنده از اینترنت برای تولید تصاویر است. برای نمونه، می‌تواند یک نقشه پیش‌بینی آب‌وهوا برای یک شهر و تاریخ مشخص تولید کند. علی‌بابا مجموع این توانمندی‌ها را برای تولید محتوای حرفه‌ای در بیش از ۱۰۰ سبک بصری، از جمله طراحی روزنامه، ماکت‌های رابط کاربری و تصاویر تجارت الکترونیک، هدف‌گذاری کرده است.

رویکرد غیرمتن‌باز و غیبت اطلاعات فنی

معرفی Qwen-Image-3.0 با یک غیبت بزرگ همراه است. برخلاف نسل‌های پیشین که با گزارش فنی، وزن‌های متن‌باز و مجوز آپاچی ۲ منتشر می‌شدند، برای Qwen-Image-3.0 هیچ جدول بنچمارک، تعداد پارامتر، مجوز یا وزن قابل دانلودی ارائه نشده است. تمام ادعاهای مطرح‌شده صرفاً بر اساس تصاویر منتخبی است که علی‌بابا منتشر کرده و کاربران تنها از طریق پلتفرم Qwen Chat می‌توانند مدل را آزمایش کنند.

این رویکرد در تضاد با رقبایی مانند تنسنت و Thinking Machines Lab است که مدل‌های تصویری جدید خود را به‌صورت متن‌باز عرضه کرده‌اند. بر اساس بنچمارک اختصاصی Qwen، یعنی Qwen-Image-Bench، نسل قبلی این مدل یعنی Qwen Image 2.0 Pro در رتبه پنجم کلی قرار داشت و مدل‌های GPT Image 2 از OpenAI و مدل‌های Nano Banana از گوگل صدرنشین بودند. باید دید که این تغییر رویه علی‌بابا در انتشار مدل‌های خود، چه تأثیری بر جایگاه این شرکت در رقابت با سایر غول‌های هوش مصنوعی خواهد داشت.

مجله تکنولوژی هارپی تک

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *