نموذج Qwen-Image-2.1 ينطلق بدقة 2K وتحرير حتى 10 صور مرجعية

أطلق فريق Qwen رسميًا نموذج Qwen-Image-2.1 لتوليد الصور وتحريرها، مع تركيز واضح على الجمع بين جودة الصورة وكفاءة التشغيل ودعم التحرير المتقدم في نموذج واحد. ويأتي الإصدار بمكوّن توليد بصري يضم 7 مليارات معامل، مع دعم دقة 2K أصلية، وخلفيات شفافة RGBA، والتحرير باستخدام ما يصل إلى 10 صور مرجعية، إلى جانب تحسينات في كتابة النصوص داخل الصور والحفاظ على ملامح الأشخاص والمنتجات.
الإجابة السريعة
نموذج Qwen-Image-2.1 هو أحدث نموذج صور من Qwen، ويدعم إنشاء الصور من النص وتحرير الصور ضمن بنية موحدة. أبرز إضافاته هي الشفافية الأصلية، دعم ما يصل إلى 10 صور مرجعية، التحرير المحلي عبر دوائر أو علامات مرسومة أو أقنعة مستقلة، دقة 2K، وتحسين جودة الخطوط والوجوه والخامات. كما حصل منذ اليوم الأول على دعم في Diffusers وComfyUI وعدة أطر استدلال عالية الأداء.
ما الجديد في Qwen-Image-2.1؟
ويصف فريق Qwen نموذج Qwen-Image-2.1 بأنه أقوى نموذج صور في العائلة حتى الآن، مع أربعة محاور رئيسية للتطوير: تقليل تكلفة الاستدلال مع الحفاظ على جودة الصورة، دمج الإنشاء والتحرير في نموذج واحد، توسيع قدرات التحرير متعدد المراجع، وتحسين التفاصيل البصرية والنصوص داخل الصورة.
ويعتمد نموذج Qwen-Image-2.1 على بنية Single-Stream DiT من 32 طبقة، بينما يبلغ حجم مكوّن التوليد البصري 7 مليارات معامل. ويستخدم Qwen3-VL 8B كمشفّر للنص والصور المرجعية، مع VAE يدعم صور RGBA والشفافية الأصلية.
خلفيات شفافة بدون خطوة إزالة منفصلة
واحدة من أكثر الميزات العملية في الإصدار الجديد هي القدرة على توليد صور بخلفية شفافة مباشرة. بدل إنشاء صورة عادية ثم تمريرها عبر أداة إزالة الخلفية، يستطيع النموذج إنتاج ملف RGBA يحتوي على قناة Alpha من البداية عندما يطلب المستخدم ذلك بالشكل المناسب.
ولا يقتصر الأمر على الإنشاء فقط؛ يستطيع نموذج Qwen-Image-2.1 أيضًا تحرير طبقات شفافة واستخراج عناصر من الصور الفوتوغرافية. هذه الوظيفة مفيدة في تصميم الشعارات والملصقات والعناصر الرسومية وصور المنتجات التي تحتاج إلى دمجها لاحقًا داخل تصميم آخر.
تحرير يصل إلى 10 صور مرجعية
رفع Qwen سقف التحرير متعدد الصور بصورة واضحة. الإصدار الجديد يدعم حتى 10 صور مرجعية في المهمة الواحدة، ويمكن استخدام هذه المراجع للحفاظ على هوية شخص أو منتج، أو تركيب مشهد جديد من عدة عناصر منفصلة.
ويعرض المشروع أمثلة تجمع عدة صور شخصية في لقطة جماعية، وأخرى تبني إطلالة كاملة من صور منفصلة لشخص وملابس وحذاء وحقيبة وقبعة. الفكرة هنا أن نموذج Qwen-Image-2.1 لا يتعامل مع الصورة المرجعية كإشارة شكلية فقط، بل يحاول الحفاظ على هوية العناصر أثناء إعادة تركيبها في مشهد جديد.
تحرير محلي باستخدام الدوائر والرسم والأقنعة
أضاف الفريق أكثر من طريقة لتحديد المنطقة التي يجب تعديلها. يستطيع المستخدم وضع دائرة حول عنصر معين، الرسم فوق المنطقة المطلوبة، أو تمرير Mask منفصل يحدد الجزء المستهدف بدقة.
هذا يجعل عملية التحرير أقرب إلى الأدوات البصرية التقليدية: يمكنك مثلًا تحديد ساعة في صورة وطلب إزالتها، تحديد الشعر وطلب تغيير لونه، أو تحديد قطعة ملابس واستبدالها مع ترك بقية الصورة كما هي. ويعرض مستودع المشروع مثالًا يجمع أكثر من تعديل محلي داخل الصورة نفسها.
تحسين الحفاظ على الوجوه والمنتجات
من المشكلات المتكررة في نماذج تحرير الصور تغير ملامح الشخص بعد تعديل الملابس أو الخلفية. فريق Qwen يقول إن نموذج Qwen-Image-2.1 يحسن Portrait and Product Fidelity، أي الحفاظ على الهوية البصرية للأشخاص والمنتجات خلال عمليات التحرير.
بالنسبة لصناع المحتوى والمتاجر الإلكترونية، قد تكون هذه النقطة أهم من زيادة الدقة نفسها. إذا استطاع نموذج Qwen-Image-2.1 تغيير المشهد أو الملابس مع بقاء شكل الشخص أو المنتج قريبًا من المرجع، يصبح استخدامه أكثر عملية في حملات متعددة الصور بدل إعادة توليد هوية مختلفة في كل مرة.
نصوص أفضل داخل الصور
يشير الفريق كذلك إلى تحسين Typography ضمن الإصدار الجديد. كتابة النصوص داخل الصور كانت لفترة طويلة واحدة من نقاط الضعف في نماذج التوليد، خصوصًا عند وجود لافتات أو عناوين طويلة أو تصميمات تحتاج إلى أحرف واضحة.
لا يعني ذلك أن كل نص سيخرج صحيحًا في كل محاولة، لكن Qwen يضع تحسين الخطوط ضمن الميزات الأساسية للإصدار، مع أمثلة لتوليد لافتات وتصميمات تحتوي على كلمات مقروءة بصورة أوضح من الأجيال السابقة.
دقة 2K أصلية ونسب أبعاد متعددة
يدعم النموذج دقة 2048 × 2048 بكسل افتراضيًا، مع أحجام موصى بها لنسب مثل 4:3 و3:4 و3:2 و2:3 و16:9 و9:16. وفي حالة 16:9 مثلًا يقترح المشروع 2752 × 1536 بكسل، بينما يصل المقاس الرأسي 9:16 إلى 1536 × 2752 بكسل.
هذا يجعل نموذج Qwen-Image-2.1 مناسبًا منذ البداية لصور المقالات والشاشات العريضة والمحتوى الرأسي، من دون الحاجة إلى البدء بصورة مربعة ثم توسيعها لاحقًا.
كيف حاول Qwen تقليل تكلفة التشغيل في نموذج Qwen-Image-2.1؟
رغم جودة الصور ودقة 2K، ركز الفريق على الكفاءة. تستخدم البنية ما يسميه Mixed-Granularity Attention مع إعادة استخدام Prefix KV Cache. الفكرة أن الصور المرجعية وتعليمات النص لا تحتاج إلى إعادة حسابها بالكامل في كل خطوة من خطوات إزالة الضوضاء.
بحسب وصف البنية، يتم حساب المدخلات في الخطوة الأولى ثم تخزين الأجزاء القابلة لإعادة الاستخدام للخطوات التالية. هذا التصميم يهدف إلى تقليل العمل المتكرر داخل الاستدلال، وهو مهم خصوصًا عند التعامل مع أكثر من صورة مرجعية أو عند تشغيل النموذج محليًا.
دعم Diffusers وComfyUI من اليوم الأول
إطلاق نموذج Qwen-Image-2.1 لم يقتصر على نشر الأوزان. أعلن المشروع أن Hugging Face Diffusers يدعمه منذ اليوم الأول عبر QwenImage21Pipeline، كما حصل ComfyUI على دعم أصلي مع أوزان ومسارات عمل جاهزة لتوليد الصور والتحرير.
هناك أيضًا دعم من vLLM-Omni وSGLang وLightX2V لتسريع الاستدلال، مع تقنيات مثل CUDA Graphs والتوازي بين أكثر من GPU والتخزين المؤقت ونقل بعض المكونات من الذاكرة عند الحاجة. وهذا يجعل النموذج موجهًا للمستخدم الفردي وللبنية التحتية الكبيرة في الوقت نفسه.
التشغيل على عتاد غير NVIDIA
يوثق المشروع دعم بطاقات AMD Radeon عبر ROCm وPyTorch وDiffusers. كما يستخدم نموذج Qwen-Image-2.1 عبر FlagOS مجموعة من شرائح الذكاء الاصطناعي المختلفة، مع صور وأوزان جاهزة لثماني منصات عتادية وفق إعلان الفريق.
هذه نقطة مهمة لأن نماذج الصور المحلية كثيرًا ما ترتبط عمليًا بمنظومة CUDA. توسيع خيارات العتاد لا يعني أن الأداء سيكون متطابقًا على جميع الأجهزة، لكنه يزيد عدد البيئات التي يمكن اختبار النموذج عليها دون تغيير جوهري في كود Diffusers.
هل النموذج مفتوح المصدر فعلًا؟
يصف مستودع Qwen النموذج بأنه مفتوح المصدر، وتتوفر الأوزان والكود للعامة عبر GitHub وHugging Face وModelScope. لكن الترخيص المستخدم ليس Apache 2.0 أو MIT؛ المستودع منشور تحت Qwen Research License Agreement.
لذلك من المهم قراءة شروط الترخيص قبل دمج نموذج Qwen-Image-2.1 في منتج تجاري أو خدمة عامة، وعدم افتراض أن توفر الأوزان يعني تلقائيًا حرية الاستخدام نفسها التي تمنحها تراخيص البرمجيات المفتوحة التقليدية.
ما الفرق عن إصدارات Qwen-Image السابقة؟
كانت عائلة Qwen-Image قد توسعت سابقًا في تحرير الصور والمحافظة على هوية الشخص واستخدام أكثر من صورة مرجعية. الإصدار 2.1 يجمع هذه المسارات في نموذج موحد، ويرفع عدد الصور المرجعية إلى 10، ويضيف شفافية RGBA أصلية، ويركز أكثر على الكفاءة ودقة التفاصيل والنصوص.
وكان سوالف قد تناول قبل أيام إطلاق Qwen3.8 Omni Flash، وهو نموذج مختلف مخصص لفهم النص والصورة والصوت والفيديو وإخراج النص. أما الإصدار الجديد هنا فيركز تحديدًا على إنشاء الصور وتحريرها.
ماذا يعني الإصدار للمصممين وصناع المحتوى؟
أبرز ما يجعل الإصدار مهمًا عمليًا ليس مجرد زيادة جودة صورة مولدة منفردة، بل دمج مجموعة مهام كانت تحتاج إلى أدوات منفصلة. تستطيع بدء العمل من Prompt، إدخال عدة مراجع، المحافظة على شخص أو منتج، إجراء تعديل موضعي، ثم الحصول على صورة شفافة أو بنسبة أبعاد مناسبة داخل النظام نفسه.
إذا نجحت هذه القدرات بالثبات الذي تعرضه أمثلة الفريق، فقد يقل الاعتماد على سلسلة طويلة من أدوات إزالة الخلفية وإعادة تركيب العناصر وتعديل المشاهد. ومع ذلك تبقى الأمثلة الرسمية منتقاة من الجهة المطورة، ولذلك الحكم النهائي على جودة نموذج Qwen-Image-2.1 يحتاج إلى اختبارات مستقلة وعلى صور ومهام متنوعة.
كيف يمكن تجربة Qwen-Image-2.1؟
نشر الفريق الأوزان عبر Hugging Face وModelScope، مع أمثلة تشغيل باستخدام Diffusers، كما يتوفر دعم ComfyUI. ويوصي المستودع حاليًا باستخدام PyTorch 2.4 أو أحدث وTransformers 5.17 ونسخة حديثة من Diffusers مع Accelerate وPillow.
ويعرض المستودع إعدادًا افتراضيًا من 40 خطوة استدلال ودقة 2048 × 2048، مع إمكانية تغيير العرض والارتفاع حسب النسبة المطلوبة. هذه الإعدادات ليست قاعدة إلزامية لكل حالة، لكنها نقطة البداية التي يوثقها الفريق.
كلمة اخيرة
يمثل نموذج Qwen-Image-2.1 تحديثًا كبيرًا لعائلة الصور لدى Qwen لأنه لا يركز على التوليد فقط. الشفافية الأصلية، التحرير متعدد المراجع حتى 10 صور، الأقنعة والتحديد البصري، تحسين هوية الأشخاص والمنتجات، ودقة 2K تجعل الإصدار أقرب إلى منصة إنشاء وتحرير موحدة.
وفي الجانب التقني، يحاول نموذج Qwen-Image-2.1 الجمع بين هذه القدرات وبنية أكثر كفاءة، مع دعم مبكر لـDiffusers وComfyUI وأطر الاستدلال السريع وعدة أنواع من العتاد. ويمكن مراجعة المستودع الرسمي لـQwen-Image-2.1 للاطلاع على الأوزان وأمثلة التشغيل والترخيص والتحديثات الخاصة بالدعم.
لا يسمح بنقل هذا المحتوى من سوالف دون الاشارة برابط مباشر





