كل المقالات

Qwen-Image-3.0 من علي بابا: نموذج يُنتج إنفوغرافيك كاملاً ونصاً بعشرة بكسلات في تمريرة واحدة

فاطمة الزهراء22 يوليو 2026 في 1:22 ص5 دقيقة للقراءة
Qwen-Image-3.0 من علي بابا: نموذج يُنتج إنفوغرافيك كاملاً ونصاً بعشرة بكسلات في تمريرة واحدة

أبرز النقاط

  • يقبل النموذج مدخلات تصل إلى 4500 رمز ويُنتج تخطيطات معقدة دون تجميع صور متعددة
  • يعرض نصوصاً بوضوح حتى حجم عشرة بكسلات ومعادلات LaTeX كاملة
  • متاح حالياً عبر واجهة برمجة تطبيقات بدعوة فقط، مع خطط لدمجه في تطبيقات علي بابا قريباً

أطلق فريق Qwen التابع لعلي بابا النسخة الثالثة من مولّد الصور Qwen-Image-3.0، وهو نموذج صُمم خصيصاً للتطبيقات العملية التي طالما أرّقت نماذج توليد الصور: تصميم صفحات الجرائد، والرسوم المعلوماتية المعقدة، والمحتوى البصري الغني بالبيانات. الفارق الجوهري أن النموذج يُنجز كل ذلك في تمريرة واحدة، دون الحاجة إلى تجميع صور منفصلة أو تكرار التوليد.

4,500 رمز
الحد الأقصى لمدخلات النص، ما يتيح بناء تخطيطات كثيفة المعلومات في خطوة واحدة
Advertisements

لماذا تُعدّ قراءة نص بعشرة بكسلات إنجازاً تقنياً؟

ظلّ توليد نص مقروء داخل الصور من أصعب التحديات أمام نماذج الانتشار مثل DALL-E وMidjourney وStable Diffusion؛ إذ كثيراً ما تُنتج حروفاً مشوّهة أو كلمات محرّفة. Qwen-Image-3.0 يكسر هذا الحاجز بعرض نصوص واضحة بحجم عشرة بكسلات فقط، إضافة إلى معادلات LaTeX كاملة تشمل الكسور والجذور والأُسُس والرموز التجميعية — وهو ما يفتح الباب لتوليد أوراق علمية وتقارير مالية ورسوم بيانية جاهزة للنشر.

في أحد العروض التوضيحية، أنتج النموذج شبكة 3×3 تضم تسعة إنفوغرافيك مختلفة داخل صورة واحدة: مسافات الأمان قرب الأنفاق، درس كونفوشي عن العاطفة والعقل، دورة حياة الديدان الكبدية، نظريات سايلو للمجموعات من الرتبة 72، الرقابة الداخلية في البنوك، والحمض النووي في الخلايا الحيوانية والنباتية — كل لوحة بنصوصها ورسومها ومعادلاتها.

واجهات متداخلة: من VSCode إلى ملصق قهوة

لإظهار قدرة النموذج على التعامل مع التعقيد البصري، قدّم الفريق مثالاً يبدأ بنافذة VSCode تحتوي شاشة Qwen Chat، وداخلها محادثة WeChat تتضمن ملصقاً يشرح طريقة تحضير قهوة بالتقطير. أربع واجهات متداخلة في صورة واحدة، وكل طبقة تحافظ على تفاصيلها ونصوصها المقروءة.

أربع واجهات متداخلة: VSCode ثم Qwen Chat ثم محادثة WeChat ثم ملصق تحضير قهوة بالتقطير
أربع واجهات متداخلة: VSCode ثم Qwen Chat ثم محادثة WeChat ثم ملصق تحضير قهوة بالتقطير

معادلات LaTeX وصفحات علمية كاملة

عرض الفريق صفحة من ورقة بحثية خيالية في الهندسة الجبرية تحتوي معادلات LaTeX متعددة الأسطر بأُسُس سفلية وعلوية وأقواس وكسور ورموز جمع وضرب. كذلك أنتج النموذج صفحة جريدة محاكاة وملاحظات بخط يد أحمر تشبه تصحيحات المعلمين — وهو نوع من المحتوى لم يكن ممكناً توليده سابقاً بجودة عملية.

صفحة من ورقة بحثية خيالية في الهندسة الجبرية تتضمن معادلات LaTeX معقدة
صفحة من ورقة بحثية خيالية في الهندسة الجبرية تتضمن معادلات LaTeX معقدة

دقة فوتوغرافية: مسام الجلد وخصلات الشعر

لا يقتصر النموذج على النصوص والرسوم؛ بل يستهدف أيضاً الواقعية الفوتوغرافية في الصور الشخصية: مسام مرئية، نسيج جلد طبيعي، وخصلات شعر فردية تتفاعل مع الإضاءة الخلفية. في عرض آخر للتحرير، أصلح النموذج لوحة حبر صينية تقليدية تُصوّر نسوراً متصارعة، فملأ الأجزاء الناقصة مع الحفاظ على أسلوب الفرشاة وتدرجات الحبر الأصلية.

صورة شخصية فوتوغرافية تُظهر تفاصيل مسام الجلد وخصلات شعر بإضاءة خلفية ناعمة
صورة شخصية فوتوغرافية تُظهر تفاصيل مسام الجلد وخصلات شعر بإضاءة خلفية ناعمة
Advertisements

اثنتا عشرة لغة ودعم للمحتوى الحي

يدعم Qwen-Image-3.0 اثنتي عشرة لغة أصلياً، منها اليابانية والكورية والإسبانية. وتشمل الأمثلة المنشورة إعادة إنتاج واجهات مواقع وألعاب وبثوث مباشرة. في عرض تحريري، حوّل النموذج صورة حشرة إلى لوحة تعريف علمية كاملة بالتصنيف وعلامات المعالم الجسدية وعروض مكبّرة ومقياس رسم.

لوحة تعريف علمية لحشرة تتضمن تصنيفاً وعلامات تفصيلية وعروضاً مكبّرة ومقياس رسم
لوحة تعريف علمية لحشرة تتضمن تصنيفاً وعلامات تفصيلية وعروضاً مكبّرة ومقياس رسم

يستطيع النموذج أيضاً سحب بيانات حية من الإنترنت؛ أحد الأمثلة يعرض نشرة طقس لمدينة هانغتشو. مثال آخر يجمع رسّام الحبر الصيني تشي بايشي والرسام الهولندي فينسنت فان غوخ في استوديو بث مباشر محاكى — مزيج يختبر قدرة النموذج على دمج شخصيات تاريخية في سياقات معاصرة.

صورة محاكاة لاستوديو بث مباشر يجمع الرسامين تشي بايشي وفان غوخ
صورة محاكاة لاستوديو بث مباشر يجمع الرسامين تشي بايشي وفان غوخ

من Qwen-Image-2.0 إلى 3.0: تطور سريع

أصدرت علي بابا النسخة السابقة Qwen-Image-2.0 في مايو 2026 فقط، أي قبل شهرين. ركّز تقريرها التقني على مكاسب الكفاءة في التدريب والاستدلال، بما في ذلك متغيّر أسرع يحتاج أربع خطوات فقط بدلاً من أربعين لكل صورة. النسخة الثالثة تنتقل من "الدقة" إلى ما يسمّيه الفريق "الواقعية" — نموذج مصمّم للعمل الفعلي لا للصور الجميلة فحسب.

متى يمكنك استخدامه؟

النموذج متاح حالياً عبر واجهة برمجة تطبيقات (API) بدعوة فقط، مع خطط لدمجه قريباً في تطبيقات علي بابا مثل Qwen Chat. على عكس الإصدارات السابقة، يبدو أن الأوزان لن تُطرح بترخيص مفتوح — وهو توجّه يعكس تحوّلاً أوسع في الصناعة نحو تسويق النماذج بدلاً من إتاحتها مجاناً.

  • الحد الأقصى للمدخلات: 4,500 رمز
  • أصغر نص مقروء: 10 بكسلات
  • اللغات المدعومة: 12 لغة
  • التوليد: تمريرة واحدة لتخطيطات معقدة
  • الوصول الحالي: API بدعوة فقط
ℹ️

رأي Logicity

يضع Qwen-Image-3.0 علي بابا في موقع تنافسي مباشر مع Ideogram 2.0 الذي اشتُهر بدقة النصوص، ومع Adobe Firefly المدمج في Creative Cloud. الفارق أن Qwen يستهدف تخطيطات كاملة لا نصوصاً معزولة. إذا أثبتت النتائج موثوقيتها على نطاق واسع، فقد يختصر النموذج ساعات عمل مصممي الإنفوغرافيك والتقارير المالية، لكنه يفتح أيضاً باباً واسعاً للمحتوى المضلل عبر صفحات جرائد وأوراق علمية مزيّفة تبدو أصلية تماماً.

الأسئلة الشائعة

ما الذي يميز Qwen-Image-3.0 عن DALL-E وMidjourney؟

يتفوق في توليد نصوص مقروءة بحجم عشرة بكسلات ومعادلات LaTeX كاملة ضمن تخطيطات معقدة في تمريرة واحدة، وهو ما تعجز عنه معظم نماذج الانتشار الحالية.

هل النموذج متاح للجميع؟

ليس بعد؛ الوصول حالياً عبر واجهة برمجة تطبيقات بدعوة فقط، مع خطط لدمجه في تطبيقات علي بابا قريباً.

هل ستُطرح أوزان النموذج بترخيص مفتوح؟

على الأرجح لا؛ على عكس إصدارات Qwen السابقة، لا تبدو هناك خطط لإتاحة الأوزان علنياً.

ما اللغات التي يدعمها النموذج؟

اثنتا عشرة لغة أصلياً، منها اليابانية والكورية والإسبانية، مع قدرة على توليد نصوص مقروءة بكل منها.

هل يمكن استخدامه لتوليد تقارير مالية أو أوراق علمية؟

تقنياً نعم، لكن يجب التحقق من الدقة يدوياً؛ النموذج يولّد شكلاً مقنعاً لكنه لا يضمن صحة المحتوى العلمي أو المالي.

ℹ️

هل تحتاج مساعدة في التطبيق؟

إذا كنت تبني منتجاً يعتمد على توليد الصور أو تحتاج استشارة حول دمج نماذج الذكاء الاصطناعي في سير عملك، تواصل مع فريق Logicity للحصول على توجيه تقني متخصص.

ف

فاطمة الزهراء

كاتبة تقنية متخصصة في الذكاء الاصطناعي

أُنتِج هذا المقال بمساعدة الذكاء الاصطناعي وراجعه فريق التحرير في لوجيسيتي. اعرف المزيد في سياسة التحرير.

اقرأ أيضاً