DeepSeek V4.1 Flash ينطلق بقدرات أقوى وتكلفة تشغيل أقل

أعلنت شركة DeepSeek الصينية عن إطلاق DeepSeek V4.1 Flash، وهو نموذج جديد متعدد الوسائط يجمع بين معالجة النصوص والصور وبنية محسنة صممت خصيصًا لتقليل تكلفة التشغيل وزيادة سرعة الاستجابة، مع الحفاظ على مستوى أداء تقول الشركة إنه يتفوق في عدد من اختبارات الوكلاء على نموذجها الأكبر V4 Pro.
النموذج الجديد متاح عبر API، كما نشرت DeepSeek أوزانه على Hugging Face بترخيص MIT، ما يسمح للباحثين والشركات بتجربته وتشغيله وتطوير أدوات مبنية عليه وفق شروط الترخيص.
الإجابة السريعة
DeepSeek V4.1 Flash هو نموذج Mixture-of-Experts متعدد الوسائط يضم 552 مليار معامل، لكنه لا يشغل جميع المعاملات في كل خطوة. يستخدم 8 مليارات معامل نشطة تقريبًا أثناء معالجة الإدخال و16 مليارًا أثناء التوليد، ويدعم سياقًا يصل إلى مليون Token، مع بنية جديدة تقلل حجم KV Cache بصورة كبيرة مقارنة بالجيل السابق.
بنية مختلفة عن النماذج التقليدية
أبرز ما يميز الإصدار الجديد هو اعتماد ما تسميه DeepSeek بنية Causal Encoder-Decoder أو CED. النموذج يتكون من 40 طبقة Transformer موزعة إلى 20 طبقة Encoder سببية و20 طبقة Decoder.
الفكرة من هذا التصميم هي عدم تكرار إنشاء KV Cache بالطريقة التقليدية في كل طبقة من طبقات Decoder، بل اشتقاق الذاكرة العالمية من الحالة النهائية للـEncoder، ما يقلل كمية الذاكرة المطلوبة أثناء العمل على سياقات ضخمة.
وتقول الشركة إن هذا التصميم يسمح لـDeepSeek V4.1 Flash بتشغيل عدد محدود من المعاملات في كل Token رغم الحجم الكلي الكبير للنموذج، وهو ما يساعد على خفض تكلفة التشغيل خصوصًا في المهام الطويلة والوكلاء الذين ينفذون عددًا كبيرًا من الخطوات.
552 مليار معامل لكن 8 مليارات فقط أثناء الإدخال
النموذج ينتمي إلى فئة MoE أو Mixture-of-Experts، ويحتوي على 552 مليار معامل في الـBackbone، لكن عملية الاستدلال لا تستخدمها جميعًا في الوقت نفسه.
بحسب التقرير التقني، يتم تفعيل نحو 8 مليارات معامل لكل Token أثناء مرحلة Prefill، وترتفع إلى نحو 16 مليارًا أثناء Decode. ويعتمد النموذج على خبير مشترك و384 خبيرًا موجهًا داخل طبقات MoE، مع تفعيل ستة خبراء موجهين لكل Token.
هذا الأسلوب يسمح بالحفاظ على سعة معرفية كبيرة دون تحمل تكلفة نموذج كثيف يشغل مئات المليارات من المعاملات في كل خطوة.
سياق يصل إلى مليون Token
يدعم DeepSeek V4.1 Flash نافذة سياق تصل إلى مليون Token، وهي ميزة مهمة للتعامل مع مستودعات برمجية ضخمة أو مستندات طويلة أو جلسات Agent تمتد عبر عدد كبير من الخطوات.
لكن السياق الطويل لا يكون مفيدًا إذا كانت الذاكرة المطلوبة لتخزين KV Cache مرتفعة جدًا، ولذلك ركزت DeepSeek بصورة واضحة على تقليل هذا الجزء من تكلفة التشغيل.
KV Cache أصغر بأربع مرات
وفق DeepSeek، انخفض حجم Global KV Cache إلى نحو 890 بايت لكل Token، أي ما يقارب ربع الحجم المستخدم في DeepSeek V4 Flash.
وتقول الشركة إن هذا يقلل الحاجة إلى ذاكرة HBM إلى نحو الربع، ويخفض متطلبات التخزين على SSD إلى نحو الثُمن مقارنة بالجيل السابق.
وتشير DeepSeek كذلك إلى أن حجم KV Cache أصبح أصغر بنحو 437 مرة مقارنة بالجيل الأول من نماذجها، وهو فرق كبير خصوصًا عند تشغيل DeepSeek V4.1 Flash داخل أنظمة Agent طويلة السياق.
متعدد الوسائط من البداية
الإصدار الجديد لا يعتمد على إضافة رؤية منفصلة بعد تدريب النموذج النصي، بل تم تدريبه منذ البداية كنظام متعدد الوسائط قادر على معالجة النصوص والصور معًا.
يستخدم النموذج Vision Encoder باسم DeepSeek-ViT تم تدريبه من الصفر، ثم يتم تحويل الصور إلى تمثيلات تدخل إلى النموذج بجانب النصوص.
وتوضح DeepSeek أن مجموعة التدريب الأساسية للنموذج تضمنت نحو 45 تريليون Token من بيانات متعددة الوسائط، مع تمديد طول السياق تدريجيًا حتى مليون Token.
تركيز واضح على الوكلاء والبرمجة
تركز DeepSeek في إعلانها على أداء النموذج في Agentic Workloads، أي المهام التي لا تقتصر على سؤال وإجابة واحدة، بل تتطلب استخدام أدوات واتخاذ سلسلة قرارات وتنفيذ عدة خطوات.
وتقول الشركة إن DeepSeek V4.1 Flash تفوق في الاختبارات التي أجرتها أو اعتمدتها على V4 Pro في الأداء والتكلفة والسرعة والوقت الإجمالي لتنفيذ المهام.
لكن هذه النتائج تظل نتائج Benchmark منشورة من الشركة المطورة، ولذلك تحتاج المقارنات المستقلة بعد الإطلاق إلى تأكيد حجم التفوق في الاستخدام الحقيقي.
مستوى التفكير يمكن التحكم به
من الخصائص اللافتة في النموذج دعم مستوى Reasoning Effort يمكن ضبطه بصورة مستمرة من 1 إلى 100، بدل الاكتفاء بوضعين ثابتين للتفكير وعدم التفكير.
الفكرة تسمح للمطور بالموازنة بين دقة الإجابة وتكلفة الاستدلال؛ المهام البسيطة يمكن تشغيلها بمستوى تفكير منخفض، بينما يمكن رفع المستوى في مسائل البرمجة أو الاستدلال المعقدة.
DeepSeek V4.1 Flash أصبح متاحًا عبر API
أصبح DeepSeek V4.1 Flash متاحًا على DeepSeek API، وتوضح الشركة أن المطور يستطيع الوصول إلى النموذج الجديد باستخدام اسم deepseek-flash.
أما أسماء deepseek-v4-flash وdeepseek-v4-flash-vision-exp القديمة فسيتم توجيهها مؤقتًا إلى النموذج الجديد بهدف الحفاظ على التوافق مع التطبيقات الحالية.
كما أعلنت الشركة أن V4 Flash وV4 Flash Vision Exp السابقين خرجا من الخدمة، بينما تخطط لبدء توجيه طلبات V4 Pro إلى V4.1 Flash بعد 14 سبتمبر، إلى أن يصل V4.1 Pro مستقبلاً.
تخفيض أسعار API
بالتزامن مع الإطلاق، أعلنت DeepSeek خفض أسعار API للنموذج الجديد نتيجة انخفاض تكلفة التشغيل التي وفرتها البنية الجديدة.
كما ستستمر الشركة في استخدام نظام التسعير الذي يفرق بين أوقات الذروة والفترات الهادئة، حيث تكون أسعار الاستخدام في الأوقات منخفضة الضغط نصف أسعار ساعات الذروة.
التركيز على التكلفة مهم بصورة خاصة في مهام Agents، لأن الوكيل قد ينفذ عشرات أو مئات طلبات النموذج لإنجاز مهمة واحدة، ولذلك يمكن لتقليل تكلفة الـCache والاستدلال أن يحدث فرقًا كبيرًا عند التشغيل على نطاق واسع.
النموذج متاح على Hugging Face
نشرت DeepSeek أوزان النموذج على Hugging Face، ويمكن الاطلاع على صفحة DeepSeek V4.1 Flash الرسمية على Hugging Face، التي تتضمن بطاقة النموذج والتقرير التقني وتعليمات التشغيل.
وتوضح الصفحة إمكانية تشغيل النموذج من خلال Transformers وvLLM وSGLang وأدوات أخرى، لكن الحجم الكبير يعني أن تشغيل النسخة الكاملة محليًا ليس أمرًا عمليًا على أجهزة المستخدم العادية.
DeepSeek نفسها تشير إلى أن عمليات النشر واسعة النطاق قد تحتاج إلى موارد ضخمة تشمل آلاف بطاقات GPU وبنية تخزين مناسبة.
DeepSeek تستعد لإيقاف V4 Pro تدريجيًا
من أكثر التفاصيل لفتًا للانتباه أن الشركة لا تقدم النموذج باعتباره إصدار Flash أقل تكلفة فقط، بل تقول إن أداءه أصبح كافيًا لتجاوز V4 Pro في المؤشرات الرئيسية.
ولهذا تخطط DeepSeek لتوجيه استخدام V4 Pro إلى DeepSeek V4.1 Flash مؤقتًا بعد منتصف سبتمبر، في انتظار وصول V4.1 Pro.
هذه الخطوة تعكس تحولًا مهمًا في فلسفة النماذج؛ فبدل الاعتماد على نموذج أكبر وأكثر تكلفة للحصول على أفضل أداء، تحاول الشركة الحصول على مستوى مماثل أو أعلى من خلال تحسين البنية وكفاءة الذاكرة.
DeepSeek تواصل الضغط على تكلفة الذكاء الاصطناعي
منذ ظهور نماذج DeepSeek الأولى، ركزت الشركة على نسبة الأداء إلى التكلفة باعتبارها أحد عناصر المنافسة الرئيسية مع الشركات الأمريكية الكبرى.
وكانت سوالف قد تناولت سابقًا جانبًا مختلفًا من تطور نماذج الشركة في مقال كيف تكشف DeepSeek أسرار الكون من خلال نموذج رياضي جديد؟.
الإصدار الجديد يوضح أن المنافسة لم تعد تدور فقط حول من يملك أكبر عدد من المعاملات، وإنما حول كيفية استخدام هذه المعاملات وتقليل كمية الذاكرة والحوسبة المطلوبة لكل Token.
الخلاصة
DeepSeek V4.1 Flash يمثل تحديثًا تقنيًا كبيرًا في سلسلة DeepSeek، مع بنية CED جديدة، و552 مليار معامل MoE، وقدرات رؤية أصلية، وسياق يصل إلى مليون Token، إلى جانب تخفيض ملحوظ في KV Cache وتكلفة التشغيل.
الأهم أن الشركة تراهن على أن هذه الكفاءة تسمح لنموذج Flash بتجاوز نموذج Pro السابق في عدد من مهام الوكلاء، وهو ادعاء ستختبره المقارنات المستقلة خلال الأيام والأسابيع المقبلة.
وإذا تأكد هذا الأداء خارج اختبارات الشركة، فقد يكون الاتجاه الأهم في الجيل الجديد من نماذج الذكاء الاصطناعي ليس مجرد زيادة الحجم، بل تصميم نماذج كبيرة تستطيع تشغيل جزء صغير من قدراتها في كل لحظة مع تقليل تكلفة الذاكرة والاستدلال إلى أدنى حد ممكن.
لا يسمح بنقل هذا المحتوى من سوالف دون الاشارة برابط مباشر





