مقالات الذكاء الاصطناعي

Gemini 3.8 Live: الفرق بين النموذج العادي وExtended Thinking

Gemini 3.8 Live: الفرق بين النموذج العادي وExtended Thinking
Gemini 3.8 Live: الفرق بين النموذج العادي وExtended Thinking

أعلنت جوجل عن جيل جديد من نماذج المحادثة الصوتية الحية يضم Gemini 3.8 Live وGemini 3.8 Live Extended Thinking، لكن الفرق بينهما لا يقتصر على اسم أطول أو وضع تفكير إضافي. النموذج الأول مصمم للسرعة والتوسع وكفاءة التكلفة في المحادثات الفورية، بينما الثاني موجه للمهام التي تحتاج إلى استدلال أعمق وخطوات متعددة مع استمرار الحوار من دون توقف. لذلك فإن اختيار النموذج المناسب عمليًا يعتمد أساسًا على طبيعة المهمة أكثر من اعتماده على فكرة أن أحدهما أفضل مطلقًا.

الإجابة السريعة

Gemini 3.8 Live هو الخيار الأنسب للمحادثات الصوتية السريعة، وخدمة العملاء، والبحث الحي، والمهام التي تحتاج إلى استجابة فورية مع تكلفة أقل. أما Gemini 3.8 Live Extended Thinking فهو موجه للمهام المعقدة التي تحتاج إلى تخطيط واستدلال متعدد الخطوات، مثل تنسيق حجوزات متتابعة أو تحويل ملاحظات صوتية ورسومات إلى مكونات برمجية. النموذجان يدعمان الحوار الطبيعي والأدوات والسياق البصري، لكن Extended Thinking يستهلك وقتًا أكبر للتفكير عندما تكون المشكلة تستحق ذلك.

ما الجديد في نماذج Gemini الصوتية؟

تصف جوجل النموذجين بأنهما الأكثر تقدمًا لديها حتى الآن للمحادثة الحية. الهدف لم يعد مجرد تحويل الكلام إلى نص ثم إنتاج إجابة صوتية، بل الحفاظ على حوار مستمر أثناء تنفيذ أدوات وعمليات في الخلفية. يستطيع Gemini 3.8 Live مثلًا الاعتراف بالطلب فورًا والاستمرار في الحديث بينما تنفذ استدعاءات API أو الأدوات المطلوبة.

هذه النقلة مهمة لأن المساعدات الصوتية التقليدية كانت تميل إلى التوقف بين الاستماع والمعالجة والرد. في الجيل الجديد تحاول جوجل جعل التجربة أقرب إلى محادثة حقيقية، بحيث يمكنك مقاطعة النموذج في منتصف الجملة أو تغيير الموضوع أو الانتقال بين اللغات من دون إعادة بدء الجلسة.

الفرق الأساسي بين Gemini 3.8 Live وExtended Thinking

تضع جوجل النموذج العادي في خانة السرعة وقابلية التوسع وكفاءة التكلفة. هذا يعني أنه مخصص للسيناريوهات التي تتطلب عددًا كبيرًا من المحادثات والاستجابات السريعة، مثل المساعدات الصوتية العامة وخدمة العملاء والبحث المباشر والدعم التفاعلي.

أما Gemini 3.8 Live Extended Thinking فيضيف مستوى أعمق من الاستدلال للمهام المعقدة. يستطيع النموذج التفكير في الخلفية وفي الوقت نفسه إبقاء المستخدم داخل المحادثة، مع عبارات مبكرة مثل «دعني أتحقق من ذلك» ثم تقديم تحديثات صوتية أثناء تقدم المهمة. هذا الأسلوب مفيد عندما تحتاج المهمة إلى أكثر من خطوة أو أكثر من أداة بدل إجابة مباشرة واحدة.

السرعة مقابل عمق التفكير

إذا كان السؤال بسيطًا أو يحتاج إلى معلومات فورية، فلن تستفيد كثيرًا من دفع النموذج إلى تفكير ممتد. هنا يظهر دور Gemini 3.8 Live الذي يحاول الحفاظ على زمن استجابة منخفض وتدفق محادثة سريع.

في المقابل، إذا طلبت من المساعد مقارنة عدة خيارات، أو تنفيذ سلسلة حجوزات، أو تحليل مشكلة مركبة ثم اتخاذ خطوات متتابعة، يصبح Extended Thinking أكثر ملاءمة. الفكرة ليست أن النموذج الأبطأ أفضل دائمًا، بل أن الوقت الإضافي يصبح له قيمة عندما ترتفع صعوبة المهمة.

المقاطعة أثناء الكلام أصبحت جزءًا أساسيًا من التجربة

أحد الجوانب التي ركزت عليها جوجل هو القدرة على مقاطعة المساعد في منتصف حديثه. يستطيع المستخدم إضافة معلومة أو تغيير الاتجاه قبل انتهاء الرد، وهو سلوك ضروري إذا أرادت الشركة أن تجعل الصوت وسيلة عمل حقيقية بدل مجرد واجهة لإملاء الأسئلة.

ويستفيد Gemini 3.8 Live من هذه القدرة في السيناريوهات اليومية؛ فإذا كنت تسأل عن خطوات إصلاح جهاز ثم اكتشفت معلومة جديدة أمامك، يمكنك مقاطعة النموذج وإضافة التفاصيل بدل الانتظار حتى ينهي شرحًا لم يعد مناسبًا.

97 لغة والتحول بينها أثناء المحادثة

بحسب جوجل، يستطيع النموذج العادي اكتشاف 97 لغة مدعومة والانتقال بينها أثناء المحادثة نفسها. هذا يعني أنك تستطيع البدء بالعربية ثم إدخال مصطلح إنجليزي أو الانتقال إلى لغة أخرى من دون تغيير إعداد منفصل.

هذه الميزة تجعل Gemini 3.8 Live مناسبًا للتطبيقات العالمية ومراكز الخدمة التي تتعامل مع مستخدمين بلغات متعددة، كما تقلل الحاجة إلى تحديد لغة الجلسة قبل بدء المحادثة.

السياق البصري: الصوت لم يعد يعمل وحده

النموذج يستطيع معالجة المدخلات البصرية في وقت شبه حقيقي، وبالتالي يمكن للمحادثة أن تعتمد على ما تقوله وما تشير إليه بالكاميرا في الوقت نفسه. عرضت جوجل مثالًا على مساعدة المستخدم في حل مشكلة عملية عبر النظر إلى الجزء الذي يوجه إليه الكاميرا.

وهذا يجعل Gemini 3.8 Live مناسبًا للدعم الفني والتدريب والإرشاد الميداني. بدل وصف كل شيء بالكلمات، يمكن للمستخدم عرض المشكلة مباشرة ثم الحصول على خطوات صوتية مرتبطة بما يراه النموذج.

Extended Thinking للمهام متعددة الخطوات

الميزة الأهم في النسخة الممتدة هي أن التفكير لا يقطع الحوار. عندما يبدأ النموذج مهمة معقدة، يستطيع إعطاء المستخدم إشارات مبكرة عن أنه يعمل عليها، ثم يواصل سرد التقدم بينما تنفذ عمليات في الخلفية.

عرضت جوجل أمثلة تشمل تنسيق حجوزات متعددة واستدعاءات وظائف غير متزامنة، وتحويل رسومات أولية وملاحظات صوتية لحظية إلى مكونات React قابلة للاستخدام. هذه السيناريوهات تحتاج إلى تخطيط ومراجعة أكثر من مجرد الرد على سؤال بسيط.

تنفيذ الأدوات في الخلفية

يدعم النموذجان استدعاء الوظائف والأدوات بصورة غير متزامنة، ما يسمح للمحادثة بالاستمرار بينما يجري تنفيذ عملية خارجية. هذه نقطة مهمة للأنظمة التي تعتمد على قواعد بيانات أو حجوزات أو خدمات خارجية، لأن المستخدم لا يضطر إلى الانتظار في صمت حتى تنتهي العملية.

بالنسبة إلى Gemini 3.8 Live، هذا السلوك يجعله أقرب إلى وكيل صوتي قادر على الفعل، وليس مجرد مساعد يجيب عن الأسئلة. أما Extended Thinking فيضيف طبقة تخطيط أعمق عندما تكون هناك سلسلة من الأدوات أو القرارات التي يجب تنسيقها.

أي النموذجين أفضل لخدمة العملاء؟

في معظم سيناريوهات خدمة العملاء واسعة النطاق، يبدو النموذج العادي أكثر منطقية بسبب تركيز جوجل على السرعة والتكلفة والتوسع. يستطيع الرد بسرعة، التعامل مع المقاطعات، التحول بين اللغات، والاستفادة من الأدوات لتنفيذ إجراءات في الخلفية.

لكن عندما تصبح الحالة معقدة وتحتاج إلى جمع معلومات من أكثر من نظام أو اتخاذ عدة خطوات مترابطة، يمكن تحويل المهمة إلى Extended Thinking. لذلك قد تستخدم الشركات النموذجين معًا بدل اختيار واحد فقط لكل الحالات.

ماذا عن الأداء في الاختبارات؟

تنشر جوجل أرقامًا قوية للنسخة الممتدة. وفق إعلانها، حقق Gemini 3.8 Live Extended Thinking المركز الأول على Speech to Speech Quality Index من Artificial Analysis بنتيجة 82.6، كما سجل 68.6% على τ-Voice و35.1% على معيار Sierra τ-Voice-banking، إضافة إلى 97.7% على Big Bench Audio.

أما Gemini 3.8 Live فحل ثانيًا في Speech Agent Arena بحسب البيانات التي استشهدت بها جوجل. هذه النتائج مفيدة للمقارنة التقنية، لكنها لا تعني أن كل مستخدم سيحصل على النتيجة نفسها في جميع السيناريوهات، لأن جودة التجربة تعتمد على المهمة والأدوات والاتصال والتطبيق الذي يستخدم النموذج.

التكلفة مهمة للمطورين

جوجل تضع النموذج العادي بوضوح كخيار مصمم للتوسع وكفاءة التكلفة. وفي Live API أعلنت الشركة سعرًا يبدأ من 0.005 دولار لكل دقيقة إدخال صوتي و0.018 دولار لكل دقيقة إخراج صوتي للنماذج الجديدة، بحسب صفحة المطورين وقت الإطلاق.

لهذا قد يكون Gemini 3.8 Live الاختيار الطبيعي للتطبيقات التي تتعامل مع عدد ضخم من الدقائق يوميًا، بينما يُستخدم Extended Thinking عندما تكون قيمة الدقة والاستدلال الإضافي أكبر من أهمية أقل زمن ممكن للاستجابة.

أين تتوفر النماذج الجديدة؟

تقول جوجل إن النماذج بدأت الوصول عبر Gemini API وGoogle AI Studio ومنتجات المؤسسات، كما تستخدمها تجارب داخل Gemini وGoogle Workspace وSearch Live. ويمكن للمطورين بناء تطبيقات صوتية عليها من خلال Live API، مع تكاملات مع منصات مثل LiveKit وPipecat وVercel وAgora.

وعلى مستوى المستخدم النهائي، يظهر أثر النموذج الأساسي في تجارب المحادثة والبحث الحي، بينما تتجه النسخة الممتدة إلى السيناريوهات التي تحتاج إلى مستوى أكبر من التفكير والتنفيذ.

هل Extended Thinking أفضل دائمًا؟

لا. استخدام التفكير الممتد في مهمة بسيطة يمكن أن يزيد زمن الاستجابة من دون فائدة حقيقية. إذا كنت تريد معلومة سريعة أو حوارًا طبيعيًا أو ترجمة مباشرة أو مساعدة بصرية فورية، فالنموذج الأساسي غالبًا أكثر ملاءمة.

أما عندما تكون المشكلة غامضة أو مركبة أو تحتاج إلى تخطيط متعدد المراحل، فقد يبرر Extended Thinking الانتظار الإضافي. وهنا يصبح الاختيار أقرب إلى الفرق بين وضع سريع ووضع تحليل عميق بدل الفرق بين نموذج جيد وآخر سيئ.

ما الذي تغير مقارنة بـGemini Live القديم؟

سوالف تناول سابقًا كيف يعمل Gemini Live عندما كانت الفكرة الأساسية تدور حول المحادثة الطبيعية والمقاطعة وفهم السياق. الجيل الجديد يتجاوز ذلك بإضافة تنفيذ الأدوات في الخلفية، والسياق البصري شبه اللحظي، والتحول بين عدد أكبر من اللغات، ونموذج منفصل للتفكير الممتد.

لذلك لا يعد الإصدار الجديد مجرد تحديث في جودة الصوت، بل خطوة باتجاه وكيل يستطيع الاستماع والرؤية والتنفيذ مع الحفاظ على حوار مستمر مع المستخدم.

كيف تختار بين النموذجين؟

اختر النموذج العادي عندما تكون الأولوية للسرعة والحوار الطبيعي والتكلفة المنخفضة والتعامل مع عدد كبير من الجلسات. وهو الأنسب للدعم الصوتي والبحث المباشر والمساعدة البصرية والمهام التي تتطلب إجراءً واحدًا أو عددًا محدودًا من الخطوات.

واختر Extended Thinking عندما تحتاج إلى تحليل أعمق، أو تنسيق سلسلة من الأدوات، أو حل مشكلة متعددة المراحل، أو مهمة يكون الخطأ فيها أكثر تكلفة من الانتظار لثوانٍ إضافية. إذا كنت مطورًا، قد يكون التصميم الأفضل هو استخدام Gemini 3.8 Live افتراضيًا ثم توجيه الحالات المعقدة إلى النسخة الممتدة.

الخلاصة

الفارق الحقيقي بين النموذجين هو المقايضة بين السرعة والكفاءة من جهة، وعمق الاستدلال من جهة أخرى. Gemini 3.8 Live موجه للمحادثات الحية السريعة والقابلة للتوسع، بينما يضيف Extended Thinking قدرة أكبر على التفكير متعدد الخطوات ومتابعة المهام المعقدة من دون كسر تدفق الحوار.

وبدل السؤال عن أيهما الأقوى بشكل مطلق، السؤال الأفضل هو: ما طبيعة المهمة؟ إذا كانت تحتاج إلى سرعة وتفاعل لحظي فالنموذج الأساسي أقرب للاختيار الصحيح، وإذا كانت تحتاج إلى تخطيط وتحليل وتنفيذ متتابع فـExtended Thinking هو الخيار الأقوى. ويمكن مراجعة إعلان Google الرسمي عن النموذجين لمعرفة تفاصيل الإطلاق والاختبارات التي نشرتها الشركة.

لا يسمح بنقل هذا المحتوى من سوالف دون الاشارة برابط مباشر

الأسئلة الشائعة

استضافة مجانية استضافة محتوى

Ayman abdallah

مؤسس ومدير تنفيذي لمشروع [محتوى] للمواقع العربية، مدير ادارة المحتوى في شركة Super App والرئيس التنفيذي ومدير التحرير والاعلانات لموقع سوالف سوفت.

اقرأ أيضا:

اترك تعليقاً

زر الذهاب إلى الأعلى