اخبار الذكاء الاصطناعي

Gemini 3.8 Live يحصل على Live Avatar لمحادثات مرئية

Gemini 3.8 Live يحصل على Live Avatar لمحادثات مرئية
Gemini 3.8 Live يحصل على Live Avatar لمحادثات مرئية

بعد أسبوع واحد فقط من إطلاق جوجل نماذج المحادثة الصوتية الجديدة، أضافت الشركة بعدًا بصريًا إلى Gemini 3.8 Live عبر ميزة Live Avatar، التي تمنح وكلاء الذكاء الاصطناعي شخصية مرئية متحركة تتحدث بتزامن مع الصوت، وتستطيع في الوقت نفسه فهم ما يراه المستخدم عبر الكاميرا أو مشاركة الشاشة. الميزة أصبحت متاحة الآن لعملاء Gemini Enterprise، ما يجعلها أقرب إلى أداة موجهة للشركات والمطورين منها إلى تحديث مباشر لتطبيق Gemini الاستهلاكي.

الإجابة السريعة

ميزة Live Avatar الجديدة تجعل Gemini 3.8 Live قادرًا على تقديم محادثة صوتية ومرئية شبه فورية من خلال أفاتار متحرك بتزامن دقيق للشفاه وتعبيرات طبيعية، مع دعم 97 لغة، وفهم البث الحي من الكاميرا ومشاركة الشاشة، وتنفيذ الأدوات وواجهات API في الخلفية دون قطع الحوار. الإطلاق الحالي مخصص لـGemini Enterprise، بينما إنشاء أفاتار مخصص من صورة مرجعية ما زال يتطلب موافقة خاصة من جوجل.

ما الذي أضافته Live Avatar فعليًا؟

كانت جوجل قد أطلقت Gemini 3.8 Live ونسخة Extended Thinking في 15 سبتمبر، مع تركيز واضح على المحادثة الطبيعية، المقاطعة أثناء الكلام، تنفيذ الأدوات في الخلفية، والسياق البصري. الإضافة الجديدة لا تستبدل هذه القدرات، بل تبني فوقها طبقة فيديو تجعل الوكيل يظهر للمستخدم كشخصية مرئية تتفاعل أثناء الحوار بدل الاكتفاء بصوت بلا وجه.

وفق الإعلان الرسمي، تقرن Live Avatar توليد الفيديو شبه الفوري بالكلام، بحيث تتزامن حركة الشفاه والتعبيرات مع الصوت وتتغير مع سير المحادثة. الفكرة هنا ليست مجرد شخصية كرتونية ثابتة؛ جوجل تتحدث عن حضور مرئي ديناميكي يستطيع الاستماع والرؤية والكلام في تجربة واحدة.

يرى ما تراه الكاميرا والشاشة

أحد أهم جوانب Gemini 3.8 Live في هذا الإصدار هو أن الفيديو لا يسير في اتجاه واحد. الوكيل لا يعرض وجهًا متحركًا فقط، بل يستطيع معالجة بث الكاميرا الحي ومشاركة الشاشة بالتزامن مع الصوت. وهذا يفتح الباب أمام استخدامات عملية مثل الدعم الفني المرئي، التدريب، خدمة العملاء، أو توجيه المستخدم خلال مهمة بينما يشاهد ما يحدث أمامه.

عرضت Google Cloud مثالًا لوكيل مطالبات تأمين: يتحدث المستخدم ويعرض الضرر بالكاميرا، بينما تُملأ بيانات المطالبة في الخلفية وتتحقق أنظمة أخرى من السياسة والقواعد. هذا المثال يوضح الفرق بين أفاتار للعرض فقط ووكيل مرئي لديه اتصال فعلي بالأدوات والبيانات.

الحوار لا يتوقف أثناء تنفيذ الأدوات

تحافظ Live Avatar على إحدى أهم قدرات الجيل الجديد، وهي الاستدعاء غير المتزامن للأدوات. يستطيع Gemini 3.8 Live بدء استدعاء API أو البحث عن بيانات أو تنفيذ إجراء في الخلفية، وفي الوقت نفسه يستمر في الحديث مع المستخدم بدل التوقف في صمت حتى تنتهي العملية.

هذه النقطة مهمة خصوصًا في مراكز الخدمة. إذا طلب المستخدم التحقق من حجز أو حالة طلب، يمكن للوكيل الاعتراف بالطلب فورًا ومواصلة الحوار بينما يجلب النظام البيانات المطلوبة. جوجل تراهن هنا على أن الشعور باستمرار المحادثة مهم بقدر سرعة النتيجة نفسها.

97 لغة مع تزامن بصري أثناء الانتقال بينها في Gemini 3.8 Live

تقول جوجل إن Gemini 3.8 Live يفهم ويتحدث 97 لغة مع اكتشاف تلقائي للغة. ومع Live Avatar لا يقتصر الأمر على تبديل الصوت؛ بل تتكيف مزامنة الشفاه والتعبيرات أثناء الانتقال بين اللغات دون أن يتحول الفيديو إلى طبقة منفصلة عن الحوار.

هذه القدرة تجعل التقنية مناسبة نظريًا لخدمات العملاء العالمية أو الأكشاك التفاعلية أو تطبيقات الويب والموبايل التي تحتاج إلى واجهة واحدة تخدم مستخدمين بلغات مختلفة. لكنها لا تعني أن كل اللغات ستقدم مستوى الجودة نفسه في كل لهجة أو سيناريو، ولذلك تبقى التجربة الفعلية مهمة عند النشر التجاري.

يمكن للشركات إنشاء شخصية خاصة بها.. لكن بشروط

توفر جوجل مكتبة من الشخصيات الجاهزة، كما تسمح للشركات بإنشاء أفاتار مخصص انطلاقًا من صورة مرجعية عالية الجودة. في العرض الرسمي، يمكن إضافة تعليمات للنظام ورفع صورة وعينة صوت لإنشاء شخصية متحركة تحافظ على الشكل والهوية البصرية المطلوبة.

لكن هذه الميزة ليست مفتوحة للجميع. إنشاء الشخصيات المخصصة متاح حاليًا عبر allowlist للمؤسسات بعد عملية تحقق، وهي نقطة مهمة لأن التقنية بطبيعتها تلامس مخاطر انتحال الهوية وإساءة استخدام الصور والأصوات.

SynthID على الصوت والفيديو المولد

لمعالجة جانب الشفافية، تؤكد جوجل أن كل مخرجات الصوت والفيديو التي تولدها Live Avatar تحمل علامة SynthID غير مرئية. الهدف هو إبقاء المحتوى المولد آليًا قابلًا للكشف، حتى عندما يبدو الأفاتار طبيعيًا أثناء الحوار.

وتضيف الشركة أن الشخصيات المخصصة تخضع لعملية تحقق وقيود على الوصول، بينما يمكن للعملاء استخدام مجموعة من الأفاتارات الجاهزة. هذه الضوابط لا تلغي مخاطر الاستخدام السيئ، لكنها توضح أن الإطلاق التجاري جاء مع طبقة من الحماية بدل ترك ميزة تقليد الهوية مفتوحة دون قيود.

ليست ميزة جديدة لكل مستخدمي تطبيق Gemini

هنا توجد نقطة قد تسبب بعض الالتباس. إعلان Live Avatar لا يعني أن كل مستخدم لتطبيق Gemini على الهاتف سيجد فجأة شخصية مرئية تتحدث معه. جوجل تطرح Gemini 3.8 Live مع Live Avatar حاليًا داخل Gemini Enterprise، وتوفره للمطورين عبر Gemini Live API مع نقاط خدمة في الولايات المتحدة والاتحاد الأوروبي وخيارات موجهة لبيئات المؤسسات.

أما Gemini 3.8 Live Extended Thinking فما زال في Private Preview وفق Google Cloud. ولذلك يجب الفصل بين نموذج المحادثة الحية نفسه، الذي بدأ الوصول إلى عدة منتجات وتجارب، وبين ميزة الأفاتار المرئي المعلنة حاليًا لقطاع المؤسسات.

تطور جديد بعد Gemini 3.8 Live وليس خبرًا مكررًا

كانت سوالف قد تناولت قبل أيام الفرق بين Gemini 3.8 Live وExtended Thinking، بما في ذلك قدرات الصوت والسياق البصري وتنفيذ الأدوات واللغات. الجديد هنا مختلف بوضوح: تحويل تلك المحادثة إلى تجربة فيديو تفاعلية بشخصية مرئية، مع إتاحة تجارية داخل Gemini Enterprise.

وبهذا تتحرك جوجل خطوة إضافية من فكرة «المساعد الصوتي» نحو وكلاء رقميين يمكن أن يكون لهم وجه وصوت وسياق بصري وأدوات تنفيذ في الجلسة نفسها. الاستخدامات الأولى تبدو مؤسسية بوضوح: خدمة العملاء، الإرشاد، الأكشاك التفاعلية، المبيعات، والمساعدة الميدانية، لكن التقنية تكشف أيضًا الشكل الذي قد تتجه إليه المساعدات الشخصية لاحقًا إذا انتقلت هذه القدرات إلى منتجات المستهلكين.

يمكن مراجعة إعلان جوجل الرسمي عن Live Avatar للاطلاع على عروض الفيديو والتفاصيل التقنية للإطلاق.

لا يسمح بنقل هذا المحتوى من سوالف دون الاشارة برابط مباشر

استضافة مجانية استضافة محتوى

Ayman abdallah

مؤسس ومدير تنفيذي لمشروع [محتوى] للمواقع العربية، مدير ادارة المحتوى في شركة Super App والرئيس التنفيذي ومدير التحرير والاعلانات لموقع سوالف سوفت.

اقرأ أيضا:

اترك تعليقاً

زر الذهاب إلى الأعلى