منوعات

جوجل تطلق Gemini 3.5 Transcribe لتحويل الكلام إلى نص بذكاء أكبر

جوجل تطلق Gemini 3.5 Transcribe لتحويل الكلام إلى نص بذكاء أكبر
جوجل تطلق Gemini 3.5 Transcribe لتحويل الكلام إلى نص بذكاء أكبر

أعلنت جوجل عن Gemini 3.5 Transcribe، أحدث نماذجها المتخصصة في تحويل الكلام إلى نص، مع مجموعة كبيرة من التحسينات التي تتجاوز فكرة نسخ الكلمات كما قيلت حرفيًا. النموذج الجديد يستطيع فهم السياق، وإزالة كلمات التردد، والتعامل مع تغير اللغة أثناء الحديث، والتعرف على المتحدثين المختلفين، بالإضافة إلى إنشاء نص أكثر ترتيبًا وقابلية للاستخدام مباشرة.

وتقدم جوجل النموذج باعتباره أدق نموذج Speech-to-Text لديها حتى الآن، مع تركيز واضح على الاستخدام في المحادثات الحية والإملاء الذكي والتطبيقات التي تحتاج إلى تحويل الصوت إلى نص بسرعة منخفضة التأخير.

الإجابة السريعة

Gemini 3.5 Transcribe هو نموذج جديد من جوجل لتحويل الصوت إلى نص، ويدعم أكثر من 85 لغة، والتبديل بين اللغات أثناء الكلام، والتعرف على المتحدثين، والتوقيت لكل كلمة، والقواميس المخصصة، إضافة إلى تنظيف النص تلقائيًا من الترددات والأخطاء الشائعة في الكلام.

ما الجديد في Gemini 3.5 Transcribe؟

المميز في النموذج الجديد أن جوجل لا تتعامل معه كمحرك إملاء تقليدي. الهدف هو تحويل الصوت الخام إلى نص منظم أقرب إلى ما كان المتحدث يقصد كتابته، وليس مجرد تسجيل حرفي لكل صوت أو كلمة صدرت منه.

على سبيل المثال، يستطيع Gemini 3.5 Transcribe إزالة كلمات التردد والتوقفات غير الضرورية، وفهم التصحيحات التي يجريها المستخدم أثناء الحديث، ثم إنتاج جملة نهائية أكثر وضوحًا.

وهذه الفكرة ظهرت بالفعل في بعض خدمات جوجل، ومنها ميزة Rambler على أندرويد وإمكانيات الإملاء الصوتي داخل تطبيق Gemini على macOS.

أكثر من 85 لغة والتبديل بينها أثناء الحديث

بحسب وثائق جوجل، يستطيع النموذج اكتشاف أكثر من 85 لغة تلقائيًا، كما يمكنه التعامل مع ما يسمى Code Switching، أي انتقال المتحدث من لغة إلى أخرى داخل المحادثة نفسها.

هذه النقطة مهمة بشكل خاص للمستخدم العربي الذي قد يستخدم كلمات إنجليزية أو أسماء تطبيقات ومصطلحات تقنية وسط الجملة العربية، وهي حالة لا تتعامل معها أنظمة تحويل الصوت التقليدية دائمًا بصورة جيدة.

وبدل الحاجة إلى تحديد اللغة مسبقًا، يحاول Gemini 3.5 Transcribe اكتشاف اللغة المستخدمة في كل جزء من الحديث تلقائيًا.

التعرف على المتحدثين المختلفين

عند معالجة الملفات الصوتية يدعم النموذج Speaker Diarization، وهي ميزة تحدد الشخص الذي قال كل جزء من الحديث بدل إخراج الحوار كله كنص واحد دون تمييز.

وتوضح جوجل أن معالجة الملفات يمكنها التعرف على ما يصل إلى ثمانية متحدثين، مع الإشارة إلى أن دقة الفصل بين ثلاثة متحدثين أو أكثر لا تزال مصنفة كتجريبية.

هذه الميزة يمكن أن تكون مفيدة في تفريغ الاجتماعات والمقابلات والبودكاست والمناقشات الطويلة.

أهم خصائص نموذج جوجل الجديد

الميزة ما الذي تقدمه؟
دعم اللغات اكتشاف تلقائي لأكثر من 85 لغة
التبديل بين اللغات التعامل مع استخدام أكثر من لغة في المحادثة نفسها
Smart Transcription تنظيف الترددات وتحسين تنسيق النص تلقائيًا
Speaker Diarization تمييز المتحدثين في الملفات الصوتية حتى 8 متحدثين
Word-level timestamps تحديد توقيت كل كلمة داخل التسجيل
Custom Vocabulary إضافة كلمات ومصطلحات متخصصة لتحسين التعرف عليها
Streaming تحويل الكلام إلى نص بصورة مباشرة ومنخفضة التأخير

قواميس مخصصة للمصطلحات الصعبة

من المزايا المهمة أيضًا دعم Custom Vocabulary Biasing. ويمكن للمطور إضافة قائمة بالمصطلحات والأسماء التي يتوقع استخدامها حتى يعطيها النموذج أولوية عند تحليل الصوت.

وتفيد هذه الخاصية في المجالات التي تحتوي على أسماء منتجات أو مصطلحات طبية وقانونية وتقنية قد لا يتعرف عليها نموذج عام بسهولة.

ووفق الوثائق الرسمية يدعم Gemini 3.5 Transcribe قوائم تصل إلى 1000 مصطلح، رغم أن جوجل تشير إلى أن أفضل النتائج لدى العملاء تظهر عادة مع قوائم أصغر تصل إلى نحو 100 مصطلح.

تحسن كبير في سرعة النسخ

تقول جوجل إن النموذج الجديد يحقق تقدمًا واضحًا مقارنة بنموذج Chirp 3 السابق، سواء من حيث الدقة أو زمن الاستجابة.

وبحسب قياسات Artificial Analysis التي استشهدت بها الشركة، تحسن الوقت المطلوب للحصول على النسخة النهائية من النص بنحو 70%.

كما سجل النموذج معدل خطأ كلمات WER يبلغ 5.50% في وضع البث المباشر و5.04% عند معالجة الملفات في الاختبارات التي عرضتها جوجل على مجموعة من اللغات والمناطق ضمن معيار FLEURS.

نسخ مباشر ونسخ من الملفات

توفر جوجل النموذج بطريقتين أساسيتين. الأولى هي gemini-3.5-transcribe-live للمحادثات والنسخ المباشر عبر WebSockets، والثانية gemini-3.5-transcribe لمعالجة الملفات الصوتية المسجلة.

النسخة المباشرة مصممة لزمن استجابة منخفض، بينما تتيح معالجة الملفات خصائص إضافية مثل تحديد المتحدثين والتوقيت على مستوى الكلمات.

ووفق الوثائق الحالية يمكن للجلسة الحية أن تصل إلى 10 دقائق، بينما تسمح معالجة الملفات بصوت يصل إلى ساعة، مع قيود أقل عندما يتم تفعيل خصائص متقدمة معينة.

Gemini يتوسع أكثر في التعامل مع الصوت

الإعلان الجديد يأتي في وقت توسع فيه جوجل استخدام Gemini داخل منتجاتها المختلفة بدل بقائه مجرد مساعد نصي. وقد تناولنا سابقًا في سوالف سوفت إتاحة Gemini 3 في بحث جوجل على نطاق أوسع، ضمن اتجاه الشركة إلى إدخال نماذجها في مزيد من الخدمات.

أما Gemini 3.5 Transcribe فيركز تحديدًا على جعل التعامل مع الصوت أكثر ذكاءً؛ فبدل النظر إلى التسجيل كسلسلة أصوات فقط، يحاول النموذج فهم ما يقصده المتحدث وكيف ينبغي أن يظهر الكلام عندما يتحول إلى نص مكتوب.

أين يمكن استخدام Gemini 3.5 Transcribe؟

النموذج متاح للمطورين من خلال Gemini API وGoogle AI Studio، كما أشارت جوجل إلى استخدام التقنية في منتجات وتجارب أخرى داخل منظومتها.

ومن التطبيقات المحتملة له تفريغ الاجتماعات والمقابلات، وتحويل الملاحظات الصوتية إلى نص منظم، وإضافة الإملاء الذكي إلى التطبيقات، وإنشاء ترجمات نصية للمحتوى الصوتي، والتعرف على المتحدثين في التسجيلات الطويلة.

وبهذه المزايا تحاول جوجل جعل تحويل الكلام إلى نص خطوة تتضمن قدرًا أكبر من الفهم، وليس مجرد عملية نسخ ميكانيكية للكلمات.

المصدر: Google

لا يسمح بنقل هذا المحتوى من سوالف دون الاشارة برابط مباشر

استضافة مجانية استضافة محتوى

Ayman abdallah

مؤسس ومدير تنفيذي لمشروع [محتوى] للمواقع العربية، مدير ادارة المحتوى في شركة Super App والرئيس التنفيذي ومدير التحرير والاعلانات لموقع سوالف سوفت.

اقرأ أيضا:

اترك تعليقاً

زر الذهاب إلى الأعلى