Eleven v4 يصل بصوت أكثر تعبيرًا ونسخة Turbo فائقة السرعة

أطلقت ElevenLabs نموذج Eleven v4 لتحويل النص إلى صوت، إلى جانب النسخة السريعة Eleven v4 Turbo الموجهة للتطبيقات الفورية ووكلاء الذكاء الاصطناعي. وتقدم الشركة الإصدار الجديد باعتباره أكثر نماذجها تعبيرًا حتى الآن، مع بنية جديدة تهدف إلى فهم السياق والنبرة والإيقاع والعاطفة بصورة أفضل، بدل الاكتفاء بقراءة الكلمات بصوت طبيعي فقط.
الإجابة السريعة
Eleven v4 هو الجيل الجديد من نماذج تحويل النص إلى صوت لدى ElevenLabs، ويدعم أكثر من 90 لغة، وتعدد المتحدثين، والمؤثرات الصوتية، والتعليمات المكتوبة داخل النص مثل الهمس والضحك والتوقفات. أما Eleven v4 Turbo فيركز على المحادثات الحية ووكلاء الصوت بزمن استجابة منخفض يصل وفق الشركة إلى نحو 100 مللي ثانية للاستدلال ونحو 150 مللي ثانية لبدء الكلام.
النموذج لا يقرأ النص فقط بل يحاول فهم المشهد
الفكرة الأساسية في النموذج هي أن النموذج لا يتعامل مع كل جملة باعتبارها مقطعًا منفصلًا. تقول ElevenLabs إن البنية الجديدة تتابع من المتحدث، وما الذي حدث قبل الجملة، والطريقة التي يجب أن تصل بها العبارة إلى المستمع. وهذا يسمح للنموذج بالانتقال بين نبرة هادئة أو درامية أو متوترة أو مرحة مع الحفاظ على هوية الصوت عبر الحوار.
هذا التوجه مهم خصوصًا في الكتب الصوتية والألعاب والبودكاست والمشاهد الحوارية، لأن المشكلة في أجيال تحويل النص إلى صوت لم تعد فقط وضوح النطق. المستخدم يريد أن تبدو الجملة مناسبة لما قبلها وما بعدها، وأن يظل المتحدث نفسه متماسكًا عند إعادة توليد مقطع أو الانتقال بين أكثر من شخصية.
تعليمات صوتية داخل النص نفسه
أحد أبرز التغييرات هو الاعتماد على Audio Tags داخل النص. يمكن كتابة تعليمات مثل [laughs] أو [whispers] أو [long pause] أو حتى مؤثر مثل [door slams]، ثم يحاول النموذج تنفيذها أثناء التوليد. وتقول الشركة إن النموذج أصبح أكثر التزامًا بتسلسل هذه التعليمات مقارنة بالإصدار v3، مع دعم المؤثرات الصوتية ضمن المشهد نفسه.
المثير هنا أن التحكم لا يقتصر على المشاعر. المستخدم يستطيع توجيه الإيقاع، والتوقف، وطريقة النطق، بينما تظل قواميس النطق متاحة لتعريف أسماء الأشخاص والمصطلحات والاختصارات والكلمات التقنية. في المقابل، توضح ElevenLabs أن وسوم SSML مثل <break> غير مفعلة في هذا الإصدار، ويجب استخدام التعليمات الطبيعية داخل الأقواس بدلًا منها.
أكثر من 90 لغة وتعدد المتحدثين
يدعم النموذج الكلام بأكثر من 90 لغة، مع إمكانية وجود عدة متحدثين داخل التوليد نفسه. وتعرض الشركة النموذج بوصفه مناسبًا للحوار، والسرد، والمحتوى التعليمي، والإعلانات، والشخصيات الخيالية، والمحتوى متعدد اللغات.
كما تعمل جميع الأصوات المتاحة في مكتبة ElevenLabs، التي تضم أكثر من 17,500 صوت وفق الصفحة الرسمية، مع النموذج الجديد. لكن الأصوات المستنسخة التي أنشئت قبل إطلاق الإصدار قد تحتاج إلى إعادة تدريب أو تهيئة حتى تعمل بأفضل صورة مع الجيل الجديد.
عودة Professional Voice Cloning بعد غيابه في v3
أعادت ElevenLabs دعم Professional Voice Cloning في الإصدار الجديد بعد عدم توفره في v3. وتقول الشركة إن النسخ الاحترافي يستطيع الاستفادة من النطاق العاطفي الكامل للنموذج عبر اللغات التي يتحدثها الصوت.
إلى جانب ذلك، تظل ميزة Instant Voice Cloning متاحة، كما يمكن للمستخدم تصميم صوت جديد من وصف نصي بدل تسجيل نموذج صوتي مسبق. وتوضح الشركة أن استنساخ أي صوت يتطلب موافقة موثقة من صاحب الصوت، وأن الصوت الناتج يظل خاضعًا لتقنيات الكشف الخاصة بها.
Eleven v4 يقدم ثبات أكبر عند إعادة توليد الجمل
من المشكلات المعروفة في أدوات الصوت الاصطناعي أن إعادة إنشاء جملة واحدة قد تؤدي إلى تغير ملحوظ في شخصية الصوت أو طبقته. تقول ElevenLabs إن الإصدار الجديد يعالج هذه النقطة من خلال الحفاظ على هوية المتحدث عند إعادة توليد السطر مرات متعددة، سواء كان الاستخدام حوارًا أو سردًا طويلًا.
كما أضافت الشركة ما تسميه Context Stitching للمحتوى الطويل، بحيث تحافظ المقاطع المتتابعة على الإيقاع وطريقة الإلقاء بصورة أكثر استقرارًا. الحد الأقصى للتوليد الواحد هو 10,000 حرف، بينما صُمم الربط السياقي لمساعدة المشاريع الأطول مثل الكتب الصوتية على تجنب الشعور بأن كل جزء تم تسجيله بمعزل عن الآخر.
Eleven v4 Turbo للمحادثات الفورية ووكلاء AI
إلى جانب النموذج الأساسي كشفت الشركة عن Eleven v4 Turbo، وهو إصدار يركز على الزمن الحقيقي. ووفق الأرقام الرسمية، يبلغ متوسط زمن الاستدلال نحو 100 مللي ثانية، بينما يصل متوسط الوقت حتى بداية الكلام إلى نحو 150 مللي ثانية.
الهدف من هذه السرعة هو تطبيقات المكالمات والمساعدين الصوتيين ووكلاء الذكاء الاصطناعي، حيث تؤدي أي مهلة طويلة بين سؤال المستخدم والرد إلى جعل المحادثة مصطنعة. يدعم Turbo البث ثنائي الاتجاه، بحيث يمكن إرسال النص أثناء قيام نموذج اللغة بإنتاجه والبدء في استقبال الصوت قبل اكتمال الجملة بالكامل.
وتوفر ElevenLabs هذا الإصدار عبر API وElevenAgents، بينما يستطيع المطور استخدام واجهات REST أو البث المباشر أو حزم TypeScript وPython. وتقول الشركة إن Professional Voice Clones تعمل عبر النموذجين، ما يسمح باستخدام الصوت نفسه في المحتوى المسجل والمحادثات الفورية.
ماذا تغير مقارنة بـ Eleven v3؟
بحسب ElevenLabs، يعتمد Eleven v4 على بنية جديدة مع جودة صوت أعلى ونطاق عاطفي أوسع، وتحسن في ثبات هوية المتحدث، وعودة Professional Voice Cloning، والتزام أفضل بالتعليمات الصوتية، وانخفاض في زمن بدء التوليد.
وهذه التغييرات تجعل المقارنة مع v3 أوسع من مجرد زيادة عدد اللغات أو تحسين نقاء الصوت. التركيز انتقل إلى التحكم في الأداء نفسه: ماذا يشعر المتحدث، ومتى يتوقف، وكيف ينطق الجملة، وكيف يظل الصوت متماسكًا خلال الحوار أو عند إعادة إنشاء جزء صغير منه.
نتائج اختبارات تعلنها ElevenLabs
تقول الشركة إن Eleven v4 جاء في المركز الأول في تقييم Artificial Analysis، كما تشير إلى أن نحو 75% من المستمعين في اختبارات مقارنة عمياء فضلوه على نماذج منافسة. هذه الأرقام واردة في إعلان ElevenLabs نفسه، ولذلك ينبغي التعامل معها باعتبارها نتائج منشورة من الشركة إلى جانب تفاصيل منهجية الاختبار التي تشير إليها في الإعلان، وليست حكمًا مستقلاً على جميع سيناريوهات الاستخدام.
الخطة المجانية متاحة والنموذج لا يحتاج اشتراكًا جديدًا
النموذج متاح ضمن خطط ElevenLabs الحالية ولا يملك تسعيرًا منفصلًا. الخطة المجانية تمنح 10,000 رصيد شهريًا، وهو ما تقدره الشركة بنحو عشر دقائق من الصوت، مع استخدام شخصي ودون الحاجة إلى بطاقة ائتمان. وتبدأ الخطط المدفوعة المعروضة حاليًا من 6 دولارات شهريًا وتضيف أرصدة أعلى ومزايا منها Professional Voice Cloning وحدود أكبر وتوليد أسرع.
هذا يجعل تجربة Eleven v4 متاحة مباشرة لمن يريد اختبار جودة الصوت قبل الانتقال إلى خطة مدفوعة، بينما ستعتمد التكلفة الفعلية للمشاريع الكبيرة على حجم التوليد ونوع الخطة وطريقة الاستخدام عبر الواجهة أو API.
أين يمكن أن يفيد الإصدار الجديد عمليًا؟
أكثر الفئات استفادة من هذا النوع من التحسينات هم منتجو الكتب الصوتية والبودكاست وصناع الفيديو والألعاب، إضافة إلى الفرق التي تبني مساعدين صوتيين أو مراكز اتصال آلية. تعدد المتحدثين والتعليمات العاطفية يساعدان في إنتاج مشاهد أكثر تركيبًا، بينما يخدم Turbo التطبيقات التي تحتاج إلى رد فوري بدل توليد ملف صوتي وانتظاره.
ومن يريد مقارنة الاتجاه السحابي لدى ElevenLabs مع مشروع يعمل محليًا يمكنه مراجعة مقال سوالف عن VoiceStudio كبديل مفتوح المصدر لـ ElevenLabs، حيث يختلف النموذجان جذريًا في طريقة التشغيل والخصوصية ومتطلبات الجهاز.
نقلة من توليد الصوت إلى إخراج الأداء
اللافت في Eleven v4 أن المنافسة لم تعد تدور فقط حول جعل الصوت أقرب إلى الإنسان، بل حول منح صانع المحتوى تحكمًا يشبه توجيه ممثل صوتي: نبرة، توقفات، مشاعر، مؤثرات، أكثر من متحدث، واستمرارية عبر نصوص طويلة. أما Eleven v4 Turbo فينقل الفكرة نفسها إلى المحادثة الحية حيث تصبح السرعة عنصرًا أساسيًا إلى جانب جودة الصوت.
يمكن تجربة النموذج والاطلاع على العينات والتفاصيل التقنية من صفحة Eleven v4 الرسمية. وقد أعلنت ElevenLabs عن الإصدار في 28 سبتمبر 2026، مع إتاحته عبر ElevenCreative وElevenAgents وواجهة API.
لا يسمح بنقل هذا المحتوى من سوالف دون الاشارة برابط مباشر




