قراءة النص شيء، وأداؤه شيء آخر.
أعطِ برنامج قراءة عبارة «آه، رائع، ها أنت هنا» فسينطق الكلمات. وأعطها لممثلة فستسأل عما حدث قبلها مباشرة. هل الشخصية مرتاحة؟ أم ساخرة؟ هل وصل أحدهم للتو متأخرًا إلى اجتماع؟
كانت الإصدارات السابقة من ElevenLabs قادرة على أداء الجملة إذا أخبرتها كيف. أما Eleven v4 فيحاول أن يستنتج ذلك بنفسه. تقول ElevenLabs إنه يقرأ الحوار المحيط، أي من يتكلم وكيف تصاعد التبادل وما الذي قيل للتو، ثم يؤدي كل جملة بما يناسبها.
أطلقت ElevenLabs نموذج Eleven v4 في 28 سبتمبر 2026، ومعه Eleven v4 Turbo، وهو نسخة أسرع لوكلاء الصوت في الوقت الفعلي. وكلاهما متاح في تطبيقات ElevenLabs وواجهتها البرمجية، بما في ذلك الخطة المجانية.
ماذا يقول المستمعون
الرقم الأهم لأي نموذج صوتي بسيط: أيها يفضّل الناس حين لا يرون الاسم؟
تدير Artificial Analysis ساحة Provider Voice التي تجيب عن هذا السؤال تحديدًا. يستمع الناس إلى مقطعين مجهولي المصدر للنص نفسه ويختارون الأكثر طبيعية، ثم تتحول الأصوات إلى تقييمات Elo كما في الشطرنج. في سبتمبر 2026 احتل Eleven v4 المركز الأول بـ 1319 Elo، متقدمًا على Cartesia Sonic 3.6 بـ 1276 وعلى Gemini 3.8 Flash TTS من Google بـ 1267. وتضعه Artificial Analysis أيضًا في المركز الأول في متانة النطق، أي نطق الكلمات الصعبة بشكل صحيح، وفي المركز الثاني في الصوت المتحكَّم به.
وتضيف ElevenLabs اختبارًا أعمى خاصًا بها فضّل فيه نحو 75% من المستمعين النموذج v4. هذا رقم صادر عن الشركة، لذا فترتيب الساحة هو ما يُعتمد عليه.
ما الجديد منذ v3
قدّم v3 الوسوم الصوتية: توجيهات قصيرة بين قوسين معقوفين مثل [whispers] أو [laughs] تغيّر طريقة نطق الجملة. ويبني v4 على هذه الفكرة:
- يمكن دمج الوسوم وتسلسلها. تستطيع الجمع بين عدة توجيهات، ويتبعها النموذج بالترتيب على امتداد المقطع.
- يصغي إلى السياق. تأخذ الردود في الحوار نبرتها مما سبقها، وهذا مهم في الخلافات وتصاعد التوتر ولحظات «يرجى الانتظار» في خدمة العملاء.
- نطق يمكنك تهجئته. اكتب الكلمة بالأبجدية الصوتية الدولية (IPA) بين شرطتين مائلتين، وسينطقها v4 كما كتبتها. وتقول ElevenLabs إن ذلك صار أكثر موثوقية بكثير.
- طلبات أطول. حتى 10,000 حرف في الطلب الواحد، أي نحو عشر دقائق من الصوت، مع وصل أفضل حين تربط عدة طلبات ببعضها.
- أصوات أكثر ثباتًا. تحافظ طريقة جديدة على هوية الصوت عبر السرد الطويل وإعادة التسجيل المتكررة، وكان ذلك نقطة ضعف في المشاريع الطويلة.
تتسع اللغات من نحو 70 إلى أكثر من 90، وأكبر قفزات الجودة في اليابانية والبرتغالية البرازيلية والماندرين والكانتونية. ويستطيع الصوت الواحد الآن التحدث بأي لغة مدعومة مع الاحتفاظ بهويته.
وصار استنساخ الأصوات أسرع أيضًا. فـ Instant Voice Clone يحتاج الآن إلى نحو 10 ثوانٍ فقط من التسجيل. ولأعلى دقة ممكنة، يدعم النموذج أيضًا Professional Voice Clones.
Turbo: أصوات يمكنك التحدث إليها
يعيش وكيل الصوت أو يموت بالتوقيت. فإن بدأ الرد بعد ثانية كاملة من صمتك، بدت المحادثة كخط هاتفي رديء.
صُمم Eleven v4 Turbo لهذه المهمة بالذات. تعلن ElevenLabs عن زمن استدلال وسيط يبلغ نحو 100 مللي ثانية ونحو 150 مللي ثانية حتى أول كلمة، مقابل 262–814 مللي ثانية لدى المنافسين الذين اختبرتهم. هذه قياسات الشركة نفسها ولا تشمل تأخير الشبكة، لكنها تضع Turbo ضمن مدة الوقفة الطبيعية بين شخصين يتحدثان. وسعره نصف سعر النموذج الكامل.
العيب بصراحة
إنه الخيار المرتفع السعر. بالسعر المعلن يكلف Eleven v4 مبلغ $0.08 لكل 1,000 حرف، وهو ما تسجله Artificial Analysis بـ $80 لكل مليون حرف. ويكلف Cartesia Sonic 3.6 مبلغ $49 وGemini 3.8 Flash TTS مبلغ $16.49 للكمية نفسها. وفي السرد بالجملة حيث يكفي أن يكون الصوت «واضحًا ولطيفًا»، فهذان أرخص بكثير. وتقدم ElevenLabs خصم إطلاق بنسبة 72% حتى 12 أكتوبر 2026 يجعل سعر v4 نحو $0.022 لكل 1,000 حرف، لكن ضع ميزانيتك على أساس السعر المعلن.
أدوات التحكم مختلفة. مثل v3، لا يدعم v4 وسوم التوقف في SSML، وهي الترميز الذي تستخدمه كثير من نصوص تحويل النص إلى كلام القديمة لتحديد الوقفات. يأتي التوجيه بدلًا من ذلك من علامات الترقيم والوسوم الصوتية والأبجدية الصوتية. إن كان لديك مسار إنتاج قائم، فأعد كتابة بعض النصوص واستمع مجددًا إلى أصواتك على v4 قبل نقل كل شيء.
الاستنساخ الجيد سلاح ذو حدين. نسخة مقنعة من صوت شخص انطلاقًا من عشر ثوانٍ من التسجيل مفيدة للمبدعين وخطيرة في الأيدي الخطأ. تطبق ElevenLabs التحقق والضوابط، لكن الموافقة والحقوق التجارية تبقى مسؤوليتك.
لمن يناسب
| إن كنت تحتاج إلى… | استخدم | لماذا |
|---|---|---|
| كتب صوتية أو شخصيات أو دبلجة يهمّ فيها الأداء | Eleven v4 | في صدارة ساحة الاستماع المستقلة، مع تحكم دقيق |
| وكيل صوتي أو مساعد مباشر | Eleven v4 Turbo | نحو 150 مللي ثانية حتى أول كلمة، بنصف السعر |
| كميات هائلة من السرد البسيط بميزانية محدودة | Gemini 3.8 Flash TTS أو Cartesia Sonic 3.6 | جزء صغير من السعر لكل حرف |
| أغانٍ بغناء وآلات موسيقية | Suno v6 | مولّد موسيقى لا أداة صوتية |
الحكم النهائي
Eleven v4 هو نموذج الصوت الذي تختاره حين يجب أن تبدو التسجيلة موجَّهة لا مقروءة. يتصدر الساحة المستقلة، ويتحدث أكثر من 90 لغة، ويمنحك أدوات حقيقية لتشكيل الأداء. ليس أرخص وسيلة لتحويل النص إلى كلام، ولا يحتاج إلى أن يكون كذلك: فحين يكون الصوت هو المنتج، فهو الصوت الذي يختاره المستمعون.