خدمات الصوت السحابية مثل ElevenLabs سهلة البدء، لكنها تعني ثلاثة أشياء: اشتراك شهري أو عدّاد استخدام، وخروج صوتك ونصك لخوادم المزوّد، واعتمادًا على اتصال الإنترنت. مشروع VoiceStudio (كان اسمه OmniVoice-Studio) يقدّم بديلًا يعمل بالكامل على جهازك.
ما يقدّمه فعليًا
- استنساخ صوتي من عيّنة قصيرة (ثلاث ثوانٍ تكفي، و5 إلى 15 ثانية أفضل).
- تصميم صوت جديد من وصف: العمر واللهجة وطبقة الصوت والأسلوب.
- دبلجة الفيديو: تفريغ، ثم ترجمة، ثم الحفاظ على تمييز المتحدثين، ثم توليد الصوت وتصدير الفيديو.
- الكتب الصوتية: نصوص متعددة الأصوات، واستيراد EPUB وPDF، وتصدير بصيغة m4b.
- أداة إملاء على مستوى النظام باختصار لوحة مفاتيح مع تفريغ حي.
- فصل الصوت عن الخلفية، وتمييز المتحدثين، وطابور معالجة للمهام الكبيرة.
16 محركًا للنطق، وأحدها يدعم العربية
التطبيق لا يعتمد على محرك واحد، بل يتيح التبديل بين 16 محرك تحويل نص لكلام و11 محرك تفريغ صوتي من داخل الواجهة. المحرك الافتراضي يدعم أكثر من 600 لغة. ومحرك **IndexTTS 2.5** يدعم **العربية** ضمن خمس لغات مع الاستنساخ الصوتي، وهي نقطة تستحق الانتباه لمن يعمل بمحتوى عربي.
حدود لغوية يجب فهمها
المشروع يعلن دعم 646 لغة، لكنه يوضّح بصراحة أن **التغطية الفعلية والجودة تعتمدان على المحرك المختار**. فالرقم الكبير لا يعني جودة متساوية عبر كل اللغات. الاختبار على لغتك المستهدفة قبل الاعتماد ضروري، خصوصًا مع لغات أقل تمثيلًا في بيانات التدريب.
المتطلبات الفعلية
| المورد | الحد الأدنى | الموصى به |
|---|---|---|
| الذاكرة | 8 جيجابايت | 16 جيجابايت فأكثر |
| القرص | 10 جيجابايت | 20 جيجابايت SSD |
| معالج الرسومات | اختياري (CPU مدعوم) | NVIDIA CUDA أو Apple Silicon |
| ذاكرة الرسومات | 4 جيجابايت عند استخدام GPU | 8 جيجابايت فأكثر |
يعمل على macOS بمعالجات Apple Silicon (لا Intel)، وWindows 10/11، ولينكس. والمحركات الكبيرة قد تحتاج 12 إلى 16 جيجابايت ذاكرة رسومات أو أكثر.
حدود الشبكة موثّقة بوضوح
التطبيق يتصل بخلفية محلية على المنفذ 3900 فقط (loopback). والوصول عن بُعد يتطلب رمز مشاركة أو مفتاح API. والميزات التي تُخرج الصوت من الجهاز (عمال بعيدون، أو تفريغ عبر خدمة متوافقة مع OpenAI) **اختيارية بالكامل، والواجهة تنبّه صراحة حين يغادر الصوت الجهاز**. وتحليلات الاستخدام معطّلة حتى الموافقة، وحين تُفعّل ترسل بيانات وصفية بلا محتوى: لا نصوص ولا صوت ولا أسماء ملفات.
واجهة متوافقة مع OpenAI
نقطة عملية مهمة: يمكن توجيه أي عميل يستخدم واجهة الصوت في OpenAI للخلفية المحلية بتغيير رابط القاعدة فقط. فالكود المكتوب أصلًا لخدمة سحابية يعمل محليًا دون إعادة كتابة. ويوفر أيضًا خادم MCP لأدوات التوليد والتفريغ.
الرخصة: نقطة تستحق القراءة
المشروع مرخّص بـ**AGPL-3.0**، وهذا يعني عمليًا: يمكنك تشغيله وتعديله واستخدامه داخليًا وبيع الصوت المولَّد. لكن **إن عدّلته وقدّمته كخدمة شبكية، تُلزمك الرخصة بإتاحة الشيفرة المعدَّلة بنفس الرخصة**. وتتوفر رخصة تجارية للتضمين في منتج مغلق. والمحركات الاختيارية تحتفظ برخص نماذجها الخاصة، فمراجعة رخصة المحرك المختار ضرورية قبل أي استخدام تجاري.
ملاحظة على النضج
المشروع يصف نفسه صراحة بأنه في **بيتا نشطة**، وينصح باستخدام آخر إصدار مستقر للعمل الجاد. مع 1771 عملية دفع و11.5 ألف نجمة، وتيرة التطوير سريعة، لكن هذا يعني أيضًا تغييرات متكررة بين الإصدارات.