أغلب المساعدات الصوتية الفورية (مثل ميزة Realtime من OpenAI) تعمل كصندوق أسود سحابي. مشروع Speech To Speech من Hugging Face يعيد بناء نفس الفكرة كخط أنابيب مفتوح بالكامل: كشف نشاط صوتي (VAD)، تحويل كلام لنص (STT)، نموذج لغوي (LLM)، ثم تحويل نص لكلام (TTS). كل مرحلة تشتغل على خيط مستقل وتتواصل عبر طوابير، وكل مكون فيها قابل للاستبدال بأمر سطر واحد.
التشغيل بأمر واحد
أمر تثبيت واحد ثم أمر تشغيل واحد يشغّل خادمًا متوافقًا مع بروتوكول OpenAI Realtime على المنفذ المحلي. بنموذج Parakeet TDT للتفريغ وQwen3-TTS للصوت افتراضيًا. وأي عميل يدعم Realtime API يتصل مباشرة بدون تعديل.
مرونة اختيار النموذج اللغوي
النموذج اللغوي (أكثر مرحلة استهلاكًا للوقت والمعالجة في خط الأنابيب) يمكن تشغيله محليًا بالكامل عبر llama.cpp أو vLLM على عتادك، أو عبر أي مزود متوافق مع OpenAI (HF Inference Providers، OpenRouter، أو OpenAI نفسها). تبديل المزود سطر واحد فقط في أمر التشغيل.
الاستخدام في الإنتاج ودعم اللغات
المشروع يشغّل فعليًا محادثات آلاف من روبوتات Reachy Mini في الإنتاج، وهو مؤشر نضج تشغيلي لا مجرد عرض تجريبي. الدعم اللغوي يعتمد على النموذج المختار لا على خط الأنابيب نفسه، ويدعم التبديل التلقائي بين اللغات عبر خيار تشغيل مخصص.