معمارية السلسلة (cascade) في وكلاء الصوت تعمل كالتالي: تفريغ الكلام لنص، ثم نموذج لغوي، ثم تركيب صوت. عيبها البنيوي أن كل تسليم بين المراحل يضيف تأخيرًا، والأهم أن النظام يعمل بالأدوار الصارمة. لا يستطيع الاستماع وهو يتكلم.

نموذج NemotronLabs VoiceChat من NVIDIA، الصادر في 3 أغسطس 2026 بأوزان مفتوحة على Hugging Face، يعالج هذا بدمج المراحل الثلاث في شبكة تدفق واحدة.

ما معنى «مزدوج الاتجاه» (Full Duplex)

المصطلح مستعار من الاتصالات: قناة أحادية الاتجاه تعني أن طرفًا واحدًا يتكلم في اللحظة، ومزدوجة الاتجاه تعني أن الطرفين يستطيعان الإرسال والاستقبال معًا.

عمليًا في المحادثة الصوتية، هذا يعني:

  • النموذج يستمع أثناء كلامه، فيلتقط المقاطعة فورًا دون طبقة كشف منفصلة.
  • تبادل الأدوار يصبح سلسًا وطبيعيًا بدل انتظار صمت كامل.
  • التعامل مع الوقفات القصيرة بلا اعتبارها نهاية دور.

البنية التقنية

التركيب ليس غريبًا: NVIDIA أخذت نموذجها اللغوي Nemotron Nano v2 بحجم 9 مليارات معامل، ووضعت أمامه مُرمِّزًا صوتيًا Fast Conformer، وخلفه مُفكِّك TTS خاص بها. بإجمالي نحو 11 مليار معامل في كومة هجينة Mamba/Transformer.

وإضافة أخرى: قناة إخراج منفصلة تصدر نصوص استدعاء الأدوات بينما تستمر المحادثة الصوتية. لهذا صار أول نموذج مزدوج الاتجاه مفتوح الأوزان يدعم استدعاء الدوال أثناء الحديث. نقطة كانت الحاجز الأساسي أمام ربط النماذج الموحّدة بالأنظمة الداخلية.

أين يقف في القياسات

إطار القياس يفصل بين محورين: ديناميكيات المحادثة (77.8%) والاستدلال الصوتي (29.2%). ووفق اختبار مستقل من Artificial Analysis، هو النموذج مفتوح الأوزان الوحيد الذي يأتي ضمن أفضل ثلاثة في المحورين معًا.

لكن الفجوة مع المغلق واضحة: أنظمة مثل Step-Audio R1.1 عند 96% وGrok Voice Agent عند 92% تتقدم بفارق كبير في الاستدلال الصوتي. هذه فجوة يقبلها المطوّر مقابل امتلاك الأوزان والتشغيل محليًا.

القيود الحقيقية قبل أي قرار

التوثيق الرسمي صريح بحدوده، وهذه أهم من الأرقام التسويقية:

  • إنجليزي فقط. لا يخدم حالات الاستخدام العربية إطلاقًا حاليًا.
  • سياق صوتي محدود بدقيقتين.
  • ضعيف في العمليات الحسابية متعددة الخطوات.
  • لا يدعم كلمات التأكيد القصيرة أثناء الاستماع (backchanneling).
  • غير مناسب صراحة للغرف الصاخبة أو ذات الصدى.
  • يحتاج معالج رسومات بذاكرة 80 جيجابايت (A100 أو H100 أو H200 أو B100 أو B200 أو RTX 6000) يشغّل vLLM على لينكس.

والرخصة تستحق الانتباه: الأوزان تحت OpenMDW-1.1 موسومة لأغراض البحث، بينما كود NeMo Speech المحيط تحت Apache 2.0.

الأدوات الداعمة في منظومة NeMo

النموذج جزء من منظومة أوسع تستحق المعرفة، خصوصًا لمن يبني وكلاء صوت:

الأداةماذا تقدّم
Nemotron-3.5-ASR-Streaming-0.6Bتفريغ لحظي بـ40 لغة، بتأخير قابل للضبط من 80 ملي ثانية إلى ثانية
MagpieTTS v2607تركيب صوت يدعم 12 لغة. أُضيفت العربية والكورية والبرتغالية في يوليو 2026
Parakeet-unified-en-0.6bتفريغ إنجليزي يجمع الوضعين المسجّل واللحظي في نموذج واحد بأقل تأخير 160 ملي ثانية
Canary-Qwen-2.5Bمعدل خطأ كلمات قياسي 5.63% على لوحة ASR الإنجليزية المفتوحة

لمن يعمل على العربية تحديدًا، MagpieTTS هو المكوّن الأهم في هذه القائمة. إضافة دعم العربية في يوليو 2026 تفتح مسار بناء وكيل عربي بمعمارية السلسلة، بينما VoiceChat الموحّد يبقى إنجليزيًا حتى إشعار آخر.

ما يعنيه هذا الإصدار

أهمية هذا الإصدار ليست في استخدامه اليوم لحالة عربية، بل فيما يثبته: أن النموذج الموحّد مزدوج الاتجاه صار قابلًا للتشغيل بأوزان مفتوحة، ويستطيع استدعاء أدواتك أثناء المحادثة.

وهناك أخ أكبر في برنامج وصول مبكر: Nemotron 3 VoiceChat بحجم 12 مليار معامل، يستهدف تأخيرًا شاملًا أقل من 300 ملي ثانية عبر معالجة مقاطع صوتية بطول 80 ملي ثانية أسرع من الزمن الحقيقي. ملاحظة: أعداد المعاملات تتراوح بين 11 و12 مليارًا بين صفحات NVIDIA نفسها، فتعامل مع الرقم كتقريبي.