ميزة توليد البودكاست في NotebookLM من Google لاقت انتشارًا واسعًا، لكنها مغلقة المصدر ومحصورة بواجهة رسومية. مشروع Podcastfy يقدّم بديلًا مفتوحًا وبرمجيًا: حزمة Python تحوّل محتوى متعدد الوسائط إلى حوار صوتي متعدد اللغات.

مصادر المحتوى المدعومة

  • مواقع ويب عبر روابطها المباشرة.
  • ملفات PDF.
  • صور (يقرأ محتواها ويحوّله لحوار).
  • فيديوهات يوتيوب.
  • موضوع يكتبه المستخدم مباشرة دون مصدر خارجي.

تقنية التقطيع مع الربط السياقي

المشكلة التقنية الأساسية: أغلب النماذج اللغوية لها حد إخراج يقارب 4 أو 8 آلاف رمز، فتوليد نص بودكاست طويل يصطدم بهذا الحد. يعالجها المشروع بتقنية يسميها «التقطيع مع الربط السياقي»: يقسّم المحتوى المدخل إلى أجزاء صغيرة، ويولّد حوارًا لكل جزء، مع ضمان أن النص المجمّع متماسك ومرتبط بالمحتوى الأصلي.

التحكم في الطول

الحلقات القصيرة الافتراضية تنتج صوتًا من دقيقتين إلى خمس، والطويلة قد تصل 20 إلى 30 دقيقة. يتحكم المستخدم بذلك عبر معاملين: الحد الأقصى لعدد جولات النقاش، والحد الأدنى لحجم الجزء. لكن المشروع ينبّه لمقايضة حقيقية: رفع عدد الجولات أو خفض حجم الجزء بإفراط قد يخفض جودة الحوار ويجعل طوله يصل حدًا أقصى لا يتجاوزه إن كان المحتوى المدخل محدودًا.

التخصيص والأصوات

يتيح ضبط أسلوب الحوار وعدد الكلمات المستهدف وبنية الحوار واللغة. ويدعم نماذج تحويل نص لكلام متقدمة (OpenAI وElevenLabs وEdge)، مع تحديد صوت منفصل للسائل وآخر للمجيب. ودعم اللغات المتعددة موصوف بأنه **تجريبي**، فمن يستهدف العربية يستحق اختباره قبل الاعتماد عليه.

طرق الاستخدام

يعمل كحزمة Python باستدعاء دالة واحدة، أو عبر سطر الأوامر، أو من خلال تطبيق تجريبي على Hugging Face Spaces (لكن التوثيق نفسه يذكر أن واجهة العرض أقل اختبارًا وقدرة من الحزمة البرمجية). ويدعم أيضًا إنشاء بودكاست من نص حوار موجود مسبقًا أو معدَّل يدويًا.

حالات استخدام واقعية

التوثيق يذكر ثلاث فئات: صنّاع المحتوى الذين يحوّلون مقالاتهم لصيغة صوتية للوصول لجمهور يفضّل الاستماع، والمعلّمون الذين يحوّلون مواد المحاضرات لحوارات صوتية (مفيد خصوصًا لذوي الإعاقة البصرية)، والباحثون الذين يحوّلون أوراقهم البحثية لملخصات صوتية.