مشكلة أدوات تحويل المستندات لصوت أن أغلبها صندوق مغلق: تدخل ملفًا وتخرج صوتًا، فإن لم يعجبك الناتج تعيد المحاولة كاملة. مشروع PDF2Audio من مختبر LAMM في MIT (رخصة Apache 2.0) يعالج هذه النقطة بجعل مسودة النص خطوة مرئية قابلة للتعديل.
الميزة المميزة: التكرار على المسودة
بدل التوليد المباشر للملف النهائي، تُعرض المسودة أولًا. يمكنك تحريرها بنفسك، أو إعطاء ملاحظات محددة أو توجيهات عامة للنموذج حول كيفية تحسينها، ثم إعادة التوليد. وهذا يتكرر عدة مرات حتى تصل للنتيجة المطلوبة، فتتحول العملية من محاولة واحدة إلى دورة مراجعة فعلية.
قوالب متعددة للمخرجات
يوفر قوالب تعليمات جاهزة تحدد شكل الناتج: بودكاست حواري، أو محاضرة، أو ملخص، وغيرها. ويمكن تخصيص القوالب، مع إمكانية إضافة تعليمات تمهيدية تشكّل بداية الحوار، وتعليمات ما قبل الحوار توجّه بناء العرض.
ما يدعمه
- رفع عدة ملفات PDF دفعة واحدة، إضافة لملفات Markdown وصيغ أخرى.
- اختيار نموذج التوليد النصي ونموذج الصوت بشكل منفصل.
- أصوات متعددة للراوي قابلة للاختيار.
- دعم نماذج OpenAI المتقدمة، مع إمكانية الاتصال بنماذج مفتوحة المصدر.
التشغيل
يعمل كتطبيق Gradio محلي: استنساخ المستودع، إنشاء بيئة Conda، تثبيت الاعتماديات، ثم وضع مفتاح OpenAI في ملف بيئة. بعدها يفتح على المنفذ 7860 محليًا. ومتاح أيضًا للتجربة المباشرة عبر Hugging Face Spaces ودفتر Colab دون أي تثبيت.
أصله البحثي
المشروع مبني على عمل سابق (pdf-to-podcast وpromptic)، ويصدر من مختبر LAMM في MIT المتخصص في الذكاء الاصطناعي للاكتشاف العلمي، مع استشهادات بحثية في توثيقه. هذا يفسّر تركيزه على الأوراق العلمية والمواد التعليمية أكثر من المحتوى الترفيهي.
الفرق عن Podcastfy
الاثنان يحوّلان مستندات لصوت، لكن Podcastfy حزمة برمجية تُدمج في سير عمل آلي وتدعم مصادر أوسع (مواقع، صور، يوتيوب)، بينما PDF2Audio تطبيق واجهة يركّز على المستندات مع دورة مراجعة بشرية. فالاختيار بينهما يعتمد على ما إذا كنت تريد أتمتة كاملة أو تحكمًا يدويًا في المخرجات.