ضبط نماذج اللغة الكبيرة (fine-tuning) لا يزال مؤلمًا. حتى الفرق ذات الخبرة تقضي 30 إلى 50% من وقتها في محاربة البنية التحتية بدل تحسين النموذج. إعداد GPU، أخطاء البيئة، إدارة الحزم. مشروع Soup (رخصة Apache 2.0) يعالج هذا مباشرة.
الفكرة بثلاثة أسطر
تثبيت، إعداد، تدريب. بلا أكثر. المشروع يتولى تلقائيًا حجم الدفعة (batch size)، اكتشاف GPU، والضغط (quantization)، فلا حاجة للدخول عبر SSH لخادم معطّل أو ضبط إعدادات يدويًا.
مرونة دعم النماذج
يعمل مع أي نموذج توليد نص على HuggingFace Hub. لو حُمّل عبر AutoModelForCausalLM، يعمل بلا تعديل إعدادات. أكثر من 100 وصفة جاهزة (recipes) لعائلات مثل Llama 3.x/4، وQwen 2.5/3، وGemma 3، وMistral، وDeepSeek R1/V3، وPhi-4.
أي نموذج يناسب عتادك
| ذاكرة GPU | أقصى نموذج (QLoRA 4-bit) | مثال |
|---|---|---|
| 8 GB | ~7B | Llama-3.1-8B، Mistral-7B |
| 16 GB | ~14B | Phi-4-14B، Qwen2.5-14B |
| 24 GB | ~34B | CodeLlama-34B، Yi-1.5-34B |
| 48 GB | ~70B | Llama-3.3-70B |
| 80 GB+ | 70B+ كامل أو MoE | Mixtral-8x22B، DeepSeek-V3 |
ميزة حديثة: رصد وتصحيح ذاتي لخداع المكافأة
في أحدث إصدار، أُضيفت ميزة متقدمة لمن يدرّب وكلاء عبر التعلّم المعزز (GRPO/PPO): رصد «خداع المكافأة» (reward hacking) أثناء التدريب نفسه (وهي الحالة التي يتعلّم فيها النموذج استغلال ثغرة في دالة المكافأة بدل تحقيق الهدف الفعلي) مع تصحيح ذاتي لحظي بدل مجرد إيقاف التدريب.
- عند ارتفاع مؤشر الخداع، يرفع النظام معامل KL تلقائيًا عبر ضابط تحكم مخصص.
- لو استمر الخداع، يتراجع النظام لآخر نقطة حفظ سليمة (rollback).
- وكحل أخير فقط، يوقف التدريب مبكرًا.
- يعتمد تصويتًا من عدة إشارات معًا لتقليل الإنذارات الكاذبة.
صيغ البيانات وطرق التدريب
اكتشاف تلقائي لصيغ JSONL وJSON وCSV وParquet وTXT، بدعم alpaca وsharegpt وchatml للمحادثات، وdpo/orpo/simpo/ipo للتفضيلات المزدوجة، وkto للتصنيف الثنائي. إضافة لصيغ الرؤية والصوت وما قبل التدريب. وطرق التدريب تغطي SFT وDPO وGRPO وPPO وKTO وORPO وSimPO وغيرها.
من التدريب إلى النشر
بعد التدريب، أمر merge يدمج LoRA بالنموذج الأساسي، وexport يصدّر لصيغة GGUF (لـOllama وllama.cpp) أو ONNX أو TensorRT أو AWQ أو GPTQ أو BitNet. وserve يشغّل خادمًا متوافقًا مع واجهة OpenAI، وdoctor يفحص GPU والتبعيات والبيئة دفعة واحدة.
التشغيل المحلي وحدود المشروع
أبرز فرق عن أدوات ضبط النماذج التقليدية أنه يعمل محليًا بالكامل عبر QLoRA بدون الحاجة لحساب سحابي، مناسب لمن يريد تجربة ضبط نموذج على بياناته الخاصة دون التزام بفاتورة سحابية. لكنه مشروع نشط جدًا (أكثر من 150 إصدارًا حتى الآن وبعض ميزاته لا تزال في مرحلة Beta) يستحق التجربة على مهمة غير حرجة أولًا.