vLLM
vLLM is an open-source high-throughput inference and serving engine for deploying large language and multimodal AI models efficiently on GPUs, CPUs, and other accelerator hardware.
vLLM هو إطار عمل مفتوح المصدر لاستدلال الذكاء الاصطناعي وخدمة النماذج، ومصمم لمطوري الذكاء الاصطناعي ومهندسي التعلم الآلي وفرق البنية التحتية والباحثين والمؤسسات التي ترغب في نشر نماذج لغوية كبيرة مع إنتاجية عالية واستخدام فعال لموارد الأجهزة.
تم تطوير vLLM في الأصل في Sky Computing Lab بجامعة كاليفورنيا في بيركلي، ثم تطور ليصبح مشروعًا مجتمعيًا يركز بشكل أساسي على الاستدلال في بيئات الإنتاج بدلًا من توفير روبوت دردشة للمستخدم النهائي أو خدمة ذكاء اصطناعي مستضافة وجاهزة للاستخدام.
يستخدم محرك vLLM مجموعة من تقنيات تحسين الأداء مثل PagedAttention والمعالجة المستمرة على دفعات والجدولة المحسنة والتخزين المؤقت للبادئات وفك التشفير التخميني والتعبئة المسبقة المجزأة ونوى CUDA المحسنة. وتساعد هذه التقنيات على زيادة الإنتاجية وتحسين كفاءة استخدام الذاكرة.
كما يدعم vLLM عدة أساليب للتكميم تشمل GPTQ وAWQ وINT4 وINT8 وFP8، مما يسمح للمؤسسات بتقليل متطلبات ذاكرة النماذج وفقًا للأجهزة المستخدمة وخصائص كل نموذج.
يتكامل vLLM بشكل وثيق مع Hugging Face ويدعم حاليًا أكثر من 200 بنية للنماذج، بما في ذلك نماذج LLM ذات وحدة فك التشفير فقط ونماذج Mixture of Experts والبنى الهجينة والنماذج متعددة الوسائط ونماذج التضمينات ونماذج إعادة الترتيب ونماذج المكافآت ونماذج التصنيف.
يمكن عرض النماذج المنشورة من خلال واجهات API متوافقة مع OpenAI، بالإضافة إلى واجهة متوافقة مع Anthropic Messages وواجهات gRPC.
وتشمل الميزات المدعومة البث والمخرجات المنظمة واستدعاء الأدوات ومحللات الاستدلال وخدمة محولات LoRA بكفاءة عالية.
وبالنسبة لعمليات النشر واسعة النطاق، يدعم vLLM عدة أنواع من التوازي تشمل توازي الموترات وخطوط الأنابيب والبيانات والخبراء والسياق عبر عدة مسرعات وعقد.
يشمل دعم الأجهزة وحدات معالجة الرسومات NVIDIA وAMD بالإضافة إلى معالجات x86 وARM وPowerPC. كما تتوفر تكاملات مع مسرعات ومنصات أخرى مثل Google TPU وIntel Gaudi وHuawei Ascend وApple Silicon.
وتشمل خيارات النشر Python وDocker وKubernetes عبر Helm بالإضافة إلى البيئات الموزعة.
لا يعتمد vLLM على نموذج تسعير قائم على الاشتراك. ويتم توزيع المشروع بموجب ترخيص Apache 2.0 ويمكن استخدامه مجانًا، بينما يتحمل المستخدمون تكاليف وحدات معالجة الرسومات والخوادم والبنية التحتية السحابية والتخزين وأي نماذج مدفوعة يختارون نشرها.
بشكل عام، يُعد vLLM مناسبًا بشكل خاص للفرق التقنية التي تحتاج إلى تشغيل نماذج الذكاء الاصطناعي على نطاق واسع مع أداء استدلال مرتفع واستخدام أكثر كفاءة لموارد الأجهزة.