vLLM

vLLM هو محرك مفتوح المصدر ذو أداء عالي للاستدلال وتقديم الخدمة لنشر نماذج الذكاء الاصطناعي الكبيرة والمتعددة الوسائط بكفاءة على وحدات معالجة الرسومات، ووحدات المعالجة المركزية، والأجهزة المسرعة الأخرى.

التسعير: Free AI Models & LLMs

استدلال LLMتقديم خدمة LLMبنية الذكاء الاصطناعيذكاء اصطناعي مفتوح المصدرنشر النماذجvLLMAPI الذكاء الاصطناعيذكاء اصطناعي توليدي

vLLM هو إطار عمل مفتوح المصدر للاستدلال على الذكاء الاصطناعي وتقديم النماذج مصمم لمطوري الذكاء الاصطناعي، ومهندسي التعلم الآلي، وفرق البنية التحتية، والباحثين، والمنظمات التي ترغب في نشر نماذج لغوية كبيرة مع أداء عالٍ واستغلال فعال للأجهزة. تم تطويره في الأصل في معمل الحوسبة السحابية بجامعة كاليفورنيا في بيركلي، وقد تطور ليصبح مشروعًا مدفوعًا من المجتمع يركز بشكل أساسي على الاستدلال الإنتاجي بدلاً من تقديم روبوت دردشة للمستخدم النهائي أو خدمة ذكاء اصطناعي مستضافة.

يستخدم المحرك تقنيات مثل PagedAttention، وتجميع مستمر، وجدولة محسنة، وتخزين مؤقت للبداية، وفك تشفير تخميني، وإعادة ملء مقطعية، ونوى CUDA محسنة لتحسين الأداء وفعالية الذاكرة. كما يدعم العديد من أساليب التكميم بما في ذلك GPTQ، وAWQ، وINT4، وINT8، وFP8، مما يتيح للمنظمات تقليل متطلبات الذاكرة للنموذج حسب أجهزتها ونموذجها.

يتكامل vLLM عن كثب مع Hugging Face ويدعم حاليًا أكثر من 200 معمارية نموذجية، بما في ذلك نماذج LLM ذات فك التشفير فقط، ونماذج مزيج الخبراء، والمعماريات الهجينة، والنماذج متعددة الوسائط، ونماذج التضمين، ونماذج إعادة الترتيب، ونماذج المكافأة، ونماذج التصنيف. يمكنه كشف النماذج المنشورة من خلال واجهات برمجة التطبيقات المتوافقة مع OpenAI بالإضافة إلى واجهة برمجة التطبيقات المتوافقة مع رسائل Anthropic وواجهات gRPC. تشمل الميزات البث، والمخرجات الهيكلية، واستدعاء الأدوات، ومحللات الاستدلال، وتقديم الخدمة بشكل فعال عبر مهايئ LoRA.

للنشر الأكبر، يدعم vLLM التوازي في الأبعاد، وخطوط الإنتاج، والبيانات، والخبراء، وسياق التوازي عبر مسرعات متعددة وعقد مختلفة. تشمل دعم الأجهزة وحدات معالجة الرسومات NVIDIA وAMD، ووحدات المعالجة المركزية x86 وARM وPowerPC، بالإضافة إلى تكاملات المسرعات لـ Google TPU وIntel Gaudi وHuawei Ascend وApple Silicon ومنصات أخرى. تشمل خيارات النشر Python وDocker وKubernetes من خلال Helm والبيئات الموزعة.

لا يحتوي vLLM نفسه على نموذج تسعير اشتراك. يتم توزيع المشروع بموجب ترخيص Apache 2.0، بينما يتحمل المستخدمون مسؤولية تكاليف وحدات معالجة الرسومات، والخوادم، والبنية التحتية السحابية، والتخزين، والنماذج التي ينشرونها.