vLLM

vLLM is an open-source high-throughput inference and serving engine for deploying large language and multimodal AI models efficiently on GPUs, CPUs, and other accelerator hardware.

Tarification: Free

Inférence LLMService LLMInfrastructure d'IAIA open sourceDéploiement du modèlevLLMAPI IAIA générative

vLLM est un framework open source d’inférence et de déploiement de modèles d’IA conçu pour les développeurs, ingénieurs en machine learning, équipes d’infrastructure, chercheurs et organisations qui souhaitent servir de grands modèles de langage avec un débit élevé tout en optimisant l’utilisation des ressources matérielles.

Développé à l’origine au Sky Computing Lab de l’UC Berkeley, vLLM est devenu un projet communautaire principalement orienté vers l’inférence en production. Il ne s’agit donc pas d’un chatbot destiné directement aux utilisateurs ni d’un service d’IA hébergé prêt à l’emploi.

Son moteur d’inférence s’appuie sur plusieurs technologies d’optimisation telles que PagedAttention, le traitement par lots continu, la planification optimisée, la mise en cache des préfixes, le décodage spéculatif, le pré-remplissage fragmenté et des kernels CUDA optimisés. Ces techniques permettent d’améliorer le débit tout en réduisant la consommation de mémoire.

vLLM prend également en charge plusieurs méthodes de quantification comme GPTQ, AWQ, INT4, INT8 et FP8. Les organisations peuvent ainsi réduire les besoins en mémoire des modèles en fonction du matériel utilisé et des caractéristiques du modèle déployé.

Le framework s’intègre étroitement à Hugging Face et prend actuellement en charge plus de 200 architectures de modèles. Cela inclut notamment les LLM à décodeur uniquement, les modèles Mixture of Experts, les architectures hybrides, les modèles multimodaux, les modèles d’embeddings, les rerankers, les modèles de récompense et les modèles de classification.

Les modèles déployés avec vLLM peuvent être exposés via des API compatibles avec OpenAI. Le framework propose également une compatibilité avec l’API Anthropic Messages ainsi que des interfaces gRPC.

Parmi les fonctionnalités prises en charge figurent le streaming, les sorties structurées, les appels d’outils, les parseurs de raisonnement et le déploiement efficace d’adaptateurs LoRA.

Pour les infrastructures à grande échelle, vLLM prend en charge plusieurs formes de parallélisme, notamment le parallélisme de tenseurs, de pipelines, de données, d’experts et de contexte sur plusieurs accélérateurs ou plusieurs nœuds.

La compatibilité matérielle couvre notamment les GPU NVIDIA et AMD ainsi que les processeurs x86, ARM et PowerPC. Des intégrations sont également disponibles pour différents accélérateurs et plateformes comme Google TPU, Intel Gaudi, Huawei Ascend et Apple Silicon.

Les options de déploiement comprennent Python, Docker, Kubernetes via Helm ainsi que différents environnements distribués.

vLLM ne fonctionne pas avec un abonnement payant propre à la plateforme. Le projet est distribué sous licence Apache 2.0 et peut être utilisé gratuitement. Les utilisateurs doivent toutefois prendre en charge les coûts associés aux GPU, serveurs, infrastructures cloud, stockage et éventuels modèles payants qu’ils choisissent de déployer.

Dans l’ensemble, vLLM constitue une solution particulièrement adaptée aux équipes techniques qui souhaitent déployer des modèles d’IA à grande échelle avec de bonnes performances d’inférence et une utilisation optimisée des ressources matérielles.