vLLM

vLLM est un moteur d'inférence et de service open-source à haut débit pour le déploiement efficace de modèles AI de grande taille et multimodaux sur GPU, CPU et autres matériels d'accélération.

Tarification: Free AI Models & LLMs

Inférence LLMService LLMInfrastructure AIAI Open SourceDéploiement de modèlesvLLMAPI AIAI générative

vLLM est un cadre d'inférence AI et de service de modèles open-source conçu pour les développeurs AI, les ingénieurs en apprentissage automatique, les équipes d'infrastructure, les chercheurs et les organisations qui souhaitent déployer des modèles linguistiques de grande taille avec un haut débit et une utilisation efficace du matériel. Développé à l'origine au laboratoire Sky Computing de l'UC Berkeley, il a évolué en un projet dirigé par la communauté axé principalement sur l'inférence de production plutôt que sur la fourniture d'un chatbot de base utilisateur ou d'un service AI hébergé.

Le moteur utilise des technologies telles que PagedAttention, le batch continu, la planification optimisée, le cache de préfixes, le décodage spéculatif, le pré-remplissage par morceaux et les noyaux CUDA optimisés pour améliorer le débit et l'efficacité de la mémoire. Il prend également en charge plusieurs approches de quantification, y compris GPTQ, AWQ, INT4, INT8 et FP8, permettant aux organisations de réduire les besoins en mémoire des modèles en fonction de leur matériel et de leur modèle.

vLLM s'intègre étroitement avec Hugging Face et prend actuellement en charge plus de 200 architectures de modèles, y compris les LLM uniquement décodeurs, les modèles Mixture-of-Experts, les architectures hybrides, les modèles multimodaux, les modèles d'incorporation, les réajusteurs, les modèles de récompense et les modèles de classification. Il peut exposer les modèles déployés via des APIs compatibles OpenAI ainsi qu'une API compatible avec Anthropic Messages et des interfaces gRPC. Les fonctionnalités incluent le streaming, les sorties structurées, l'appel d'outils, les parseurs de raisonnement et le service efficace d'adaptateurs LoRA.

Pour des déploiements plus importants, vLLM prend en charge le parallélisme de tenseurs, de pipelines, de données, d'experts et de contexte sur plusieurs accélérateurs et nœuds. Le support matériel inclut les GPU NVIDIA et AMD, les CPU x86, ARM et PowerPC, ainsi que des intégrations d'accélérateurs pour Google TPU, Intel Gaudi, Huawei Ascend, Apple Silicon et d'autres plateformes. Les options de déploiement incluent Python, Docker, Kubernetes via Helm et des environnements distribués.

vLLM lui-même n'a pas de modèle de tarification par abonnement. Le projet est distribué sous la licence Apache 2.0, tandis que les utilisateurs sont responsables des coûts des GPU, des serveurs, de l'infrastructure cloud, du stockage et des modèles qu'ils déploient.