Si la promesse de l'IA générative domine une grande partie du paysage technologique actuel, la taille des grands modèles linguistiques (GML) qui sous-tendent ces systèmes ne cesse de croître. De ce fait, la mise en place de services GML fiables et rentables exige une puissance de calcul et des ressources énergétiques considérables, ainsi que des compétences opérationnelles spécialisées. En pratique, ces difficultés rendent inaccessibles à la plupart des organisations les avantages d'une IA personnalisée, prête à déployer et plus sécurisée.
Red Hat ambitionne de relever ces défis en rendant l'IA générative plus accessible à un plus grand nombre d'organisations grâce à l'innovation ouverte de vLLM. Développé par l'Université de Californie à Berkeley, vLLM est un projet open source piloté par la communauté, dédié au déploiement de modèles ouverts (la manière dont les modèles d'IA générative infèrent et résolvent les problèmes). Il prend en charge toutes les principales familles de modèles, intègre des recherches avancées sur l'accélération de l'inférence et est compatible avec diverses plateformes matérielles, notamment les GPU AMD, AWS Neuron, les TPU Google, Intel Gaudi, les GPU NVIDIA et les processeurs x86. Le leadership de Neural Magic dans le projet vLLM, associé au solide portefeuille de technologies d'IA cloud hybride de Red Hat, permettra aux organisations de construire des stratégies d'IA adaptées à leurs besoins spécifiques, quel que soit l'emplacement de leurs données.
