Friendli Inference est un moteur haute performance pour servir des grands modèles de langage (LLM) en production. Il est conçu pour maximiser la vitesse d'inférence tout en réduisant la charge d'infrastructure et les dépenses GPU, afin d'aider les équipes à exécuter des modèles génératifs avec un débit élevé et une faible latence.
Inférence LLM optimisée
Friendli Inference applique des optimisations spécialisées axées sur l'efficacité et la performance :
Réduction des coûts GPU de 50 à 90 %
Utilisation jusqu'à 6× moins de GPU par rapport aux approches traditionnelles
Performances supérieures dans les benchmarks par rapport à vLLM et TensorRT-LLM, avec jusqu'à 10,7× de débit en plus et jusqu'à 6,2× de latence en moins
Conçu pour les équipes de production
La plateforme cible les équipes qui ont besoin d'un service LLM stable et économique à grande échelle, des startups aux grandes entreprises :
Intégration par API pour les services existants
Mise à l'échelle en fonction de la croissance du trafic
Aide à maximiser l'utilisation des ressources GPU actuelles sans sacrifier la vitesse de génération

