Aller au contenu principal
AIDive
FR
Se connecter
Friendli Inference

Friendli Inference

Moteur d'inférence LLM haute performance pour un service rapide et rentable

0

Description

Friendli Inference est un moteur haute performance pour servir des grands modèles de langage (LLM) en production. Il est conçu pour maximiser la vitesse d'inférence tout en réduisant la charge d'infrastructure et les dépenses GPU, afin d'aider les équipes à exécuter des modèles génératifs avec un débit élevé et une faible latence.

Inférence LLM optimisée

Friendli Inference applique des optimisations spécialisées axées sur l'efficacité et la performance :

Réduction des coûts GPU de 50 à 90 %

Utilisation jusqu'à 6× moins de GPU par rapport aux approches traditionnelles

Performances supérieures dans les benchmarks par rapport à vLLM et TensorRT-LLM, avec jusqu'à 10,7× de débit en plus et jusqu'à 6,2× de latence en moins

Conçu pour les équipes de production

La plateforme cible les équipes qui ont besoin d'un service LLM stable et économique à grande échelle, des startups aux grandes entreprises :

Intégration par API pour les services existants

Mise à l'échelle en fonction de la croissance du trafic

Aide à maximiser l'utilisation des ressources GPU actuelles sans sacrifier la vitesse de génération

0
0 commentaire

Newsletter

Soyez averti lorsqu’un nouvel outil IA est ajouté

Rejoignez la communauté.

Friendli Inference - moteur d'inférence LLM