Friendli Inference es un motor de alto rendimiento para servir grandes modelos de lenguaje (LLMs) en producción. Está diseñado para maximizar la velocidad de inferencia mientras reduce la carga de infraestructura y el gasto en GPU, ayudando a los equipos a ejecutar modelos generativos con alto rendimiento y baja latencia.
Inferencia de LLM optimizada
Friendli Inference aplica optimizaciones especializadas orientadas a la eficiencia y el rendimiento:
Reduce los costos de GPU en un 50–90%
Usa hasta 6× menos GPUs en comparación con los enfoques tradicionales
Mayor rendimiento en benchmarks frente a vLLM y TensorRT-LLM, con hasta 10.7× mayor rendimiento y hasta 6.2× menor latencia
Diseñado para equipos de producción
La plataforma está orientada a equipos que necesitan servir LLMs de forma estable y rentable a escala, desde startups hasta grandes empresas:
Integración basada en API para servicios existentes
Escala con el crecimiento del tráfico
Ayuda a maximizar la utilización de los recursos de GPU actuales sin sacrificar la velocidad de generación

