Friendli Inference é um mecanismo de alto desempenho para servir modelos de linguagem grandes (LLMs) em produção. Ele foi projetado para maximizar a velocidade de inferência enquanto reduz a carga de infraestrutura e os gastos com GPU, ajudando equipes a operar modelos generativos com alta taxa de transferência e baixa latência.
Inferência de LLM otimizada
Friendli Inference aplica otimizações especializadas voltadas para eficiência e desempenho:
Reduz custos de GPU em 50–90%
Usa até 6× menos GPUs em comparação com abordagens tradicionais
Desempenho superior em benchmarks em relação ao vLLM e ao TensorRT-LLM, com até 10,7× mais throughput e até 6,2× menor latência
Feito para equipes de produção
A plataforma é voltada para equipes que precisam de serving de LLM estável e com bom custo-benefício em escala — de startups a grandes empresas:
Integração baseada em API para serviços existentes
Escala conforme o crescimento do tráfego
Ajuda a maximizar a utilização dos recursos de GPU atuais sem sacrificar a velocidade de geração

