Netflix рассказал, как сам разворачивает LLM: vLLM вместо TensorRT-LLM, Triton под капотом
Netflix публикует детали своей платформы для serving LLM. После сравнения с TensorRT-LLM выбрали vLLM из-за лучшей поддержки кастомных архитектур, отладки и удобства интеграции. Модели упаковываются через JSON-конфиг (vLLM backend), а не через жёсткие спецификации тензоров. В продакшене столкнулись с проблемами несовместимости версий Triton и vLLM.