📰 IT Дайджест

#netflix

1 материал

6. Netflix рассказал, как сам разворачивает LLM: vLLM вместо TensorRT-LLM, Triton под капотом

Netflix публикует детали своей платформы для serving LLM. После сравнения с TensorRT-LLM выбрали vLLM из-за лучшей поддержки кастомных архитектур, отладки и удобства интеграции. Модели упаковываются через JSON-конфиг (vLLM backend), а не через жёсткие спецификации тензоров. В продакшене столкнулись с проблемами несовместимости версий Triton и vLLM.

netflixtechblog.com · #ai #infrastructure #llm #netflix