📰 IT Дайджест

#speculative-decoding

1 материал

3. DSpark: speculative decoding для ускорения инференса LLM

В PDF из DeepSeek описан DSpark — схема speculative decoding, которую авторы подают как способ ускорить inference больших языковых моделей. Пост на HN собрал 742 очка и 310 комментариев, так что все уже по привычке спорят, где там реальное ускорение, а где очередная красивая математика в презентации.

github.com · #ai #gpu #inference #llm #paper #speculative-decoding