📰 IT Дайджест

#quantization

4 материала

13. 4-битная модель обходит full-precision оригинал: Quantization-Aware Healing

Метод QAH дистиллирует сжатый 4-битный студент напрямую из оригинальной full-precision модели, а не из восстановленного чекпоинта. GPT-OSS 120B → 60B в MXFP4 превзошёл bfloat16-версию на 7 из 9 бенчмарков, став одновременно меньше, быстрее и точнее.

huggingface.co · #ai #llm #optimization #quantization

13. Gemma 4 12B Q3: +8.55% к кодингу за счёт тензорного квантования

Подробности не раскрыты — известно только, что новая техника распределения квантования на уровне тензоров даёт прирост производительности на задачах программирования. Цифры и методология пока не опубликованы.

www.reddit.com · #ai #gemma #llm #optimization #quantization

7. Qwen 3.6 27B: локальная модель, которую хвалят за размер

В посте Qwen 3.6 27B называют sweet spot для локальной разработки, и комментарии на HN это, судя по всему, проглотили с аппетитом: 727 очков и 548 комментариев. Самое занятное тут не маркетинг, а то, что люди всерьёз обсуждают 27B-модель как удобный вариант для запуска у себя, а не только в облачной империи.

quesma.com · #ai #llm #local #quantization #qwen