Метод QAH дистиллирует сжатый 4-битный студент напрямую из оригинальной full-precision модели, а не из восстановленного чекпоинта. GPT-OSS 120B → 60B в MXFP4 превзошёл bfloat16-версию на 7 из 9 бенчмарков, став одновременно меньше, быстрее и точнее.
huggingface.co · #ai #llm #optimization #quantization
На Reddit появился трекер обновлений для 1-битных, 2-битных и тернарных моделей (Bitnet). Детали не опубликованы — только заголовок.
www.reddit.com · #ai #bitnet #llm #quantization
Подробности не раскрыты — известно только, что новая техника распределения квантования на уровне тензоров даёт прирост производительности на задачах программирования. Цифры и методология пока не опубликованы.
www.reddit.com · #ai #gemma #llm #optimization #quantization
В посте Qwen 3.6 27B называют sweet spot для локальной разработки, и комментарии на HN это, судя по всему, проглотили с аппетитом: 727 очков и 548 комментариев. Самое занятное тут не маркетинг, а то, что люди всерьёз обсуждают 27B-модель как удобный вариант для запуска у себя, а не только в облачной империи.
quesma.com · #ai #llm #local #quantization #qwen