📰 IT Дайджест

← К выпуску 28.08.2026

4-битная модель обходит full-precision оригинал: Quantization-Aware Healing

huggingface.co · #ai #llm #optimization #quantization

Метод QAH дистиллирует сжатый 4-битный студент напрямую из оригинальной full-precision модели, а не из восстановленного чекпоинта. GPT-OSS 120B → 60B в MXFP4 превзошёл bfloat16-версию на 7 из 9 бенчмарков, став одновременно меньше, быстрее и точнее.

Открыть оригинал →