Alibaba показала Qwen3.8-Flash-Next — превью архитектуры Qwen 4
125B MoE-модель с 6B активных параметров на токен, 51B N-gram эмбеддингов, выгружаемых в RAM/SSD, и гибридным механизмом Gated DeltaNet + Qwen Sparse Attention. На контексте в 1M токенов Prefill ускорился в 8.6x. Нативное окно — 262K токенов.