Qwen3.8-Flash-Next: MoE на 125B с 6B активных
Qwen выложила open-weights Qwen3.8-Flash-Next — мультимодальную MoE-модель, которую называют ранним превью архитектуры Qwen4. При суммарном размере 125B активны только 6B; Саймон Уиллисон уже гонял её на DGX Spark в квантованиях Unsloth (72.5GB UD-IQ1_S и 78.9GB UD-Q2_K_XL).
26 августа 2026 г. — Блог-ссылки
Qwen3.8-Flash-Next (через [ссылку]) Еще одна модель с открытыми весами от Qwen. Эта — «мультимодальная MoE-модель, которая также служит ранним превью архитектуры, используемой в Qwen4».
Она довольно большая: 125B токенов, но только 6B активны, что дает значительный прирост производительности.
Я тестировал ее на DGX Spark, используя эти квантованные модели Unsloth. Я все еще изучаю модель — на данный момент я попробовал UD-IQ1_S на 72,5 ГБ (создающую этих пеликанов) и UD-Q2_K_XL на 78,9 ГБ (создающую этих).
Моей любимой на данный момент оказалась эта попытка с усиленным рассуждением (xhigh reasoning effort) от UD-Q2_K_XL: