Подробности не раскрыты — известно только, что новая техника распределения квантования на уровне тензоров даёт прирост производительности на задачах программирования. Цифры и методология пока не опубликованы.
www.reddit.com · #ai #gemma #llm #optimization #quantization
Автор на neomindlabs показал запуск Gemma 4 26B на старом 13-летнем Xeon без видеокарты и получил около 5 tokens/sec. Это уже не «погонял LLM на ноуте», а почти археология: большой 26B-модельный кирпич, CPU-only и очень терпеливый человек. Заодно хороший тест на то, сколько пафоса уходит, когда железо старше самого хайпа вокруг модели.
www.neomindlabs.com · #ai #cpu #gemma #gpu-free #inference #llm
Ars пишет про новую Gemma 4 12B от Google: модель заточили под запуск на обычном ноутбуке с 16 ГБ памяти. Внутри у неё новый encoding scheme и token prediction — то есть не просто «меньше параметров», а попытка выжать больше из того же железа.
arstechnica.com · #ai #gemma #gpu #inference #llm