Gemma 4 12B обещают гонять на ноутбуках с 16 ГБ RAM
Ars пишет про новую Gemma 4 12B от Google: модель заточили под запуск на обычном ноутбуке с 16 ГБ памяти. Внутри у неё новый encoding scheme и token prediction — то есть не просто «меньше параметров», а попытка выжать больше из того же железа.
Gemma 4 12B почти так же способен, как версия с 26 миллиардами параметров.
Фото:
Google
Gemma 4 12B почти так же способен, как версия с 26 миллиардами параметров.
Фото:
Google
Google заявляет, что новая модель способна к сложным многошаговым рассуждениям и агентным workflows, которые ранее требовали более крупных вариантов Gemma. Несмотря на меньший счетчик параметров, Gemma 4 12B поставляется с недавно разработанными Multi-Token Prediction (MTP) drafters, которые используют не задействованные вычислительные циклы для расчета возможных будущих токенов. Результат — более высокая скорость и эффективность. Google выпустила опциональные MTP-версии других моделей Gemma 4, но это первая модель, в которой MTP есть из коробки.
Gemma 4 12B также более эффективна благодаря новому подходу к мультимодальности. Семейство Gemma 4 изначально мультимодально и принимает на вход текст, аудио или изображения. Большинство gen AI моделей — включая другие варианты Gemma 4 — используют специализированные энкодеры для обработки нетекстовых входных данных и передают эти данные в LLM. Это работает достаточно хорошо, но увеличивает задержку и потребление памяти.
В новой модели среднего размера Google реализовала упрощенный модуль embedding для зрения, с однократным умножением матриц и positional embedding, что позволяет данным поступать в LLM с корректным пониманием пространственных отношений. Это устраняет необходимость в громоздком промежуточном encoder. Для аудио кодирования вообще нет. Разработчики нашли способ проецировать сырой аудиосигнал в те же векторы, которые используются для текстовых токенов.
Demo Gemma 4 12B
Если вы хотите ознакомиться с новой моделью Gemma 4, к ней можно получить доступ без загрузки через такие инструменты, как LM Studio, Google AI Edge Gallery и другие. Но вся идея Gemma 4 12B в том, что вы можете запускать ее локально и на своих условиях. Если у вас достаточно RAM, веса модели доступны для немедленной загрузки на Kaggle и Hugging Face. Ее размер — чуть меньше 18GB.