📰 IT Дайджест

#inference

16 материалов

3. Qwen 3.8 27B доступен на Cerebras: 1500 токенов/с, без прунинга

Cerebras запустил Qwen 3.8 27B на публичных эндпоинтах со скоростью 1500 токенов/с. Модель не прунена — все веса оригинальные, только выборочная квантизация при хранении. Пруненные версии REAP доступны на Hugging Face, но не через API.

inference-docs.cerebras.ai · #ai #cerebras #inference #llm

10. OpenAI показала первые результаты чипа Jalapeño

OpenAI опубликовала первые результаты Jalapeño — собственного inference-чипа. Заявлены более высокая скорость и энергоэффективность, выше throughput и ниже latency для современных моделей; конкретные цифры в анонсе не приводятся.

openai.com · #hardware #chip #hardware #inference #openai

2. OpenAI представила чип Jalapeño — быстрее Blackwell на perf/W

OpenAI показала инференс-чип Jalapeño, разработанный с Broadcom за 16 месяцев. На бенчмарках InferenceX он обходит Nvidia Blackwell по производительности на ватт, использует HBM4. В шутку запустили Doom, портированный через Codex.

newsletter.semianalysis.com · #hardware #chip #inference #openai

10. Почему ваша локальная LLM кажется тупее, чем есть на самом деле

Обсуждение на Level1Techs: пользователи жалуются, что локальные модели дают худшие результаты, чем облачные. Причины — квантование, маленький контекст и неоптимальные настройки. Конкретных цифр или имён моделей в статье нет.

forum.level1techs.com · #ai #inference #llm #local-llm

2. AMD купила стартап Taalas, вплавляющий веса моделей в кремний

Taalas делает MSIC — чипы, где веса модели втравированы в кремний, без HBM. Тестовый HC1 на TSMC 6nm выдал 16 960 токенов/с на Llama 3.1 8B — в 48 раз быстрее NVIDIA. HC2 обещает 20 млрд параметров; AMD планирует ставить такие ускорители рядом с Instinct Helios.

www.theregister.com · #hardware #ai #amd #inference #silicon

3. 70B модель на 4 ГБ GPU — без квантизации и дистилляции

AirLLM ужимает потребление памяти так, что 70B-модели запускаются на одной видеокарте с 4 ГБ, а 405B Llama 3.1 — на 8 ГБ, DeepSeek-V3 (671B) — на ~12 ГБ, а разреженная MoE-модель Kimi K3 (2.8T) — вообще на <4 ГБ. Секрет в том, что данные не сжимаются, а стримятся: вместо целого слоя передаётся один эксперт за раз.

github.com · #ai #ai #gpu #inference #llm

5. Gemma 4 26B запустили на 13-летнем Xeon без GPU: 5 токенов в секунду

Автор на neomindlabs показал запуск Gemma 4 26B на старом 13-летнем Xeon без видеокарты и получил около 5 tokens/sec. Это уже не «погонял LLM на ноуте», а почти археология: большой 26B-модельный кирпич, CPU-only и очень терпеливый человек. Заодно хороший тест на то, сколько пафоса уходит, когда железо старше самого хайпа вокруг модели.

www.neomindlabs.com · #ai #cpu #gemma #gpu-free #inference #llm

10. Bonsai 27B запускается на телефоне

PrismML хвастается моделью Bonsai 27B, которую, по их словам, можно гонять прямо на смартфоне. Число 27B тут важнее всего: это уже не игрушка на пару миллиардов параметров, а вполне тяжёлый зверь, который обычно ждёшь увидеть на сервере, а не в кармане. Любопытно не то, что «можно», а сколько компромиссов пришлось сделать, чтобы это вообще жило.

prismml.com · #ai #benchmark #inference #llm #mobile

9. MiMo-V2.5: Xiaomi пишет про full-pipeline оптимизацию инференса

Xiaomi опубликовала разбор оптимизаций инференса для серии MiMo-V2.5 и называет это full-pipeline optimization. Само по себе это обычно означает скучную, но полезную работу: где-то подрезали latency, где-то лучше распараллелили этапы, где-то выжали лишние проценты из движка, чтобы модель меньше ела железо и больше отрабатывала запросы.

mimo.xiaomi.com · #ai #device #gpu #inference #optimization #xiaomi

2. Сборка SOTA-LLM локально: гайд Джеймса Оба на GitHub

На GitHub лежит большой практический гайд по запуску современных LLM на своей машине — не статья в духе «всё работает», а набор конкретных инструкций и трюков от jamesob. Репозиторий собрал 305 пунктов на HN, так что людей, видимо, давно мучает вопрос, как жить без чужого API и без лишних счетов за токены.

github.com · #ai #gpu #guide #inference #llm #local

3. DSpark: speculative decoding для ускорения инференса LLM

В PDF из DeepSeek описан DSpark — схема speculative decoding, которую авторы подают как способ ускорить inference больших языковых моделей. Пост на HN собрал 742 очка и 310 комментариев, так что все уже по привычке спорят, где там реальное ускорение, а где очередная красивая математика в презентации.

github.com · #ai #gpu #inference #llm #paper #speculative-decoding

10. Как автор ускорял свёртки в своей модели и упёрся в Depthwise Conv

На Habr автор рассказывает, как после статьи про NormIs-1 полез оптимизировать модель и обнаружил, что скорость проседает именно на Depthwise Conv. Это как раз тот случай, когда метрики интеллекта выглядят прилично, а потом выясняется, что узкое место сидит в самом обычном блоке свёрток.

habr.com · #ai #blog #inference #model #optimization #russian

6. Сири и «private inference»: почему приватность всё равно дырявая

На Cryptography Engineering разбирают идею приватных агентов на примере будущего Siri. Автор спорит с тезисом, что local/private inference автоматически решает проблему приватности: если модель видит ваши данные и делает выводы, утечки могут случиться и без облачного сервера в кадре.

blog.cryptographyengineering.com · #security #inference #llm #privacy #siri

4. Gemma 4 12B обещают гонять на ноутбуках с 16 ГБ RAM

Ars пишет про новую Gemma 4 12B от Google: модель заточили под запуск на обычном ноутбуке с 16 ГБ памяти. Внутри у неё новый encoding scheme и token prediction — то есть не просто «меньше параметров», а попытка выжать больше из того же железа.

arstechnica.com · #ai #gemma #gpu #inference #llm