📰 IT Дайджест

#optimization

16 материалов

11. Kimi K3 (2.8T параметров) работает на M5 Max с 128 ГБ — 1 токен/с с четырёх SSD

ARGODRIVE Deltafin запустил модель Kimi K3 на MacBook Pro: декодирование 1 токен/с при 512 токенах. Проблема: время до первого токена ~6.3 минуты из-за повторного чтения слоёв. Один SSD даёт 52% скорости от четырёх, два — 73%, три — 90%.

github.com · #ai #hardware #llm #optimization

14. AI помог ARM-инженеру ускорить сборку ядра Linux на 36%, но сгенерировал «отвратительный» код

Lorenzo Stoakes из ARM использовал LLM для поиска узких мест в процессе сборки. Результат: полная сборка быстрее на 36%, инкрементальная — до 70%, noop — до 90%. Каждый коммит содержит Assisted-by: LLM. Код пришлось вручную проверять и переписывать.

www.phoronix.com · #infra #ai #kernel #linux #optimization

8. GitHub Copilot: как сократить расход токенов, не ухудшая качество — уроки A/B-тестов

Инженеры GitHub выяснили, что укорачивание каждого ответа инструмента (RTK) ведёт к дополнительным запросам и росту затрат. Вместо этого внедрили выборочный компрессор: сохраняют вывод cat, git diff, grep, а шум сборки сжимают. Четыре изменения проверены на бенчмарках и в онлайне.

github.blog · #ai #copilot #github #llm #optimization

3. SlotStream запускает 104-гигабайтную Qwen3.8-Flash-Next на Mac с 48 ГБ — 12 токенов/с

Проект SlotStream транслирует веса 125B MoE-модели Qwen3.8-Flash-Next (104 ГБ в 4-битном формате) с SSD, позволяя запускать её на Mac с 48 ГБ памяти. На M5 Pro получено ~12 токенов/с при пиковом потреблении 32 ГБ. Бинарник написан на Swift, поддерживает API Ollama и OpenAI.

github.com · #ai #llm #mac #mlx #optimization

5. Агенты пересылают 97% токенов повторно: исследование 40 сессий

Автор проанализировал 40 сессий Claude Code и Codex (777 млн токенов). Выяснилось, что на каждый новый токен приходится 36–47 повторных пересылок старых. Свежий ввод — 0.003% у Claude и 5.7% у Codex. Стоимость растёт быстрее длины сессии: удвоение шагов даёт ×2.4 токенов.

habr.com · #ai #cost #llm #optimization #tokens

4. Cloudflare сэкономил 100 TB памяти в DNS-кэше 1.1.1.1

Пять оптимизаций структуры хранения сократили расход памяти на запись кэша более чем вдвое. Замена Vec на Box<[T]> и объединение списков ответов дали 15 TB экономии, а в сумме по флоту высвободилось 100 TB — эквивалент 130 серверов Gen 13.

blog.cloudflare.com · #infra #cloudflare #dns #memory #optimization

8. Маленькие модели становятся дешёвыми и быстрыми

Автор тестирует gpt-5.6-luna: ~100 токенов/c, стоимость сложных задач — копейки. Раньше персонализированная новостная лента обходилась в $1, теперь — $0.10. Это открывает путь для consumer-приложений с AI, где раньше мешали высокие затраты на инференс.

calv.info · #ai #efficiency #llm #optimization

13. 4-битная модель обходит full-precision оригинал: Quantization-Aware Healing

Метод QAH дистиллирует сжатый 4-битный студент напрямую из оригинальной full-precision модели, а не из восстановленного чекпоинта. GPT-OSS 120B → 60B в MXFP4 превзошёл bfloat16-версию на 7 из 9 бенчмарков, став одновременно меньше, быстрее и точнее.

huggingface.co · #ai #llm #optimization #quantization

13. Gemma 4 12B Q3: +8.55% к кодингу за счёт тензорного квантования

Подробности не раскрыты — известно только, что новая техника распределения квантования на уровне тензоров даёт прирост производительности на задачах программирования. Цифры и методология пока не опубликованы.

www.reddit.com · #ai #gemma #llm #optimization #quantization

14. GitHub ускорил case-folding в 15 раз, убрав early exit из ASCII-пути

Blackbird (поиск кода GitHub) индексирует 180M+ репозиториев (480TB). Оптимизация ASCII-пути: удалены все ветвления, цикл без раннего выхода, арифметическая проверка A..=Z. Результат — Rust-крейт casefold, работающий на скорости памяти (без потери точности для Unicode C/S).

github.blog · #infra #github #optimization #performance

7. В Linux 7.2 чинят драйверы SEGA Dreamcast

Phoronix заметил, что перед выходом 7.2-rc3 в git попали правки для драйверов SEGA Dreamcast. Да, в 2026 году ядро всё ещё получает патчи для консоли, которую многие уже видели только на фото и в мемах. Это тот случай, когда Linux поддерживает вообще всё, включая ностальгию.

www.phoronix.com · #tool #code #optimization #performance #simulation

9. MiMo-V2.5: Xiaomi пишет про full-pipeline оптимизацию инференса

Xiaomi опубликовала разбор оптимизаций инференса для серии MiMo-V2.5 и называет это full-pipeline optimization. Само по себе это обычно означает скучную, но полезную работу: где-то подрезали latency, где-то лучше распараллелили этапы, где-то выжали лишние проценты из движка, чтобы модель меньше ела железо и больше отрабатывала запросы.

mimo.xiaomi.com · #ai #device #gpu #inference #optimization #xiaomi

10. Как автор ускорял свёртки в своей модели и упёрся в Depthwise Conv

На Habr автор рассказывает, как после статьи про NormIs-1 полез оптимизировать модель и обнаружил, что скорость проседает именно на Depthwise Conv. Это как раз тот случай, когда метрики интеллекта выглядят прилично, а потом выясняется, что узкое место сидит в самом обычном блоке свёрток.

habr.com · #ai #blog #inference #model #optimization #russian

2. В Semianalysis разбирают, как искать miscompile'ы в компиляторах

Статья про охоту на miscompile'ы — случаи, когда компилятор генерирует неправильный код, хотя программа сама по себе корректна. Тема скучная ровно до того момента, пока такой баг не ломает прод в самых веселых местах, а потом уже всем не до шуток: авторы копаются в том, как это ловить и воспроизводить.

newsletter.semianalysis.com · #tool #compiler #miscompile #optimization