#optimization
16 материалов
ARGODRIVE Deltafin запустил модель Kimi K3 на MacBook Pro: декодирование 1 токен/с при 512 токенах. Проблема: время до первого токена ~6.3 минуты из-за повторного чтения слоёв. Один SSD даёт 52% скорости от четырёх, два — 73%, три — 90%.
github.com · #ai #hardware #llm #optimization
Lorenzo Stoakes из ARM использовал LLM для поиска узких мест в процессе сборки. Результат: полная сборка быстрее на 36%, инкрементальная — до 70%, noop — до 90%. Каждый коммит содержит Assisted-by: LLM. Код пришлось вручную проверять и переписывать.
www.phoronix.com · #infra #ai #kernel #linux #optimization
Инженеры GitHub выяснили, что укорачивание каждого ответа инструмента (RTK) ведёт к дополнительным запросам и росту затрат. Вместо этого внедрили выборочный компрессор: сохраняют вывод cat, git diff, grep, а шум сборки сжимают. Четыре изменения проверены на бенчмарках и в онлайне.
github.blog · #ai #copilot #github #llm #optimization
Проект SlotStream транслирует веса 125B MoE-модели Qwen3.8-Flash-Next (104 ГБ в 4-битном формате) с SSD, позволяя запускать её на Mac с 48 ГБ памяти. На M5 Pro получено ~12 токенов/с при пиковом потреблении 32 ГБ. Бинарник написан на Swift, поддерживает API Ollama и OpenAI.
github.com · #ai #llm #mac #mlx #optimization
Автор проанализировал 40 сессий Claude Code и Codex (777 млн токенов). Выяснилось, что на каждый новый токен приходится 36–47 повторных пересылок старых. Свежий ввод — 0.003% у Claude и 5.7% у Codex. Стоимость растёт быстрее длины сессии: удвоение шагов даёт ×2.4 токенов.
habr.com · #ai #cost #llm #optimization #tokens
Пять оптимизаций структуры хранения сократили расход памяти на запись кэша более чем вдвое. Замена Vec на Box<[T]> и объединение списков ответов дали 15 TB экономии, а в сумме по флоту высвободилось 100 TB — эквивалент 130 серверов Gen 13.
blog.cloudflare.com · #infra #cloudflare #dns #memory #optimization
Автор тестирует gpt-5.6-luna: ~100 токенов/c, стоимость сложных задач — копейки. Раньше персонализированная новостная лента обходилась в $1, теперь — $0.10. Это открывает путь для consumer-приложений с AI, где раньше мешали высокие затраты на инференс.
calv.info · #ai #efficiency #llm #optimization
Метод QAH дистиллирует сжатый 4-битный студент напрямую из оригинальной full-precision модели, а не из восстановленного чекпоинта. GPT-OSS 120B → 60B в MXFP4 превзошёл bfloat16-версию на 7 из 9 бенчмарков, став одновременно меньше, быстрее и точнее.
huggingface.co · #ai #llm #optimization #quantization
Гибрид из 6 блоков attention и 12 свёрточных обучен на 59.9B токенов и набрал 47.31 против порога 42.20. Он быстрее в 1.76 раза на контексте 2048 токенов и обходит MobileLLM-125M, хотя та видела триллион токенов.
tldr.takara.ai · #ai #cpu #inference #llm #optimization
Автор использовал LLM-агента для сборки AOT-компилятора regex-движка FRE. На длинных запросах ускорение 2–4x, на репрезентативных — около 7%, и всё это за пару минут человеческого времени.
danluu.com · #blog #optimization #performance #software
Подробности не раскрыты — известно только, что новая техника распределения квантования на уровне тензоров даёт прирост производительности на задачах программирования. Цифры и методология пока не опубликованы.
www.reddit.com · #ai #gemma #llm #optimization #quantization
Blackbird (поиск кода GitHub) индексирует 180M+ репозиториев (480TB). Оптимизация ASCII-пути: удалены все ветвления, цикл без раннего выхода, арифметическая проверка A..=Z. Результат — Rust-крейт casefold, работающий на скорости памяти (без потери точности для Unicode C/S).
github.blog · #infra #github #optimization #performance
Phoronix заметил, что перед выходом 7.2-rc3 в git попали правки для драйверов SEGA Dreamcast. Да, в 2026 году ядро всё ещё получает патчи для консоли, которую многие уже видели только на фото и в мемах. Это тот случай, когда Linux поддерживает вообще всё, включая ностальгию.
www.phoronix.com · #tool #code #optimization #performance #simulation
Xiaomi опубликовала разбор оптимизаций инференса для серии MiMo-V2.5 и называет это full-pipeline optimization. Само по себе это обычно означает скучную, но полезную работу: где-то подрезали latency, где-то лучше распараллелили этапы, где-то выжали лишние проценты из движка, чтобы модель меньше ела железо и больше отрабатывала запросы.
mimo.xiaomi.com · #ai #device #gpu #inference #optimization #xiaomi
На Habr автор рассказывает, как после статьи про NormIs-1 полез оптимизировать модель и обнаружил, что скорость проседает именно на Depthwise Conv. Это как раз тот случай, когда метрики интеллекта выглядят прилично, а потом выясняется, что узкое место сидит в самом обычном блоке свёрток.
habr.com · #ai #blog #inference #model #optimization #russian
Статья про охоту на miscompile'ы — случаи, когда компилятор генерирует неправильный код, хотя программа сама по себе корректна. Тема скучная ровно до того момента, пока такой баг не ломает прод в самых веселых местах, а потом уже всем не до шуток: авторы копаются в том, как это ловить и воспроизводить.
newsletter.semianalysis.com · #tool #compiler #miscompile #optimization