📰 IT Дайджест

#gpu

41 материал

4. AMD набирает элитную команду для внедрения Rust в графический стек

AMD ищет разработчиков для продвижения Rust в компиляторы, рантаймы, прошивки и драйверы GPU. Старший фелло Harsh Meno объявил об этом в LinkedIn. NVIDIA тоже движется в этом направлении, разрабатывая драйвер Nova на Rust.

www.phoronix.com · #infra #amd #drivers #gpu #rust

15. NVIDIA выпустила патчи для vGPU и VFIO в открытый драйвер Nova

NVIDIA отправила в список рассылки ядра 13 патчей, добавляющих поддержку виртуальных GPU и VFIO в драйвер Nova. Это позволит запускать гостевые ОС через QEMU с пробросом GPU. Пока поддержка обещана только для рабочих станций и датацентров, не для GeForce.

www.phoronix.com · #infra #gpu #kernel #linux #nova #nvidia

14. Nvidia хочет портировать CUDA на RISC-V: требования — RVA23, ACPI, PCIe coherence

На Hot Chips Nvidia рассказала о требованиях к RISC-V CPU для работы с CUDA: CPU должен быть RVA23, поддерживать ACPI, PCIe когерентность и P2P PCIe. Также упомянут NVLink Fusion для интеграции кастомных CPU через NVLink C2C.

chipsandcheese.com · #hardware #cuda #gpu #riscv

6. Qwen3.8-27B на RTX 5090: 120 токенов/с с 451K KV-cache

По заголовку, модель Qwen3.8-27B в формате NVFP4 с поддержкой зрения работает на одной RTX 5090 (ограничение 400 Вт) со средней скоростью 120 токенов/с и кэшем ключей/значений на 451K токенов. Подробности не раскрыты.

www.reddit.com · #ai #ai #gpu #llm #qwen

12. В Linux 7.3 улучшены драйверы для старых и новых GPU

DRM-подсистема Linux 7.3 включает DMEMCG eviction от Valve для улучшения работы при нехватке VRAM, поддержку форматов модификаторов для GCN (GFX6-GFX8), а также включение по умолчанию графики Intel Xe3P (Nova Lake). Rust-драйвер Nova получил исправления Blackwell и Hopper, а Nouveau — NVDEC для NVK Vulkan Video.

www.phoronix.com · #infra #drm #gpu #kernel #linux

15. Организованные группы угоняют грузовики с AI-чипами, используя ПИТ-манёвры

По данным бывшего детектива, два грузовика с оборудованием для дата-центров были похищены после того, как эскортные машины вывели из строя (наезд сзади и ПИТ-манёвр). Водители, вероятно, были в сговоре. Стоимость грузов — миллионы долларов.

www.wired.com · #hardware #ai #chips #gpu #logistics #theft

8. Valve улучшает управление видеопамятью: патчи для Linux 7.3 позволяют играть с перерасходом vRAM в 1 ГБ

Natalie Vock из Valve подготовила патчи для Linux 7.3, улучшающие управление vRAM (особенно для AMDGPU). Тестирование с Indiana Jones при 9 ГБ запроса и 8 ГБ доступной vRAM показало, что игра остаётся «вполне играбельной». Код уже в DRM-Next, дополнительные улучшения готовятся для будущих ядер.

www.phoronix.com · #infra #gpu #kernel #linux #memory

9. Исследователи показали Rust-код для GPU через LLVM: производительность сравнима с CUDA и HIP, но с memory safety

Группа авторов (Drehwald, Domínguez, Sala, Aspuru-Guzik, Doerfert) опубликовала работу по оффлоаду Rust-кода на GPU через LLVM. Бенчмарки показывают, что реализация конкурентоспособна с нативными CUDA/HIP C++-ядрами: часть тестов выигрывает, часть проигрывает. Фронтенд считается безопасным и позволяет избегать raw-указателей.

www.phoronix.com · #tool #gpu #llvm #rust #safety

13. Soup: дообучение 8B-модели на 4GB ноутбучной GPU через layer streaming

Инструмент Soup позволяет дообучать LLM из одного YAML-файла. Layer streaming держит замороженную базу вне VRAM и подаёт в GPU по одному декодерному слою. На RTX 3050 4GB: Llama-3.1-8B-Instruct + NF4 — 119.6 tok/s, пик 3.32 GB. Поддерживает SFT, DPO, QLoRA, GGUF.

github.com · #ai #gpu #llm #show-hn

3. 70B модель на 4 ГБ GPU — без квантизации и дистилляции

AirLLM ужимает потребление памяти так, что 70B-модели запускаются на одной видеокарте с 4 ГБ, а 405B Llama 3.1 — на 8 ГБ, DeepSeek-V3 (671B) — на ~12 ГБ, а разреженная MoE-модель Kimi K3 (2.8T) — вообще на <4 ГБ. Секрет в том, что данные не сжимаются, а стримятся: вместо целого слоя передаётся один эксперт за раз.

github.com · #ai #ai #gpu #inference #llm

4. Meta удвоила эффективность обучения рекламной модели на LLM-масштабе

GEM — foundation-модель для рекламы в Instagram и Facebook — теперь тренируется на тысячах GPU и достигла 20–25% MFU (Model FLOPs Utilization) при четырёхкратном росте FLOPs за год. Для этого пришлось изобрести собственные ядра (Jagged Flash Attention, GDPA, BlockAttention), смешанную точность MXFP8 и 5D-параллелизм с учётом топологии сети Meta.

engineering.fb.com · #ai #gpu #llm #meta #training

10. Китайский DFSX обещает вдвое большую пропускную способность памяти, чем NVIDIA GB200

На Reddit обсуждают китайский чип DFSX, который, по заявлению, предлагает вдвое большую пропускную способность памяти по сравнению с NVIDIA GB200. Подробностей о чипе и тестах в посте нет.

www.reddit.com · #hardware #bandwidth #gpu #hardware

15. SlurpJSON: парсинг JSON на GPU через WebGPU compute shaders

Проект slurpjson на Rust использует wgpu compute shaders для разбора JSON. Парсинг сводится к параллельным префиксным сканам, создавая плоскую ленту структурных символов. Работа основана на идеях Raph Levien о "invitingly parallel" проблемах.

github.com · #tool #gpu #json #performance #shaders

12. AMD Advancing AI 2026: упор на «open» — open-source RTL, SONiC, OpenBMC, OpenSIL на Zen 6

AMD на своём мероприятии тысячу раз сказала «AI», но вторым по частоте было «open». Платформа Kria открывает схемы и RTL FPGA для робототехники. Сетевой стек Helios строится на SONiC, EPYC 9006 Venice использует OpenBMC, OpenSIL на Zen 6 достигает production. Контраст с прошлогодним Intel налицо.

www.phoronix.com · #hardware #ai #amd #gpu

15. AMD представила Instinct MI455X с 432 ГБ HBM4 и стоечную систему Helios

Новый ускоритель Instinct MI455X выполнен по техпроцессу 2 нм, оснащён 432 ГБ HBM4 и обещает до 4-кратного прироста в MXFP8/MXFP4 по сравнению с MI355X. Платформа Helios объединяет EPYC Venice, MI455X и сетевые решения Pensando: 4600 CPU-ядер и 18000 GPU-вычислительных блоков на стойку. Поставки начнутся в конце квартала, MI500 series запланирован на 2027 год, MI600 — на 2028.

www.phoronix.com · #hardware #ai #amd #datacenter #gpu

9. MiMo-V2.5: Xiaomi пишет про full-pipeline оптимизацию инференса

Xiaomi опубликовала разбор оптимизаций инференса для серии MiMo-V2.5 и называет это full-pipeline optimization. Само по себе это обычно означает скучную, но полезную работу: где-то подрезали latency, где-то лучше распараллелили этапы, где-то выжали лишние проценты из движка, чтобы модель меньше ела железо и больше отрабатывала запросы.

mimo.xiaomi.com · #ai #device #gpu #inference #optimization #xiaomi

10. DRM scheduler в Linux обещает заметно снизить задержку job submission

Набор патчей для Linux DRM scheduler показывает сильное падение latency при submission job, когда система забита runnable CPU-процессами. Это тот редкий случай, когда графический стек и планировщик начинают бодаться за время процессора, а итогом становится не «плавнее картинка», а просто меньшее ожидание на submit.

www.phoronix.com · #infra #drm #gpu #kernel #linux #scheduler

2. Сборка SOTA-LLM локально: гайд Джеймса Оба на GitHub

На GitHub лежит большой практический гайд по запуску современных LLM на своей машине — не статья в духе «всё работает», а набор конкретных инструкций и трюков от jamesob. Репозиторий собрал 305 пунктов на HN, так что людей, видимо, давно мучает вопрос, как жить без чужого API и без лишних счетов за токены.

github.com · #ai #gpu #guide #inference #llm #local

3. DSpark: speculative decoding для ускорения инференса LLM

В PDF из DeepSeek описан DSpark — схема speculative decoding, которую авторы подают как способ ускорить inference больших языковых моделей. Пост на HN собрал 742 очка и 310 комментариев, так что все уже по привычке спорят, где там реальное ускорение, а где очередная красивая математика в презентации.

github.com · #ai #gpu #inference #llm #paper #speculative-decoding

7. Valve помогает старым AMD GCN видеокартам переживать зависания

Phoronix сообщает, что для ранних AMD Radeon GCN идут улучшения recovery-механизма после GPU hang. Работу ведёт open-source команда Valve по Linux-графике — то есть не просто «драйверная уборка», а конкретная попытка сделать старые карты менее хрупкими в реальной жизни. Хороший пример того, как умирающее железо ещё поживёт, если его регулярно вытаскивают с того света.

www.phoronix.com · #infra #amd #gpu #linux #radeon #valve

5. AMD Lemonade AI Server 10.8 добавил MCP-сервер

В версии 10.8 для open-source Lemonade AI Server появилась интеграция с MCP Server. Сервер, как и раньше, рассчитан на запуск локальных AI-вычислений на Windows и Linux через Ryzen AI NPU, Radeon GPU и обычные x86_64 CPU — то есть это попытка сделать «приватный ИИ» без обязательного похода в облако.

www.phoronix.com · #ai #ai #gpu #mcp #server

6. Panther Lake на Linux 7.1: Phoronix сравнил Xe3 до и после апдейта

Phoronix прогнал Intel Core Ultra X7 358H Panther Lake на Linux 7.0 и свежем stable Linux 7.1, отдельно смотря на CPU и iGPU. Повод вполне приземлённый: после прошлых тестов Arc B580 и Arc Pro B70 читатели спросили, не подтянулись ли и новые Xe3-графики — ну вот, теперь есть цифры, а не вера в лучшее.

www.phoronix.com · #infra #gpu #intel #linux #performance

11. Российский блогер собрал моноблок на Ryzen 9 9900X и RTX 5080

Моноблок, который обычно ассоциируется с экономией места, здесь превратили в витрину для десктопного железа: Ryzen 9 9900X и RTX 5080 внутри. Получилось ровно то, что и обещает заголовок: не тонкий офисный комбайн, а большой вопрос к смыслу форм-фактора, если в него пихают почти весь топовый ПК.

habr.com · #hardware #gpu #habr #pc #ryzen

13. Линукс-7.2 уже ждут с Apple M3, HDMI 2.1 FRL и cache-aware scheduling

Phoronix заранее перечисляет, что может попасть в Linux 7.2: поддержка Apple M3, начальная AMDGPU HDMI 2.1 FRL, USB4STREAM и cache-aware scheduling. Это именно такой список, где половина радости — в аббревиатурах, а половина — в том, что кто-то еще продолжает втачивать железо в ядро по кусочкам. Stable 7.1 еще не вышел, а народ уже спорит о следующем окне слияния.

www.phoronix.com · #infra #amd #gpu #kernel #linux #usb4

10. Linux 7.1 подтянул Intel Arc Pro B70

Phoronix сравнил Intel Arc Pro B70 между Linux 7.0 и почти финальным Linux 7.1. Автор увидел несколько улучшений производительности на новой версии ядра — приятный сюжет для тех, кто покупает workstation-видюху и потом ждёт, пока Linux догонит железо.

www.phoronix.com · #hardware #benchmarks #gpu #intel #linux

3. Linux 7.1 ускоряет Intel Arc Battlemage B580

Phoronix сравнил Intel Arc B580 на текущем Linux 7.0 и грядущем 7.1 и увидел более высокую производительность на новой ветке ядра. Речь именно о Battlemage desktop card, а не о каких-то абстрактных «улучшениях драйверов»: тесты показывают, что обновление ядра уже сейчас меняет цифры на графиках.

www.phoronix.com · #infra #gpu #intel #kernel #linux #performance

9. Firefox научили Vulkan Video для декодирования видео

В Firefox смержили начальную поддержку Vulkan Video, то есть браузер теперь может использовать GPU-ускоренное декодирование через этот API. Пока это только первый шаг, но сам факт, что декодирование видео в вебе снова двигают в сторону Vulkan, уже звучит как работа для людей, которые любят страдать с драйверами.

www.phoronix.com · #infra #browser #firefox #gpu #video-decoding #vulkan

4. Gemma 4 12B обещают гонять на ноутбуках с 16 ГБ RAM

Ars пишет про новую Gemma 4 12B от Google: модель заточили под запуск на обычном ноутбуке с 16 ГБ памяти. Внутри у неё новый encoding scheme и token prediction — то есть не просто «меньше параметров», а попытка выжать больше из того же железа.

arstechnica.com · #ai #gemma #gpu #inference #llm

1. Nvidia VRAM в роли swap: Linux-проект nbd-vram

Автор GitHub-проекта предлагает использовать видеопамять NVIDIA как swap-space в Linux. Идея не из серии «запустим LLM на тостере»: по сути это NBD-обвязка, которая выдает VRAM наружу как блочное устройство, чтобы ядро могло туда вытеснять страницы. На HN у репозитория уже 198 очков и 57 комментариев — народ, разумеется, сразу начал мерить, где это сломается первым.

github.com · #tool #github #gpu #linux #nvidia #swap

14. Intel Arc Pro B70 на Linux: Phoronix погонял его в играх

Phoronix отдельно протестировал Intel Arc Pro B70 BMG-G31 под Linux в игровых сценариях, хотя карта вообще-то не для этого. В серии тестов уже были OpenCL, Vulkan, Level Zero и даже конфигурации до четырёх карт — в общем, скучно железке не дали.

www.phoronix.com · #infra #benchmark #gpu #intel-arc #linux

3. NVIDIA выпустила CUDA 13.3 с CUDA Python 1.0 и CUDA Tile for C++

В CUDA 13.3 завезли CUDA Python 1.0 и поддержку CUDA Tile for C++, то есть NVIDIA продолжает обвешивать свой стек еще одной прослойкой абстракций. Phoronix пишет, что это очередной шаг в unified GPU programming stack — формулировка, за которой обычно прячется мысль: «держитесь, сейчас будет ещё сложнее».

www.phoronix.com · #hardware #cuda #gpu #nvidia #python

10. low_latency_layer пытается скрестить Vulkan, Reflex 2 и Anti-Lag 2 на Linux

Проект low_latency_layer — это open-source Vulkan layer, который обещает дать AMD Anti-Lag 2 и NVIDIA Reflex 2 на Linux в более-менее аппаратно-агностичном виде. В Phoronix пишут, что слой должен работать и с AMD, и с Intel GPU, то есть идея не привязана к одному вендору и его маркетинговым фокусам. Если оно действительно заведётся, это будет не очередной «ускоритель всего», а полезная прослойка для уменьшения input latency.

www.phoronix.com · #hardware #gpu #latency #linux #reflex #vulkan

6. ROCm 7.13 добавил поддержку Instinct MI350P и новых Ryzen AI APU

AMD выпустила ROCm 7.13 как свежий preview SDK в дороге к тому, что позже, вероятно, назовут ROCm 8.0. Из заметного — поддержка Instinct MI350P и ещё нескольких Ryzen AI APU; то есть стек для GPU/AI у AMD продолжает обрастать железом быстрее, чем документацией.

www.phoronix.com · #hardware #amd #gpu #mi350p #rocm #ryzen