#gpu
41 материал
AMD ищет разработчиков для продвижения Rust в компиляторы, рантаймы, прошивки и драйверы GPU. Старший фелло Harsh Meno объявил об этом в LinkedIn. NVIDIA тоже движется в этом направлении, разрабатывая драйвер Nova на Rust.
www.phoronix.com · #infra #amd #drivers #gpu #rust
NVIDIA отправила в список рассылки ядра 13 патчей, добавляющих поддержку виртуальных GPU и VFIO в драйвер Nova. Это позволит запускать гостевые ОС через QEMU с пробросом GPU. Пока поддержка обещана только для рабочих станций и датацентров, не для GeForce.
www.phoronix.com · #infra #gpu #kernel #linux #nova #nvidia
Заявлена работа Qwen3.8-Flash-Next с контекстом 170K токенов на одной 96 ГБ видеокарте со скоростью около 110 токенов в секунду. Подробности не раскрыты.
www.reddit.com · #ai #gpu #inference #llm #qwen
Apple представила Mac mini с M6 (2 нм) от $899 и Mac Studio с M5 Ultra до 512 ГБ памяти. Упор на локальный запуск open-weight моделей (Qwen, DeepSeek). Поддержка Wi-Fi 7, Bluetooth 6, storage до 15 ГБ/с.
arstechnica.com · #hardware #ai #apple #gpu #workstation
На Hot Chips Nvidia рассказала о требованиях к RISC-V CPU для работы с CUDA: CPU должен быть RVA23, поддерживать ACPI, PCIe когерентность и P2P PCIe. Также упомянут NVLink Fusion для интеграции кастомных CPU через NVLink C2C.
chipsandcheese.com · #hardware #cuda #gpu #riscv
Согласно заголовку, Nvidia уведомила клиентов о повышении цен на ИИ-решения более чем на 15%. Подробности не раскрыты.
www.reddit.com · #drama #ai #gpu #nvidia #pricing
По заголовку, модель Qwen3.8-27B в формате NVFP4 с поддержкой зрения работает на одной RTX 5090 (ограничение 400 Вт) со средней скоростью 120 токенов/с и кэшем ключей/значений на 451K токенов. Подробности не раскрыты.
www.reddit.com · #ai #ai #gpu #llm #qwen
DRM-подсистема Linux 7.3 включает DMEMCG eviction от Valve для улучшения работы при нехватке VRAM, поддержку форматов модификаторов для GCN (GFX6-GFX8), а также включение по умолчанию графики Intel Xe3P (Nova Lake). Rust-драйвер Nova получил исправления Blackwell и Hopper, а Nouveau — NVDEC для NVK Vulkan Video.
www.phoronix.com · #infra #drm #gpu #kernel #linux
Подробности не раскрыты — известно только о выходе CS-4 от Cerebras. Предыдущие модели были рекордными по размеру кристалла.
www.cerebras.ai · #hardware #ai #cerebras #chips #gpu
По данным бывшего детектива, два грузовика с оборудованием для дата-центров были похищены после того, как эскортные машины вывели из строя (наезд сзади и ПИТ-манёвр). Водители, вероятно, были в сговоре. Стоимость грузов — миллионы долларов.
www.wired.com · #hardware #ai #chips #gpu #logistics #theft
Natalie Vock из Valve подготовила патчи для Linux 7.3, улучшающие управление vRAM (особенно для AMDGPU). Тестирование с Indiana Jones при 9 ГБ запроса и 8 ГБ доступной vRAM показало, что игра остаётся «вполне играбельной». Код уже в DRM-Next, дополнительные улучшения готовятся для будущих ядер.
www.phoronix.com · #infra #gpu #kernel #linux #memory
Группа авторов (Drehwald, Domínguez, Sala, Aspuru-Guzik, Doerfert) опубликовала работу по оффлоаду Rust-кода на GPU через LLVM. Бенчмарки показывают, что реализация конкурентоспособна с нативными CUDA/HIP C++-ядрами: часть тестов выигрывает, часть проигрывает. Фронтенд считается безопасным и позволяет избегать raw-указателей.
www.phoronix.com · #tool #gpu #llvm #rust #safety
В r/LocalLLaMA сообщили о playable world model в стиле Genie, которая работает на одной RTX 5090 в 19 GB VRAM и держит 720p при 16 FPS. Подробностей о модели, весах и способе запуска нет.
www.reddit.com · #ai #ai #gpu #world-model
Новый компонент ROCm — Spur, написан на Rust, поддерживает WireGuard mesh, GPU-first scheduling и совместим с Slurm CLI. AMD заявляет о работе с кластерами из тысяч GPU. Код под Apache 2.0 на GitHub.
www.phoronix.com · #ai #ai #gpu #rust #scheduling
Инструмент Soup позволяет дообучать LLM из одного YAML-файла. Layer streaming держит замороженную базу вне VRAM и подаёт в GPU по одному декодерному слою. На RTX 3050 4GB: Llama-3.1-8B-Instruct + NF4 — 119.6 tok/s, пик 3.32 GB. Поддерживает SFT, DPO, QLoRA, GGUF.
github.com · #ai #gpu #llm #show-hn
AirLLM ужимает потребление памяти так, что 70B-модели запускаются на одной видеокарте с 4 ГБ, а 405B Llama 3.1 — на 8 ГБ, DeepSeek-V3 (671B) — на ~12 ГБ, а разреженная MoE-модель Kimi K3 (2.8T) — вообще на <4 ГБ. Секрет в том, что данные не сжимаются, а стримятся: вместо целого слоя передаётся один эксперт за раз.
github.com · #ai #ai #gpu #inference #llm
GEM — foundation-модель для рекламы в Instagram и Facebook — теперь тренируется на тысячах GPU и достигла 20–25% MFU (Model FLOPs Utilization) при четырёхкратном росте FLOPs за год. Для этого пришлось изобрести собственные ядра (Jagged Flash Attention, GDPA, BlockAttention), смешанную точность MXFP8 и 5D-параллелизм с учётом топологии сети Meta.
engineering.fb.com · #ai #gpu #llm #meta #training
На Reddit обсуждают китайский чип DFSX, который, по заявлению, предлагает вдвое большую пропускную способность памяти по сравнению с NVIDIA GB200. Подробностей о чипе и тестах в посте нет.
www.reddit.com · #hardware #bandwidth #gpu #hardware
По данным источников, Nvidia ожидается повышение цен на видеокарты GeForce RTX до 30%. Подробности о причинах и сроках не сообщаются.
www.reddit.com · #hardware #gpu #market #nvidia #pricing
Проект slurpjson на Rust использует wgpu compute shaders для разбора JSON. Парсинг сводится к параллельным префиксным сканам, создавая плоскую ленту структурных символов. Работа основана на идеях Raph Levien о "invitingly parallel" проблемах.
github.com · #tool #gpu #json #performance #shaders
AMD на своём мероприятии тысячу раз сказала «AI», но вторым по частоте было «open». Платформа Kria открывает схемы и RTL FPGA для робототехники. Сетевой стек Helios строится на SONiC, EPYC 9006 Venice использует OpenBMC, OpenSIL на Zen 6 достигает production. Контраст с прошлогодним Intel налицо.
www.phoronix.com · #hardware #ai #amd #gpu
Новый ускоритель Instinct MI455X выполнен по техпроцессу 2 нм, оснащён 432 ГБ HBM4 и обещает до 4-кратного прироста в MXFP8/MXFP4 по сравнению с MI355X. Платформа Helios объединяет EPYC Venice, MI455X и сетевые решения Pensando: 4600 CPU-ядер и 18000 GPU-вычислительных блоков на стойку. Поставки начнутся в конце квартала, MI500 series запланирован на 2027 год, MI600 — на 2028.
www.phoronix.com · #hardware #ai #amd #datacenter #gpu
Xiaomi опубликовала разбор оптимизаций инференса для серии MiMo-V2.5 и называет это full-pipeline optimization. Само по себе это обычно означает скучную, но полезную работу: где-то подрезали latency, где-то лучше распараллелили этапы, где-то выжали лишние проценты из движка, чтобы модель меньше ела железо и больше отрабатывала запросы.
mimo.xiaomi.com · #ai #device #gpu #inference #optimization #xiaomi
Набор патчей для Linux DRM scheduler показывает сильное падение latency при submission job, когда система забита runnable CPU-процессами. Это тот редкий случай, когда графический стек и планировщик начинают бодаться за время процессора, а итогом становится не «плавнее картинка», а просто меньшее ожидание на submit.
www.phoronix.com · #infra #drm #gpu #kernel #linux #scheduler
На GitHub лежит большой практический гайд по запуску современных LLM на своей машине — не статья в духе «всё работает», а набор конкретных инструкций и трюков от jamesob. Репозиторий собрал 305 пунктов на HN, так что людей, видимо, давно мучает вопрос, как жить без чужого API и без лишних счетов за токены.
github.com · #ai #gpu #guide #inference #llm #local
В PDF из DeepSeek описан DSpark — схема speculative decoding, которую авторы подают как способ ускорить inference больших языковых моделей. Пост на HN собрал 742 очка и 310 комментариев, так что все уже по привычке спорят, где там реальное ускорение, а где очередная красивая математика в презентации.
github.com · #ai #gpu #inference #llm #paper #speculative-decoding
Phoronix сообщает, что для ранних AMD Radeon GCN идут улучшения recovery-механизма после GPU hang. Работу ведёт open-source команда Valve по Linux-графике — то есть не просто «драйверная уборка», а конкретная попытка сделать старые карты менее хрупкими в реальной жизни. Хороший пример того, как умирающее железо ещё поживёт, если его регулярно вытаскивают с того света.
www.phoronix.com · #infra #amd #gpu #linux #radeon #valve
В версии 10.8 для open-source Lemonade AI Server появилась интеграция с MCP Server. Сервер, как и раньше, рассчитан на запуск локальных AI-вычислений на Windows и Linux через Ryzen AI NPU, Radeon GPU и обычные x86_64 CPU — то есть это попытка сделать «приватный ИИ» без обязательного похода в облако.
www.phoronix.com · #ai #ai #gpu #mcp #server
Phoronix прогнал Intel Core Ultra X7 358H Panther Lake на Linux 7.0 и свежем stable Linux 7.1, отдельно смотря на CPU и iGPU. Повод вполне приземлённый: после прошлых тестов Arc B580 и Arc Pro B70 читатели спросили, не подтянулись ли и новые Xe3-графики — ну вот, теперь есть цифры, а не вера в лучшее.
www.phoronix.com · #infra #gpu #intel #linux #performance
Моноблок, который обычно ассоциируется с экономией места, здесь превратили в витрину для десктопного железа: Ryzen 9 9900X и RTX 5080 внутри. Получилось ровно то, что и обещает заголовок: не тонкий офисный комбайн, а большой вопрос к смыслу форм-фактора, если в него пихают почти весь топовый ПК.
habr.com · #hardware #gpu #habr #pc #ryzen
Phoronix заранее перечисляет, что может попасть в Linux 7.2: поддержка Apple M3, начальная AMDGPU HDMI 2.1 FRL, USB4STREAM и cache-aware scheduling. Это именно такой список, где половина радости — в аббревиатурах, а половина — в том, что кто-то еще продолжает втачивать железо в ядро по кусочкам. Stable 7.1 еще не вышел, а народ уже спорит о следующем окне слияния.
www.phoronix.com · #infra #amd #gpu #kernel #linux #usb4
Phoronix пишет, что в Mesa 26.2 готовят поддержку GFX1156 — это уже пост-Strix-Halo RDNA 3.5, а не очередная мелкая правка. В связке идут и другие новые IP-блоки: SDMA 6.4, NBIO 7.11.5, IH 6.4, HDP 6.4, MMHUB 3.4.2, SMU 15.0.5, ATHUB 3.4.2 и VPE 2.2.
www.phoronix.com · #infra #amd #gpu #linux #mesa
Phoronix сравнил Intel Arc Pro B70 между Linux 7.0 и почти финальным Linux 7.1. Автор увидел несколько улучшений производительности на новой версии ядра — приятный сюжет для тех, кто покупает workstation-видюху и потом ждёт, пока Linux догонит железо.
www.phoronix.com · #hardware #benchmarks #gpu #intel #linux
Phoronix сравнил Intel Arc B580 на текущем Linux 7.0 и грядущем 7.1 и увидел более высокую производительность на новой ветке ядра. Речь именно о Battlemage desktop card, а не о каких-то абстрактных «улучшениях драйверов»: тесты показывают, что обновление ядра уже сейчас меняет цифры на графиках.
www.phoronix.com · #infra #gpu #intel #kernel #linux #performance
В Firefox смержили начальную поддержку Vulkan Video, то есть браузер теперь может использовать GPU-ускоренное декодирование через этот API. Пока это только первый шаг, но сам факт, что декодирование видео в вебе снова двигают в сторону Vulkan, уже звучит как работа для людей, которые любят страдать с драйверами.
www.phoronix.com · #infra #browser #firefox #gpu #video-decoding #vulkan
Ars пишет про новую Gemma 4 12B от Google: модель заточили под запуск на обычном ноутбуке с 16 ГБ памяти. Внутри у неё новый encoding scheme и token prediction — то есть не просто «меньше параметров», а попытка выжать больше из того же железа.
arstechnica.com · #ai #gemma #gpu #inference #llm
Автор GitHub-проекта предлагает использовать видеопамять NVIDIA как swap-space в Linux. Идея не из серии «запустим LLM на тостере»: по сути это NBD-обвязка, которая выдает VRAM наружу как блочное устройство, чтобы ядро могло туда вытеснять страницы. На HN у репозитория уже 198 очков и 57 комментариев — народ, разумеется, сразу начал мерить, где это сломается первым.
github.com · #tool #github #gpu #linux #nvidia #swap
Phoronix отдельно протестировал Intel Arc Pro B70 BMG-G31 под Linux в игровых сценариях, хотя карта вообще-то не для этого. В серии тестов уже были OpenCL, Vulkan, Level Zero и даже конфигурации до четырёх карт — в общем, скучно железке не дали.
www.phoronix.com · #infra #benchmark #gpu #intel-arc #linux
В CUDA 13.3 завезли CUDA Python 1.0 и поддержку CUDA Tile for C++, то есть NVIDIA продолжает обвешивать свой стек еще одной прослойкой абстракций. Phoronix пишет, что это очередной шаг в unified GPU programming stack — формулировка, за которой обычно прячется мысль: «держитесь, сейчас будет ещё сложнее».
www.phoronix.com · #hardware #cuda #gpu #nvidia #python
Проект low_latency_layer — это open-source Vulkan layer, который обещает дать AMD Anti-Lag 2 и NVIDIA Reflex 2 на Linux в более-менее аппаратно-агностичном виде. В Phoronix пишут, что слой должен работать и с AMD, и с Intel GPU, то есть идея не привязана к одному вендору и его маркетинговым фокусам. Если оно действительно заведётся, это будет не очередной «ускоритель всего», а полезная прослойка для уменьшения input latency.
www.phoronix.com · #hardware #gpu #latency #linux #reflex #vulkan
AMD выпустила ROCm 7.13 как свежий preview SDK в дороге к тому, что позже, вероятно, назовут ROCm 8.0. Из заметного — поддержка Instinct MI350P и ещё нескольких Ryzen AI APU; то есть стек для GPU/AI у AMD продолжает обрастать железом быстрее, чем документацией.
www.phoronix.com · #hardware #amd #gpu #mi350p #rocm #ryzen