📰 IT Дайджест

#benchmarks

17 материалов

9. API-бенчмарки завышают результаты чат-интерфейсов на 3,4 п.п.

Аудит ChatGPT, Claude и Gemini по семи системам и девяти бенчмаркам показал, что API-оценки в среднем на 3,4 п.п. выше по точности и на 2,1 п.п. выше по согласованности, чем оценки через интерфейс. У ChatGPT разрыв между API и интерфейсом больше, чем разница между GPT 5.3 и GPT 5.4 через API. Изменение системных промптов, параметров сэмплинга и reasoning не убирает разрыв.

tldr.takara.ai · #ai #benchmarks #chatbot #evaluation #llm

6. Grok 4.6 догнал лидеров за месяц

Модель xAI набрала 61 балл в AA Intelligence Index, сравнявшись с GPT-5.6 Sol и отставая на один балл от Claude Fable 5. Прирост — 5 баллов за месяц, а цена задачи $0,84 ставит её на границу Парето.

habr.com · #ai #benchmarks #grok #llm

12. Claude Fable 5 разгромил GPT-5.6 Sol на бенчмарке переписывания программ — 64% против 20%

Epoch AI обновила лидерборд MirrorCode: Claude Fable 5 решил 64% задач, GPT-5.6 Sol — 20%. Разрыв втрое объясняется не разницей в умении, а в надёжности: Fable доводит до конца почти все попытки, а Sol проваливает краевые случаи. Особенно показательно, что Fable почти не теряет в точности на редком языке Ada, что говорит о навыке, а не запоминании тестов.

habr.com · #ai #anthropic #benchmarks #llm #openai

11. Дайджест open-weight моделей: Inkling (975B), Hy3 от Tencent, Kimi K3 и Laguna S2.1

Очередной обзор открытых моделей. Thinking Machines выпустила Inkling — 975B-параметровую MoE (мультимодальную). Tencent открыла Hy3 (295B) под лицензией Apache 2.0. Poolside представила Laguna-S-2.1 (118B) под OpenMDW. Moonshot выложила Kimi K3 с некоммерческой лицензией, требующей контракта для коммерческого использования.

www.interconnects.ai · #ai #benchmarks #llm #open-source

2. Два API-параметра утроили счёт GPT-5.6 на ARC-AGI-3

OpenAI показала, что включение двух настроек API — удержание режима рассуждений (reasoning) и включение компактизации (compaction) — позволило GPT-5.6 поднять результат на тесте абстрактного мышления ARC-AGI-3 втрое. Подробности того, как именно это работает, — в блоге компании.

openai.com · #ai #benchmarks #openai #reasoning

10. Claude Opus 5 обходит Fable 5 в независимом рейтинге Artificial Analysis

Anthropic выпустила Claude Opus 5 — вдвое дешевле Fable 5 и сразу доступна всем. В индексе Artificial Analysis (61 балл) она на один балл обходит Fable 5 (60) и GPT-5.6 Sol (59). На ARC-AGI-3 — 30,2% против 7,8% у GPT-5.6 Sol, хотя бенчмарк мог быть известен до окончания обучения. Контекст — 1 млн токенов, вывод — до 128 тыс.

habr.com · #ai #benchmarks #claude #llm

5. MirrorCode: ИИ переписывает программы за часы и доллары, а Anthropic ускоряет роботов в 20 раз

Бенчмарк MirrorCode от Epoch и METR: Opus 4.7 за 14 часов и $251 переписал gotree (16k строк) с нуля по CLI-доступу. Anthropic показал, что Claude Opus 4.1 ускорил выполнение роботизированных задач в 20 раз по сравнению с человеческим рекордом (181 минута без ИИ).

jack-clark.net · #ai #agents #benchmarks #openai #robotics

4. KDE Plasma 6.7: замерили игры в X11 и Wayland на NVIDIA под CachyOS

Phoronix сравнил игровые бенчмарки X11 и Wayland-сессий в Plasma 6.7.2 на NVIDIA под CachyOS. Это полезнее очередного «Wayland готов», потому что здесь есть конкретная машина, конкретная связка дистрибутива и драйвера, и можно посмотреть, где именно все еще проседает. А еще это напоминание, что X11 пока окончательно не отпустили, несмотря на все планы.

www.phoronix.com · #infra #benchmarks #linux #nvidia #wayland

12. Почему single-channel DDR5 режет производительность на Intel Core Ultra 7 270K

Phoronix сравнил single- и dual-channel память на Intel Core Ultra 7 270K, потому что нынешние цены на ОЗУ заставляют людей думать о сборке с одной планкой DDR5 «пока не подешевеет». Тесты как раз нужны, чтобы понять, насколько сильно такая экономия бьёт по реальной скорости, а не по ощущениям из чата сборщиков.

www.phoronix.com · #hardware #benchmarks #ddr5 #intel #memory #performance

2. Semgrep сравнил GLM 5.2 с Claude в своих cyber-бенчмарках

Semgrep опубликовал пост с результатами собственных бенчмарков: GLM 5.2 у них обошёл Claude в задачах по кибербезопасности. Публикация собрала 612 очков на HN и 298 комментариев — то есть это не тихий внутренний отчёт, а очередной повод спорить, насколько вообще честны такие сравнения.

semgrep.dev · #ai #benchmarks #cyber #llm #semgrep

2. NVIDIA сравнили Vera CPU и GB10 по производительности на ядро

Phoronix продолжает раскладывать по полочкам железки NVIDIA: на этот раз — сравнение Vera CPU и GB10. В статье не абстрактные «быстрее/медленнее», а именно per-core performance, то есть пригодно для вечной боли про ARM-серверы и их реальную полезность вне маркетинга.

www.phoronix.com · #hardware #arm #benchmarks #cpu #nvidia #vera

6. В ядре ищут защиту: allocation tokens и bootpatch-SLR

LWN пишет про попытки усложнить жизнь эксплойтам в Linux kernel через allocation tokens и bootpatch-SLR. Смысл тут приземлённый: даже если баги в ядре полностью не исчезнут, их хотят сделать заметно дороже в эксплуатации.

lwn.net · #infra #benchmarks #kernel #linux #performance #raspberrypi

10. Linux 7.1 подтянул Intel Arc Pro B70

Phoronix сравнил Intel Arc Pro B70 между Linux 7.0 и почти финальным Linux 7.1. Автор увидел несколько улучшений производительности на новой версии ядра — приятный сюжет для тех, кто покупает workstation-видюху и потом ждёт, пока Linux догонит железо.

www.phoronix.com · #hardware #benchmarks #gpu #intel #linux

11. RISC-V за пять лет: от HiFive Unmatched до SpacemiT K3

Phoronix сравнил пятилетнюю динамику RISC-V и показал прирост производительности примерно в 8 раз: от SiFive HiFive Unmatched до SpacemiT K3. В замерах рядом с K3 мелькают Intel Core Ultra, AMD Ryzen, Raspberry Pi 5 и Loongson 3B6000 — то есть это не фанатский тепличный тест, а попытка поставить RISC-V рядом с реальными конкурентами.

www.phoronix.com · #hardware #benchmarks #cpu #risc-v #sifive

10. io_uring без розовых очков: на HTTP почти не быстрее epoll

Автор честно пишет, что на HTTP keep-alive разница с epoll часто составляет 0–15%, а иногда io_uring даже проигрывает. Зато на NVMe при queue depth 128 получился прирост в 3 раза; в статье также разбираются SQPOLL, cancel race, partial recv и почему Google вообще отключил io_uring в части своего C-стека.

habr.com · #infra #benchmarks #epoll #io-uring #linux #nvme

7. Hugging Face без шума: подобрать локальную LLM под своё железо теперь можно по бенчмаркам

В show HN выложили репозиторий whichllm — проект ранжирует локальные LLM по бенчмаркам, чтобы не гадать, влезет ли модель в вашу видеокарту или устроит ли она слайд-шоу на CPU. Судя по интересу на HN, людям надоело подбирать модель методом «поставил, запустил, увидел 0.8 токена/сек и ушёл пить чай».

github.com · #ai #benchmarks #llm #local #show-hn

2. Подбор локальной LLM по железу: GitHub-проект WhichLLM ранжирует модели бенчмарками

Show HN про репозиторий Andyyyy64/whichllm, который помогает выбрать локальную LLM под конкретный компьютер. В описании прямо обещают ранжирование по бенчмаркам, то есть без гадания на кофейной гуще и чатов про «а потянет ли мой ноут 70B».

github.com · #ai #benchmarks #hardware #llm #local-llm #show-hn