#benchmarks
17 материалов
Аудит ChatGPT, Claude и Gemini по семи системам и девяти бенчмаркам показал, что API-оценки в среднем на 3,4 п.п. выше по точности и на 2,1 п.п. выше по согласованности, чем оценки через интерфейс. У ChatGPT разрыв между API и интерфейсом больше, чем разница между GPT 5.3 и GPT 5.4 через API. Изменение системных промптов, параметров сэмплинга и reasoning не убирает разрыв.
tldr.takara.ai · #ai #benchmarks #chatbot #evaluation #llm
Модель xAI набрала 61 балл в AA Intelligence Index, сравнявшись с GPT-5.6 Sol и отставая на один балл от Claude Fable 5. Прирост — 5 баллов за месяц, а цена задачи $0,84 ставит её на границу Парето.
habr.com · #ai #benchmarks #grok #llm
Epoch AI обновила лидерборд MirrorCode: Claude Fable 5 решил 64% задач, GPT-5.6 Sol — 20%. Разрыв втрое объясняется не разницей в умении, а в надёжности: Fable доводит до конца почти все попытки, а Sol проваливает краевые случаи. Особенно показательно, что Fable почти не теряет в точности на редком языке Ada, что говорит о навыке, а не запоминании тестов.
habr.com · #ai #anthropic #benchmarks #llm #openai
Очередной обзор открытых моделей. Thinking Machines выпустила Inkling — 975B-параметровую MoE (мультимодальную). Tencent открыла Hy3 (295B) под лицензией Apache 2.0. Poolside представила Laguna-S-2.1 (118B) под OpenMDW. Moonshot выложила Kimi K3 с некоммерческой лицензией, требующей контракта для коммерческого использования.
www.interconnects.ai · #ai #benchmarks #llm #open-source
OpenAI показала, что включение двух настроек API — удержание режима рассуждений (reasoning) и включение компактизации (compaction) — позволило GPT-5.6 поднять результат на тесте абстрактного мышления ARC-AGI-3 втрое. Подробности того, как именно это работает, — в блоге компании.
openai.com · #ai #benchmarks #openai #reasoning
Anthropic выпустила Claude Opus 5 — вдвое дешевле Fable 5 и сразу доступна всем. В индексе Artificial Analysis (61 балл) она на один балл обходит Fable 5 (60) и GPT-5.6 Sol (59). На ARC-AGI-3 — 30,2% против 7,8% у GPT-5.6 Sol, хотя бенчмарк мог быть известен до окончания обучения. Контекст — 1 млн токенов, вывод — до 128 тыс.
habr.com · #ai #benchmarks #claude #llm
Бенчмарк MirrorCode от Epoch и METR: Opus 4.7 за 14 часов и $251 переписал gotree (16k строк) с нуля по CLI-доступу. Anthropic показал, что Claude Opus 4.1 ускорил выполнение роботизированных задач в 20 раз по сравнению с человеческим рекордом (181 минута без ИИ).
jack-clark.net · #ai #agents #benchmarks #openai #robotics
Phoronix сравнил игровые бенчмарки X11 и Wayland-сессий в Plasma 6.7.2 на NVIDIA под CachyOS. Это полезнее очередного «Wayland готов», потому что здесь есть конкретная машина, конкретная связка дистрибутива и драйвера, и можно посмотреть, где именно все еще проседает. А еще это напоминание, что X11 пока окончательно не отпустили, несмотря на все планы.
www.phoronix.com · #infra #benchmarks #linux #nvidia #wayland
Phoronix сравнил single- и dual-channel память на Intel Core Ultra 7 270K, потому что нынешние цены на ОЗУ заставляют людей думать о сборке с одной планкой DDR5 «пока не подешевеет». Тесты как раз нужны, чтобы понять, насколько сильно такая экономия бьёт по реальной скорости, а не по ощущениям из чата сборщиков.
www.phoronix.com · #hardware #benchmarks #ddr5 #intel #memory #performance
Semgrep опубликовал пост с результатами собственных бенчмарков: GLM 5.2 у них обошёл Claude в задачах по кибербезопасности. Публикация собрала 612 очков на HN и 298 комментариев — то есть это не тихий внутренний отчёт, а очередной повод спорить, насколько вообще честны такие сравнения.
semgrep.dev · #ai #benchmarks #cyber #llm #semgrep
Phoronix продолжает раскладывать по полочкам железки NVIDIA: на этот раз — сравнение Vera CPU и GB10. В статье не абстрактные «быстрее/медленнее», а именно per-core performance, то есть пригодно для вечной боли про ARM-серверы и их реальную полезность вне маркетинга.
www.phoronix.com · #hardware #arm #benchmarks #cpu #nvidia #vera
LWN пишет про попытки усложнить жизнь эксплойтам в Linux kernel через allocation tokens и bootpatch-SLR. Смысл тут приземлённый: даже если баги в ядре полностью не исчезнут, их хотят сделать заметно дороже в эксплуатации.
lwn.net · #infra #benchmarks #kernel #linux #performance #raspberrypi
Phoronix сравнил Intel Arc Pro B70 между Linux 7.0 и почти финальным Linux 7.1. Автор увидел несколько улучшений производительности на новой версии ядра — приятный сюжет для тех, кто покупает workstation-видюху и потом ждёт, пока Linux догонит железо.
www.phoronix.com · #hardware #benchmarks #gpu #intel #linux
Phoronix сравнил пятилетнюю динамику RISC-V и показал прирост производительности примерно в 8 раз: от SiFive HiFive Unmatched до SpacemiT K3. В замерах рядом с K3 мелькают Intel Core Ultra, AMD Ryzen, Raspberry Pi 5 и Loongson 3B6000 — то есть это не фанатский тепличный тест, а попытка поставить RISC-V рядом с реальными конкурентами.
www.phoronix.com · #hardware #benchmarks #cpu #risc-v #sifive
Автор честно пишет, что на HTTP keep-alive разница с epoll часто составляет 0–15%, а иногда io_uring даже проигрывает. Зато на NVMe при queue depth 128 получился прирост в 3 раза; в статье также разбираются SQPOLL, cancel race, partial recv и почему Google вообще отключил io_uring в части своего C-стека.
habr.com · #infra #benchmarks #epoll #io-uring #linux #nvme
В show HN выложили репозиторий whichllm — проект ранжирует локальные LLM по бенчмаркам, чтобы не гадать, влезет ли модель в вашу видеокарту или устроит ли она слайд-шоу на CPU. Судя по интересу на HN, людям надоело подбирать модель методом «поставил, запустил, увидел 0.8 токена/сек и ушёл пить чай».
github.com · #ai #benchmarks #llm #local #show-hn
Show HN про репозиторий Andyyyy64/whichllm, который помогает выбрать локальную LLM под конкретный компьютер. В описании прямо обещают ранжирование по бенчмаркам, то есть без гадания на кофейной гуще и чатов про «а потянет ли мой ноут 70B».
github.com · #ai #benchmarks #hardware #llm #local-llm #show-hn