📰 IT Дайджест

#benchmark

17 материалов

12. Вышел Real-SWE: бенчмарк для ИИ на реальных корпоративных кодовых базах

Бенчмарк содержит задачи из приватных продакшн-репозиториев c реальными бизнес-правилами (расчёт налогов, миграции). Лучший результат у Claude Fable 5.1 + Claude Code — 38.8% resolution rate. GPT-6 Astra с Codex CLI набрал 33.8%, Gemini 3.8 Flash — 31.2%. Ни одна модель не превышает 40%.

withspecific.com · #ai #benchmark #enterprise #llm #swe

15. InfoOps Bench: бенчмарк для проверки LLM на устойчивость к госинформационным операциям

Бенчмарк использует более 2100 информационных операций из live-мониторинга российских, китайских и иранских государственных ресурсов. Протестированы 17 моделей от 8 провайдеров: уровень отказов (integrity score) варьируется от 8.8% до 94.5%. Китайские модели (кроме GLM 5.2) резко снижают compliance на фактические, но критичные для Китая запросы — падение на 48–70 процентных пунктов.

tldr.takara.ai · #security #benchmark #info-ops #safety

2. Kimi K3: 2,8 трлн параметров и обещание выложить веса до 27 июля

Moonshot AI показала Kimi K3 и называет его своей самой мощной моделью — 2,8 трлн параметров, если верить их округлениям до «3T-class». Модель уже доступна через сайт и API, а open-weight релиз обещают до 27 июля 2026 года; на фоне DeepSeek это уже соревнование не в качестве ответов, а в размере таблички с параметрами.

simonwillison.net · #ai #api #benchmark #llm #open-weights #parameters

6. Ryzen 7 7700X3D вышел в продажу: 8 ядер, 104 МБ кэша и $329

Phoronix посмотрел на Linux-производительность AMD Ryzen 7 7700X3D — нового самого дешёвого 3D V-Cache процессора для геймеров. У чипа 8 ядер, 16 потоков, boost до 4,5 ГГц, суммарно 104 МБ кэша и цена около $329; интересно, насколько «игровой» он окажется вне рекламных слайдов и внутри реальных Linux-бенчмарков.

www.phoronix.com · #hardware #amd #benchmark #cpu #linux #ryzen

10. Bonsai 27B запускается на телефоне

PrismML хвастается моделью Bonsai 27B, которую, по их словам, можно гонять прямо на смартфоне. Число 27B тут важнее всего: это уже не игрушка на пару миллиардов параметров, а вполне тяжёлый зверь, который обычно ждёшь увидеть на сервере, а не в кармане. Любопытно не то, что «можно», а сколько компромиссов пришлось сделать, чтобы это вообще жило.

prismml.com · #ai #benchmark #inference #llm #mobile

3. Apple SpeechAnalyzer сравнили с Whisper и старым API

В бенчмарке авторы гоняли новый SpeechAnalyzer API от Apple против Whisper и его предшественника. Судя по HN-шумихе, там не просто «посмотрите, у нас тоже есть STT», а попытка понять, насколько новый стек реально тянет на фоне уже обжитых решений.

get-inscribe.com · #ai #apple #benchmark #speech #whisper

7. Graviton5 уже обгоняет Xeon Granite Rapids, но до EPYC Turin не дотягивает

Phoronix прогнал бенчмарки новых AWS Graviton5 и сравнил их с Graviton4, Intel Xeon Granite Rapids и AMD EPYC Turin. У AWS тут Neoverse-V3 вместо Neoverse-V2 и память DDR5-8800 вместо DDR5-5600, так что прирост не из воздуха, а из довольно конкретной смены платформы.

www.phoronix.com · #hardware #arm #aws #benchmark #cpu #graviton

7. Clojure почти догоняет C, если правильно попросить

На Lobsters обсуждают пост, где Clojure подводят очень близко к C по скорости — но, разумеется, не бесплатно и не магией. Такие разборы обычно интересны не лозунгом «языки теперь одинаковые», а тем, какие именно трюки с компиляцией, аллокациями и типами пришлось применить, чтобы не стыдно было показывать бенчмарк.

ertu.dev · #other #benchmark #clojure #jvm #performance

8. WebScan v2.0: из песочницы Хабра до pip install за неделю

Автор рассказывает, как за неделю довел WebScan до версии 2.0 и упаковал проект в pip install. Внутри обещаны путь от идеи, ошибки и бенчмарк — то есть не маркетинговый «вот вам тулза», а нормальная разработческая кухня с тем, где именно всё сломалось и что пришлось переделать.

habr.com · #tool #benchmark #pip #python #web #webscan

4. DeepSeek V4 Pro обошёл GPT-5.5 Pro по точности

На runtimewire пишут, что DeepSeek V4 Pro показал лучшую precision, чем GPT-5.5 Pro. Деталей по методике в карточке мало, но сам факт сравнения двух топовых моделей уже собрал 164 балла на HN и 48 комментариев — народ, как всегда, готов спорить по любому бенчмарку.

runtimewire.com · #ai #benchmark #deepseek #gpt #llm #precision

7. Эстонский бенчмарк сравнил LLM по устойчивости к российской пропаганде

Ars Technica пишет про тест, который эстонское правительство устроило десяткам моделей: насколько они умеют сопротивляться российским «strategic narratives». Деталей тут ровно столько, чтобы стало любопытно, какие модели сливаются на манипуляциях, а какие хотя бы не разваливаются после пары аккуратных нарративов.

arstechnica.com · #ai #benchmark #llm #propaganda

8. CachyOS прогнал BORE scheduler через бенчмарки

Phoronix отдельно разобрал производительность BORE scheduler в CachyOS Linux. Ранее у них уже были замеры других flavor'ов ядра, а здесь автор специально добрался до BORE, потому что читатели попросили посмотреть, что он дает на практике, а не в релизных обещаниях.

www.phoronix.com · #infra #benchmark #linux #scheduler

14. Intel Arc Pro B70 на Linux: Phoronix погонял его в играх

Phoronix отдельно протестировал Intel Arc Pro B70 BMG-G31 под Linux в игровых сценариях, хотя карта вообще-то не для этого. В серии тестов уже были OpenCL, Vulkan, Level Zero и даже конфигурации до четырёх карт — в общем, скучно железке не дали.

www.phoronix.com · #infra #benchmark #gpu #intel-arc #linux

11. На стенде по computer vision обещают 86% точности на десятках картинок

Авторы Habr-поста пишут про стенд, где модели учатся буквально на десятках изображений вместо тысяч и при этом показывают не меньше 86% точности. Отдельно они утверждают, что решение обходит YOLO и не требует GPU-кластеров — звучит как отличный повод проверить, где там заканчивается инженерия и начинается маркетинг.

habr.com · #ai #benchmark #computer-vision #ml #stand