#benchmark
17 материалов
Бенчмарк содержит задачи из приватных продакшн-репозиториев c реальными бизнес-правилами (расчёт налогов, миграции). Лучший результат у Claude Fable 5.1 + Claude Code — 38.8% resolution rate. GPT-6 Astra с Codex CLI набрал 33.8%, Gemini 3.8 Flash — 31.2%. Ни одна модель не превышает 40%.
withspecific.com · #ai #benchmark #enterprise #llm #swe
Автор собрал все известные бенчмарки для LLM-кодинга и посчитал их 'плотность интеллекта'. Детали не раскрыты — только заголовок.
www.reddit.com · #ai #benchmark #coding #llm
Модель NVIDIA AVO завершила все 183 уровня в 25 публичных средах ARC-AGI-3, разобравшись, что делать, без инструкций и явных целей. Детали не раскрыты — известно только это.
www.reddit.com · #ai #agi #benchmark #nvidia
FAR.AI представил версию 1.0 стандарта безопасности для frontier-моделей. В методологию входит таксономия статических джейлбрейков и метод их композиции для оценки защищённости.
tldr.takara.ai · #security #ai #benchmark #safety #security
Бенчмарк использует более 2100 информационных операций из live-мониторинга российских, китайских и иранских государственных ресурсов. Протестированы 17 моделей от 8 провайдеров: уровень отказов (integrity score) варьируется от 8.8% до 94.5%. Китайские модели (кроме GLM 5.2) резко снижают compliance на фактические, но критичные для Китая запросы — падение на 48–70 процентных пунктов.
tldr.takara.ai · #security #benchmark #info-ops #safety
Moonshot AI показала Kimi K3 и называет его своей самой мощной моделью — 2,8 трлн параметров, если верить их округлениям до «3T-class». Модель уже доступна через сайт и API, а open-weight релиз обещают до 27 июля 2026 года; на фоне DeepSeek это уже соревнование не в качестве ответов, а в размере таблички с параметрами.
simonwillison.net · #ai #api #benchmark #llm #open-weights #parameters
Phoronix посмотрел на Linux-производительность AMD Ryzen 7 7700X3D — нового самого дешёвого 3D V-Cache процессора для геймеров. У чипа 8 ядер, 16 потоков, boost до 4,5 ГГц, суммарно 104 МБ кэша и цена около $329; интересно, насколько «игровой» он окажется вне рекламных слайдов и внутри реальных Linux-бенчмарков.
www.phoronix.com · #hardware #amd #benchmark #cpu #linux #ryzen
PrismML хвастается моделью Bonsai 27B, которую, по их словам, можно гонять прямо на смартфоне. Число 27B тут важнее всего: это уже не игрушка на пару миллиардов параметров, а вполне тяжёлый зверь, который обычно ждёшь увидеть на сервере, а не в кармане. Любопытно не то, что «можно», а сколько компромиссов пришлось сделать, чтобы это вообще жило.
prismml.com · #ai #benchmark #inference #llm #mobile
В бенчмарке авторы гоняли новый SpeechAnalyzer API от Apple против Whisper и его предшественника. Судя по HN-шумихе, там не просто «посмотрите, у нас тоже есть STT», а попытка понять, насколько новый стек реально тянет на фоне уже обжитых решений.
get-inscribe.com · #ai #apple #benchmark #speech #whisper
Phoronix прогнал бенчмарки новых AWS Graviton5 и сравнил их с Graviton4, Intel Xeon Granite Rapids и AMD EPYC Turin. У AWS тут Neoverse-V3 вместо Neoverse-V2 и память DDR5-8800 вместо DDR5-5600, так что прирост не из воздуха, а из довольно конкретной смены платформы.
www.phoronix.com · #hardware #arm #aws #benchmark #cpu #graviton
На Lobsters обсуждают пост, где Clojure подводят очень близко к C по скорости — но, разумеется, не бесплатно и не магией. Такие разборы обычно интересны не лозунгом «языки теперь одинаковые», а тем, какие именно трюки с компиляцией, аллокациями и типами пришлось применить, чтобы не стыдно было показывать бенчмарк.
ertu.dev · #other #benchmark #clojure #jvm #performance
Автор рассказывает, как за неделю довел WebScan до версии 2.0 и упаковал проект в pip install. Внутри обещаны путь от идеи, ошибки и бенчмарк — то есть не маркетинговый «вот вам тулза», а нормальная разработческая кухня с тем, где именно всё сломалось и что пришлось переделать.
habr.com · #tool #benchmark #pip #python #web #webscan
На runtimewire пишут, что DeepSeek V4 Pro показал лучшую precision, чем GPT-5.5 Pro. Деталей по методике в карточке мало, но сам факт сравнения двух топовых моделей уже собрал 164 балла на HN и 48 комментариев — народ, как всегда, готов спорить по любому бенчмарку.
runtimewire.com · #ai #benchmark #deepseek #gpt #llm #precision
Ars Technica пишет про тест, который эстонское правительство устроило десяткам моделей: насколько они умеют сопротивляться российским «strategic narratives». Деталей тут ровно столько, чтобы стало любопытно, какие модели сливаются на манипуляциях, а какие хотя бы не разваливаются после пары аккуратных нарративов.
arstechnica.com · #ai #benchmark #llm #propaganda
Phoronix отдельно разобрал производительность BORE scheduler в CachyOS Linux. Ранее у них уже были замеры других flavor'ов ядра, а здесь автор специально добрался до BORE, потому что читатели попросили посмотреть, что он дает на практике, а не в релизных обещаниях.
www.phoronix.com · #infra #benchmark #linux #scheduler
Phoronix отдельно протестировал Intel Arc Pro B70 BMG-G31 под Linux в игровых сценариях, хотя карта вообще-то не для этого. В серии тестов уже были OpenCL, Vulkan, Level Zero и даже конфигурации до четырёх карт — в общем, скучно железке не дали.
www.phoronix.com · #infra #benchmark #gpu #intel-arc #linux
Авторы Habr-поста пишут про стенд, где модели учатся буквально на десятках изображений вместо тысяч и при этом показывают не меньше 86% точности. Отдельно они утверждают, что решение обходит YOLO и не требует GPU-кластеров — звучит как отличный повод проверить, где там заканчивается инженерия и начинается маркетинг.
habr.com · #ai #benchmark #computer-vision #ml #stand