#llm
50 материалов
Бенчмарк содержит задачи из приватных продакшн-репозиториев c реальными бизнес-правилами (расчёт налогов, миграции). Лучший результат у Claude Fable 5.1 + Claude Code — 38.8% resolution rate. GPT-6 Astra с Codex CLI набрал 33.8%, Gemini 3.8 Flash — 31.2%. Ни одна модель не превышает 40%.
withspecific.com · #ai #benchmark #enterprise #llm #swe
Исследователи представили тест для измерения влияния RAG на безопасность ответов, разделяя задачу на 4 условия: без RAG, с oracle-документом, с релевантными и случайными документами. Результаты на 5 open-source LLM показали, что baseline guardrails не работают в RAG-сценарии, а даже безвредные документы провоцируют unsafe-генерацию.
tldr.takara.ai · #ai #llm #rag #safety #security
Модель SWE-2 набрала 50% на FrontierCode 1.1 Main, отстав от Fable 5.1 на один пункт, но будучи на 64% дешевле. Она построена поверх Kimi K33 (2.8 трлн параметров) и использует RL с линейным штрафом за стоимость. SWE-2 medium тратит на 58% меньше шагов и стоит на 81% дешевле SWE-1.7 при равном или лучшем результате.
cognition.com · #ai #cognition #llm #swe
В эксперименте v1.1 в reasoning-канал Qwen3.8 A95B подставляли первые 1% рассуждений GPT-5.5 Pro — совпадение с ответом учителя выросло на +18.18 п.п., особенно на STEM (+26.99 п.п.) и синтетических головоломках (+14.75 п.п.). Автор считает, что Qwen могла учиться у GPT-5.5 Pro или близкой модели, а не у Opus. Kimi K3 показала наибольшее перекрытие с GPT-5.5 Pro и без префилла (31.11%), но прирост от префилла всего +4.54 п.п.
gist.github.com · #ai #llm #qwen #reasoning
Аудит ChatGPT, Claude и Gemini по семи системам и девяти бенчмаркам показал, что API-оценки в среднем на 3,4 п.п. выше по точности и на 2,1 п.п. выше по согласованности, чем оценки через интерфейс. У ChatGPT разрыв между API и интерфейсом больше, чем разница между GPT 5.3 и GPT 5.4 через API. Изменение системных промптов, параметров сэмплинга и reasoning не убирает разрыв.
tldr.takara.ai · #ai #benchmarks #chatbot #evaluation #llm
Новая лицензия требует security review от Z.AI для сервисов с выручкой >$10 млрд за 12 месяцев. Неопределённость с термином «аффилированные лица» вызывает вопросы. В обзоре также Motif-3 (MIT), Hy4-preview от Tencent и другие модели.
www.interconnects.ai · #ai #ai #llm #open-source
Новая версия генерирует изображения быстрее, лучше следует инструкциям в многошаговых диалогах и сохраняет объекты из референсных фото. В API появились gpt-image-2.5-sunburst и gpt-image-2.5-flare. Sunburst — для точного редактирования, Flare — для быстрой генерации.
simonwillison.net · #ai #chatgpt #images #llm #openai
ARGODRIVE Deltafin запустил модель Kimi K3 на MacBook Pro: декодирование 1 токен/с при 512 токенах. Проблема: время до первого токена ~6.3 минуты из-за повторного чтения слоёв. Один SSD даёт 52% скорости от четырёх, два — 73%, три — 90%.
github.com · #ai #hardware #llm #optimization
20 января 2025 года DeepSeek выложила R1 под MIT-лицензией, а 27 января Nvidia рухнула на 17%, потеряв $589 млрд капитализации; Nasdaq просел примерно на 3%, весь рынок — около $1 трлн. Модель сделала дочерняя структура хедж-фонда High-Flyer из Ханчжоу на урезанных H800. Чтобы обойти ограничения, команда использовала MLA, DeepSeekMoE с 671 млрд параметров (активны 37 млрд), FP8-обучение и DualPipe.
habr.com · #ai #deepseek #llm #market
Саймон Уиллисон выпустил llm 0.35 — очередной релиз его инструмента для работы с LLM. Из анонса известно только одно: появилась поддержка новой модели OpenAI gpt-6-astra, то есть GPT-6 Astra. Остальные изменения не раскрыты.
simonwillison.net · #tool #cli #llm #openai
Брайан Кантрилл объясняет, почему посты, написанные LLM, сразу узнаваемы: эмодзи, односложные абзацы, тире. Такое письмо заставляет читателей сомневаться в подлинности автора. Призывает писать самим.
bcantrill.dtrace.org · #blog #ai #ethics #llm #writing
OpenRouter добавил в каталог новую модель OpenAI — GPT-6 Astra. Детали о цене, контекстном окне и производительности пока не раскрыты. API уже доступен для тестирования.
openrouter.ai · #ai #gpt6 #llm #openrouter
Исследователи аудировали предположение, что одна и та же LLM-модель возвращает одинаковые результаты. На 52 988 запросах Spearman согласие повторов в одном окне составило 0.40 (требовалось 0.90). Причины: смещение mapping-меток, шум на 7 порядков ниже сигнала и бит-идентичные входы с разными рангами. Смена провайдера не помогла.
tldr.takara.ai · #ai #ai #evaluation #llm #reliability
OpenAI запускает GPT-6 Astra по цене Claude Fable 5: $10/млн input, $50/млн output. Модель набирает 99.9% на ARC-AGI 3 через кастомный Provider Adapter harness (за $19K), но на стандартном — 62.7% за $26K. На ExploitBench — 100%, на SRE-Bench — 99.2% против 68.7% у Sol. Однако Artificial Analysis ставит Astra на 61 балл — ниже Fable 5.1 (66) и Muse Spark 1.3.
simonwillison.net · #ai #gpt-6 #llm #openai
Cerebras запустил Qwen 3.8 27B на публичных эндпоинтах со скоростью 1500 токенов/с. Модель не прунена — все веса оригинальные, только выборочная квантизация при хранении. Пруненные версии REAP доступны на Hugging Face, но не через API.
inference-docs.cerebras.ai · #ai #cerebras #inference #llm
FT разбирает, как рынок LLM перешёл от гонки бенчмарков к выбору дешёвых моделей. Fable 5, выпущенная в июне, спустя два месяца составляла лишь ~11% корпоративных расходов на Anthropic (данные Ramp). Клиенты предпочитают более дешёвые модели, если прирост качества не влияет на бизнес-результат.
habr.com · #ai #business #llm #strategy
Google DeepMind представил Gemini 3.8 Flash — третью Flash-модель за полтора месяца. Цена — $0.75 за миллион входных токенов, $3.75 за выходные. На бенчмарке DeepSWE v1.1 модель обходит более дорогие frontier-модели. Версия Flash Cyber через программу Fairwind ищет уязвимости на уровне frontier, но доступна только «доверенным защитникам».
blog.google · #ai #gemini #google #llm
По данным The Information, модель Astra (возможно GPT-6) использует recurrent depth: данные прогоняются через одни и те же слои несколько раз. Часть «мыслей» модели остаётся в числовых состояниях — их нельзя прочитать. OpenAI присвоила Astra уровень Critical по кибербезопасности: на ExploitBench 100%, найдены две zero-day в V8. Ирония: защита от злоупотреблений строится на чтении рассуждений, которые новая архитектура прячет.
habr.com · #ai #gpt6 #llm #openai
Инженеры GitHub выяснили, что укорачивание каждого ответа инструмента (RTK) ведёт к дополнительным запросам и росту затрат. Вместо этого внедрили выборочный компрессор: сохраняют вывод cat, git diff, grep, а шум сборки сжимают. Четыре изменения проверены на бенчмарках и в онлайне.
github.blog · #ai #copilot #github #llm #optimization
Claude Fable 5.1 стоит на 25% меньше предшественника на типовых нагрузках и до 45% меньше для агентных сценариев. Система безопасности стала реже блокировать легитимные запросы: в кибербезопасности ложных срабатываний стало на 60% меньше. Одновременно вышла Mythos 5.1 — та же модель с усиленными защитами, доступная только через доверенные программы.
www.anthropic.com · #ai #anthropic #claude #llm #release
Проект SlotStream транслирует веса 125B MoE-модели Qwen3.8-Flash-Next (104 ГБ в 4-битном формате) с SSD, позволяя запускать её на Mac с 48 ГБ памяти. На M5 Pro получено ~12 токенов/с при пиковом потреблении 32 ГБ. Бинарник написан на Swift, поддерживает API Ollama и OpenAI.
github.com · #ai #llm #mac #mlx #optimization
Новый метод аудита на основе многомерной IRT проанализировал 34 тыс. вопросов из 16 бенчмарков на 100 LLM. Выяснилось, что BBQ (тест на социальные стереотипы) сильнее коррелирует с общим reasoning, чем с безопасностью, а WMDP (опасные знания) тоже больше зависит от reasoning, причём сильные модели чаще отказываются отвечать.
huggingface.co · #ai #benchmarking #evaluation #llm
Автор проанализировал 40 сессий Claude Code и Codex (777 млн токенов). Выяснилось, что на каждый новый токен приходится 36–47 повторных пересылок старых. Свежий ввод — 0.003% у Claude и 5.7% у Codex. Стоимость растёт быстрее длины сессии: удвоение шагов даёт ×2.4 токенов.
habr.com · #ai #cost #llm #optimization #tokens
Автор представляет OGL-Mini — гибридную модель безопасности для AI-агентов, работающую на CPU. Разбирает векторы атак из OWASP LLM Top 10, включая промпт-инъекции и утечку системных промптов. Модель доступна в репозитории для TypeScript, Python и Go.
habr.com · #security #agents #ai #llm #security
Автор собрал все известные бенчмарки для LLM-кодинга и посчитал их 'плотность интеллекта'. Детали не раскрыты — только заголовок.
www.reddit.com · #ai #benchmark #coding #llm
Заявлена работа Qwen3.8-Flash-Next с контекстом 170K токенов на одной 96 ГБ видеокарте со скоростью около 110 токенов в секунду. Подробности не раскрыты.
www.reddit.com · #ai #gpu #inference #llm #qwen
Опубликованы новые модели: LongCat-Flash-Lite-Sparse с MTP и LSA, Qwen3.8-27B, Qwen3.5-122B-A10B, Qwen3-Coder-Next и Laguna-S2.1 с Vision. Все в GGUF. Также форки llama.cpp. Подробности не раскрыты.
www.reddit.com · #ai #gguf #llama.cpp #llm #models
Tencent выкатила открытую текстовую модель Hy4: 770B всего, 49B активных, окно в 1M токенов, веса 1.56 ТБ на Hugging Face. В трейсе рассуждений заметили урезанный английский — видимо, на скрытый текст грамматику не тратят. Два уровня reasoning effort: high и no_think; по умолчанию — high.
simonwillison.net · #ai #frontier #llm #tencent
Подробности не раскрыты. Статья описывает «load-bearing vocabulary» — набор ключевых токенов, которые критически влияют на поведение модели Claude.
louisabraham.github.io · #ai #claude #llm #prompting
GLM-5.3 стал open-weight, при этом базовая модель у него та же, что у GLM-5.2 — весь прирост пришёл из post-training. Авторы заявляют 50% улучшение на их внутреннем Z.ai Code Bench и первое место среди open-weights на публичных бенчмарках вроде Terminal Bench 3.0 и Agents' Last Exam. Отдельно они подчёркивают, что модель неожиданно хорошо прокачалась в cyber-задачах: на CyberGym она SOTA по поиску уязвимостей, а на exploitation-бенчмарках больше чем вдвое обходит GLM-5.2.
huggingface.co · #ai #glm #llm #open-weights
DeepMind представила Gemini Omni 1.1 Flash для более управляемой генерации видео через Gemini API в Google AI Studio. Модель теперь может продолжать сцену, анализируя до 10 секунд предыдущего контекста, а не только последнюю секунду, и тянуть ролики шагами по 10 секунд до суммарных 40 секунд. Ещё есть first/last frame interpolation, генерация превью в 360p и апскейл до 4K; для прототипов обещают до 60% быстрее и в три раза дешевле, чем стандартный 720p.
deepmind.google · #ai #gemini #google #llm
Автор тестирует gpt-5.6-luna: ~100 токенов/c, стоимость сложных задач — копейки. Раньше персонализированная новостная лента обходилась в $1, теперь — $0.10. Это открывает путь для consumer-приложений с AI, где раньше мешали высокие затраты на инференс.
calv.info · #ai #efficiency #llm #optimization
Метод QAH дистиллирует сжатый 4-битный студент напрямую из оригинальной full-precision модели, а не из восстановленного чекпоинта. GPT-OSS 120B → 60B в MXFP4 превзошёл bfloat16-версию на 7 из 9 бенчмарков, став одновременно меньше, быстрее и точнее.
huggingface.co · #ai #llm #optimization #quantization
125B MoE-модель с 6B активных параметров на токен, 51B N-gram эмбеддингов, выгружаемых в RAM/SSD, и гибридным механизмом Gated DeltaNet + Qwen Sparse Attention. На контексте в 1M токенов Prefill ускорился в 8.6x. Нативное окно — 262K токенов.
habr.com · #ai #architecture #llm #qwen
В блоге Z.ai опубликован анонс GLM-5.3-Flash. Характеристики модели в доступной выдаче не раскрыты; пост на Hacker News набрал 938 очков и 473 комментария.
z.ai · #ai #glm #llm #model-release
Qwen выложила open-weights Qwen3.8-Flash-Next — мультимодальную MoE-модель, которую называют ранним превью архитектуры Qwen4. При суммарном размере 125B активны только 6B; Саймон Уиллисон уже гонял её на DGX Spark в квантованиях Unsloth (72.5GB UD-IQ1_S и 78.9GB UD-Q2_K_XL).
simonwillison.net · #ai #ai #llm #moe #qwen
Исследователи предложили атаку InjecMEM: злоумышленник в одном взаимодействии внедряет якорь и команду, которые при последующих запросах на ту же тему подменяют ответ модели. Атака работает на нескольких системах памяти и бэкбон-моделях, не затрагивая нецелевые запросы.
tldr.takara.ai · #security #agents #ai #injection #llm #security
По заголовку, модель Qwen 3.8 27B объявлена значительным прорывом. Детали не раскрыты.
www.reddit.com · #ai #ai #llm #qwen
По заголовку, модель Qwen3.8-27B в формате NVFP4 с поддержкой зрения работает на одной RTX 5090 (ограничение 400 Вт) со средней скоростью 120 токенов/с и кэшем ключей/значений на 451K токенов. Подробности не раскрыты.
www.reddit.com · #ai #ai #gpu #llm #qwen
Обсуждение на Level1Techs: пользователи жалуются, что локальные модели дают худшие результаты, чем облачные. Причины — квантование, маленький контекст и неоптимальные настройки. Конкретных цифр или имён моделей в статье нет.
forum.level1techs.com · #ai #inference #llm #local-llm
Разработчик сравнил Codex и Claude: Codex генерирует меньше комментариев в Ruby-коде, делает изменения быстрее, но потом долго прогоняет тесты. Claude создаёт больше абстракций и сложнее архитектуру. Codex путается с rebase в ветках, зато лучше работает с MCP-логином.
allaboutcoding.ghinda.com · #ai #claude #codex #coding #llm
Модель xAI набрала 61 балл в AA Intelligence Index, сравнявшись с GPT-5.6 Sol и отставая на один балл от Claude Fable 5. Прирост — 5 баллов за месяц, а цена задачи $0,84 ставит её на границу Парето.
habr.com · #ai #benchmarks #grok #llm
Исследователи показали, что 2-значные секреты в контексте восстанавливаются почти идеально, а 4-значные — с точностью 82%, даже когда модель отказывается их выдавать. Более способные модели утекают сильнее, а атака позволяет вытащить номера SSN из продакшн-агента.
tldr.takara.ai · #security #context-leakage #llm #privacy
Гибрид из 6 блоков attention и 12 свёрточных обучен на 59.9B токенов и набрал 47.31 против порога 42.20. Он быстрее в 1.76 раза на контексте 2048 токенов и обходит MobileLLM-125M, хотя та видела триллион токенов.
tldr.takara.ai · #ai #cpu #inference #llm #optimization
Метод Скотта Ааронсона не влияет на качество и стоит почти ноль, Google внедрил его ещё в 2024 и проверил на 20 млн примерах. Anthropic теперь тоже маркирует выводы Claude, а народ почему-то злится.
thezvi.substack.com · #ai #llm #security #watermarking
Сравнение SLM (Qwen3, Gemma3, Granite 4.0) на Nvidia/Apple M4 с облачными LLM (ChatGPT 5, Claude 4.5, Gemini 2.5 Pro) показало: в чатах SLM выигрывают или сравниваются в 98,6% случаев, в рассуждениях — 62,5%. Энергозатраты ниже на 50–85%.
klementoninvesting.substack.com · #ai #llm #slm #strategy
Ornith-1.5 выходит в трёх размерах (397B MoE, 35B MoE, 9B Dense) и использует self-improvement loop: модель сама генерирует задачи, скэффолды и роллауты. 397B версия набирает 86.1 на Terminal-Bench 2.1 и 56 на DeepSWE — наравне с Claude Opus 4.8. 9B-версия работает на iPhone и Android, обгоняя Gemma 4-31B.
ornith.ai · #ai #ai #llm #ornith
Alibaba адаптировала модель Qwen-3.8 27B для работы на 64-ядерном RISC-V процессоре XuanTie C950 (TSMC 5nm). Декодинг — 30 токенов/с, TTFT 1.9 с. Чип не требует GPU, использует встроенные матричные и векторные ускорители.
wccftech.com · #hardware #chip #integration #llm #riscv
На Reddit появился трекер обновлений для 1-битных, 2-битных и тернарных моделей (Bitnet). Детали не опубликованы — только заголовок.
www.reddit.com · #ai #bitnet #llm #quantization
Qwen3.8-27B (Apache 2.0) — мультимодальная dense-модель с 27,78 млрд параметров, гибридной архитектурой (16 слоёв full attention, 48 слоёв Gated DeltaNet) и контекстом 262K токенов. По бенчмаркам (Terminal-Bench 2.1, SWE-bench Pro, LiveCodeBench v6) в ряде тестов обходит Claude Opus 4.6 Max, хотя сравнительные таблицы от Qwen включают внутренние бенчмарки и не всегда честно перегоняют Opus.
habr.com · #ai #ai #llm #qwen #release