📰 IT Дайджест

#llm

50 материалов

12. Вышел Real-SWE: бенчмарк для ИИ на реальных корпоративных кодовых базах

Бенчмарк содержит задачи из приватных продакшн-репозиториев c реальными бизнес-правилами (расчёт налогов, миграции). Лучший результат у Claude Fable 5.1 + Claude Code — 38.8% resolution rate. GPT-6 Astra с Codex CLI набрал 33.8%, Gemini 3.8 Flash — 31.2%. Ни одна модель не превышает 40%.

withspecific.com · #ai #benchmark #enterprise #llm #swe

14. Новый бенчмарк RAG-Safety-Bench выявил: RAG может ухудшать безопасность LLM

Исследователи представили тест для измерения влияния RAG на безопасность ответов, разделяя задачу на 4 условия: без RAG, с oracle-документом, с релевантными и случайными документами. Результаты на 5 open-source LLM показали, что baseline guardrails не работают в RAG-сценарии, а даже безвредные документы провоцируют unsafe-генерацию.

tldr.takara.ai · #ai #llm #rag #safety #security

5. Cognition выпустила SWE-2 — кодовую модель за копейки

Модель SWE-2 набрала 50% на FrontierCode 1.1 Main, отстав от Fable 5.1 на один пункт, но будучи на 64% дешевле. Она построена поверх Kimi K33 (2.8 трлн параметров) и использует RL с линейным штрафом за стоимость. SWE-2 medium тратит на 58% меньше шагов и стоит на 81% дешевле SWE-1.7 при равном или лучшем результате.

cognition.com · #ai #cognition #llm #swe

8. Qwen3.8 A95B повторяет рассуждения GPT-5.5 Pro при префилле

В эксперименте v1.1 в reasoning-канал Qwen3.8 A95B подставляли первые 1% рассуждений GPT-5.5 Pro — совпадение с ответом учителя выросло на +18.18 п.п., особенно на STEM (+26.99 п.п.) и синтетических головоломках (+14.75 п.п.). Автор считает, что Qwen могла учиться у GPT-5.5 Pro или близкой модели, а не у Opus. Kimi K3 показала наибольшее перекрытие с GPT-5.5 Pro и без префилла (31.11%), но прирост от префилла всего +4.54 п.п.

gist.github.com · #ai #llm #qwen #reasoning

9. API-бенчмарки завышают результаты чат-интерфейсов на 3,4 п.п.

Аудит ChatGPT, Claude и Gemini по семи системам и девяти бенчмаркам показал, что API-оценки в среднем на 3,4 п.п. выше по точности и на 2,1 п.п. выше по согласованности, чем оценки через интерфейс. У ChatGPT разрыв между API и интерфейсом больше, чем разница между GPT 5.3 и GPT 5.4 через API. Изменение системных промптов, параметров сэмплинга и reasoning не убирает разрыв.

tldr.takara.ai · #ai #benchmarks #chatbot #evaluation #llm

6. Zhipu сменила лицензию GLM-5.3 с MIT на кастомную — порог $10 млрд

Новая лицензия требует security review от Z.AI для сервисов с выручкой >$10 млрд за 12 месяцев. Неопределённость с термином «аффилированные лица» вызывает вопросы. В обзоре также Motif-3 (MIT), Hy4-preview от Tencent и другие модели.

www.interconnects.ai · #ai #ai #llm #open-source

9. OpenAI выпустила ChatGPT Images 2.5 — две модели в API

Новая версия генерирует изображения быстрее, лучше следует инструкциям в многошаговых диалогах и сохраняет объекты из референсных фото. В API появились gpt-image-2.5-sunburst и gpt-image-2.5-flare. Sunburst — для точного редактирования, Flare — для быстрой генерации.

simonwillison.net · #ai #chatgpt #images #llm #openai

11. Kimi K3 (2.8T параметров) работает на M5 Max с 128 ГБ — 1 токен/с с четырёх SSD

ARGODRIVE Deltafin запустил модель Kimi K3 на MacBook Pro: декодирование 1 токен/с при 512 токенах. Проблема: время до первого токена ~6.3 минуты из-за повторного чтения слоёв. Один SSD даёт 52% скорости от четырёх, два — 73%, три — 90%.

github.com · #ai #hardware #llm #optimization

1. DeepSeek R1 обвалил Nvidia на 17% — минус $589 млрд за день

20 января 2025 года DeepSeek выложила R1 под MIT-лицензией, а 27 января Nvidia рухнула на 17%, потеряв $589 млрд капитализации; Nasdaq просел примерно на 3%, весь рынок — около $1 трлн. Модель сделала дочерняя структура хедж-фонда High-Flyer из Ханчжоу на урезанных H800. Чтобы обойти ограничения, команда использовала MLA, DeepSeekMoE с 671 млрд параметров (активны 37 млрд), FP8-обучение и DualPipe.

habr.com · #ai #deepseek #llm #market

3. llm 0.35 добавил поддержку GPT-6 Astra

Саймон Уиллисон выпустил llm 0.35 — очередной релиз его инструмента для работы с LLM. Из анонса известно только одно: появилась поддержка новой модели OpenAI gpt-6-astra, то есть GPT-6 Astra. Остальные изменения не раскрыты.

simonwillison.net · #tool #cli #llm #openai

5. «Ваш интеллектуальный ширинка расстёгнута» — эссе про LLM-посты

Брайан Кантрилл объясняет, почему посты, написанные LLM, сразу узнаваемы: эмодзи, односложные абзацы, тире. Такое письмо заставляет читателей сомневаться в подлинности автора. Призывает писать самим.

bcantrill.dtrace.org · #blog #ai #ethics #llm #writing

10. Чёрные ящики LLM-судей ненадёжны: 52 988 запросов показали разброс корреляции до 0.40

Исследователи аудировали предположение, что одна и та же LLM-модель возвращает одинаковые результаты. На 52 988 запросах Spearman согласие повторов в одном окне составило 0.40 (требовалось 0.90). Причины: смещение mapping-меток, шум на 7 порядков ниже сигнала и бит-идентичные входы с разными рангами. Смена провайдера не помогла.

tldr.takara.ai · #ai #ai #evaluation #llm #reliability

1. OpenAI выпустила GPT-6 Astra: цена $10/$50 за миллион токенов, 99.9% на ARC-AGI 3 за $19K

OpenAI запускает GPT-6 Astra по цене Claude Fable 5: $10/млн input, $50/млн output. Модель набирает 99.9% на ARC-AGI 3 через кастомный Provider Adapter harness (за $19K), но на стандартном — 62.7% за $26K. На ExploitBench — 100%, на SRE-Bench — 99.2% против 68.7% у Sol. Однако Artificial Analysis ставит Astra на 61 балл — ниже Fable 5.1 (66) и Muse Spark 1.3.

simonwillison.net · #ai #gpt-6 #llm #openai

3. Qwen 3.8 27B доступен на Cerebras: 1500 токенов/с, без прунинга

Cerebras запустил Qwen 3.8 27B на публичных эндпоинтах со скоростью 1500 токенов/с. Модель не прунена — все веса оригинальные, только выборочная квантизация при хранении. Пруненные версии REAP доступны на Hugging Face, но не через API.

inference-docs.cerebras.ai · #ai #cerebras #inference #llm

6. Financial Times: бизнесу больше не нужны самые мощные модели — Fable 5 даёт лишь 11% расходов Anthropic

FT разбирает, как рынок LLM перешёл от гонки бенчмарков к выбору дешёвых моделей. Fable 5, выпущенная в июне, спустя два месяца составляла лишь ~11% корпоративных расходов на Anthropic (данные Ramp). Клиенты предпочитают более дешёвые модели, если прирост качества не влияет на бизнес-результат.

habr.com · #ai #business #llm #strategy

1. Google выпустил Gemini 3.8 Flash и Flash Cyber — третье обновление за шесть недель

Google DeepMind представил Gemini 3.8 Flash — третью Flash-модель за полтора месяца. Цена — $0.75 за миллион входных токенов, $3.75 за выходные. На бенчмарке DeepSWE v1.1 модель обходит более дорогие frontier-модели. Версия Flash Cyber через программу Fairwind ищет уязвимости на уровне frontier, но доступна только «доверенным защитникам».

blog.google · #ai #gemini #google #llm

4. OpenAI готовит Astra с «зацикленным трансформером» — часть рассуждений станет нечитаемой

По данным The Information, модель Astra (возможно GPT-6) использует recurrent depth: данные прогоняются через одни и те же слои несколько раз. Часть «мыслей» модели остаётся в числовых состояниях — их нельзя прочитать. OpenAI присвоила Astra уровень Critical по кибербезопасности: на ExploitBench 100%, найдены две zero-day в V8. Ирония: защита от злоупотреблений строится на чтении рассуждений, которые новая архитектура прячет.

habr.com · #ai #gpt6 #llm #openai

8. GitHub Copilot: как сократить расход токенов, не ухудшая качество — уроки A/B-тестов

Инженеры GitHub выяснили, что укорачивание каждого ответа инструмента (RTK) ведёт к дополнительным запросам и росту затрат. Вместо этого внедрили выборочный компрессор: сохраняют вывод cat, git diff, grep, а шум сборки сжимают. Четыре изменения проверены на бенчмарках и в онлайне.

github.blog · #ai #copilot #github #llm #optimization

1. Anthropic выпустила Fable 5.1 — на 25% дешевле, на 60% меньше ложных срабатываний

Claude Fable 5.1 стоит на 25% меньше предшественника на типовых нагрузках и до 45% меньше для агентных сценариев. Система безопасности стала реже блокировать легитимные запросы: в кибербезопасности ложных срабатываний стало на 60% меньше. Одновременно вышла Mythos 5.1 — та же модель с усиленными защитами, доступная только через доверенные программы.

www.anthropic.com · #ai #anthropic #claude #llm #release

3. SlotStream запускает 104-гигабайтную Qwen3.8-Flash-Next на Mac с 48 ГБ — 12 токенов/с

Проект SlotStream транслирует веса 125B MoE-модели Qwen3.8-Flash-Next (104 ГБ в 4-битном формате) с SSD, позволяя запускать её на Mac с 48 ГБ памяти. На M5 Pro получено ~12 токенов/с при пиковом потреблении 32 ГБ. Бинарник написан на Swift, поддерживает API Ollama и OpenAI.

github.com · #ai #llm #mac #mlx #optimization

11. BenchMIRT выясняет, что на самом деле измеряют LLM-бенчмарки

Новый метод аудита на основе многомерной IRT проанализировал 34 тыс. вопросов из 16 бенчмарков на 100 LLM. Выяснилось, что BBQ (тест на социальные стереотипы) сильнее коррелирует с общим reasoning, чем с безопасностью, а WMDP (опасные знания) тоже больше зависит от reasoning, причём сильные модели чаще отказываются отвечать.

huggingface.co · #ai #benchmarking #evaluation #llm

5. Агенты пересылают 97% токенов повторно: исследование 40 сессий

Автор проанализировал 40 сессий Claude Code и Codex (777 млн токенов). Выяснилось, что на каждый новый токен приходится 36–47 повторных пересылок старых. Свежий ввод — 0.003% у Claude и 5.7% у Codex. Стоимость растёт быстрее длины сессии: удвоение шагов даёт ×2.4 токенов.

habr.com · #ai #cost #llm #optimization #tokens

7. OGL-Mini: открытая модель безопасности для LLM-агентов

Автор представляет OGL-Mini — гибридную модель безопасности для AI-агентов, работающую на CPU. Разбирает векторы атак из OWASP LLM Top 10, включая промпт-инъекции и утечку системных промптов. Модель доступна в репозитории для TypeScript, Python и Go.

habr.com · #security #agents #ai #llm #security

1. Tencent выпустила Hy4 — 770B параметров, 1M контекст

Tencent выкатила открытую текстовую модель Hy4: 770B всего, 49B активных, окно в 1M токенов, веса 1.56 ТБ на Hugging Face. В трейсе рассуждений заметили урезанный английский — видимо, на скрытый текст грамматику не тратят. Два уровня reasoning effort: high и no_think; по умолчанию — high.

simonwillison.net · #ai #frontier #llm #tencent

5. GLM-5.3 показал рост в кодинге и взломе

GLM-5.3 стал open-weight, при этом базовая модель у него та же, что у GLM-5.2 — весь прирост пришёл из post-training. Авторы заявляют 50% улучшение на их внутреннем Z.ai Code Bench и первое место среди open-weights на публичных бенчмарках вроде Terminal Bench 3.0 и Agents' Last Exam. Отдельно они подчёркивают, что модель неожиданно хорошо прокачалась в cyber-задачах: на CyberGym она SOTA по поиску уязвимостей, а на exploitation-бенчмарках больше чем вдвое обходит GLM-5.2.

huggingface.co · #ai #glm #llm #open-weights

8. Gemini Omni 1.1 Flash умеет тянуть сцену и поднимать видео до 4K

DeepMind представила Gemini Omni 1.1 Flash для более управляемой генерации видео через Gemini API в Google AI Studio. Модель теперь может продолжать сцену, анализируя до 10 секунд предыдущего контекста, а не только последнюю секунду, и тянуть ролики шагами по 10 секунд до суммарных 40 секунд. Ещё есть first/last frame interpolation, генерация превью в 360p и апскейл до 4K; для прототипов обещают до 60% быстрее и в три раза дешевле, чем стандартный 720p.

deepmind.google · #ai #gemini #google #llm

8. Маленькие модели становятся дешёвыми и быстрыми

Автор тестирует gpt-5.6-luna: ~100 токенов/c, стоимость сложных задач — копейки. Раньше персонализированная новостная лента обходилась в $1, теперь — $0.10. Это открывает путь для consumer-приложений с AI, где раньше мешали высокие затраты на инференс.

calv.info · #ai #efficiency #llm #optimization

13. 4-битная модель обходит full-precision оригинал: Quantization-Aware Healing

Метод QAH дистиллирует сжатый 4-битный студент напрямую из оригинальной full-precision модели, а не из восстановленного чекпоинта. GPT-OSS 120B → 60B в MXFP4 превзошёл bfloat16-версию на 7 из 9 бенчмарков, став одновременно меньше, быстрее и точнее.

huggingface.co · #ai #llm #optimization #quantization

14. Alibaba показала Qwen3.8-Flash-Next — превью архитектуры Qwen 4

125B MoE-модель с 6B активных параметров на токен, 51B N-gram эмбеддингов, выгружаемых в RAM/SSD, и гибридным механизмом Gated DeltaNet + Qwen Sparse Attention. На контексте в 1M токенов Prefill ускорился в 8.6x. Нативное окно — 262K токенов.

habr.com · #ai #architecture #llm #qwen

8. Z.ai показала GLM-5.3-Flash

В блоге Z.ai опубликован анонс GLM-5.3-Flash. Характеристики модели в доступной выдаче не раскрыты; пост на Hacker News набрал 938 очков и 473 комментария.

z.ai · #ai #glm #llm #model-release

12. Qwen3.8-Flash-Next: MoE на 125B с 6B активных

Qwen выложила open-weights Qwen3.8-Flash-Next — мультимодальную MoE-модель, которую называют ранним превью архитектуры Qwen4. При суммарном размере 125B активны только 6B; Саймон Уиллисон уже гонял её на DGX Spark в квантованиях Unsloth (72.5GB UD-IQ1_S и 78.9GB UD-Q2_K_XL).

simonwillison.net · #ai #ai #llm #moe #qwen

7. InjecMEM: атака на память LLM-агентов через один запрос

Исследователи предложили атаку InjecMEM: злоумышленник в одном взаимодействии внедряет якорь и команду, которые при последующих запросах на ту же тему подменяют ответ модели. Атака работает на нескольких системах памяти и бэкбон-моделях, не затрагивая нецелевые запросы.

tldr.takara.ai · #security #agents #ai #injection #llm #security

6. Qwen3.8-27B на RTX 5090: 120 токенов/с с 451K KV-cache

По заголовку, модель Qwen3.8-27B в формате NVFP4 с поддержкой зрения работает на одной RTX 5090 (ограничение 400 Вт) со средней скоростью 120 токенов/с и кэшем ключей/значений на 451K токенов. Подробности не раскрыты.

www.reddit.com · #ai #ai #gpu #llm #qwen

10. Почему ваша локальная LLM кажется тупее, чем есть на самом деле

Обсуждение на Level1Techs: пользователи жалуются, что локальные модели дают худшие результаты, чем облачные. Причины — квантование, маленький контекст и неоптимальные настройки. Конкретных цифр или имён моделей в статье нет.

forum.level1techs.com · #ai #inference #llm #local-llm

15. Неделя с Codex: быстрее, проще, но без лишних абстракций

Разработчик сравнил Codex и Claude: Codex генерирует меньше комментариев в Ruby-коде, делает изменения быстрее, но потом долго прогоняет тесты. Claude создаёт больше абстракций и сложнее архитектуру. Codex путается с rebase в ветках, зато лучше работает с MCP-логином.

allaboutcoding.ghinda.com · #ai #claude #codex #coding #llm

6. Grok 4.6 догнал лидеров за месяц

Модель xAI набрала 61 балл в AA Intelligence Index, сравнявшись с GPT-5.6 Sol и отставая на один балл от Claude Fable 5. Прирост — 5 баллов за месяц, а цена задачи $0,84 ставит её на границу Парето.

habr.com · #ai #benchmarks #grok #llm

7. Секреты в контексте LLM утекают через обычные ответы

Исследователи показали, что 2-значные секреты в контексте восстанавливаются почти идеально, а 4-значные — с точностью 82%, даже когда модель отказывается их выдавать. Более способные модели утекают сильнее, а атака позволяет вытащить номера SSN из продакшн-агента.

tldr.takara.ai · #security #context-leakage #llm #privacy

11. Исследование Stanford: SLM на десктопах догоняют LLM в 98,6% чатов

Сравнение SLM (Qwen3, Gemma3, Granite 4.0) на Nvidia/Apple M4 с облачными LLM (ChatGPT 5, Claude 4.5, Gemini 2.5 Pro) показало: в чатах SLM выигрывают или сравниваются в 98,6% случаев, в рассуждениях — 62,5%. Энергозатраты ниже на 50–85%.

klementoninvesting.substack.com · #ai #llm #slm #strategy

14. Ornith-1.5: 397B MoE модель догоняет Claude Opus 4.8 на Terminal-Bench и DeepSWE

Ornith-1.5 выходит в трёх размерах (397B MoE, 35B MoE, 9B Dense) и использует self-improvement loop: модель сама генерирует задачи, скэффолды и роллауты. 397B версия набирает 86.1 на Terminal-Bench 2.1 и 56 на DeepSWE — наравне с Claude Opus 4.8. 9B-версия работает на iPhone и Android, обгоняя Gemma 4-31B.

ornith.ai · #ai #ai #llm #ornith

11. Alibaba запускает Qwen-3.8 27B на собственном 5-нм RISC-V чипе XuanTie C950

Alibaba адаптировала модель Qwen-3.8 27B для работы на 64-ядерном RISC-V процессоре XuanTie C950 (TSMC 5nm). Декодинг — 30 токенов/с, TTFT 1.9 с. Чип не требует GPU, использует встроенные матричные и векторные ускорители.

wccftech.com · #hardware #chip #integration #llm #riscv

6. Alibaba выпустила Qwen3.8-27B: dense-модель на 27 млрд параметров, которая влезает в домашнюю видеокарту и обгоняет Claude Opus 4.6 на некоторых бенчмарках

Qwen3.8-27B (Apache 2.0) — мультимодальная dense-модель с 27,78 млрд параметров, гибридной архитектурой (16 слоёв full attention, 48 слоёв Gated DeltaNet) и контекстом 262K токенов. По бенчмаркам (Terminal-Bench 2.1, SWE-bench Pro, LiveCodeBench v6) в ряде тестов обходит Claude Opus 4.6 Max, хотя сравнительные таблицы от Qwen включают внутренние бенчмарки и не всегда честно перегоняют Opus.

habr.com · #ai #ai #llm #qwen #release