📰 IT Дайджест

#model

7 материалов

9. IBM выпустил Granite Time Series PatchTST-FM-r2 — топ-1 среди open-source zero-shot моделей

Модель с 385 млн параметров, контекстом до 8192 токенов и квантильным прогнозированием (99 квантилей). Занимает первое место среди zero-shot моделей с разрешённой лицензией на GIFT-Eval, обходя TimesFM-3 по MASE. Доступна под Apache 2.0 и OpenMDW 1.0.

huggingface.co · #ai #ibm #model #timeseries

12. Google представила TimesFM-3 — foundation model для многомерных временных рядов

TimesFM-3 от Google — модель на 330 млн параметров, предобученная на >1 трлн точек данных. В отличие от предшественников, она нативно поддерживает многомерное прогнозирование: несколько целевых рядов, прошлые ковариаты и известные будущие события. Использует non-autoregressive decode за один проход.

research.google · #ai #forecasting #google #model

9. Нерелизная модель Astra решила 10 открытых математических проблем

OpenAI отчиталась, что внутренняя версия Astra (следующая большая модель) справилась с десятью нерешёнными задачами — от упаковки сфер в высоких размерностях до чисел Рамсея и несофических групп. Каждое решение обошлось бы ~$2000 по тарифам Sol API, и все формализованы в Lean. OpenAI признаёт, что Millennium Prize проблемы пока не взяты.

thezvi.substack.com · #ai #math #model #openai #research

3. Anthropic выпустила Claude Opus 5 — вдвое дешевле Fable при почти той же производительности

Claude Opus 5 доступен сегодня. На Frontier-Bench v0.1 он вдвое превосходит Opus 4.8 при меньшей стоимости за задачу. На CursorBench 3.2 на max effort отстаёт от Fable 5 всего на 0.5%, но стоит вдвое меньше. На ARC-AGI 3 результат в три раза выше, чем у следующей лучшей модели. В одном из тестов модель самостоятельно написала pipeline компьютерного зрения, чтобы извлечь геометрию из пикселей чертежа — конкуренты не смогли решить задачу за пять попыток.

www.anthropic.com · #ai #anthropic #claude #llm #model

10. Как автор ускорял свёртки в своей модели и упёрся в Depthwise Conv

На Habr автор рассказывает, как после статьи про NormIs-1 полез оптимизировать модель и обнаружил, что скорость проседает именно на Depthwise Conv. Это как раз тот случай, когда метрики интеллекта выглядят прилично, а потом выясняется, что узкое место сидит в самом обычном блоке свёрток.

habr.com · #ai #blog #inference #model #optimization #russian

4. DiffusionGemma: Gemma-модель, которая генерирует по-другому

Саймон Уиллисон пишет про DiffusionGemma — открытые веса Apache 2, модель google/diffusiongemma-26B-A4B-it. Это продолжение того самого экспериментального Gemini Diffusion, который Google мельком показывала в прошлом году; тогда он у автора крутился на 857 tokens/second, так что тут явно не просто очередной «посмотрите, у нас тоже есть LLM».

simonwillison.net · #ai #diffusion #gemini #model

15. ZML обещает «model to metal», но пока у нас только страница и комментарии

ZML с подзаголовком Model to Metal выглядит как очередная попытка связать модели напрямую с железом, минуя лишнюю прослойку абстракций. Но в кандидате почти нет содержания: только сайт и комментарии, так что без нормального технического разбора это пока больше вывеска, чем материал.

zml.ai · #ai #ai-hardware #metal #model #zml