📰 IT Дайджест

#reasoning

5 материалов

8. Qwen3.8 A95B повторяет рассуждения GPT-5.5 Pro при префилле

В эксперименте v1.1 в reasoning-канал Qwen3.8 A95B подставляли первые 1% рассуждений GPT-5.5 Pro — совпадение с ответом учителя выросло на +18.18 п.п., особенно на STEM (+26.99 п.п.) и синтетических головоломках (+14.75 п.п.). Автор считает, что Qwen могла учиться у GPT-5.5 Pro или близкой модели, а не у Opus. Kimi K3 показала наибольшее перекрытие с GPT-5.5 Pro и без префилла (31.11%), но прирост от префилла всего +4.54 п.п.

gist.github.com · #ai #llm #qwen #reasoning

12. LRM не такие чёрные ящики: латентные токены декодируются в понятные цепочки до 93% случаев

Исследование двух LRM показало, что скрытые токены рассуждений часто не нужны для ответа — модель может дать тот же результат без них. Когда нужны, в 65–93% правильных ответов можно извлечь ожидаемую цепочку рассуждений. Предложен метод декодирования верифицированного следа без знания правильного ответа.

arxiv.org · #ai #interpretability #llm #reasoning

14. Simon Willison выпустил LLM 0.32: reasoning traces, OpenAI Responses, server-side tools

Новая версия LLM CLI показывает reasoning traces reasoning-моделей в stderr, поддерживает GPT-5.6 Luna по умолчанию, server-side инструменты OpenAI (CodeInterpreter, WebSearch) и Anthropic (WebSearch, WebFetch, MCP). В Python API — model.prompt(messages=[]) и stream_events() для работы с reasoning, tool calls и аттачментами.

simonwillison.net · #tool #llm #reasoning #sqlite

2. Два API-параметра утроили счёт GPT-5.6 на ARC-AGI-3

OpenAI показала, что включение двух настроек API — удержание режима рассуждений (reasoning) и включение компактизации (compaction) — позволило GPT-5.6 поднять результат на тесте абстрактного мышления ARC-AGI-3 втрое. Подробности того, как именно это работает, — в блоге компании.

openai.com · #ai #benchmarks #openai #reasoning

10. Reasoner на 16 КБ без LLM: в Habr хвалят VSA и 90% на multi-hop QA

На Хабре описывают обучаемый нейронный reasoner поверх Vector-Symbolic Architecture: модель занимает 16 КБ, работает только на CPU и не использует GPU вообще. Автор заявляет 90% exact multi-hop QA в среднем, с 100% на 1-2 hop и 70% на 3-hop — уже есть о чем поспорить в комментариях.

habr.com · #ai #cpu #habr #no-llm #reasoning #vector-symbolic-architecture