📰 IT Дайджест

← К выпуску 17.08.2026

Статья: RL меняет 1–3% токенов, а результат повторяется без RL

www.reddit.com · #ai #llm #research #rl

Авторы статьи утверждают, что reinforcement learning для reasoning меняет лишь 1–3% токенов, и воспроизводят улучшения без RL при затратах примерно в 1000 раз меньше. Ни названия моделей, ни бенчмарков в анонсе нет.

Открыть оригинал →