Статья: RL меняет 1–3% токенов, а результат повторяется без RL
Авторы статьи утверждают, что reinforcement learning для reasoning меняет лишь 1–3% токенов, и воспроизводят улучшения без RL при затратах примерно в 1000 раз меньше. Ни названия моделей, ни бенчмарков в анонсе нет.