Авторы статьи утверждают, что reinforcement learning для reasoning меняет лишь 1–3% токенов, и воспроизводят улучшения без RL при затратах примерно в 1000 раз меньше. Ни названия моделей, ни бенчмарков в анонсе нет.
www.reddit.com · #ai #llm #research #rl
Habr перевёл подборку из 35 вопросов по RL для интервью, явно рассчитанную не на новичков с книжкой про Q-learning, а на тех, кого уже гоняют по деталям современных методов. В тексте виден знакомый мотив: аспирантура, потом весенняя волна найма и внезапно высокооплачиваемая работа в индустрии.
habr.com · #ai #2026 #interviews #learning #rl