Главный вывод работы: даже модель всего с миллионами параметров способна конкурировать с в разы большими LLM в алгоритмических задачах. Также сделали общие веса для - и -модулей и добавили — усреднение весов за последние шагов для итогового чекпойнта. Помимо этого, как и в моделях URM и TRM, мы использовали -копию модели для сглаживания эффекта от неудачных шагов модели. И увидели, что увеличение количества циклов, через которые проходит градиент, всегда улучшало качество итоговой модели и ускоряло сходимость как на обучающей, так и на тестовой выборках. Аналогичная ситуация наблюдалась и в «игре в жизнь».