None
RU
Single Task Algorithmic Reasoning Models: как с помощью маленькой модели обойти большую LLM?
[]
Все публикации подряд на Хабре
Главный вывод работы: даже модель всего с миллионами параметров способна конкурировать с в разы большими LLM в алгоритмических задачах.
Также сделали общие веса для - и -модулей и добавили — усреднение весов за последние шагов для итогового чекпойнта.
Помимо этого, как и в моделях URM и TRM, мы использовали -копию модели для сглаживания эффекта от неудачных шагов модели.
И увидели, что увеличение количества циклов, через которые проходит градиент, всегда улучшало качество итоговой модели и ускоряло сходимость как на обучающей, так и на тестовой выборках.
Аналогичная ситуация наблюдалась и в «игре в жизнь».