None
RU
Обучение с подкреплением в рекомендациях: оптимизируем удовлетворённость пользователя за всю сессию — статья на KDD 2026
['Хабр Карьера']
Все публикации подряд на Хабре
Учатся все эти модели на логах — что мы показали пользователю, с чем он провзаимодействовал, что лайкнул, что дослушал.
Проблема в том, что входит не в саму награду.
Off-policy обучение и оценкаЧтобы получить траектории текущей политики , надо выкатить модель на пользователей, собрать данные, обновить политику и повторить.
Тот же importance sampling, что и в обучении.
Проблемы те же, что и в обучении.