Учатся все эти модели на логах — что мы показали пользователю, с чем он провзаимодействовал, что лайкнул, что дослушал. Проблема в том, что входит не в саму награду. Off-policy обучение и оценкаЧтобы получить траектории текущей политики , надо выкатить модель на пользователей, собрать данные, обновить политику и повторить. Тот же importance sampling, что и в обучении. Проблемы те же, что и в обучении.