Привет! Интересный вопрос. Ваш случай отличается от сценария переноса знания между Лавкой и Маркетом тем, что пользователи не пересекаются. При пересечнии пользователей можно сделать прямо-таки единую модель, в которой анализируется совместная история из обоих источников - конкретно для Лавки и Маркета я не уверен, будет ли от этого какой-то профит, но точно есть другие пары доменов в экосистеме Яндекса, где это хорошо работает.
А в вашем случае нужно надеяться, что предобученный энкодер будет нести какую-то пользу. Если бы еще айтемы представлялись текстом в обоих доменах, то можно было бы попробовать текстовый энкодер тоже переиспользовать. Но в данном случае (на музыкальном домене) придётся все-таки учить новую матрицу эмбеддингов.
Мы сами в это сильно не забуривались, но был один конкретный случай, когда попробовали вот так вот перенести только энкодер между доменами. Это не дало никакого прироста качества. Но, как говорится, это было давно и неправда. У нас тогда модели по размеру были гораздо меньше, да и датасеты тоже :) По моей интуиции это должно работать, то есть должно быть возможным обучить такой энкодер над историей пользователя, чтобы он более-менее из коробки хорошо понимал много рекомендательных доменов. Но, возможно, здесь очень важно сделать этот энкодер большим по размеру
Действительно, музыка в этом плане очень удобный домен. Стриминговый. Легко учитывать весь фидбек, как негативный, так положительный.
В доменах с цельными выдачами, типа Маркета, мы как правило кладём не все показы, а сэмплируем. Берём все положительные, а из остальных сэмплируем. При сэмплировании можно пробовать разные эвристики - например, брать те показы, которые выше позитива или "вокруг" него
Привет! Интересный вопрос. Ваш случай отличается от сценария переноса знания между Лавкой и Маркетом тем, что пользователи не пересекаются. При пересечнии пользователей можно сделать прямо-таки единую модель, в которой анализируется совместная история из обоих источников - конкретно для Лавки и Маркета я не уверен, будет ли от этого какой-то профит, но точно есть другие пары доменов в экосистеме Яндекса, где это хорошо работает.
А в вашем случае нужно надеяться, что предобученный энкодер будет нести какую-то пользу. Если бы еще айтемы представлялись текстом в обоих доменах, то можно было бы попробовать текстовый энкодер тоже переиспользовать. Но в данном случае (на музыкальном домене) придётся все-таки учить новую матрицу эмбеддингов.
Мы сами в это сильно не забуривались, но был один конкретный случай, когда попробовали вот так вот перенести только энкодер между доменами. Это не дало никакого прироста качества. Но, как говорится, это было давно и неправда. У нас тогда модели по размеру были гораздо меньше, да и датасеты тоже :) По моей интуиции это должно работать, то есть должно быть возможным обучить такой энкодер над историей пользователя, чтобы он более-менее из коробки хорошо понимал много рекомендательных доменов. Но, возможно, здесь очень важно сделать этот энкодер большим по размеру
Привет! Отличный вопрос.
Действительно, музыка в этом плане очень удобный домен. Стриминговый. Легко учитывать весь фидбек, как негативный, так положительный.
В доменах с цельными выдачами, типа Маркета, мы как правило кладём не все показы, а сэмплируем. Берём все положительные, а из остальных сэмплируем. При сэмплировании можно пробовать разные эвристики - например, брать те показы, которые выше позитива или "вокруг" него