AvitoTech Если, я правильно понимаю: Третий подход может работать в том случае, если конверсия ручек каждого бандита(конфигов) зависят от времени одинаково. Другими словами номер ручки ортогонален времени. Но это может быть и не так. Например, люди могут искать какие-то товары в какое-то время суток чаще или реже, и это может влиять на конверсию для каждой ручку отдельно. Интересно, пробовали ли вы это как-то учитывать? Либо нужно обновлять значения распределений ручек раз в сутки, чтобы сравнивать ручки вне зависимости от часа. Понимаю, что времени после публикации прошло много, но я наткнулся на вашу статью только сейчас. Будет здорово, если у вас найдется человек, который сможет ответить на мой вопрос.
Спасибо за статью, интересный опыт!
Есть желание построить аналогичную систему, но пока нет опыта работы со звуком, поэтому очень интересно изучить чужой end-to-end опыт.
Пока читал возник ряд вопросов, возможно раскроете тему чуть подробнее.
Звук.
1.1. Сколько часов аудио использовалось для тренировки акустической модели, чтобы достичь удовлетворительного результата?
1.2. Какая модель использовалась для акустической модели? Почему именно она?
1.3. Чем пользовались для создания разметки для звуковой модели?
Языковая модель.
2.1. Как строили языковую модель?
2.2. Каков был объем датасета?
2.3. Почему не использовали большие корпусы типа википедии?
2.4. Насколько могу судить для того, чтобы составить окончательный текст по звуку, вам было необходимо использовать beam search(или что-то аналогичное), чтобы составить "решетку гипотез." Можете это подтвердить или опровергнуть? Очень интересно, что именно вы для этого использовали и почему.
Выделение смыслов.
3.1 Почему вы использовали именно этот вариант ембединга StarSpace, почему не FastText или предтренированный BERT. Очень интересны мотивы вашего выбора.
3.2 В классификации намерений, немного странным выглядит, то что метрики для классов: "Приветствие", "Отрицание", "Подтверждение" — ниже, чем для других. Как мне кажется, это наиболее простые классы для классфикации. Можете как-то прокомментировать?
3.4 Каковы мотивы выбора CRF для NER? Не самое популярное решение.
Диалог с пользователем.
4.1 Насколько могу судить по картинке из статьи, ваша система поддержиает диалог с пользователем, а значит нужна отдельная модель для отслеживания статуса диалога. Можете рассказать что использовали, как тренировали, каков был объем выбрки итд?
За ранее спасибо, если ответите хотя бы на часть вопросов!
Интересный кейс.
AvitoTech
Если, я правильно понимаю:
Третий подход может работать в том случае, если конверсия ручек каждого бандита(конфигов) зависят от времени одинаково. Другими словами номер ручки ортогонален времени.
Но это может быть и не так. Например, люди могут искать какие-то товары в какое-то время суток чаще или реже, и это может влиять на конверсию для каждой ручку отдельно.
Интересно, пробовали ли вы это как-то учитывать?
Либо нужно обновлять значения распределений ручек раз в сутки, чтобы сравнивать ручки вне зависимости от часа.
Понимаю, что времени после публикации прошло много, но я наткнулся на вашу статью только сейчас. Будет здорово, если у вас найдется человек, который сможет ответить на мой вопрос.
можете чуть подробнее пояснить?
Очень интересно, узнал из статьи и из комментариев про индексирование шестиугольниками. Спасибо!
Спасибо за статью, интересный опыт!
Есть желание построить аналогичную систему, но пока нет опыта работы со звуком, поэтому очень интересно изучить чужой end-to-end опыт.
Пока читал возник ряд вопросов, возможно раскроете тему чуть подробнее.
Звук.
1.1. Сколько часов аудио использовалось для тренировки акустической модели, чтобы достичь удовлетворительного результата?
1.2. Какая модель использовалась для акустической модели? Почему именно она?
1.3. Чем пользовались для создания разметки для звуковой модели?
Языковая модель.
2.1. Как строили языковую модель?
2.2. Каков был объем датасета?
2.3. Почему не использовали большие корпусы типа википедии?
2.4. Насколько могу судить для того, чтобы составить окончательный текст по звуку, вам было необходимо использовать beam search(или что-то аналогичное), чтобы составить "решетку гипотез." Можете это подтвердить или опровергнуть? Очень интересно, что именно вы для этого использовали и почему.
Выделение смыслов.
3.1 Почему вы использовали именно этот вариант ембединга StarSpace, почему не FastText или предтренированный BERT. Очень интересны мотивы вашего выбора.
3.2 В классификации намерений, немного странным выглядит, то что метрики для классов: "Приветствие", "Отрицание", "Подтверждение" — ниже, чем для других. Как мне кажется, это наиболее простые классы для классфикации. Можете как-то прокомментировать?
3.4 Каковы мотивы выбора CRF для NER? Не самое популярное решение.
Диалог с пользователем.
4.1 Насколько могу судить по картинке из статьи, ваша система поддержиает диалог с пользователем, а значит нужна отдельная модель для отслеживания статуса диалога. Можете рассказать что использовали, как тренировали, каков был объем выбрки итд?
За ранее спасибо, если ответите хотя бы на часть вопросов!