Обновить
0
Роман Рыбальченко@nerevar1n

Пользователь

Отправить сообщение

Привет! А расскажете технических подробностей?

Какие LLM модели используете?
Запросы только на английском языке поддерживаются? Насколько хуже качество если на русском задавать?
Из каких шагов состоит evaluation process? помимо 15-30 SQL запросов

Шаг "интерпретация запроса" — в чём необходимость этого отдельного шага? Объединить со "слоём метрик" имеет смысл?

Кстати, для сравнения систем, помимо дискретного числа побед, для большей наглядности, можно посчитать средневзвешенный WER по доменам для каждой системы, т.е. ∑ (доля записей в домене от всех записей) * WER_домена

Привет!

А вы выложите куда-нибудь данные с текстами? Хочется не только WER, но и другие метрики распознавания речи посчитать

Неужели данные hh.ru с зарплатой, номерами телефонов и электронной почте есть/были в открытом доступе? О_о

100 заголовков новостей — очень маленький датасет. Большой риск переобучиться под него с коэффициентами. Как вариант — можно спарить заголовки Яндекс.Новостей и считать за бейзлайн в первом приближении — они тоже группируют похожие новости в сюжеты

Спасибо за статью. Только после прочтения об использовании word2vec и обучения моделей на статьях хабра осталось ощущение незавершенности: вот мы обручили модель с такой-то точностью, и всё. Интересно как это можно применить, или хотя бы понять-интерпретировать результат. Например топ- слов, влияющих на рейтинг статьи (хотя это можно и без ML сделать)

Сюда ещё оценка точности, полноты:
Accuracy, Precision, Recall NBC: (0.96, 0.9821428571428571, 0.9482758620689655)
Accuracy, Precision, Recall CDT: (0.97, 0.9824561403508771, 0.9655172413793104)
Спасибо за статью!
Я только начал изучать машинное обучение немного удивлён тому, что NBC классификатор реализуется достаточно просто.

Кстати, если будет интересно, я на основе твоего кода и выборки обучил решающее дерево (DecisionTreeClassifier из scikit-learn), которое показало точность 97%:

from sklearn.tree import DecisionTreeClassifier

# ...

def get_features(sample): return (
    ord(sample[-1]),  # get last letter
    ord(sample[0]),  # get first letter
    ord(sample[1]),  # get second letter
)

# ...

clf = DecisionTreeClassifier()
clf.fit(
    [i[0] for i in train_set],
    [i[1] for i in train_set]
)

hits = 0
for feats, label in test_set:
    if label == clf.predict([feats]):
        hits += 1
print 'Accurancy DecisionTreeClassifier: ', hits/len(test_set)

Напомнило:
<insomnia> Нужно выполнить всего три команды, чтобы поставить Gentoo
<insomnia> cfdisk /dev/hda && mkfs.xfs /dev/hda1 && mount /dev/hda1 /mnt/gentoo/ && chroot /mnt/gentoo/ && env-update &&. /etc/profile && emerge sync && cd /usr/portage && scripts/bootsrap.sh && emerge system && emerge vim && vi /etc/fstab && emerge gentoo-dev-sources && cd /usr/src/linux && make menuconfig && make install modules_install && emerge gnome mozilla-firefox openoffice && emerge grub && cp /boot/grub/grub.conf.sample /boot/grub/grub.conf && vi /boot/grub/grub.conf && grub && init 6
<insomnia> это первая
Кстати, если кто-то захочет вновь поиграть в мады, я пару месяцев назад немного допилил Jaba Mud Client.
Теперь он без ошибок работает на Windows 7, пишет крутые логи сразу в HTML(с one-click заливкой на peeep.us) и умеет сворачиваться в System Tray.

Например один из логов боя пк мира Арды
Рано её использовать.
На нашем проекте пока отказались из-за критикал вещей:
баг в chromium из-за которого происходит выход из полноэкранного режима при использовании HistoryAPI
— Отсутствует возможность скроллить страницу средствами js
Судя по тому, что Carnegie Mellon входит в TOP-10 Американских IT университетов, и эта разработка очень высокотехнологична, то появление огромных боевых человекоподобных роботов в ближайшем будущем не предвидится…

Информация

В рейтинге
Не участвует
Откуда
Москва, Москва и Московская обл., Россия
Работает в
Дата рождения
Зарегистрирован
Активность