Какие LLM модели используете? Запросы только на английском языке поддерживаются? Насколько хуже качество если на русском задавать? Из каких шагов состоит evaluation process? помимо 15-30 SQL запросов
Шаг "интерпретация запроса" — в чём необходимость этого отдельного шага? Объединить со "слоём метрик" имеет смысл?
Кстати, для сравнения систем, помимо дискретного числа побед, для большей наглядности, можно посчитать средневзвешенный WER по доменам для каждой системы, т.е. ∑ (доля записей в домене от всех записей) * WER_домена
100 заголовков новостей — очень маленький датасет. Большой риск переобучиться под него с коэффициентами. Как вариант — можно спарить заголовки Яндекс.Новостей и считать за бейзлайн в первом приближении — они тоже группируют похожие новости в сюжеты
Спасибо за статью. Только после прочтения об использовании word2vec и обучения моделей на статьях хабра осталось ощущение незавершенности: вот мы обручили модель с такой-то точностью, и всё. Интересно как это можно применить, или хотя бы понять-интерпретировать результат. Например топ- слов, влияющих на рейтинг статьи (хотя это можно и без ML сделать)
Спасибо за статью!
Я только начал изучать машинное обучение немного удивлён тому, что NBC классификатор реализуется достаточно просто.
Кстати, если будет интересно, я на основе твоего кода и выборки обучил решающее дерево (DecisionTreeClassifier из scikit-learn), которое показало точность 97%:
from sklearn.tree import DecisionTreeClassifier
# ...
def get_features(sample): return (
ord(sample[-1]), # get last letter
ord(sample[0]), # get first letter
ord(sample[1]), # get second letter
)
# ...
clf = DecisionTreeClassifier()
clf.fit(
[i[0] for i in train_set],
[i[1] for i in train_set]
)
hits = 0
for feats, label in test_set:
if label == clf.predict([feats]):
hits += 1
print 'Accurancy DecisionTreeClassifier: ', hits/len(test_set)
<insomnia> Нужно выполнить всего три команды, чтобы поставить Gentoo
<insomnia> cfdisk /dev/hda && mkfs.xfs /dev/hda1 && mount /dev/hda1 /mnt/gentoo/ && chroot /mnt/gentoo/ && env-update &&. /etc/profile && emerge sync && cd /usr/portage && scripts/bootsrap.sh && emerge system && emerge vim && vi /etc/fstab && emerge gentoo-dev-sources && cd /usr/src/linux && make menuconfig && make install modules_install && emerge gnome mozilla-firefox openoffice && emerge grub && cp /boot/grub/grub.conf.sample /boot/grub/grub.conf && vi /boot/grub/grub.conf && grub && init 6
<insomnia> это первая
Кстати, если кто-то захочет вновь поиграть в мады, я пару месяцев назад немного допилил Jaba Mud Client.
Теперь он без ошибок работает на Windows 7, пишет крутые логи сразу в HTML(с one-click заливкой на peeep.us) и умеет сворачиваться в System Tray.
Рано её использовать.
На нашем проекте пока отказались из-за критикал вещей:
— баг в chromium из-за которого происходит выход из полноэкранного режима при использовании HistoryAPI
— Отсутствует возможность скроллить страницу средствами js
Судя по тому, что Carnegie Mellon входит в TOP-10 Американских IT университетов, и эта разработка очень высокотехнологична, то появление огромных боевых человекоподобных роботов в ближайшем будущем не предвидится…
Привет! А расскажете технических подробностей?
Какие LLM модели используете?
Запросы только на английском языке поддерживаются? Насколько хуже качество если на русском задавать?
Из каких шагов состоит evaluation process? помимо 15-30 SQL запросов
Шаг "интерпретация запроса" — в чём необходимость этого отдельного шага? Объединить со "слоём метрик" имеет смысл?
Кстати, для сравнения систем, помимо дискретного числа побед, для большей наглядности, можно посчитать средневзвешенный WER по доменам для каждой системы, т.е. ∑ (доля записей в домене от всех записей) * WER_домена
Привет!
А вы выложите куда-нибудь данные с текстами? Хочется не только WER, но и другие метрики распознавания речи посчитать
Неужели данные hh.ru с зарплатой, номерами телефонов и электронной почте есть/были в открытом доступе? О_о
100 заголовков новостей — очень маленький датасет. Большой риск переобучиться под него с коэффициентами. Как вариант — можно спарить заголовки Яндекс.Новостей и считать за бейзлайн в первом приближении — они тоже группируют похожие новости в сюжеты
Спасибо за статью. Только после прочтения об использовании word2vec и обучения моделей на статьях хабра осталось ощущение незавершенности: вот мы обручили модель с такой-то точностью, и всё. Интересно как это можно применить, или хотя бы понять-интерпретировать результат. Например топ- слов, влияющих на рейтинг статьи (хотя это можно и без ML сделать)
Accuracy, Precision, Recall NBC: (0.96, 0.9821428571428571, 0.9482758620689655)
Accuracy, Precision, Recall CDT: (0.97, 0.9824561403508771, 0.9655172413793104)
Я только начал изучать машинное обучение немного удивлён тому, что NBC классификатор реализуется достаточно просто.
Кстати, если будет интересно, я на основе твоего кода и выборки обучил решающее дерево (DecisionTreeClassifier из scikit-learn), которое показало точность 97%:
Теперь он без ошибок работает на Windows 7, пишет крутые логи сразу в HTML(с one-click заливкой на peeep.us) и умеет сворачиваться в System Tray.
Например один из логов боя пк мира Арды
На нашем проекте пока отказались из-за критикал вещей:
— баг в chromium из-за которого происходит выход из полноэкранного режима при использовании HistoryAPI
— Отсутствует возможность скроллить страницу средствами js