Обновить
8K+
347
Alexander Veysov@snakers4

Machine Learning / Data Science

31,1
Рейтинг
455
Подписчики
Отправить сообщение

Грубо говоря, можно ли "захардкодить" контекст для ограниченного набора слов?

Ещё проще, кмк, вместо ИИ подключать ЕИ. Т.е. все места с потенциальной ошибкой вывести пользователю для ручной простановки ударения. Если он, конечно, соответствующий флаг в true поставил. :)

Если бы мы заранее знали места с ошибкой, мы бы не делали ошибок) Слова, которые лучше не считать омографами, где плохие метрики или где получается какая-то хрень — мы убрали априори.

А чем это по сути отличается от:

При этом остальная логика работы сохраняется, а приоритеты выставлены следующим образом:

  1. Поиск по пользовательским регулярным выражениям;

  2. Поиск по пользовательским словосочетаниям;

  3. Поиск по "встроенным" словосочетаниям;

  4. Если ничего так и не нашлось, отправляем в нейросеть-классификатор.

Ведь по сути это оно и есть. Единственное, что вывести для "ручной простановки" — это немного идеологии библиотеки противоречит. Ну то есть мы делаем парсер, он на фоне внутри downstream приложений решает свою задачу и очень мало кушать просит.

А если вы хотите свой краевой кейс предложенными инструментами разобрать — теперь вы можете. Словосочетания и регулярки — это довольно гибкий инструмент, им можно многое разобрать из частотных примеров.

Понятно, что грамматические / морфологические омографы тут грустят и смысловые омографы немного грустят, но, к сожалению, таков путь.

Я предостерегаю. Просто обидно, когда ты выиграл в конкурсе 50к, а выигрыш получить не можешь, потому что почему-то нужно такие подробные персональные данные для якобы российской компании почему-то передать через почтовый ящик кипрской компании… а она по российским законам не отвечает и никакого договора об их обработке подписывать не хочет.

Данные точно также передаются через кипрскую компанию как и в прошлый раз? Как отозвать обработку своих персональных данных после их передачи?

Список данных это вот это, буквально парой сообщений выше:

То есть нужно будет отправить указанный выше список ПД на электронную почту кипрской компании (`@habr.team`), не подписав с ней никакого договора об обработке ПД?

Средства на счёт поступят от российской компании? Можно ли получить средства на счёт ООО или ИП, не отправляя эти ПД? Можно ли получить средства за прошлый конкурс на счёт ООО или ИП?

Автор, конечно, безумец, в хорошем смысле. Но я не согласен с постановкой задачи.

С одной стороны ранние серии "Тома и Джери" — действительно классика анимации и озвучки. Все изучают классическую музыку по этому мультику.

Но как мне кажется любовь автора и сотни часов залитые в эту работу немного не в коня по целому ряду причин:

  • Магия мультика перестаёт работать на каком-то сезоне, где оригинальных творцов заместили "креаторы". То есть спасать можно не только лишь всё;

  • Зачем переозвучивать такой мультик — большой вопрос. В нём говорят ну очень мало и на понимание это почти не влияет. Субтитры тут только увеличивают погружение. Да камон, я даже когда не знал английский и так ребёнком понимал, что они говорят. А взрослый человек, которые даже не владеет свободно и так поймёт 95% "шекспировских диалогов". Вы что аниме смотрите в переозвучке???;

  • Если даже оригинальная оцифровка плёнки неидеальная, я знаю как минимум два способа вообще не париться и получать удовольствие: смотреть на проекторе или смотреть на менее качественном экране (на старом большом телеке с ЭЛТ). Проектор попроще наверное будет. И там как раз разделение по цене идёт в районе FHD. Проектор классно сглаживает проблемы картинки анимации;

  • Ну и на вкус и цвет фломастеры разные, лучше бы спасать и нести в массы советские мультики, но тут фломастеры разные просто.

Ну и чисто вкусовщина, посмотрел видосики в 4К, что автор выложил как примеры. Ремастеры выглядят более чётко, но они какие-то "рваные" или "дёрганые" (мерцают чуть при быстром движении). Скорее всего нейросетки или алгоритмы как-то вмешиваются в "магию" анимации. Там есть определённые правила классической анимации, и видимо, когда алгоритм что-то подчищает, появляется эффект дрожания.

Нет, я не троллю. Если российская компания не может мне легально перевести деньги, ну переведите нашим бойцам на гуманитарку. Не можете им, ну отдайте на благотворительность, я буду рад, какая-нибудь бабушка получит операцию или лекарств.

Открою тайну как раньше ТОТ ЖЕ ХАБР это делал. Ну накопилось у меня МНОГОДЕНЕГ на ППА когда-то в бородатом году. Просят список данных в пол. Я, конечно, не хочу их давать. Спрашиваю, а точно-точно нет нормального способа. И естественно он есть. Можно просто перевести на счёт ИП моего партнёра или на счёт нашего ООО и ноль проблем.

Отсюда я спрашиваю Сбер, а выплаты тоже будут от Сбера от иностранного юрлица или с тонной ненужной приватной информации?

Просто не повторяйте мой опыт, я уже потерял так 50к рублей у меня на ППА сейчас 40к висит. И я не могу получить их от российской компании, лол.

на протяжении последних 20 лет это 'абсолютная норма'

Это не норма. И с этим стали бороться как минимум с высшего уровня. Поинтересуйтесь, например, историей с Домодедово.

Нет, я абсолютно серьёзен. Вот чуть подробностей. Если вы не верите, могу переписку показать.

Зачем мне передавать такие сверхдетальные (и явно избыточные) персональные данные на домен, принадлежащий кипрской компании, и русская компания ссылается на какую-то оферту, которую никто до этого не видел и отказывается подписать договор о ПД.

Ну вот я и спрашиваю организаторов как будет. Т.к. в прошлый раз, мой немалый приз (50к рублей) просто пропал.

Поднял переписку — там хрен разберешься. Письмо с запросом этих реквизитов мне пришло с имейла habr.team, а это кипрская компания. При это оферта была повешена на русскую ООО.

При этом как-то внятно ответить мне зачем мне на имейл кипрской компании слать данные для русской компании по оферте, которую я "якобы подписал" — мне не ответили. Также мне не ответили, почему я не могу подписать хотя бы договор об обработке ПД (чтобы их сразу потом отозвать) с русской компанией. На благотворительность или бойцам — перевести тоже нельзя.

Сплошные тайны. Но зато мой приз мне простили.

Задал вопрос менеджеру, она прочитала и пока молчит.

При этом данные по сути передавались кипрской компании, договор об обработке ПД подписать они отказались. Я не жадный, попросил перечислить мой приз нашим бойцам или на благотворительность — мне отказали.

Я был участником прошлого похожего конкурса "Сезон ИИ в разработке". Подал неплохую статью, вроде как что-то выиграл. Чтобы забрать приз оказалось, что "я уже подписал" (хотя мою подпись на бумаге или ЭЦП мне не показали) какой-то договор (естественно он оказался офертой за ссылкой в статье, которую отредактировали задним числом, в форме не было никакого подписания оферты) с их кипрской компанией и чтобы забрать приз я должен передать ей чувствительные персональные данные.

Альтернативных способов забрать приз (допустим от российского юрлица, через СБП или наличными) или просто чтобы мой приз передали нашим бойцам в качестве материальной помощи — организаторы не предусмотрели и мой приз пошёл по миру.

Поэтому мой вопрос — а призы опять будут через передачу чувствительных персональных данных левой кипрской компании, которая даже договор на обработку ПД не хочет подписать, или будет нормально?

Тут, как говорится, максимальный репост, так как я вообще не знаю, где теперь пиарить технические проекты, хабр состоит из слопа чуть менее, чем полностью, а в телеге все стухло или AGI слоп тоже.

Теперь у сообщества также есть возможность поучаствовать в разработке и поддержке проекта минимальными ресурсами без вникания в тонкости — можно собирать и присылать свои словари словосочетаний и регулярки и тестировать их непосредственно в библиотеке.

Всего так не покроешь, но какие-то краевые случаи или бесячие хотфиксы можно очень быстро закрыть. Понятно, что никто не мешает делать такие проверки самому (наша библиотека сохраняет авторские ударения), но тут скорее пытаемся забайтить сообщество помогать в развитии библиотеки.

Мы естественно пробовали в этом направлении копать. Очень шумно выходит. Плюс не хочется зависимости тащить лишние.

Уже это уже легендарное слово.

Еще бы завести понятие сессии. Имя — книгоспецифичное явление. Но это действительно, пусть пользователь решает другими средствами.

Ну просто 2 объекта и 2 json и юзер что угодно может делать.

Смысловые и морфологические омографы, это две разные предметные области, а не одна, собственно омографы. Уж очень сильно они отличаются. Если их разделить, подобранные для каждой архитектуры сеток/датасетов, покажут себя намного лучше, чем если попытку разобрать эти различия возложить на одну. Причем легче по ресурсам.

Ну да, всё так. Чисто члены предложения и части речи по идее разбирают библиотеки типа Наташи. Но их особо никто не поддерживает и их по сути одна (парочка). Это не "модно".

Появилось ли у вас разделение подходов разрешения по типу омографа?

Ну мы используем десятки разных источников данных.

 Важны морфологические формы контекста. Можно обойтись без разметки.

Это всё прекрасно, но тогда всё сводится к наличию парсера морф. форм этого самого контента. А парсеры мягко говоря никто особо не разрабатывает, они все древние, неидеальные и много кушают.

Смысловые — меняется как форма, так и смысл, — скорее важен сам контекст. Вплоть до раздельного обучения.

Тут без нейросетей — никуда, к сожалению.

Собственные — О́дин, Ангара́, Ма́ша, Ва́ля — достаточно позиции в предложения и регистра, вместо исключения из списка омографов.

Мы исходим из того, что пользователь не обязательно будет соблюдать регистр (особенно при формировании текста для озвучки!). А так регистр и позиция … это как раз (барабанная дробь) же регулярка! Ну то есть по идее комьюнити может тут регулярок докинуть.

Также удивило первое же слово из технического списка тем, что люди путаются. 1. ед, населенный пункт: выехал из села́; 2. мн, населенный пункт: города и сёла; 3 жр, действие: се́ла в машину. Вначале прогон по смыслу, потом по форме.

Ну это "кандидат" в омографы. И это редкий "тройной" омограф ещё и с буквой ё. Какая красота.

В системе заложена логика профилей скорости под разные погодные условия - условно «солнце», «дождь» и «гололёд», - которые задают более жёсткие ограничения по разгону и требуют закладывать больший тормозной путь. Прогноз погоды система напрямую не получает, профиль обычно выбирает сам водитель вручную, и не факт, что делает это всегда добросовестно.

Беспилотный трамвай в Петербурге: что изменилось за 4 года промышленной эксплуатации

Ничего не имею против системы, которая бы страховала водителя трамвая от аварий и наездов на пешеходов (японцы в машины такое ставят уже лет 10), но название статьи следовало поменять на что-то более релевантное, например "Наш опыт 4 лет промышленной эксплуатации систем помощи водителям трамваев в СПБ на базе 350 вагонов" (нужно сократить и отполировать, понятное дело).

То, что система — помогайка водителю трамвая я по факту увидел уже в середине блока комментериев. Статью саму по себе это не делает хуже, просто происходит по факту обман читателя.

Я удалённый комментарий, конечно же прочитал. Но тут получилось, как мне кажется, очень иронично. Отвечу цитатой из вашей же статьи:

Дисклеймер: текущие LLM‑возможности позволяют детектировать «жирный» слоп. Но оценка может быть субъективной, и возможны ошибки, никогда не доверяйте оценке слепо: это обоюдоострый меч. 

Ну можно же банально проверять, что вы копипастите.

Попросите их выбрать ещё самый близкий язык к их языку и попробовать кросс-языковую генерацию потыкать, то есть голос с близкого языка на своём родном. Результат может удивить.

1
23 ...

Информация

В рейтинге
264-й
Зарегистрирован
Активность