
Комментарии 7
Недавно я искал смартфон со специфическим списком параметров
1 - обязательно возможность разблокировки загрузчика,
2 - возможность установки одной из свободных ОС ( GrapheneOS , LineageOS , AOSP )
3 - возможность подключения монитора по проводу ( не Miracast, и не подобное беспроводное )
И еще штук пять параметров, вроде размера экрана, объема батареи, возможность беспроводной зарядки, степень защиты от влаги и пыли, срок доставки, диапазон цен.
Так вот, оказалось, что в наш век развитых систем обработки данных, очень сложно составить такую выборку.
Все магазины - лишь малую часть моих требований позволяют указать в фильтрах.
Мне пришлось заставлять LLM искать товары и строить отчеты о наличии, ценах и параметрах.
Но в результате, я понял, что пользоваться таким отчетом невозможно - слишком много вымышленных или устаревших данных в нем.
Написал это сейчас с надеждой на то,что те люди которые занимаются реализацией подобных технологий поиска товара, обратят внимание на проблему.
На пять вопросов о том, как проверить айфон и не купить подделку, две трети ссылок получили СМИ и обзорные сайты. Статьи из блогов магазинов тоже попадают в ответы, но реже: 13 ссылок из 85. Разделов каталога и карточек в этих ответах нет.
По моему логично. Тут должны быть статьи и посты блогов.
Скажем так - а вы точно понимаете, как работает ИИ? Откуда в нем данные, как они туда попадают?
Сколько идет обучение модели?
С того момента, на данных которого обучали модель, прошло несколько месяцев. За это время сменились модели телефонов, условия оформления и доставки, а уж наличие...
Далее идет прикрепленный поиск - яндекс, гугл и т.д. Но они, во-первых, пользуются своим индексом, а это значит, что страницы не все, индексировались кто когда и проч. И, во-вторых, даже нормальный rag из них собрать уже слишком накладно, поэтому там уже достаточно упрощенный поиск. Поэтому в ответах, в основном, будут давно лежащие неизменно страницы.
А вы хотели, чтобы ИИ включала актуальные данные из поисковика, да еще и шла краулерить все недостающее. И при этом все это было на уровне не менее rag, а то и модель была дообучена :)
ПС. Все равно скоро это изменится - "сео-оптимизаторы" (для которых давно отдельный котел) ломанутся впихивать свои страницы в ии, и на выдаче вы будете получать традиционный seo-слоп вместо актуальных данных, устаревший на полгода минимум.
Современные ИИ-сервисы уже года два как не просто дают доступ к единожды обученной и замершей в развитии LLM.
Там под капотом стоит система оркестрации агентов, в том числе - умеющих да, тянуть данные из поисковика. Точнее, поисковиков, в том числе специализированных, умеющих искать по картинке и т.д., но главное - именно из внешних для нейронки сервисов.
И запрос в поисковики идёт прямо по ходу инференса, никакого своего индекса эти сервисы не держат, так что результат поиска настолько свежий, насколько это может позволить Гугл/Яндекс/нужное подставить.
А я как-то иначе написал?
То, что вопрос в поисковик идет "прямо из инференса" (на самом деле, конечно, не из инференса, а между ними) означает, что в самом лучшем случае вы получите в этом месте ту же информацию, что и в поисковике. А то и хуже. Ваша модель возьмет не более того, что знает поисковик. А изначальный пост был про то, как бы здорово было, чтобы ИИ перелопачивал для вас полинтернета в реальном времени.
Интересно, нужно будет попробовать тоже самое
Продвижение интернет‑магазина в ответах ИИ: почему нейросети почти не ссылаются на карточку товара