Информация
- В рейтинге
- 192-й
- Откуда
- Россия
- Зарегистрирован
- Активность
Специализация
Ученый по данным
Ведущий
Deep Learning
Машинное обучение
PyTorch
NLU
Обработка естественного языка
Управление людьми
Управление проектами
ООП
Алгоритмы и структуры данных
C++
Приветствую!
До 5-ти файлов за один запрос.
Приветствую!
Ухх, Вы общались с чатовой Алисой еще на самом старте, круто!
Приветствую!
Харнесс заточен под определенные модели, чтобы давать лучшее качество, поэтому выбор модели пользователю не отдаем.
Приветствую!
Понимаю реакцию, и спасибо, что написали. Агент ищет только по открытым источникам, то есть по тому, что уже проиндексировано и доступно в обычном поиске, никаких закрытых баз у него нет. Но понимаю, что собранное в одном месте выглядит иначе. Если не сложно, пришлите в ЛС ссылку на диалог - посмотрим, что именно он собрал и откуда.
Приветствую! Спасибо за репорт, мы еще работаем над следованием инструкциям пользователя. Если не сложно, пришлите в ЛС ссылку на расшаренный диалог - посмотрим.
Приветствую!
О, вижу, вы внимательно читали статью, спасибо)
Отвечу по порядку.
Классификатор релевантности сниппетов
Мы собрали обучающую выборку и бенчмарк и обучили отдельную модельку. На входе: диалог + ИК (инфоконтекст) + метаданные ИК. На выходе классическая вероятность релевантности.
Свежие тиры поиска
Про подробности работы поисковой ручки, скорее, не смогу ответить, т. к. этим занимается команда поиска. По поводу противоречия разных ИК: мы для каждого ИК показываем модели дату его публикации, что помогает выбрать более свежий при противоречии.
Экстрактор инфоконтекстов
Да, тут вы правильно ссылку приложили, в статье коллег как раз есть подробности. Было ли там BIO или IO, не в курсе, зависит от постановки задачи. Формат - JSON. Определенные защиты от промпт-инъекций, конечно, есть, но про них рассказывать не могу. Да, если ИК не хватает, то агент может выгрузить полный HTML (там тоже есть регулировка, какой объем выдавать). По поводу превышения контекста: на него есть отдельный бюджет + compact, в статье есть про это.
Планирование
Генерировать несколько перефразированных поисковых запросов пробовали, сейчас это не докидывает, но докидывает искать одновременно в разные области. Мы пробовали также убирать планирование: это не просаживало общие метрики, но появлялись некоторые проблемы другого характера (например, проблема удержания контекста), поэтому планирование нам сейчас помогает.
Structured Output
Сейчас не применяем, с форматом нет проблем. Мы решили не ставить ограничение для модели отвечать строго по контексту, т. к. современные модели имеют очень много информации в своих весах, и поиск, по сути, нужен только для свежести или очень глубоких фактов. Нет, не самая мощная модель для ответа, т. к. у нас стояла задача выдержать большой поток запросов на ограниченном кол-ве GPU.
Промпты
У нас все на русском языке. Промпты пишем сами (ML/ML-аналитики) или используем системы автоматического улучшения промптов вроде GEPA.
Рой агентов
Вот прям рой агентов с обменом идеями пока не пробовали, но это ровно то направление, в которое мы хотим идти.
Спасибо за фидбэк, рады, что Вам заходит!
Приветствую!
Да, это ровно наш первый подход с CodeAgent. Мы от него ушли, но индустрия - нет. Еще есть похожий подход Search as Code, но у нас он не взлетел.
Приветствую!
У нас есть ряд экспериментов, один из которых вам очень повезло поймать :) надеюсь, коллеги расскажут скоро тоже.
Приветствую!
Не совсем понял вопрос, нужна бригада. Мы изначально все разрабатывали и хостили прод на серверах Яндекса (внутренняя сеть). Единственный сервис, который не во внутренней сети Яндекса - CodeSandbox, он хостится в Yandex Cloud. Сделано это для безопасности, чтобы не исполнять код, сгенерированный LLM (считаем его UGC), во внутренней сети.
Приветствую!
OpenCode - как раз хороший пример харнесса с настройками под разные модели. Посмотрите в исходники: там разные промпты, схемы инструментов и т. д. под каждое семейство моделей. Вы как пользователь этого можете не замечать, потому что разработчики заботятся о поддержке новых моделей и делают для вас опыт бесшовным. По поводу модели в 7m параметров - тут зависит от того, для какой задачи вы её планируете применять и какая архитектура. Если сравнивать с LLM (миллиарды параметров и выше), 7m - это малая модель, и под неё точно нужны будут хорошие обвязки.
Приветствую!
Интересные результаты. Подскажите плиз замеряли ли более популярные бенчи (HLE, BrowseComp, GAIA, DSQA, WideSearch)?
Да, тот же вопрос. Нашел под кнопкой "Исследовать" только предыдущую версию (baseline?). Было бы интересно попробовать.
Спасибо за отзыва!
Согласен, наличие источника не гарантирует правильно ответа. Зато есть возможность пойти в первоисточник и проверить корректность факта, а также узнать больше информации о нем.
Привет! Кажется, GigaChat предпочитает bash ;) А если серьезно, мы работаем над повышением качества генерируемого кода на разных языках, в том числе и на скриптовом языке powershell. Прошу вас оставить обратную связь, если генерация была неудачная.
Привет! Да, конечно, это может быть любая БД или другой источник данных. Пример работы со своим источником данных в библиотеке GigaChain (библиотека пока в альфа версии).
Привет! Да, есть пример в библиотеке GigaChain (библиотека пока в альфа версии).
Привет! Это срабатывает цензор. Если вопрос невинный, стоит попробовать начать новый диалог. Мы работаем над уменьшением количества false positive срабатываний цензора.
Привет! Специальный промпт нужен только если используете GigaChat через API и хотите, чтобы GigaChat использовал знания из Вашей поисковой системы.
А если Вы задаете вопрос в GigaChat через https://developers.sber.ru/gigachat/, то можно просто задать вопрос. Правильный промпт с поисковой выдачей сформируется внутри нашего сервиса автоматически, а Вы получите уже готовый ответ.