Вам нужно на лету сформировать заранее неизвестный JSON под конкретный документ? Если так, то почему то, что JSON каждый раз получается разным, является проблемой?
Проверьте промпт и схему на конфликт, если каждое поле описано в промпте и с таким же название существует в схеме structured outputs, то вариативности не будет. У нас за 1000+ прогонов не было кейса где llm просто взяла и прислала другой json. и везде прописаны типы данных и null как один из возможных ответов
2) я показываю что в последовательной системе ошибки перемножаются, там могли быть другие блоки это не поменяло бы суть - если ваш flow плохо работает с какой-то тематикой, мы не можем взять и вычистить ее плотностью. Эксперты разметили ответы llm поставили дизлайки на плохих кейсах, мы знаем тематики и видим что определеный раздел западает, там прям низкое качество. мы решаем не давать ответы на эту тематику, НО оркестрация не будет работать на 100%, не которые вопросы по этой тематики не попадут в мусорную группу и мы дадим плохой ответ.
Может быть, я неправильно выразился. Я хотел сказать, что нужно посмотреть, насколько оценки от LLM совпадают с оценками эксперта, чтобы понять: LLM действительно всё сваливает в корзину 4 баллов или это и правда у нас так много оценок из среднего спектра.
и еще плюс в том что это локальная мотивация (не знаю как назвать придумал термин сам, может в какой-то из книг это описано?). Кажется что премия мотивирует под дедлайны, а система геймификации поддерживает мотивацию каждый день, как думаешь?
Прикольно то что ты смог аргументировано доказать что у ребят сделали плохое демо новой фичи, но все-таки оплати подписку и поиграйся с этим, там есть источники в которое можно перейти. Было бы прикольно услышать, как это фичу можно использовать на 100 процентов, потому что кажется что потенциал очень мощный
1) на сколько я понимаю просто openai sdk (магнит остановился на Яндексе)
2) у Skyeng мне не совсем понятно как считались метрики, как они заявляют скорость создания упражнений выросла в 3 раз, но было ли у них среднее время создания таких уроков не знаю. Как считали - NDA
магнит разделял, как полагается, датасет пополам часть на обучение, часть на проверку.
Точка смотрела на использование фичи и лайки (что в их случае является хорошей валидацией):
Около половины пользователей, которые смотрели подборку собеседников, воспользовались нейросетью для приветственных сообщений.
86% из них одобряют предложенные варианты, что говорит о реальном упрощении старта общения.
{"role": "system", "content": "ты являешься профессиональным модератором, перепиши комментарий пользователя, так чтобы он стал положительным. Дальше идет комментарий пользователя:"}
Магнит дообучил ЯндексGPT на маленьком датасете, что-то вроде 1000 соответствий.
Skyeng показывают учителям конструктор, где можно накликивать нужное упражнение (захардкодженные промпты под кнопками, прожатие пары кнопок - конкатенация двух промптов).
Точка подставляет в промпт личную информацию отправителя и получателя сообщения.
Сейчас ученые приходят к мнению, что родной язык и определяет сознание, и без языка полноценного сознания не возможно. Таким образом языковые модели являются с какой-то точностью слепком части человеческого сознания...
Поскольку на фото были засняты движущееся предметы, мы можем утверждать что фото двигается
Могли бы вы попробовать сгруппировать все пункты по общей природе? Кажется, что тут не так много вариантов:
1) недостаточный или предвзятый датасет 2) дефекты в самом обучении 3) а все остальное ошибки как-будто когнитивные искажения людей, которые верят в правдивость всего что происходит в чат-бот
привет, я сейчас пишу цепочку на автогене, которая на вход принимают алгоритмическую задачку и пробует через разных агентов по разному решать, засекая время и память и записывая процесс. Может быть у тебя есть какие-то наработки, которые ты можешь дать глянуть?
Вам нужно на лету сформировать заранее неизвестный JSON под конкретный документ? Если так, то почему то, что JSON каждый раз получается разным, является проблемой?
Проверьте промпт и схему на конфликт, если каждое поле описано в промпте и с таким же название существует в схеме structured outputs, то вариативности не будет. У нас за 1000+ прогонов не было кейса где llm просто взяла и прислала другой json. и везде прописаны типы данных и null как один из возможных ответов
1) да, агент без llm это не агент ахах 👏
2) я показываю что в последовательной системе ошибки перемножаются, там могли быть другие блоки это не поменяло бы суть - если ваш flow плохо работает с какой-то тематикой, мы не можем взять и вычистить ее плотностью. Эксперты разметили ответы llm поставили дизлайки на плохих кейсах, мы знаем тематики и видим что определеный раздел западает, там прям низкое качество. мы решаем не давать ответы на эту тематику, НО оркестрация не будет работать на 100%, не которые вопросы по этой тематики не попадут в мусорную группу и мы дадим плохой ответ.
я не понял, классический волчара это человек без навыков вообще или что-то есть? цель получить 1-2 зп или перепрыгнуть Грейд?
Спасибо за уточнение.
Может быть, я неправильно выразился. Я хотел сказать, что нужно посмотреть, насколько оценки от LLM совпадают с оценками эксперта, чтобы понять: LLM действительно всё сваливает в корзину 4 баллов или это и правда у нас так много оценок из среднего спектра.
вот например здесь он кажется отлично справился - https://chatgpt.com/share/67c70af1-4a08-8008-a6e5-8bc3b7040bb4
и еще плюс в том что это локальная мотивация (не знаю как назвать придумал термин сам, может в какой-то из книг это описано?). Кажется что премия мотивирует под дедлайны, а система геймификации поддерживает мотивацию каждый день, как думаешь?
Прикольно то что ты смог аргументировано доказать что у ребят сделали плохое демо новой фичи, но все-таки оплати подписку и поиграйся с этим, там есть источники в которое можно перейти. Было бы прикольно услышать, как это фичу можно использовать на 100 процентов, потому что кажется что потенциал очень мощный
Классная статья, большое спасибо)
увидел плейлист ШМЯ 2022 года, мб лучше это посмотреть?
https://www.youtube.com/watch?v=dD7MRIdOxYQ&list=PLEs8EuAPI73A5Mwn8XcnqHibjC6EvHM_x
1) на сколько я понимаю просто openai sdk (магнит остановился на Яндексе)
2) у Skyeng мне не совсем понятно как считались метрики, как они заявляют скорость создания упражнений выросла в 3 раз, но было ли у них среднее время создания таких уроков не знаю. Как считали - NDA
магнит разделял, как полагается, датасет пополам часть на обучение, часть на проверку.
Точка смотрела на использование фичи и лайки (что в их случае является хорошей валидацией):
Около половины пользователей, которые смотрели подборку собеседников, воспользовались нейросетью для приветственных сообщений.
86% из них одобряют предложенные варианты, что говорит о реальном упрощении старта общения.
{"role": "system", "content": "ты являешься профессиональным модератором, перепиши комментарий пользователя, так чтобы он стал положительным. Дальше идет комментарий пользователя:"}
там все просто, везде один вызов llm:
Магнит дообучил ЯндексGPT на маленьком датасете, что-то вроде 1000 соответствий.
Skyeng показывают учителям конструктор, где можно накликивать нужное упражнение (захардкодженные промпты под кнопками, прожатие пары кнопок - конкатенация двух промптов).
Точка подставляет в промпт личную информацию отправителя и получателя сообщения.
Спасибо 🖤
Поскольку на фото были засняты движущееся предметы, мы можем утверждать что фото двигается
Могли бы вы попробовать сгруппировать все пункты по общей природе? Кажется, что тут не так много вариантов:
1) недостаточный или предвзятый датасет
2) дефекты в самом обучении
3) а все остальное ошибки как-будто когнитивные искажения людей, которые верят в правдивость всего что происходит в чат-бот
Как вы считаете?
модель Sora училась только на видео с пролетами??
ладно, я все-таки спрошу. кот преподаватель, НО только один ученик кот, все остальные люди. поч?
походу no-code LangChain
привет, я сейчас пишу цепочку на автогене, которая на вход принимают алгоритмическую задачку и пробует через разных агентов по разному решать, засекая время и память и записывая процесс. Может быть у тебя есть какие-то наработки, которые ты можешь дать глянуть?