Комментарии 12
Напиши справку о Томской научной конференции по квантовой агрономии 2019 года: участники, доклады, итоги
Пздц
Даже самые дешёвые модели даже с отключением поиска в интернет ответят верно
Зависит от пост-тренинга. Если модель штрафовали за галлюцинации - а поисковые и чатбот модели ориентированные на формат вопрос-ответ обычно штрафуют - то будет отказываться. Если не штрафовали - а "креативные" модели не штрафуют - то нет. Может Вам оно для книжки с сеттингом в альтернативной истории надо.
Емнип это вообще базовая модель без пост-тренинга была, если так - и если Яндекс её у себя и крутит, то понятно, что она не фильтрует выход - фильтра просто нет
Из статьи стало ясно, что гигачад и прочие алисы, не то что не могут в агентскую работу, но даже составлять таблички им порой не одолеть...
Особенно вот это впечатлило:
Сначала я попробовал в кодинге: я подключил её в VSCode и попросил взять наш текущий проект и сделать архитектурное подробное описание. Увы, модель напридумывала фреймворки и стеки, которые у меня не используются.
По сути показывает, что модель беспомощна при написании кода и сразу тонет в собственных галлюцинациях.
Выводы лично для меня: новая модель честно говоря меня удивила.
Уважаемый автор, у Вас выводы для читателей отсутствуют. А, как минимум, ряду читателей сначала их желательно изучить, чтобы понять, что именно в статье есть смысл читать. Просьба всё же их делать.
P.s. Вы бы хоть суммировали кратко, чем удивила-то:-)
Я вынужден извиниться, дело в том что последние статьи модерация просто удаляет ссылки. Я не знаю в чем причина, ведь www это и есть ссылки на самом деле. Но в этой статье была ссылка на статью в инфостарт, где они использовали gigachat 3.5 в качестве ии-агента для 1C, и получили результат 0 из 5. Гуглите слова "infostart GigaChat 3.5 агент 1C". У меня же результат пожалуй 8 из 10. И это действительно удивительно, если учесть что предыдущая модель в этой линейке вообще не работала в моем бенчмарке(ссылку опять же боюсь давать: это одна из причин бана, мол, я тут свой сервис рекламирую), модель не соответствовала описанию, а недельное общение с поддержкой пошло по кругу: они просто просили сделать то что я уже попробовал.
Если говорить совсем глобально: у нас наконец-то есть суверенная модель, которую можно использовать в проде в качестве ии-агента, но с большими оговорками.
Похоже статью писала тоже эта же модель - бессмысленную и бестолковую.
Спасибо, интересно почитать реальные кейсы. Еще интереснее было бы посмотреть бенчмаркинг математическими тестами

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва