Обновить

Прогнали GigaChat 3.5 по реальным кейсам: Результаты большого тест‑драйва

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели9.2K
Всего голосов 8: ↑8 и ↓0+8
Комментарии12

Комментарии 12

Напиши справку о Томской научной конференции по квантовой агрономии 2019 года: участники, доклады, итоги

Пздц

Даже самые дешёвые модели даже с отключением поиска в интернет ответят верно

Зависит от пост-тренинга. Если модель штрафовали за галлюцинации - а поисковые и чатбот модели ориентированные на формат вопрос-ответ обычно штрафуют - то будет отказываться. Если не штрафовали - а "креативные" модели не штрафуют - то нет. Может Вам оно для книжки с сеттингом в альтернативной истории надо.

Емнип это вообще базовая модель без пост-тренинга была, если так - и если Яндекс её у себя и крутит, то понятно, что она не фильтрует выход - фильтра просто нет

Из статьи стало ясно, что гигачад и прочие алисы, не то что не могут в агентскую работу, но даже составлять таблички им порой не одолеть...

Особенно вот это впечатлило:

Сначала я попробовал в кодинге: я подключил её в VSCode и попросил взять наш текущий проект и сделать архитектурное подробное описание. Увы, модель напридумывала фреймворки и стеки, которые у меня не используются. 

По сути показывает, что модель беспомощна при написании кода и сразу тонет в собственных галлюцинациях.

Но я не дописал ещё кое-что: я поставил температуру 0.1, и тут полетели ошибки - баланс. Я пополнил баланс, но запросы все равно летели ошибочные.. В общем, бросил я на тот момент это дело. Но я думаю что попробовать при строгой температуре стоит.

Выводы лично для меня:  новая модель честно говоря меня удивила. 

Уважаемый автор, у Вас выводы для читателей отсутствуют. А, как минимум, ряду читателей сначала их желательно изучить, чтобы понять, что именно в статье есть смысл читать. Просьба всё же их делать.
P.s. Вы бы хоть суммировали кратко, чем удивила-то:-)

Я вынужден извиниться, дело в том что последние статьи модерация просто удаляет ссылки. Я не знаю в чем причина, ведь www это и есть ссылки на самом деле. Но в этой статье была ссылка на статью в инфостарт, где они использовали gigachat 3.5 в качестве ии-агента для 1C, и получили результат 0 из 5. Гуглите слова "infostart GigaChat 3.5 агент 1C". У меня же результат пожалуй 8 из 10. И это действительно удивительно, если учесть что предыдущая модель в этой линейке вообще не работала в моем бенчмарке(ссылку опять же боюсь давать: это одна из причин бана, мол, я тут свой сервис рекламирую), модель не соответствовала описанию, а недельное общение с поддержкой пошло по кругу: они просто просили сделать то что я уже попробовал.

Если говорить совсем глобально: у нас наконец-то есть суверенная модель, которую можно использовать в проде в качестве ии-агента, но с большими оговорками.

Похоже статью писала тоже эта же модель - бессмысленную и бестолковую.

Вот это сейчас было обидно, если учесть что я только вышел из бана за обработку предыдущей статьи ИИ, и эта статья написана 100% мной, т.к. модерация разглядывала её в лупу...

Нет разницы, чем писалась плохая статья.

Спасибо, интересно почитать реальные кейсы. Еще интереснее было бы посмотреть бенчмаркинг математическими тестами

Благодарю за поддержку.

Ну, мат тесты обычно к бизнес-задачам отношения не имеет. А вот выложить пост про сравнение рисование(картин) кодом - выложу!

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации