Обновить

Сравнение Алисы (Яндекс) и Гигачат (Сбер) по 5 бенчмаркам: τ³, ПРАКТ-120, MultiChallenge, WildBench и Arena‑Hard

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.7K
Всего голосов 8: ↑6 и ↓2+4
Комментарии14

Комментарии 14

В большинстве подобных задач решает агентная обвязка, а не веса модели.

Вы совершенно правы. Обвязка бралась стандартная. Ни Алиса, ни Гигачат обвязку не дают (по крайней мере я не нашел где ее взять), поэтому для Алисы использовались обвязка ее стандартная, для Гигачата - те стандартные, что нашлись к бенчмаркам.

Зачем это? Вы типа к чебурнету готовитесь? Есть же нормальные модели и нормальные инструменты.

Вам чем-то мешает исследование возможностей отечественных моделей?

И да, к чебурнету стоит приготовиться, законы о запрете иностранных ИИ уже готовятся. И огромное количество структур - госы, силовики, медики, разработчики суверенного софта и многие другие уже не могут пользоваться иностранными ИИ, и дальше будет только жестче.

И дело даже не в умении ВПН настроить или прокси поднять. Дело в том, что очень большое количество компаний уже сейчас не готово отправлять свои данные в иностранные ИИ.

Подготовка к Чебурнету - это правильно :(

Но "большое количество компаний уже сейчас не готово отправлять свои данные в иностранные ИИ" - скорее лукавство. Нет никакой опасности на серверах в РФ запускать буржуйские модели. Каких только весов не выкладывают в открытый доступ.

Но законы требуют модели, правильно отвечающие на чувствительные вопросы. И это не про "враги узнают секреты".

Это не лукавство, это из первых рук. И да, сложности никакой нет, но если вы какая-то гос клиника (а теперь уже и не только гос, а любой мед), или отдел в службах, или военное подразделение - вы не будете этим заниматься. Вы думаете об айтишниках, а их на самом деле не так много по сравнению со всеми остальными.

Да, кто-то что-то развернет. Но кто и где? Кто будет иметь доступ к чувствительной информации? Кто там админит? Кто поднял? Это все не так тривиально.

Я вообще предпоалагаю что будет что-то типа ГосИИсуверенплатформ, с регистрацией через Госуслуги, с Госключом, на Госкоблаке - вот таким госсуверенным можно будет пользоваться. Будут ли туда допускаться иностранные модели, даже не смотря на свободные веса? Очень сомневаюсь. Кто остается? Те кто в тестах, скорее всего.

Вообще-то я как раз про то же самое. Что будет условный "ГосИИсуверенплатформ", надо готовиться к Чебурнету...

Я лишь не согласен с почему "врядли туда будут допускаться иностранные модели, даже не смотря на свободные веса". Отнюдь не из-за "враги узнают секреты".

Придется пользоваться все равно буржуйским старьем, только дообученным с приоритетом на "официально одобряемые ответы".

Вы же не считаете, что Алисы с Гигачатами "с нуля" собирались? Помню я прекрасно как всякие Шедеврумы на запрос "коренной житель" рисовали индейца (native american же). И сейчас на "разночтениях рус/англ" сплошь и рядом ловятся.

Так нечестно, Вы сравниваете проекты, которые "на честном слове" пытаются развить энтузиасты с проектами в которые вложены многие миллиарды как денег так и человеко-часов. Президент призвал "внедрять, адаптировать и продвигать", но "денег нет и держимся"... База-то в железе: пока "своё" не станет "лидирующим" - так и будут что Яндекс, что Сбер - на "карточках с Авито" что-то пытаться наваять.
Дальше: какие могут быть достижения у ИТ-спецов, если им по политическим причинам рубят связь, то есть возможности "перенять и развить" и "дать мысль другим на изучение"
В-общем пока это даже не "догонялки", но мы надеемся на лучшее (вот расстреляют ворье и заживем)

По-моему, автор как раз честно поступил. Не сравнивал "это" даже с китайскими квенами. Только между собой.

А что известно про Алису с технической точки зрения? Про Сбер известно: что своего, что чужого. А про Яндекс - не особо. У них вообще это подразделение русское, или международное?

Имхо, лишком чувствительная тема, поэтому нет доверия таким тестировщикам. Сорри.

Недавно прошла волна набросов на Алису и Гигачат.В VC.ru выкладывали перепечатку поста из X с дипфейком про Алису от псевдоГрефа с почти единодушными поддакиваниями около двухсот комментаторов.

Открытый фэйк невыдерживающий критики и ноль сомнений в комментах. И это на околотехническом сайте. Но почти все читатели вдруг одномоментно лишились способности оценивать информацию...

После здесь же на Хабре в комментах под статьей от авторов Алисы как понял, некто вбросил почти то же самое с некоторыми изменениями об Алисе и Гигачат. Возражений от автора тогда не видел. На что и был расчет для ссылок, так как откровенный фэйк с vc.ru с его "не рефлексируйте, распространяйте" бесполезен.

Нп этом нездоровом фоне тема слишком горячая, чтобы доверять таким случайным тестам.

Имхо независимые тесты нужны. Но в условиях инфовойн к ним больше требований, чем обычно.

Вы сможете скачать архив с результатами и посмотреть детали каждого теста. Или повторить его самостоятельно. Это займёт всего пару недель.

Какой именно это гигачат? Ультра есть 3.5, если 3, есть вообще неделю назад выпущенный reasoning вариант. Это ж не условная астра про которую все знают и которая такая одна, ну указывайте нормально идентификатор модели, пожалуйста. Макс это что, второй который? Зачем его бенчить вообще, он неюзабельный был сразу на момент выхода...

3.5 ультра и 3.5 Макс. Нужно было уточнить, да. Спасибо, попозже добавлю в статью.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации