Комментарии 14
В большинстве подобных задач решает агентная обвязка, а не веса модели.
Зачем это? Вы типа к чебурнету готовитесь? Есть же нормальные модели и нормальные инструменты.
Вам чем-то мешает исследование возможностей отечественных моделей?
И да, к чебурнету стоит приготовиться, законы о запрете иностранных ИИ уже готовятся. И огромное количество структур - госы, силовики, медики, разработчики суверенного софта и многие другие уже не могут пользоваться иностранными ИИ, и дальше будет только жестче.
И дело даже не в умении ВПН настроить или прокси поднять. Дело в том, что очень большое количество компаний уже сейчас не готово отправлять свои данные в иностранные ИИ.
Подготовка к Чебурнету - это правильно :(
Но "большое количество компаний уже сейчас не готово отправлять свои данные в иностранные ИИ" - скорее лукавство. Нет никакой опасности на серверах в РФ запускать буржуйские модели. Каких только весов не выкладывают в открытый доступ.
Но законы требуют модели, правильно отвечающие на чувствительные вопросы. И это не про "враги узнают секреты".
Это не лукавство, это из первых рук. И да, сложности никакой нет, но если вы какая-то гос клиника (а теперь уже и не только гос, а любой мед), или отдел в службах, или военное подразделение - вы не будете этим заниматься. Вы думаете об айтишниках, а их на самом деле не так много по сравнению со всеми остальными.
Да, кто-то что-то развернет. Но кто и где? Кто будет иметь доступ к чувствительной информации? Кто там админит? Кто поднял? Это все не так тривиально.
Я вообще предпоалагаю что будет что-то типа ГосИИсуверенплатформ, с регистрацией через Госуслуги, с Госключом, на Госкоблаке - вот таким госсуверенным можно будет пользоваться. Будут ли туда допускаться иностранные модели, даже не смотря на свободные веса? Очень сомневаюсь. Кто остается? Те кто в тестах, скорее всего.
Вообще-то я как раз про то же самое. Что будет условный "ГосИИсуверенплатформ", надо готовиться к Чебурнету...
Я лишь не согласен с почему "врядли туда будут допускаться иностранные модели, даже не смотря на свободные веса". Отнюдь не из-за "враги узнают секреты".
Придется пользоваться все равно буржуйским старьем, только дообученным с приоритетом на "официально одобряемые ответы".
Вы же не считаете, что Алисы с Гигачатами "с нуля" собирались? Помню я прекрасно как всякие Шедеврумы на запрос "коренной житель" рисовали индейца (native american же). И сейчас на "разночтениях рус/англ" сплошь и рядом ловятся.
Так нечестно, Вы сравниваете проекты, которые "на честном слове" пытаются развить энтузиасты с проектами в которые вложены многие миллиарды как денег так и человеко-часов. Президент призвал "внедрять, адаптировать и продвигать", но "денег нет и держимся"... База-то в железе: пока "своё" не станет "лидирующим" - так и будут что Яндекс, что Сбер - на "карточках с Авито" что-то пытаться наваять.
Дальше: какие могут быть достижения у ИТ-спецов, если им по политическим причинам рубят связь, то есть возможности "перенять и развить" и "дать мысль другим на изучение"
В-общем пока это даже не "догонялки", но мы надеемся на лучшее (вот расстреляют ворье и заживем)
А что известно про Алису с технической точки зрения? Про Сбер известно: что своего, что чужого. А про Яндекс - не особо. У них вообще это подразделение русское, или международное?
Имхо, лишком чувствительная тема, поэтому нет доверия таким тестировщикам. Сорри.
Недавно прошла волна набросов на Алису и Гигачат.В VC.ru выкладывали перепечатку поста из X с дипфейком про Алису от псевдоГрефа с почти единодушными поддакиваниями около двухсот комментаторов.
Открытый фэйк невыдерживающий критики и ноль сомнений в комментах. И это на околотехническом сайте. Но почти все читатели вдруг одномоментно лишились способности оценивать информацию...
После здесь же на Хабре в комментах под статьей от авторов Алисы как понял, некто вбросил почти то же самое с некоторыми изменениями об Алисе и Гигачат. Возражений от автора тогда не видел. На что и был расчет для ссылок, так как откровенный фэйк с vc.ru с его "не рефлексируйте, распространяйте" бесполезен.
Нп этом нездоровом фоне тема слишком горячая, чтобы доверять таким случайным тестам.
Имхо независимые тесты нужны. Но в условиях инфовойн к ним больше требований, чем обычно.
Какой именно это гигачат? Ультра есть 3.5, если 3, есть вообще неделю назад выпущенный reasoning вариант. Это ж не условная астра про которую все знают и которая такая одна, ну указывайте нормально идентификатор модели, пожалуйста. Макс это что, второй который? Зачем его бенчить вообще, он неюзабельный был сразу на момент выхода...

Сравнение Алисы (Яндекс) и Гигачат (Сбер) по 5 бенчмаркам: τ³, ПРАКТ-120, MultiChallenge, WildBench и Arena‑Hard