Ну стоит признать, что заниматься взломом текущие LLM могут прекрасно. Например, свежий Qwen 3.8 без всяких оглядок на этику вчера мне проанализировал репозиторий на гитхабе и нашёл точки взлома. А MiniMax с большим удовольствием их реализовал. Покажи вам это года эдак 3 назад, что бы вы сказали? Всё познаётся в сравнении.
Вот именно. Никто и не позиционировал Атом как машину для марш-бросков на тысячи км. Она предназначена для езды по городу с заправкой дома от розетки раз в неделю. Разумеется, предполагается, что владелец живёт в частном доме.
Их железо давно посчитано и его все равно что нет.
Для триллионных моделей - да. А для 100-миллиардных, как видим, уже 4 года назад железо было. И для нейросетевого перевода видео в реальном времени с качеством лучше, чем у Гугла, есть железо прямо сейчас.
Да, я ошибся, в open-source они выкладывали только нерассуждающие версии. А рассуждающие доступны только по API.
Если есть reasoning, то где бенчи для него и сравнение с другими такими моделями? У GigaChat 2.0 Max действительно увидел "effort" в API, а где бенчи для него? Видел их в статье от Танька про T-Pro 2.0, это у ризонинг модели все так плохо? 45% GPQA Diamond.
Железо-то есть. Яндекс ещё 4 года назад (к слову, ещё до выхода ChatGPT) выкладывал модель аж на 100 миллиардов параметров - https://huggingface.co/yandex/yalm-100b
Как раз, чтобы утереть нос Сберу, который на тот момент тоже уже выложил mGPT-13B (апрель 2022).
Другое дело, что даже при наличии вычислительных ресурсов их использование стоит денег. И если в случае с иностранными компаниями это деньги богатеньких буратино, которых убедили инвестировать "в эй ай", то тут в РФ таких инвесторов нету. А с учётом демпинга китайцев возврат таких инвестиций становится невозможным. Единственное направление - обслуживание чувствительных сфер. Ну и всякие сценарии с местным колоритом.
Даже самому Сберу сейчас чисто финансово было бы выгодней просто задеплоить какого-нибудь китайца помощнее. Но они продолжают что-то там сами разрабатывать, что уже само по себе работа "за идею".
Ризонинг у них добавился год назад, ещё в GigaChat 2.0.
сужу по тому что видел и щупал.
Весов о1 у вас нет, что не мешает его видеть и щупать.
Но с вашими оценками по отставанию я всё равно согласен. С другой стороны, обвинять их в отставании было бы странно. С какой стати они не должны отставать?
"Тупит" в большинстве случаев просто означает увеличение времени на решение задачи. Он её всё равно решит, просто не за 5 минут, а за 5 часов. И вопрос тут только в том, готов ли человек заплатить за скорость. И нужна ли эта скорость вообще.
MiniMax - это твёрдый середняк между GLM и DeepSeek-V4-Pro в плане цены и качества. Kimi и Qwen - это, конечно, хорошо, но когда дело доходит до цен, то они сливают всухую Минимаксу. Кстати, у дипсика с недавнего времени есть клон-конкурент MiMo, который скопировал его прайс один в один. Всё это очень воодушевляет, но в то же время, глядя на цену оперативки, думаю, что придётся делать апгрейд сейчас, потому что через год всё будет ещё дороже...
Ну стоит признать, что заниматься взломом текущие LLM могут прекрасно. Например, свежий Qwen 3.8 без всяких оглядок на этику вчера мне проанализировал репозиторий на гитхабе и нашёл точки взлома. А MiniMax с большим удовольствием их реализовал. Покажи вам это года эдак 3 назад, что бы вы сказали? Всё познаётся в сравнении.
Вот именно. Никто и не позиционировал Атом как машину для марш-бросков на тысячи км. Она предназначена для езды по городу с заправкой дома от розетки раз в неделю. Разумеется, предполагается, что владелец живёт в частном доме.
Так кучу же всяких модификаций наплодили.
До этого была Веста?
Что, сильно хуже Солярисов и Кий?
Для триллионных моделей - да. А для 100-миллиардных, как видим, уже 4 года назад железо было. И для нейросетевого перевода видео в реальном времени с качеством лучше, чем у Гугла, есть железо прямо сейчас.
Да, я ошибся, в open-source они выкладывали только нерассуждающие версии. А рассуждающие доступны только по API.
Видимо, пока да. Вот ещё независимая оценка - https://ru.mysummit.school/blog/gigachat-ultra-thinking-mode-test-2026/
Ну где-то так и получается, это уровень Claude 3.5 Sonnet примерно.
Да выпустят попозже Атом 2 с нормальными дверьми. Вон на Весту посмотрите - 100500 модификаций за 15 лет.
Проблемы только с редактурой. Где тут проблемы с математикой?
Так Горшенин пишет про тех, кто едет 90-100 км/час. Соответственно, в этом случае даже без заправок и туалетов получается около 8 часов.
А у Атома с двумя заправками на час меньше.
Железо-то есть. Яндекс ещё 4 года назад (к слову, ещё до выхода ChatGPT) выкладывал модель аж на 100 миллиардов параметров - https://huggingface.co/yandex/yalm-100b
Как раз, чтобы утереть нос Сберу, который на тот момент тоже уже выложил mGPT-13B (апрель 2022).
Другое дело, что даже при наличии вычислительных ресурсов их использование стоит денег. И если в случае с иностранными компаниями это деньги богатеньких буратино, которых убедили инвестировать "в эй ай", то тут в РФ таких инвесторов нету. А с учётом демпинга китайцев возврат таких инвестиций становится невозможным. Единственное направление - обслуживание чувствительных сфер. Ну и всякие сценарии с местным колоритом.
Даже самому Сберу сейчас чисто финансово было бы выгодней просто задеплоить какого-нибудь китайца помощнее. Но они продолжают что-то там сами разрабатывать, что уже само по себе работа "за идею".
Так и китайцы с американцами присасываются. Так что ваши вопросы вполне себе в буквальном смысле резонны.
Да нет, с ризонингом - https://huggingface.co/ai-sage/GigaChat3.5-432B-A28B
Ризонинг у них добавился год назад, ещё в GigaChat 2.0.
Весов о1 у вас нет, что не мешает его видеть и щупать.
Но с вашими оценками по отставанию я всё равно согласен. С другой стороны, обвинять их в отставании было бы странно. С какой стати они не должны отставать?
Лайт-версию опубликовал - https://huggingface.co/collections/yandex/yandexgpt-5-lite-8b
"Тупит" в большинстве случаев просто означает увеличение времени на решение задачи. Он её всё равно решит, просто не за 5 минут, а за 5 часов. И вопрос тут только в том, готов ли человек заплатить за скорость. И нужна ли эта скорость вообще.
Так речь не про качество, а про соотношение цены и качества.
Проблема kimi-k2.7-code - всего 260к контекст. У Минимакса с этим всё чётко - честный миллион. При этом он дешевле.
Пересаживаетесь на Алису, надо полагать?
Для теста-то можно и API купить.
MiniMax - это твёрдый середняк между GLM и DeepSeek-V4-Pro в плане цены и качества. Kimi и Qwen - это, конечно, хорошо, но когда дело доходит до цен, то они сливают всухую Минимаксу. Кстати, у дипсика с недавнего времени есть клон-конкурент MiMo, который скопировал его прайс один в один. Всё это очень воодушевляет, но в то же время, глядя на цену оперативки, думаю, что придётся делать апгрейд сейчас, потому что через год всё будет ещё дороже...