Обновить

Китайский стартап за $5 млрд уничтожил GPT-5 бесплатной моделью. Кремниевая долина в панике?

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели8.8K
Всего голосов 25: ↑14 и ↓11+7
Комментарии26

Комментарии 26

Ещё один "тектонический сдвиг"? "Технология, взорвавшая индустрию"? Как там ИИ-инвесторы, в панике небось?

Рискну предположить, что через неделю про эту Кими никто и не вспомнит

И совершенно зря. На эту тему недавно было исследование от гугла, societies of thoughts, было и тут на Хабре. Элементарно добавление описания ролей в промпт качественно меняет ответ во всех ЛЛМ что я пробовал (Opus/Sonnet, ChatGPT, Grok). Здесь же это реализовано нативно на стадии обучения. Субъективно разница в качестве ответа как была между ChatGPT 3.5 и 4. Я сам заливаю в промпт четыре роли - прагматик, критик, архитектор и исследователь.

Рискну предположить, что через неделю про эту Кими никто и не вспомнит

Почему, Kimi давно была хорошей моделью "второго эшелона" (отстающей в общем использовании, но лидирующей в частных задачах, в её случае - в написании прилично звучащего текста и тестах на не-поощрение психозов пользователя вроде SpiralBench).

Я верю что её новую версию могли заметно улучшить, но mixture-of-experts всё-таки не тянет на "прорыв в алгоритмах".

Отдельно, открытые модели имеют неустранимые проблемы безопасности. Anthropic может обрезать доступ к модели, если вы будете задавать вопросы "как сварить зарин в домашних условиях". Если Kimi так хороша как рекламируется, то есть шанс что её вспомнят, но по очень плохой причине.

Ура цензуре для безопасности.

Фосген в домашних условиях варится не сложнее борща. И что - много наварили? Я вспоминаю только один раз японцев специально, и пару раз американцев, пытавшихся освоить электросварку по мануалу.

предположение с наименьшим риском: этот текст сгенерирован нейросетью. Несколько чисто технических признаков, включая подобные обороты, делают риск минимальным.

Данный перевод сделан Kimi K2.5 или ChatGPT/Gemini/Claude?

просто сгенерённый текст.

Дал этому kimi задачу и вот он уже 20+ минут пытается найти решение, настрочил более 70к символов. В принципе очевидно, что он ушел в рекурсию. В общем отбой, крупные модели пока могут спать спокойно. P.S. интересно, как долго он там будет блуждать по кругу, походу можно его оставить до завтра, а потом может китайский стартап то и разорится к этому моменту ))))

Уже уверен на 99%, что половина вычислительных мощностей у разных GPT-продаванов занята хождением по форумам и нахваливанием самого себя. Технически это уже как два пальца...

НИКАКОГО больше объяснения не нахожу существованию фанбоев kimi, GLM, gemini, sonnet и прочего второсортного гогна. Кто на первом месте не буду писать. Всё проверяется за вечерок.

Хз чем вам не угодил GLM, учитывая стоимость и лимиты подписки за свои деньги более чем. Да и Sonnet в связке с Opus и Haiku работает прекрасно, чтобы не переплачивать. Все перечисленные описываю с точки зрения нужд разработки

Не помешало бы больше технических деталей почему использование Mixture of Experts называется прорывом? Кажется идея не нова, да и в принципе лежит на поверхности.

Или раньше это было просто теорией, а им первым удалось это реализовать?

Тут прорывом называется не Mixture of Experts, а Agent Swarm, а это немного совсем другая технология.

MoE предложили в 1991 году еще: "Origin and development of MoE. In 1991, research led by Jacobs first proposed the mixture of experts (MoE) model [76]."

MoE моделей на рынке уже куча. Я бы даже сказал, что большинство существующих моделей - MoE. Включая DeekSeek (кмк они первые продвинули это массово в индустрию), OpenAI (видно на примере gpt-oss-120b, 128 Experts), Llama v4 (например, Maverick which has 17B x 128 Experts MoE), Mistral, NVIDIA Nemotron и прочие.

Как поработавший с данной моделью для разработки сложных SQL преобразований, могу поделиться опытом. Моделька интересная. Но не за свои деньги. Минимальная подписка - 19$. Сравнимо с ChatGPT Agent, тоже минимальной. И насыпано лимитов, судя по всему, тоже сравнимо.

Но качество моделей - разное. Попробовал не коже SQL Teradata. Модель справляется со сложными запросами - ощутимо хуже. Не совсем плохо, но хуже.

Я бы сравнил, субъективно, ChatGPT high с мидлом, а Kimi - джун+.

В этом смысле, интереснее GLM 4.7. Она тоже джун+, но за свои 9$ за 3 мес - уже смотрится куда интереснее.

Собственно, мне понравился дуэт ChatGPT когда мужен "мозг" (проверка плана, проверка реализации на соответствие плану, фиксинг сложных багов), и GLM, когда только "руки".

Именно на openrouter я и использовал. Но мы же понимаем разницу между оплатой по токенам, и подпиской.

За предложение локального запуска - спасибо. Оплатить подписку на много лет будет дешевле :)

Если, конечно, не нужно приватности, и не готовы за это платить.

Никто не знает какого размера на самом деле модели от гпт, а тем более какая у них архитектура, возможно у них давно уже есть всё что китайцы только что изобрели.

Открытые модели в заведомо проигрышном положении находятся, закрытые модели могут брать из них всё лучшее и умножать на свои чудовищные мощности, и ничего не возвращать в комьюнити, могут даже не сообщать что позаимствовали что то.

Кто знает. Есть вариант, что китайцы не зря делают модели открытые. Подписками на закрытые модели пользуются одиночки и мелкий биз. Все кто покрупнее ставят себе свои ЛЛМ, т.е. китайские. Где то здесь была статистика...

Как можно писать статью о то, что "стартап стоимостью $4,8 миллиарда только что опубликовал открытую модель, которая обходит GPT-5 ", и не дать ссылку на эту модель?

У кого есть маленько гпушного железа- гоу качать!))

Ссылка на Кими К2.5 на ХаггинсФейсе.

Сейфтензорс

Все GGUFы

GGUF UD-Q8_K_XL

вы посмотрите, кто написал статью )

вы посмотрите, кто написал статью

дык, нейросеть и писала.

На HLE, Human Level Exam

Какой ещё human level? Отродясь был Humanity's Last Exam.

По ощущениям все что тут написано в статье на практике оказывается полной ерундой..

Если ты (обычный пользователь) запустишь эту модель на какой нибудь open code и там подгрузишь эту модель для своих задач ( кстати она там бесплатна пока что ) то ты поймешь что она нахрен тротлит и сходит с ума уже через 20 минут, ну или при заполнении 20-25% от возможных токенов на операцию.  Поэтому после чуть ли не  каждого действия  её нужно «очищать» сокращать контекст, и вообще она медленнее и хуже справляется с задачами чем тот же Клод от Антропик..

Единственный плюс пока она бесплатная- можешь познакомиться вообще с тем что такое clm с агентами  и как на ней можно создавать какие нить проекты

а чьи это уши торчат?

Это левое расширение.

Это система под названием Mixture of Experts с 384 специализированными экспертами.

Тут нет прорыва. Большинство актуальных моделей - MoE.

DeekSeek v3 (671B, 256 экспертов), Llama v4 (400B, 128 экспертов), gpt-oss-120b, Nemotron, Mistral, Qwen3, etc.

Более того, в безумно далеком (по меркам индустрии) 2022 году Google выкатил MoE модель на 1.6 трлн параметров с 2048 экспертами https://huggingface.co/google/switch-c-2048 + https://arxiv.org/pdf/2101.03961

Гигантские модели вроде ChatGPT-5 активируют сотни миллиардов параметров для малейшего вопроса, даже тривиального. 

"Где пруфы, Билли?" Уважаемые люди пишут, что уже GPT-4 была MoE. https://newsletter.semianalysis.com/p/gpt-4-architecture-infrastructure Да и GPT-5 https://www.ycict.net/an-important-step-towards-agi-openai-officially-releases-the-gpt-5-model/

И даже открытая модель от OpenAI прошлого года - MoE. https://openai.com/index/introducing-gpt-oss/

Настоящая инновация Kimi K2.5 — это то, что Moonshot называет Agent Swarm (Рой агентов), совершенно новая парадигма в ИИ.

Ага, расскажите это Groq 4 Heavy (https://www.datacamp.com/blog/grok-4), Gemini 2.5 Deep Think (https://techcrunch.com/2025/08/01/google-rolls-out-gemini-deep-think-ai-a-reasoning-model-that-tests-multiple-ideas-in-parallel/), Parallel-R1 (https://arxiv.org/pdf/2509.07980) и прочим.

В отличие от других мультимодальных моделей, которые прививают энкодер зрения к существующим текстовым моделям

Gemini 1.0 еще учился сразу на мультимодальных данных. "Gemini models are trained on a dataset that is both multimodal and multilingual. Our pre-training dataset uses data from web documents, books, and code, and includes image, audio, and video data." А еще gpt-4o (With GPT‑4o, we trained a single new model end-to-end across text, vision, and audio, meaning that all inputs and outputs are processed by the same neural network), Llama v4 и многие другие

Вместо погони за самым мощным железом они массово инвестировали в алгоритмическую оптимизацию. Нативный метод квантизации модели, реализованный во время обучения, а не после, позволяет ей работать на 4 GPU H100 вместо обычно необходимых 16.

Post-training gpt-oss-120b был в MXFP4. "The models were post-trained with MXFP4 quantization of the MoE weights, making gpt-oss-120b run on a single 80GB GPU (like NVIDIA H100 or AMD MI300X) and the gpt-oss-20b model run within 16GB of memory." NVIDIA Nemotron 3 Super и Ultra (еще не зарелизино) обучается нативно на NVFP4 - https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/. А Nemotron 3 Nano после QAD показывает результаты в NVFP4 (и активации, и веса) практически на уровне FP8/BF16 - https://research.nvidia.com/labs/nemotron/nemotron-qad/ + https://research.nvidia.com/labs/nemotron/files/NVFP4-QAD-Report.pdf

ИМХО, то, что мало моделей пока нативно обучается в FP4 - следствие не того, что никто не догадался до этого, а в том, что FP4 нативно появился только в Blackwell (и сильно улучшился в Blackwell Ultra), поэтому обучать в FP4 на Hopper нет никакого смысла (с тем же эффектом можно обучить в FP8, а потом сделать QAD или post-training до FP4). По мере того, как Blackwell будет становится больше, популярность обучения в FP4 будет органично расти.

Год спустя Kimi K2.5 вбивает гвоздь в крышку гроба.

Ага, это при том, что NVIDIA ходит и всем рассказывает, что обучать надо сразу в FP4/NVFP4. https://developer.nvidia.com/blog/nvfp4-trains-with-precision-of-16-bit-and-speed-and-efficiency-of-4-bit/, https://arxiv.org/html/2509.25149v1 Да и вообще, что NVFP4 - must have и должен быть дефолтом. https://developer.nvidia.com/blog/introducing-nvfp4-for-efficient-and-accurate-low-precision-inference/

P.S. Все выше написанное не отменяет того, что Kimi 2.5 очень даже не плоха для модели с открытыми весами (хотя ИМХО слишком заточена под прохождение бенчмарков), но прорывов, о которых, пишут в статье в ней не наблюдается. Это комбинация (вероятно, первая на текущий момент), широко известных и используемых подходов в рамках единой, большой модели.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Информация

Сайт
bothub.ru
Дата регистрации
Дата основания
Численность
11–30 человек
Местоположение
Россия
Представитель
Greg Ewin