Комментарии 26
Ещё один "тектонический сдвиг"? "Технология, взорвавшая индустрию"? Как там ИИ-инвесторы, в панике небось?
Рискну предположить, что через неделю про эту Кими никто и не вспомнит
И совершенно зря. На эту тему недавно было исследование от гугла, societies of thoughts, было и тут на Хабре. Элементарно добавление описания ролей в промпт качественно меняет ответ во всех ЛЛМ что я пробовал (Opus/Sonnet, ChatGPT, Grok). Здесь же это реализовано нативно на стадии обучения. Субъективно разница в качестве ответа как была между ChatGPT 3.5 и 4. Я сам заливаю в промпт четыре роли - прагматик, критик, архитектор и исследователь.
Рискну предположить, что через неделю про эту Кими никто и не вспомнит
Почему, Kimi давно была хорошей моделью "второго эшелона" (отстающей в общем использовании, но лидирующей в частных задачах, в её случае - в написании прилично звучащего текста и тестах на не-поощрение психозов пользователя вроде SpiralBench).
Я верю что её новую версию могли заметно улучшить, но mixture-of-experts всё-таки не тянет на "прорыв в алгоритмах".
Отдельно, открытые модели имеют неустранимые проблемы безопасности. Anthropic может обрезать доступ к модели, если вы будете задавать вопросы "как сварить зарин в домашних условиях". Если Kimi так хороша как рекламируется, то есть шанс что её вспомнят, но по очень плохой причине.
предположение с наименьшим риском: этот текст сгенерирован нейросетью. Несколько чисто технических признаков, включая подобные обороты, делают риск минимальным.
Данный перевод сделан Kimi K2.5 или ChatGPT/Gemini/Claude?
Дал этому kimi задачу и вот он уже 20+ минут пытается найти решение, настрочил более 70к символов. В принципе очевидно, что он ушел в рекурсию. В общем отбой, крупные модели пока могут спать спокойно. P.S. интересно, как долго он там будет блуждать по кругу, походу можно его оставить до завтра, а потом может китайский стартап то и разорится к этому моменту ))))
Уже уверен на 99%, что половина вычислительных мощностей у разных GPT-продаванов занята хождением по форумам и нахваливанием самого себя. Технически это уже как два пальца...
НИКАКОГО больше объяснения не нахожу существованию фанбоев kimi, GLM, gemini, sonnet и прочего второсортного гогна. Кто на первом месте не буду писать. Всё проверяется за вечерок.
Не помешало бы больше технических деталей почему использование Mixture of Experts называется прорывом? Кажется идея не нова, да и в принципе лежит на поверхности.
Или раньше это было просто теорией, а им первым удалось это реализовать?
Тут прорывом называется не Mixture of Experts, а Agent Swarm, а это немного совсем другая технология.
MoE предложили в 1991 году еще: "Origin and development of MoE. In 1991, research led by Jacobs first proposed the mixture of experts (MoE) model [76]."
MoE моделей на рынке уже куча. Я бы даже сказал, что большинство существующих моделей - MoE. Включая DeekSeek (кмк они первые продвинули это массово в индустрию), OpenAI (видно на примере gpt-oss-120b, 128 Experts), Llama v4 (например, Maverick which has 17B x 128 Experts MoE), Mistral, NVIDIA Nemotron и прочие.
Как поработавший с данной моделью для разработки сложных SQL преобразований, могу поделиться опытом. Моделька интересная. Но не за свои деньги. Минимальная подписка - 19$. Сравнимо с ChatGPT Agent, тоже минимальной. И насыпано лимитов, судя по всему, тоже сравнимо.
Но качество моделей - разное. Попробовал не коже SQL Teradata. Модель справляется со сложными запросами - ощутимо хуже. Не совсем плохо, но хуже.
Я бы сравнил, субъективно, ChatGPT high с мидлом, а Kimi - джун+.
В этом смысле, интереснее GLM 4.7. Она тоже джун+, но за свои 9$ за 3 мес - уже смотрится куда интереснее.
Собственно, мне понравился дуэт ChatGPT когда мужен "мозг" (проверка плана, проверка реализации на соответствие плану, фиксинг сложных багов), и GLM, когда только "руки".
Но не за свои деньги. Минимальная подписка - 19$.
Никто не знает какого размера на самом деле модели от гпт, а тем более какая у них архитектура, возможно у них давно уже есть всё что китайцы только что изобрели.
Открытые модели в заведомо проигрышном положении находятся, закрытые модели могут брать из них всё лучшее и умножать на свои чудовищные мощности, и ничего не возвращать в комьюнити, могут даже не сообщать что позаимствовали что то.
Как можно писать статью о то, что "стартап стоимостью $4,8 миллиарда только что опубликовал открытую модель, которая обходит GPT-5 ", и не дать ссылку на эту модель?
У кого есть маленько гпушного железа- гоу качать!))
На HLE, Human Level Exam
Какой ещё human level? Отродясь был Humanity's Last Exam.
По ощущениям все что тут написано в статье на практике оказывается полной ерундой..
Если ты (обычный пользователь) запустишь эту модель на какой нибудь open code и там подгрузишь эту модель для своих задач ( кстати она там бесплатна пока что ) то ты поймешь что она нахрен тротлит и сходит с ума уже через 20 минут, ну или при заполнении 20-25% от возможных токенов на операцию. Поэтому после чуть ли не каждого действия её нужно «очищать» сокращать контекст, и вообще она медленнее и хуже справляется с задачами чем тот же Клод от Антропик..
Единственный плюс пока она бесплатная- можешь познакомиться вообще с тем что такое clm с агентами и как на ней можно создавать какие нить проекты
а чьи это уши торчат?

Это система под названием Mixture of Experts с 384 специализированными экспертами.
Тут нет прорыва. Большинство актуальных моделей - MoE.
DeekSeek v3 (671B, 256 экспертов), Llama v4 (400B, 128 экспертов), gpt-oss-120b, Nemotron, Mistral, Qwen3, etc.
Более того, в безумно далеком (по меркам индустрии) 2022 году Google выкатил MoE модель на 1.6 трлн параметров с 2048 экспертами https://huggingface.co/google/switch-c-2048 + https://arxiv.org/pdf/2101.03961
Гигантские модели вроде ChatGPT-5 активируют сотни миллиардов параметров для малейшего вопроса, даже тривиального.
"Где пруфы, Билли?" Уважаемые люди пишут, что уже GPT-4 была MoE. https://newsletter.semianalysis.com/p/gpt-4-architecture-infrastructure Да и GPT-5 https://www.ycict.net/an-important-step-towards-agi-openai-officially-releases-the-gpt-5-model/
И даже открытая модель от OpenAI прошлого года - MoE. https://openai.com/index/introducing-gpt-oss/
Настоящая инновация Kimi K2.5 — это то, что Moonshot называет Agent Swarm (Рой агентов), совершенно новая парадигма в ИИ.
Ага, расскажите это Groq 4 Heavy (https://www.datacamp.com/blog/grok-4), Gemini 2.5 Deep Think (https://techcrunch.com/2025/08/01/google-rolls-out-gemini-deep-think-ai-a-reasoning-model-that-tests-multiple-ideas-in-parallel/), Parallel-R1 (https://arxiv.org/pdf/2509.07980) и прочим.
В отличие от других мультимодальных моделей, которые прививают энкодер зрения к существующим текстовым моделям
Gemini 1.0 еще учился сразу на мультимодальных данных. "Gemini models are trained on a dataset that is both multimodal and multilingual. Our pre-training dataset uses data from web documents, books, and code, and includes image, audio, and video data." А еще gpt-4o (With GPT‑4o, we trained a single new model end-to-end across text, vision, and audio, meaning that all inputs and outputs are processed by the same neural network), Llama v4 и многие другие
Вместо погони за самым мощным железом они массово инвестировали в алгоритмическую оптимизацию. Нативный метод квантизации модели, реализованный во время обучения, а не после, позволяет ей работать на 4 GPU H100 вместо обычно необходимых 16.
Post-training gpt-oss-120b был в MXFP4. "The models were post-trained with MXFP4 quantization of the MoE weights, making gpt-oss-120b run on a single 80GB GPU (like NVIDIA H100 or AMD MI300X) and the gpt-oss-20b model run within 16GB of memory." NVIDIA Nemotron 3 Super и Ultra (еще не зарелизино) обучается нативно на NVFP4 - https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/. А Nemotron 3 Nano после QAD показывает результаты в NVFP4 (и активации, и веса) практически на уровне FP8/BF16 - https://research.nvidia.com/labs/nemotron/nemotron-qad/ + https://research.nvidia.com/labs/nemotron/files/NVFP4-QAD-Report.pdf
ИМХО, то, что мало моделей пока нативно обучается в FP4 - следствие не того, что никто не догадался до этого, а в том, что FP4 нативно появился только в Blackwell (и сильно улучшился в Blackwell Ultra), поэтому обучать в FP4 на Hopper нет никакого смысла (с тем же эффектом можно обучить в FP8, а потом сделать QAD или post-training до FP4). По мере того, как Blackwell будет становится больше, популярность обучения в FP4 будет органично расти.
Год спустя Kimi K2.5 вбивает гвоздь в крышку гроба.
Ага, это при том, что NVIDIA ходит и всем рассказывает, что обучать надо сразу в FP4/NVFP4. https://developer.nvidia.com/blog/nvfp4-trains-with-precision-of-16-bit-and-speed-and-efficiency-of-4-bit/, https://arxiv.org/html/2509.25149v1 Да и вообще, что NVFP4 - must have и должен быть дефолтом. https://developer.nvidia.com/blog/introducing-nvfp4-for-efficient-and-accurate-low-precision-inference/
P.S. Все выше написанное не отменяет того, что Kimi 2.5 очень даже не плоха для модели с открытыми весами (хотя ИМХО слишком заточена под прохождение бенчмарков), но прорывов, о которых, пишут в статье в ней не наблюдается. Это комбинация (вероятно, первая на текущий момент), широко известных и используемых подходов в рамках единой, большой модели.
Китайский стартап за $5 млрд уничтожил GPT-5 бесплатной моделью. Кремниевая долина в панике?