Обновить
8K+
8
Михаил@Xronofag

Внедряю AI в банкинг и экосистемы

-1,8
Рейтинг
13
Подписчики
Отправить сообщение

Z.ai не доказала полную независимость Китая от Nvidia. Но кое-что что важное все же произошло

На прошлой неделе на OpenRouter появилась бесплатная анонимная модель под кодовым именем Ox Alpha. Без названия компании, пресс-релиза и привычного маркетингового разогрева.

За шесть полных дней она обработала 23,2 трлн токенов и стала самой используемой моделью на платформе — с отрывом в 2,3 раза от ближайшего конкурента.

26 августа Z.ai раскрыла карты: под именем Ox Alpha тестировалась её новая модель GLM-5.3-Flash.

Но самое интересное здесь не место в рейтинге и даже не цена. Весь трафик анонимного запуска, по заявлению Z.ai, обслуживался на китайских ИИ-ускорителях.

Ox Alpha занимает первое место на OpenRouter по числу обработанных токенов
Ox Alpha занимает первое место на OpenRouter по числу обработанных токенов

Трафик OpenRouter за 20–25 августа 2026 года. Источник: официальный релиз Z.ai.

1. Экономика сильных моделей меняется быстрее, чем кажется

На момент публикации миллион входных токенов GLM-5.3-Flash на OpenRouter стоит $0,075, выходных — $0,25. Для GLM-5.3 это $1,25 и $4,40.

Первая цена акционная, поэтому строить долгосрочную экономику только на ней не стоит. Но даже стандартный тариф Z.ai — $0,15 за вход и $0,50 за выход — заметно ниже стоимости большинства моделей сопоставимого уровня.

При этом на внутреннем Z.ai Code Bench v1.0 новая модель на максимальном режиме рассуждения почти сравнялась с Claude Opus 4.8: 29,0 против 29,5 балла.

Важно: Z.ai Code Bench v1.0 — закрытый тест самой компании. По состоянию на 30 августа его задания не опубликованы, поэтому результат нельзя независимо воспроизвести. Считать эти цифры доказательством одинакового качества не корректно.

То есть честная формулировка звучит не как «то же качество в десять раз дешевле», а так: модель уже находится в сопоставимом классе и стоит достаточно дёшево, чтобы её обязательно проверить на собственных задачах.

2. Низкая цена появилась не из воздуха

GLM-5.3-Flash — MoE-модель: всего в ней 320 млрд параметров, но при обработке каждого токена активируются только 18 млрд. Кроме того, в ней 45 слоёв против 92 у сопоставимой по общему размеру GLM-4.5.

Для работы с длинным контекстом объединили механизмы внимания:

  • линейное внимание обрабатывает локальные зависимости через состояние;

  • разреженное внимание находит релевантные фрагменты во всём контексте через отдельный индексатор;

  • IndexPool дополнительно сжимает четыре ключевых вектора индексатора в один.

По расчётам компании, по сравнению с GLM-5.3 это уменьшает вычисления механизма внимания примерно в три раза, а объём KV-кэша — в 4,4 раза на контексте до миллиона токенов.

Если убрать технические детали, смысл простой: модель тратит меньше вычислений и памяти на каждый запрос. Поэтому низкая цена здесь выглядит не только как субсидия для захвата рынка, но и как следствие архитектуры.

Конкуренция в ИИ всё заметнее смещается от гонки за «самую умную модель» к оптимизации всей системы: модели, движка инференса, памяти, сети и железа.

3. Китайское железо прошло проверку массовым инференсом

В течение всего анонимного запуска запросы к Ox Alpha обрабатывал крупный кластер китайских ИИ-ускорителей.

Для него Z.ai построила собственный стек инференса поверх SGLang: с разделением этапов обработки запроса, несколькими видами квантизации, оптимизацией обмена данными и отдельным планированием вычислительных пулов. Компания утверждает, что в результате производительность выросла втрое относительно первоначальной версии на том же оборудовании, а стоимость одного токена стала сопоставима с массовыми решениями на Nvidia.

Ещё одно важное уточнение: речь идёт об инференсе — обслуживании пользовательских запросов. Публичных доказательств того, что GLM-5.3-Flash была полностью обучена без оборудования Nvidia, пока нет.

Это различие принципиально. Обучить большую модель с нуля и обслуживать уже обученную модель в продакшене — разные по сложности и требованиям задачи.

Но результат всё равно значимый. Он показывает, что китайское оборудование уже способно выдерживать массовый трафик модели передового класса, а локальный программный стек — компенсировать ограничения отдельных чипов на уровне кластера.

Теги:
+8
Комментарии0

Дал большое интервью изданию Tazabek (деловое медиа Кыргызстана, входит в группу АКИpress) — про то, как мы с командой, начав с мобильного оператора, за пять лет собрали полноценную экосистему «Мой О!»: 3,5 млн клиентов и 10+ млн загрузок при населении страны около 7 млн.

Поговорили о том, что обычно остаётся за кадром историй успеха:

  • Почему телеком-финтех редкая история масштабного успеха не зависимо от географии, ведь стратегии и технологии у всех примерно одинаковые, но экосистемы получились не всех.

  • Какое архитектурное решение мы приняли на старте и ни разу не пожалели – про «сквозные», но не единые буквально данные, идентификацию и клиентский опыт.

  • Как устроенбаланс между скоростью и регулятором, и почему регуляторная песочница Национального банка — история не только про нас, но и про всю страну.

  • Трансграничные коридоры с Kaspi и Uzum — первые прямые финтех-коридоры в Центральной Азии.

  • Куда всё движется дальше: AI в каждом домене – от скоринга и антифрода до регуляторики.

И главный вывод, к которому мы пришли за эти годы: люди важнее технологий. Все провалившиеся проекты имели лучшие в мире технологии. Не хватило людей, которые собрали бы из этого работающую экосистему под конкретную страну.

Полный текст

А пока вопрос к вам: какие локальные финтех- или экосистемные проекты в ЦА и СНГ вы видели вблизи — и на чём они споткнулись? Интересны конкретные кейсы.

Теги:
Всего голосов 4: ↑3 и ↓1+4
Комментарии3

DeepSeek V4: 8 технических инноваций, de-NVIDIAfication и что это значит для рынка

Вчера OpenAI выпустил GPT-5.5. Сегодня DeepSeek выложил V4 – открытые веса, MIT-лицензия, 1М токенов контекста. Тайминг, конечно...

8 технических инноваций

Техническое описание V4 впечатляет не столько отдельными решениями, сколько плотностью инноваций – DeepSeek упаковал в один релиз больше новых техник, чем большинство лабораторий выпускают за год. Не все из них обязательно окажутся одинаково эффективными, но уровень инженерной амбиции – зашкаливающий.

1. Гибридное внимание (CSA + HCA)

Классический механизм Attention был серьёзно доработан. Теперь используется комбинация Compressed Sparse Attention и Heavily Compressed Attention, заменившая Multi-head Latent Attention из V3 и DeepSeek Sparse Attention из V3.2. У этого есть свои ньюансы и "цена". Эксперты пишут, что это может серьезно влиять на применимость модели в задачах с легаси кодом, так как компрессия контекста будет приводить к тому, что Дипсик 4 сможет корректно работать только с тем, кодом, который написал сам, а на легаси могут быть сюрпризы.

Результат: на окне в 1 миллион токенов модель потребляет лишь 27% вычислений и 10% памяти (KV-кэша) по сравнению с V3.2. Читать целые кодовые базы и книги стало экстремально дешево.

2. Оптимизатор Muon на триллионном масштабе

Индустрия привыкла к оптимизатору AdamW – он де-факто стандарт для обучения трансформеров. DeepSeek перевёл большую часть параметров на Muon – это первый публично известный случай применения Muon на модели масштаба 1.6T параметров.

Muon дал более быструю сходимость и стабильность при обучении гигантской MoE-архитектуры. Ранее он валидировался только на существенно меньших масштабах.

3. Гиперконнекции (mHC)

Классические остаточные связи (residual connections) между слоями нейросети были заменены на Manifold-Constrained Hyper-Connections. С помощью проекции на многообразие Биркгофа через итерации Синкхорна–Кноппа они устранили риск того, что сигналы "взорвутся" при обучении очень глубокой сети – проблему, которая убивала предыдущие попытки сделать обучаемые остаточные связи.

Накладные расходы: всего ~6.7% дополнительных вычислений. Техника была впервые опубликована DeepSeek в январе 2026 года.

4. Слияние знаний через On-Policy Distillation (OPD)

Вместо того чтобы в конце обучать модель всему одновременно (что приводит к размыванию компетенций), авторы пошли двухэтапным путём:

  1. Сначала обучили 10+ узких ИИ-экспертов (отдельно математик, отдельно кодер, отдельно логик и т.д.) через SFT + GRPO (reinforcement learning).

  2. Затем через On-Policy Distillation аккуратно "перелили" знания каждого эксперта в единую финальную модель.

Это устранило проблему, когда знания из одной области мешают другой – так называемое cross-domain interference.

5. Генеративный судья (GRM)

Для обучения сложным задачам DeepSeek отказался от классических скалярных "оценщиков" (как в стандартном RLHF). Вместо числовой оценки "хорошо/плохо" модель теперь сама текстово анализирует свои шаги – Generative Reward Model. Это качественно более богатая обратная связь при обучении.

6. Три режима мышления "из коробки"

Глубиной рассуждений модели можно управлять:

  • Non-Think – быстрый интуитивный ответ

  • Think-High – вдумчивый анализ

  • Think-Max – "выжми педаль в пол": модель расписывает все гипотезы, ищет краевые случаи и доказывает свой ответ (требует ≥384K контекста)

Think-Max – это режим, в котором DeepSeek замеряет свои лучшие бенчмарки. На HLE он поднимает score с 34.5 до 37.7, на SimpleQA-Verified – с 46.2 до 57.

Теги:
Всего голосов 3: ↑3 и ↓0+3
Комментарии17

Информация

В рейтинге
Не участвует
Дата рождения
Зарегистрирован
Активность

Специализация

Директор по продукту
Ведущий
Python
Git
Английский язык