Обновить

Стартап российских математиков Mostik научил нейросети общаться между собой напрямую, без текста, чтобы объединять несколько моделей и экономить деньги на ресурсы и токены для ИИ. Стартапу всего четыре месяца. Его основала россиянка Александра Малышева, а в команде 15 человек, почти все с PhD и опытом работы в Google, Nvidia или Perplexity.

Точный механизм работы своего решения в Mostik не раскрывают. В теории это означает, что маленькую модель можно соединить с большой, чтобы повысить точность ответов у первой. Это должно сократить затраты на передачу данных от одной модели к другой.

Теги:
+3
Комментарии0

Как запустить Qwen3.8-Flash-Next 125B на 6 ГБ VRAM

Qwen3.8-Flash-Next - открытая 125B-модель на архитектуре, которая станет основой Qwen4. По опубликованным Qwen результатам она конкурирует с закрытыми frontier-моделями в задачах программирования, работы с агентами и computer use.

Мы запустили полный checkpoint Qwen/Qwen3.8-Flash-Next на одной RTX 4090. Пиковое потребление VRAM составило 5,95 ГБ, без 4-битной квантизации и дистилляции. Использовался полный checkpoint в bf16, который генерировал обычные токены.

По сравнению с Opus 4.6 Max, согласно собственным данным Qwen:

Как запустить Qwen3.8-Flash-Next 125B на 6 ГБ VRAM

Публикации