DeepSeek V4.1 Flash: новая модель DeepSeek бросает вызов флагманам
DeepSeek официально выпустила V4.1 Flash — быструю MoE-модель с 552 млрд параметров, рассчитанную прежде всего на программирование, агентные сценарии и мультимодальные задачи. При этом на один токен активируется значительно меньше параметров: 8 млрд при обработке входа и 16 млрд при генерации.
По заявленным результатам тестирования модель показывает очень высокие результаты:
DeepSWE v1.1 — 74,2 балла;
CyberGym — 88,1;
Automation-Bench — 54,8;
Codeforces — 3471;
Terminal-Bench 2.1 — 90,6.
DeepSeek заявляет, что V4.1 Flash в ряде сценариев превосходит предыдущую V4 Pro, включая производительность, скорость и время выполнения задач. Сравнение с конкретными моделями вроде GPT-5.6 Sol и Claude Opus 5 зависит от методики тестирования, поэтому воспринимать отдельные лидерские позиции как абсолютный рейтинг всех моделей не стоит.
Главная особенность архитектуры — ставка не только на количество параметров, но и на эффективность. DeepSeek указывает, что новая архитектура позволяет снизить требования к KV-кэшу примерно в четыре раза по HBM и в восемь раз по SSD относительно предыдущего поколения. Для агентных задач это особенно важно: такие системы постоянно работают с большими объёмами контекста.
Цена тоже интересная
С 10 сентября действуют новые тарифы Flash:
$0,15 за 1 млн входных токенов без попадания в кэш и $0,60 за 1 млн выходных в непиковое время. Для кэшированных входных токенов цена составляет всего $0,003 за 1 млн. В пиковые часы тарифы увеличиваются вдвое.
Модель уже доступна в открытом виде на Hugging Face. Репозиторий также содержит инструкции для запуска через Transformers, vLLM и SGLang.
V4.1 Flash получила нативную мультимодальность, поэтому модель умеет работать не только с текстом и кодом, но и с изображениями. Старые V4 Flash и V4 Flash Vision Exp выводятся из эксплуатации, а их API-имена временно перенаправляются на новую модель.
Есть и ещё более интересный момент: 14 сентября DeepSeek планирует окончательно вывести V4 Pro. До выхода V4.1 Pro запросы к V4 Pro будут автоматически отправляться на V4.1 Flash и оплачиваться по тарифу Flash.
Похоже, DeepSeek решила не просто выпустить ещё одну Flash-модель, а сделать её основной рабочей лошадкой для кода и AI-агентов — причём с ценой, которая заметно ниже уровня флагманских моделей.