Да, шумиха реальная — вышло буквально вчера-сегодня.
Основное по DeepSeek-V4.1-Flash:
Официально выпущена 10 сентября, с новым прайсингом для Flash-серии TechNode
MoE-модель с 552B параметров в backbone, поддержка контекста до миллиона токенов, нативная работа с изображениями и текстом Hugging Face
Новая архитектура — Causal Encoder-Decoder (CED): 40-слойный трансформер, 20 слоёв энкодера + 20 слоёв декодера, где KV-кэш декодера проецируется из финальных состояний энкодера, а не берётся из каждого слоя декодера отдельно. Благодаря этому на префилле активируется только 8B параметров на токен, а на генерации — 16B, что сильно повышает эффективность для агентных задач с большим объёмом входных данных Hugging FaceHugging Face
За счёт Compressed Sparse Attention 2 и FP4-квантования KV-кэша footprint снижен до 890 байт на токен — примерно в 4 раза меньше, чем у V4-Flash Hugging Face
По их заявлению, V4.1 Flash превзошла V4 Pro по производительности, стоимости, скорости и общему времени выполнения во внутренних и внешних тестах, поэтому начиная с 14 сентября все запросы к V4-Pro будут маршрутизироваться на V4.1-Flash по её тарифам, пока не выйдет V4.1-Pro TechNodeTechNode
По цене (offpeak): 0.02 юаня за миллион токенов при cache-hit на входе, 1 юань при cache-miss, 4 юаня за выход — в пиковые часы вдвое дороже. TechNode
Пробовать уже начали — на форуме NVIDIA обсуждают первые бенчмарки, сравнивают с GLM 5.3 Flash, отмечают новую архитектуру и заметно возросшую скорость. Официальные партнёры WorkBuddy (включая CodeBuddy) и OpenCode уже полностью поддерживают V4.1-Flash. NVIDIA Developer ForumsDeepSeek
Отношение к LLM-коннектору (redb.Route.Llm) DeepSeek в списке провайдеров, это может быть интересно как ещё один multi-provider, учитывая заявленную эффективность на агентных нагрузках.