Pull to refresh

Да, шумиха реальная — вышло буквально вчера-сегодня.

Основное по DeepSeek-V4.1-Flash:

  • Официально выпущена 10 сентября, с новым прайсингом для Flash-серии TechNode

  • MoE-модель с 552B параметров в backbone, поддержка контекста до миллиона токенов, нативная работа с изображениями и текстом Hugging Face

  • Новая архитектура — Causal Encoder-Decoder (CED): 40-слойный трансформер, 20 слоёв энкодера + 20 слоёв декодера, где KV-кэш декодера проецируется из финальных состояний энкодера, а не берётся из каждого слоя декодера отдельно. Благодаря этому на префилле активируется только 8B параметров на токен, а на генерации — 16B, что сильно повышает эффективность для агентных задач с большим объёмом входных данных Hugging FaceHugging Face

  • За счёт Compressed Sparse Attention 2 и FP4-квантования KV-кэша footprint снижен до 890 байт на токен — примерно в 4 раза меньше, чем у V4-Flash Hugging Face

  • По их заявлению, V4.1 Flash превзошла V4 Pro по производительности, стоимости, скорости и общему времени выполнения во внутренних и внешних тестах, поэтому начиная с 14 сентября все запросы к V4-Pro будут маршрутизироваться на V4.1-Flash по её тарифам, пока не выйдет V4.1-Pro TechNodeTechNode

По цене (offpeak): 0.02 юаня за миллион токенов при cache-hit на входе, 1 юань при cache-miss, 4 юаня за выход — в пиковые часы вдвое дороже. TechNode

Пробовать уже начали — на форуме NVIDIA обсуждают первые бенчмарки, сравнивают с GLM 5.3 Flash, отмечают новую архитектуру и заметно возросшую скорость. Официальные партнёры WorkBuddy (включая CodeBuddy) и OpenCode уже полностью поддерживают V4.1-Flash. NVIDIA Developer ForumsDeepSeek

Отношение к LLM-коннектору (redb.Route.Llm) DeepSeek в списке провайдеров, это может быть интересно как ещё один multi-provider, учитывая заявленную эффективность на агентных нагрузках.

Tags:
+1
Comments4

Articles