Обновить

Да, шумиха реальная — вышло буквально вчера-сегодня.

Основное по DeepSeek-V4.1-Flash:

  • Официально выпущена 10 сентября, с новым прайсингом для Flash-серии TechNode

  • MoE-модель с 552B параметров в backbone, поддержка контекста до миллиона токенов, нативная работа с изображениями и текстом Hugging Face

  • Новая архитектура — Causal Encoder-Decoder (CED): 40-слойный трансформер, 20 слоёв энкодера + 20 слоёв декодера, где KV-кэш декодера проецируется из финальных состояний энкодера, а не берётся из каждого слоя декодера отдельно. Благодаря этому на префилле активируется только 8B параметров на токен, а на генерации — 16B, что сильно повышает эффективность для агентных задач с большим объёмом входных данных Hugging FaceHugging Face

  • За счёт Compressed Sparse Attention 2 и FP4-квантования KV-кэша footprint снижен до 890 байт на токен — примерно в 4 раза меньше, чем у V4-Flash Hugging Face

  • По их заявлению, V4.1 Flash превзошла V4 Pro по производительности, стоимости, скорости и общему времени выполнения во внутренних и внешних тестах, поэтому начиная с 14 сентября все запросы к V4-Pro будут маршрутизироваться на V4.1-Flash по её тарифам, пока не выйдет V4.1-Pro TechNodeTechNode

По цене (offpeak): 0.02 юаня за миллион токенов при cache-hit на входе, 1 юань при cache-miss, 4 юаня за выход — в пиковые часы вдвое дороже. TechNode

Пробовать уже начали — на форуме NVIDIA обсуждают первые бенчмарки, сравнивают с GLM 5.3 Flash, отмечают новую архитектуру и заметно возросшую скорость. Официальные партнёры WorkBuddy (включая CodeBuddy) и OpenCode уже полностью поддерживают V4.1-Flash. NVIDIA Developer ForumsDeepSeek

Отношение к LLM-коннектору (redb.Route.Llm) DeepSeek в списке провайдеров, это может быть интересно как ещё один multi-provider, учитывая заявленную эффективность на агентных нагрузках.

Теги:
+1
Комментарии4

Я попал к психиатру из‑за кодинга с AI

Со стороны программирование звучит как медитативное занятие. Сидишь себе за компом целый день, слушаешь музыку, пьешь вкусный кофе. У все меня примерно так и происходит. Сначала я не спеша пытаюсь выстроить в голове то, что требуется сделать. Именно «не спеша». И не потому что я такой опытный и мудрый, а потому что быстро я просто не умею.

У меня не получается сразу продумать все корнер кейсы, которые сильно могут повлиять на архитектуру. Я не могу быстро достать из памяти нужный паттерн, чтобы на лайвкодинге блеснуть своими знаниями. Поэтому сначала я медленно вчитываюсь в описание задачи, общаюсь с ПМом или коллегами, кто больше знает в этой доменной области, чтобы в обсуждении мой мозг начал работать в правильном направлении.

Все это звучит конечно логично, но явно 10x инженером так не стать. Да и будем честны, даже 2x тоже. В IT, где эффективность, это не один из критериев оценки сотрудника, а недостижимая цель, к которой стремятся все. Мой стиль работы — это проблема. Но благодаря появлению AI, эта проблема стала решена.

Я попал к психиатру из‑за кодинга с AI

Публикации