Да, Minimax M3 сильно недооценен, на мой взгляд. Особенно при большом контексте практически не выражен lost-in-the-middle. DS V4 Flash Preview был заметно хуже (как и DS V4 Pro Preview, как и MiMo V2.5 [Pro]).
После недавнего обновления правда не скажу кто лучше (на той же задаче не гонял), но в повседневном использовании DS V4 Flash / Pro оставили очень приятное впечатление.
Интересная статья, но технических деталей маловато. Да и без описания решаемых задач - статья просто из серии “у меня получилось”. Рядом точно такая же статья “ИИ плохо пишет код” (про ИИ в GameDev).
Вопрос-то не в “может ИИ или нет”, вопрос “а что он может” и “как этому способствовать”.
Под deepseek/deepseek-v4-pro скрывается старая модель (preview). И цены сейчас были бы раза в 2-3 выше (хотя от провайдера зависит - цены именно сам DeepSeek поднимал на свое API).
Вопрос, вероятно, опять сведется к вариантам использования. Flash дешевле, Pro дороже, Luna где-то между ними. По интеллекту - примерно аналогично.
Вопрос, конечно, еще и в том, на сколько стоимость Luna спонсируется сейчас и что с ней будет потом (в предверии выхода на биржу OpenAI заинтересована в дешевой и качественной модели как никогда).
Хотя лично я за DeepSeek - MIT лицензия и доступны альтернативные инфренс-провайдеры c ZDR. Правда не то, чтобы у Luna было сильно по другому (кроме лицензии).
P.S. а еще с Luna открыт вопрос стабильности доступа. Из России она недоступна, VPN/сторонние сервисы добавляют факторы риска.
Эпоха почти бесплатного DeepSeek API, кажется, закончилась. Особенно для длинных агентных сессий, где экономия сильно зависела от кэша.
Пересчитывал по своим сессиям - по текущим ценам Flash, при росте стоимости чтения кеша в 10 раз стоимость сессий вырастает всего в 2 раза. Т.е. с учетом новых цен на инференс - цена если вырастит, но не на порядок, а раза в 3 от силы. DeepSeek API все равно останется крайне дешевым.
Т.е. цены будут все равно ниже чем на OpenRouter в большинстве своем. Особенно чтение кеша. С одной стороны неприятно, а с другой - цены и так были сверх-низкими.
Обновленная DeepSeek V4 на удивление толковой получилась - что Flash, что Pro. Так что не думаю, что сильно на популярности скажется.
Kimi K3 не $0.03 а $0.30 имеет на чтение кеша. Это не в 10 раз дороже выходит, а в 100 ) Но справедливости ради - $0.003625 только у самого Deepseek, а он собирает данные и обучает на них модели. У других провайдеров чтение кеша раз в 10 дороже (да и инференс дороже раза в 3-4 для Pro).
P.S. пересчитывал у себя стоимость по сессиям агента как раз для deepseek flash ($0,0028 vs $0,028) - при изменении цены чтения кеша в 10 раз стоимость выросла примерно в 2 раза, а не на порядок.
P.P.S. Kimi K3 на другом уровне работает - и заплатить за нее больше в 10 раз не жалко. Для кодинга может сильной разницы и нет, но на ревью она все замечания выдает по делу (за редким исключением). Правда со свежим DeepSeek V4 Pro еще не игрался - может существенно подтянули (вслед за DeepSeek V4 Flash). Но раньше (DeepSeek V4 Flash/Pro Preview) для ревью были практически непригодными - очень поверхностный анализ выдавали.
Luna достаточно компактна в размышлениях. Flash тратит много на размышления - это да. Pro немногим меньше. Ну а Luna в разы меньше (судя по тестам https://artificialanalysis.ai/).
Впрочем, по стоимости Luna примерно на уровне Pro выходит. Flash раза в 2 дешевле.
Так на V4 Pro скидка в 75% действовала с момента выхода практически. Подозреваю, что просто уберут эту скидку.
P.S. V4 Pro Preview хостится не только у DeepSeek - а значит экономика сходится, цены там как раз примерно x3-x4 получаются от текущих для Pro у DeepSeek.
На большинстве моделей - да, куча лишнего на ревью появляется (ревью изменений или ревью модуля - не важно). Или перестраховка, или просто невозможные ситуации. А самой больное - кривая оценка важности. Самые существенные баги я обычно нахожу в пункте “прочее” или “неважное”. Или в процессе обсуждения найденных косяков всплывает (всегда обсуждайте найденные пункты, даже если они невозможны - как минимум подсветит “да, это невозможно, НО” - и после НО может идти существенный нюанс). Так что существенная польза есть. Модели - Minimax M3, Kimi K2.7 Code, GLM 5.2 и Deepseek V4 Flash (после обновления, новую Pro еще не щупал).
И это я не беру модели, которые просто пачку ерунды “ни о чем” выдают (например Deepseek V4 Pro/Flash Preview (после недавнего обновления стали сильно лучше) и MiMo V2.5 [Pro]).
Но Kimi-K3 прям сильно выделяется на этом фоне. Практически все замечания - по делу. Замечаний “ни о чем” нет или практически нет.
Любой KPI из индикатора превращается в самоцель. А с ИИ и накрутить показатели будет не сложно. Хотя бы потому, что нет четкого разделения результатов работы между ИИ и разработчиком.
И куча дилетантов, за которых все делает ИИ - и результат, на взгляд обывателя, не хуже, и даже дешевле. А что через месяц-два все развалится как карточный домик - уже мало кому интересно.
Да, в оригинальной новости “73% разработчиков Яндекса регулярно используют ИИ” и “более половины нового кода в компании создаётся с помощью генеративных моделей”.
Ошибся, это не “70% кода от ИИ”. Впрочем, смысл от этого мало теряется.
Да. Но тут мало вариантов “LLM сама поняла, что пошла не туда и как надо было делать”. Автоматические подсказки? Так на все случаи не напасешься их.
Заранее в контекст положить основные моменты - очень даже неплохой выход. Но если LLM уже пошла не по правильному пути - очень маловероятно, что она вдруг вспомнит, как надо было делать.
А вот обойти ограничения, порушив чего-нибудь попутно - очень даже получится.
Впрочем, вопрос всегда в балансе - удобство vs цена ошибки. На каждый чих дергать не дело. Да и не работает, как показала практика. Но и “делай все, что хочешь” - тоже вариант не лучший (хотя я именно таким вариантом и пользуюсь, пускай и в песочнице в виде докера).
Да, Minimax M3 сильно недооценен, на мой взгляд. Особенно при большом контексте практически не выражен lost-in-the-middle. DS V4 Flash Preview был заметно хуже (как и DS V4 Pro Preview, как и MiMo V2.5 [Pro]).
После недавнего обновления правда не скажу кто лучше (на той же задаче не гонял), но в повседневном использовании DS V4 Flash / Pro оставили очень приятное впечатление.
Потому что игра слов. В подобном стиле задачки делают по математике в младших классах.
Интересная статья, но технических деталей маловато. Да и без описания решаемых задач - статья просто из серии “у меня получилось”. Рядом точно такая же статья “ИИ плохо пишет код” (про ИИ в GameDev).
Вопрос-то не в “может ИИ или нет”, вопрос “а что он может” и “как этому способствовать”.
Под
deepseek/deepseek-v4-proскрывается старая модель (preview). И цены сейчас были бы раза в 2-3 выше (хотя от провайдера зависит - цены именно сам DeepSeek поднимал на свое API).DeepSeek V4 Pro - до или после недавнего обновления (DeepSeek V4 Pro 0813)? И цены буквально на днях существенно подняли.
Да, это очень интересный вопрос.
Вопрос, вероятно, опять сведется к вариантам использования. Flash дешевле, Pro дороже, Luna где-то между ними. По интеллекту - примерно аналогично.
Вопрос, конечно, еще и в том, на сколько стоимость Luna спонсируется сейчас и что с ней будет потом (в предверии выхода на биржу OpenAI заинтересована в дешевой и качественной модели как никогда).
Хотя лично я за DeepSeek - MIT лицензия и доступны альтернативные инфренс-провайдеры c ZDR. Правда не то, чтобы у Luna было сильно по другому (кроме лицензии).
P.S. а еще с Luna открыт вопрос стабильности доступа. Из России она недоступна, VPN/сторонние сервисы добавляют факторы риска.
Пересчитывал по своим сессиям - по текущим ценам Flash, при росте стоимости чтения кеша в 10 раз стоимость сессий вырастает всего в 2 раза. Т.е. с учетом новых цен на инференс - цена если вырастит, но не на порядок, а раза в 3 от силы. DeepSeek API все равно останется крайне дешевым.
Лучше не просто откатиться, а дополнить промт, направив решение в правильную сторону. Или как минимум закрыть явно неправильный путь.
Deepseek все равно останется дешевым. А после обновления - и крайне умным.
Да и альтернативных провайдеров достаточно - пускай они и дороже (раза в 2 для Flash и раза в 3-4 для Pro по текущим ценам).
Т.е. цены будут все равно ниже чем на OpenRouter в большинстве своем. Особенно чтение кеша. С одной стороны неприятно, а с другой - цены и так были сверх-низкими.
Обновленная DeepSeek V4 на удивление толковой получилась - что Flash, что Pro. Так что не думаю, что сильно на популярности скажется.
Kimi K3 не $0.03 а $0.30 имеет на чтение кеша. Это не в 10 раз дороже выходит, а в 100 ) Но справедливости ради - $0.003625 только у самого Deepseek, а он собирает данные и обучает на них модели. У других провайдеров чтение кеша раз в 10 дороже (да и инференс дороже раза в 3-4 для Pro).
P.S. пересчитывал у себя стоимость по сессиям агента как раз для deepseek flash ($0,0028 vs $0,028) - при изменении цены чтения кеша в 10 раз стоимость выросла примерно в 2 раза, а не на порядок.
P.P.S. Kimi K3 на другом уровне работает - и заплатить за нее больше в 10 раз не жалко. Для кодинга может сильной разницы и нет, но на ревью она все замечания выдает по делу (за редким исключением). Правда со свежим DeepSeek V4 Pro еще не игрался - может существенно подтянули (вслед за DeepSeek V4 Flash). Но раньше (DeepSeek V4 Flash/Pro Preview) для ревью были практически непригодными - очень поверхностный анализ выдавали.
Luna достаточно компактна в размышлениях. Flash тратит много на размышления - это да. Pro немногим меньше. Ну а Luna в разы меньше (судя по тестам https://artificialanalysis.ai/).
Впрочем, по стоимости Luna примерно на уровне Pro выходит. Flash раза в 2 дешевле.
Так на V4 Pro скидка в 75% действовала с момента выхода практически. Подозреваю, что просто уберут эту скидку.
P.S. V4 Pro Preview хостится не только у DeepSeek - а значит экономика сходится, цены там как раз примерно x3-x4 получаются от текущих для Pro у DeepSeek.
По первым впечатлениям Pro значительно лучше Flash-версии. Но это именно впечатление, а не замеры/тесты.
P.S. Скорости что у Flash, что у Pro вполне неплохие - 100+ и 60+ ток/сек.
На большинстве моделей - да, куча лишнего на ревью появляется (ревью изменений или ревью модуля - не важно). Или перестраховка, или просто невозможные ситуации. А самой больное - кривая оценка важности. Самые существенные баги я обычно нахожу в пункте “прочее” или “неважное”. Или в процессе обсуждения найденных косяков всплывает (всегда обсуждайте найденные пункты, даже если они невозможны - как минимум подсветит “да, это невозможно, НО” - и после НО может идти существенный нюанс). Так что существенная польза есть. Модели - Minimax M3, Kimi K2.7 Code, GLM 5.2 и Deepseek V4 Flash (после обновления, новую Pro еще не щупал).
И это я не беру модели, которые просто пачку ерунды “ни о чем” выдают (например Deepseek V4 Pro/Flash Preview (после недавнего обновления стали сильно лучше) и MiMo V2.5 [Pro]).
Но Kimi-K3 прям сильно выделяется на этом фоне. Практически все замечания - по делу. Замечаний “ни о чем” нет или практически нет.
Любой KPI из индикатора превращается в самоцель. А с ИИ и накрутить показатели будет не сложно. Хотя бы потому, что нет четкого разделения результатов работы между ИИ и разработчиком.
И куча дилетантов, за которых все делает ИИ - и результат, на взгляд обывателя, не хуже, и даже дешевле. А что через месяц-два все развалится как карточный домик - уже мало кому интересно.
Да, в оригинальной новости “73% разработчиков Яндекса регулярно используют ИИ” и “более половины нового кода в компании создаётся с помощью генеративных моделей”.
Ошибся, это не “70% кода от ИИ”. Впрочем, смысл от этого мало теряется.
Только в Yandex уже более 70% кода пишет ИИ. Так что это скорее для инвесторов “великая цель”, которая выполнится и сама.
Да. Но тут мало вариантов “LLM сама поняла, что пошла не туда и как надо было делать”. Автоматические подсказки? Так на все случаи не напасешься их.
Заранее в контекст положить основные моменты - очень даже неплохой выход. Но если LLM уже пошла не по правильному пути - очень маловероятно, что она вдруг вспомнит, как надо было делать.
А вот обойти ограничения, порушив чего-нибудь попутно - очень даже получится.
Впрочем, вопрос всегда в балансе - удобство vs цена ошибки. На каждый чих дергать не дело. Да и не работает, как показала практика. Но и “делай все, что хочешь” - тоже вариант не лучший (хотя я именно таким вариантом и пользуюсь, пускай и в песочнице в виде докера).