Справедливости ради - там речь шла про скорость генерации токенов, если я правильно помню.
Так что “prefill просел в 2 раза” - не выглядит как катастрофа. Более быстрый nvme, RAID из nvme - и, вероятно, что проблема уйдет (или нет - вопрос и в задержках, а не только в скорости чтения).
P.S. еще вопрос в софте - на сколько он подобный режим может использовать.
Тут еще важно чей квант используется - сейчас многие кванты оптимизируются под конкретные области применения через imatrix. И потом с русским проблемы, которых в исходной модели не было и близко. В частности кванты unsloth имеют подобный эффект.
Где-то проскакивало, что N‑gram даже на SSD можно оставлять - существенного влияния на скорость не будет. Так что, вероятно, требования по памяти можно будет значительно снизить.
Да, Minimax M3 сильно недооценен, на мой взгляд. Особенно при большом контексте практически не выражен lost-in-the-middle. DS V4 Flash Preview был заметно хуже (как и DS V4 Pro Preview, как и MiMo V2.5 [Pro]).
После недавнего обновления правда не скажу кто лучше (на той же задаче не гонял), но в повседневном использовании DS V4 Flash / Pro оставили очень приятное впечатление.
Интересная статья, но технических деталей маловато. Да и без описания решаемых задач - статья просто из серии “у меня получилось”. Рядом точно такая же статья “ИИ плохо пишет код” (про ИИ в GameDev).
Вопрос-то не в “может ИИ или нет”, вопрос “а что он может” и “как этому способствовать”.
Под deepseek/deepseek-v4-pro скрывается старая модель (preview). И цены сейчас были бы раза в 2-3 выше (хотя от провайдера зависит - цены именно сам DeepSeek поднимал на свое API).
Вопрос, вероятно, опять сведется к вариантам использования. Flash дешевле, Pro дороже, Luna где-то между ними. По интеллекту - примерно аналогично.
Вопрос, конечно, еще и в том, на сколько стоимость Luna спонсируется сейчас и что с ней будет потом (в предверии выхода на биржу OpenAI заинтересована в дешевой и качественной модели как никогда).
Хотя лично я за DeepSeek - MIT лицензия и доступны альтернативные инфренс-провайдеры c ZDR. Правда не то, чтобы у Luna было сильно по другому (кроме лицензии).
P.S. а еще с Luna открыт вопрос стабильности доступа. Из России она недоступна, VPN/сторонние сервисы добавляют факторы риска.
Эпоха почти бесплатного DeepSeek API, кажется, закончилась. Особенно для длинных агентных сессий, где экономия сильно зависела от кэша.
Пересчитывал по своим сессиям - по текущим ценам Flash, при росте стоимости чтения кеша в 10 раз стоимость сессий вырастает всего в 2 раза. Т.е. с учетом новых цен на инференс - цена если вырастит, но не на порядок, а раза в 3 от силы. DeepSeek API все равно останется крайне дешевым.
Т.е. цены будут все равно ниже чем на OpenRouter в большинстве своем. Особенно чтение кеша. С одной стороны неприятно, а с другой - цены и так были сверх-низкими.
Обновленная DeepSeek V4 на удивление толковой получилась - что Flash, что Pro. Так что не думаю, что сильно на популярности скажется.
Kimi K3 не $0.03 а $0.30 имеет на чтение кеша. Это не в 10 раз дороже выходит, а в 100 ) Но справедливости ради - $0.003625 только у самого Deepseek, а он собирает данные и обучает на них модели. У других провайдеров чтение кеша раз в 10 дороже (да и инференс дороже раза в 3-4 для Pro).
P.S. пересчитывал у себя стоимость по сессиям агента как раз для deepseek flash ($0,0028 vs $0,028) - при изменении цены чтения кеша в 10 раз стоимость выросла примерно в 2 раза, а не на порядок.
P.P.S. Kimi K3 на другом уровне работает - и заплатить за нее больше в 10 раз не жалко. Для кодинга может сильной разницы и нет, но на ревью она все замечания выдает по делу (за редким исключением). Правда со свежим DeepSeek V4 Pro еще не игрался - может существенно подтянули (вслед за DeepSeek V4 Flash). Но раньше (DeepSeek V4 Flash/Pro Preview) для ревью были практически непригодными - очень поверхностный анализ выдавали.
Luna достаточно компактна в размышлениях. Flash тратит много на размышления - это да. Pro немногим меньше. Ну а Luna в разы меньше (судя по тестам https://artificialanalysis.ai/).
Впрочем, по стоимости Luna примерно на уровне Pro выходит. Flash раза в 2 дешевле.
Так на V4 Pro скидка в 75% действовала с момента выхода практически. Подозреваю, что просто уберут эту скидку.
P.S. V4 Pro Preview хостится не только у DeepSeek - а значит экономика сходится, цены там как раз примерно x3-x4 получаются от текущих для Pro у DeepSeek.
Так в три ночи дорогой тариф скорее начинается ) Скорее уж до обеда спать - там пиковое время по Пекину считается.
Справедливости ради - там речь шла про скорость генерации токенов, если я правильно помню.
Так что “prefill просел в 2 раза” - не выглядит как катастрофа. Более быстрый nvme, RAID из nvme - и, вероятно, что проблема уйдет (или нет - вопрос и в задержках, а не только в скорости чтения).
P.S. еще вопрос в софте - на сколько он подобный режим может использовать.
Тут еще важно чей квант используется - сейчас многие кванты оптимизируются под конкретные области применения через imatrix. И потом с русским проблемы, которых в исходной модели не было и близко. В частности кванты unsloth имеют подобный эффект.
Так для llama.cpp можно грамматику задать (или формат JSON-ответа) - сам софт будет жестко контролировать формат ответа.
Причем Structured Output поддерживается много где, грамматику только у llama.cpp видел.
Может просто уже все надоело? Потому как именно тут возникает очень много интересных открытий, заставляющих иногда кардинально пересмотреть систему.
P.S. а может просто от стека зависит.
Где-то проскакивало, что N‑gram даже на SSD можно оставлять - существенного влияния на скорость не будет. Так что, вероятно, требования по памяти можно будет значительно снизить.
Да, Minimax M3 сильно недооценен, на мой взгляд. Особенно при большом контексте практически не выражен lost-in-the-middle. DS V4 Flash Preview был заметно хуже (как и DS V4 Pro Preview, как и MiMo V2.5 [Pro]).
После недавнего обновления правда не скажу кто лучше (на той же задаче не гонял), но в повседневном использовании DS V4 Flash / Pro оставили очень приятное впечатление.
Потому что игра слов. В подобном стиле задачки делают по математике в младших классах.
Интересная статья, но технических деталей маловато. Да и без описания решаемых задач - статья просто из серии “у меня получилось”. Рядом точно такая же статья “ИИ плохо пишет код” (про ИИ в GameDev).
Вопрос-то не в “может ИИ или нет”, вопрос “а что он может” и “как этому способствовать”.
Под
deepseek/deepseek-v4-proскрывается старая модель (preview). И цены сейчас были бы раза в 2-3 выше (хотя от провайдера зависит - цены именно сам DeepSeek поднимал на свое API).DeepSeek V4 Pro - до или после недавнего обновления (DeepSeek V4 Pro 0813)? И цены буквально на днях существенно подняли.
Да, это очень интересный вопрос.
Вопрос, вероятно, опять сведется к вариантам использования. Flash дешевле, Pro дороже, Luna где-то между ними. По интеллекту - примерно аналогично.
Вопрос, конечно, еще и в том, на сколько стоимость Luna спонсируется сейчас и что с ней будет потом (в предверии выхода на биржу OpenAI заинтересована в дешевой и качественной модели как никогда).
Хотя лично я за DeepSeek - MIT лицензия и доступны альтернативные инфренс-провайдеры c ZDR. Правда не то, чтобы у Luna было сильно по другому (кроме лицензии).
P.S. а еще с Luna открыт вопрос стабильности доступа. Из России она недоступна, VPN/сторонние сервисы добавляют факторы риска.
Пересчитывал по своим сессиям - по текущим ценам Flash, при росте стоимости чтения кеша в 10 раз стоимость сессий вырастает всего в 2 раза. Т.е. с учетом новых цен на инференс - цена если вырастит, но не на порядок, а раза в 3 от силы. DeepSeek API все равно останется крайне дешевым.
Лучше не просто откатиться, а дополнить промт, направив решение в правильную сторону. Или как минимум закрыть явно неправильный путь.
Deepseek все равно останется дешевым. А после обновления - и крайне умным.
Да и альтернативных провайдеров достаточно - пускай они и дороже (раза в 2 для Flash и раза в 3-4 для Pro по текущим ценам).
Т.е. цены будут все равно ниже чем на OpenRouter в большинстве своем. Особенно чтение кеша. С одной стороны неприятно, а с другой - цены и так были сверх-низкими.
Обновленная DeepSeek V4 на удивление толковой получилась - что Flash, что Pro. Так что не думаю, что сильно на популярности скажется.
Kimi K3 не $0.03 а $0.30 имеет на чтение кеша. Это не в 10 раз дороже выходит, а в 100 ) Но справедливости ради - $0.003625 только у самого Deepseek, а он собирает данные и обучает на них модели. У других провайдеров чтение кеша раз в 10 дороже (да и инференс дороже раза в 3-4 для Pro).
P.S. пересчитывал у себя стоимость по сессиям агента как раз для deepseek flash ($0,0028 vs $0,028) - при изменении цены чтения кеша в 10 раз стоимость выросла примерно в 2 раза, а не на порядок.
P.P.S. Kimi K3 на другом уровне работает - и заплатить за нее больше в 10 раз не жалко. Для кодинга может сильной разницы и нет, но на ревью она все замечания выдает по делу (за редким исключением). Правда со свежим DeepSeek V4 Pro еще не игрался - может существенно подтянули (вслед за DeepSeek V4 Flash). Но раньше (DeepSeek V4 Flash/Pro Preview) для ревью были практически непригодными - очень поверхностный анализ выдавали.
Luna достаточно компактна в размышлениях. Flash тратит много на размышления - это да. Pro немногим меньше. Ну а Luna в разы меньше (судя по тестам https://artificialanalysis.ai/).
Впрочем, по стоимости Luna примерно на уровне Pro выходит. Flash раза в 2 дешевле.
Так на V4 Pro скидка в 75% действовала с момента выхода практически. Подозреваю, что просто уберут эту скидку.
P.S. V4 Pro Preview хостится не только у DeepSeek - а значит экономика сходится, цены там как раз примерно x3-x4 получаются от текущих для Pro у DeepSeek.
По первым впечатлениям Pro значительно лучше Flash-версии. Но это именно впечатление, а не замеры/тесты.
P.S. Скорости что у Flash, что у Pro вполне неплохие - 100+ и 60+ ток/сек.