Ну на RAM это будет мучительная история, ожидайте скорость в 1-3 токена в секунду + еще не забываем, что R1 генерит <think> токены, поэтому ответов можно по часу ждать.
Ну и бред) начнем хотя бы с того, что LLaMA это Dense модель, а DeepSeekV3 - MoE. Уже одно это принципиальное архитектурное отличие сводит все эти утверждения в ноль.
Что за QwenLM? Моделей Qwen великое множество, самые последние - Qwen 2.5, а рассуждающий вариант QwQ-32b, которая в другой весовой категории по сравнению с o1 и r1, у которых сотни миллионов параметров)
Из забавного, можно заставить её рассуждать в стиле кого-то, т.е. отыгрывать роль по рассуждении. Видел твит, где её запромптили рассуждать в стиле Джа-Джа Бинкса и Трампа.
Вы пару месяцев назад могли тестить только старую версию DeepSeek v2.5, которая сильно уступала SOTA моделям. В конце декабря вышла v3, а сейчас уже R1, которая выдает перформанс примерно на уровне o1 (med) на английском.
Так и не надо верить, есть факты в виде кучи бенчмарков. Таргетные языки у модели - английский и китайский, если на русском не очень работает, то увы, ничего не поделаешь. Он как раз от o1 на livebench сильно отстает именно в плане языков.
Лол, Gigachat и рядом с Мистралем/DeepSeek/Qwen не валялся.
DeepSeekV3 на английском мне куда больше нравится по сравнению с 4o или Gemini 1.5 Pro, но меньше Claude 3.5 Sonnet. Новый R1 по ощущениям пока где-то на уровне o1 с low compute - т.е. лучше o1-mini, но до o1 pro пока недотягивает. С учетом цены токенов, это убер мощно.
На русском DeepSeek так себе, они прямо в тех. репорте пишут что упор на английский и китайский.
4o-mini это сейчас хорошая рабочая лошадка, которая способна решать многие задачи относительно дешево.
Для чего-то простого - да, но в целом 4o-mini весьма слабенькая модель. В курсоре пользовался 4o-mini часто (т.к. на него лимиты большие), он был прямо плох, сливал в ноль тем же опенсорсным Qwen 2.5 32B-Coder или DeepSeek v2.5 Coder.
Ну и, ясное дело, ИИ команда Сбера это не монстры типа Antropic или Open AI, чтобы ожидать от них конкуренции с топовыми моделями. Весовая категория, опять же, разная
Они и с Alibaba/DeepSeek/01.ai/Mistral не могут конкурировать. Причем дело не только в вычислительных ресурсах - те же DeepSeek выкатили DeepSeekV3, которую тренили на 2048 H800 (урезанная версия H100), и она сейчас обходит многие закрытые, в том числе от OpenAI/Antropic - LiveBench.
Причем даже если ограничиваться чисто русским языком, то и тут GigaChat Max проигрывает Qwen 2.5-72b, а с файнтюном его обходит уже 32b версия.
Тут скорее речь о том, что практического смысла юзать GigaChat с текущей ценой за токены - нет. Для большой компании проще поднять опенсорсную модель - это в конечном счете выйдет дешевле и намного лучше по приватности; ну а для персонального юзкейса и так понятно.
Тут загвоздка в том, что фирма в этом случае согласно восточной этике "потеряет лицо"
Бред. По вашему карточки типа A4000-A6000 покупают исключительно "восточные" компании из-за своей этики?) Или все-таки лицензионные соглашения в некоторых частях мира это не просто бумажка и тут "потеря лица" не при чем?
Про потолок я писал именно как комментарий про 5 лет опыта. 300К-350К — это средняя для сениоров с опытом лет 8-10. За 5 лет в принципе мало кто станет сениором.
Сильно зависит от сферы. В условном ML/DL/DS для людей с опытом в ~5 лет 300-400к это вполне себе рыночная вилка зп. В финтехе вроде тоже, может даже лучше.
Зависит от конкретной специализации, конечно, но в целом - да.
ЗП сеньеров 400-500к
500к это уже выше среднего, рыночные зп это скорее 350-450к и то для большинства вакансий 400к это уже прям около предела.
выше, ЗП в стартапах, особенно по нейросетям это 1500 000 рублей
Ну это уже из области фантастики. Даже работая на зарубеж тяжело получать с одного места $15000 чистыми в месяц. ЗП в российских стартапах как правило около рынка, в зарубежных - да, выше, но куда скромнее чем вы описали: $4-6k для мидла, $7-9k для сеньора и то верхние части вилок уже пореже встречаются.
Я не сомневаюсь что есть специалисты в Индии, которые получают по $6k в месяц и больше, но вряд ли они работают в аутсорсе. Аутсорс индийцы в большинстве своем получают куда меньше - $1-2k уже хорошая ЗП.
Если нужно просто кнопку нажимать на чудо машине, то что же ASML сама не занимается печатанием и дизайном чипов? Ну или даже какая-то другая нидерландская\европейская компания? Вместо этого европейцы пытаются привлечь Intel и TSMC открывать самые продвинутые фабы в Европе, так что отмазка про "стоимость труда" тоже мимо.
Видимо дело в том, что эти два процесса тоже невероятно сложны и на передовом уровне их могут выполнять считанные компании по всему миру, а без них машины ASML будут никому не нужны даже даром.
Во-вторых, у Яндекса цель - не отстать от "остального мира", а на самом деле США
Добавьте ещё китайцев и французов.
А у настоящего остального мира, помимо США, России и Китая, таких компаний и продуктов по большей части нет.
У французского Мистраля крутые модели, причем тестируют их не на закрытых французских бенчах разработанных самим же Мистралем, а на общих. Топовые модели у них немного отстают от самых свежих моделей большой тройки (OpenAI, Anthropic, Google - и то насчет последнего вопрос), но вполне себе конкурируют с топ open weight решениями типа Qwen 2.5 от Алибабы и LLaMA 3.2 от Меты.
У Яндекса, вероятно, гораздо меньше даты и гораздо меньше ресурсов на обучение моделей, чем у меты.
Ну вот китайские компании выпускают модели, которые на общих англоязычных бенчмарках и арене толкаются в топе или около него - Qwen 2.5 (open weight, кстати), Deepseek 2.5, Yi-Lightning, GLM-4 Plus и так далее. Причем на них тоже висят санкции на покупку передовых GPU и не думаю что у них сильно больше возможностей по сбору англоязычных данных чем у Яндекса. Так что дело не только в этом, но и в кадрах.
Ну на RAM это будет мучительная история, ожидайте скорость в 1-3 токена в секунду + еще не забываем, что R1 генерит <think> токены, поэтому ответов можно по часу ждать.
Все верно, даже при пустом контексте будет скорость в 1-2 токена в секунду.
Ну и бред) начнем хотя бы с того, что LLaMA это Dense модель, а DeepSeekV3 - MoE. Уже одно это принципиальное архитектурное отличие сводит все эти утверждения в ноль.
У DeepSeek R1 нет мультимодальности.
Что за QwenLM? Моделей Qwen великое множество, самые последние - Qwen 2.5, а рассуждающий вариант QwQ-32b, которая в другой весовой категории по сравнению с o1 и r1, у которых сотни миллионов параметров)
Из забавного, можно заставить её рассуждать в стиле кого-то, т.е. отыгрывать роль по рассуждении. Видел твит, где её запромптили рассуждать в стиле Джа-Джа Бинкса и Трампа.
Вы пару месяцев назад могли тестить только старую версию DeepSeek v2.5, которая сильно уступала SOTA моделям. В конце декабря вышла v3, а сейчас уже R1, которая выдает перформанс примерно на уровне o1 (med) на английском.
По-моему вы юзали V3, а не R1, судя по отсутствию "think". У меня R1 все верно выдал.
Скрытый текст
Из приколов - по референсам любит ссылаться на китайские сайты.
Так и не надо верить, есть факты в виде кучи бенчмарков. Таргетные языки у модели - английский и китайский, если на русском не очень работает, то увы, ничего не поделаешь. Он как раз от o1 на livebench сильно отстает именно в плане языков.
Лол, Gigachat и рядом с Мистралем/DeepSeek/Qwen не валялся.
DeepSeekV3 на английском мне куда больше нравится по сравнению с 4o или Gemini 1.5 Pro, но меньше Claude 3.5 Sonnet. Новый R1 по ощущениям пока где-то на уровне o1 с low compute - т.е. лучше o1-mini, но до o1 pro пока недотягивает. С учетом цены токенов, это убер мощно.
На русском DeepSeek так себе, они прямо в тех. репорте пишут что упор на английский и китайский.
Для чего-то простого - да, но в целом 4o-mini весьма слабенькая модель. В курсоре пользовался 4o-mini часто (т.к. на него лимиты большие), он был прямо плох, сливал в ноль тем же опенсорсным Qwen 2.5 32B-Coder или DeepSeek v2.5 Coder.
Они и с Alibaba/DeepSeek/01.ai/Mistral не могут конкурировать. Причем дело не только в вычислительных ресурсах - те же DeepSeek выкатили DeepSeekV3, которую тренили на 2048 H800 (урезанная версия H100), и она сейчас обходит многие закрытые, в том числе от OpenAI/Antropic - LiveBench.
Причем даже если ограничиваться чисто русским языком, то и тут GigaChat Max проигрывает Qwen 2.5-72b, а с файнтюном его обходит уже 32b версия.
Тут скорее речь о том, что практического смысла юзать GigaChat с текущей ценой за токены - нет. Для большой компании проще поднять опенсорсную модель - это в конечном счете выйдет дешевле и намного лучше по приватности; ну а для персонального юзкейса и так понятно.
DeepThink включает другую модель - как раз DeepSeek-R1-Lite-Preview с CoT обучением аля o1.
Все еще проще - модель себя ничем не считает.
Бред. По вашему карточки типа A4000-A6000 покупают исключительно "восточные" компании из-за своей этики?) Или все-таки лицензионные соглашения в некоторых частях мира это не просто бумажка и тут "потеря лица" не при чем?
Сильно зависит от сферы. В условном ML/DL/DS для людей с опытом в ~5 лет 300-400к это вполне себе рыночная вилка зп. В финтехе вроде тоже, может даже лучше.
Зависит от конкретной специализации, конечно, но в целом - да.
500к это уже выше среднего, рыночные зп это скорее 350-450к и то для большинства вакансий 400к это уже прям около предела.
Ну это уже из области фантастики. Даже работая на зарубеж тяжело получать с одного места $15000 чистыми в месяц. ЗП в российских стартапах как правило около рынка, в зарубежных - да, выше, но куда скромнее чем вы описали: $4-6k для мидла, $7-9k для сеньора и то верхние части вилок уже пореже встречаются.
Я не сомневаюсь что есть специалисты в Индии, которые получают по $6k в месяц и больше, но вряд ли они работают в аутсорсе. Аутсорс индийцы в большинстве своем получают куда меньше - $1-2k уже хорошая ЗП.
Если нужно просто кнопку нажимать на чудо машине, то что же ASML сама не занимается печатанием и дизайном чипов? Ну или даже какая-то другая нидерландская\европейская компания? Вместо этого европейцы пытаются привлечь Intel и TSMC открывать самые продвинутые фабы в Европе, так что отмазка про "стоимость труда" тоже мимо.
Видимо дело в том, что эти два процесса тоже невероятно сложны и на передовом уровне их могут выполнять считанные компании по всему миру, а без них машины ASML будут никому не нужны даже даром.
Добавьте ещё китайцев и французов.
У французского Мистраля крутые модели, причем тестируют их не на закрытых французских бенчах разработанных самим же Мистралем, а на общих. Топовые модели у них немного отстают от самых свежих моделей большой тройки (OpenAI, Anthropic, Google - и то насчет последнего вопрос), но вполне себе конкурируют с топ open weight решениями типа Qwen 2.5 от Алибабы и LLaMA 3.2 от Меты.
Ну вот китайские компании выпускают модели, которые на общих англоязычных бенчмарках и арене толкаются в топе или около него - Qwen 2.5 (open weight, кстати), Deepseek 2.5, Yi-Lightning, GLM-4 Plus и так далее. Причем на них тоже висят санкции на покупку передовых GPU и не думаю что у них сильно больше возможностей по сбору англоязычных данных чем у Яндекса. Так что дело не только в этом, но и в кадрах.