Ну если вы не способны ни по ссылкам из статьи перейти, ни погуглить, ни хотя бы проверить собственные утверждения, а также демонстрируете тотальное непонимание того, как модели обучают, тестируют, позиционируют и используют, смысл вам что-то объяснять? Сами вы ни одного своего утверждения пруфами не снабдили, лжете буквально в каждом своем коменте, но от других чего-то требуете и обвиняете в словоблудии. Пруфы, если что, у вас прямо сейчас под носом лежат, на расстоянии нескольких кликов. Если вы их не видите - нейронку попросите помочь, заодно попросите перепроверить все ваши утверждения и оценить их адекватность, возможно что-то и поймёте
У меня есть свои тесты, и на определенном классе русскоязычных задач меня и прошлый гигачат более чем устраивал, так как был лучше всех крутых западных универсальных моделей в понимании русских пословиц.
Я читал все комменты, в них есть ровно один “тест”, тестом модели не являющийся, это тесты сберовской среды, которая ни ризонинга не показывает, ни инструментов не имеет. А вот трейсы решения бенчмарков как раз являются тестами, и по ним гигачат на уровне дипсика. Вам в статье раз десять написали, что училась модель только mini-swe-agent обвязке, в ней и надо тестировать.
Вам самому не смешно противопоставлять один некорректный пример десяткам тысяч корректных?
Я работал с llm ещё до выхода chatgpt, когда не было instruction версий, а исключительно те, что сейчас называются base. И использую модели в повседневной жизни уж точно не меньше вашего, бывает и по 8 сессий параллельно. Как облачные, так и локальные. Пишу собственный харнесс как пет-проект и делаю коммерческого агента на работе, тоже можно считать за харнесс. Поэтому я могу оценить важность и ценность этой статьи.
А вы - просто хейтер сбера, не более. Под каждым коментом отписались, я смотрю. Даже взяли на себя ответы за разработчика на предложения обновить маленькую модель, причем ответили абсолютно не понимая о чем речь. Если что, маленькие модели локально запускают, у Сбера уже есть такая, они её никогда не монетизировали. И когда она вышла, была на уровне тогдашних локальных моделей overall и сильно лучше всего на рынке именно в русском языке (на котором первые локалки в принципе не разговаривали), но вам это очевидно не известно, про платность какую-то чушь несёте. Ни одного аргумента не привели и расписались неоднократно в собственной неграмотности (когда назвали 4 “древней версией” и когда обвиняли сбер в плагиате китайцев, хотя они с очень древних пор, ещё до выхода чатгпт всё опенсорсят и там абсолютно всё своё, в чем убедиться можно за минуту, ru-gpt3xl вышла в принципе еше до основания компании deepseek). Позор!
Мне стыдно за комментаторов выше. Люди, вам выкатили подробную интересную статью, написанную руками об обучении ИИ. Со всеми подводными камнями. Даже китайцы, которые все опенсорсят, настолько подробно не расписывают.
Мы имеем первую отечественную reasoning модель на 430b, обученную самостоятельно на своей архитектуре. Ещё и по метрикам ± на уровне deepseek v4 flash при даже меньшем размере. В условиях дефицита железа и санкций.
И все в опенсорс!
Но нет, железо не суверенное, модель хуже чем гемини 3.7 (которая жирнее почти в 2 раза) и отстаёт от мира на 12 лет (при том что chat gpt 3.5 вышел в 2022) и лучше бы сделали что-то другое. Вот почему такой негатив-то? Вы чего хотите, уважаемые комментаторы? У нас и так ровно одна контора в стране обучением ИИ с нуля занимается, нужно чтобы вообще никого не было?
В 1,2-6 раз дороже в зависимости от моделей + 1 рубль “налога” с абсолютно каждого запроса. Абсолютно все дешёвые модели переходят в разряд неоправданно дорогих, когда “налог” стоит дороже самого ответа. Каждый вызов тула тоже триггерит этот налог, так как это отдельный вызов. Считал месяц назад. Одна и та же задача самому дешевому deepseek-v4-flash стоила мне примерно 50р через опенроутер и 540 через bothub, где большая часть суммы уплачена как “налог”. BYOC, управления роутингом и провайдерами нет - в статье автору glm ровно поэтому и не ответила, на openrouter есть провайдеры, дающие 5-7 токенов/с всего и их нужно ручками банить, на bothub будешь жрать что дают за столько, за сколько скажут без гарантий ответа в принципе. Поддержка при этом по сути отсутствует и крайне некомпетентна.
Потому что 18000 строк (где строка может быть на 1000+ символов) + объемный систем промт с глоссарием и конвенциями по переводу локальная модель будет обрабатывать вечность, и мне нужен был не перевод, а его вычитка и критика
Как-то клод сказал, что ему нужна фича ultracode для одной из моих задач и запросил доступ на запуск агентов пачкой. Я, думая, что он запустит пару-тройку субагентов как обычно, разрешил. 141 агент был запущен и немедленно остановлен - за считанные секунды улетело 300$, деньги на api закончились. До генерации не дошло, чисто на входные токены. Так что охотно верю.
Задача была - вычитать перевод видеоигры перед публикацией.
Ни до, ни после клод этот режим мне не предлагал, понятия не имею, зачем ему потребовался 141 агент для простой задачи на чтение.
В итоге deepseek v4 flash + hy preview без всякого агентского харнесса закрыли ту же задачу за 3 бакса быстрее и даже качественнее, как мне показалось. Просто в виде python скрипта с асинхронными запросами в opentouter.
От гриппа ежегодно умирает больше человек, чем от всех орфанных заболеваний вместе взятых, это всё та же испанка, убившая десятки миллионов, просто мы к ней (и она к нам) адаптировались.
От эболы и бешенства есть вакцины, от лепры 95% населения Земли имеют иммунитет. Там в целом вопрос решен и понятно, что делать.
Далеко не все простуды вызываются аденовирусами, но даже если от всех существующих аденовирусов будет вакцина - использовать их как вектора это не помешает вот вообще никак.
Лично я за подобные исследования и финансирование медицины, не важно кем, а разговоры в духе “вы не той наукой занимаетесь и не то лечите, есть более приоритетные цели” решительно осуждаю.
А вот стоило бы напрячься и изучить сами репозитории и исторический контекст, а не выдачу поиска. То, что дипсик выложил их себе не значит, что он эти дистиляты и делал, но это в сущности и не важно.
Мой первый довод - статья вводит в заблуждение, DeepSeek R1 тут никто не запускал. Вы его подтвердили, а не “разбили”.
А ваше последнее предложение - чистое хамство. То есть прочитать один абзац (причем как-то выборочно, с середины), погуглить, сделать скриншот и написать “опровержение” вы время нашли, а по существу ответить - уже нет? Зачем тогда вы вообще свое драгоценное время решили потратить на этот ответ? Вы ж даже не автор статьи и к вам никто не обращался.
Ну зря вы так, с 2017 года была куча улучшений архитектуры на всех уровнях, и улучшения продолжаются. От функции активации до принципов работы механизма внимания. Гугл вот недавно сумел без потерь kv кэш в 6 раз сжать. Все современные модели очень далеко ушли от трансформера из Attention is all you need. И место для улучшений ещё есть, как количественных, так и качественных, и таких мест становится только больше, как ни парадоксально.
Ничего лучше трансформера для задачи генерации текста ещё не придумали, но rnd ведётся. Диффузионки - гораздо более “тупиковая” и старая идея, но даже там раз в пару месяцев прорыв случается и умудряются выжимать приличные результаты.
Легко сказать, что нужны новые подходы. Хорошо бы их предложить.
Насчёт “ветеранов, что держатся за старые догмы” - вы про Шазира почитайте на досуге. У него, пожалуй, все публикации можно отнести к фундаментальным прорывам, прекрасно он новые борозды прокладывает
В статье описано, но кратенько. Любой скилл содержит секцию “когда использовать этот скилл”. В каждой сессии фреймворк формирует системный промт для модели, куда помимо непосредственно запроса пользователя подмешивает список всех активных тулов с описаниями и секции “когда использовать этот скилл” для всех активных скиллов. Если модель захочет что-то сделать, она попросит у фреймворка полный текст скилла через тул. Либо скилл может быть напрямую подмешан в запрос пользователя целиком, если он вызывает его явно.
Например, представим некий скилл для работы с docx файлами. Составим большой промт, где опишем, какими python библиотеками пользоваться для чтения docx файлов, как их правильно парсить и сохранять, чтобы модель не выдумывала велосипеды. В начале файла скилла напишем, что это скилл /docx с инструкциями по работе с docx файлами.
Если скилл активен, во все сессии будет подмешиваться в системный промт именно эта фраза, что в среде есть инструкция для работы с docx файлами, но без самого текста инструкции. Если модели потребуется в ходе сессии работать с docx, она вызовет тул skill-read и прочитает полный текст этого скилла.
Либо если пользователь явно пропишет в запросе “используя /docx оформи мне отчёт” - полный текст скилла добавится в запрос сразу, без промежуточного вызова тула на чтение полной инструкции.
Ну если вы не способны ни по ссылкам из статьи перейти, ни погуглить, ни хотя бы проверить собственные утверждения, а также демонстрируете тотальное непонимание того, как модели обучают, тестируют, позиционируют и используют, смысл вам что-то объяснять? Сами вы ни одного своего утверждения пруфами не снабдили, лжете буквально в каждом своем коменте, но от других чего-то требуете и обвиняете в словоблудии. Пруфы, если что, у вас прямо сейчас под носом лежат, на расстоянии нескольких кликов. Если вы их не видите - нейронку попросите помочь, заодно попросите перепроверить все ваши утверждения и оценить их адекватность, возможно что-то и поймёте
.
У меня есть свои тесты, и на определенном классе русскоязычных задач меня и прошлый гигачат более чем устраивал, так как был лучше всех крутых западных универсальных моделей в понимании русских пословиц.
Я читал все комменты, в них есть ровно один “тест”, тестом модели не являющийся, это тесты сберовской среды, которая ни ризонинга не показывает, ни инструментов не имеет. А вот трейсы решения бенчмарков как раз являются тестами, и по ним гигачат на уровне дипсика. Вам в статье раз десять написали, что училась модель только mini-swe-agent обвязке, в ней и надо тестировать.
Вам самому не смешно противопоставлять один некорректный пример десяткам тысяч корректных?
Я работал с llm ещё до выхода chatgpt, когда не было instruction версий, а исключительно те, что сейчас называются base. И использую модели в повседневной жизни уж точно не меньше вашего, бывает и по 8 сессий параллельно. Как облачные, так и локальные. Пишу собственный харнесс как пет-проект и делаю коммерческого агента на работе, тоже можно считать за харнесс. Поэтому я могу оценить важность и ценность этой статьи.
А вы - просто хейтер сбера, не более. Под каждым коментом отписались, я смотрю. Даже взяли на себя ответы за разработчика на предложения обновить маленькую модель, причем ответили абсолютно не понимая о чем речь. Если что, маленькие модели локально запускают, у Сбера уже есть такая, они её никогда не монетизировали. И когда она вышла, была на уровне тогдашних локальных моделей overall и сильно лучше всего на рынке именно в русском языке (на котором первые локалки в принципе не разговаривали), но вам это очевидно не известно, про платность какую-то чушь несёте. Ни одного аргумента не привели и расписались неоднократно в собственной неграмотности (когда назвали 4 “древней версией” и когда обвиняли сбер в плагиате китайцев, хотя они с очень древних пор, ещё до выхода чатгпт всё опенсорсят и там абсолютно всё своё, в чем убедиться можно за минуту, ru-gpt3xl вышла в принципе еше до основания компании deepseek). Позор!
Назовите пожалуйста хоть одну llm из 2014. ChatGPT и тот в 2022 вышел. Чего не сто лет сразу?
Мне стыдно за комментаторов выше. Люди, вам выкатили подробную интересную статью, написанную руками об обучении ИИ. Со всеми подводными камнями. Даже китайцы, которые все опенсорсят, настолько подробно не расписывают.
Мы имеем первую отечественную reasoning модель на 430b, обученную самостоятельно на своей архитектуре. Ещё и по метрикам ± на уровне deepseek v4 flash при даже меньшем размере. В условиях дефицита железа и санкций.
И все в опенсорс!
Но нет, железо не суверенное, модель хуже чем гемини 3.7 (которая жирнее почти в 2 раза) и отстаёт от мира на 12 лет (при том что chat gpt 3.5 вышел в 2022) и лучше бы сделали что-то другое. Вот почему такой негатив-то? Вы чего хотите, уважаемые комментаторы? У нас и так ровно одна контора в стране обучением ИИ с нуля занимается, нужно чтобы вообще никого не было?
С какой экономикой? Это опенсорс модель, ии-подписок сбер не продает.
В 1,2-6 раз дороже в зависимости от моделей + 1 рубль “налога” с абсолютно каждого запроса. Абсолютно все дешёвые модели переходят в разряд неоправданно дорогих, когда “налог” стоит дороже самого ответа. Каждый вызов тула тоже триггерит этот налог, так как это отдельный вызов. Считал месяц назад. Одна и та же задача самому дешевому deepseek-v4-flash стоила мне примерно 50р через опенроутер и 540 через bothub, где большая часть суммы уплачена как “налог”. BYOC, управления роутингом и провайдерами нет - в статье автору glm ровно поэтому и не ответила, на openrouter есть провайдеры, дающие 5-7 токенов/с всего и их нужно ручками банить, на bothub будешь жрать что дают за столько, за сколько скажут без гарантий ответа в принципе. Поддержка при этом по сути отсутствует и крайне некомпетентна.
Нейрослопно
Это скорее всего под wsl запущено
Можно, конечно, если у вас есть 250+ Гб общей памяти и 4 H100. Качественнее точно не получится. Цены комплектующих сами знаете
Ещё не вышла, веса пока закрыты, емнип
Уважаемая Сбежавшая Нейросеть, вы же сами писали, дважды, что результаты SWE-Bench Pro больше ничего не значат, бенчмарк сломан.
del
del
Потому что 18000 строк (где строка может быть на 1000+ символов) + объемный систем промт с глоссарием и конвенциями по переводу локальная модель будет обрабатывать вечность, и мне нужен был не перевод, а его вычитка и критика
Как-то клод сказал, что ему нужна фича ultracode для одной из моих задач и запросил доступ на запуск агентов пачкой. Я, думая, что он запустит пару-тройку субагентов как обычно, разрешил. 141 агент был запущен и немедленно остановлен - за считанные секунды улетело 300$, деньги на api закончились. До генерации не дошло, чисто на входные токены. Так что охотно верю.
Задача была - вычитать перевод видеоигры перед публикацией.
Ни до, ни после клод этот режим мне не предлагал, понятия не имею, зачем ему потребовался 141 агент для простой задачи на чтение.
В итоге deepseek v4 flash + hy preview без всякого агентского харнесса закрыли ту же задачу за 3 бакса быстрее и даже качественнее, как мне показалось. Просто в виде python скрипта с асинхронными запросами в opentouter.
От гриппа ежегодно умирает больше человек, чем от всех орфанных заболеваний вместе взятых, это всё та же испанка, убившая десятки миллионов, просто мы к ней (и она к нам) адаптировались.
От эболы и бешенства есть вакцины, от лепры 95% населения Земли имеют иммунитет. Там в целом вопрос решен и понятно, что делать.
Далеко не все простуды вызываются аденовирусами, но даже если от всех существующих аденовирусов будет вакцина - использовать их как вектора это не помешает вот вообще никак.
Лично я за подобные исследования и финансирование медицины, не важно кем, а разговоры в духе “вы не той наукой занимаетесь и не то лечите, есть более приоритетные цели” решительно осуждаю.
А вот стоило бы напрячься и изучить сами репозитории и исторический контекст, а не выдачу поиска. То, что дипсик выложил их себе не значит, что он эти дистиляты и делал, но это в сущности и не важно.
Мой первый довод - статья вводит в заблуждение, DeepSeek R1 тут никто не запускал. Вы его подтвердили, а не “разбили”.
А ваше последнее предложение - чистое хамство. То есть прочитать один абзац (причем как-то выборочно, с середины), погуглить, сделать скриншот и написать “опровержение” вы время нашли, а по существу ответить - уже нет? Зачем тогда вы вообще свое драгоценное время решили потратить на этот ответ? Вы ж даже не автор статьи и к вам никто не обращался.
Ну зря вы так, с 2017 года была куча улучшений архитектуры на всех уровнях, и улучшения продолжаются. От функции активации до принципов работы механизма внимания. Гугл вот недавно сумел без потерь kv кэш в 6 раз сжать. Все современные модели очень далеко ушли от трансформера из Attention is all you need. И место для улучшений ещё есть, как количественных, так и качественных, и таких мест становится только больше, как ни парадоксально.
Ничего лучше трансформера для задачи генерации текста ещё не придумали, но rnd ведётся. Диффузионки - гораздо более “тупиковая” и старая идея, но даже там раз в пару месяцев прорыв случается и умудряются выжимать приличные результаты.
Легко сказать, что нужны новые подходы. Хорошо бы их предложить.
Насчёт “ветеранов, что держатся за старые догмы” - вы про Шазира почитайте на досуге. У него, пожалуй, все публикации можно отнести к фундаментальным прорывам, прекрасно он новые борозды прокладывает
В статье описано, но кратенько. Любой скилл содержит секцию “когда использовать этот скилл”. В каждой сессии фреймворк формирует системный промт для модели, куда помимо непосредственно запроса пользователя подмешивает список всех активных тулов с описаниями и секции “когда использовать этот скилл” для всех активных скиллов. Если модель захочет что-то сделать, она попросит у фреймворка полный текст скилла через тул. Либо скилл может быть напрямую подмешан в запрос пользователя целиком, если он вызывает его явно.
Например, представим некий скилл для работы с docx файлами. Составим большой промт, где опишем, какими python библиотеками пользоваться для чтения docx файлов, как их правильно парсить и сохранять, чтобы модель не выдумывала велосипеды. В начале файла скилла напишем, что это скилл /docx с инструкциями по работе с docx файлами.
Если скилл активен, во все сессии будет подмешиваться в системный промт именно эта фраза, что в среде есть инструкция для работы с docx файлами, но без самого текста инструкции. Если модели потребуется в ходе сессии работать с docx, она вызовет тул skill-read и прочитает полный текст этого скилла.
Либо если пользователь явно пропишет в запросе “используя /docx оформи мне отчёт” - полный текст скилла добавится в запрос сразу, без промежуточного вызова тула на чтение полной инструкции.