Потому что 18000 строк (где строка может быть на 1000+ символов) + объемный систем промт с глоссарием и конвенциями по переводу локальная модель будет обрабатывать вечность, и мне нужен был не перевод, а его вычитка и критика
Как-то клод сказал, что ему нужна фича ultracode для одной из моих задач и запросил доступ на запуск агентов пачкой. Я, думая, что он запустит пару-тройку субагентов как обычно, разрешил. 141 агент был запущен и немедленно остановлен - за считанные секунды улетело 300$, деньги на api закончились. До генерации не дошло, чисто на входные токены. Так что охотно верю.
Задача была - вычитать перевод видеоигры перед публикацией.
Ни до, ни после клод этот режим мне не предлагал, понятия не имею, зачем ему потребовался 141 агент для простой задачи на чтение.
В итоге deepseek v4 flash + hy preview без всякого агентского харнесса закрыли ту же задачу за 3 бакса быстрее и даже качественнее, как мне показалось. Просто в виде python скрипта с асинхронными запросами в opentouter.
От гриппа ежегодно умирает больше человек, чем от всех орфанных заболеваний вместе взятых, это всё та же испанка, убившая десятки миллионов, просто мы к ней (и она к нам) адаптировались.
От эболы и бешенства есть вакцины, от лепры 95% населения Земли имеют иммунитет. Там в целом вопрос решен и понятно, что делать.
Далеко не все простуды вызываются аденовирусами, но даже если от всех существующих аденовирусов будет вакцина - использовать их как вектора это не помешает вот вообще никак.
Лично я за подобные исследования и финансирование медицины, не важно кем, а разговоры в духе “вы не той наукой занимаетесь и не то лечите, есть более приоритетные цели” решительно осуждаю.
А вот стоило бы напрячься и изучить сами репозитории и исторический контекст, а не выдачу поиска. То, что дипсик выложил их себе не значит, что он эти дистиляты и делал, но это в сущности и не важно.
Мой первый довод - статья вводит в заблуждение, DeepSeek R1 тут никто не запускал. Вы его подтвердили, а не “разбили”.
А ваше последнее предложение - чистое хамство. То есть прочитать один абзац (причем как-то выборочно, с середины), погуглить, сделать скриншот и написать “опровержение” вы время нашли, а по существу ответить - уже нет? Зачем тогда вы вообще свое драгоценное время решили потратить на этот ответ? Вы ж даже не автор статьи и к вам никто не обращался.
Ну зря вы так, с 2017 года была куча улучшений архитектуры на всех уровнях, и улучшения продолжаются. От функции активации до принципов работы механизма внимания. Гугл вот недавно сумел без потерь kv кэш в 6 раз сжать. Все современные модели очень далеко ушли от трансформера из Attention is all you need. И место для улучшений ещё есть, как количественных, так и качественных, и таких мест становится только больше, как ни парадоксально.
Ничего лучше трансформера для задачи генерации текста ещё не придумали, но rnd ведётся. Диффузионки - гораздо более “тупиковая” и старая идея, но даже там раз в пару месяцев прорыв случается и умудряются выжимать приличные результаты.
Легко сказать, что нужны новые подходы. Хорошо бы их предложить.
Насчёт “ветеранов, что держатся за старые догмы” - вы про Шазира почитайте на досуге. У него, пожалуй, все публикации можно отнести к фундаментальным прорывам, прекрасно он новые борозды прокладывает
В статье описано, но кратенько. Любой скилл содержит секцию “когда использовать этот скилл”. В каждой сессии фреймворк формирует системный промт для модели, куда помимо непосредственно запроса пользователя подмешивает список всех активных тулов с описаниями и секции “когда использовать этот скилл” для всех активных скиллов. Если модель захочет что-то сделать, она попросит у фреймворка полный текст скилла через тул. Либо скилл может быть напрямую подмешан в запрос пользователя целиком, если он вызывает его явно.
Например, представим некий скилл для работы с docx файлами. Составим большой промт, где опишем, какими python библиотеками пользоваться для чтения docx файлов, как их правильно парсить и сохранять, чтобы модель не выдумывала велосипеды. В начале файла скилла напишем, что это скилл /docx с инструкциями по работе с docx файлами.
Если скилл активен, во все сессии будет подмешиваться в системный промт именно эта фраза, что в среде есть инструкция для работы с docx файлами, но без самого текста инструкции. Если модели потребуется в ходе сессии работать с docx, она вызовет тул skill-read и прочитает полный текст этого скилла.
Либо если пользователь явно пропишет в запросе “используя /docx оформи мне отчёт” - полный текст скилла добавится в запрос сразу, без промежуточного вызова тула на чтение полной инструкции.
Codex на маках не снимает видео с экрана, а пользуется инструментами доступности (то, что преимущественно использовалось для создания интерфейсов для невидящих людей). Apple подумали о них на уровне системы, заложили этот инструментарий глубоко в систему и требуют доступности от всех приложений в AppStore. В MacOS всегда активен этот слой доступности, и он строит дерево всех элементов во всех приложениях на экране, даже свернутых или невидимых сейчас.
Так просто получилось, что в приложениях на маках к каждой кнопочке или картинке прилагается подпись для слепых. Один стартап это понял и сделал обёртку для llm. OpenAI сразу его купила.
Именно поэтому эта фича будет только на маках и вряд ли появится где-то ещё.
В gnu/linux и windows построить дерево всех элементов на экране очень нетривиально или вообще невозможно. Максимум для браузеров что-то такое увидим
У вас в заголовке ложь - вы Deepseek R1 не запускали и даже не пробовали. Я попался на ваш кликбейт, было очень интересно, как это вы Deepseek умудрились всего в две A100 запихать, а оказывается никак. Вы запустили Llama 70b, дообученную не относящимися к Deepseek людьми на его ответах. Для Deepseek R1 ваша конфигурация недостаточна.
Второй момент: вы опустили всю обвязку. Каким образом вам удалось получить от модели ответ, что она на двух видеокартах выполняется в стандартном чате llama.cpp, что вы демонстрируете? Если вы подключили какой-то агентский инструментарий - поделитесь же. Гораздо интереснее и ценнее опыт воспитания неагентской llama из прошлого года под современные задачи.
Если нетрудно - приведите итоговый конфиг или строку запуска модели. Одним этим вы повысите ценность статьи с нулевой до минимально полезной. Сейчас же вы вообще не привели никаких железоспецифичных трудностей, из вашей статьи следует, что запуск llama.cpp на отечественном оборудовании не отличается от стандартной процедуры, зато наделали кучу фоток вашего железа, не относящихся к статье.
Отдельно пункт 11 - очень обидно. Есть RuAdapt квена, есть та же llama3, дообученная Тинькофф, есть вихри которые ЛУЧШЕ оригиналов на русском языке, есть ДЕСЯТКИ кастомок на HF, но вы пишете, что отечественных аналогов просто нет. Вы бы сами погугли, посмотрели бенчмарки, чем слепо верить ии, что вам статью нагенерил.
Вы пишете в заключении, что “рассмотрели все грабли”, но ни одной грабли в статье не упомянуто, только кратко упомянули про сборку из репозитория nvidia, но не привели конкретики, как это сделать.
У вас неверная команда для подключения к докеру. В этом образе переехали mssql-tools, плюс необходимо шифрование (флаги -No для отключения или -C для доверия к самоподписанному сертификату) Корректная команда:
Вы теплое с мягким сравниваете. Карточку модели открыли бы хоть сами, прежде чем нейронку анализировать натравливать.
Diffusion Gemma по всем бенчам немного проигрывает обычной Gemma согласно официальному же отчёту гугла, но скорость выше в разы. И нужна она исключительно для скорости и под файнтюн. Стандартным llama.cpp вы её не запустите, нужно пересобирать из исходников со специальными флагами.
Это первая приличная опенсорсная диффузионная ЛЛМ. Кроме Гугла на этом поприще чего-то добилась только Inception Labs, но они сурсы не открывают.
На каком коне Qwen? Это модель совершенно другого класса, работающая на других принципах, умудряющаяся при этом выдавать недурный результат.
Это все равно что моторную лодку с мотоциклом сравнивать.
Можно, конечно, если у вас есть 250+ Гб общей памяти и 4 H100. Качественнее точно не получится. Цены комплектующих сами знаете
Ещё не вышла, веса пока закрыты, емнип
Уважаемая Сбежавшая Нейросеть, вы же сами писали, дважды, что результаты SWE-Bench Pro больше ничего не значат, бенчмарк сломан.
del
del
Потому что 18000 строк (где строка может быть на 1000+ символов) + объемный систем промт с глоссарием и конвенциями по переводу локальная модель будет обрабатывать вечность, и мне нужен был не перевод, а его вычитка и критика
Как-то клод сказал, что ему нужна фича ultracode для одной из моих задач и запросил доступ на запуск агентов пачкой. Я, думая, что он запустит пару-тройку субагентов как обычно, разрешил. 141 агент был запущен и немедленно остановлен - за считанные секунды улетело 300$, деньги на api закончились. До генерации не дошло, чисто на входные токены. Так что охотно верю.
Задача была - вычитать перевод видеоигры перед публикацией.
Ни до, ни после клод этот режим мне не предлагал, понятия не имею, зачем ему потребовался 141 агент для простой задачи на чтение.
В итоге deepseek v4 flash + hy preview без всякого агентского харнесса закрыли ту же задачу за 3 бакса быстрее и даже качественнее, как мне показалось. Просто в виде python скрипта с асинхронными запросами в opentouter.
От гриппа ежегодно умирает больше человек, чем от всех орфанных заболеваний вместе взятых, это всё та же испанка, убившая десятки миллионов, просто мы к ней (и она к нам) адаптировались.
От эболы и бешенства есть вакцины, от лепры 95% населения Земли имеют иммунитет. Там в целом вопрос решен и понятно, что делать.
Далеко не все простуды вызываются аденовирусами, но даже если от всех существующих аденовирусов будет вакцина - использовать их как вектора это не помешает вот вообще никак.
Лично я за подобные исследования и финансирование медицины, не важно кем, а разговоры в духе “вы не той наукой занимаетесь и не то лечите, есть более приоритетные цели” решительно осуждаю.
А вот стоило бы напрячься и изучить сами репозитории и исторический контекст, а не выдачу поиска. То, что дипсик выложил их себе не значит, что он эти дистиляты и делал, но это в сущности и не важно.
Мой первый довод - статья вводит в заблуждение, DeepSeek R1 тут никто не запускал. Вы его подтвердили, а не “разбили”.
А ваше последнее предложение - чистое хамство. То есть прочитать один абзац (причем как-то выборочно, с середины), погуглить, сделать скриншот и написать “опровержение” вы время нашли, а по существу ответить - уже нет? Зачем тогда вы вообще свое драгоценное время решили потратить на этот ответ? Вы ж даже не автор статьи и к вам никто не обращался.
Ну зря вы так, с 2017 года была куча улучшений архитектуры на всех уровнях, и улучшения продолжаются. От функции активации до принципов работы механизма внимания. Гугл вот недавно сумел без потерь kv кэш в 6 раз сжать. Все современные модели очень далеко ушли от трансформера из Attention is all you need. И место для улучшений ещё есть, как количественных, так и качественных, и таких мест становится только больше, как ни парадоксально.
Ничего лучше трансформера для задачи генерации текста ещё не придумали, но rnd ведётся. Диффузионки - гораздо более “тупиковая” и старая идея, но даже там раз в пару месяцев прорыв случается и умудряются выжимать приличные результаты.
Легко сказать, что нужны новые подходы. Хорошо бы их предложить.
Насчёт “ветеранов, что держатся за старые догмы” - вы про Шазира почитайте на досуге. У него, пожалуй, все публикации можно отнести к фундаментальным прорывам, прекрасно он новые борозды прокладывает
В статье описано, но кратенько. Любой скилл содержит секцию “когда использовать этот скилл”. В каждой сессии фреймворк формирует системный промт для модели, куда помимо непосредственно запроса пользователя подмешивает список всех активных тулов с описаниями и секции “когда использовать этот скилл” для всех активных скиллов. Если модель захочет что-то сделать, она попросит у фреймворка полный текст скилла через тул. Либо скилл может быть напрямую подмешан в запрос пользователя целиком, если он вызывает его явно.
Например, представим некий скилл для работы с docx файлами. Составим большой промт, где опишем, какими python библиотеками пользоваться для чтения docx файлов, как их правильно парсить и сохранять, чтобы модель не выдумывала велосипеды. В начале файла скилла напишем, что это скилл /docx с инструкциями по работе с docx файлами.
Если скилл активен, во все сессии будет подмешиваться в системный промт именно эта фраза, что в среде есть инструкция для работы с docx файлами, но без самого текста инструкции. Если модели потребуется в ходе сессии работать с docx, она вызовет тул skill-read и прочитает полный текст этого скилла.
Либо если пользователь явно пропишет в запросе “используя /docx оформи мне отчёт” - полный текст скилла добавится в запрос сразу, без промежуточного вызова тула на чтение полной инструкции.
Codex на маках не снимает видео с экрана, а пользуется инструментами доступности (то, что преимущественно использовалось для создания интерфейсов для невидящих людей). Apple подумали о них на уровне системы, заложили этот инструментарий глубоко в систему и требуют доступности от всех приложений в AppStore. В MacOS всегда активен этот слой доступности, и он строит дерево всех элементов во всех приложениях на экране, даже свернутых или невидимых сейчас.
Так просто получилось, что в приложениях на маках к каждой кнопочке или картинке прилагается подпись для слепых. Один стартап это понял и сделал обёртку для llm. OpenAI сразу его купила.
Именно поэтому эта фича будет только на маках и вряд ли появится где-то ещё.
В gnu/linux и windows построить дерево всех элементов на экране очень нетривиально или вообще невозможно. Максимум для браузеров что-то такое увидим
У вас в заголовке ложь - вы Deepseek R1 не запускали и даже не пробовали. Я попался на ваш кликбейт, было очень интересно, как это вы Deepseek умудрились всего в две A100 запихать, а оказывается никак. Вы запустили Llama 70b, дообученную не относящимися к Deepseek людьми на его ответах. Для Deepseek R1 ваша конфигурация недостаточна.
Второй момент: вы опустили всю обвязку. Каким образом вам удалось получить от модели ответ, что она на двух видеокартах выполняется в стандартном чате llama.cpp, что вы демонстрируете? Если вы подключили какой-то агентский инструментарий - поделитесь же. Гораздо интереснее и ценнее опыт воспитания неагентской llama из прошлого года под современные задачи.
Если нетрудно - приведите итоговый конфиг или строку запуска модели. Одним этим вы повысите ценность статьи с нулевой до минимально полезной. Сейчас же вы вообще не привели никаких железоспецифичных трудностей, из вашей статьи следует, что запуск llama.cpp на отечественном оборудовании не отличается от стандартной процедуры, зато наделали кучу фоток вашего железа, не относящихся к статье.
Отдельно пункт 11 - очень обидно. Есть RuAdapt квена, есть та же llama3, дообученная Тинькофф, есть вихри которые ЛУЧШЕ оригиналов на русском языке, есть ДЕСЯТКИ кастомок на HF, но вы пишете, что отечественных аналогов просто нет. Вы бы сами погугли, посмотрели бенчмарки, чем слепо верить ии, что вам статью нагенерил.
Вы пишете в заключении, что “рассмотрели все грабли”, но ни одной грабли в статье не упомянуто, только кратко упомянули про сборку из репозитория nvidia, но не привели конкретики, как это сделать.
Если не секрет, это какая модель родила “фолс‑флагит”? Разные перлы видел, но так над русским языком даже китайцы на 8b не издеваются.
“просто”
Чтобы что? Вы сейчас серьезно предлагаете сравнить новые модели на 700b и 1t+ с полугодовалой на 120/20b?
Не получится
У вас неверная команда для подключения к докеру. В этом образе переехали mssql-tools, плюс необходимо шифрование (флаги -No для отключения или -C для доверия к самоподписанному сертификату) Корректная команда:
docker exec -it mssql1 /opt/mssql-tools18/bin/sqlcmd -S localhost -U sa -P strongPassword123 -CЕсли вы думаете, что заменить длинные тире на минусы достаточно, чтобы не палиться - вы ошибаетесь.
Вы теплое с мягким сравниваете. Карточку модели открыли бы хоть сами, прежде чем нейронку анализировать натравливать.
Diffusion Gemma по всем бенчам немного проигрывает обычной Gemma согласно официальному же отчёту гугла, но скорость выше в разы. И нужна она исключительно для скорости и под файнтюн. Стандартным llama.cpp вы её не запустите, нужно пересобирать из исходников со специальными флагами.
Это первая приличная опенсорсная диффузионная ЛЛМ. Кроме Гугла на этом поприще чего-то добилась только Inception Labs, но они сурсы не открывают.
На каком коне Qwen? Это модель совершенно другого класса, работающая на других принципах, умудряющаяся при этом выдавать недурный результат.
Это все равно что моторную лодку с мотоциклом сравнивать.