Я сравнивал стоимость развертывания GLM в локальном контуре со стоимостью развертывания среднеразмерных SFT моделей в локальном контуре.
В обоих случаях само собой разумеется, что либо есть сотрудники в штате, обладающие нужными компетенциями, либо привлечен вендор или интегратор.
с какой поры и в каких масштабах компании проще оплачивать ENT подписку, а с какой переходить на on-prem GLM
Подписка хороша когда нет Пдн и работа сети некритична. В 99% случаях это касается отдела разработчиков. Ну забанит им Антропик аккаунт в очередной раз, ну побегают день добиваясь разблокировки, либо зарегают новый, попишут какое-то время код ручками. Не смертельно.
Другое дело, когда кодовая база работает с Пдн, имеет чувствительную корпоративную инфу или модель встроена в критичные бизнес процессы.
Например, в систему интеллектуального роутинга и обработки входящих обращений, автоматическое распознование входящих документов, систему безопасности (соблюдения ТБ, определения возгораний и тд), корпоративную базу знаний, которой пользуются одновременно несколько отделов... вплоть до контроля флотации для обогащения руды (автоматизация управления технологическими параметрами и снижение расхода реагентов).
Вот там, за пределами ИТ отдела, использование облачных зарубежных систем может доставить очень много неприятностей, а их отвал буквально парализовать работу компании.
Рекомендую прочитать пару (раз, два) моих статей на эту тему, если еще не читали.
И отдельно не понял, каким образом тут реклама.
Я один из тех кто оказывает такие услуги, в основном интеграторам, а они уже своим клиентам (иногда работаю с клиентами напрямую). Поэтому любые открытые расценки с моей стороны в том насколько это будет экономнее будут выглядеть рекламой (нарушением правил), чего я бы хотел избежать.
Зависит от задач, во многих случаях хватает от 35 до 80B, c учетом KV-кеша это примерно от 48 до 160GB VRAM.
О каком размере контекста идет речь?
Обычно в районе 256-262К.
Есть ли малые модели, скажем до 8 гб включительно, но с большим контекстом для таких задач?
Боюсь, что таких моделей с нормальным качеством просто не существует. Либо будет квантована в Q4, либо контекст будет урезан в 64К, либо параметров будет недостаточно для нормальной работы (3B).
Даже тернарная Bonsai 27B, которая требует около 5GB VRAM, имеет контекст всего лишь 8К и не дотягивает по качеству до SFT средних моделей о которых я писал в комментариях выше. А рекомендовать Qwen 2.5 Coder 7B (Q4_K_M) 128К или Llama 3.1 8B (Q4_K_M) 128К мне совесть не позволяет. Чудес не бывает.
Я спрашиваю о том, кто этот пайплайн будет настраивать, собирать датасет, валидировать
Очевидно, тот же кто будет разворачивать GLM.
всё и поддерживать для каждого направления
Достаточно одной модели на несколько направлений, она заточится под эти направления.
на какие деньги и как это сравнимо с затратами на хотя бы on-prem GLM
Затраты примерно на порядок дешевле т.е. в 10 раз. Это минимум, на самом деле больше. Детально по ценам расписывать не буду, потому что это уже будет рекламой, а она здесь запрещена. Порядок экономии средств думаю понятен.
не говоря уже об API ENT OpenAI/Anthropic. Где хотя бы какие-то цифры?
Именно. Я о них не говорю. Потому-что, во-первых, мой комментарий касается только локального закрытого контура (on-prem) и сравниваю я небольшие модели с GLM в локальных контурах, а во-вторых, сейчас во многих случаях уже по совокупности проблем (от 152ФЗ до санкционных рисков) рассматривать зарубежные облачные решения мягко говоря не разумно.
Облачные зарубежные решения сейчас для тех кого даже массовый отзыв SSL/TLS-сертификатов не разбудил.
Причем тут бесплатно? Это конечно в десятки раз дешевле использования GLM в локальном контуре, но не настолько чтобы быть вообще бесплатным.
И поддерживаться будет?
Стоимость поддержки такого сервера внутри компании ничем не отличается от любого другого. ML специфичный пайплайн обычно завернут в тот же докер и наружу торчат только ноги по OpenAPI спецификации. Девопса для такого сервера вполне достаточно.
Вы вроде бы не поняли сути моего изначального комментария, я лишь указал на то что можно обойтись затратами на порядок меньше для получения такого же результата. О халяве речи ни шло, хотя для компании средней руки это несерьезные расходы.
На чем файн-тюнить предлагаете? На датасете компании, который, возможно, никто не собирал?
Если есть только код, то придется проделать подготовительный этап. Если помимо кода есть git repo, Сonfluence/Notion, Wiki/Jira/Slack/etc, а также хоть какой-то гайд или настройки линтера, то все намного упрощается т.к. проще засунуть в датасет архитектурные моменты.
Будет ли self-hosted LLM производительнее, чем модель во внешнем контуре
Да, если их правильно готовить.
Зачем использовать гигантскую GLM, требующую целой серверной стойки, если 80% ежедневных задач в IDE можно закрывать моделями 35–120B, помещающимися на пару видеокарт?
Базовые небольшие модели в чистом виде это полуфабрикаты. Их часто используют сырыми, получают посредственный результат и делают ложные выводы о непригодности. Но качественный файнтюнинг под специфику проекта (UI-kit, внутренние API, архитектурные шаблоны) дает на дистанции не просто сопоставимый, а зачастую более чистый результат без галлюцинаций и в разы быстрее.
Да, GLM вырывается вперед там, где нужна глубокая архитектурная логика и разбор сложных межмодульных связей. Но строить весь Dev-пайплайн только на монструозных моделях является экономическим оверхедом.
Будущее не за абстрактным “чем больше, тем лучше”, а за гибридным подходом: узкозаточенные FT-модели на локальном железе для рутины и одна тяжелая рассуждающая модель для редкого комплексного проектирования (которая нужна не всем и не всегда).
Дообучение же LoRA/QLoRA на сформированном датасете занимает пару часов и стоит копейки по сравнению с подписками/API-токенами монструозных моделей на всю команду разработки.
Мы живём в этой ловушке, это неизбежно, мы люди речи, но надо понимать её наличие.
Дополню из собственных мыслей, возникших за годы создания сети принятия решений:
В отличии от животных, люди не связаны с миром прямо. Наш язык и мышление является посредником. Мы не действуем с реальностью напрямую, мы ее называем, описываем и представляем в голове.
В этом наше отличие от животных. Кот не думает лизать ему яйца или нет, он не представляет в голове образ как он лижет яйца, он их лижет сразу. Потому что может, вернее, не может иначе. Он не может посмотреть на себя со стороны наложив нормы этики, морали и устоявшихся традиций в кошачем обществе и решить что пожалуй не стоит делать этого на улице.
Вполне понятная, маркетинговая тряска. Все хайп, что не некролог.
Вот когда нейронки научатся обходить пожарный топор, висящий на стене в серверной, возникнет небольшой повод для беспокойства, пока же это все "смотрите, мы тоже как Клод!"
Вы там определитесь, я далекий от ИИ или узкий специалист в своей микрообласти?
Вы действительно только прошлись своей распознавалкой по тексту, приняли ее коэффициент 0.60 и в саму статью не вчитывались?
Сначала я прочитал статью, в процессе чтения отловил глазами с десяток мест где глаз споткнулся, проверил на всякий случае скриптом на паттерны, убедился что монотонность и количество определенных приемов выдают с головой непереваренный слоп.
И вы ДЕЙСТВИТЕЛЬНО верите в то, о чем говорите, что статья - сплошной нейрослоп, от начала и до конца выдуманный нейронной, а я просто копировал и вставил?
Вы закинули в чат тему статьи, следом описали тему двумя предложениями и закинули пару фактов/наблюдений (в лучшем случае). Получили на выходе слоп и закинули в сюда.
Кстати, для человека, который "Я ИИ не пользуюсь, а живу в нём с 2022 года, еще с GPT-3.", могли бы и скилл накидать по правильному оформлению статей, взяв его из страницы для авторов, указать структуру и тд. А не так топорно.
Есть функция автогенератор, в который можно вставить curl или тела запросов/ответов, и сразу генерируются проверки, включая типы данных, whitelist для поиска лишних параметров, затем можно донастроить проверки под документацию (если необходимо).
Как реализовали, если не секрет? В общих чертах будет достаточно.
Также, если рассматривать работу в закрытом контуре, настоящий JSON нельзя отправить во внешний чат
Я говорю сугубо о внутреннем периметре (on-premise), никаких внешних чатов, все генерится моделью развернутой локальной. Такое решение собирается за пару вечеров опытным ML-инженером.
Также заметил, что оно под Windows 10 / 11, это однопользовательская программа и нужна лицензия на винду? Насколько я понимаю никакой интеграции в линуксовые CI/CD.
Я пытаюсь понять чем ваше решение может быть интересно и кому.
Зачем? В смысле для кого это? Если связка Pydantic + Pytest + LLM (для генерации тестов) + CI/CD сделают тоже самое по всему тесту за время пока вы будете накликивать первое правило проверки. И любой ручной тестировщик справится с вставкой в окно чата JSON запроса, URL и JSON правильного ответа.
Так я же и сказал что да, уличили, я живу и работаю в среде ИИ и везде его применяю и не скрываю этого.
Проблема не в этом.
И для вычитки статьи обширно применял.
А в том что применяли настолько обширно, что кроме воды, однострочных абзацев-обрывов, афористических концовок, искусственной симметрии и триад, а также неопределенной атрибуции и раздутой значимости там ничего не отсалось, вернее изначально не было.
Что ещё нужно? Что вы пытались донести?
Пытался донести что не стоит вываливать слоп в чистом виде, а хотя бы попробовать заменив часть воды своими мыслями, если они есть.
Но, как показывает практика, если это надо объяснять то это не надо объяснять.
Конечно нет. Могу добавить одно слово:
"В отличии от большинства животных, люди не связаны с миром прямо."
И ваша кошка в это большинство не входит.
Кошки проваливают классический зеркальный тест с меткой на лбу.
Из млекопитающих только мы, человекообразные обезьяны, слоны и дельфины его проходим, емнип.
Вы сейчас подменяете понятия, кошка не представляет себя внутри этой симуляции так, как это делает человек.
Я сравнивал стоимость развертывания GLM в локальном контуре со стоимостью развертывания среднеразмерных SFT моделей в локальном контуре.
В обоих случаях само собой разумеется, что либо есть сотрудники в штате, обладающие нужными компетенциями, либо привлечен вендор или интегратор.
Подписка хороша когда нет Пдн и работа сети некритична. В 99% случаях это касается отдела разработчиков. Ну забанит им Антропик аккаунт в очередной раз, ну побегают день добиваясь разблокировки, либо зарегают новый, попишут какое-то время код ручками. Не смертельно.
Другое дело, когда кодовая база работает с Пдн, имеет чувствительную корпоративную инфу или модель встроена в критичные бизнес процессы.
Например, в систему интеллектуального роутинга и обработки входящих обращений, автоматическое распознование входящих документов, систему безопасности (соблюдения ТБ, определения возгораний и тд), корпоративную базу знаний, которой пользуются одновременно несколько отделов... вплоть до контроля флотации для обогащения руды (автоматизация управления технологическими параметрами и снижение расхода реагентов).
Вот там, за пределами ИТ отдела, использование облачных зарубежных систем может доставить очень много неприятностей, а их отвал буквально парализовать работу компании.
Рекомендую прочитать пару (раз, два) моих статей на эту тему, если еще не читали.
Я один из тех кто оказывает такие услуги, в основном интеграторам, а они уже своим клиентам (иногда работаю с клиентами напрямую). Поэтому любые открытые расценки с моей стороны в том насколько это будет экономнее будут выглядеть рекламой (нарушением правил), чего я бы хотел избежать.
Зависит от задач, во многих случаях хватает от 35 до 80B, c учетом KV-кеша это примерно от 48 до 160GB VRAM.
Обычно в районе 256-262К.
Боюсь, что таких моделей с нормальным качеством просто не существует. Либо будет квантована в Q4, либо контекст будет урезан в 64К, либо параметров будет недостаточно для нормальной работы (3B).
Даже тернарная Bonsai 27B, которая требует около 5GB VRAM, имеет контекст всего лишь 8К и не дотягивает по качеству до SFT средних моделей о которых я писал в комментариях выше. А рекомендовать Qwen 2.5 Coder 7B (Q4_K_M) 128К или Llama 3.1 8B (Q4_K_M) 128К мне совесть не позволяет. Чудес не бывает.
Очевидно, тот же кто будет разворачивать GLM.
Достаточно одной модели на несколько направлений, она заточится под эти направления.
Затраты примерно на порядок дешевле т.е. в 10 раз. Это минимум, на самом деле больше. Детально по ценам расписывать не буду, потому что это уже будет рекламой, а она здесь запрещена. Порядок экономии средств думаю понятен.
Именно. Я о них не говорю. Потому-что, во-первых, мой комментарий касается только локального закрытого контура (on-prem) и сравниваю я небольшие модели с GLM в локальных контурах, а во-вторых, сейчас во многих случаях уже по совокупности проблем (от 152ФЗ до санкционных рисков) рассматривать зарубежные облачные решения мягко говоря не разумно.
Облачные зарубежные решения сейчас для тех кого даже массовый отзыв SSL/TLS-сертификатов не разбудил.
Причем тут бесплатно? Это конечно в десятки раз дешевле использования GLM в локальном контуре, но не настолько чтобы быть вообще бесплатным.
Стоимость поддержки такого сервера внутри компании ничем не отличается от любого другого. ML специфичный пайплайн обычно завернут в тот же докер и наружу торчат только ноги по OpenAPI спецификации. Девопса для такого сервера вполне достаточно.
Вы вроде бы не поняли сути моего изначального комментария, я лишь указал на то что можно обойтись затратами на порядок меньше для получения такого же результата. О халяве речи ни шло, хотя для компании средней руки это несерьезные расходы.
Если есть только код, то придется проделать подготовительный этап. Если помимо кода есть git repo, Сonfluence/Notion, Wiki/Jira/Slack/etc, а также хоть какой-то гайд или настройки линтера, то все намного упрощается т.к. проще засунуть в датасет архитектурные моменты.
Да, если их правильно готовить.
Зачем использовать гигантскую GLM, требующую целой серверной стойки, если 80% ежедневных задач в IDE можно закрывать моделями 35–120B, помещающимися на пару видеокарт?
Базовые небольшие модели в чистом виде это полуфабрикаты. Их часто используют сырыми, получают посредственный результат и делают ложные выводы о непригодности. Но качественный файнтюнинг под специфику проекта (UI-kit, внутренние API, архитектурные шаблоны) дает на дистанции не просто сопоставимый, а зачастую более чистый результат без галлюцинаций и в разы быстрее.
Да, GLM вырывается вперед там, где нужна глубокая архитектурная логика и разбор сложных межмодульных связей. Но строить весь Dev-пайплайн только на монструозных моделях является экономическим оверхедом.
Будущее не за абстрактным “чем больше, тем лучше”, а за гибридным подходом: узкозаточенные FT-модели на локальном железе для рутины и одна тяжелая рассуждающая модель для редкого комплексного проектирования (которая нужна не всем и не всегда).
Дообучение же LoRA/QLoRA на сформированном датасете занимает пару часов и стоит копейки по сравнению с подписками/API-токенами монструозных моделей на всю команду разработки.
Дополню из собственных мыслей, возникших за годы создания сети принятия решений:
В отличии от животных, люди не связаны с миром прямо. Наш язык и мышление является посредником. Мы не действуем с реальностью напрямую, мы ее называем, описываем и представляем в голове.
В этом наше отличие от животных. Кот не думает лизать ему яйца или нет, он не представляет в голове образ как он лижет яйца, он их лижет сразу. Потому что может, вернее, не может иначе. Он не может посмотреть на себя со стороны наложив нормы этики, морали и устоявшихся традиций в кошачем обществе и решить что пожалуй не стоит делать этого на улице.
Так вроде бы у задачи 2 не существует единственного правильного решения. Там ответ скорее в области философии.
Вполне понятная, маркетинговая тряска. Все хайп, что не некролог.
Вот когда нейронки научатся обходить пожарный топор, висящий на стене в серверной, возникнет небольшой повод для беспокойства, пока же это все "смотрите, мы тоже как Клод!"
P.S.: хм, знакомый у вас ник, мимо Obezyan.
Нет, не умеете, если вы не аутист (условно). Там сверхчеловеческая монотонность паттернов.
Спасибо за детальный и развернутый ответ. Теперь мне понятна целевая аудитория.
Зачем? Если вы дважды не поняли о чем я пишу. Не думаю, что в третий раз что-то изменится.
Вы там определитесь, я далекий от ИИ или узкий специалист в своей микрообласти?
Сначала я прочитал статью, в процессе чтения отловил глазами с десяток мест где глаз споткнулся, проверил на всякий случае скриптом на паттерны, убедился что монотонность и количество определенных приемов выдают с головой непереваренный слоп.
Вы закинули в чат тему статьи, следом описали тему двумя предложениями и закинули пару фактов/наблюдений (в лучшем случае). Получили на выходе слоп и закинули в сюда.
Кстати, для человека, который "Я ИИ не пользуюсь, а живу в нём с 2022 года, еще с GPT-3.", могли бы и скилл накидать по правильному оформлению статей, взяв его из страницы для авторов, указать структуру и тд. А не так топорно.
Как реализовали, если не секрет? В общих чертах будет достаточно.
Я говорю сугубо о внутреннем периметре (on-premise), никаких внешних чатов, все генерится моделью развернутой локальной. Такое решение собирается за пару вечеров опытным ML-инженером.
Также заметил, что оно под Windows 10 / 11, это однопользовательская программа и нужна лицензия на винду? Насколько я понимаю никакой интеграции в линуксовые CI/CD.
Я пытаюсь понять чем ваше решение может быть интересно и кому.
Зачем? В смысле для кого это? Если связка Pydantic + Pytest + LLM (для генерации тестов) + CI/CD сделают тоже самое по всему тесту за время пока вы будете накликивать первое правило проверки. И любой ручной тестировщик справится с вставкой в окно чата JSON запроса, URL и JSON правильного ответа.
Все, что я вам должен - прощаю.
Проблема не в этом.
А в том что применяли настолько обширно, что кроме воды, однострочных абзацев-обрывов, афористических концовок, искусственной симметрии и триад, а также неопределенной атрибуции и раздутой значимости там ничего не отсалось, вернее изначально не было.
Пытался донести что не стоит вываливать слоп в чистом виде, а хотя бы попробовать заменив часть воды своими мыслями, если они есть.
Но, как показывает практика, если это надо объяснять то это не надо объяснять.