Имхо ии это печатная машинка. В руках профи он напишет нормально, а в руках нуба будет шляпа. Потому что профи будет играть роль архитектора, составит спеки и достаточно подробно распишет что и как должно быть реализовано. Меньше пишем, больше думаем над тем каким должен быть конечный результат.
Если дилетант выглядит как профи, и стоит дешевле чем профи. Тогда кто из этих двоих на самом деле профи. Тот кто задачу решает, или тот кто на чистый код наяривает.
как обладатель 5090 могу вам позавидовать, но увы затрудняюсь понять. Использую gemma4 31b qat + mtp + кеш и каких то ощутимых проблем не вижу. Там используется тритон, но в плане производительности меня вполне устраивает ~45 tps при контексте 96к. Больше увы при vllm не лезет, но мне как будто бы не особо то и надо.
Попробуйте, может тоже зайдет. Если пробовали раньше - вероятно ловили косяки парсера тулов\ризонинга, сейчас эти косяки вроде победили.
Llama.cpp не годится для агентов, потому что не умеет нормально работать с kv (читаем про сдвиг контекста). По этому лучше брать vllm. Нет необходимости запихивать весь kv в vram, достаточно одной страницы. Vllm без проблем будет подкладывать в vram страницы из ram. При pcie5 это не приводит к драматичному падению производительности. Ну и moe - странный выбор, уж лучше плотную взять, с mtp получится вполне приятная скорость генерации при нормально работающем kv cache, не падающий по oom и не теряющий системный промпт на длинном контексте.
Если бинарник является микросервисом который надо версионировать, крутить в нескольких экземплярах, динамически настраивать наблюдаемость.. Вот тогда контейнеры внезапно становятся нужны.
Ничем не лучше, потому что это разные инструменты. Mcp это тулы интеграции с почти чем угодно + описание как и зачем они нужны. Скилы это шпаргалки о том как сделать чтото. Скилы могут описывать и вызов mcp и вызов cli. Но как использовать cli модель вангует из датасета.
если это делается раз в неделю, а не раз в 5 минут - да, а учитывая масштабность проекта, скорее всего один раз соберут и отложат на пол года, пока не понадобится что-то добавить. При таких вводных нет совершенно никакого практического смысла заморачиваться.
Терминология в камне не высечена и может меняться от компании к компании. Некоторые вообще про слои не думают, и это не то чтобы сильно мешает. Dockerfile не обязан быть идеальным, это не крупный проект, а просто прототип, погоня за скоростью сборки и размером контейнера совершенно избыточна.
нормально они кодят, 12b вполне себе пишет простые скрипты, 31b пишет лучше. Берем 31b, пишем им, а верху садим gemini\claude для ревью\орекестрации. Если не упарываться в "чистый код", то вполне рабочие лошадки.
там шина один фиг тонкая, запустить запустите а производительность будет уныная. Чтоб летало, лучший вариант это 4090 на 48gb, а лучше rtx 6000. Но оба варианта стоят столько что сидишь и думаешь о том имеет ли это какой то смысл даже на фоне подписки за 200$.
Особенно если через пару лет аппетиты уменьшатся или цены на память станут более нормальными
Имхо ии это печатная машинка. В руках профи он напишет нормально, а в руках нуба будет шляпа. Потому что профи будет играть роль архитектора, составит спеки и достаточно подробно распишет что и как должно быть реализовано. Меньше пишем, больше думаем над тем каким должен быть конечный результат.
Если дилетант выглядит как профи, и стоит дешевле чем профи. Тогда кто из этих двоих на самом деле профи. Тот кто задачу решает, или тот кто на чистый код наяривает.
Возможно аналог mattermost
в том то и дело, если дорогому кочевнику уже за 35, требования к доходу ощутимо меняются в сторону заградительных.
как обладатель 5090 могу вам позавидовать, но увы затрудняюсь понять. Использую gemma4 31b qat + mtp + кеш и каких то ощутимых проблем не вижу. Там используется тритон, но в плане производительности меня вполне устраивает ~45 tps при контексте 96к. Больше увы при vllm не лезет, но мне как будто бы не особо то и надо.
Попробуйте, может тоже зайдет. Если пробовали раньше - вероятно ловили косяки парсера тулов\ризонинга, сейчас эти косяки вроде победили.
Возрастной ценз не только от 18 но еще и до 34.
Llama.cpp не годится для агентов, потому что не умеет нормально работать с kv (читаем про сдвиг контекста). По этому лучше брать vllm. Нет необходимости запихивать весь kv в vram, достаточно одной страницы. Vllm без проблем будет подкладывать в vram страницы из ram. При pcie5 это не приводит к драматичному падению производительности. Ну и moe - странный выбор, уж лучше плотную взять, с mtp получится вполне приятная скорость генерации при нормально работающем kv cache, не падающий по oom и не теряющий системный промпт на длинном контексте.
Если бинарник является микросервисом который надо версионировать, крутить в нескольких экземплярах, динамически настраивать наблюдаемость.. Вот тогда контейнеры внезапно становятся нужны.
а что собственно раньше мешало модели сходить за документацией... Революции не случилось, просто сделали официальную обертку
Ничем не лучше, потому что это разные инструменты. Mcp это тулы интеграции с почти чем угодно + описание как и зачем они нужны. Скилы это шпаргалки о том как сделать чтото. Скилы могут описывать и вызов mcp и вызов cli. Но как использовать cli модель вангует из датасета.
Это просто пример того как можно станцевать вокруг s3, а не школа балета.
если это делается раз в неделю, а не раз в 5 минут - да, а учитывая масштабность проекта, скорее всего один раз соберут и отложат на пол года, пока не понадобится что-то добавить. При таких вводных нет совершенно никакого практического смысла заморачиваться.
Терминология в камне не высечена и может меняться от компании к компании. Некоторые вообще про слои не думают, и это не то чтобы сильно мешает. Dockerfile не обязан быть идеальным, это не крупный проект, а просто прототип, погоня за скоростью сборки и размером контейнера совершенно избыточна.
нормально они кодят, 12b вполне себе пишет простые скрипты, 31b пишет лучше.
Берем 31b, пишем им, а верху садим gemini\claude для ревью\орекестрации. Если не упарываться в "чистый код", то вполне рабочие лошадки.
а она уже есть, 7гб vram и как раз остается под жирный kv с turboquant
Шикардос, ждем квантованную от unslosh и с турбоквантом юзаем на потребительнских видухах.
Бесполезный огрызок gb10, в формате ноута.. Вагон памяти, с дохлой шиной
там шина один фиг тонкая, запустить запустите а производительность будет уныная.
Чтоб летало, лучший вариант это 4090 на 48gb, а лучше rtx 6000. Но оба варианта стоят столько что сидишь и думаешь о том имеет ли это какой то смысл даже на фоне подписки за 200$.
Особенно если через пару лет аппетиты уменьшатся или цены на память станут более нормальными
Уж лучше честные 12b чем moe на 3b.
В кли лимиты сильно больше чем в антигравити, не говоря о том что антигравити кли, отстает от старой кли. Кажется что про подписка стала бесполезной