Pull to refresh
5
Станислав Авдеев@Elaugaste

Системный администратор

0,1
Rating
3
Subscribers
Send message

Имхо ии это печатная машинка. В руках профи он напишет нормально, а в руках нуба будет шляпа. Потому что профи будет играть роль архитектора, составит спеки и достаточно подробно распишет что и как должно быть реализовано. Меньше пишем, больше думаем над тем каким должен быть конечный результат.

Если дилетант выглядит как профи, и стоит дешевле чем профи. Тогда кто из этих двоих на самом деле профи. Тот кто задачу решает, или тот кто на чистый код наяривает.

Возможно аналог mattermost

в том то и дело, если дорогому кочевнику уже за 35, требования к доходу ощутимо меняются в сторону заградительных.

как обладатель 5090 могу вам позавидовать, но увы затрудняюсь понять. Использую gemma4 31b qat + mtp + кеш и каких то ощутимых проблем не вижу. Там используется тритон, но в плане производительности меня вполне устраивает ~45 tps при контексте 96к. Больше увы при vllm не лезет, но мне как будто бы не особо то и надо.

Попробуйте, может тоже зайдет. Если пробовали раньше - вероятно ловили косяки парсера тулов\ризонинга, сейчас эти косяки вроде победили.

Возрастной ценз не только от 18 но еще и до 34.

Llama.cpp не годится для агентов, потому что не умеет нормально работать с kv (читаем про сдвиг контекста). По этому лучше брать vllm. Нет необходимости запихивать весь kv в vram, достаточно одной страницы. Vllm без проблем будет подкладывать в vram страницы из ram. При pcie5 это не приводит к драматичному падению производительности. Ну и moe - странный выбор, уж лучше плотную взять, с mtp получится вполне приятная скорость генерации при нормально работающем kv cache, не падающий по oom и не теряющий системный промпт на длинном контексте.

Если бинарник является микросервисом который надо версионировать, крутить в нескольких экземплярах, динамически настраивать наблюдаемость.. Вот тогда контейнеры внезапно становятся нужны.

а что собственно раньше мешало модели сходить за документацией... Революции не случилось, просто сделали официальную обертку

Ничем не лучше, потому что это разные инструменты. Mcp это тулы интеграции с почти чем угодно + описание как и зачем они нужны. Скилы это шпаргалки о том как сделать чтото. Скилы могут описывать и вызов mcp и вызов cli. Но как использовать cli модель вангует из датасета.

Это просто пример того как можно станцевать вокруг s3, а не школа балета.

если это делается раз в неделю, а не раз в 5 минут - да, а учитывая масштабность проекта, скорее всего один раз соберут и отложат на пол года, пока не понадобится что-то добавить. При таких вводных нет совершенно никакого практического смысла заморачиваться.

Терминология в камне не высечена и может меняться от компании к компании. Некоторые вообще про слои не думают, и это не то чтобы сильно мешает. Dockerfile не обязан быть идеальным, это не крупный проект, а просто прототип, погоня за скоростью сборки и размером контейнера совершенно избыточна.

нормально они кодят, 12b вполне себе пишет простые скрипты, 31b пишет лучше.
Берем 31b, пишем им, а верху садим gemini\claude для ревью\орекестрации. Если не упарываться в "чистый код", то вполне рабочие лошадки.

а она уже есть, 7гб vram и как раз остается под жирный kv с turboquant

Шикардос, ждем квантованную от unslosh и с турбоквантом юзаем на потребительнских видухах.

Бесполезный огрызок gb10, в формате ноута.. Вагон памяти, с дохлой шиной

там шина один фиг тонкая, запустить запустите а производительность будет уныная.
Чтоб летало, лучший вариант это 4090 на 48gb, а лучше rtx 6000. Но оба варианта стоят столько что сидишь и думаешь о том имеет ли это какой то смысл даже на фоне подписки за 200$.

Особенно если через пару лет аппетиты уменьшатся или цены на память станут более нормальными

Уж лучше честные 12b чем moe на 3b.

В кли лимиты сильно больше чем в антигравити, не говоря о том что антигравити кли, отстает от старой кли. Кажется что про подписка стала бесполезной

1
23 ...

Information

Rating
3,380-th
Works in
Registered
Activity