Комментарии 18
Спасибо, четко и по делу.
Главный вывод: моделей на 9B–27B параметров уже вполне достаточно для задач такого класса.
Неистово плюсую.
А что у вас с безопасностью ассистента? Хотелось бы понять как этот пласт у вас обработан? вижу что вы выпускаете его из песочницы. Что по защите от OWASP топ 10 угроз ии агентам в целом и по промпт инъекциям в частности? Ваша бд защищена? Ваш парсер как работает? Как вы защищаете БД от отравления? Есть какие то гейты? Карантины для принесенного из интернета?
Я вчитывался в вопросы безопасности - этому посвящены целые форумы и публикации, особенно для таких платфор, как Moltbook. Две базовые вещи. Доступ к file и shell должен быть ограничен; можно запускать в докере, можно в локальной файловой системе. Второе. Факты из интернета считаются недостоверными, если только не индексированы самим пользователем. Поскольку от промт-инъекций принципиальной защиты нет, приходится ограничивать весь доступ. Для периодического брифинга используется новостной mcp, который не вносится в постоянную память агента. Пока так. Но в целом это тема, которая активно меняется и развивается.
Серж, если агент не изолирован от документов личных, а тем более корпоративных, вопросами безопасности надо озаботиться. Не на уровне почитать, а на уровне - разобраться. Посвятить несколько часов хотя бы почитать реальные кейсы 2026 года, как люди жестко встревали. А затем перекрыть хотя бы основные поверхности для атак. Есть решения опенсорс по безопасности. А если хорошо вникнуть, то и свое можно написать.
Поэтому вердикт — 1x GPU c 24 ГБ VRAM или 2x GPU c 16 ГБ достаточно для ассистента при <27B моделях.
У вас еще жирно, я у себя умудряюсь на 1х12гб запускать на своем агенте, и норм, скорость в диапазоне 10-46т.с. среднее 25т.с зависит от модели =)
Да, вы абсолютно правы. 8B-9B отлично запускаются на одном GPU. Qwen3.5 ведет себя очень достойно, даже появилась дистилляция 3.8 в 9B. Но я заметил, что при сложной обработке документов, например, построй проекцию доходов-расходов по объекту X в течение времени Y, когда одновременно обрабатываются rag и графы, ответы 27B будут включать детали, которые может упустить 9B. Вероятно, что в 70B качество будет еще выше. Тут нужен компромисс между тем, что ЛЛМ дают и сколько денег нужно в них инвестировать. На мой взгляд вариант 2 GPU это оптимум, который хорош как для личного применения, так и для небольших фирм.
Пробовал тестировать и гонять разные модели бесплатные те, что есть в Ollame, чтобы разобраться, а можно ли использовать их для кодинга. В самой Ollame они работают, но как только делаю связку Ollama через OpenCode - всё приехали! оказывается модели могут только в терминале работать, как только идет связка через "думать", это работа кусочками через json запросы, приехали - и тормоза и капец.
Может я что не так настроил, но отказался пока от этой идеи. Сейчас для работы использую только облачные модели из пакета Go для OpenCode, и не дорого и выбор большой.
(P.S. забыл написать, я пробовал приручить модель qwen3-coder-latest)
Здесь принципиальный вопрос, можно ли доверять эту информацию или код облаку или это нечто, что нужно защищать? Если нет особой необходимости в защите, то кодекс, антигравити и так далее - я думаю, это сейчас безальтернативно. Возникает проблема, если это нечто, с чем делиться нельзя ни в коем случае. Локальный кодер, например, через VS Code, тоже неплох, но мне он не понравился. У ассистента другая задача. Он преобразует тяжело формализуемые вещи через LLM в цепочки инструментов. Здесь он работает, на мой взгляд, очень хорошо.
Вопрос новичка в данной теме: какие есть альтернативы AI-агенту для решения данной подзадачи " ассистент должен быть автономным 24/7 и сам инициировать действия, если это требуется в дневном workflow — считывать данные умного дома, внешних сенсоров и так далее " ?
Насколько оправдано использование именно AI-агнета для этого?
Мы писали систему управления для местной агрофермы. Ей в конце концов необходимо принимать решения на основе множественных сенсорных данных от растений, от окружающей среды и так далее. Можно обойтись без AI агента с привлечением агронома, плюс его зарплата, плюс расходы, плюс всё такое. Мы сделали с агентом через API, платим за токены, услуги агронома сократились раз в 10 (примерно). Сейчас перешли на дае локальные модели, платить за токены перестали. Плюс ушла головная боль с недоступностью серверов в час пик. Вот и разница.
А на какой бесплатной модели вы запустили агента? Если не секрет фирмы.
https://arxiv.org/pdf/2608.09949 здесь все подробно описано - и модели, и те случаи, которые возникли, где имеет смысл использовать ИИ и где нет.
Прочитал. Интересно.
Читая документ, поймал себя на флэшбеках из фильма «Марсианин», где герой выращивал картошку, и из цикла Сергея Тармашева «Древний», где ИИ - оцифрованный друг героя - пока тот спал, занимался разработками на подземной фабрике.
Я так понял модель от гугла. А какая и через что работала?
Для умного дома там есть определенная проблема с самими устройствами, протоколы типо Zigbee и тому подобный зоопарк, все рассчитано на то что устройство будет работать через внешний сервер производителя, который сегодня есть а завтра нет....
А так конечно, вы сами можете с помощью агента себе что то разработать, у меня к примеру агент сам себя подключает к нужному объекту мониторинга, пишет небольшой сенсор и далее все автоматом мониторится за счет кода, не полагаясь на саму модель, модель отрабатывает в случае сработки какого либо сенсора.
Все сейчас полагаются на MCP и всякие скилы, я использую Nagios что для мониторинга сервисов и серверов, надежнее, технология отработанная десятилетиями (предшественник Zabbix) .

Как я создавал персонального ассистента на домашнем железе