Вы не пробовали свой MCP сервер в какой-нибудь openclow или hermes подключить чтобы заказывать через чат с ии помошником?
Что такое MCP и зачем он тут
MCP (Model Context Protocol) — это стандарт, по которому ИИ-ассистент (Claude, и не только) подключает внешние «инструменты». Ты описываешь набор функций — search_products, add_to_cart, checkout_preview — и модель вызывает их сама, когда это нужно по ходу диалога.
Строго говоря это вы описали просто tool calling и у обычного агента тоже есть тулы которые он дает модели и там нет никакого стороннего MCP сервера.
А ещё, раз уж вы сделали отдельный сервер, то можно еще туда добавить Access Log например)
Как можно сделать выбор на основании того что вы называете бенчмарком? С кем вы соревнуетесь? а еще у вас куча технических решений, а где обляционные исследования, было бы интересно понять насколько они работают?
Latency - time to first token при контексте реально заполненном до 50К (ну или 25К хотя бы), при первом запросе, и втором (когда должен работать префикс кеш) - вот это интересно.
Вы не пробовали свой MCP сервер в какой-нибудь openclow или hermes подключить чтобы заказывать через чат с ии помошником?
Строго говоря это вы описали просто tool calling и у обычного агента тоже есть тулы которые он дает модели и там нет никакого стороннего MCP сервера.
А ещё, раз уж вы сделали отдельный сервер, то можно еще туда добавить Access Log например)
Так вы корпус бенчмаркаете или свое решение для памяти? Может есть какое-то популярное решение для памяти и там будет 99% или 9% на тех же данных?
Чего?
Как можно сделать выбор на основании того что вы называете бенчмарком? С кем вы соревнуетесь? а еще у вас куча технических решений, а где обляционные исследования, было бы интересно понять насколько они работают?
Одна вода и ни одного бенчмарка.
Интересно было бы узнать, как может килл -9 затаймаутиться))
Пожалуйста ещё раз) в статье нет в конфигах про отключения админских команд для обычных юзеров.
А где цены на кэшированные токены? Такое даже в yc есть. Они обычно в 10 раз дешевле стандартного инпута если что)
)))
(c) BridgeSecurity
А тут кто будет отвечать какие здесь sla?
А как у вас бизнес платит если у вас цен за апи нет на тех же агентов.
А если он своими ридами кластер заспамит.
Latency - time to first token при контексте реально заполненном до 50К (ну или 25К хотя бы), при первом запросе, и втором (когда должен работать префикс кеш) - вот это интересно.
Так доверяете Что забыли их добавить в конфиг?
Почему-то в статье про отключение команд ни слова.
По факту конфиг с админкой. Хотя бы напишите об этом чтобы чтобы люди которые попробуют ваши наработки не удивились неприятно потом.
Вы же сами с промт инжектингом боретесь или уже не боретесь?
И что за кейс когда пользователям саппорт чата нужна админка?)
По-хорошему статью надо снимать и редактировать из соображений безопасности.
И что юзер саппорт чата будет секреты видеть, хоть они и отдельные, а зачем это надо? А ещё админские команды выполнять)
И сколько одновременно пользователей обслужит такая нода без деградации?
А на каком железе крутилась модель и как с latency и со скоростью генерации?
Спасибо за цифры. Не так-то плохо!
Грустно что больше 8 параллельных запросов нельзя.
А что же вы time to first token не померяли? Когда есть cache hit и когда нет. Это метрика серьёзно влияет на пользовательский опыт.