Обновить
-1

Пользователь

0,1
Рейтинг
Отправить сообщение

Как можно сделать выбор на основании того что вы называете бенчмарком? С кем вы соревнуетесь? а еще у вас куча технических решений, а где обляционные исследования, было бы интересно понять насколько они работают?

Одна вода и ни одного бенчмарка.

а однажды запустила команду kill -9 -1, которая убила бы все доступные ей процессы, — та не сработала лишь из-за таймаута.

Интересно было бы узнать, как может килл -9 затаймаутиться))

Пожалуйста ещё раз) в статье нет в конфигах про отключения админских команд для обычных юзеров.

А где цены на кэшированные токены? Такое даже в yc есть. Они обычно в 10 раз дешевле стандартного инпута если что)

)))

About

Find vulnerabilities. Ship secure. — Senior security-engineer skill for AI coding agents. 

(c) BridgeSecurity

А тут кто будет отвечать какие здесь sla?

А как у вас бизнес платит если у вас цен за апи нет на тех же агентов.

Read-only RBAC переворачивает модель доверия. Агенту позволено ошибаться, потому что ошибка ничем не грозит

А если он своими ридами кластер заспамит.

Latency - time to first token при контексте реально заполненном до 50К (ну или 25К хотя бы), при первом запросе, и втором (когда должен работать префикс кеш) - вот это интересно.

Так доверяете Что забыли их добавить в конфиг?

Почему-то в статье про отключение команд ни слова.

По факту конфиг с админкой. Хотя бы напишите об этом чтобы чтобы люди которые попробуют ваши наработки не удивились неприятно потом.

Пользователь не будет видеть секреты - современные сетки уже хорошо их фильтруют.

Вы же сами с промт инжектингом боретесь или уже не боретесь?

Все сильно зависит от кейса, который хотите реализовать.

И что за кейс когда пользователям саппорт чата нужна админка?)

По-хорошему статью надо снимать и редактировать из соображений безопасности.

Отдельный Телеграм бот, отдельные секреты, скилы, провайдер ИИ модели (мозги) — все отдельное и независимое друг от друга.

И что юзер саппорт чата будет секреты видеть, хоть они и отдельные, а зачем это надо? А ещё админские команды выполнять)

И сколько одновременно пользователей обслужит такая нода без деградации?

А на каком железе крутилась модель и как с latency и со скоростью генерации?

Спасибо за цифры. Не так-то плохо!

Грустно что больше 8 параллельных запросов нельзя.

А что же вы time to first token не померяли? Когда есть cache hit и когда нет. Это метрика серьёзно влияет на пользовательский опыт.

Про контекстное окно было для красного словца? Потому что все перечисленной практики про другое, хотя те что касаются тестов - рабочие.

2-3 месяца вы серьёзно? этому учатся за вечер с чатом гпт

И вообще вайбкодер который учился не у чата гпт не достоин носить это гордое звание)

1
23 ...

Информация

В рейтинге
3 853-й
Зарегистрирован
Активность