Pull to refresh

Comments 5

Очень полезная статья. Особенно если выбираешь что хочешь. Тут сразу весь зоопарк расписан, сразу понятно куда попадают твои задачи. А еще можно у других животных посмотреть полезные навыки и строить своего кентавра. В закладки улетает :)

Очень хорошее и качественное исследование! Спасибо!
Правда сложно читать нейротекст статьи, но это мелочи

Сильная часть исследования — разложение агентности по функциональным слоям. Я бы добавил ещё одну ось: качество самого доказательства — vendor self-report, demo, production trace или независимый replay. Сейчас один критерий может быть «подтверждён» источниками разного веса. Для пилота из 30–50 запросов полезно заранее зафиксировать failure classes и допустимое «не знаю», а затем считать не только accuracy, но coverage, abstention и принятый результат по классу последствий. Сохранились ли у вас сырые per-question traces, чтобы пересчитать результаты при изменении методики?

результаты есть, но тут все настолько быстро меняется, что думаю, этот документ лишь ориентир. Тем более что реально мало кто покупает этот AI функционал. Думаю через полгода год - если пойдут продажи и использование таких инструментов, можно улучшать эту методику и тестирование более серьезное! Готовы и вас привлечь в качестве эксперта (выходите на связь в ЛС)

Sign up to leave a comment.

Articles