Pull to refresh
4K+
2
Dmitriy Koshelev@dima_dmitriy

User

3
Rating
Send message

ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта

Level of difficultyMedium
Reading time11 min
Reach and readers7.5K

У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает?

Судья, который читал только текст диалога, ставил 18/20, а проверка по реальным вызовам инструментов давала 8/20. Текстовые проверки считали правдоподобный ответ верным и не могли отличить его от подтвержденного. Самодельный «процент фантомных эскалаций» оказался измерением того, насколько слова бота согласованы с его же внутренними флагами. Каждая метрика что‑то измеряла, и ничего продуктового

Тогда мы решили: оценка качества станет отдельным сервисом с собственным источником истины. В этой статье два переписывания формулы вердикта, несколько пойманных слепот и один эталонный набор, который учил нас доверять неправильным ошибкам.

Читать далее

Information

Rating
1,576-th
Location
Москва, Москва и Московская обл., Россия
Registered
Activity

Specialization

Ученый по данным, ML разработчик
Старший
Git
PostgreSQL
Python
Docker
Linux
ООП
Английский язык
LLM