Обновить
4K+
1
Эрнис Бадмаев@b_ernis

AI/ML инженер

4
Рейтинг
Отправить сообщение

ну нода судьи для циклических задач выглядит естественно, но я бы не давал ей напрямую управлять бесконечным возвратом задачки. Судья ведь может вернуть типизированный результат. Вы можете добавить что то типа Контроллера самого цикла, который будет обязан хранить чисто попыток, лимиты бюдета и репорты слать. Иначе 2 вероятностных агента могут долго возвращать работу друг другу, каждый раз немного меняя формулировку, но не устраняя сам дефект.

да, для живого ллм адаптера строгая json-ка была бы полезна, тот же equivalent, extracted,reason с фикс типами и энамчиком. В текущем виде в репо намернно не вызывается, просто используются записанные json ответы.
Но вот что сразу можно заметить:
1. json схема решает ведь только синтаксическую часть. Моделька все еще может вернуть совершенно валидный json с выдуманным "extracted=3/4" для ответа "не знаю" (это если в контексте описанных в статье примера). Поэтому json -схему я бы рассматривал как входной фильтр перед гейтом, а не как замену детерминированной проверки
2. Насчет смещения интуция дельная. Я бы проверял это на аб тестах на одном калибров.сете, где свободный ответ противопоставлял бы строгой схеме, а затем сравнил бы конфужн матрицу, каппу и долю ручной проверки. Кстати, я скорей всего, так и сделаю и результаты опубликацию как продолжение статьи, спасибо!

Информация

В рейтинге
1 383-й
Зарегистрирован
Активность

Специализация

ML разработчик
Старший
Git
PostgreSQL
SQL
Linux
Docker
Python
PyTorch
NLP
LLM