Идея со «скептиком» интересная, без него агенты действительно моментально уходят в галлюцинации. А сколько времени у вас ушло на отладку промптов под него, чтобы он не зацикливался?
90% пилотов проваливаются обычно не из-за отсутствия «цифрового контекста», а из-за банального галлюцинирования моделей на нетривиальных задачах. В подкасте разбираете, как технически решали проблему валидации ответов агентов?
Уважение за DITA. Сейчас все на Markdown прыгают, а потом мучаются с мультиязычностью и валидацией ссылок. Для enterprise-инструмента подход с локальным индексом без внешнего ИИ — самое разумное решение.
Любопытный расклад по бенчмаркам. То, что модель вытягивают синтетикой и SFT-траекториями без раздувания параметров — правильный тренд для ценника в $2/$6. Но просадка на Terminal-Bench v3.0 до 26% огорчает. Не пробовал ещё затестить её в Cursor на реальном проекте? Интересно, как ощущается эта самопроверка на длинных дистанциях в сравнении со стандартной Fable 5.
Идея со «скептиком» интересная, без него агенты действительно моментально уходят в галлюцинации. А сколько времени у вас ушло на отладку промптов под него, чтобы он не зацикливался?
90% пилотов проваливаются обычно не из-за отсутствия «цифрового контекста», а из-за банального галлюцинирования моделей на нетривиальных задачах. В подкасте разбираете, как технически решали проблему валидации ответов агентов?
Уважение за DITA. Сейчас все на Markdown прыгают, а потом мучаются с мультиязычностью и валидацией ссылок. Для enterprise-инструмента подход с локальным индексом без внешнего ИИ — самое разумное решение.
Любопытный расклад по бенчмаркам. То, что модель вытягивают синтетикой и SFT-траекториями без раздувания параметров — правильный тренд для ценника в $2/$6. Но просадка на Terminal-Bench v3.0 до 26% огорчает. Не пробовал ещё затестить её в Cursor на реальном проекте? Интересно, как ощущается эта самопроверка на длинных дистанциях в сравнении со стандартной Fable 5.