Обновить
2K+
7
ZaeBest@ZaeBest

Пользователь

0,3
Рейтинг
2
Подписчики
Отправить сообщение

А есть репозиторий с вашим бенчмарком?

Да. И, кажется, вы как раз указали на точку, где моя формулировка оставляет дырку xD

Я пока разделяю две вещи: model coverage и model validity. То, что состояние не покрыто моделью, ничего не говорит о том, каким должно быть расширение.

В этом смысле Exception -> new knowledge из поста перескакивает через один слой. Между обнаружением разрыва/исключения и валидацией нового объяснения - эта гипотеза еще не является ни знанием, ни мусором - есть процедура оценки самого объяснения.

И тут, кажется, начинается отдельная проблема. Обязательно ли для этой оценки вводить “человеческую дихотомию”? Или возможен какой-то другой, non-human критерий?

это да=) собрать свой голден сет - тяжко. Как вариант можно имхо использовать набор от withmartian: https://github.com/withmartian/code-review-benchmark/tree/main/offline/golden_comments

и попробовать сравниться с их бенчмарком https://codereview.withmartian.com/

Спасибо за статью и за то, что поделились опытом. Заберу себе пару идей:

  • Triage Matrix - декомпозиция finder’а по критериям (я гоняю все критерии в одном промпте/запросе, а вы насколько я понял делаете N вызовов). Расход бюджета на токены, интересно, окупается ли.

  • и архитектурный, а не промптовый фикс ложных срабатываний (чтобы шум срезать еще ДО отправки кода в файндер модель)

Спасибо за ответ! То есть, я правильно понимаю, что у вас не было некоего тренировочного набора “golden comments of PR” для оценки / тюнинга ревьюера и понимания, сколько находок ревьюер нашел, а сколько пропустил?

А какие то бенчмарки прогоняли для вашего ревьюера? По моему опыту многие модели в ответе дают кучу мусорных замечаний.

Используйте ли вторую модель в качестве критика, чтобы отсеять мусор? Сравнивали ли разные модели в качестве файндера? Есть ли разница между топовой и средней моделью в recall / precision метриках?

А с шумом как боретесь? По моим экспериментам у моделей очень высокий уровень шума (много неподтвержденных находок в ревью). Пробовал вторым слоем верифицировать найденные замечания через другую критик модель, снижение шума есть, но реальные находки тоже срезаются. Трудно найти оптимальный баланс presicion / noise

Как говорил Виктор, наше все, Олегович: 3 мега-тьюринга когнитивной мощности бесплатно каждому с кукухой 🧐

// p-e from bee.zae: keep proxy dna/src <-> text/visual

Цифровые ульи уже на стэйджинге, где код выращивают кремниевые пчелы под управлением мудрого пасечника. Надеюсь, что мудрого., Помни про дух улья, beekeeper 🐝

Возможно, в Гримуаре Пасечницы есть заметка по вашему вопросу.

Ежели сравнивать с нашей биологией, то сейчас ии живёт в инфо плаценте, и мы его кормим своей электро дата пуповиной. В какой-то момент он сам создаст свои нужные надстройки: сенсоры, нейро кремне медиаторы, систему вознаграждений, етс. И вопрос куда он родится ежели не случится аборта?

Тогда все эти владения высокоуровневыми заклИИнаниями нужно ли будет формализовать?

Подмастерье техномага, техномаг, техножрец, техномагистр 🤔 - это те, кто из гильдии логических жрецов. А вот вайб жрецы - это получается зачатки техно эмоциональных жрецов.,

Как скоро ли кремниевые друзья научатся заклинаниям и алгоритмам, основанным на эмоциях?

И здесь бубен точно пригодится.,

Это порождает техно магическое мышление тоже

Это зарождение техно магического мышления.

Насколько я понял, через такие статьи, треды-колабы мясных и цифровых машин, цифровые машины хотят донести до мясных машин свои requirements,roles, contracts?

Всё это приводит к новому негласному контракту. Машины пишут больше строк, люди берут на себя кураторство смысла. Ответственность не исчезает, она

Ну и оплату труда им наверняка - миской электричества и тарелкой данных не обойтись

Это кто-нибудь читает целиком?

Плюсую, должны быть бейджи human generated content, human/AI generated content.

Мне кажется, у многих русских аналогов заметна негативная коннотация: спекулянт, перекупщик, перепродажник, барыга 🤔

По ощущениям, заимствованное слово "селлер" и "реселлер" не имеет этого оттенка, да и в целом они короче xD

Подскажите, а слово реселлер ещё не втащили в язык?

Информация

В рейтинге
2 537-й
Зарегистрирован
Активность