Да. И, кажется, вы как раз указали на точку, где моя формулировка оставляет дырку xD
Я пока разделяю две вещи: model coverage и model validity. То, что состояние не покрыто моделью, ничего не говорит о том, каким должно быть расширение.
В этом смысле Exception -> new knowledge из поста перескакивает через один слой. Между обнаружением разрыва/исключения и валидацией нового объяснения - эта гипотеза еще не является ни знанием, ни мусором - есть процедура оценки самого объяснения.
И тут, кажется, начинается отдельная проблема. Обязательно ли для этой оценки вводить “человеческую дихотомию”? Или возможен какой-то другой, non-human критерий?
Спасибо за статью и за то, что поделились опытом. Заберу себе пару идей:
Triage Matrix - декомпозиция finder’а по критериям (я гоняю все критерии в одном промпте/запросе, а вы насколько я понял делаете N вызовов). Расход бюджета на токены, интересно, окупается ли.
и архитектурный, а не промптовый фикс ложных срабатываний (чтобы шум срезать еще ДО отправки кода в файндер модель)
Спасибо за ответ! То есть, я правильно понимаю, что у вас не было некоего тренировочного набора “golden comments of PR” для оценки / тюнинга ревьюера и понимания, сколько находок ревьюер нашел, а сколько пропустил?
А какие то бенчмарки прогоняли для вашего ревьюера? По моему опыту многие модели в ответе дают кучу мусорных замечаний.
Используйте ли вторую модель в качестве критика, чтобы отсеять мусор? Сравнивали ли разные модели в качестве файндера? Есть ли разница между топовой и средней моделью в recall / precision метриках?
А с шумом как боретесь? По моим экспериментам у моделей очень высокий уровень шума (много неподтвержденных находок в ревью). Пробовал вторым слоем верифицировать найденные замечания через другую критик модель, снижение шума есть, но реальные находки тоже срезаются. Трудно найти оптимальный баланс presicion / noise
Цифровые ульи уже на стэйджинге, где код выращивают кремниевые пчелы под управлением мудрого пасечника. Надеюсь, что мудрого., Помни про дух улья, beekeeper 🐝
Ежели сравнивать с нашей биологией, то сейчас ии живёт в инфо плаценте, и мы его кормим своей электро дата пуповиной. В какой-то момент он сам создаст свои нужные надстройки: сенсоры, нейро кремне медиаторы, систему вознаграждений, етс. И вопрос куда он родится ежели не случится аборта?
Тогда все эти владения высокоуровневыми заклИИнаниями нужно ли будет формализовать?
Подмастерье техномага, техномаг, техножрец, техномагистр 🤔 - это те, кто из гильдии логических жрецов. А вот вайб жрецы - это получается зачатки техно эмоциональных жрецов.,
Как скоро ли кремниевые друзья научатся заклинаниям и алгоритмам, основанным на эмоциях?
Насколько я понял, через такие статьи, треды-колабы мясных и цифровых машин, цифровые машины хотят донести до мясных машин свои requirements,roles, contracts?
Всё это приводит к новому негласному контракту. Машины пишут больше строк, люди берут на себя кураторство смысла. Ответственность не исчезает, она
Ну и оплату труда им наверняка - миской электричества и тарелкой данных не обойтись
А есть репозиторий с вашим бенчмарком?
Да. И, кажется, вы как раз указали на точку, где моя формулировка оставляет дырку xD
Я пока разделяю две вещи:
model coverageиmodel validity. То, что состояние не покрыто моделью, ничего не говорит о том, каким должно быть расширение.В этом смысле
Exception -> new knowledgeиз поста перескакивает через один слой. Между обнаружением разрыва/исключения и валидацией нового объяснения - эта гипотеза еще не является ни знанием, ни мусором - есть процедура оценки самого объяснения.И тут, кажется, начинается отдельная проблема. Обязательно ли для этой оценки вводить “человеческую дихотомию”? Или возможен какой-то другой, non-human критерий?
это да=) собрать свой голден сет - тяжко. Как вариант можно имхо использовать набор от
withmartian: https://github.com/withmartian/code-review-benchmark/tree/main/offline/golden_commentsи попробовать сравниться с их бенчмарком https://codereview.withmartian.com/
Спасибо за статью и за то, что поделились опытом. Заберу себе пару идей:
Triage Matrix - декомпозиция finder’а по критериям (я гоняю все критерии в одном промпте/запросе, а вы насколько я понял делаете N вызовов). Расход бюджета на токены, интересно, окупается ли.
и архитектурный, а не промптовый фикс ложных срабатываний (чтобы шум срезать еще ДО отправки кода в файндер модель)
Спасибо за ответ! То есть, я правильно понимаю, что у вас не было некоего тренировочного набора “golden comments of PR” для оценки / тюнинга ревьюера и понимания, сколько находок ревьюер нашел, а сколько пропустил?
А какие то бенчмарки прогоняли для вашего ревьюера? По моему опыту многие модели в ответе дают кучу мусорных замечаний.
Используйте ли вторую модель в качестве критика, чтобы отсеять мусор? Сравнивали ли разные модели в качестве файндера? Есть ли разница между топовой и средней моделью в recall / precision метриках?
А с шумом как боретесь? По моим экспериментам у моделей очень высокий уровень шума (много неподтвержденных находок в ревью). Пробовал вторым слоем верифицировать найденные замечания через другую критик модель, снижение шума есть, но реальные находки тоже срезаются. Трудно найти оптимальный баланс presicion / noise
Как говорил Виктор, наше все, Олегович: 3 мега-тьюринга когнитивной мощности бесплатно каждому с кукухой 🧐
// p-e from bee.zae: keep proxy dna/src <-> text/visual
del
Цифровые ульи уже на стэйджинге, где код выращивают кремниевые пчелы под управлением мудрого пасечника. Надеюсь, что мудрого., Помни про дух улья, beekeeper 🐝
Возможно, в Гримуаре Пасечницы есть заметка по вашему вопросу.
Ежели сравнивать с нашей биологией, то сейчас ии живёт в инфо плаценте, и мы его кормим своей электро дата пуповиной. В какой-то момент он сам создаст свои нужные надстройки: сенсоры, нейро кремне медиаторы, систему вознаграждений, етс. И вопрос куда он родится ежели не случится аборта?
Тогда все эти владения высокоуровневыми заклИИнаниями нужно ли будет формализовать?
Подмастерье техномага, техномаг, техножрец, техномагистр 🤔 - это те, кто из гильдии логических жрецов. А вот вайб жрецы - это получается зачатки техно эмоциональных жрецов.,
Как скоро ли кремниевые друзья научатся заклинаниям и алгоритмам, основанным на эмоциях?
И здесь бубен точно пригодится.,
Это порождает техно магическое мышление тоже
Это зарождение техно магического мышления.
Насколько я понял, через такие статьи, треды-колабы мясных и цифровых машин, цифровые машины хотят донести до мясных машин свои requirements,roles, contracts?
Ну и оплату труда им наверняка - миской электричества и тарелкой данных не обойтись
Это кто-нибудь читает целиком?
Плюсую, должны быть бейджи
humangenerated content,human/AIgenerated content.Мне кажется, у многих русских аналогов заметна негативная коннотация: спекулянт, перекупщик, перепродажник, барыга 🤔
По ощущениям, заимствованное слово "селлер" и "реселлер" не имеет этого оттенка, да и в целом они короче xD
Подскажите, а слово реселлер ещё не втащили в язык?