Pull to refresh
76
Александр Щепановский@Suor

User

13
Subscribers
Send message

Такие штуки уже в коде должны жить. Или в виде тестов, или хотя бы комментариев

Если область специфичная или требования, то по умолчанию модели, конечно будут писать не то, что надо. Надо просто получше из проинструктировать. И, конечно, не нужно это в промпт каждый раз писать, достаточно один раз настроить CLAUDE.md, ну или сделать это в несколько итеративных приёмов.

Что касается оптимизаций, то тут ЛЛМ легко уделывают людей просто за счёт усердия, а когда речь идёт о низкоуровневых алгоритмах, то путём мутаций и синтеза оптимального кода - у Гугла был проект ещё до всяких чатовгпт.

Это как раз гонка, причём простая, ещё опус 4.8 видел и такие и куда менее явные. Это даже без контекста видно, что косяк. Но роборевью как раз видит, весь этот код с ретраями, про который люди давно забыли. И есть ли там уникальный индекс, он пойдет и посмотрит. Вон в Линуксе число поправленных уязвимостей выросло с 500 до 2000 после появления ИИ ревью. Так что дохрена оно всего видит, хоть и не всё, но и люди не всё. Люди меньше, зато другое, так что нужно и то, и то.

Много всякого находит, не всё, правда, с первого раза, но ПР же по нескольку раз приходит, так что в итоге код выдрачивается как никогда. Выцепляет и гонки, и логические ошибки, и дублирование кода, и разъезжающиеся зависимости, вплоть до, а вот эта ветка не покрыта, тут докстринг не соответствует ходу вещей, а там в комменте опечатка.

Вы описываете ситуацию какой она была чуть меньше года назад. С тех пор модели и обвязки здорово выросли. Вполне возможно, что есть ещё области в программировании, где ИИ может только кусочки делать, а не решить задачу от начала до конца, но в большинстве случаев уже могут. Что касается качества кода, то модели косячат и люди косячат. Причём делают это по-разному, модель добавит лишнее усложнение и напишет нечитаемый блоб комментария (привет Опус 5), человек не заметит гонку и неочевидное поведение используемого компонента фреймворка. Так что в моей области сейчас между людьми толковыми и последними сейчас паритет, с вот такими оговорками.

На 125 долларовой подписке ревью среднего пуллреквеста Fable 5/medium effort съедает в среднем 11% пятичасовой квоты, это с инструкцией всякие исследования связанного кода и прочие эксперименты запускать на сабагентах на опусе, плюс использовать параллельные вызовы инструментов - уменьшает число раундов. В Fable 5.1 примерно на 70-90% меньше, она лучше делегирует, и как-то вообще экономнее. Правда, у нас код разбит на 200+ репозиториев, подавляющее число из которых умеренного размера, но прочие репозитории тоже склонированы рядом и агент туда смотрит.

Было бы интересно как справиться Кими через Claude Code

Через два месяца может уже новая модель будет, не от Антропик, так от кого-нибудь другого

А ну т.е. это дело будущего, а то у меня ни на одном из двух аккаунтов такого лимита нет пока. Придётся адаптироваться) запускать claude в tmux, например, и подсовывать промпт. Но засранцы, конечно.

claude -p идёт в лимиты подписки

Кажется на питоне можно было за 8 часов без всяких клодов и спеков написать. А если с Клодом, но без спеков за 2-3 часа. Вообще, задача небольшая, тут даже plan mode не факт что нужен

GLM и рядом не валялся, опус тормозил, конечно, и иногда просто вылетал по перегрузке, но глупостей не генерировал, по крайней мере, у меня

Я имел в виду именно 3.6 plus.

Вот только этот квен тупой как пробка. Он найдёт только всякие шаблонные ошибки да опечатки. А ещё же есть ложноположительные срабатывания, которые могут привести к тому, что ИИ вам не экономит время, а тратит.

На пару лет рассчитывать такое себе. Там могут и проблемы с чипами решить или, что более вероятно, пузырь ИИ сдуется. Поэтому нужно брать деньги инвесторов пока дают, оптимизировать инференс и вообще учиться жить на свои: больше зарабатывать и меньше тратить.

Обвязка - русское слово для harness

Все примеры не про модель, а про инструкции. Непонятно, что мешало всё то же самое делать с другими моделями

Добавить проверку или детерминированную через хук, или в виде другого агента, у которого другой задачи нет, кроме как проверять, что оно на сервере

В малом бизнесе просто нет такого количества дурных процессов, которые надо автоматизировать. Ещё нет дурных процессов, которые в принципе не автоматизируются. А ещё нет такого, что несколько лет пилится какая-то хрень, а потом выбрасывается. Нет целых подразделений, которые занимаются или обслуживанием сложности большой компании, или и вовсе никому не нужной ерундой.

В общем крупный бизнес конкурирует не с помощью какой-то эффективности или оптимизации, а за счёт концентрации ресурсов.

Разные сессии дают разные результаты, для этого ничего не нужно менять разработчикам.

1
23 ...

Information

Rating
4,910-th
Location
Красноярск, Красноярский край, Россия
Date of birth
Registered
Activity