Комментарии 27
И сколько времени на этот
онанизмзаранее обреченный эксперимент полной автономности агентов вы потратили?
Я бы не сказал, что заранее обреченный. Промпты отлажены, процент корректного кода, получаемый с первого раза довольно высокий (процентов 75-80%), а при рефакторинге новой функциональности не предполагается и все уже покрыто тестами.
Изучение вариантов self-hoting агентов происходило (и происходит) в фоне и отдельного времени не требует. Жало было потрачено времени (около трех-четырех дней), которые я потратил на настройку разных вариантов Claw, после чего решил перейти на специализированные.
Еще два-три дня потратил на попытку сформулировать собственные ожидания от конечного решения и быстрые варианты прототипов, и по итогам которых и выбрал несколько условно подходящих. После этого за пару часов настроил OpenHands, причем больше всего ушло на попытки разобраться с подключением к LLM провайдерам через агрегатор.
Сами эксперименты с OpenHands были примерно в течение недели. Но это уже в фоне, так как процесс работы агента не быстрый и обычно просто запускал его на ночь, а утром изучал результат. Потом запускал утром и смотрел в обед, потом еще раз уже перед ночной сессией.
Весь смысл подобной эпопеи не в коде (я ведь и в самом деле не рассчитывал на нормальный результат от автономной работы агентов), а в полученном опыте по итогам подобной работы. Ведь конечная цель - повысить качество кода в проекте, мной была достигнута, хотя и не тем способом, с которым я ставил эксперименты.
И сколько времени на этот онанизм заранее обреченный эксперимент полной автономности агентов вы потратили?
И традиционный вопрос: почему sonnet 4.5 хотя уже 5 месяцев как 4.6?
И сколько времени на этот
онанизмзаранее обреченный эксперимент полной автономности агентов вы потратили?
Я бы не сказал, что заранее обреченный. Промпты отлажены, процент корректного кода, получаемый с первого раза довольно высокий (процентов 75-80%), а при рефакторинге новой функциональности не предполагается и все уже покрыто тестами.
Изучение вариантов self-hoting агентов происходило (и происходит) в фоне и отдельного времени не требует. Жало было потрачено времени (около трех-четырех дней), которые я потратил на настройку разных вариантов Claw, после чего решил перейти на специализированные.
Еще два-три дня потратил на попытку сформулировать собственные ожидания от конечного решения и быстрые варианты прототипов, и по итогам которых и выбрал несколько условно подходящих. После этого за пару часов настроил OpenHands, причем больше всего ушло на попытки разобраться с подключением к LLM провайдерам через агрегатор.
Сами эксперименты с OpenHands были примерно в течение недели. Но это уже в фоне, так как процесс работы агента не быстрый и обычно просто запускал его на ночь, а утром изучал результат. Потом запускал утром и смотрел в обед, потом еще раз уже перед ночной сессией.
Весь смысл подобной эпопеи не в коде (я ведь и в самом деле не рассчитывал на нормальный результат от автономной работы агентов), а в полученном опыте по итогам подобной работы. Ведь конечная цель - повысить качество кода в проекте, мной была достигнута, хотя и не тем способом, с которым я ставил эксперименты.
все уже покрыто тестами
Видимо, это ключевое
Причем, тесты должны быть спроектированы человеком
Лучше сказать не “спроектированы”, а реализация тестов утверждена человеком :-)
По поводу долгой автономной работы агентов у меня такой опыт:
Нормально при археологии старого кода, истории гит
Планирует плохо, нужно предварительно долго вместе работать над планом. Когда описаны четкие контракты тогда реализует их четко и быстро, но долгой автономной работы нет по этой же причине
Жрёт токены
Моего времени на эксперименты ушло много
Поэтому очень сомнительно изначально
Моего времени на эксперименты ушло много
Не попробуешь, не узнаешь :-) Тем более, тут дополнительный профит в собственном опыте, который должен быть наработан шишками, а не чтением.
собственном опыте, который должен быть наработан шишками, а не чтением.
В моём возрасте уже хочется использовать чужие шишки, а не набивать свои
Тогда это будет уже не опытом, а знаниями, которые держатся на вере :-)
Совершенно не нужно пытаться спрыгнуть с самолёта без парашюта чтобы понять что так делать нельзя
Полностью согласен. Но в данном конкретном случае я посчитал, что собственный опыт будет лучше, чем чтение восторженных рекламных публикаций от ИИ консультантов, которые продвигают собственные ТГ каналы.
И традиционный вопрос: почему sonnet 4.5 хотя уже 5 месяцев как 4.6?
Не знаю, это вопрос к разработчикам Cline, Мне больше интересно, какой совет они дают, если пользователь уже работает на Sonnet 4.5 :-)
Кстати, да, у меня такое сообщение бывало на моделях Antropic.
Глюк с ранней суммаризацией тоже бывал на Antropic, это какой то взаимный баг CLine и провайдера. Провайдер шлет какие-то свои числа контекстного окна в ответах, у CLine в настройках другое - они не могут придти к общему знаменателю, в результате ранняя суммаризация.
Не, провайдер тут вообще не причем. Это именно локальный клиент чудит. Провайдеру-то что, сколько переслали, столько и загонит в модель.
В OpenAI протоколе в ответах на запросы приходят поля с данными контекста, окна, кешированных токенов и т.п. Клиент на основе этих данных судит о контексте. Сейчас как раз пишу свою обвязку.
Они у всех провайдеров приходят. Просто Cline это игнорирует и тупо сжимает контекст при достижении 128К
У меня не сжимает. Опять я что-то делаю не так...
Рад за вас

Это к тому, что Cline не игнорирует.
Это зависит от провайдера, его API и самой модели. У меня это ограничение возникает при подключении через агрегатор.
Похожие проблемы:
https://github.com/cline/cline/issues/10980
https://github.com/cline/cline/issues/10551
https://github.com/cline/cline/issues/10094
Я не эксперт, но почему Cline? Чем вас не устраивает встроенный в VS code чат copilot, в нем можно подключать и настраивать кастомные модели от любых провайдеров, есть роли, скилы, хуки, инструменты.
Первый раз я попробовал вайбкодинг на конференции Zero Const Conf с плагином Roo Code еще до того момента, как его закрыли. Но он мне не понравился из-за слишком большой навороченности и моря ненужных настроек. После чего попробовал CLine (Roo-Code это его форк) и он мне показался значительно удобнее и понятнее в плане работы и настройки.
На тот момент я не нашел в vscode возможности настроить подключение собственных провайдеров, поэтому и продолжал пользовался Cline. Возможно стоит попробовать перейти на встроенного агента, просто сейчас я знаю и понимаю тонкости работы с Cline, к тому же они выпустили CLI версию, которая пойдет и для автономной работы, тогда как в для встроенного в vscode агента такой возможности нет.
Автономную работу не пробовал, даже не интересовался. Но встроенный инструмент мне показался удобным в плане обычной разработки с агентом
Но встроенный инструмент мне показался удобным в плане обычной разработки с агентом
Он научился работать с другими LLM провайдерами только весной этого года. А еще в Cline у меня настроена система логирования результатов выполнения задач, которую очень удобно использовать для ретроспективного анализа.
Наверно тому, что только начинает, все равно чем пользоваться, а у меня вроде все заточено под конкретный агнета, и если переходить на другой, то нужно будет и все остальное переносить.
Новая версия Cline проблему не решила?

Сладкие оковы вайб- к̶о̶д̶и̶н̶г̶а̶ инжиниринга [часть 2]