Pull to refresh

Comments 27

PinnedPinned comments

И сколько времени на этот онанизм заранее обреченный эксперимент полной автономности агентов вы потратили?

Я бы не сказал, что заранее обреченный. Промпты отлажены, процент корректного кода, получаемый с первого раза довольно высокий (процентов 75-80%), а при рефакторинге новой функциональности не предполагается и все уже покрыто тестами.

Изучение вариантов self-hoting агентов происходило (и происходит) в фоне и отдельного времени не требует. Жало было потрачено времени (около трех-четырех дней), которые я потратил на настройку разных вариантов Claw, после чего решил перейти на специализированные.

Еще два-три дня потратил на попытку сформулировать собственные ожидания от конечного решения и быстрые варианты прототипов, и по итогам которых и выбрал несколько условно подходящих. После этого за пару часов настроил OpenHands, причем больше всего ушло на попытки разобраться с подключением к LLM провайдерам через агрегатор.

Сами эксперименты с OpenHands были примерно в течение недели. Но это уже в фоне, так как процесс работы агента не быстрый и обычно просто запускал его на ночь, а утром изучал результат. Потом запускал утром и смотрел в обед, потом еще раз уже перед ночной сессией.

Весь смысл подобной эпопеи не в коде (я ведь и в самом деле не рассчитывал на нормальный результат от автономной работы агентов), а в полученном опыте по итогам подобной работы. Ведь конечная цель - повысить качество кода в проекте, мной была достигнута, хотя и не тем способом, с которым я ставил эксперименты.

И сколько времени на этот онанизм заранее обреченный эксперимент полной автономности агентов вы потратили?

И традиционный вопрос: почему sonnet 4.5 хотя уже 5 месяцев как 4.6?

И сколько времени на этот онанизм заранее обреченный эксперимент полной автономности агентов вы потратили?

Я бы не сказал, что заранее обреченный. Промпты отлажены, процент корректного кода, получаемый с первого раза довольно высокий (процентов 75-80%), а при рефакторинге новой функциональности не предполагается и все уже покрыто тестами.

Изучение вариантов self-hoting агентов происходило (и происходит) в фоне и отдельного времени не требует. Жало было потрачено времени (около трех-четырех дней), которые я потратил на настройку разных вариантов Claw, после чего решил перейти на специализированные.

Еще два-три дня потратил на попытку сформулировать собственные ожидания от конечного решения и быстрые варианты прототипов, и по итогам которых и выбрал несколько условно подходящих. После этого за пару часов настроил OpenHands, причем больше всего ушло на попытки разобраться с подключением к LLM провайдерам через агрегатор.

Сами эксперименты с OpenHands были примерно в течение недели. Но это уже в фоне, так как процесс работы агента не быстрый и обычно просто запускал его на ночь, а утром изучал результат. Потом запускал утром и смотрел в обед, потом еще раз уже перед ночной сессией.

Весь смысл подобной эпопеи не в коде (я ведь и в самом деле не рассчитывал на нормальный результат от автономной работы агентов), а в полученном опыте по итогам подобной работы. Ведь конечная цель - повысить качество кода в проекте, мной была достигнута, хотя и не тем способом, с которым я ставил эксперименты.

все уже покрыто тестами

Видимо, это ключевое

Причем, тесты должны быть спроектированы человеком

Лучше сказать не “спроектированы”, а реализация тестов утверждена человеком :-)

По поводу долгой автономной работы агентов у меня такой опыт:

  • Нормально при археологии старого кода, истории гит

  • Планирует плохо, нужно предварительно долго вместе работать над планом. Когда описаны четкие контракты тогда реализует их четко и быстро, но долгой автономной работы нет по этой же причине

  • Жрёт токены

  • Моего времени на эксперименты ушло много

Поэтому очень сомнительно изначально

Моего времени на эксперименты ушло много

Не попробуешь, не узнаешь :-) Тем более, тут дополнительный профит в собственном опыте, который должен быть наработан шишками, а не чтением.

собственном опыте, который должен быть наработан шишками, а не чтением.

В моём возрасте уже хочется использовать чужие шишки, а не набивать свои

Тогда это будет уже не опытом, а знаниями, которые держатся на вере :-)

Совершенно не нужно пытаться спрыгнуть с самолёта без парашюта чтобы понять что так делать нельзя

Полностью согласен. Но в данном конкретном случае я посчитал, что собственный опыт будет лучше, чем чтение восторженных рекламных публикаций от ИИ консультантов, которые продвигают собственные ТГ каналы.

чтение восторженных рекламных публикаций от ИИ консультантов

Бесит! Столько времени отнимает проверять их враньё!

И традиционный вопрос: почему sonnet 4.5 хотя уже 5 месяцев как 4.6?

Не знаю, это вопрос к разработчикам Cline, Мне больше интересно, какой совет они дают, если пользователь уже работает на Sonnet 4.5 :-)

Кстати, да, у меня такое сообщение бывало на моделях Antropic.
Глюк с ранней суммаризацией тоже бывал на Antropic, это какой то взаимный баг CLine и провайдера. Провайдер шлет какие-то свои числа контекстного окна в ответах, у CLine в настройках другое - они не могут придти к общему знаменателю, в результате ранняя суммаризация.

Не, провайдер тут вообще не причем. Это именно локальный клиент чудит. Провайдеру-то что, сколько переслали, столько и загонит в модель.

В OpenAI протоколе в ответах на запросы приходят поля с данными контекста, окна, кешированных токенов и т.п. Клиент на основе этих данных судит о контексте. Сейчас как раз пишу свою обвязку.

Они у всех провайдеров приходят. Просто Cline это игнорирует и тупо сжимает контекст при достижении 128К

У меня не сжимает. Опять я что-то делаю не так...

Вот! Агрегатор - у меня тоже. Происходит рассогласование между данными провайдера, агрегатора и настройками CLine.

Я не эксперт, но почему Cline? Чем вас не устраивает встроенный в VS code чат copilot, в нем можно подключать и настраивать кастомные модели от любых провайдеров, есть роли, скилы, хуки, инструменты.

Первый раз я попробовал вайбкодинг на конференции Zero Const Conf с плагином Roo Code еще до того момента, как его закрыли. Но он мне не понравился из-за слишком большой навороченности и моря ненужных настроек. После чего попробовал CLine (Roo-Code это его форк) и он мне показался значительно удобнее и понятнее в плане работы и настройки.

На тот момент я не нашел в vscode возможности настроить подключение собственных провайдеров, поэтому и продолжал пользовался Cline. Возможно стоит попробовать перейти на встроенного агента, просто сейчас я знаю и понимаю тонкости работы с Cline, к тому же они выпустили CLI версию, которая пойдет и для автономной работы, тогда как в для встроенного в vscode агента такой возможности нет.

Автономную работу не пробовал, даже не интересовался. Но встроенный инструмент мне показался удобным в плане обычной разработки с агентом

Но встроенный инструмент мне показался удобным в плане обычной разработки с агентом

Он научился работать с другими LLM провайдерами только весной этого года. А еще в Cline у меня настроена система логирования результатов выполнения задач, которую очень удобно использовать для ретроспективного анализа.

Наверно тому, что только начинает, все равно чем пользоваться, а у меня вроде все заточено под конкретный агнета, и если переходить на другой, то нужно будет и все остальное переносить.

Новая версия Cline проблему не решила?

Нет. В 4 версии размер контекстного окна Cline имеет точно такой же баг и не воспринимает указанные настройки (всегда ограничивает по 128К независимо от явно указанного размера).

Sign up to leave a comment.

Articles