Хороший вопрос, и он ровно про «а зачем всё это нужно, если можно просто задать запрос LLM напрямую».
1. Чем отличается «агентный» подход от простого промпта в Курсоре
Когда мы пишем LLM «сделай всё», мы получаем один проход модели: она берёт текст, пытается угадать решение и выдаёт результат. Но:
Нет памяти и итеративности. Если ошибка — придётся вручную уточнять запрос.
LLM не проверяет себя: она не запускает код, не тестирует гипотезу.
Ограничен масштаб задачи. Чем длиннее и запутаннее инструкция, тем выше шанс «потерять нить» и выдать мусор.
Агент же — это оболочка, которая:
Делит задачу на подшаги.
Может перезапускать код, проверять тесты, возвращаться к ошибкам.
Автоматически адаптируется к окружению (например, пробует разные библиотеки, а не только те, что «всплыли» в первом ответе).
По сути, это уже не «магический промпт», а цикл работы, где LLM выступает мозгом, а агент управляет процессом.
2. Чем это лучше и качественнее
Меньше ручного участия. Не нужно самому нянчить LLM, подсовывая уточняющие подсказки.
Выше точность на сложных задачах. Например, в SWE-Bench Verified агенты закрывают больше issue, чем «один промпт» к модели.
Робастность. Если окружение изменилось (новая версия пакета, другие тесты), агент адаптируется, а не ломается.
То есть это не «шило на мыло», а переход от «попробуй угадать» к «работай как инженер».
3. Практическое применение и цены
Можно использовать и недорогие модели (Claude Haiku, GPT-4o-mini, Mistral-8x7B, Llama-3.1-70B-Instruct). Агентная логика не требует «самого дорогого флагмана» — даже средняя модель, если дать ей инструменты и возможность перепроверять, даст результат лучше, чем дорогая, но в «один выстрел».
Примеры:
Кодинг. Автозакрытие issue с тестами (как в SWE-bench). Даже open-source агенты с Llama-3.1 умеют решать больше задач, чем просто промпт к GPT-4.
Документы. Авторазбор pdf → извлечение таблиц → сверка с базой. LLM сама по себе часто путает шаги, а агент прогоняет пайплайн.
Аналитика. Вопрос «собери данные, очисти, построи график и выведи инсайты» в чистом промпте часто ломается. Агент с Python-интерпретатором делает итерации до корректного графика.
4. Бюджетные сценарии
Можно поднять локально open-source агент + Llama-3.1-8B (бесплатно).
Можно использовать платные мини-модели (GPT-4o-mini, Claude Haiku), они стоят центы, но за счёт агентного цикла реально работают лучше «голого GPT-4».
Можно комбинировать: тяжёлую модель подключать только на финальном шаге (верификация/редактура), а вся черновая работа идёт на дешёвых.
👉 Итог: агентный подход — это не «новый промпт», а способ повысить надёжность и автоматизировать до конца, даже если модель среднего качества. В одиночку LLM остаётся «разговорным ассистентом», а с агентом превращается в работающего помощника-исполнителя.
Спасибо за внимательный и полезный отзыв! Иногда в процессе работы многое кажется очевидным, но именно Ваши замечания помогают мне сделать объяснения понятнее с первых строк.
Анализирую обратную связь, чтобы лучше понимать, какие темы и форматы интересны читателям Хабра, и стараюсь совершенствовать материалы. Ваши вопросы и комментарии — лучшая мотивация для роста!
Когда я проходил по нашим основным источникам — блогам Google про Gemini 2.5 (и мартовскому анонсу, и обновлениям с I/O 2025), Meta AI блогу о Llama 4 и обзору WindowsCentral про Microsoft Phi-4-mini — меня сразу поразила общая мысль. Там все сходятся на том, что новые версии моделей обеспечивают заметное ускорение генерации ответов при сохранении тех же параметров сэмплинга, включая temperature. Это принципиально — потому что ускорение достигается не ценой «сглаживания» или упрощения вывода, а за счёт внутренних оптимизаций архитектуры и inference-процессов.
Например:
· В блоге Google про Gemini 2.5 Pro подчёркивают, что оптимизации позволили увеличить производительность без потери качества, то есть model выдает ответы быстрее, но с тем же уровнем randomness, контролируемым temperature.
· Meta AI в материале о Llama 4 говорит о повышении throughput и сокращении latency, сохраняя непрерывность процесса генерации при неизменных настройках модели.
· В WindowsCentral описывают архитектуру Phi-4-mini «flash reasoning», где гибридные подходы дают сокращение задержек в 2–3 раза и ускорение отклика до 10х без потери смысловой глубины — опять же, при той же температуре сэмплинга.
Именно поэтому я в статье сформулировал так: «вычисляет ответ быстрее… даже при равной температуре». Эта фраза отражает общий вывод из топовых источников 2024–2025: улучшение скорости генерации стало результатом архитектурных и инженерных инноваций, а не снижением качества генерации за счёт изменения параметров, которые влияют на креативность или детальность ответа.
Добрый день. Очень этого хотелось бы. Временных ресурсов не всегда хватает. Работаю над этим. Просто сама статья показалась интересной. Конечно не все гладко, скорее всего как описывают авторы. Да, хорошее у вас пожелание. Спасибо.
2017. Тут даже дело не в механизме, не в архитектуре. Тут дело в математике, а именно в tanh и сигмоида. Этот подход применяется в TABNET. Над этим сейчас работаю, меня больше это интересовало. А перевод решил опубликовать, может кому интересно будет. Спасибо.
Мир меняется, очень. Важно, то , что этим обязательно надо пользоваться и уже сейчас.
Добрый день. В репозитории смотрели варианты реализации?
Добрый день.
Хороший вопрос, и он ровно про «а зачем всё это нужно, если можно просто задать запрос LLM напрямую».
1. Чем отличается «агентный» подход от простого промпта в Курсоре
Когда мы пишем LLM «сделай всё», мы получаем один проход модели: она берёт текст, пытается угадать решение и выдаёт результат. Но:
Нет памяти и итеративности. Если ошибка — придётся вручную уточнять запрос.
LLM не проверяет себя: она не запускает код, не тестирует гипотезу.
Ограничен масштаб задачи. Чем длиннее и запутаннее инструкция, тем выше шанс «потерять нить» и выдать мусор.
Агент же — это оболочка, которая:
Делит задачу на подшаги.
Может перезапускать код, проверять тесты, возвращаться к ошибкам.
Автоматически адаптируется к окружению (например, пробует разные библиотеки, а не только те, что «всплыли» в первом ответе).
По сути, это уже не «магический промпт», а цикл работы, где LLM выступает мозгом, а агент управляет процессом.
2. Чем это лучше и качественнее
Меньше ручного участия. Не нужно самому нянчить LLM, подсовывая уточняющие подсказки.
Выше точность на сложных задачах. Например, в SWE-Bench Verified агенты закрывают больше issue, чем «один промпт» к модели.
Робастность. Если окружение изменилось (новая версия пакета, другие тесты), агент адаптируется, а не ломается.
То есть это не «шило на мыло», а переход от «попробуй угадать» к «работай как инженер».
3. Практическое применение и цены
Можно использовать и недорогие модели (Claude Haiku, GPT-4o-mini, Mistral-8x7B, Llama-3.1-70B-Instruct). Агентная логика не требует «самого дорогого флагмана» — даже средняя модель, если дать ей инструменты и возможность перепроверять, даст результат лучше, чем дорогая, но в «один выстрел».
Примеры:
Кодинг. Автозакрытие issue с тестами (как в SWE-bench). Даже open-source агенты с Llama-3.1 умеют решать больше задач, чем просто промпт к GPT-4.
Документы. Авторазбор pdf → извлечение таблиц → сверка с базой. LLM сама по себе часто путает шаги, а агент прогоняет пайплайн.
Аналитика. Вопрос «собери данные, очисти, построи график и выведи инсайты» в чистом промпте часто ломается. Агент с Python-интерпретатором делает итерации до корректного графика.
4. Бюджетные сценарии
Можно поднять локально open-source агент + Llama-3.1-8B (бесплатно).
Можно использовать платные мини-модели (GPT-4o-mini, Claude Haiku), они стоят центы, но за счёт агентного цикла реально работают лучше «голого GPT-4».
Можно комбинировать: тяжёлую модель подключать только на финальном шаге (верификация/редактура), а вся черновая работа идёт на дешёвых.
👉 Итог: агентный подход — это не «новый промпт», а способ повысить надёжность и автоматизировать до конца, даже если модель среднего качества. В одиночку LLM остаётся «разговорным ассистентом», а с агентом превращается в работающего помощника-исполнителя.
Добрый день.Хорошо, учтем, спасибо.
Добрый день. Всё в Ваших руках.
Спасибо за внимательный и полезный отзыв! Иногда в процессе работы многое кажется очевидным, но именно Ваши замечания помогают мне сделать объяснения понятнее с первых строк.
Анализирую обратную связь, чтобы лучше понимать, какие темы и форматы интересны читателям Хабра, и стараюсь совершенствовать материалы. Ваши вопросы и комментарии — лучшая мотивация для роста!
Когда я проходил по нашим основным источникам — блогам Google про Gemini 2.5 (и мартовскому анонсу, и обновлениям с I/O 2025), Meta AI блогу о Llama 4 и обзору WindowsCentral про Microsoft Phi-4-mini — меня сразу поразила общая мысль. Там все сходятся на том, что новые версии моделей обеспечивают заметное ускорение генерации ответов при сохранении тех же параметров сэмплинга, включая temperature. Это принципиально — потому что ускорение достигается не ценой «сглаживания» или упрощения вывода, а за счёт внутренних оптимизаций архитектуры и inference-процессов.
Например:
· В блоге Google про Gemini 2.5 Pro подчёркивают, что оптимизации позволили увеличить производительность без потери качества, то есть model выдает ответы быстрее, но с тем же уровнем randomness, контролируемым temperature.
· Meta AI в материале о Llama 4 говорит о повышении throughput и сокращении latency, сохраняя непрерывность процесса генерации при неизменных настройках модели.
· В WindowsCentral описывают архитектуру Phi-4-mini «flash reasoning», где гибридные подходы дают сокращение задержек в 2–3 раза и ускорение отклика до 10х без потери смысловой глубины — опять же, при той же температуре сэмплинга.
Именно поэтому я в статье сформулировал так: «вычисляет ответ быстрее… даже при равной температуре». Эта фраза отражает общий вывод из топовых источников 2024–2025: улучшение скорости генерации стало результатом архитектурных и инженерных инноваций, а не снижением качества генерации за счёт изменения параметров, которые влияют на креативность или детальность ответа.
Посмотрим)
Рисовал накануне, вечером, а обсудить можно с утра)
Спасибо большое.
Добрый день. Можно установить из репозитория и начать использовать. - https://github.com/TencentARC/GFPGAN