Комментарии 40
Для агентского режима это очень медленно. Это начинает раздражать. Если взять модель DeepSeek-V4.1-Flash напрямую через API DeepSeek, скорость там достигает 300 токенов в секунду
Для агентского режима с четкой проверкой можно. В остальных случаях - брезгую: столько вранья давно не видел.
А есть какая-то корреляция между измеримой скоростью токенов в секунду и количеством вранья?
Есть реальная польза от агентского режима с многоступенчатой доказательной проверкой, ловится куча багов, пустышек, обещаний и т.д, это работает на любой модели, а разницы из за скорости генерации я не разу не замечал.
Спрошу по-другому - агентский режим на локальной модели с, допустим 12Гб видео и 64Гб оперативки будет работать, пусть и неспеша, но без такого же количества вранья как в упомянутом DeepSeek-V4.1-Flash ?
Скажем так, гарантии я не дам, потому что работаю на своем собственном агенте, а что возьмете вы и как настроите я не знаю, а от агентского контура зависит все.
А на счет DeepSeek-V4.1-Flash, у меня он сейчас как раз подключен, как облачная модель, и вот наблюдение, я ему кинул ссылку на статью, и сказал, хочу то что в статье но с своим блэкджеком, к вечеру полный функционал был готов, в агентском режиме он работает на ура.
Вот кстати если интересно, как работает режим проверки, это дипсик 4.1, режим работы swarm когда есть оркестратор и воркер, и вот как раз воркер закончил работу и прислал отчет оркестратору, а тот не поверил ему, и не зря, нашел косяки и отправил воркера исправлять, без моего вмешательства в работу агента.
А были ли внешние инструменты - тот же Qdrant+BAAI-m3 эбмеддер, сейчас в облачных сервисах полно этого добра. Делается векторная БД, затем чанкуется любой даташит что под руку попал (включая код с коммент-промпт форматом - не пренебрегайте этим!) и модель всё делает почти так как руками, хоть Алиса хоть Сбер. Мне очень всё это дело помогло сделать микро-проект с PWM/ADC/UART/I2C/SPI с DMA, все адекватные конечные автоматы с фоллбеками и обработчиками ошибок, практически на уровне main(){} с таймерами миниатюрная RTOS, полное понимание проблем RMW с гонкой данных и всё это впихнуть в 64 к флеша и 20к озушки, прочих вкусных протокольных внешних микрух а-ля SPI дисплейчик, мультиплексоры I2C и умные драйверы шаговых. Плюс ещё скиллы соответствующие и промпт-инъекции чтобы направить в нужное русло ну и конечно же md-саммари с хорошей цепочкой и контрольным выводом, плюс питонячьи тесты (уже давно отодвинул Matlab) и тестирующие C-обёртки. Практически можно не использовать stdlib а генерировать printf/scanf по месту и прочие парсеры, умещаясь в килобайты как на каком-нибудь спектруме, самое невероятное - практически отпала необходимость искать чьи-либо библиотеки (!) для периферии, шрифтов, рендеров итд, всё генерируется по месту, остаётся только что-то вроде HAL/SPL на уровне спецификаций регистров управления. Вообщем это добротный джун/миддл с опытом работы 50+ лет в отрасли, начиная от Z80 и до GPU/FPGA.
То есть ситуация такая: даже самые дешевые и самые тупые фронтирные модели стали достаточно умными. Если ты разбираешься в теме, их уровня хватает за глаза.
Если разбираешься в теме то и локальной Qwen 3.8 или ornith-1.5 вполне достаточно, и вуаля, затраты только на электричество 🤣
К сожалению на моей GPU игровой с 16 VRAM сильно медленный инференс для этих моделей. А если контекст растёт, то вообще мрак. А он растёт на громадных кодовых базах где я работаю... А так конечно что то маленькое чуть сложнее hello world проектик или микро сервис - вполне тянет ) тут не спорю )
qwen3.8-27b q3_xxs , KV кэш квантован до q4, контекст ~100k - на 5080 16gb 50-60 tps, prefill - пара секунд для почти забитого контекста. Проект на 180k LOC
У меня RTX 4070 Ti SUPER 16 GB - вообще я надеюсь что они выпустят qwen3.8 30B и что бы MoE архитектура что бы прям летало ) А qwen3.8-27b q3_xxs я запускал тоже )
Если они не выпустят то в течении пары месяцев другие выдадут )
С другой стороны, локально обычно только одна видеокарта - и не получится ставить параллельные задачи 3-4 агентам для ускорения общей скорости работы.
У вас молоко прокисает ? или на последнюю электричку опаздываете ?, куда вы все спешите ? 3-4-100 а потом 1000 агентов, вот реально зачем ?
Мама всегда говорила: "Сделал дело - гуляй смело"!
Решил задачи поставленные и свободен) Ведь платят не за то что отсиживаешь 8 часов в день на работе...
А то что это вносит хаос и баги не задумывались ?
Я несколько раз ловил Kimi k3 когда он плодил агентов и они приносили бред, так как даже разведка кучей агентов была не верной из за несогласованности между ними, и итоговый вывод был ошибочный.
Я вообще думал статью написать что щас тестировщики стали важнее программистов. Прекрасно понимаю, что больше кода больше багфиксов и тд это все перепроверять и протестировать. Тут уже не программист узкое горлышко становится а тестировщик.
Ну да понятно, а потом будет статья про кнопку "Сделай красиво БРО" единственный промт на все задачи, и как его правильно писать 🤣
щас тестировщики стали важнее программистов
Как-то по вакансиям и найму этого не видно

Big pickle неплохо справляется со средней кодовой базой. Но опять же, если в теме шаришь. Ревью за тобой ессно
Советую ещё испытать composer 2.5 в cursor , в подписке за 20$ он почти безлимитный.
Cursor Composer 2.5: занимает третье место в рейтинге Coding Agent Index и стоит примерно в 10-60 раз дешевле, чем конкуренты.
https://artificialanalysis.ai/articles/cursor-composer-2-5-coding-agent-index
я тоже перешел на deepseek harness и модели qwen, deepseek b и меня устраивает. иногда юзаю кодекс сделать ревью
Моего ответа нет: я не фанатик, но программирую не "20+", а "40+", начинал на советских ПМК.
Теперь по теме. Про мой опыт вайбкодинга (с чатомжпт бесплатно) я написал давно. Но мне очень интересно увидеть хоть один пример РЕАЛЬНОЙ ЗАДАЧИ по программированию, которую удалось решить с мощной платной нейронкой без танцев с бубном. Чисто из любознательности! Очень бы хотелось...
Ну я не знаю задачи какого плана вы ожидаете, но вот пример буквально сегодняшний. Юзеры шлют со свой телепонов фоточки, их нужно перекодировать (прочитать всякие heic-и, которые никто кроме ойфонов не понимает, avif-ы там и прочее оно, поправить ориентацию по exif, уменьшить до 1920 по длинной стороне, потом закатать всё в webp с sharp_yuv и наконец сравнить, что наши пляски дали реальный профит и нам не подсунули уже хорошо отшакаленный jpeg или там png, webp для которого оказался больше. Руками я когда-то это делал примерно день, ещё примерно суммарно день ушёл на сбор и исследования различных wtf и особенностей задержек развития головного мозга у различных производителей тупофонов. Астра сегодня выплюнула минут за 15. Танцев с бубном не было, потому что я уже знал про засады с exif, sharp_yuv, необходимости иметь intl и т.д.
Да и с бесплатными прекрасно решаются, например переписать кусок кода с одного языка на другой или объяснить как работает
У нас фронт на мертвом ExtJS где больше 1 млн. строчек кода. Задача создать библиотеку, которая через module federation 2.0 будет мочь встраивать react/vue как view в ExtJS при чем так чтобы микрофронт был изолирован внутри web component. Claude Code с моделью Sonnet 5 выдал готовую библиотеку за 15 минут, потом ещё минут 30 потратил чтобы создать E2E тесты (основную проблему решал с тем, что на современной macOS отсутствует старая Java которая нужна для запуска Sencha Cmd). В итоге встроив либу в наше ExtJS приложение, агент столкнулся с тем, что где-то в этом миллионе строк legacy кода есть обработчик backspace, который блокирует в браузере переход к предыдущей странице, если этот backspace нажали за пределами input/textarea. Так как изолированный микрофронт ExtJS воспринимает как простой div, то там нельзя было стереть текст нажимая backspace. Он нашел участок кода в ExtJS, сделал фикс, открыл MR и описал проблематику в Jira. Если самому повторять этот же путь с самого начала, то ушло бы несколько дней вместо часа работы агентом.
С реальными задачами именно по программированию может быть сложно - зачастую описание задачи неполное и иногда недетерминированное и по сложности не сильно отстаёт от реализации. В этом случае даже топовые ИИ водят кругами, т.к. не понимают всех нюансов задачи, пока их не поймёт и сформулирует сам разработчик.
Но всё меняется, когда нужно делать работающие продукты (как микро-утилиты так и сложные промышленные) как композицию относительно простых задач. Агенты начинают хорошо работать как в продакшен применении, так и в домашнем.
У меня сейчас главные инструменты - это OpenCode с локальным Qwen 3.8 и собственный качественный, как я считаю, опыт разработки руками. За летние месяцы, со всеми их время-затратными развлечениями масштаба частного дома, неполным списком удалось:
подчистить и доработать конфигурации ESPHome десятка домашних устройств - исправить некритичные но неприятные баги, до которых раньше у меня не доходили руки. Внутри конфигураций - и C++ код и конечные автоматы со своим DSL и нативный YAML от ESPHome.
сделать с нуля до post-MVP стадии один коммерческий проект и ТЗ с live demo и детальным коммерческим предложением для другого. Разработку, документирование, финансовое и тестовое сопровождение, ведение репозитория - только силами OpenCode плюс FAR с Colorer для контроля содержимого рабочих файлов.
Проекты логистические, для внутреннего применения с изначально заложенной перспективой продажи SaaS.
Во втором проекте достаточно серьёзная алгоритмическая сложность, но она решается сторонней библиотекой (CP-SAT Solver).аналитика и траблшутинг для другого клиента: агент в workspace для этого клиента интегрирован в readonly со всеми сервисами и инструментами клиента - Basecamp, Slack, Postman, AWS, SendGrid, Twilio. Делает скучные вещи типа сопоставления логов из нескольких мест, моделирование работы скриптов и сервисов и расследование причин проблемы. Пишет красивый и понятный отчёт клиенту.
прямо сегодня нашлось время целиком переработать утилиту, которая разбират фото и видео со всех наших семейных телефонов (5+ штук) и раскладывает в папку нашего фото-архива на файл-сервере.
Утилита делалась года назад на коленке и не имела ни архитектуры, ни надёжности - ломалась на каждом новом для неё формате файлов (HEIC/HEIF, etc.) - теперь это взрослый внутренний продукт со всеми аттрибутами, включая репозиторий и документацию.
Миллион мелких дел и автоматизаций для семьи не упоминаю, но сейчас они делаются, а раньше на них не хватало времени.
Основная проблема это поиск проблем, которые бы эффективно решались с помощью LLM - те, что решаются уже как правило оказываются решенными. Чем дальше, тем будет только сложнее.
Я пытался юзать DeepSeek V4.1 Flash для разработки, но он постоянно входит в цикл, выводя в ризонинг что-то в духе:
Let me output.
OK.
Go.
Writing.
Let me output.
Now.
OK.
И так до бесконечности, пока не остановишь. Даже старый V4 таким не страдал.
del
И знаете, какие меня ожидали результаты? У меня перестали кончаться 5-часовые лимиты и недельные лимиты. На тарифе за 20 баксов в месяц, Карл!:)
Тот момент когда пользуешься Claude Opus 5 High / Extra и тоже хватает тарифа за 20€ 🌚 и лимиты 5 часов никак не мешают…
Состояние лимитов в моменте ✅



Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле