Обновить

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели8.7K
Всего голосов 10: ↑9 и ↓1+9
Комментарии40

Комментарии 40

Для агентского режима это очень медленно. Это начинает раздражать. Если взять модель DeepSeek-V4.1-Flash напрямую через API DeepSeek, скорость там достигает 300 токенов в секунду

Для агентского режима с четкой проверкой можно. В остальных случаях - брезгую: столько вранья давно не видел.

А есть какая-то корреляция между измеримой скоростью  токенов в секунду и количеством вранья?

Есть реальная польза от агентского режима с многоступенчатой доказательной проверкой, ловится куча багов, пустышек, обещаний и т.д, это работает на любой модели, а разницы из за скорости генерации я не разу не замечал.

Спрошу по-другому - агентский режим на локальной модели с, допустим 12Гб видео и 64Гб оперативки будет работать, пусть и неспеша, но без такого же количества вранья как в упомянутом DeepSeek-V4.1-Flash ?

Скажем так, гарантии я не дам, потому что работаю на своем собственном агенте, а что возьмете вы и как настроите я не знаю, а от агентского контура зависит все.

А на счет DeepSeek-V4.1-Flash, у меня он сейчас как раз подключен, как облачная модель, и вот наблюдение, я ему кинул ссылку на статью, и сказал, хочу то что в статье но с своим блэкджеком, к вечеру полный функционал был готов, в агентском режиме он работает на ура.

О чем и говорю. Luna модель от OpenAI на том же уровне. Притом если ее попросить вместо DeepSeek-V4.1-Flash будет результат в 5 раз дольше ждать.

Это я еще не нативный API от дипсика взял,а пользую облачную ollama, там все несколько тормознее =)

Вот кстати если интересно, как работает режим проверки, это дипсик 4.1, режим работы swarm когда есть оркестратор и воркер, и вот как раз воркер закончил работу и прислал отчет оркестратору, а тот не поверил ему, и не зря, нашел косяки и отправил воркера исправлять, без моего вмешательства в работу агента.

А были ли внешние инструменты - тот же Qdrant+BAAI-m3 эбмеддер, сейчас в облачных сервисах полно этого добра. Делается векторная БД, затем чанкуется любой даташит что под руку попал (включая код с коммент-промпт форматом - не пренебрегайте этим!) и модель всё делает почти так как руками, хоть Алиса хоть Сбер. Мне очень всё это дело помогло сделать микро-проект с PWM/ADC/UART/I2C/SPI с DMA, все адекватные конечные автоматы с фоллбеками и обработчиками ошибок, практически на уровне main(){} с таймерами миниатюрная RTOS, полное понимание проблем RMW с гонкой данных и всё это впихнуть в 64 к флеша и 20к озушки, прочих вкусных протокольных внешних микрух а-ля SPI дисплейчик, мультиплексоры I2C и умные драйверы шаговых. Плюс ещё скиллы соответствующие и промпт-инъекции чтобы направить в нужное русло ну и конечно же md-саммари с хорошей цепочкой и контрольным выводом, плюс питонячьи тесты (уже давно отодвинул Matlab) и тестирующие C-обёртки. Практически можно не использовать stdlib а генерировать printf/scanf по месту и прочие парсеры, умещаясь в килобайты как на каком-нибудь спектруме, самое невероятное - практически отпала необходимость искать чьи-либо библиотеки (!) для периферии, шрифтов, рендеров итд, всё генерируется по месту, остаётся только что-то вроде HAL/SPL на уровне спецификаций регистров управления. Вообщем это добротный джун/миддл с опытом работы 50+ лет в отрасли, начиная от Z80 и до GPU/FPGA.

То есть ситуация такая: даже самые дешевые и самые тупые фронтирные модели стали достаточно умными. Если ты разбираешься в теме, их уровня хватает за глаза.

Если разбираешься в теме то и локальной Qwen 3.8 или ornith-1.5 вполне достаточно, и вуаля, затраты только на электричество 🤣

К сожалению на моей GPU игровой с 16 VRAM сильно медленный инференс для этих моделей. А если контекст растёт, то вообще мрак. А он растёт на громадных кодовых базах где я работаю... А так конечно что то маленькое чуть сложнее hello world проектик или микро сервис - вполне тянет ) тут не спорю )

qwen3.8-27b q3_xxs , KV кэш квантован до q4, контекст ~100k - на 5080 16gb 50-60 tps, prefill - пара секунд для почти забитого контекста. Проект на 180k LOC

У меня RTX 4070 Ti SUPER 16 GB - вообще я надеюсь что они выпустят qwen3.8 30B и что бы MoE архитектура что бы прям летало ) А qwen3.8-27b q3_xxs я запускал тоже )
Если они не выпустят то в течении пары месяцев другие выдадут )

есть неплохой qwen3-coder-30b moe

помойму он старый - сколько ему уже месяцев?

больше года
больше года

больше года, работает норм, нет рассуждений и вижна, зато инференс ~100 tps

У Qwen3.8 27B (xhigh) Artificial Analysis Intelligence Index - 34, докупайте еще одну такую же карту (а лучше RTX3090/4090 24Gb) и вперед!

С другой стороны, локально обычно только одна видеокарта - и не получится ставить параллельные задачи 3-4 агентам для ускорения общей скорости работы.

У вас молоко прокисает ? или на последнюю электричку опаздываете ?, куда вы все спешите ? 3-4-100 а потом 1000 агентов, вот реально зачем ?

Мама всегда говорила: "Сделал дело - гуляй смело"!
Решил задачи поставленные и свободен) Ведь платят не за то что отсиживаешь 8 часов в день на работе...

А то что это вносит хаос и баги не задумывались ?
Я несколько раз ловил Kimi k3 когда он плодил агентов и они приносили бред, так как даже разведка кучей агентов была не верной из за несогласованности между ними, и итоговый вывод был ошибочный.

Я вообще думал статью написать что щас тестировщики стали важнее программистов. Прекрасно понимаю, что больше кода больше багфиксов и тд это все перепроверять и протестировать. Тут уже не программист узкое горлышко становится а тестировщик.

Ну да понятно, а потом будет статья про кнопку "Сделай красиво БРО" единственный промт на все задачи, и как его правильно писать 🤣

щас тестировщики стали важнее программистов

Как-то по вакансиям и найму этого не видно

Да щас вообще тухляк. Раньше в ИТ искать работу 1-2-3 месяца - щас вообще от 12 месяцев сразу надо закладывать...

я не настоящий вайбкодер, я просто LM Studio скачал
я не настоящий вайбкодер, я просто LM Studio скачал

Big pickle неплохо справляется со средней кодовой базой. Но опять же, если в теме шаришь. Ревью за тобой ессно

Советую ещё испытать composer 2.5 в cursor , в подписке за 20$ он почти безлимитный.

Cursor Composer 2.5: занимает третье место в рейтинге Coding Agent Index и стоит примерно в 10-60 раз дешевле, чем конкуренты.

https://artificialanalysis.ai/articles/cursor-composer-2-5-coding-agent-index

я тоже перешел на deepseek harness и модели qwen, deepseek b и меня устраивает. иногда юзаю кодекс сделать ревью

Моего ответа нет: я не фанатик, но программирую не "20+", а "40+", начинал на советских ПМК.
Теперь по теме. Про мой опыт вайбкодинга (с чатомжпт бесплатно) я написал давно. Но мне очень интересно увидеть хоть один пример РЕАЛЬНОЙ ЗАДАЧИ по программированию, которую удалось решить с мощной платной нейронкой без танцев с бубном. Чисто из любознательности! Очень бы хотелось...

Ну я не знаю задачи какого плана вы ожидаете, но вот пример буквально сегодняшний. Юзеры шлют со свой телепонов фоточки, их нужно перекодировать (прочитать всякие heic-и, которые никто кроме ойфонов не понимает, avif-ы там и прочее оно, поправить ориентацию по exif, уменьшить до 1920 по длинной стороне, потом закатать всё в webp с sharp_yuv и наконец сравнить, что наши пляски дали реальный профит и нам не подсунули уже хорошо отшакаленный jpeg или там png, webp для которого оказался больше. Руками я когда-то это делал примерно день, ещё примерно суммарно день ушёл на сбор и исследования различных wtf и особенностей задержек развития головного мозга у различных производителей тупофонов. Астра сегодня выплюнула минут за 15. Танцев с бубном не было, потому что я уже знал про засады с exif, sharp_yuv, необходимости иметь intl и т.д.

Да и с бесплатными прекрасно решаются, например переписать кусок кода с одного языка на другой или объяснить как работает

У нас фронт на мертвом ExtJS где больше 1 млн. строчек кода. Задача создать библиотеку, которая через module federation 2.0 будет мочь встраивать react/vue как view в ExtJS при чем так чтобы микрофронт был изолирован внутри web component. Claude Code с моделью Sonnet 5 выдал готовую библиотеку за 15 минут, потом ещё минут 30 потратил чтобы создать E2E тесты (основную проблему решал с тем, что на современной macOS отсутствует старая Java которая нужна для запуска Sencha Cmd). В итоге встроив либу в наше ExtJS приложение, агент столкнулся с тем, что где-то в этом миллионе строк legacy кода есть обработчик backspace, который блокирует в браузере переход к предыдущей странице, если этот backspace нажали за пределами input/textarea. Так как изолированный микрофронт ExtJS воспринимает как простой div, то там нельзя было стереть текст нажимая backspace. Он нашел участок кода в ExtJS, сделал фикс, открыл MR и описал проблематику в Jira. Если самому повторять этот же путь с самого начала, то ушло бы несколько дней вместо часа работы агентом.

С реальными задачами именно по программированию может быть сложно - зачастую описание задачи неполное и иногда недетерминированное и по сложности не сильно отстаёт от реализации. В этом случае даже топовые ИИ водят кругами, т.к. не понимают всех нюансов задачи, пока их не поймёт и сформулирует сам разработчик.

Но всё меняется, когда нужно делать работающие продукты (как микро-утилиты так и сложные промышленные) как композицию относительно простых задач. Агенты начинают хорошо работать как в продакшен применении, так и в домашнем.

У меня сейчас главные инструменты - это OpenCode с локальным Qwen 3.8 и собственный качественный, как я считаю, опыт разработки руками. За летние месяцы, со всеми их время-затратными развлечениями масштаба частного дома, неполным списком удалось:

  • подчистить и доработать конфигурации ESPHome десятка домашних устройств - исправить некритичные но неприятные баги, до которых раньше у меня не доходили руки. Внутри конфигураций - и C++ код и конечные автоматы со своим DSL и нативный YAML от ESPHome.

  • сделать с нуля до post-MVP стадии один коммерческий проект и ТЗ с live demo и детальным коммерческим предложением для другого. Разработку, документирование, финансовое и тестовое сопровождение, ведение репозитория - только силами OpenCode плюс FAR с Colorer для контроля содержимого рабочих файлов.
    Проекты логистические, для внутреннего применения с изначально заложенной перспективой продажи SaaS.
    Во втором проекте достаточно серьёзная алгоритмическая сложность, но она решается сторонней библиотекой (CP-SAT Solver).

  • аналитика и траблшутинг для другого клиента: агент в workspace для этого клиента интегрирован в readonly со всеми сервисами и инструментами клиента - Basecamp, Slack, Postman, AWS, SendGrid, Twilio. Делает скучные вещи типа сопоставления логов из нескольких мест, моделирование работы скриптов и сервисов и расследование причин проблемы. Пишет красивый и понятный отчёт клиенту.

  • прямо сегодня нашлось время целиком переработать утилиту, которая разбират фото и видео со всех наших семейных телефонов (5+ штук) и раскладывает в папку нашего фото-архива на файл-сервере.
    Утилита делалась года назад на коленке и не имела ни архитектуры, ни надёжности - ломалась на каждом новом для неё формате файлов (HEIC/HEIF, etc.) - теперь это взрослый внутренний продукт со всеми аттрибутами, включая репозиторий и документацию.

Миллион мелких дел и автоматизаций для семьи не упоминаю, но сейчас они делаются, а раньше на них не хватало времени.

Основная проблема это поиск проблем, которые бы эффективно решались с помощью LLM - те, что решаются уже как правило оказываются решенными. Чем дальше, тем будет только сложнее.

Я пытался юзать DeepSeek V4.1 Flash для разработки, но он постоянно входит в цикл, выводя в ризонинг что-то в духе:
Let me output.
OK.
Go.
Writing.
Let me output.
Now.
OK.
И так до бесконечности, пока не остановишь. Даже старый V4 таким не страдал.

провайдер не тот

И знаете, какие меня ожидали результаты? У меня перестали кончаться 5-часовые лимиты и недельные лимиты. На тарифе за 20 баксов в месяц, Карл!:)

Тот момент когда пользуешься Claude Opus 5 High / Extra и тоже хватает тарифа за 20€ 🌚 и лимиты 5 часов никак не мешают…

Состояние лимитов в моменте ✅
Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации