Обновить

Протестировал Vibecraft от Яндекса. Один вопрос остался без ответа

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели9.6K
Всего голосов 9: ↑4 и ↓5+1
Комментарии19

Комментарии 19

а стоит ли ли переизобретать велосипед? есть прекрасные open- source агенты и LLM-ки, тот же opencode/qwen, которые гарантированно будут идти впереди.

есть узкие ниши, в которых 'свой' софт жизненно необходим, потому что иностранный недоступен а открытого просто нет. Такова, например, область промышленной автоматизации, инженерное по cam/cae/eda, геология..

в чём преимущество 'своего' vibe-xyz?..

а стоит ли ли переизобретать велосипед? есть прекрасные open- source агенты и LLM-ки, тот же opencode/qwen, которые гарантированно будут идти впереди.

"А нужно ли нам строить свои самолеты? Иностранные прекрасно летают?" А спустя 30+ лет оказалось что своих самолетов толком и нет.

Вообще, ваши вопросы были актуальны до июня этого года - до момента когда Anthropic отключил доступ к Fable 5 по прямому указу правительства США, под предлогом ограничения доступ к иностранцам. Или хотя бы вспомнить эту новость про Deepseek.

в чём преимущество 'своего' vibe-xyz?.

Если ничего своего не строить, то никаких преимуществ никогда не будет.

я же написал, нужно строить своё: сапр/ cam/eda.. зачем опровергать тезис, которого у меня нет 🙂

переупаковка опенсорса не даёт суверенитета, imho. хотя, несомненно, прокачивает скилы :)

зачем пробовать новые zcode/qwen code desktop/ мне ясно. а вот в чём именно фаундер видит свою нишу - не очень.

А чем отрасль САПР хуже своей суверенной СУБД, ERP, например?

Более того, не нужно забывать про то, что в России полно организаций, которые могут работать только в закрытом контуре. Иностранные LLM они использовать не могут априори.И вот никак нельзя их назвать узкой нишей, т.к. технически ничего такого особенного им делать не нужно.

Кстати, в САПР тоже полно opensource и проектов на github, ну, может быть конечно не в таком объеме как проекты фреймворков или ИИ-агентов.

а 52 минуты на сайт это реально дофига, не? ну типо можно было быстрее в инете найти чем столько ждать

У меня постоянно модели галлюцинируют. У ллм нет осознания какая она модель. Нет глазок внутри самой себя. Мне Кими постоянно говорить что она джипити, джипити с радостью соглашается что он джеминай и так далее. Модели обучаются на огромном количестве текстов из интернета и там большая часть - логи где люди общаются с клауд и джипити. Поэтому ваша модель может быть кем угодно. В том числе и российской.

Мне Кими постоянно говорить что она джипити, джипити с радостью соглашается что он джеминай

Кем ты хочешь меня видеть сегодняяяяу =)

Да, примерно так и выглядят наши диалоги обычно :D

Вы абсолютно правы, на простых текстовых болталках модели действительно часто путают свои "паспорта" из-за обучающей выборки. Но тут есть важный инженерный нюанс.

Одно дело, когда модель путается в приветствии, и совсем другое - когда агент в один проход генерирует сложную, чистую архитектуру на Next.js с эвалами под компоненты shadcn. Логика генерации кода, удержание контекста на длинной дистанции и когнитивная плотность - это измеряемые вещи. Базовые или легковесные open-source модели без жесточайших внешних рельсов оркестрации (графов и чеклистов) такие тяжелые кодовые проекты физически не вытягивают - они начинают сыпать синтаксическими ошибками уже на третьем файле.

Поэтому 52 минуты крутящегося лоадера OpenCode в VibeCraft - это как раз маркер того, что модель под капотом пытается "прожевать" тяжелую детерминированную задачу, а не просто галлюцинирует в чате.

Тоже вчера погонял VibeCraft — эксперимент получился забавный.

Сначала полез проверять, действительно ли там Claude. В DevTools у /api/chat обнаружилось интересное: в историю диалога попадал не только финальный ответ, но и служебный текст агента (The user is asking..., Let me..., I should...), после которого агент прямо называл себя Claude от Anthropic. Плюс в API есть любопытный флаг useOldModel. Какой именно Claude — так и не выяснил, но версия с Claude выглядит не вполне правдоподобно. Вернее, модель научили называться Клодом, но базу дать забыли.

Дальше проверял уже качество.

Простую функцию Fibonacci написал нормально — 12 нейрокредитов.

Потом попросил сделать подборщик проектов для существующего сайта строительной компании и самостоятельно изучить каталог. Вот здесь стало веселее: доступа к реальному проекту у него, видимо, не было, но вместо того чтобы об этом сказать, агент выдумал проекты «Плато Квартет», «Плато Линия», «Плато Терраса», цены и характеристики, а в отчёте уверенно написал, что использовал реальные данные каталога.

Попросил самостоятельно проверить работу на соответствие исходному ТЗ. Он обнаружил, что вместо названия компании написал «Мой сервис», заменил вывеску и отчитался, что теперь интеграция нативная :)

Зато на проекте с нуля результат оказался гораздо лучше. Сделал конфигуратор загородного дома: площадь, этажность, спальни, кабинет/терраса/сауна/гараж, динамический расчёт стоимости, ограничения, сохранение вариантов и сравнение. На это ушло около 214 кредитов.

Отдельно попросил добавить динамическую архитектурную визуализацию дома. За ~40 кредитов получил SVG-будку, у которой в зависимости от параметров появляются второй этаж, гараж и терраса :)

Моё впечатление: как инструмент для быстрого создания прототипа с нуля — интересно, особенно бесплатно. Но на неоднозначных задачах требует контроля: может уверенно додумать отсутствующий контекст и потом так же уверенно отчитаться, что всё сделал по исходным данным. А визуальный вкус пока лучше с собой приносить.

нейрокредиты

Это что за треш? Как CAPS в @bothub, чтобы сильнее запутать клиентов в системе ценообразования при выставлении итогового счета?

Да, страно что не нейрорубли..

Да, страно что не нейрорубли…

Кстати, да. Яндекс может серьезно попасть за использование иностранных слов :-)

Почти сразу тестировал, как только дали доступ. Да, релизнуть - надо yaml собирать самому, качество кода на уровне минус второго этажа. Ну почему сразу не сделать всё и сразу? Тем более когда уже много готовых решений, которые можно переложить на рус рельсы. И.. все эти умные люди на конференциях Yandex cloud - кто они?

После фразы "так и не признался" у вас какие-то очень широкие скриншоты, текст вообще не видно. Вы бы для скриншота окно уменьшали, либо делали вертикальный сплит вкладок, если лень менять размер окна.

Да, это разрешение 4K. Вечером поправлю или подумаю как увеличить. Странно что Хабр автоматом не раскрывает. Спасибо за замечание.

Когда я вижу, что кто-то спрашивает у БЯМ, что у неё под капотом, мне это неиронично напоминает ситуацию, когда спрашивают у человека "ты кто по жизни". С виду, по одежде, вроде можно первичные поверхностные выводы сделать, но ведь выдумать может что угодно, и, зачастую, это именно так и происходит) Так вот к языковым моделям и их "автобиографии", мне кажется, относиться стоит точно так же, вне зависимости от количества обвязки. А в этом случае, определить модель на которой всё это работает выходит даже сложнее, так как там вполне себе может быть целый зоопарк из самых разных диких зверей - потому что оркестрация, дистилляция, скрещивание, флоры, фауны файн-тюны, и так далее..

А что касается основной темы статьи, сервис интересный, но зная Яндекс... Пользоваться, скорее всего, в какой-то момент, станет *мягко говоря* невыгодно. Хочется ошибаться.

Обязательно попробую, как найду время

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации