Обновить

Андрей Карпаты рассказал о текущем состоянии работы нейросетей по промпту «нарисуй пеликана на велосипеде»:

Мы начинаем выходить за рамки тестирования LLM, например, с помощью запроса «создать SVG‑изображение пеликана на велосипеде». В качестве примера для обобщения, мне было интересно, что бы сделал Opus 5, если бы я дал ему первый абзац «Властелина колец», бюджет в 1 млн токенов (~$10) и попросил три рендера на JavaScript. Opus потратил около двух часов и написал 5500 строк кода, которые (процедурно) отрисовывали историю. Это немного коряво, но забавно. Но немного поразительно, что LLM должен размещать и координировать различные полигональные объекты в координатах (x,y,z) и писать код, который анимирует все это, и что он вообще что‑то делает.

Мне также нравятся подобные примеры, потому что никто в здравом уме не стал бы тратить время на написание чего‑то настолько уникального, но у LLM хватает выносливости и терпения, так что это пример того, как мы переходим от «никто бы этого не сделал» к «конечно, почему бы и нет, это же ~бесплатно». Возможно, таких примеров гораздо больше. Но меня вдохновляет создание гипер‑пользовательских миров, в которые можно было бы погружать игроков, например, чтобы они могли участвовать в истории «Властелина колец» в качестве NPC‑зрителя, или одного из персонажей, и так далее. Что‑то вроде эфемерной GTA X по запросу.

И последнее: область миров/игр выявляет слабость LLM: им трудно проверять свою работу, потому что они не способны эффективно и интуитивно воспринимать видео или играть в игры внутри них. В данном случае, Opus 5 пришлось очень медленно и кропотливо делать скриншоты в разных точках, и это несколько раз приводило к ошибкам и создавало кучу глюков. Пример тех самых возможностей (мультимодальные функции, игровой процесс), которым, на мой взгляд, пока ещё явно не хватает.

Теги:
Всего голосов 3: ↑1 и ↓2+1
Комментарии0

Путь к ИИ‑сингулярности

У нас было два репозитория неоттестированного вайб‑кода, семьдесят пять тяжеловесных SDD‑спецификаций, пять обмазанных смазкой харнессов, солонка, наполовину полная кастомных скиллов и забитых капслоком правил, с десяток дырявых MCP‑серверов, RAG‑база со свежевекторизованным Confluence, самодельная дощечка имаго‑кодинга и целая россыпь автономных агентов всех мастей, от безобидных автодополнялок до галлюцинирующих субагентов, ставящих пакеты со slopsquatting и втихаря сносящих боевые базы.

Не то чтобы все это было действительно нужно для поездки к ИИ‑сингулярности, но если уж начали участвовать в спуске с горы на велосипеде без седла, остановиться уже невозможно.

Единственное, что вызывало у меня настоящий животный страх, это передача ответственности за ревью самой модели. Тот самый момент, когда седьмой агент подтверждает галлюцинации шестого, потому что все тесты зеленые, и я знал, что рано или поздно мы перейдем на эту дрянь.

Нет ничего более беспомощного, безответственного и испорченного, чем IT‑команда, запустившая мультиагентный оркестр в режиме allow all.

Это критический (и слегка ехидный) обзор того, что произошло с разработкой последние пару лет.

Путь к ИИ‑сингулярности

Публикации