Андрей Карпаты рассказал о текущем состоянии работы нейросетей по промпту «нарисуй пеликана на велосипеде»:
Мы начинаем выходить за рамки тестирования LLM, например, с помощью запроса «создать SVG‑изображение пеликана на велосипеде». В качестве примера для обобщения, мне было интересно, что бы сделал Opus 5, если бы я дал ему первый абзац «Властелина колец», бюджет в 1 млн токенов (~$10) и попросил три рендера на JavaScript. Opus потратил около двух часов и написал 5500 строк кода, которые (процедурно) отрисовывали историю. Это немного коряво, но забавно. Но немного поразительно, что LLM должен размещать и координировать различные полигональные объекты в координатах (x,y,z) и писать код, который анимирует все это, и что он вообще что‑то делает.
Мне также нравятся подобные примеры, потому что никто в здравом уме не стал бы тратить время на написание чего‑то настолько уникального, но у LLM хватает выносливости и терпения, так что это пример того, как мы переходим от «никто бы этого не сделал» к «конечно, почему бы и нет, это же ~бесплатно». Возможно, таких примеров гораздо больше. Но меня вдохновляет создание гипер‑пользовательских миров, в которые можно было бы погружать игроков, например, чтобы они могли участвовать в истории «Властелина колец» в качестве NPC‑зрителя, или одного из персонажей, и так далее. Что‑то вроде эфемерной GTA X по запросу.
И последнее: область миров/игр выявляет слабость LLM: им трудно проверять свою работу, потому что они не способны эффективно и интуитивно воспринимать видео или играть в игры внутри них. В данном случае, Opus 5 пришлось очень медленно и кропотливо делать скриншоты в разных точках, и это несколько раз приводило к ошибкам и создавало кучу глюков. Пример тех самых возможностей (мультимодальные функции, игровой процесс), которым, на мой взгляд, пока ещё явно не хватает.




























