Приветствую, уважаемые читатели.
Эта статья будет настолько философской и платонической, насколько это возможно на Хабре.
Нейронные сети класса трансформеров (GPT) всего за два‑три года стали настолько разнообразными, что с трудом поддаются классификации.

Сегодня я напомню вам о небольшом исследовательском трансформере LegoGPT (также фигурирует в источниках под названием BrickGPT). Это исследовательский проект, разработанный в течение 2025 года группой учёных из университета Карнеги Меллон. Ранее новость об этом трансформере публиковал на Хабре уважаемый Даниил Шатухин @daniilshat.
BrickGPT — это первая удачная попытка генерировать физически стабильные (устойчивые) блоки LEGO на основе текстовых промптов. Для этого авторы собрали датасет из потенциально возможных блоков для LEGO, разметили их надписями, после чего обучили на этом множестве данных авторегрессионную большую языковую модель, так, чтобы она предлагала следующий блок LEGO по тому же принципу, по которому подбирается следующий токен. Здесь в контекстом окне удерживается уже имеющаяся конструкция, оценивается её геометрия в трёх измерениях и общая устойчивость. Авторегрессионный инференс позволяет отсекать нереалистичные варианты с учётом механики, физических законов, геометрии прямоугольных тел и правил сборки LEGO. Выполненные авторами симуляции и эксперименты показали, что BrickGPT предлагает устойчивые, красивые и плотно прилегающие друг к другу блоки, из которых можно собирать простые предметы, например, игрушечную мебель. Более того, поскольку все блоки имеют правильную и предсказуемую форму, их легко отливать на 3D‑принтере, а собирать предметы может простая роборука (манипулятор).

Построение моделей и литье пластиковых фигурок на их основе — не новая задача, поэтому поясню, в чём BrickGPT превосходит такие эксперименты с CAD. Действительно, CAD‑инструменты позволяют нарисовать отдельные физические тела, и они получаются реалистичными и геометрически гармоничными. Но такие объекты сложно собирать из деталей (компьютер генерировал объект как единое целое). Кроме того, 3D‑объект в физическом исполнении часто оказывается неустойчивым. Такой объект может не только заваливаться на бок, но и обрушиваться под своим весом, и просто разваливаться.
Именно эти недостатки устраняет BrickGPT. Более того, поскольку эта нейронка в симуляторе собирает модели из стандартных и взаимно похожих компонентов, эту работу можно конвейеризовать и автоматизировать и в реальном исполнении.
Авторы собрали для этого проекта специальный датасет StableText2Brick, выложенный здесь.
Философская составляющая
Эксперимент удался на практике, но мне он более интересен с философской точки зрения. Нейронная сеть ничего не знает о мире за пределами обучающего датасета, а также едва ли имеет представление о физических законах. Но материал датасета и обучение методом проб и ошибок (в том числе, через обучение с подкреплением) позволяет чётко установить, какие сочетания кубиков образуют прочные сборки, а какие получаются неустойчивыми, распадаются сами по себе или под нагрузкой. В итоге получается система, которая собирает конструкции быстрее, чем человек может даже представить себе этот процесс. Алгоритм LegoGPT сочетает сортировку, метод проб и ошибок и эволюционное улучшение конструкции, но по состоянию на 2026 год собирает только самые простые конструкции, в которых нет ни внутренней структуры, ни движущихся частей.
Кирпичики как токены: пошаговое прогнозирование устойчивости
LegoGPT — это тонко настроенная версия большой языковой модели LLaMA-3.2-Instruct-1B. Эту модель можно считать опенсорсной версией ChatGPT. Исследователи обучали эту модель на 47 000 сборках из кубиков Lego и на 28 000 уникальных 3D‑фигурах. Все эти объекты были подробно описаны (аннотированы). Поэтому LegoGPT может собрать в симуляционной среде как реально существующий, так и гипотетический объект, опираясь лишь на текстовый промпт.
Авторы обучили LLaMA-3.2–1B‑Instruct решать узкую задачу, а именно: предсказывать следующий кубик. На вход модель получает описание на естественном языке, а на выход выдаёт последовательность (расстановку) кубиков LEGO, закодированную в текстовом виде. Это токены, каждый из которых описывает тип блока, его положение относительно всех ранее выстроенных блоков (в частности, с какими блоками он зацепляется, а к каким только прилегает) и ориентацию блока в трёхмерной сетке размером 20×20×20.
LegoGPT выигрывает у генераторов 3D‑мешей именно тем, что строит фигуры последовательно и надёжно, не допуская возникновения разомкнутых контуров, либо фигур, вытянутые элементы которых будут «висеть» в воздухе, приводя к смещению центра тяжести и неизбежному падению. Кроме того, алгоритм не допускает наложения блоков друг на друга, выхода структуры за пределы сетки и появления невозможных фигур, таких, как треугольник Пенроуза. Если на каком‑то шаге предложенная фигура не вписывается в имеющуюся конструкцию или не соответствует промпту, то этот шаг отбрасывается, происходит откат к стабильной конструкции и новая попытка.
В базовой статье авторы показали, что модель может конструировать предметы, относящиеся примерно к 20 простым категориям (стульчики, шкафчики, кораблики, гитары, машинки, поезда), но постепенно эти конструкции усложняются. Ключевая особенность модели — откат на шаг назад, если очередной шаг был неуспешным, тупиковым или всё‑таки условно допустимым, но подталкивал конструкцию к неустойчивому состоянию. Без отката (при выстраивании фигуры с начала и до конца от простого к сложному) лишь 24% конструкций получались устойчивыми, а с возможностью отката их доля доходила до 98,8%.
Как вы уже могли оценить LegoGPT — далеко не просто нейронная сеть, возможности которой сводятся к реализации промптов. В модель встроен физический движок, дополнительно проверяющий все сгенерированные фигуры: как на них будет действовать сила тяжести, каково будет трение между кубиками, какова будет сила сцепления. Если система выявляет участок конструкции, который может обвалиться в реальной ситуации, то сначала убирает самый нестабильный кирпичик, а потом — все, зависящие от него или опирающиеся на него. После этого происходит фиксация, и модель может попробовать другой вариант надстройки.
Неигровые возможности: первая проба генеративного 3D‑дизайна
По‑видимому, LegoGPT — не просто игрушка для любителей LEGO, а первый инструмент, открывающий путь к созданию чертежей для генеративного дизайна в условиях динамически меняющихся ограничений. Некоторые возможности развития и практического применения этого инструмента:
Дизайн мебели: ИИ генерирует чертежи экзотических предметов интерьера, отталкиваясь от базовых моделей «стул», «шкаф», «кровать», где каждое мелкое изменение вносится с учётом структурной целостности, устойчивости и того веса, который должен будет выдерживать этот предмет.
Архитектура: планировка зданий и сооружений на основе промптов. Модель может учитывать не только чисто физические ограничения, но и строительные стандарты, а также их уточнения (условия вечной мерзлоты, сейсмически опасные районы).
Робототехника: подгонка деталей с учётом функции проектируемого робота, его взаимодействия с другими людьми и роботами, габаритов конвейера и сборочной линии, степеней свободы самого робота и тех материалов, с которыми он будет обращаться.
Фолдинг (свёртка) белков: тема огромная, на Хабре её рассматривали, например, уважаемые @SLY_G в статье «Так что же это такое, „фолдинг белков“?» и @tac в статье «Часть № 1. Введение в биовычисления по сворачиванию. От белков к РНК». Суть та же: требование собрать молекулу, которая одновременно обладала бы требуемыми биологическими свойствами и сохраняла целостность в растворе.
Заключение
На мой взгляд, LegoGPT, задуманный как нишевой и полуигровой проект, открыл дверь в мир тех самых «идеальных идей» Платона и «атомов» Левкиппа и Демокрита, из которых состоит всё сущее. Модель материализует не отдельные токены, а их конкретные совокупности, укладывающиеся в контекстное окно. Модель открывает для себя мир физических тел и физические законы. Вероятно, она работала бы (и будет работать) иначе, если переформулировать задачу «для работы в невесомости», «для работы в условиях повышенной гравитации», «для работы в условиях качки» и пр. Скорее всего, такая модель способна сконструировать и неочевидные сочетания блоков, и допускать труднопроверяемые ошибки (галлюцинировать), то есть, потребует тщательного контроля со стороны человека. Но в целом её возможности в области прикладной стереометрии кажутся мне безграничными.

