Comments 17
Какой-то поток сознания и копипасты
А насчёт 10^15 параметров - как бы похабно не звучало, но дело не в размере, а в умении пользоваться. У любого человека знаний значительно меньше, чем в Википедии, но тем не менее, есть способность разобраться в неизвестностной ранее теме
Данный материал не является копипастой. С потоком сознания, пожалуй, соглашусь.
Да, никто из нас не знает Википедии наизусть. Но мы, в отличие от ИИ, и учились в школе чему-то целых 11 лет. Некоторые - в универе, некоторые ещё и самостоятельно. Я не верю в “выучим английский за 24 часа”, потому что не сталкивался с такими примерами. Посему не жду чуда и тут. Одним словом, не стоит смешивать обучение человеков и обучение ИИ.
Архитектура не та. Мозг человеков ещё и потребляет 20Вт. Современный сервер для инференса 10кВт, не всякая модель в него влезет.
Самый главный ограничитель сверху для роста размера моделей - вычислительные ресурсы. Экономика LLM такова: рост количества данных линейный, вычислительных ресурсов на обучение квадратичный, прирост в качестве логарифмический. То есть увеличивая модель со 100b до 1t нам нужно в 10 раз больше данных и в 100 раз больше GPU дней, получаем прирост 2%. Увеличивая модель в 100 раз до 10t - GPU в 10_000 раз больше, данных в 100, а прирост 2.5%(цифра с потолка, суть что чем больше размер тем медленнее прогресс).
Данные можно нагенерить и так уже делают. Можно обучать на видео.
GPU не развиваются так быстро, основной прирост производительности с начала ИИ истерии за счет снижения точности и увеличения размеров и потребления электричества, соответственно. Сколько нужно нужно лет, чтобы производительность GPU за счет уменьшения техпроцесса выросла в 100 раз? Подозреваю, физический предел будет достигнут раньше.
Соглашусь со всем из вашего комментария, но не с “можно обучать на видео”. Я вам дам 100 Гб фотографий своей кошки, ну и пару терабайт видео. Посмотрим насколько умную модель вы на этом натренеруете, и что она будет уметь. :)
Вот да. Автор пишет и тут же забывает
повышаем эффективность обучения в 200 раз и ломаем закон Шиншиллы: довольствуемся 0.1 токена на 1 параметр. Следовательно, потребуется либо радикально более эффективное использование данных, либо принципиально иной подход к обучению.
Ну и считать ли мультимодальную модель с воплощением в тело и с обвязкой из сенсорных нейронок всё ещё llm. Если да, то в такой архитектуре входных данных немало начиная от датасетов в виртуальности - мультимедиа, продолжая симуляцией и заканчивая реальность, данной рою роботов в ощущениях.
А если посмотреть с другой стороны.
Скажем, в computer vision есть возможность нааугментировать датасет любой величины. Сгенерировал 3д модель сцены - вот тебе вектор Y. Отрендерил - получил матрицу Х. Даже одну сцену можно отрендерить миллиардами раз, меняя освещение, материалы, погоду, местоположение, количество и характер сенсоров. Но, для вижена такая модель большая и не сильно нужна (разве что, под дистилляцию). Там надо скорость, независимо от того, это военка или автоматизация.
Но этот пример можно обобщить. Чтобы задача была совместима с бесграничной аугментацией, надо, чтобы она имела некое скрытое состояние (как спецификация 3д модели), однозначный алгоритм создания проекции (рендер), и ценную для реальной экономики задачу по восстановлению скрытого состояния из проекции (ну, или, хотя-бы, задачу по созданию другой проекции из данной проекции). И, более того, чтобы эти скрытые состояния можно было генерировать бесконечно.
Как будто бы, хочется как-то к кодингу присобачить. Например, генерировать проекты, делать в них рандомные баги или уязвимости и восстанавливать исходный код?
Фигню расписал.
Сырых датасетов уже и на 10T не хватает - особенно если хочется хоть какого-то подобия качества. Дыры затыкаются синтетикой, и производительность при этом продолжает расти. На 1Q замахиваться можно - больше синтетики, злее синтетика. Но не нужно. Не сейчас. Потому что железа на это сегодня нет. Нету сейчас систем, на которых можно обучать и запускать 1q модели. Даже свежих зубил Vera Rubin хватит хорошо если на 100T - если консервативнее, то где-то в районе 50T с ними осядем.
1Q надо, и 1Q будет. Потому что толстые модели всегда более способны чем тонкие, при прочих равных. Они эффективнее из шума обучающих данных выжимают сигнал. И об толстые модели можно после этого учить тонкие. Просто замахиваться на этот рубеж сейчас рано.
А то, что мы сейчас видим в бенчмарках - это называется не "стагнация", а "сатурация". Модельки растут, и становятся жирнее задач, на которые их в типовых измерилках Elo кидают. Бенчмарки уходят в 90%+ и подыхают - несите новые.
Ну и то, что новые модели думают дольше старых - это самое что ни на есть естественное явление. Новые задачи дольше старых! Способность моделей справляться с долгими сложными задачами, не падая при этом в ведро слопа и не стреляя себе в ногу - это ключевая метрика производительности современных ИИ.
Я могу задвинуть ещё телегу про экзотическую синтетику и про то, как кусок желе в черепе решает проблему недостатка данных. Но есть ли смысл?
все эти википедии - имхо, лишь малая доля данных о мире, статичная, историческая, фундаментальная, но всё же малая часть того, что происходит в мире. Огромные знания, поведенческие паттерны людей можно вытягивать из цифровых логов происходящего вокруг, денежные транзакции, покупки, рекламные метрики, просмотры роликов, лайки, реакции, последовательности действий потипу увидел, позвонил, нажал, купил, откомментировал что-то.
Данные для моделей симуляции мира: как что падает, звучит, отражает... что к чему приводит. Человек же учится жить не только читая энциклопедию... он наблюдает мир во всём его многообразии... в текстовом, визуальном, социальном. Другое дело, что эти данные куда более конфиденциальны и принадлежат юр. лицам, ну либо просто коммерческая тайна - проблема скорее в этом, а не в том, что данные закончились. Закончились открытые данные (ну или хотя бы условно бесплатно доступные с серой зоной разрешения на обучение).
Вообще я даже где-то слышал, что всё активнее развивается практика скупки обанкротившихся компаний как раз ради получения логов их данных о том, что делали либо их клиенты, либо как работали сами бизнес-процессы.
Все разбивается о тот факт, что за бэйс берется обычный трансформер типа лламы. А можно взять ТТТ модели, там свои законы. Что касается Чинчиллы - тут вообще импирика. До некоторых размеров он вообще не работает, с некоторых размеров тоже. Так, сверх сотен миллиардов разряженность обобщения падает, и параметрическая емкость начинает тратиться на запоминание. Это не классическое переобучение, а именно что память для цитирования. Или неестественные данные, кооих терабайты. Логги за десятилетия, дампы памяти, голые бинарники. Это для модели в 30 миллиардов это страшный шум, а для титана это паттерны, только успевай в пасть закидывать.
С ростом параметров можно наращивать регуляризацию. Шум до 20 процентов веса просто невозможен на 100б модели. На триллионе - почему нет? Или синтетическая неграмотность и огромные бпе словари, сотни тысяч и миллионы токенов в токенизаторе. Это уже на эмбеддинг может дать ТРИЛЛИОНЫ параметров. Например по 50-100 тысяч токенов на каждый язык.
Синтетическая некрамотность может просто кратно увеличить датасет из ничего, зато такая модель научится жрать все, что угодно.
А логи агентов и бесплатные чаты? Террабайты диалогов школьников о первой любви, вопросов о том, как сварить пиво, что такое трансформатор и как выглядит синица - это огромные данные. Агентные самоциклы, где чугун сам пишет код, сам его проверяет, и сам правит, получая обратную связь - это золото длинного контекста за счет самого пользователя. Все это взламывает закон Ципфа, вытаскивая вниз высоко висящие яблоки данных. Именно для этого везде бесплатный поиск прикручен. Ты просишь найти информацию про время работы магазина Весна в Сыктывкаре, и модель находит, обликая это в читаемый вид. И вот десять килобайт синтетического текста с еастоящими знаниями и человеческим ответом у нас есть.
Так что взгляд автора несколько наивен, не в обиду будет сказано.
Автор забывает о том, что уже сейчас все понимают ценность синтетических данных. Они все чаще и больше используются для обучения. Я бы не мыслил столь категорично, заявляя про никогда. Никогда означает что и через миллион, и миллиард лет. Это слишком много, чтобы давать такие прогнозы. Но готов поверить в то, что в ближайшие 10 лет этого не произойдет.
Квадриллион параметров (1Q) для LLM. Когда нам ждать такую модель?