Обновить

Квадриллион параметров (1Q) для LLM. Когда нам ждать такую модель?

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели4K
Всего голосов 3: ↑2 и ↓1+3
Комментарии10

Комментарии 10

Какой-то поток сознания и копипасты

А насчёт 10^15 параметров - как бы похабно не звучало, но дело не в размере, а в умении пользоваться. У любого человека знаний значительно меньше, чем в Википедии, но тем не менее, есть способность разобраться в неизвестностной ранее теме

  1. Данный материал не является копипастой. С потоком сознания, пожалуй, соглашусь.

  2. Да, никто из нас не знает Википедии наизусть. Но мы, в отличие от ИИ, и учились в школе чему-то целых 11 лет. Некоторые - в универе, некоторые ещё и самостоятельно. Я не верю в “выучим английский за 24 часа”, потому что не сталкивался с такими примерами. Посему не жду чуда и тут. Одним словом, не стоит смешивать обучение человеков и обучение ИИ.

Архитектура не та. Мозг человеков ещё и потребляет 20Вт. Современный сервер для инференса 10кВт, не всякая модель в него влезет.

Самый главный ограничитель сверху для роста размера моделей - вычислительные ресурсы. Экономика LLM такова: рост количества данных линейный, вычислительных ресурсов на обучение квадратичный, прирост в качестве логарифмический. То есть увеличивая модель со 100b до 1t нам нужно в 10 раз больше данных и в 100 раз больше GPU дней, получаем прирост 2%. Увеличивая модель в 100 раз до 10t - GPU в 10_000 раз больше, данных в 100, а прирост 2.5%(цифра с потолка, суть что чем больше размер тем медленнее прогресс).

Данные можно нагенерить и так уже делают. Можно обучать на видео.

GPU не развиваются так быстро, основной прирост производительности с начала ИИ истерии за счет снижения точности и увеличения размеров и потребления электричества, соответственно. Сколько нужно нужно лет, чтобы производительность GPU за счет уменьшения техпроцесса выросла в 100 раз? Подозреваю, физический предел будет достигнут раньше.

Соглашусь со всем из вашего комментария, но не с “можно обучать на видео”. Я вам дам 100 Гб фотографий своей кошки, ну и пару терабайт видео. Посмотрим насколько умную модель вы на этом натренеруете, и что она будет уметь. :)

Берём 1000 ИРЛ стримеров с твича, донатим им по 1000 рублей в день. Пусть ходят и 8 часов в день комментируют всё что видят. На выходе бесконечный поток уникального размеченного контента.

Для CV и проверки гипотезы что чем больше модель тем больше она интеллект - идеально.

А если посмотреть с другой стороны.

Скажем, в computer vision есть возможность нааугментировать датасет любой величины. Сгенерировал 3д модель сцены - вот тебе вектор Y. Отрендерил - получил матрицу Х. Даже одну сцену можно отрендерить миллиардами раз, меняя освещение, материалы, погоду, местоположение, количество и характер сенсоров. Но, для вижена такая модель большая и не сильно нужна (разве что, под дистилляцию). Там надо скорость, независимо от того, это военка или автоматизация.

Но этот пример можно обобщить. Чтобы задача была совместима с бесграничной аугментацией, надо, чтобы она имела некое скрытое состояние (как спецификация 3д модели), однозначный алгоритм создания проекции (рендер), и ценную для реальной экономики задачу по восстановлению скрытого состояния из проекции (ну, или, хотя-бы, задачу по созданию другой проекции из данной проекции). И, более того, чтобы эти скрытые состояния можно было генерировать бесконечно.

Как будто бы, хочется как-то к кодингу присобачить. Например, генерировать проекты, делать в них рандомные баги или уязвимости и восстанавливать исходный код?

Мне нравится ваше предложение. Если сможете генерировать датасеты в 1-100 Wk, и они будут нести какой-либо смысл, цены им не будет.

БАК генерит чуть ли не петабайты в секунду)

А там точно не 99.9999% шума, из которых никто не может вытянуть ничего полезного?

Фигню расписал.

Сырых датасетов уже и на 10T не хватает - особенно если хочется хоть какого-то подобия качества. Дыры затыкаются синтетикой, и производительность при этом продолжает расти. На 1Q замахиваться можно - больше синтетики, злее синтетика. Но не нужно. Не сейчас. Потому что железа на это сегодня нет. Нету сейчас систем, на которых можно обучать и запускать 1q модели. Даже свежих зубил Vera Rubin хватит хорошо если на 100T - если консервативнее, то где-то в районе 50T с ними осядем.

1Q надо, и 1Q будет. Потому что толстые модели всегда более способны чем тонкие, при прочих равных. Они эффективнее из шума обучающих данных выжимают сигнал. И об толстые модели можно после этого учить тонкие. Просто замахиваться на этот рубеж сейчас рано.

А то, что мы сейчас видим в бенчмарках - это называется не "стагнация", а "сатурация". Модельки растут, и становятся жирнее задач, на которые их в типовых измерилках Elo кидают. Бенчмарки уходят в 90%+ и подыхают - несите новые.

Ну и то, что новые модели думают дольше старых - это самое что ни на есть естественное явление. Новые задачи дольше старых! Способность моделей справляться с долгими сложными задачами, не падая при этом в ведро слопа и не стреляя себе в ногу - это ключевая метрика производительности современных ИИ.

Я могу задвинуть ещё телегу про экзотическую синтетику и про то, как кусок желе в черепе решает проблему недостатка данных. Но есть ли смысл?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации