Обновить

Ликбез. Как учится ИИ.

Мы уже выяснили в предыдущих постах, что после «мама мыла» ИИ предпочтет раму межконтинентальной баллистической ракете. Но вопрос: а с чего он это взял?

Для обучения берут огромное количество текстов и загружают их в модель. Она видит начало какого-нибудь куска и пытается продолжить. Не угадала - подкрутили. Следующий кусок. Снова не угадала - опять подкрутили. И так раз за разом.

Причем справочник «Как устроен мир» модели никто не выдает. Ей дают гору текстов, а дальше разбирайся сама. Из них модель должна каким-то образом выяснить, что трава зеленая, растет на земле, ее едят коровы, а еще она почему-то отдельно разрешена в Нидерландах. Никто это не объясняет, это нужно вытащить из того, как люди используют слова в текстах.

А теперь ооооооочень грубо упростим происходящее внутри. Будем считать, что каждое такое подкручивание создает или поправляет маленькую ассоциацию. Эти маленькие ассоциации называются параметрами, и у большой модели их миллиарды.

Постепенно из этих маленьких ассоциаций получаются целые ассоциативные ряды. «Мама» - человек, семья, дети, дом. «Мыла» - вода, мыло, уборка, чистота. Но вместе «мама мыла» создает уже новый ряд: пол, посуда, окна и та самая рама. Ассоциации накладываются друг на друга, и их сочетание может дать связь, которой не было ни у одного слова по отдельности. Поэтому рама и пол в теории побеждают баллистическую ракету.

Но если в запросе перед этим обсуждали подготовку ракеты к параду, то она внезапно получает целую кучу дополнительных ассоциаций и возвращается в игру. Примерно это мы уже наблюдали в предыдущей заметке про миры пользователя.

Готовая модель почти не содержит в себе исходных текстов. Тексты нужны прежде всего для того, чтобы сформировать этот чудовищный клубок ассоциаций. Какие-то фрагменты модель может фактически запомнить и воспроизвести, но это скорее побочный результат обучения, а не основной способ хранения знаний.

Поэтому модель не энциклопедия. Она постепенно связывает Париж с Францией, Цезаря с Римом, цезарь с пармезаном, холодильник с магнитиками, маму с рамой и миллионы других вещей друг с другом.

Теги:
+2
Комментарии1

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ‑модели. Оказывается, есть такой параметр «Cost per Task», и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max).

При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз.

Как я понимаю, бенчмарк «Cost per Task» высчитывается так: когда ставится нормальная, грамотно описанная задача, замеряется, сколько токенов было потрачено на ее выполнение. То есть не в формате «из ХЗ сделаю ТЗ», а в формате, когда в хорошо заданном вопросе уже содержится половина ответа.

Я сначала не поверил, что так и есть, и стал работать, используя самую тупую модель Luna в линейке. И знаете, какие меня ожидали результаты?

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

Публикации