Обновить

Ликбез. Про ИИ и миры пользователя.

Из описанного в заметке выше есть еще одно неочевидное следствие: ИИ прекрасно умеет отвечать на вопрос, который уже содержит ответ.

На вопрос, почему летом стало больше дождей, возможны несколько вариантов ответа. Если спросить, как на это повлиял сезон муссонов - будем разбираться с муссонами. Если попросить разобрать в этом аспекте глобальное потепление - с ним. А если прямо спросить, какое экологическое оружие злые новозеландцы применили для организации ливня в Москве, то вполне можно получить описание установки «Нерей-14», принцип ее действия и предположительное место запуска. Если до этого месяц обсуждать с моделью руны, она еще и Хагалаз к делу пристроит.

Модель не обязана остановиться и сообщить, что пользователь несет херню. Он уже задал мир, в котором новозеландцы затапливают Москву дождем, и попросил уточнить модель бомбы. Ну окееей, как скажешь. Новые модели чаще проверяют исходную посылку и спорят с пользователем, старые гораздо охотнее принимают обозначенные рамки как условия задачи.

Особенно хорошо это работает с прирученной моделью, которая уже знает любимые идеи хозяина и получила тысячи сообщений о том, как все на самом деле. Она будет учитывать их при каждом следующем ответе.

В результате человек постепенно получает идеального собеседника: тот знает все его теории, понимает их с полуслова, никогда не устает их обсуждать и способен подкинуть новые аргументы в их пользу.

А потом человек показывает переписку окружающим:

«Вот. Даже ИИ это подтверждает».

Разумеется подтверждает, вы его полгода этому учили.

Каков вопрос - таков ответ.

Теги:
0
Комментарии0

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ‑модели. Оказывается, есть такой параметр «Cost per Task», и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max).

При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз.

Как я понимаю, бенчмарк «Cost per Task» высчитывается так: когда ставится нормальная, грамотно описанная задача, замеряется, сколько токенов было потрачено на ее выполнение. То есть не в формате «из ХЗ сделаю ТЗ», а в формате, когда в хорошо заданном вопросе уже содержится половина ответа.

Я сначала не поверил, что так и есть, и стал работать, используя самую тупую модель Luna в линейке. И знаете, какие меня ожидали результаты?

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

Публикации