Обновить

Пост, закрывающий мою «неделю списков» на Хабре

Представьте себе торговый зал какого-нибудь большого супермаркета. Покупатели снуют по проходам между полками со своими тележками. Кто-то хаотично бродит по рядам, задумчиво разглядывая товары. Кто-то быстро и со знанием дела перемещается от отдела к отделу. Но никто не сравнится по твёрдости и целенаправленности с мужчиной, у которого в руках Список Покупок, написанный аккуратным женским почерком. Этот человек точно знает, что ему надо купить — все маркетологи и мерчендайзеры мира перед ним бессильны. Ни на йоту не отступая от заданной программы, он последовательно и методично наполняет свою тележку. Этот покупатель предельно серьёзен и сосредоточен, ведь все требования списка должны быть соблюдены безукоризненно. Можно только гадать, что бы он делал без этого ценного листочка бумаги, заполненного важной информацией о наименованиях и требуемом количестве продуктов и предметов.

Актуальное... 😎

Жена отправляет мужа-программиста в магазин:
— Купи батон хлеба, если будут яйца — возьми десяток.
Муж возвращается из магазина с десятью батонами.
— Ты зачем столько хлеба купил?
— Так ведь яйца были...

Почитать про списки:

Теги:
Всего голосов 10: ↑10 и ↓0+12
Комментарии1

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ‑модели. Оказывается, есть такой параметр «Cost per Task», и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max).

При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз.

Как я понимаю, бенчмарк «Cost per Task» высчитывается так: когда ставится нормальная, грамотно описанная задача, замеряется, сколько токенов было потрачено на ее выполнение. То есть не в формате «из ХЗ сделаю ТЗ», а в формате, когда в хорошо заданном вопросе уже содержится половина ответа.

Я сначала не поверил, что так и есть, и стал работать, используя самую тупую модель Luna в линейке. И знаете, какие меня ожидали результаты?

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

Публикации