Обновить

Тест для AGI

AGI (Artificial General Intelligence), искусственный общий интеллект, способный решать интеллектуальные задачи на уровне человека.

Вводные для теста

1) Изображение

2) Описание

«Двадцать четыре шарика окрашены в шесть цветов и связаны между собой шестью замкнутыми цепочками. При вращении цепочек шарики перемешиваются. Вращая цепочки, необходимо восстановить исходное состояние так, чтобы на каждой стороне головоломки были шарики только одного цвета».

Задача

  1. По изображению и описанию создать трёхмерную компьютерную головоломку, используя вайбкодинг.

  2. Решить созданную головоломку, не используя машинный перебор вариантов.

Теги:
-1
Комментарии1

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ‑модели. Оказывается, есть такой параметр «Cost per Task», и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max).

При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз.

Как я понимаю, бенчмарк «Cost per Task» высчитывается так: когда ставится нормальная, грамотно описанная задача, замеряется, сколько токенов было потрачено на ее выполнение. То есть не в формате «из ХЗ сделаю ТЗ», а в формате, когда в хорошо заданном вопросе уже содержится половина ответа.

Я сначала не поверил, что так и есть, и стал работать, используя самую тупую модель Luna в линейке. И знаете, какие меня ожидали результаты?

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

Публикации