Обновить

ИИ AlphaProof в комбинации с Gemini достигает высокого уровня понимания математики. Google даже заявляет, что на Международной математической олимпиаде такая система получила бы серебряную медаль.

В реальном мире неточность больших языковых моделей удивляет. В Сети распространяют очередной тест на тупость БЯМ: просьбу сравнить числа 9,9 и 9,11.

Чаты по типу ChatGPT скармливают ввод от пользователя в БЯМ с неким ненулевым значением температуры, поэтому результаты генерации в ответ на один и тот же запрос могут различаться. К тому же не все скриншоты показывают полный контекст чатов. Тем не менее для почти всех доступных моделей есть примеры, где ИИ уверенным тоном объясняет, что 9,11 больше, чем 9,9. К примеру, эту ошибку демонстрируют ChatGPT, Claude и даже новая модель Llama 3.1 в варианте на 405 млрд параметров.

Объяснение ошибке найти просто. Как минимум в одном контексте 9.11 будет больше, чем 9.9 — версионирование программного обеспечения. Без дополнительного контекста математических вычислений БЯМ могут понимать вопрос неправильно.

На вопрос отвечает Llama 3.1-405B
На вопрос отвечает Llama 3.1-405B

Ошибка проявляется редко и может исчезать при изменении порядка слов в вопросе. Тем не менее пользователей крайне забавляет, когда ChatGPT вычитает 9,9 из 9,11 и получает 0,21, а отличный от собственного результат от API Python объясняет ошибками арифметики чисел с плавающей запятой. В другом случае модель Llama 3.1-405B согласилась, что совершила ошибку, но от утверждения «9,11 больше 9,9» не отказалась, придумав новое доказательство.

Теги:
Всего голосов 2: ↑2 и ↓0+4
Комментарии1

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ‑модели. Оказывается, есть такой параметр «Cost per Task», и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max).

При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз.

Как я понимаю, бенчмарк «Cost per Task» высчитывается так: когда ставится нормальная, грамотно описанная задача, замеряется, сколько токенов было потрачено на ее выполнение. То есть не в формате «из ХЗ сделаю ТЗ», а в формате, когда в хорошо заданном вопросе уже содержится половина ответа.

Я сначала не поверил, что так и есть, и стал работать, используя самую тупую модель Luna в линейке. И знаете, какие меня ожидали результаты?

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

Публикации