Языковая модель сама по себе не является калькулятором: она вероятностно предсказывает следующий токен, а не выполняет детерминированный алгоритм вычисления.
Для текста это полезное свойство — одну мысль можно выразить множеством способов. В математике «почти правильный» ответ уже неверен. В многошаговой задаче одна ошибка в промежуточном значении распространяется на весь результат.
Практический вывод для ИИ-агентов: разделять роли. LLM должна понять задачу, составить план и выбрать инструмент. Сам расчёт лучше передать калькулятору, Python, CAS или специализированному вычислителю, а затем проверить и объяснить ответ.
Сильная агентная система — это не только модель, но и правила использования инструментов.
Подробнее — в моём Telegram-канале «Идеи для ИИ — Андрей Анисимов». Ссылка в профиле.