Комментарии 5
А куда делась Gemini? В прошлых тестах она всегда попадала в тройку лидеров.
Читал на днях кажется на пикабушке тест, который показал что грок всех уделал
А почему в бенчмарке нет практической задачи разработки приложения с нуля ? Например, реализовать простую CRM-систему. Или сделать задачу по учету оборудования и его обслуживания. Да, я понимаю, что её оценивать объективно сложнее, но там и так половина оценок субъективна.
Кроме того, а можно в 1С подключать Claude напрямую к проду и давать ему любые задачи по обработке/чтению/измению данных ?
Мы в lsFusion сделали, что любой сервер в проде отдает MCP сервер, который просто дает исходный код на внутреннем высокоуровневом языке, а также возможность запуска команд на этом языке.
В итоге LLM может спокойно сам разобраться в логике по коду, все считать и даже изменять данные. Например, вот Claude подключился к демке MyCompany , считал её логику, считал и изменил данные, добавив платеж. И все по промпту :
Найди в демо MyCompany поставщиков с наибольшей задолженностью и заплати ему половину долга
Вот пример чата : https://claude.ai/share/bd0b0d12-75e5-4d6f-ade3-8e78f55984f3

Лучшие модели для разработки с ИИ на 1С (бенчмарк v2)