Обновить

Комментарии 5

А куда делась Gemini? В прошлых тестах она всегда попадала в тройку лидеров.

Давно не обновлялась - сейчас сильно уступает даже аутсайдерам... не то что лидерам

Читал на днях кажется на пикабушке тест, который показал что грок всех уделал

Ну в чистом виде конечно не уделает... но да, модель очень неплохая

А почему в бенчмарке нет практической задачи разработки приложения с нуля ? Например, реализовать простую CRM-систему. Или сделать задачу по учету оборудования и его обслуживания. Да, я понимаю, что её оценивать объективно сложнее, но там и так половина оценок субъективна.

Кроме того, а можно в 1С подключать Claude напрямую к проду и давать ему любые задачи по обработке/чтению/измению данных ?

Мы в lsFusion сделали, что любой сервер в проде отдает MCP сервер, который просто дает исходный код на внутреннем высокоуровневом языке, а также возможность запуска команд на этом языке.

В итоге LLM может спокойно сам разобраться в логике по коду, все считать и даже изменять данные. Например, вот Claude подключился к демке MyCompany , считал её логику, считал и изменил данные, добавив платеж. И все по промпту :

Найди в демо MyCompany поставщиков с наибольшей задолженностью и заплати ему половину долга

Вот пример чата : https://claude.ai/share/bd0b0d12-75e5-4d6f-ade3-8e78f55984f3

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации