Обновить
4K+
3
Александр Бородин@apdorodin

Пользователь

0,9
Рейтинг
Отправить сообщение

Мой топ бэнчмарков

Какую модель запустить на 2xV100, 2x32 GB VRAM: Gemma-4-26B или Qwen-3.6-35B. Обе современные. Обе от топовых компаний, обе мультимодальные, у обеих качественный маркетинг. Количество параметров и требования к железу - аналогичные. Но Gemma абсолютно неконкурентна и в любом типе задач измеримо хуже. В таких грубых случаях бенчмарки отлично описывают модели. Они и в менее грубых помогают, но там уже есть некоторое отклонение от реальности.

https://artificialanalysis.ai/ - Топ-1 по популярности и взвешенности решения. Состоит из 9 бенчмарков и составляет 3 индекса на их основе: интеллект, кодинг и агентные способности. Содержит все модели и добавляет их в течение 2 дней после выхода. Модели OpenAI добавляет день в день. Поменял свой индекс, чтобы показать, что GPT-5.6 Sol лучше Opus 4.8, но если вы пользуетесь только одним бенчмарком - пусть это будет он.

https://deepswe.datacurve.ai/ - бенчмарк SOTA-моделей на реальных задачах программирования. Основной формат представления - процент решённых задач против цены на одну задачу. То есть даже лучше, чем цена за токен, ведь одни модели используют больше токенов, чем другие. Задачи максимально продуманы и глубоки. На данный момент не переполнен и реально показывает полезность моделей для программирования.

https://arena.ai/leaderboard - так же, как и Artificial Analysis, не один бенчмарк, а целая коллекция. Начинал со сравнения пользовательских предпочтений, но сейчас имеет куда больше разделов. Упал в популярности, но всё ещё полезен для нишевых вопросов вроде сравнения качества поиска или генерации картинок

Теги:
+6
Комментарии1

MCP - это было очень модно (где-то год назад). Но многие до сих пор не поняли простую вещь: агент с доступом к командной строке может пользоваться любыми CLI-интерфейсами ничуть не хуже.

При этом у классических CLI есть очевидные преимущества:

- Их банально легче разрабатывать

- Они прозрачнее и понятнее в работе

- Применяться они могут не только агентами, но и людьми

- Их уже существует огромное множество под любые задачи

В Google это тоже осознали и выкатили [свой инструмент](https://github.com/googleworkspace/cli). Сделан он явно для агентов (его выпустили только в этом месяце), но это именно CLI, а не очередной MCP-сервер.

Точных фактов по этой теме пока нет. Кто-то говорит, что [в простых задачах MCP требует больше контекста, а в сложных — меньше, чем CLI, если инструменты грамотно обернуты и хорошо обнаруживаются агентом](https://portofcontext.com/blog/cli-vs-mcp-vs-code-mode). Кто-то, что этой разницей можно пренебречь, да и вызвана она тем, что не все CLI адаптированы под экономию контекста. Но все согласны, что CLI может дать агенту доступ ко всем тем же инструментам и обеспечить одинаковый процент успеха при выполнении задач, при этом будучи куда понятнее для человека и значительно проще в написании и поддержке.

В моих проектах я буду использовать CLI.

Теги:
Всего голосов 1: ↑1 и ↓0+2
Комментарии3

Информация

В рейтинге
2 135-й
Откуда
Россия
Зарегистрирован
Активность

Специализация

Десктоп разработчик