Обновить

Наш бенчмарк ИИ‑агентов: собачьи бега моделей LLM, в которых Алиса выигрывает

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели6.2K
Всего голосов 4: ↑2 и ↓2+1
Комментарии14

Комментарии 14

ЗакрепленныеЗакреплённые комментарии

Только что узнал новость что вышла новая модель Сбера с открытыми весами. Мы уже обновили бенчмарк, добавили модель ai-sage/GigaChat3.5-432B-A28B, и можно сравнить производительность. Честно говоря скорость работы намного выросла. 42 секунды против 27 у Алисы, но.. у этой модели документ более полный.

Сергей, сейчас будет не очень приятно, но, надеюсь полезно. Отнеситесь пожалуйста к моему комментарию как к конструктивной критике.

Дело в том что это не тесты, это сравнения попарно сферических коней в вакууме. Объясню на вашем примере номер четыре: Коммерческое предложение

Задача: КП от студии дизайна интерьера, семь разделов перечислены явно (о компании, этапы работы, что входит в услугу, сроки, стоимость по этапам, условия оплаты, контакты), тон деловой, но не сухой.

Первая проблема в том, что модели вынуждены придумывать название компаниии, этапы, сроки, цены “в среднем по больнице” исходя из того чему они были обучены.

Даже региональная специфика не учитывается, а ведь расценки по регионам разные. Клиенту буквально предлагается получить “рыбу” (шаблон) и затем заменить в нем названия, цены, этапы и тд. Я называю это лоскутной автоматизацией.

Вторая пробелма в том, что вы стреляете из пушки по воробьям. Большие модели, которые вы используете в тестах являются моделями общего назначения, те они обучены делать все с усредненным качеством.

И в этом случае гораздо меньшие модели, даже без дообучения покажут такое же и более высокое качество, потому что тут все зависит от акцентов на доменные области, которые разработчики модели выбрали при обучении.

Я продемонстрирую это на вашем тесте указанном выше.

Вы сравнивали GigaChat 2 Max и Alice AI LLM.

На самом деле вы сравнивали Qwen и DeepSeek, потому что GigaChat внук DeepSeek V2.5 и правнук DeepSeek-V2-Lite, а Алиса приходится внучкой Qwen3-235B и правнучкой Qwen-2.5-32B-base, ну это так, к слову.

GigaChat 2 Max (SberCloud) справился за 3:48, Alice AI LLM справилась за 0:45.

Возьмем, например, модель Ornith 1.0 35B, она помещается в 48GB c 262К контекстом и решает это задание за 4:04 с тем же качеством.

Возьмем модель поменьше, Qwen 3.8 27B. Она справляется за 2:30, уже обгоняет GigaChat 2 Max и качество результата у нее такое же как у облачных.

Можно сказать, что Qwen 3.8 самая свежая, только вышла и это нечестное сравнение. Хорошо, давайте возьмем более старую и более младшую модель, Qwen 3.5 9B. Эта модель с полным 262К контекстом помещается в 20GB, с контекстом достаточным для выполнения задачи, она помещается в 12GB.

Самое интересное, эта модель поняла, что не нужно выдумывать и начала задавать вопросы пользователю чтобы сделать сразу нормально:

Я помогу вам оформить коммерческое предложение от студии дизайна интерьера. Сначала мне нужно получить информацию о вашей компании, чтобы сделать документ персонализированным и точным.

Давайте я задам несколько вопросов:

Какая информация у вас есть о студии дизайна интерьера? 
Пожалуйста, предоставьте: 

1) Название студии 
2) Краткое описание/особенности компании (опыт работы, специализация, преимущества) 
3) Этапы работы студии (сколько этапов, какие основные шаги)

И дальше начала задавать вопросы про расценки. Пришлось добавить в конец задачи “Придумай данные сам”.

После этого модель справилась за 0:48. Это уже результат Alice AI LLM, при этом модель грамотно указала уточнения:

в разделе “Сроки разработки проекта”: Сроки могут изменяться в зависимости от сложности планировочных решений, необходимости согласований и выбранных опций визуализации.

в разделе “Стоимость по отдельным этапам”: При заказе полного проекта скидка 15% на все этапы работы.

в конце документа: Коммерческое предложение актуально на сентябрь 2026 года и может быть изменено без предварительного уведомления. Все цены указаны в российских рублях с учётом НДС

Я никак не дообучивал модели, не добавлял доп инструкции, не заставлял работать в агентном режиме, просто запустил как есть, локально (т.е. полностью бесплатно по токенам).

Если бы я использовал дообученные модели, настроенные на эти типы задач результат был бы еще лучше, но мы сравниваем модели как есть, без доработок.

Чтобы уменьшить размер комментария, я положил результаты тестов в файлообмнник.

Вы можете скачать текстовые файлы результатов трех моделей в md формате для сравнения.

Они будут доступны на файлообменнике неделю. MD-формат выбран для удобства сравнения машинным способом, он легко преобразуется в pdf/docx/xlsx. Это уже стандарт при работе с моделями.

Эпоха использования больших моделей общего назначения для обычных задач уходит, потому что технологии не стоят на месте. Новые архитектуры и решения позволяют делать все эти задачи локально либо в закрытом контуре, без использования облаков, с тем же качеством и той же скоростью.

Наши, российские большие модели отстают от текущих зарубежных больших моделей на 1-1.5 года и вы (ваш бизнес) становитесь заложником этого отставания.

Я понимаю, что это ваша бизнес модель, поэтому и делюсь информацией. Возможно, вы сможете чутко среагировать и скомандовать “лево руля” вовремя. У больших моделей есть свои ниши которые останутся востребоваными еще долго, но они не имеют отношения к тем задачам которые вы показали в статье.

Я желаю вам не быть одним из тех бизнес-мотыльков, что слепо несутся на пламя хайпа больших LLM и сгорают. Порхайте как бабочка, жальте как пчела.

Спасибо за развёрнутый разбор, вы потратили на него время и выложили результаты, это редкость.

По синтетике согласен полностью. Задачи в забегах действительно с придуманными данными, и это ограничение методики. Ближайшее, что я поправлю: добавлю тип задачи, где входные данные подаются файлом, а не выдумываются моделью. Это ближе к тому, как работают пользователи на самом деле.

Дальше не соглашусь, и вот почему. Мы меряем разные вещи. У вас на выходе markdown из чата, у меня docx, прошедший проверку структуры внутри конвейера, с шаблоном, полями и валидацией. Ваши секунды это время до текста в окне, мои до готового файла. Сравнивать их напрямую нельзя.

И обратите внимание на собственный результат с Qwen 3.5 9B. Модель вместо документа начала задавать уточняющие вопросы, и вам пришлось руками дописать «придумай данные сам». Это и есть та работа, ради которой существует конвейер. У меня в проде тысяча сто пользователей, и это в основном не инженеры. Никто из них не станет переформулировать задание, когда модель решила поговорить. За три месяца по логам это 22 сбоя на 1198 задач.

Про локальные модели вы правы по существу, но это другой продукт. 12, 20 и 48 гигабайт видеопамяти это сервер и человек, который умеет его обслуживать. Мой пользователь бухгалтер, сметчик или фрилансер, у него ноутбук и задача сдать акт сегодня. Локальный контур это отдельный сценарий, и он мне интересен, но он не отменяет облачный.

Если захотите проверить своё утверждение в сопоставимых условиях, забеги открыты, там одна задача и один конвейер на обе модели: vibepilot.ru/benchmark. Результаты публичные, спорить будет уже не с чем.

Ближайшее, что я поправлю: добавлю тип задачи, где входные данные подаются файлом, а не выдумываются моделью. Это ближе к тому, как работают пользователи на самом деле.

Да, это здорово поднимет ценность результатов тестирования.

Мы меряем разные вещи. У вас на выходе markdown из чата, у меня docx, прошедший проверку структуры внутри конвейера, с шаблоном, полями и валидацией.

Не совсем так. Ваша проверка структуры заложена в конвеер, а не в саму модель. Я точно также могу добавить pydantic-валидацию, сделав конвеер и получать на выходе такие же форматы как и вы. Это не свойство модели как таковой, это свойство пайплайна. Мы же ведем речь о тестировании моделей, а не пайплайнов.

Ну ладно я, неподготовленный пользователь задав вопрос в чат сделает тоже самое, вернее за него это сделает модель. А уж если он поставит локальный харнесс выполнив одну команду, которую предложит ему та же модель в чате, то вообще тушите свет.

Нет никаких проблем сделать локальный пайплайн такого же или лучшего качества. Лучшего, потому что на валидацию и прочие шаги пайплайна я могу локально посадить еще меньшую модель, которой будет достаточно по качеству, а скорость она будет выдавать выше. Вам же придется обращаться к большой модели общего назначения.

И обратите внимание на собственный результат с Qwen 3.5 9B. Модель вместо документа начала задавать уточняющие вопросы, и вам пришлось руками дописать «придумай данные сам». Это и есть та работа, ради которой существует конвейер. 

В данном случае это плюс, а не минус. Меньшая модель сама понимает и делает то, что вам приходится достраивать пайплайном. А мое добавление «придумай данные сам» вызвано желанием оставить модель в рамках теста заставив ее придумывать, те работать хуже чем она может.

Про локальные модели вы правы по существу, но это другой продукт. 12, 20 и 48 гигабайт видеопамяти это сервер и человек, который умеет его обслуживать.

48ГБ нужны для запуска первых двух с максимальным контекстом. Для тех задач, что вы используете в бенчмарке он не нужен, т.е. их можно запустить на обычной RTX 3090 24Gb.

Далее, 9B модель спокойно запускается на 12GB, достаточно обычной потребительской видеокарты. Есть также 12GB модели (не включил в тест чтобы ужать комментарий), которые помещаются в 16GB, что тоже поместится в какую-нибудь RTX 4060. Никаких серверных видеокарт для работы с этими моделями не нужно, собственно, они для этого и разрабатывались.

Мой пользователь бухгалтер, сметчик или фрилансер, у него ноутбук и задача сдать акт сегодня.

Я мог бы рассказать про оффлоад модели в RAM, про различное квантование позволяющее работать с локальными моделями на ноутбуках, но это тема отдельной статьи.

Если взять старый ноутбук или мобильный телефон/планшет, то тут да, облачное решение без вариантов, во всех остальных случаях уже локальные решения идут вровень или выигрывают у облачных. Такова сегодняшняя реальность.

Если захотите проверить своё утверждение в сопоставимых условиях, забеги открыты, там одна задача и один конвейер на обе модели: vibepilot.ru/benchmark. Результаты публичные, спорить будет уже не с чем.

Не совсем понял, что я могу проверить? Загрузить к вам небольшие модели и прогнать их? Так они еще лучше (и быстрее) себя покажут на вашем же пайплайне, т.к. локально я вообще не использовал пайплайн предположив, что это чистые замеры моделей.

У Вас название "Почему Алиса выигрывает", но из дальнейшего текста не ясно, а почему, модель, явно уступающая своим конкурентам в целом, внезапно на отдельной задаче выигрывает (что с некоторой вероятностью может быть, но явно требует пояснений).
Не успел спросить у Вас, как увидел объяснения @ToxaBes, и вот они как раз выглядят достаточно ясными (правда, объясняют, почему Алиса НЕ выигрывает).
В Вашем ответе ему, пояснений выигрыша Алисы тоже нет. Было бы интересно, если бы Вы разобрали этот вопрос.
P.s. Не ставлю под сомнение, что задача иметь рабочий вариант на суверенных моделях Вами решена, вопрос о том, действительно ли суверенные модели при этом и лучшие.

Справедливый вопрос, в статье механизма действительно нет, только факт. Попробую разобрать.

Разрыв на смете (19 секунд против 87 у Qwen3-235B) складывается из трёх вещей, и скорость самой модели среди них не главная.

Первое: число вызовов модели. 2 у Алисы против 5 у Qwen. Конвейер вызывает модель заново, если результат не прошёл валидацию структуры. Крупные модели чаще промахиваются мимо формата: оборачивают ответ в markdown, дописывают пояснения, «улучшают» схему. Каждый такой промах это лишний полный вызов, и три лишних вызова дают в разрыв больше, чем разница в tokens/sec.

Второе: объём вывода. 385 токенов против 1182. Алиса пишет короче. На смете с явно заданными разделами это не вредит, структура на месте. Часть выигрыша по времени тут просто оплачена лаконичностью, и в других задачах та же черта работает против неё.

Третье, и это надо сказать прямо: промпты шагов у всех моделей одинаковые, тут условия равные. А вот параметры запросов под Алису откалиброваны лучше просто потому, что она в проде с апреля и я на ней набил шишки. У остальных моделей стоят разумные умолчания, но без такой же обкатки. Какую-то часть разрыва это объясняет, честно оценить какую я не могу.

И только четвёртым пунктом идёт то, что модель меньше и физически быстрее генерирует.

То есть картина такая: конвейер снимает с модели принятие решений и оставляет ей шаг с фиксированной структурой и целью. На таком шаге превосходство сильной модели почти не реализуется, ей негде его проявить. А раз качество ответов на шаге выравнивается, решают попадание в формат с первого раза и скорость.

По вашему P.S.: нет, суверенные модели не лучшие, и я так не утверждаю. По качеству результата на лендингах Qwen делает страницу аккуратнее, а по проценту сбоев Алиса вообще последняя из шести (2,4%). Утверждение скромнее: внутри такой архитектуры они достаточны, и тогда решают скорость, цена и то, что данные не покидают периметр.

Ясно, спасибо. То есть основное - использована оптимизированная под массовые шаблонные бизнес-задачи с генерацией документов очень дешёвая модель (нет у неё ни большого контекстного окна, ни reasoning, зато стоимость почти 0). И в них она действительно лидер.

Стоимость почти ноль? С чего вы так решили?

Модель

Цена за 1000 входящих токенов,вкл. НДС

Цена за 1000 кешированных токенов,вкл. НДС

Цена за 1000 токенов инструментов,вкл. НДС

Цена за 1000 исходящих токенов,вкл. НДС

Alice AI LLM

0,5 ₽

0,5 ₽

0,13 ₽

1,2 ₽

Спасибо за уточнение.
Тогда правильно так: "нет у неё ни большого контекстного окна, ни reasoning, а стоимость не меньше других".

И я не виноват, так и должно было быть. Это всё DeepSeek. И он всё объяснил: "Это не случайность, а системное свойство: LLM не гарантирует логическую согласованность внутри ответа..."

P.s. Это самоирония про мою невиновность. Проверять надо.

Только что узнал новость что вышла новая модель Сбера с открытыми весами. Мы уже обновили бенчмарк, добавили модель ai-sage/GigaChat3.5-432B-A28B, и можно сравнить производительность. Честно говоря скорость работы намного выросла. 42 секунды против 27 у Алисы, но.. у этой модели документ более полный.

Перед тем продолжить, я хочу уточнить, что не являюсь вашим конкурентом (не работаю с бухгалтерами на ноутбуках/фрилансерами/физлицами), тут скорее вы являетесь моим потенциальным клиентом, т.к. я специализируюсь на B2B интеграторах по white label/субподряду и B2C (средний/крупный бизнес).

Мы с вами работаем в разных, непересекающихся областях одного большого домена. Все что я пытаюсь вам показать, это то с чем вы начнете массово сталкиваться уже этой зимой.

Давайте продолжим опыт по использованию небольших локальных моделей, на примере 27B модели. Я открыл результат работы GigaChat 3.5 432B и захотел проверить качество результата (текст договора), но накнулся на “Скачать DOCX и PDF без пометок, 199 ₽”.

Окей, запускаю модель 27B и пишу: скачай текст договора со всем форматированием в md файл: https://vibepilot.ru/word/preview?session=session-1789042949018-2waqv1ga5

На первой минуте модель поняла, что это SPA на Next.js, на второй нашла весь контент в json формате, на третьей расковыряла оригинальное форматирование и на четвертой минуте вернула полностью валидный md документ с текстом договора.

После чего я задал второй вопрос: проверь договор_оказания_услуг_по_разработке_сайта.md с юридической стороны, укажи какие недочеты и риски он содержит с учетом законодательства РФ в 2026м году.

На этот раз модель думала 7 минут и выдала (дальше ответ модели):

Проверил договор по актуальному законодательству РФ (с учётом изменений 2025–2026 гг.). Ниже — рецензия по степени критичности.

Юридическая рецензия: «Договор оказания услуг по разработке сайта»

🔴 Критические недочёты

1. Существенное условие (предмет) фактически не определено. Пункт 1.3 отсылает к Приложению №1 (ТЗ) как «неотъемлемой части Договора», но приложение в документе отсутствует, а все ключевые данные — плейсхолдеры ([Город], [Сумма], [Дата начала] и т.д.). Предмет — существенное условие (п. 1 ст. 432 ГК РФ). Если ТЗ не будет подписано вместе с договором, суд может признать договор незаключённым, а объём работ — недоказуемым. Это главный источник будущих споров «что именно заказывали». → Приложить и подписать ТЗ с критериями приёмки до подписание договора; заполнить все плейсхолдеры.

2. Нет досудебного (претензионного) порядка со сроком. П. 9.2 говорит лишь, что «споры решаются путём переговоров». С 01.09.2016 для экономических споров обязателен претензионный порядок — 30 дней (п. 6 ст. 49 АПК РФ). Без закреплённого срока и порядка направления претензии суд может вернуть/отказать в принятии иска. → Добавить: претензия направляется по адресу/почте из раздела «Реквизиты», срок ответа — 30 календарных дней, до обращения в суд обязательна.

3. Пункт 3.1 «НДС не облагается в связи с применением Исполнителем УСН» — безусловная формулировка, которая в 2026 г. может быть неверной. С 01.01.2026 базовая ставка НДС повышена до 22%, а порог освобождения для упрощенцев снижен до 20 млн руб. дохода (по итогам 2025 г.; далее поэтапно: 15 млн в 2027, 10 млн с 2028) — см. ФНС о новых правилах НДС, Сбербанк: ставка 22% с 01.01.2026 (425-ФЗ от 28.11.2025), Контур: НДС на УСН в 2026. Если доход Исполнителя превысит порог, он обязан выставлять счета-фактуры со ставкой 5%/7% (1ab: ставки для ИП на УСН в 2026). → Риск: Исполнитель — доначисление, пени; Заказчик — потеря права на вычет и переплата. Заменить формулировку на: «Налоги и сборы каждая Сторона несёт самостоятельно в соответствии с законодательством РФ. Исполнитель обязуется уведомить Заказчика об изменении налогового статуса не позднее 5 рабочих дней».

🟠 Высокие риски (отсутствующие разделы)

4. Переквалификация: «услуги» vs «подряд». По тексту это подряд на результат (этапы, сдача-приёмка готового Сайта), а по названию — возмездное оказание услуг. Судебная практика нередко переквалифицирует IT-разработки в подряд (гл. 37 ГК РФ) — см. обзор рисков переквалификации. Последствия разные: для подряда действуют гарантия качества (ст. 723 ГК), право Заказчика на односторонний отказ с оплатой фактически понесённых расходов (ст. 717 ГК); для услуг — ст. 782 ГК. → Либо переименовать в «договор подряда на разработку сайта», либо прямо зафиксировать, что договор регулируется гл. 39/37 ГК и какие последствия сторон это несёт.

5. Персональные данные (152-ФЗ) — раздел отсутствует полностью. Если Сайт будет собирать данные через формы: кто оператор? С 01.09.2025 действует запрет трансграничной передачи ПД (хостинг/сервисы за рубежом = нарушение), а с того же срока оператор обязан уведомлять Роскомнадзор об инциденте в течение 24 часов, а о результатах расследования — в течение 72 часов (ч. 3.1 ст. 21 152-ФЗ) — порядок уведомления. → Добавить раздел: размещение данных на территории РФ, распределение обязанностей оператора (уведомление Роскомнадзора, политика конфиденциальности, обработка инцидентов), ответственность за нарушение.

6. Гарантия качества и поддержка после приёмки — отсутствуют. Нет гарантийного срока на дефекты Сайта, нет SLA, нет порядка устранения ошибок после подписания Акта. Через месяц Сайт «лежит» — договор молчит, остаются только общие нормы ГК. → Добавить: гарантийный срок (например, 12 месяцев), срок реакции/устранения критических дефектов, порядок бесплатного исправления в гарантии.

7. Интеллектуальная собственность (раздел 7) неполная.

  • Нет оговорки о сторонних компонентах: открытые библиотеки, стоковые фото, шрифты — лицензии OSS (например, GPL) могут наложить обязательства на код Сайта; Исполнитель не гарантирует чистоту лицензий.

  • Нет гарантии от Заказчика, что предоставляемый им контент (тексты, изображения) не нарушает прав третьих лиц — риск претензий/снесения Сайта по ст. 1250–1252 ГК РФ падает и на Исполнителя как публикующего.

  • Права переходят только после полной оплаты: если Заказчик задержит оплату, но Сайт уже работает у него — механизма (лицензия до перехода прав / блокировка доступа) нет. → Добавить обе гарантии + порядок лицензирования до момента перехода исключительных прав.

8. Домен, хостинг и передача доступов — не регулируются. Кто регистрирует домен и на кого? Кто платит за хостинг после запуска? Как передаются админ-доступы (панель, хостинг, почта)? П. 6.1 упоминает «тестовый хостинг» — но кто его оплачивает и сколько он живёт, не сказано. Это классическая зона споров при расставании сторон. → Добавить раздел: домен регистрируется на Заказчика (или передаётся), оплата хостинга после Акта — за Заказчиком, передача доступов оформляется актом.

9. Расторжение и односторонний отказ. Как выйти из договора досрочно, что происходит с авансом 50% при отказе — не урегулировано вовсе (применяются только императивные ст. 717/782 ГК). При предоплате 50% это чувствительно: порядок возврата/зачёта аванса при отказе Заказчика должен быть прописан. → Добавить раздел «Изменения и расторжение»: право одностороннего отказа, расчёт (оплата фактически выполненных работ по акту, возврат неиспользованного аванса в N дней).

10. Дополнительные работы и изменение цены. Любой объём сверх ТЗ («а давай ещё блог») сейчас — спор: договор не содержит механизма доп. соглашений/коммерческих предложений на дополнительные работы. → Добавить: дополнительные работы оформляются отдельным приложением с ценой и сроками, подписываются обеими сторонами.

🟡 Средние риски и неточности

11. Сроки (раздел 4) — не определена точка отсчёта. «Общий срок [N] календарных дней» — с момента подписания или с момента предоставления материалов Заказчиком (п. 2.2)? Если с подписания, а контент пришлют через месяц, Исполнитель автоматически в просрочке по п. 5.2 без механизма переноса сроков. → Привязать срок к дате получения полного комплекта материалов; задержка со стороны Заказчика продлевает сроки соразмерно.

12. Ответственность (раздел 5) — асимметрия и пробелы.

  • Пени Исполнителя ограничены 10%, но общий лимит ответственности отсутствует — для Исполнителя риск неограниченного возмещения убытков; для Заказчика, наоборот, нет гарантии компенсации сверх пеней.

  • Нет исключения ответственности Исполнителя при просрочке по вине Заказчика (см. п. 11).

  • П. 5.3: пени Заказчику начисляются только при задержке оплаты более 5 рабочих дней — льготный период, допустим, но учтите его.

13. Форс-мажор (раздел 8) без процедуры. Не указаны: кто и в какой срок уведомляет другую сторону, что является доказательством (справка ТПП), как переносятся сроки. Без этого ссылка на ст. 401 ГК в споре слаба.

14. Нет раздела «Уведомления»: адреса/почты для направления актов, отказов и претензий. Без него сложно доказать надлежащее уведомление (в т.ч. «умолчание = приёмка» из п. 6.3).

15. Передача прав и обязанностей. Нет оговорки об обязательном согласии другой стороны на цессию/перенаправление (ст. 382, 391 ГК) — например, если Исполнитель передаст проект субподрядчику или продаст бизнес.

16. Подсудность (п. 9.2). «Арбитражный суд по месту нахождения Истца» допустима как договорная подсудность (ст. 32 АПК) и обычно поддерживается, но формулировка через «Истца» менее определённая — лучше назвать конкретный суд.

17. Формальные пробелы:

  • нет номера договора;

  • не указано количество экземпляров («в двух экземплярах, имеющих равную юридическую силу»);

  • не определена форма: бумажная или электронная (при подписании через УЭД/ЭП нужна оговорка об эквивалентности электронной подписи);

  • блок подписей — одна строка с табуляцией; в бумажном виде лучше две колонки, каждая со своими реквизитами под подписью (таблица выше частично это закрывает).

Итог: топ-5 действий перед подписанием

# Действие Устраняет риск

1 Подписать ТЗ как приложение с критериями приёмки, заполнить все плейсхолдеры Договор признан незаключённым (ст. 432 ГК)

2 Добавить претензионный порядок на 30 дней Иск вернут без рассмотрения (п. 6 ст. 49 АПК)

3 Заменить «НДС не облагается» на нейтральную налоговую оговорку + уведомление об изменении статуса Налоговые доначисления в 2026 (ставка 22%, порог УСН 20 млн)

4 Добавить разделы: персональные данные, гарантия/поддержка, домен-хостинг-доступы, расторжение с судьбой аванса Основные зоны будущих споров

5 Уточнить квалификацию (подряд vs услуги), точку отсчёта сроков и процедуру форс-мажора Переквалификация, ложная просрочка

В целом структура договора рабочая (приёмка с «умолчанием = принято» — хороший пункт для Исполнителя; пени 0,1% с потолком 10% — рыночные), но в текущем виде он не готов к подписанию: без ТЗ и претензионного порядка это документ с высоким шансом оказаться бесполезным именно в момент спора.

Могу подготовить доработанную версию договора со всеми недостающими разделами — скажите, от позиции какой стороны делать акценты (Заказчик / Исполнитель).

Комментарии излишни.

Спасибо. Отвечу по трём пунктам отдельно, потому что они про разное.

По document.json. Это дыра, а не полемика. Предпросмотр рендерится из JSON, который лежал на публичном URL без проверки сессии, и оплата в этом месте защищала только кнопку скачивания. Спасибо, что показали. Закрываю.

По качеству договора. Претензии принимаю, налоговую часть вашей рецензии я проверил, она корректна. Конвейер генерирует черновик уровня шаблона: разделы на месте, плейсхолдеры на месте, юридической экспертизы нет и не заявлено.

Тут уместно сказать, какой позиции я придерживаюсь. В манифесте платформы третьим пунктом стоит «За результат отвечает человек, а не ИИ» (https://vibepilot.ru/principles, написан весной). Платформа отдаёт черновик за 45 секунд, решение о подписании принимает человек. Ваша рецензия это ровно та роль, которую принцип и оставляет человеку, только вы делегировали её другой модели, и получилось лучше, чем у меня.

Но это не индульгенция. Принцип объясняет, где проходит граница ответственности, и не объясняет, почему черновик не может быть лучше. Из ваших 17 пунктов часть относится к экспертизе, которой у шаблона и не должно быть, а часть к банальным пробелам структуры: нет номера договора, нет раздела уведомлений, не указано количество экземпляров, не привязана точка отсчёта сроков. Вот это конвейер обязан закрывать сам, и не закрывает. Забираю в работу.

По 27B в свободном цикле. Вот это для меня самое интересное, и тут я уточню свой же тезис. Ваша задача была исследовательской: прочитать, разобраться, вернуть текст. Ошибиться в ней почти безопасно, попыток не ограничено, результат оценивает человек прямо в процессе, семь минут на размышление никого не смущают. Мой сценарий другой: артефакт производится без надзора, время измеряется секундами, сбой видит клиент. В этом режиме свободный цикл на слабой модели ведёт себя сильно хуже, и цифры в статье именно про него.

Но вашего главного наблюдения это не отменяет. Год назад 27B не расковырял бы SPA за четыре минуты. Если такие модели станут стабильными и в производственном режиме, преимущество жёсткого конвейера сжимается, и обороняться придётся не структурой, а слоем проверки результата. То, что ваша рецензия ценнее сгенерированного договора, это тот же сигнал с другой стороны: производство документа дешевеет, проверка дорожает.

За «этой зимой» отдельное спасибо, приму к сведению.

Год назад 27B не расковырял бы SPA за четыре минуты. 

Да, именно это я и пытался показать, что локальные небольшие модели за последнее время существенно догнали большие модели общего назначения. При правильной настройке и использовании они показывают такой же или лучший результат.

Стоит учитывать это уже сейчас и адаптировать бизнес модель.

Пересчитала две строки DeepSeek V4 в лидерборде на цену за 1K токенов: прямой API дает 1,32 ₽ на 1,9K, то есть 0,69, а Yandex Cloud — 2,47 ₽ на 3,5K, это 0,71. Тариф практически одинаковый, расходится сам счетчик токенов — в 1,8 раза на одной модели внутри одного конвейера, и разными лимитами с нагрузкой на инференс это не объясняется: время — да, объем промпта нет. Остаются два варианта: либо в облачную строку попадают токены ретраев и системной части, либо через хвост фолбэков в прямой API уходят задачи попроще, и тогда разброс в 35 раз меряет заодно разную нарезку задач по строкам, а не только прайс. Вы сверяли состав задач в этих двух строках — хотя бы доли Excel и лендингов?

Пересчёт верный, спасибо. Добавлю цифры по всем шести строкам в ₽ за 1K токенов: V3.2 напрямую 0,09, Qwen3-235B 0,65, V4 напрямую 0,69, V4 в облаке 0,71, Alice 0,87, YandexGPT 5 Pro 1,23.

Сразу признаю следствие: фраза про разброс «почти в 35 раз» в статье некорректна. По тарифу разброс около 13 раз, остальное это разный объём токенов на задачу.

И есть третья причина, которой в вашем списке нет. В конце августа DeepSeek заметно поднял тариф, так что внутри трёхмесячного окна часть задач посчитана по старой цене, часть по новой. Для строк с n = 18 и n = 44 это критично: там вполне может быть цена, которой сегодня уже нет. Буду пересчитывать историю по актуальному прайсу, иначе колонка отвечает на вопрос «сколько это стоило когда-то».

По вашим двум гипотезам: часть проверяется прямо на странице любого забега. В каждом прогоне открывается лог запросов к модели: число вызовов, сколько байт ушло и сколько вернулось, время по этапам. Содержание запросов я не показываю, там устройство конвейера, а вот объёмы и количество вызовов открыты. Так что гипотеза про ретраи и системную часть проверяется без меня, на любой паре забегов.

Чего на странице действительно нет, так это разреза лидерборда по типам задач. Доли Word, Excel и лендингов в двух строках V4 я посмотрю и выложу отдельно: вы правы, что при 18 задачах один лендинг двигает среднее по токенам заметно, и без выровненных выборок колонка стоимости сравнивает заодно и нарезку задач.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации