
Последние несколько лет за развитием генеративного ИИ было удобно следить как за спортивной таблицей. OpenAI выпускала GPT-4, Google отвечала Gemini, Anthropic показывала новую Claude, затем начинался следующий круг. Каждая компания приносила набор бенчмарков и объясняла, где её модель теперь первая.
В 2026 году эта логика начала ломаться. Не потому, что модели перестали становиться мощнее. Наоборот, 1 сентября Anthropic выпустила Claude Fable 5.1, новую топовую модель для программирования и сложной интеллектуальной работы. Проблема в другом: возможность построить более сильную модель больше не означает, что большинство клиентов захотят использовать её для большинства задач.
Financial Times недавно обратила внимание на показательный пример. Fable 5 вышла 9 июня 2026 года как одна из самых мощных моделей Anthropic, но спустя примерно два месяца на неё приходилось около 11% расходов на продукты Anthropic среди корпоративных клиентов, которых отслеживает Ramp.
Здесь важно уточнение. Это не 11% всей выручки Anthropic, а показатель внутри конкретной выборки корпоративных расходов. Кроме того, первоначальный запуск Fable был прерван: 12 июня доступ к модели отключили из-за американских экспортных ограничений, а глобальный релиз восстановили 1 июля. Поэтому эту цифру нельзя использовать как идеальное измерение спроса.
Но сама тенденция гораздо интереснее конкретных 11%. Компании всё чаще выбирают более дешёвые модели, если дополнительное качество frontier-модели не влияет на бизнес-результат.
Если посмотреть на развитие LLM с 2022 года, становится видно, что рынок пришёл к этому не внезапно. За четыре года индустрия постепенно перешла от идеи «одна большая модель должна уметь всё» к системам, где вычислительная мощность распределяется в зависимости от сложности задачи.
2022–2023: главным параметром был интеллект
30 ноября 2022 года OpenAI запустила ChatGPT. Крупные языковые модели существовали и раньше, но именно ChatGPT превратил LLM из исследовательской технологии в массовый продукт. Улучшение модели теперь можно было почти сразу показать миллионам пользователей.
14 марта 2023 года вышла GPT-4. OpenAI продемонстрировала заметный скачок на академических и профессиональных тестах. Например, в симуляции американского bar exam GPT-4 оказалась примерно в верхних 10% результатов, тогда как GPT-3.5 находилась около нижних 10%. Модель также получила возможность работать с изображениями вместе с текстом.
GPT-4 быстро стала точкой отсчёта для всей индустрии. Конкурентов оценивали прежде всего по тому, смогли ли они приблизиться к её уровню или обойти её на отдельных тестах.
Но уже в 2023 году стало понятно, что одной характеристики «умнее» недостаточно.
Anthropic начала конкурировать размером контекста. Claude получила окно в 100 тысяч токенов, а Claude 2 закрепила это направление. Модель могла работать с сотнями страниц текста за один запрос, что делало её удобной для анализа больших документов и кодовых баз даже без абсолютного лидерства на всех бенчмарках.
В декабре Google представила Gemini 1.0 сразу в трёх вариантах: Ultra для наиболее сложных задач, Pro для массового использования и Nano для работы непосредственно на устройствах.
Само это разделение оказалось не менее важным, чем результаты Gemini Ultra. Google фактически разбила понятие «лучшая модель» на несколько классов. Запускать Ultra там, где хватает Pro или Nano, было просто невыгодно.
2024: одной шкалы «умнее или глупее» больше нет
В феврале 2024 года Google представила Gemini 1.5 Pro. Здесь важен уже не только прирост качества, но и архитектура. Модель использовала Mixture-of-Experts: вместо одинакового задействования всей сети на каждом запросе система активирует подходящие для конкретных данных группы экспертов.
Одновременно Google резко увеличила контекстное окно. В закрытом превью Gemini 1.5 Pro могла работать с контекстом до миллиона токенов, при этом по качеству компания сравнивала её с более крупной Gemini 1.0 Ultra.
Задача разработки постепенно менялась. Важно было не просто построить более крупную модель, а получить нужный уровень качества эффективнее.
В марте Anthropic выпустила Claude 3 в трёх вариантах: Haiku, Sonnet и Opus. Компания прямо разделила модели по балансу интеллекта, скорости и стоимости. Opus предназначалась для максимально сложных задач, Sonnet занимала середину, Haiku оптимизировалась под скорость.
Сегодня такая линейка кажется стандартной, но по сути именно здесь начал формироваться современный рынок: клиенту продают не одну лучшую модель, а разные классы вычислений.
В мае OpenAI выпустила GPT-4o. На текстовых задачах она работала примерно на уровне GPT-4 Turbo, но была быстрее и стоила через API примерно вдвое дешевле. Одновременно одна модель получила нативную работу с текстом, изображениями и аудио.
Почти одновременно Google показала Gemini 1.5 Flash, отдельно сделав акцент на более низкой задержке и стоимости. Pro оставалась мощнее, но для большого количества production-запросов Flash была экономически привлекательнее.
К концу 2024 года гонка уже шла сразу по нескольким направлениям: reasoning, контекст, мультимодальность, latency, стоимость API и работа с инструментами. Фраза «модель A лучше модели B» без указания конкретной задачи становилась всё менее содержательной.
Осень 2024 года: интеллект становится вычислительным бюджетом
Серия OpenAI o1 добавила ещё одну переменную. Вместо того чтобы полагаться только на способности, полученные во время обучения, reasoning-модели начали тратить дополнительные вычисления непосредственно во время решения задачи.
Практическое следствие было важнее самого термина reasoning. Стоимость ответа теперь зависела не только от размера модели, но и от того, сколько вычислений имеет смысл потратить на конкретный запрос.
Одновременно OpenAI выпустила o1-mini, оптимизированную для STEM-задач и существенно более дешёвую, чем o1-preview.
Архитектура AI-продукта стала выглядеть сложнее, чем «запрос отправляется в LLM». Простую классификацию можно выполнить небольшой моделью. Сложную математическую задачу отправить reasoning-модели. Для актуальной информации подключить поиск. Агентная задача может несколько раз вызывать модель, работать с инструментами и перепроверять результат.
Для бизнеса становится важна стоимость всей этой цепочки, а не место одной модели в лидерборде.
Январь 2025 года: DeepSeek делает цену частью frontier-гонки
20 января 2025 года DeepSeek выпустила R1. Компания заявила результаты на уровне OpenAI o1 в математике, программировании и reasoning-задачах, открыла веса модели под MIT License и описала масштабное использование reinforcement learning на этапе post-training.
API при этом стоил $0,55 за миллион входных токенов без попадания в кеш и $2,19 за миллион выходных.
Значение R1 было не в том, что DeepSeek внезапно «победила OpenAI», как это часто подавалось в новостях. Модель резко усилила давление на cost-performance frontier. Если сопоставимый класс reasoning можно получить заметно дешевле или развернуть на открытых весах, владельцам закрытых моделей становится сложнее продавать только максимальное качество без учёта стоимости эксплуатации.
Для корпоративного рынка эта разница особенно важна. Пользователь обычного чат-бота может не задумываться, сколько стоил ответ. Компания, которая обрабатывает миллионы или миллиарды токенов, считает inference, latency, caching, rate limits и повторные вызовы. Дополнительное качество имеет смысл только тогда, когда оно оправдывает дополнительные расходы.
2025 год: OpenAI ставит router между пользователем и моделью
Один из самых показательных поворотов произошёл в августе 2025 года с GPT-5.
OpenAI описала GPT-5 уже не просто как одну модель, а как unified system. В неё входили быстрая модель для большинства запросов, более мощная reasoning-модель для сложных задач и real-time router, который выбирал между ними в зависимости от сложности запроса, необходимости использовать инструменты и пользовательских инструкций.
Это меняет саму постановку задачи. Раньше пользователь или разработчик выбирал модель. Теперь система должна сначала определить, сколько вычислительных ресурсов стоит потратить на конкретный запрос.
Упрощённо такой router можно представить так:
def route(request): complexity = estimate_complexity(request) tools = detect_required_tools(request) risk = estimate_failure_cost(request) if complexity == "low" and not tools: return fast_model if complexity == "medium": return standard_model if complexity == "high" or risk == "high": return reasoning_model return standard_model
В реальных системах факторов больше. Router может учитывать стоимость токенов, длину контекста, latency budget, доступность конкретного провайдера, тип данных, прошлое качество ответов и необходимость fallback.
Но общий принцип тот же: frontier-модель перестаёт быть default и становится одним из ресурсов внутри системы.
Это, пожалуй, важнее очередного первого места в benchmark. Даже OpenAI, один из главных участников гонки за максимальный интеллект, пришла к архитектуре, где нет смысла отправлять каждый запрос самой мощной модели.
2026: платить за максимум нужно далеко не всегда
К 2026 году особенно хорошо видно, насколько большой стала разница между классами моделей.
Claude Sonnet 5 стоит $2 за миллион входных и $10 за миллион выходных токенов. На другом конце линейки находится Fable 5.1 с ценой $10 и $50 соответственно.
Fable нужна там, где дополнительная вычислительная мощность действительно меняет результат: в сложном программировании, длительной агентной работе, научных задачах и больших исследованиях.
Но использовать её для классификации обращений, извлечения данных из документов или переписывания короткого текста экономически бессмысленно, если Sonnet справляется достаточно хорошо.
Показательно и то, как сегодня анонсируются сами frontier-модели. В релизе Fable 5.1 Anthropic рассказывает не только о новых результатах на тестах, но и о снижении стоимости cache reads на 75%. По оценке компании, это может уменьшать стоимость типичных workload примерно на четверть, а сильно агентных сценариев ещё заметнее.
То есть даже релиз самой мощной модели теперь приходится объяснять через экономику её эксплуатации.
На этом фоне данные Ramp, на которые ссылается Financial Times, выглядят логично. Компании не отказываются от frontier-моделей. Они просто перестают использовать их там, где более дешёвая система выдаёт достаточный результат.
Вопрос меняется с «какая модель лучше?» на «какая минимальная модель достаточно хороша для этой задачи?»
На смену лидербордам приходит оркестрация
Особенно хорошо этот переход видно на примере Perplexity. Компания делает ставку на multi-model orchestration: разные модели используются внутри одной системы и получают те части работы, для которых подходят лучше.
В 2026 году Perplexity также развивает Model Council. Один запрос может параллельно отправляться нескольким моделям, после чего отдельный слой сравнивает ответы и формирует итоговый результат.
Здесь идея «выбрать одну лучшую LLM» уже практически исчезает. Важнее построить систему, которая умеет правильно распределять запросы.
Упрощённая архитектура выглядит примерно так:
Запрос ↓ Классификация ↓ Router ├─ быстрая дешёвая модель ├─ reasoning-модель ├─ модель с большим контекстом ├─ поиск / RAG / инструменты └─ дополнительная модель для проверки ↓ Синтез результата ↓ Ответ
В production именно этот слой становится всё важнее. Нужно решить, какие запросы требуют дорогого inference, когда включать reasoning, сколько контекста передавать, где использовать кеш, когда переключаться на другого провайдера и какие ответы стоит дополнительно проверять.
Хорошая оркестрация может влиять на стоимость и качество продукта сильнее, чем очередная замена одной frontier-модели на другую.
Так гонка закончилась или нет?
На исследовательском уровне нет. OpenAI, Google, Anthropic, xAI, DeepSeek и другие компании продолжат выпускать более сильные модели. Frontier по-прежнему важен: именно там появляются возможности, которые позднее становятся дешевле и переходят в массовые модели.
Заканчивается другая гонка: попытка использовать одну максимально мощную модель как универсальный ответ на все задачи.
В 2023 году такой подход ещё выглядел логично. GPT-4 заметно превосходила предыдущее поколение во многих сценариях, поэтому переход на неё давал понятный выигрыш.
К 2026 году рынок раздробился. Есть быстрые модели, reasoning-модели, системы с огромным контекстом, open-weight решения, специализированные модели и архитектуры, которые автоматически переключаются между несколькими вариантами.
Поэтому позиция в одном benchmark всё хуже описывает реальную ценность модели. Для production гораздо важнее соотношение качества, стоимости и задержки.
Именно поэтому публикация Financial Times интересна не судьбой конкретной Fable 5. Она фиксирует момент, к которому рынок шёл несколько лет: максимальный интеллект остаётся ценным ресурсом, но использовать его на каждом запросе больше нет смысла.
Следующий виток может оказаться вообще не про LLM
Пока AI-компании учатся экономнее распределять запросы между моделями, в Сингапуре развивается куда более необычный эксперимент.
NUS Medicine вместе с оператором дата-центров DayOne и австралийской Cortical Labs работают над прототипом Biological Data Centre. В качестве одного из вычислительных элементов там исследуют wetware: живые нейроны, выращенные из стволовых клеток и подключённые к микроэлектродным массивам.
Пока это исследовательская установка, а не конкурент GPU-кластерам. Поэтому называть её «дата-центром на человеческом мозге» было бы сильным преувеличением.
Но сам эксперимент интересен уже тем, насколько далеко разошлись направления развития вычислений. Пока одна часть индустрии учится выбирать между GPT, Claude и Gemini, другая проверяет, можно ли вообще использовать живые нейронные культуры как элемент вычислительной инфраструктуры.
Как устроен CL1, зачем дата-центру живые нейроны и что именно сейчас строят в Сингапуре, разберу отдельно в следующей статье.
Попробовать разные модели на одной задаче
В SYNTX.AI можно сравнить GPT, Claude, Gemini, DeepSeek, Qwen, Perplexity и другие модели в одном интерфейсе, не переключаясь между разными сервисами.
Для читателей Хабра действует промокод CTRLAI на скидку 20% на любой тариф.
Источники
Financial Times: Anthropic's best AI model struggles to attract users as cheaper tools thrive
OpenAI: GPT-4 Research, GPT-4o, o1, GPT-5 System Card
Anthropic: Claude 3 family, Claude Sonnet 5, Claude Fable 5, Claude Fable 5.1
Google DeepMind: Gemini 1.0, Gemini 1.5 Pro, Gemini 1.5 Flash
DeepSeek: DeepSeek-R1
Perplexity: Multi-model orchestration, Model Council
NUS Medicine: Biological Data Centre prototype in Singapore

