Обновить

Что за зверь «internal OpenAI model» и почему DeepSeek догоняет OpenAI?

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели11K
Всего голосов 3: ↑3 и ↓0+4
Комментарии12

Комментарии 12

А что, собственно, непонятно? Есть модели, которые в разработке - это internal models. Есть модели, которые уже выпустили. Какая-то из моделей в разработке становится выпущенной. И сейчас у OpenAI есть следующая версия в разработке, которая решила Навье — Стокса. Никакой конспирологии тут нет.

Вопрос в том, насколько сильны эти модели, и являются ли они моделями следующего поколения, насколько доступные нам версии приближены к их возможностям. Ну и также здесь хочу показать, почему самые сильные модели не доступны публике, тк основная причина — это легкость дистилляции для конкурентов.

Вопрос в том, насколько сильны эти модели

В случае OpenAI ответ простой: вспомните, сколько раз они обещали выпустить ну нереально мощную модель, а потом либо сливались полностью, либо выпускали что-то крайне сомнительное (относительно изначальных обещаний). Astra, Spud (GPT-5.5), какие-то внутренние модели с февраля (видимо, GPT-5.4), "Garlic/Shallotpet" (с которыми вообще мутновато), "Экспериментальная модель, взявшая золото на IMO" (с лета 2025, до сих пор неизвестно что это было вообще) - все это обещали как лютый прорыв, который вот-вот выйдет, а на деле...

Так что крайне сомнительно, что у OpenAI есть какие-то внутренние модели, которые при прочих равных на голову сильнее публичных.

Ну факт остаётся фактом, Навье - Стокса они сделали. Да и в реальных задачах Астра реально лучше моделей годовалой давности.

Ну факт остаётся фактом, Навье - Стокса они сделали. 

Ну, как сказать "сделали". В лучшем случае - узнали, что есть подход, у которого имеются огромные шансы оказаться успешным, и залили туда гигатонну вычислений. В худшем - своровали работу и добили буквально последние шаги (да, это все ещё сложно, но уже на уровне, когда математики - например, Теренс Тао - после просмотра работы стали уверенными в том, что готовое решение скоро будет получено; это ещё до анонса от OpenAI).

Про другие нюансы промолчу.

Да и в реальных задачах Астра реально лучше моделей годовалой давности.

Годовалой - да, но прорыв-то обещали относительно GPT-5.6. А там уже ситуация сильно печальней, на уровне "Ну, оно получше работает, и на том спасибо".

Просто раньше они выпускали модели раз в год или около того. А потом просто стали выпускать обновления чаще. Это же нельзя ставить им в упрёк.

Я им ставлю в упрек только то, что они постоянно рассказывают истории про множество совершенных прорывов и каких-то нереально умных моделях, которые пока что сидят в лаборатории, но при этом вот-вот выйдут, а потом вместо этих "монструозных внутренних моделей" мы получаем что-то достаточно унылое.

Очень сложно оценить способности модели, пока её не попробовала широкая аудитория. Возможно, они даже недооценивали способности Астры, потому что ценник на неё можно было бы спокойно делать ещё выше - народ как с цепи сорвался. Так что эта ошибка в оценке работает в обе стороны.

Очень сложно оценить способности модели, пока её не попробовала широкая аудитория.

Никто не спорит, что оценка способностей модели - штука сложная и с кучей тонкостей. Но это не отменяет факта, что OpenAI прямо из всех щелей светились уверенностью. Впрочем, вспоминая легендарное "GPT-5 - это Звезда Смерти", есть подозрение, что дело совсем не в сложности оценки.

 Возможно, они даже недооценивали способности Астры, потому что ценник на неё можно было бы спокойно делать ещё выше - народ как с цепи сорвался. 

А кто конкретно сорвался? Я лично видел только бушевания всяких инфлюенсеров, и то, видимо, проплаченных (иначе сложно объяснить, почему они так пристали к 3D-моделированию - мало того, что способность нишевая, так ещё и OpenAI делали акцент на совсем других вещах). У большинства остальных реакция была от "Ну ладно, пойдет" до "Нафиг надо, остаюсь на GPT-5.6".

У OpenAI серверы были перегружены в первую неделю релиза, даже Sol отвечал не всегда. Кто-то в игры заставлял играть, кто-то в пэинте рисовать, кто во что горазд, во общем. Лично я пока не видел каких-то разочарованных возгласов.

Отличная статья, добавлю то, что осталось не до конца раскрытым.

Статья грамотно рассказывает про передачу распределений вероятностей от учителя к студенту, но не объясняет, почему это настолько усиливает обучение по сравнению с простым копированием текстовых ответов.

Лет 10 назад было проведено исследование, показавшее следующее: когда модель отвечает не просто “кот”, а выдает что-то вроде 90% кот, 8% собака, 2% все остальное, вот эти вторичные проценты оказываются самой ценной частью знания, потому что они говорят, на что обьект похож больше, а на что меньше.

Модель-студент, обученный на таком полном распределении, обобщает намного лучше, чем студент, которому дали только финальные правильные ответы. Именно поэтому дистилляция через логиты, как у Meta с Llama, качественно сильнее, чем дистилляция через обычный чат-API, где логиты никто не отдает.

DeepSeek и подобные компании вынуждены компенсировать отсутствие доступа к логитам Antropic или OpenAI количеством запрсов (миллионами).

Второй интересный момент: краже моделей через API тоже уже лет 10. В то время вышла другая статья про stealing machine learning models via prediction APIs, где показали, что можно восстановить чужую модель, просто наблюдая ее ответы без доступа к весам.

Тогда это все было про простые классификаторы, продававшиеся как облачный сервис, и там же родилась вся защитная механика, которую индустрия потом просто перенесла на языковые модели: лимиты запросов, водяные знаки, детекция подозрительно однородных паттернов трафика, honeypot-ответы для отслеживания утечек.

То, что Anthropic сейчас описывает как промышленные дистилляционные кампании с тысячами фейковых аккаунтов, это тот же самый класс атаки, что и десять лет назад, просто перенесённый на генеративные модели. Буквально, ничего нового за десятилетие, ну кроме того, что об этом начали писать.

По поводу internal models все банально. Компания тренирует новый флагманский чекпойнт и после того как основное обучение завершено проходит еще много месяцев внутренней работы: пост-трейнинг, RLHF, дообучение на размышления, проверка на безопасность, тесты на галлюцинации, оптимизация под стоимость и скорость, урезание до размера, который вообще можно масштабировать на сотни миллионов пользователей. Все это время у модели уже есть основные способности, грубо говоря интеллект уже внутри весов, но ее еще нельзя показывать наружу, потому что она не готова как продукт.

Спасибо за дополнение!

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации