Обновить
4

Пользователь

1
Подписчики
Отправить сообщение

Такого заявления Anthropic не существует.

Соглашусь, вышла ошибка. Заявление это сделал Майкл Крациос, а не Anthropic. Но сути это почти не меняет.

С чего бы им этого не делать?

Делают, кто же это отрицает. Но утверждать, что только на ней держатся все китайские модели - это отборный копиум. К масштабам дистилляции и влияние на конечные результаты тоже есть вопросы.

Потому что китайские модели живут дистилляциями с американских

Рассказы про "дистилляцию" - не более чем залив копиума для инвесторов, которые с каждым большим релизом от китайцев начинают знатно так паниковать. Да, дистилляция дает определенный прирост, но в общей картине он не настолько значим.

ладно-ладно, я вам помогу по статьям: раздватричетыре.

Разве что 3 статья является хоть сколь-нибудь внятным аргументом, но и даже тут есть нюансы. Остальные же источники - это что-то на уровне заявления Anthropic, что Kimi K3 с Fable 5 дистиллировали (и все равно, что там по времени всё это даже близко не сходится; главное инвесторов успокоить).

Всего лишь постоянное улучшение capabilities новых передовых моделей

"Постоянное улучшение способностей" - это когда Сёма Альтманов орет "Spud - это AGI!", "Astra - это AGI!" месяцами, а на выходе получаем унылые +4% на бенчмарках (и ещё хорошо, если без рандомных деградаций и проценты не забенчмакшены)?

прорывные результаты от них во всё новых областях.

"Прорывные результаты" - это "мы подворовали чужую работу" или "мы закидали гигатонной вычислений все что можно, выкинули 999 результатов и оставили 1"?

Но вот этот пафос "мы уже вот прям щас создали вундервафлю" немного несвежий.

Правильней было бы сказать "ОЧЕНЬ несвежий". OpenAI ещё с середины прошлого года постоянно рассказывают, что у них в недрах лаборатории есть супер-модель, которая будет выпущена на публику вот чуть ли не завтра. Штук 4-5 было таких моделей, и все они спустя пару недель/месяцев обещаний либо испарялись без следа, либо даже близко не оказывались каким-то супер-прорывом.

Хотя кто ж знает, быть может, настал тот самый момент, когда OpenAI все-таки не обманут и сдержут свое обещание.

На следующей неделе генеральный директор OpenAI Сэм Альтман проведет серию закрытых брифингов для представителей администрации США и законодателей. По данным Bloomberg, речь пойдет о следующем поколении моделей OpenAI и их потенциальном влиянии на рынок труда и вопросы безопасности. 

Вот эти вот утечки напоминают мне про разгоны, которые были в марте. Вот вышел GPT-5.5, который и есть Spud, но как-то обещанной супер-мощности в нём не наблюдается.

закрытое тестирование новой модели продолжается уже около двух с половиной месяцев

У OpenAI есть прямо загадочная черта: в глубинах лаборатории они совершают один прорыв за другим, которые позволяют создавать мегаумные модели, но почему-то все эти прорывы за километр обходят публичные релизы. Вот и в этот раз, судя по всему, GPT-5.6 ничего не перепало от супер-умной модели и новых прорывных методов.

Еще пишут, что GPT-6 якобы с первой попытки нашла контрпример к гипотезе Якоби. Видимо пиарщики OpenAI пропустили, что Anthropic уже сообщили об обнаружении такого контрпримера с помощью модели Fable.

Прямо-таки скопировали Anthropic с их "Mythos тоже смог решить задачу Эрдёша о единичных расстояниях!!!".

Как считаете, это и правда совпадения или все-таки маркетинговая стратегия?

Самое интересное, что правило "Чем больше OpenAI кричат о прорывах, тем хуже идут их дела на самом деле" работает как часы. Будет удивительно, если в этот раз все эти громкие крики окажутся не разведением хайпа ради хайпа.

пока похоже на рекламный рассказ в стиле "у нас есть ТАКИЕ приборы, но мы их вам не покажем"

Так OpenAI уже почти год как крайне активно крутят тему того, что у них в глубинах лабораторий вот уже есть сверхсекретная нереально умная модель, которую по тем или иным (зачастую крайне мутным) причинам нельзя выпустить публично. То "Экспериментальная модель, взявшая золото на IMO", то "Garlic/Shallotpeat", затем ещё две "Внутренние модели" (или речь шла об одной и той шла, из анонсов OpenAI неясно), то "Spud" - и все эти модели в итоге испарились без следа (кроме, быть может, "Garlic", хотя с ним тоже мутно дело). Конечно, может быть в 6 раз окажется, что OpenAI не разводит хайп и на самом деле заимели что-то прорывное, но лично я в этом сомневаюсь.

Либо же дело в том, что Anthropic очень сильно испугались релиза GPT-5.6 и решили проплатить астротурфинг на тему того, что GPT-5.6 вообще тупой и сильно уступает Fable 5. Как-то уж многовато подобного формата историй и в целом странного негатива в отношении GPT-5.6 всплыло за последние два дня (хотя, может, это мне только кажется).

Так Anthropic уже который год на публику кричат про необходимость регулирования злого и опасного ИИ, при этом выставляя себя хорошими парнями, которые вкладывают колоссальные силы в ИИ-безопасность. Думали, что регулирование навставляет палки в колеса конкурентов и обойдет самих Anthropic, но реальность оказалась такой, какой оказалась.

Проблема в том, что именно Anthropic сильнее всех проталкивали тему того, что ИИ невероятно страшен и опасен (сам по себе или в неправильных руках), и выставляли себя этакой организацией, которая этими самыми катастрофическими рисками очень озабочена. Кажется, что реальные намерения здесь крайне очевидные.

Тут весь источник - какие-то мутные типа "сливы". Потому что есть, что нет - разница отсутствует.

Вы хотя бы статью почитали перед публикацией. Единственная релевантная информация:

The San Francisco-based company had installed about half a dozen staff within the NSA as so-called forward-deployed engineers to guide the use of the technology and customise models for specific applications, two people familiar with the arrangement said.

It remains unclear whether Anthropic’s engineers are assisting the NSA in active operations. However, one person close to the situation said Mythos would be useful for infiltrating the networks of nations such as China or Iran.

Проще говоря, вся новость основывается на очень мутных словах какой-то мутной личности. Выглядит как унылый пиар, нежели что-то интересное.

Где здесь проблема инфраструктуры и экспоненциального роста, а где следствие некачественного кода написанного нейронкой?

Ну да, это точно не проблема некачественного кода. Ведь продукты от Anthropic славятся своим полным отсутствием багов, никто из пользователей не жалуется на различные поломки приложений от них, а количество issue у Claude Code близко к нулю. Или же всё-таки нет?

Ну факты в Firefox

А кто есть кроме них? В то время как на стороне скептиков имеются примеры cURL (почти ноль результатов), Palo Alto Networks (результаты хорошие, но там использовался не только Mythos; вклад ИИ в целом описан мутно; кол-во найденных уязвимостей тоже не самое большое), WolfSSL (неплохой вклад от Mythos, но далеко не настолько огромный, как в других проектах). В качестве примера "фактов" можно добавить Cloudflare и Google, но с ними тоже не все до конца понятно

там возможно не Mythos, а другие модели, но дела это не меняет

Если модели открытые, то дела как раз очень и очень сильно меняются.

Написано мол это будет mythos-class models, то есть не сама мифос, а какая-то облегченная версия что-ли

Разгадка тут куда проще, как мне кажется. Opus 4.8 уже по многим бенчмаркам находится на уровне (а иногда даже превосходит) Mythos; там же, где Opus хуже, отставание в большинстве случаев составляет порядка 3-5%.

Вероятнее всего, Anthropic забенчмаксит Opus 4.8 на эти самые проценты и через месяц-два выкатит какой-нибудь Opus 4.9/5.0, провозгласит его "Mythos-level model", и на этом всё. В другой сценарий верится слабо.

У Anthropic сейчас есть задачи поважнее: бенчмаксить модельки перед IPO. А на простых пользователей всем как обычно....

Из этого числа около 1,9 тыс. выявили сторонние компании в сфере кибербезопасности, свыше 1,7 тыс. были подтверждены, в том числе более 1 тыс. получили оценку высокой или критической степени серьёзности.

Эти результаты всё ещё находятся на стадии проверки. По оценкам Anthropic, на основании только текущих данных будет подтверждено около 3,9 тыс. критических и серьёзных уязвимостей. Поскольку сканирование продолжается, компания полагает, что число серьёзных уязвимостей может вырасти до 6,2 тыс.

Перевод, конечно, переврал все, что только можно переврать. Оригинальная статья говорит о том, что было найдено 23 тысячи потенциальных уязвимостей, из них 6202 имеют высокий или критический уровень. Из этих 6202 выбрали 1752 уязвимости и проверили вручную (самостоятельно или с помощью сторонних компаний, занимающихся кибербезопасностью). Получили, что 9.8% из них являются false positive, а среди остальных только у 62.4% правильно присвоен уровень серьезности. Отсюда сделали вывод, что, исходя из этой оценки, на момент написания статьи было найдено 6202 x 0.624 = 3870 уязвимостей высокого или критического уровня.

Да, у них там картинка с текстом не совсем стыкуются (отсюда, возможно, и ошибки перевода), но все равно не понимаю, как можно было так смысл вывернуть.

За месяц около 50 партнеров нашли более 10 000 багов высокой и критической степени в критическом софте

Просто напомню, что партнёры для поиска уязвимостей использовали почти все доступные модели. Как минимум Cloudflare, Palo Alto Networks, Microsoft и Oracle говорят об этом напрямую. Забавно получается, что 10000 уязвимостей - это результат совместной работы разных моделей (и, вероятно, не-ИИ методов), но нахождение всех этих уязвимостей пытаются приписать Mythos.

К слову, Palo Alto Networks нашли за месяц только 4 уязвимости высокой или критической степеней. В том же wolfSSL Mythos откопал 8 уязвимостей (супротив 14, о которых сообщили другие источники в тот же период времени). В случае cURL вообще печаль. Зато неназванные "партнёры" нашли сотни всяких серьезных уязвимостей. Это как?

еще 6202 — в open-source-проектах.

Во-первых, 6202 уязвимости нашли не за один, а за несколько месяцев. Во-вторых, просканировали "больше 1000 проектов" (в нашем случае это может значить что угодно, хоть 1500, хоть 2000 и т.д.). Т.е. это ~6.2 уязвимостей критической или высокой степени на проект (и это хорошо, если среди отсканированных не было слоповозов по типу OpenClaw). Где же "сотни критических уязвимостей"? Почему только "партнёры" (и то не все) находят такие конские количества?

Скепсис к самому Mythos в сообществе тоже есть. Две недели назад Дэниел Стенберг, лид и основной разработчик curl, опубликовал разбор работы модели на их коде: из пяти "подтвержденных уязвимостей" после проверки осталась одна, низкого уровня важности. Стенберг сформулировал прямо: "хайп вокруг этой модели в основном маркетинговый".

При этом после сканирования от Mythos было найдено как минимум 11 новых уязвимостей. Что ж, соотношение "1 найденный / 11 не найденных" неплохое, конечно.

Что ж, Anthropic всеми силами пытаются разогнать слоповозку перед IPO.

Хочешь сказать что opus 4.7 это забракованный 5.0?

Признаки по большей части косвенные:
- У Opus 4.6 cutoff date это Май 2025, у Opus 4.7 - Январь 2026. Т.е. скорее всего обновили претрейн, что обычно делают для крупных релизов.
- Изменения в архитектуре. Как минимум новый токенизатор, работает побыстрее Opus 4.6 (во всяком случае, так говорят Artificial Analysis). Да и жесткие просадки на MRCR v2 (задача на удержание длинного контекста) наводят на ту же мысль
- Anthropic обычно выпускают крупные релизы примерно каждые 4-5 месяцев. Opus 4.5 был в конце ноября 2025, так что Opus 5.0 ожидался где-то между концом марта и концом апреля.
- Некоторые приросты на бенчмарках выглядят слишком уж большими для 4.6 -> 4.7 обновления (номера версий подразумевают, что это обновление итеративное, с приличными, но небольшими приростами). В некоторых бенчмарках (по типу HLE) ещё следы совсем уж наглого benchmaxxing-а, будто бы пытались всеми силами выжать цифру побольше.

В общем, есть определенные основания полагать, что они зафейлили создание Opus 5.0, а зафейленную модельку подали как Opus 4.7.

Да не выгодно им делать публичный Opus 5.0 который будет конкурировать с их взломщиком.

Взломщик - это Mythos? С одной стороны, допускаю, что Anthropic реально могут не выпускать Opus 5.0, как минимум ради поддержания хайпа вокруг Mythos. С другой стороны, тот же Opus 4.7 имеет все признаки того, что он должен был быть следующим большим релизом.

В общем, сложно тут.

А вырезать из него дорого и долго

Из Opus 4.7 вроде как повырезали всякое, а ведь он вышел спустя ~2.5 месяца после Opus 4.6. Т.е. не сказать, что прямо долго.

Так итоговый ответ от модели - это 2 страницы все-таки. 125 страниц - это выжимка из CoT модели, там может быть достаточно много нерелевантного.

1
23 ...

Информация

В рейтинге
4 891-й
Зарегистрирован
Активность