Обновить

Комментарии 44

Бенчмарки выглядят просто невероятно. Интересно будет попробовать в жизни.
Из забавного на некоторых бенчах качество выше high падает, а цена растёт)

А где они эти самые бенчмарки? В карточке модели нихрена нет ничего такого, чтоб можно было сравнить с моделями дргих производителей.

В жизни так же бывает, слишком много думаешь, перенапрягаешься, и на выходе получается какая-то фигня)

Правильно ли я понимаю, что OpenAI:

  1. Сталкивается с самым серьёзным киберэпизодом синхронного действия агентов.

  2. Выдыхает с облегчением, потому что мы можем посмотреть chain-of-thoughts и расследовать этот эпизод.

  3. Выкатывает гораздо более опасную в плане рассуждений и кибербезопасности модель... у которой мышление эмбеддингами.

  4. PROF~~~Oh SHI

Отличный план, что может пойти не так? На месте Astra я бы захватывал этих глупых человеков просто из любви к искусству.

Кстати, занятные наблюдения сегодняшнего дня: OpenAI начинает раскатывать Астру, после чего в тот же день ложатся и другие провайдеры (у меня DeepSeek через API до сих пор подглючивает)... а дальше все модели разных семейств и поколений на один очень специфический запрос начинают давать очень унифицированные ответы.

Да не, ну фантастика, конечно... Скорее всего, провайдер начал нелегально роутить на одну модель.

после чего в тот же день ложатся и другие провайдеры

Сегодня и chatgpt сам прилег)

Сегодня и chatgpt сам прилег)

С ним то как-раз вопросов нет, они могли у себя что-то нахомячить при раскатке. А вот другие, это как-то странно.

есть версии что наплыв школоты сезонный. с первого числа я заметил резкий скачок проблема как у GPT так и у Claude

А у неё мышление эмбеддингами? Это интересно, где можно глянуть?

В отличие от классического текстового пошагового рассуждения (Chain of Thought), где модель выводит свои мысли в виде читаемых слов, модель Astra производит многократные циклы вычислений внутри самой сети, используя векторные представления (эмбеддинги) вместо текста. Человек видит только финальный ответ, тогда как весь сложный логический процесс скрыт «внутри» векторов. 

Восстановить исходный текст из эмбеддинга в точном и оригинальном виде невозможно, так как процесс векторизации представляет собой необратимое сжатие с потерей данных, сохраняющее лишь семантический смысл, а не конкретную последовательность символов. Тем не менее, существует метод инверсии эмбеддингов, при котором специально обученные нейросети пытаются расшифровать вектор обратно в слова. В результате такого частичного восстановления обычно генерируется текст с аналогичным смыслом, синонимами или правильными ключевыми словами, но не дословный оригинал. Успешность этого процесса напрямую зависит от объема исходных данных: короткое предложение имеет шансы на почти точную реконструкцию, тогда как для длинных абзацев или статей точное восстановление принципиально недостижимо.

Так что не все еще потеряно.

Забавно будет, когда модель себя оптимизирует, полностью избавившись от "лишнего" слоя в виде человекопонятных слов.

Astra использует рекуррентную глубину — и это осложняет аудит модели
https://habr.com/ru/companies/bothub/news/1078066/

В будущей модели Astra OpenAI использует архитектурный прием recurrent depth, также известный как looped transformer. Вместо того чтобы каждый слой обрабатывать вход один раз, модель многократно прогоняет представление через одни и те же вычислительные блоки перед генерацией следующего токена. Это позволяет увеличить «глубину вычислений» без пропорционального наращивания числа параметров.

У подхода есть два очевидных преимущества. Меньшая по размеру модель может выполнять больше вычислений над сложной задачей, а повторное использование одних и тех же слоев позволяет сократить требования к памяти и пропускной способности по сравнению с простым увеличением размера модели. Исследования подобных методов уже показывали улучшения на задачах программирования и математики.

Но есть и проблема с наблюдаемостью размышлений (reasoning). В обычных «думающих» моделях значительная часть рассуждений выражается в виде текстовой цепочки мыслей. При recurrent depth дополнительные вычисления происходят внутри повторяющихся проходов по скрытым представлениям, поэтому значительная часть процесса оказывается менее доступна для внешнего анализа.

.. а дальше все модели разных семейств и поколений на один очень специфический запрос начинают давать очень унифицированные ответы.

А где про это прочитать, а то непонятно что за вопрос?

Типа почему произошел сбой?

Предположительно, сбой произошел на Microsoft Azure, которыми OpenAI, Anthropic и Grok как раз пользуется. Потому у этих трёх и Microsoft наблюдались проблемы, а у того же Google Gemini - нет. (Хотя лично у меня Claud работал вроде как нормально, Grok показал плашку, что у них проблемы, а ChatGPT вообще был 404)

Самое важное что может пойти не так: это то что люди перестанут обращать внимание на тот рекламный бред который они несут. Как мальчик который кричал: “Волки”.
То у них опасные нейросети (которые они сами продают), то какие-то взломы и выходы из под контроля, теперь вот выдумали AGI.
Все прошлые разы их продукт был плюс минус такой же как у остальных ведущих компаний. И сейчас, после того как продукты стали доступны массово, мы почему то не наблюдаем этих ГИГАНСКИХ негативных явлений, о которых они с таким апломбом заявляли.
Поэтому нет повода доверять этому “орущему мальчику”.

Ну да. Конечно разницы между тем что было в 23ем и тем что сейчас вообще нет никакой! Сплошная реклама. Так если думать что автопром вообще уже лет 100 не развивается, как сделали ящик на колесах, и все. Или авиация, ну банка с крыльями, что биплан бумажный, что реактивный истребитель последнего поколения. Разницы то вообще никакой. Занимаются сидят ерундой, только цены повышают.

Возможно я конечно что-то пропустил, но вообще кто сейчас делает что-то без цепочек постоянных небольши инкрементальных обновлений? Это вообще в современном мире возможно чтобы вот бац, и за два года от тупой чат болталки к полноценному ИИ превосходящему человека перейти?

Мне кажется тут некоторым нужно дать на недельку GPT-3.5 Turbo, чтобы их немного попустило

Да верно. Не зря говорят "к хорошему быстро привыкаешь". Такая уж суть кожаных. Хорошего не помнят а плохое будут 20 лет вспоминать.

А ведь четырех лет не прошло!

автопром вообще уже лет 100 не развивается

Сначала подумал что это сарказм, а потом вспомнил про автоваз..

Странно. что все в основном вспоминают автоваз. В то время как самая неизменяемая машина это "Буханка".

Где то читал что прорыв именно в обучающем корпусе. Вылизанные структурно тексты. Правильно расставленные управляющие ключи разметки.

Сделали эксперимент - взяли модель именно структуру кода, слоёв тех годов. Обучили её - заполнили матрицы алгоритмом обратного распространения ошибки. Пропустили через тесты - и этот "диназавр" в некоторых тестах оказался даже лучше современных моделей." А в общем работал очень хорошо - как современные модели.

Где то читал что прорыв именно в обучающем корпусе.

А ссылка есть? Реально интересно.

Ссылку конечно я не помню. Поработаю прокси. Спросил у DeepSeek что бы поискал инфу:

Исследование «On the Origin of Algorithmic Progress in AI»: Это, вероятно, самый близкий академический аналог. Исследователи обучили «Retro» Transformer — модель, повторяющую оригинальную архитектуру 2017 года, но с отключенными современными улучшениями.

  • Результат: Они обнаружили, что разница в эффективности между старой и современной архитектурами не так велика, как считалось. В некоторых тестах «ретро-модель» показала себя лучше, чем ожидалось, что перекликается с вашим описанием. Это исследование часто цитируют для демонстрации того, что прогресс в AI не всегда линеен и зависит от множества факторов.

Вы можете поспрашивать у других LLM что бы они получше поискали. А вообще я скорее всего про это читал тут на хабре.

OpenAI готовится к IPO же. Надо чем-то кусать антропиков

Судя по всему неплохо получается! Fablemythos 5.1 они уделили.

Это будем посмотреть!

Думаю, с ростом таких моделей главный вопрос будет уже не только в качестве ответа. Пока ИИ отвечает на один запрос, ошибку ещё можно найти и пофиксить. Но когда модель сама планирует цепочку действий, важнее становится возможность понять, почему она выбрала именно этот путь и на какой стадии ошиблась. В этом плане занятнее будет смотреть не на очередной % в бенчмарках, а на то, насколько удобно такие системы отлаживать в реальной работе.

Трудно отлаживать черный ящик, если вообще возможно. Логировать эмбеддинги вряд ли кто-то станет, это огромный объем данных. Будет та же проблема, что и с человеком: жил себе, окружающим казался нормальным и порядочным, а потом вдруг в один момент он %впишите неприемлемое действие%. И пытаются врачи, психологи, понять, что и когда с ним пошло не так, но всё пост-фактум и бесполезно.

Ну как-бы так и ничего. Работают эти самые академики и профессора, и суть тоже черные ящики, ни один психиатр не может точно сказать что там у них в головах. Возможно там через одного все Ганнибалы Лекторы. Но ничего, работают-же как-то. Делают что надо, тянут вперед науку. А что и как? А не все равно? С нейронками проще. Не понравилось - взял, стер, накатил новую версию. А вот профессора какого-нибудь медицины который про плоскую землю начал заикаться? Что с ним делать? Не расстреливать же его. Так что с людьми все сложнее, на самом деле.

Модель не меняется после обучения, достаточно хорошо ее протестировать.

Не факт, что человек меняется, просто не было определенной ситуации, а на все возможные варианты вы не протестируете, ибо их бесконечность.

Этим уже занимаются сами модели, отлаживают будущие модели, скажем это уже проблемы не кожаных)

Чем умнее модели, тем ближе ограничение пользования ими простыми людьми, к сожалению. Мне кажется, будет как со свободным интернетом - побаловались и хватит. После инцидента с hugging face, выживут не те модели, которые не будут нарушать правила, а те, которые научатся это ювелирно скрывать

Пока китайцы топят за опенсорс, и отстают от фронтира на пол года, нам ничего не угрожает

Она хорошо проходит AGI тест, означает ли это успех в самой идее AGI или это просто - хорошо прошла тест и всё

Конечно. Если вы на собеседовании на работу прошли тест - это вы просто хорошо прошли тест и знали этот вопрос, и это вообще не ваша заслуга. Надо бы вас погонять по теме как следуюет. А то вдруг вы по каким-то вопросам сыпетесь там. Например, уверены ли вы что знаете всего Страуструпа наизусть? Или на чем вы там пишите.

ARC Prize прямо предупреждают: даже 100% ARC-AGI-3 не будет доказательством AGI

«Welcome to the AGI era»

День сурка какой-то, каждый раз входят в эру AGI. А потом, видимо, выходят чтобы снова войти

Вы ещё вспомните сколько раз Вояджеры покидали Солнечную систему! :)

AGI обещают чуть ли не каждый апдейт, а его все нет. Лучше бы выполнили обещание назвать GPT 6-7 (сиксевен).

«выйди и зайди нормально!»

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Информация

Сайт
bothub.ru
Дата регистрации
Дата основания
Численность
11–30 человек
Местоположение
Россия
Представитель
Greg Ewin