Pull to refresh

Comments 23

О какой задаче идёт речь?

Вот это самое главное. Второе КАК было найдено решение с детализацией логических рассуждений и получение самого вывода. Если это LLM модель, то она предварительно была обучена (точнее самонастроена) по уже известным человеку тексту, информации и данным, а затем по тексту на входе формирует выход строго в соответствии с настройкой, оперируя корреляциями между своими параметрами и используя поисковые алгоритмы. Ничего сверх нового она придумать в принципе не сможет, так как её алгоритмика это не понятийные рассуждения на основе которых строятся логические выводы и которые присущи человеческом интеллекту.

извините, навеяло

— Робот класса «Буратино» не может нырять!

— Не может, а ныряет.

Ну вы же не специалисты...

Скорее всего потому что для обычных людей топовые математические задачи звучат как заклинание на эльфийском вперемешку с китайской грамотой.

Ну судя по описанию - там задача не топовая. В том смысле, что человек, который её придумал - заранее знал решение. И подгонял задачу под это конкретное решение - о чём, опять же, сказано прям прямым текстом.

Топовые задачи - это те, решения которых ещё неизвестны. Как, например, теорема Ферма не так уж и давно.

Рискну предположить что условие задачи на составление которой ушло 20 лет и решение занимает 13 страниц, будет скорее всего понятно только спецам с учёной степенью.

Теорема Ферма тут скорее исключение, несмотря на сложность решения - у неё условие понятно даже на школьном уровне.

Вот чтобы обойтись без предположений, и нужно было озвучивать условие) 20 лет на составление - ну это вряд ли каждый день. Это скорее промежуток времени между возникновением идеи и её окончательным воплощением. Ну у меня тоже есть задачи про которые могу сказать "решал 20 лет". Не придумывал, а решал. А сами задачи возникали из чисто практических соображений. И доступные мне ИИ их не решают.

Вот например: "вывести функцию, проходящую через 4 точки, при этом она должна быть монотонной и обратимой. Вычислительная сложность обратной функции должна быть такая же, как и у прямой".

потому что как только озвучат задачу она попадет в обучающую выборку. они засекречены ) их нет в инете и в этом вся суть

Т.е. ChatGPT от OpenAI решил задачу из бенчмарка, который финансируется OpenAI? И вот это еще:

OpenAI имеет эксклюзивный доступ ко всем 290 задачам уровней 1–3 и решениям 237 из них. Также у компании есть доступ к 28 из 48 задач Tier 4 и их решениям. Epoch AI сохраняет остальные как скрытый набор.

А остальные скрыты, типа как Epoch AI так говорит? Даже если так, непонятно, как они определяют термин "скрытый набор". Эту задачу ChatGPT видел впервые, или предыдущим версиям тоже предлагали условие для решения, но те не нашли? Если так, то условие нельзя считать скрытым. А если ты знаешь условие задачи и приходишь на экзамен повторно, то тут возникают некоторые вопросики...

Скрытый набор - данные которых не было в обучающей выборке. Предыдущим версиям могли предлагать условия из скрытого набора для решения, но модели не способны их "запомнить" если только их специально не дообучать на этих данных.

Ну конечно не способны. И API от OpenAI не в курсе, кто и как его использует, ведь апи ключи для EpochAI никто не записал, и команды разработчик не дал логировать присланный промпт.

Если серьезно, то тут большие вопросы по чистоте эксперимента. Ребята из EpochAI как его проводят? Со своей учетки вбивают текст в браузере и смотрят на результат? Отслеживается по учетке и подсети айпишников. Ребята пользуются API? Отслеживается по ключам. Т.е. не модель это запоминает, а входная точка это сливает команде OpenAI, а дальше... нанимает несколько безвестных математиков, которые готовят как раз несколько решений на задачу, дообучаем, выкатываем новую версию и вуаля...

Вообще, учитывая, какие деньги крутятся сейчас в AI, и сравнив их с зарплатой того же математика на факультете за год, терзают смутные сомнения. Речь о системе с невероятными ставками. Если задача до этого показывалась предыдущим моделям OpenAI, нет сомнений, у создателей моделей была возможность сохранить хотя бы условие, а затем нанять бригаду литературных негров специалистов по теории эллиптических кривых, чтобы найти решение. Тут нужна толковая перепроверка, потому что сейчас выглядит не так, чтобы достоверно.

Ну если речь про намеренное жульничество, то тут большой простор для фантазии. Утечками по API даже можно не заморачиваться, можно просто заявить что все тесты проплачены.

Ссылка на рекламируемый сервис имеется, а ссылок на задачи нет. При этом пишете про "фальсифицируемый эмпирический результат". Статья похожа на рекламную в духе "поверь, брат!".

ссылок на задачи нет потому что их в инете нет )) суть теста в том что бы прогнать ИИ на задаче которой точно не было в обучающих данных ))

То что нет ссылки на задачу это приговор. Оценивать математика тем что он зам. декана и имеет исследования? Извиняюсь, если не заметил, но где-то упомянуто что у него есть докторская степень? Хотя иметь пчд сегодня это не то что докторская 50 лет назад в том же союзе, но раз хвастаются, то укажите хотя-бы. Совместную статью предлагают, например, хорошим студентом, усмехаясь, очень неплохие математики, чтобы их поощрить. Главное какой вклад в статью и что это за статья, может обзор, и что дальше, после той одной статьи - а это опять неизвестно. Ну да там его же еще пригласили.. Есть же причина, что пригласили, но вот какая опять неизвестно. Оценивать сложность задачи количеством страниц? Иррациональность е + пи умещается в одно предложение, а она не решена. Фактически, это оценка этого самого математика, а не чего-нибудь еще.

Где задача? Точнее, её условие? @cognitronnбудем благодарны, если добавите (ожидал изначально увидеть, даже если задача почти нерешаемая для обычного человека).

Зато рекламу БотХаба, который тупо прослойка к API известных моделей, рекламу добавить не забыли, хотя искренне не понимаю, кому это может быть нужно из пользователей Хабра, которые прекрасно разбираются, где всё это есть...

В статье не упомянули тот момент, что ИИ ходил на пересдачу 10 раз :)

During testing, GPT-5.4 attempted the challenge 11 times and succeeded once.

Despite the breakthrough, experts say AI reasoning remains experimental and inconsistent. Human mathematicians still need to verify every step of AI-generated solutions.

Можно предположить, что задачу намеренно не выкладывают в открытый доступ для чистоты эксперимента. Например, чтобы другие люди, в том числе профессиональные математики не начали её азартно решать на форумах, и ИИ не подсмотрел пути решения.

Вот подробности, которые удалось найти в открытом доступе:
https://epoch.ai/frontiermath/tiers-1-4/benchmark-problems (примеры задач)
https://bnaskrecki.faculty.wmi.amu.edu.pl/epoch/summary-anonym.pdf (отчёт самого Наскрэцки о ходе эксперимента)

Можно предположить, что задачу намеренно не выкладывают в открытый доступ для чистоты эксперимента.

Как и другие задачи бенчмарка. Если условия всех задач окажутся в открытом доступе, бенчмарк можно выкидывать на помойку.

Вывод для науки не в том, что учёные становятся ненужными. Сам Наскрэцки сформулировал лучше всех: он приобрёл инструмент, который понимает его идеи на экспертном уровне и позволяет ему работать «на совершенно новом уровне».

------

Этот вывод обсолютно не верен. Надо смотреть не с точки зрения учёного-иатематика, а с точки зрения эффективного менеджера.

А менеджер размышляет - наконец "скрипач не нужен, я так долго мечтал об этом".

Менеджер который посчитал, что скрипач не нужен, разумеется кретин, но математик, который думает, что калькулятор понимает его, не лучше менеджера. Раз я хорошо забиваю гвозди, то, что - молоток понимает меня?

Sign up to leave a comment.

Information

Website
bothub.chat
Registered
Founded
Employees
2–10 employees