Обновить
26
Ingref@Ingref

Пользователь

1,3
Рейтинг
6
Подписчики
Отправить сообщение

Сразу вспомнились уроки по информатике, где учили, как правильно писать в ворде и рисовать в пэинте.

Ну факт остаётся фактом - если дать одну и ту же задачу GPT-3.5 и GPT-5.6, то последний с ней справится лучше. То же самое касается работы в агентском окружении и просто в чате. Но люди, которые этого не пробовали и не хотят, начинают придумывать оправдания про казино.

Автор даже не упомянул, о какой именно модели идёт речь. И о каком временном периоде. Что-то не очень похоже, что он пользовался Fable 5. Скорее всего, он даже не подозревает о существовании Claude Code и общался в чатике на сайте. Ещё и ссылается на какое-то видео на ютубе больше чем полуторагодовалой давности и на исследование 2-летней давности - про LLM тех времён. Хотя кое-где он прав (например, про недостаток в обучающей выборке больших игровых проектов). Но это всё какие-то детские претензии. Те, кто LLM-ками пользуется давно, уже давно этим переболел.

Мысль интересная. С другой стороны, можно предположить, что прожорливость родного агента также коррелирует с его эффективностью. Ведь зачастую именно в родной обвязке модель показывает лучшие результаты. А вообще, проблемой сжигания токенов агентами уже много кто озаботился. Например, есть такой проект - https://www.rtk-ai.app/ - там вообще всё что только можно попытались ужать. Говорят, сокращает расход токенов до 90%.

Иосиф Виссарионович, перелогиньтесь.

А для винды 11 разве tpm не нужен?

Поначалу утверждали якобы "кровь из носа нужен", а по факту - ничего там не нужно.

А в чём проблема всё это обновлять программным образом? Почему винду 11 можно поставить на 775 сокет 20-летней давности, и всё прекрасно работает, а тут прям всё устарело, ничего нельзя сделать, только в морг. В примере с виндой, конечно, производитель тоже попытался чё-то там изобразить подобное, но его потуги быстро иссякли.

У меня телек Sony уже лет 20 служит.

Бритва была Braun - лет 15 отслужила (и ещё 15 бы отслужила, если б я её смазывал).

Моник Viewsonic лет 15 отслужил, блок питания вышел из строя (запчастей нет).

Холодильник Indesit - 13 лет верой и правдой.

Так что все эти жизненные циклы смартфонов - просто курам на смех. Они должны служить 20 лет минимум. Старые телефонные аппараты вообще по 50 лет служат и более. С какого хрена они должны вообще переставать служить?

Сериал на Netflix, сезонов на 10 минимум.

Предскажи точный финальный вывод этого кода на Python до последнего знака после запятой без использования сторонних библиотек:

x = 0.0

for _ in range(150):

x += 0.1

print(f"{x:.17f}")

На самом деле, даже на сайте дипсика после долгих размышлений модель таки дошла до правильного ответа - 14.99999999999996270. Но сами размышления были прерваны до того, как она их завершила.

Дипсик думает долго, да. И токены расходует долго.

Ну есть же Arena.ai, где люди тестируют модели и оценивают ответы. Даже там Клод первый. Да и в целом если бы это всё было накруткой бенчмарков, то люди бы давно это раскусили (как раскусывают с многими другими "убийцами Клода"). Но в реальности ещё с прошлой зимы люди заметили резкое улучшение именно у Клода на реальных задачах. Так что вряд ли тут можно говорить про какую-то аферу. Вот про ухудшение модели из-за цензуры скорее можно высказывать подозрения. Да и в целом периодически может урезаться test time compute по-тихому, из-за чего модель будет выдавать ерунду. Также не забываем, что Клод бывает не только Fable 5, но и какой-нибудь старый Sonnet, например.

Спасибо, интересный обзор. Немного смутило, что твит Маска на китайском. Только потом до меня дошло, что вы китаянка, поэтому у вас твиты на китайском. Кстати, если вы женщина (вроде на аватарке женщина?), то это желательно учитывать при переводе с китайского на русский. Потому что в русском языке речь от имени мужчины и от имени женщины обозначается по-разному (с помощью окончаний в словах). Просто просите ИИ при переводе это учитывать.

А имя совершенно необязательно менять на русское, вполне можно указать реальное китайское имя, просто русскими буквами.

С учётом цен на Muse Spark 1.2 (contributor edition), который по производительности между дипсиком-флеш и дипсиком-про, особого смысла платить за дипсик-про не будет, если ценник вырастет.

Что будет, если вы перейдёте в агентный режим (расшарите проект) и повторите свой вопрос?

Расширится контекст. В первом случае весь контекст - это один ваш маленький промпт. Во втором - это все данные, которые доступны агенту + инструментарий. В современном виде агент - это такой напарник, который иногда помогает вам, а иногда вы помогаете ему. В случае с чат-ботом - это просто оператор коллцентра, к которому вы обратились за поддержкой.

а платить - значит спонсировать.

Нет. В законе сказано:

Предоставление или сбор средств либо оказание финансовых услуг, заведомо предназначенных для финансирования...

Кроме того, есть отдельное постановление Верховного Суда РФ:

Финансированием экстремистской деятельности следует признавать наряду с оказанием финансовых услуг предоставление или сбор не только денежных средств (в наличной или безналичной форме), но и материальных средств (например, предметов обмундирования, экипировки, средств связи) с осознанием того, что они предназначены для финансирования...

То есть недостаточно просто платить. Нужно платить с умыслом именно на совершение преступления. И наличие умысла должен будет доказывать прокурор.

Оплата за подписку - это абсолютно законное действие, не подпадающее под финансирование преступлений. Потому что умысел здесь - купить подписку.

И все эти разговоры депутатов по телеку о том, что типа лучше не покупать подписку на инсту (и телегу, если Дурова признают экстремистом) - это всё туфта, не имеющая отношения к юридической плоскости.

Я бы сказал, что примечательно здесь не только само по себе математическое достижение, а тот факт, что это теперь будет ещё одним своеобразным бенчмарком. Теперь каждая новая передовая модель будет стараться преодолеть рекорд, установленный Антропиком. И самый очевидный вектор атаки тут - "дизайн" эксперимента. Сами авторы кичатся тем, что промптили кое-как. И если какие-нибудь усердные ребята (например, из Китая) всерьёз решат этим заняться, то у них есть все шансы побить этот рекорд за счёт одного лишь продуманного взаимодействия с моделью. Ещё один очевидный лайфхак - убрать переполнение контекста. Потому что при контекстном окне в 1 миллион токенов 30 миллионов выходных - это 30 раз прочищенный и ужатый контекст. Можно было бы после каждого миллиона делать развилку и просто загружать в новый пустой чат полученные результаты, чтобы модель могла ими оперировать с чистого листа. Причём, это можно делать параллельно в нескольких чатах, а потом выбирать тот результат, который получился наиболее перспективным, и снова отправлять в пустой чат. Наверняка есть ещё куча других подобных методов, которые не были использованы.

Если в агентском режиме модель даст вам результат (что будет говорить о наличии корреляции с /Yc), а в диалоговом нет, значит вас просто разводят на исходники.

Не совсем понятно, откуда такой вывод. Тут уже куча людей написали с примерами, что это именно так и работает. А вы продолжаете теоретизировать, опасаясь за свои исходники. Если у вас исходники нельзя никому показывать, пользуйтесь локальными LLM. Вон Kimi K3 можно у себя в датацентре развернуть, если надо. Или что поменьше, если своего датацентра нет. Но если речь просто о проверке способностей LLM в агентском режиме, то совсем необязательно им скармливать какие-то чувствительные исходники.

И опять, как всегда, не указаны модели. Могу предположить, что эти модели:

  • GPT-5.5-Instant

  • DeepSeek-V4-Flash-0423

И, естественно, не в агентском режиме, а просто в чате на сайте. Разумеется, в бесплатной версии.

Факт остаётся фактом - алгоритмы за несколько лет улучшились, что привело к созданию маленьких моделей с производительностью больших. Дипсик флеш - это 284 миллиарда параметров против триллиона у GLM.

Ну это, в принципе, можно понять. Наверняка было куча жалоб, что людям не нравится, что их можно так найти.

Но тут тоже переборщили. Потому что даже фотографии не из личных соцсетей всё равно не ищутся. Потому что алгоритм тупо проверяет, известный человек или нет, и если неизвестный, то зарубает поиск на корню. Довольно твердолобый подход.

Информация

В рейтинге
1 772-й
Зарегистрирован
Активность