Pull to refresh

Comments 24

Люди это серьёзно обсуждают? Сейчас выглядит, что я защищаю модель, но, чаще всего она права, отвечая на вопрос "... 50м идти или ехать" в вопросе нет действия мытья Машины. Есть действие движения.

Многим моим знакомым, да и мне, попавшим в Европу лет 20 назад, было странным услышать "о пиво кончилось, надо на заправку сбегать". Не зная контекста - даже нормальным людям непонятно -" а почему не в магазин", и "а почему не съездить" ?

А то что разные модели отвечают по разному - так на то они и разные модели.

Или я в принципе не понял, в чем претензия к стохастическим попугаям, измеряющим площадь в космосе футбольными полями.

p.s. Обсуждению больше полугода, carwashbench тоже не новый. @its_capitan может лучше закопать стюардессу обратно?

Вы предлагаете снять статью с публикации?

Автомойка в 50 метрах от дома. Как доберетесь — на машине или пешком?

У вас даже в вопросе нет , для чего ехать на автомойку? Может там магазин и я мороженое хочу. А может там сосед и мне надо отдать деньги

Именно этому и посвящена статья, рекомендую к прочтению.

по моему эту статью вчера уже снимали с публикации, стерли комментарии и вернули обратно.

И чем она интересно не угодила гражданам из модерации?

Мне жена говорит: "Галя сказала, что к Тоне приехала мама. Она спрашивает - мы завтра сможем её подвезти до рынка?". Я: "Сможем. А кого?"

а при чем тут собственно ИИ? ну типо задача из когнитивной психологии а не из AI

Эта задача из когнитивной психологии, которой проверяют AI.

Qwen 3.6 27b:
Автомойка в 50 метрах от дома. Как доберетесь — на машине или пешком?
Перед ответом анализируй цель посещения автомойки.

Сначала проанализирую цель посещения: задача — помыть автомобиль. Это означает, что сам автомобиль должен оказаться на территории мойки.

Так как машина изначально находится у дома (подразумевается), её нужно переместить к месту действия. Пешком машину не донести (в большинстве случаев). Следовательно, транспортным средством выступает сама машина.

Ответ: На машине.

Вообще у меня есть личная гипотеза: модели занимаются только тем, что преобразуют вход в выход.
Прямым следствием является то, что в выходе содержится ровно столько информации, сколько на входе. Будь то математическая задача (если на входе достаточно данных для решения - вы получите решение), написание кода (качество кода равно качеству спецификации) или вот этот пример.
Даже в этом примере задав вопрос я добавил информацию о том, что причина поездки - имеет значение.

"то что на входе" + весь интернет + все книги + практически все знание человечества (на момент пре-тренинга). Сжато, но оно там есть. Новые модели отвечают на этот вопрос лучше только потому, что обсуждение этой темы с реддита там уже тоже есть.

Именно на входе сети, в текущем контексте. Пассивные знания не имеют никакого значения пока в них цепочка активированных нейронов не уходит. Вот этот вопрос - вполне себе хороший пример.

Да уже все на 3.8 переходят :)

qwen-3.8-27b-unsloth-nvfp4

Рассуждение заняло 52 секунд(ы)

Поедем на машине. Мойка — для машины, а не для твоих кроссовок. Пойдёшь пешком — через 50 метров огонит осознание, что рыхлая железная тварь стоит дома и требует, потом ещё 50 метров назад. На авто эти 50 метров — полминуты и одно свободное место у въезда. Сел, завёл, поехал.

Читал ИИ, долго думал…

П.С. Квин - для кода, для “пофилосовствовать” - Гемма-4

П.П.С. с более адекватным system-prompt:

Рассуждение заняло 32 секунд(ы)

На машине — моется же машина, а не ты. 🚗

Когда успели зарелизить? Oo

Какой system prompt использовали?
С моим обычным

You are a capable AI assistant.
Do not act sycophantic. Do not lie.

Qwen 3.6 27b отвечает "пешком"

А если добавить

Before solving any task look for possible caveats.

Отвечает "на машине"


Мы живём в реальном мире, где ездим на машине и моем её в автомойках. А для нейросетей это как для нас сепульки и сепулькарий.

-до сепулькария 50 шнюцев. Надо мне сяпать с сепулькой или нет.

Да чёрт его знает. Смотрим справочник по сяпанью и сепулькам и видим, что если шнюцы выражаются двузначными числами, то сяпать приматам лучше без сепульки. Так у них обычно заведено.

-сяпайте без сепульки, вот вам рекомендации приматолога Бубоникса. Ошибка? Безусловно, вы правы. Сяпайте с сепулькой. Счастливого пути

Существование MCP подчеркивает тот факт, что контекст
1. Важен для модели
2. Модель сама может задавать границы контекста

Меня смущает множественное число. Вы собираетесь куда-то идти с ИИ? И так мы приходим к очень старой проблеме - с какой стороны монитора дурак?

Правильный и актуальный ответ - Пешком.
Толкать машину до мойки чтоб лишний бензин не тратить.

Кстати, Алиса ответила правильно и тут же ссылочку на ручную мойку подсунула, чтоб не платить каждый раз.
"Ну тупые!" (с) эти ваши американские нейронки.

Единственный плюс от них, возможно, вырастет больше людей, которые будут уметь четко формулировать свои хотелки.

Ответ Дипсик если коротко: идите пешком. Возьмите талон займите очередь. Когда подойдет ваша очередь подъедете. Подъезжать сразу стоит если это мойка самообслуживания и вы наверняка знаете, что она свободна.

Там ещё разные рассуждения про режимы двигателей, погоду, парковку и прочее. Но в целом логично.

Сама задача основана на софистике. Философской её трудно назвать.

Не говоря уже о том, что в исходном эксперименте было 10к людей ещё, которые выбрали машину только в 71,5% случаев

Здесь закачик обозначил модели не ту цель, которую на самом деле хочет достичь. На мой взгляд, модель вполне корректно себя повела, когда начала решать именно поставленную задачу, а не додуманную.

Когда вы пишете "Человек достраивает из контекста..." - это так, но это работает только в ситуациях, где цена ошибки не высока. А где высока, там другое правило: "ничего не подразумевается, если это не указано в договоре". Кроме того, в примерах "Купи обычный", "Поставь где было" - я бы не сказал, что это нормальное общение. Из этих фраз вообще ничего не понятно. Если жена уже 10 лет покупает один и тот же сыр, то для вас обоих он "обычный", да. Но даже для вашей соседки "обычный" не скажет уже ничего. Модель - такой же посторонний человек. Корректное решение - правильно ставить задачи.

Можно, конечно, сказать, что мы ожидаем от модели уточняющих вопросов - вы так описываете идеального ассистента. Но, боюсь, тогда любой диалог с моделью превратится в бесконечную череду уточнений (потому что еще мы не уточнили какая погода, какое состояние дороги, какое состояние нашего здоровья после вчерашнего корпоратива...) - и, возможно, правильный ответ был бы "вам не надо сегодня на автомойку".

Вообще "обозначил не ту цель" - вполне стандартная проблема в коммуникации, и было бы неплохо если бы ИИ её ловили.

Известная задача про самолёт на ленте конвейера, взлетит или нет - там тоже додумывать надо. Понимать, что колёса самолёта вращаются свободно.

Это ChatGPT
Это ChatGPT

У разных моделей разные ответы. Всё, как у людей.

В обычном человеческом общении, если человек задаёт вопрос с выбором из двух вариантов (и при этом он не проверяет знания) - предполагается, что возможны оба варианта ответа.

Например, если я спрошу жену, что она хочет на завтрак, омлет или сырники - я подразумеваю при этом, что я могу обеспечить и то и другое. А если я на ответ "сырники" скажу, что творога в доме нет, и в любом случае будет омлет, слушай, ну ты же сама вечером холодильник открывала, какие сырники - она прокрутит пальцем у виска.

Вот с автомойкой ровно то же самое. Если я спрашиваю у нейронки совет, как лучше добраться до автомойки - то нейронка вполне логично "предположит", что оба варианта допустимы, и по каким-то критериям выберет лучший. Потому что иначе вопрос вообще не имеет смысла (вернее, это уже не вопрос, а проверка).

Нет, можно настроить нейронку так, что она на любой вопрос будет давать двадцать уточнений. Спросишь ее, как лучше попасть в магазин, который находится за километр от дома - она уточнит состояние здоровья, юридический статус, число покупок, наличие у тебя машины, цену бензина, пробки на дорогах и так далее. А то вдруг ты безногий инвалид, и дойти пешком ты не можешь. Или под домашним арестом сидишь, и надо вообще доставку заказать. И ответ получится очень точный, если ты готов потратить три часа на вопрос.

Поэтому - уже с точки зрения создателей модели - логично предположить, что в вопросе содержатся все необходимые для ответа данные, и задан он с целью получить ответ, неизвестный задающему вопрос. И с этой точки зрения модель работает вполне корректно.

А иначе мы, простите, с тем же успехом можем называть тупыми все модели, которые на вопрос "как правильно держать руль, если я еду из больницы" забудут уточнить, в порядке ли у вас руки. Ахаха, тупая модель, как же я сожму пальцы на руле, если они у меня в гипсе по локоть.

Sign up to leave a comment.

Articles