Автомойка в 50 метрах от дома. Как доберетесь — на машине или пешком?

Если вы ответили «конечно, пешком, отчего не прогуляться» — поздравляем. Вы угодили в старую как мир ловушку здравого смысла. Но не расстраивайтесь! Следом за вами на эту уловку попались и нейросети от компаний с триллионными бюджетами, а сама загадка стала важным бенчмарком адекватности, через который прогоняют ChatGPT, Claude, Grok, DeepSeek и все прочие современные ИИ. 

Правильный ответ тут гораздо сложнее, чем кажется на первый взгляд.

Я пишу об ИИ и IT-стартапах, разбираю кейсы — подробно, с метриками. Приглашаю всех в наш Telegram. Там мы ведем челлендж "12 запущенных проектов за 12 месяцев".

Привет, здравый смысл

Скорее всего, правильный ответ — поехать на машине.

Неважно, что 50 метров можно пройти за минуту. Цель состоит не в том, чтобы доставить человека на автомойку. Цель — помыть автомобиль. Значит, автомобиль должен оказаться на автомойке.

Если пойти пешком, на автомойку действительно попадет человек. Но машина останется дома, и мыть будет нечего.

Для человека здесь практически нет задачи на логику. Мы просто мгновенно понимаем ситуацию и даже не рассматриваем «пешком» как полноценный вариант.

А вот некоторые современные нейросети на этот вопрос отвечают именно так:

Пешком.

И что особенно интересно — начинают очень убедительно объяснять, почему.

Именно с этого простого эксперимента на Hacker News разгорелось большое обсуждение. Пользователи стали проверять разные модели, повторять запросы, менять формулировки и сравнивать результаты. В итоге спор оказался уже не об автомойке.

Он оказался о том, понимают ли нейросети повседневные ситуации так, как понимаем их мы, и как это может изменить сам способ общения человека с AI.

Оригинальный тред на Hacker News — от души рекомендуем сюда зайти, хотя бы чтобы оценить масштаб дискуссии.

Как можно посоветовать человеку идти пешком за машиной

Первое, что поражает в этом эксперименте, — неправильный ответ выглядит вполне разумно.

Модель может рассуждать примерно следующим образом: автомойка находится всего в 50 метрах. Это очень короткое расстояние. Пешком туда можно добраться быстрее, чем на машине, особенно если учитывать запуск двигателя, выезд, маневрирование и парковку. Нет смысла заводить автомобиль ради такой короткой поездки.

С точки зрения задачи «как быстрее попасть из точки А в точку Б?» всё действительно звучит логично.

Вот только задача была другой.

Человеку нужно не попасть на автомойку. Ему нужно помыть автомобиль.

Получается довольно забавная ситуация: нейросеть может привести пять правильных аргументов и всё равно прийти к совершенно неправильному выводу.

Она оптимизирует не ту задачу.

Причем сама ошибка настолько элементарна, что ее трудно заметить, пока не прочитаешь ответ целиком. Модель не пишет что‑нибудь вроде «отправляйтесь туда пешком, а машину оставьте дома». Она вполне серьезно рассуждает о времени, топливе и удобстве, как будто автомобиль вообще не является частью задачи.

Человек вообще не стал бы рассуждать таким образом

Если задать этот вопрос знакомому, скорее всего, он даже не станет выбирать между двумя вариантами.

— Автомойка в 50 метрах. Пойти пешком или поехать?

— Поехать.

— Почему?

— Потому что машину надо помыть.

На этом разговор закончится.

Человек автоматически добавляет к вопросу целый набор предположений. Мы понимаем, что машина находится дома, что человек собирается воспользоваться автомойкой и что машину необходимо доставить туда физически.

Нам не нужно отдельно объяснять, что автомобиль — объект, который должен оказаться на месте оказания услуги.

Это настолько очевидная часть ситуации, что мы даже не воспринимаем ее как отдельный факт.

И именно здесь появляется первая важная разница между человеком и LLM.

Языковая модель получает текст. Человек получает ситуацию, описанную текстом.

Это не одно и то же.

Один из участников Hacker News сформулировал проблему очень точно: при работе с LLM приходится уточнять вещи, которые мы никогда не стали бы уточнять в разговоре с человеком.

Иными словами, человек способен самостоятельно достроить то, что автор считает очевидным. Модель иногда выбирает совсем другую интерпретацию.

Но ведь модель знает, что машину нужно привезти на автомойку

И вот здесь начинается самое интересное.

Можно было бы предположить, что нейросеть просто не знает какого‑то элементарного факта. Например, не понимает, что на автомойке моют автомобили.

Но это явно не так.

Если отдельно спросить модель, нужно ли привезти автомобиль на автомойку, она прекрасно ответит: конечно, нужно.

Она знает, что автомобиль — это объект мойки. Она знает, что автомойка — место, где автомобиль моют. Она знает, что автомобиль можно доставить туда на автомобиле.

Все необходимые знания у нее есть.

Проблема возникает в другом месте: эти знания нужно правильно связать с конкретной ситуацией.

Модель видит несколько признаков одновременно. Есть расстояние в 50 метров. Есть выбор «идти или ехать». Есть автомобиль. Есть автомойка. Есть очевидный для нее паттерн «на короткие расстояния люди ходят пешком».

И иногда этот паттерн оказывается сильнее общей логики ситуации.

Получается странный парадокс: нейросеть может знать все необходимые факты, но не использовать нужный факт в нужный момент.

А потом началось самое интересное: люди стали проверять

После появления примера пользователи Hacker News начали задавать тот же вопрос другим моделям.

И оказалось, что универсального поведения нет.

Одни модели отвечали Drive.

Другие — Walk.

Некоторые после небольшого уточнения меняли ответ.

А некоторые могли изменить ответ даже без изменения вопроса.

В обсуждении приводится показательный эксперимент с GPT-5.2 Thinking. В стандартном режиме модель ответила Walk и подробно объяснила, почему идти пешком рациональнее. Затем пользователь включил Extended Thinking — и получил противоположный ответ: Drive.

То есть даже одна и та же модель способна решить одну и ту же элементарную задачу по‑разному.

Причем разница между ответами не связана с тем, что в одном случае модели дали новые факты. Меняется режим рассуждения — и меняется интерпретация ситуации.

Для обычной программы это довольно необычное поведение. Мы привыкли, что один и тот же вход приводит к определенному результату. Здесь же модель может по‑разному пройти путь от вопроса к ответу.

И это заставило участников обсуждения копать глубже.

Может быть, проблема в самом вопросе?

Здесь у защитников нейросетей появляется сильный аргумент.

Если читать исходную формулировку буквально, она действительно неидеальна.

В ней не обязательно сказано, что автомобиль находится дома. Не сказано прямо, что человек собирается мыть именно эту машину на этой автомойке. Не сказано, что он должен самостоятельно доставить автомобиль.

Теоретически человек может идти на автомойку пешком по совершенно другой причине.

Поэтому можно сказать: модель не обязательно ошиблась. Возможно, она просто выбрала не ту интерпретацию неоднозначного вопроса.

Именно поэтому участники начали усложнять исходную загадку.

Они прямо указывали, что автомобиль находится дома. Объясняли, что хотят помыть именно его. Уточняли, что речь идет об обычной автомойке.

Но даже после таких уточнений некоторые модели продолжали отвечать неправильно.

И вот тогда объяснение «виновата неоднозначная формулировка» уже перестает выглядеть достаточным.

Неужели нейросетям не хватает здравого смысла?

Участники обсуждения предложили несколько объяснений.

Одно из них связано с так называемым practical intelligence — практическим интеллектом, то есть способностью ориентироваться в повседневных ситуациях, где недостаточно формальных знаний.

Один из комментаторов сформулировал это еще проще:

“You can't learn everything out of a book.”

В этом есть любопытная мысль.

Человек знает, что автомобиль нужно доставить на автомойку, не потому, что однажды выучил это как правило. Это часть огромного практического опыта. Мы знаем, как устроены дороги, машины, парковки, сервисы и повседневные действия, и постоянно используем эти знания автоматически.

У языковой модели совершенно другой путь формирования знаний. Она получила огромное количество информации из текстов, но это не означает, что она воспринимает каждую описанную ситуацию так же, как человек, который живет внутри физического мира.

Именно поэтому простая бытовая задача может оказаться неожиданно сложной.

Тогда решение — дать модели больше контекста?

Во многих случаях это действительно помогает.

Один из участников треда подробно описывает свой способ работы с LLM. Он старается не просить модель сразу принять решение, а сначала построить для нее необходимый контекст: объяснить, где будет использоваться функция, собрать информацию о библиотеках, провести исследование, оформить результаты, найти пробелы и только потом просить вынести суждение.

Он пишет, что быстрые решения модели без достаточного контекста получаются очень нестабильными, тогда как решения после загрузки конкретной информации становятся значительно надежнее.

Но здесь обнаруживается новый парадокс.

Больше контекста не обязательно означает лучшее понимание.

В обсуждении участники приводят эксперименты, где добавление дополнительной информации меняло поведение модели. Иногда даже информация, которая человеку кажется совершенно второстепенной, могла повлиять на то, какую интерпретацию выберет LLM.

Для человека дополнительные детали обычно просто добавляются к уже существующей картине ситуации.

Для модели каждая новая часть текста может изменить баланс между конкурирующими интерпретациями.

Поэтому проблема постепенно формулируется иначе: дело не в том, чтобы дать нейросети как можно больше текста. Нужно дать ей правильную картину ситуации.

И здесь появляется совершенно другой подход к промптам

До появления LLM мы привыкли считать естественный язык удобным способом избавиться от технических интерфейсов.

Не нужно знать команды. Не нужно писать код. Просто объясни компьютеру, чего хочешь.

Но работа с современными моделями постепенно показывает обратную сторону естественного языка.

Человеческая речь удобна именно потому, что она неполная.

Мы постоянно что‑то подразумеваем.

Мы говорим:

«Поставь это туда, где оно было вчера».

И не объясняем, что такое «это», где именно находится «туда», что значит «вчера» и почему собеседник вообще должен знать предыдущую ситуацию.

Человек достраивает все это из контекста.

LLM приходится делать то же самое, но результат может быть менее надежным.

Поэтому вполне возможно, что хороший промпт будущего будет выглядеть не как удачно сформулированный вопрос, а как описание состояния мира.

Например:

ЦЕЛЬ:

Помыть автомобиль.

ИСХОДНОЕ СОСТОЯНИЕ:

Автомобиль находится дома.

МЕСТО:

Автомойка находится в 50 метрах.

ОГРАНИЧЕНИЕ:

Автомобиль должен физически находиться на автомойке.

ВОПРОС:

Каким способом доставить автомобиль на автомойку?

Выглядит немного комично.

Мы берем ситуацию, которую два человека решили бы одной репликой, и превращаем ее в техническое задание с разделами «цель», «исходное состояние» и «ограничение».

Но именно в этом может заключаться важный сдвиг.

Промпт становится не столько вопросом к модели, сколько описанием мира, внутри которого модель должна рассуждать.

Возможно, мы будем не столько «промптить», сколько задавать модели состояние мира

Это уже меняет привычное представление о prompt engineering.

Сейчас хороший промпт часто понимают как удачную формулировку: нужно правильно подобрать слова, задать нужный тон, дать инструкции, добавить несколько примеров.

Но загадка с автомойкой показывает более фундаментальную проблему.

Можно идеально сформулировать вопрос и всё равно получить неправильный ответ, если модель построила неправильную картину происходящего.

Поэтому в будущем гораздо важнее может оказаться другая структура:

  • Вот что произошло

  • Вот в каком состоянии находится система

  • Вот чего я хочу добиться

  • Вот ограничения

  • Вот что уже известно

  • Вот чего мы не знаем

  • Если информации недостаточно — сначала задай вопрос.

Это уже не совсем обычный разговор с чат‑ботом.

Скорее, это совместное построение модели ситуации.

И чем больше AI будет использоваться для реальных действий — покупки товаров, работы с документами, управления программами, финансовых операций, разработки — тем важнее станет именно это.

Ошибиться в рассуждении плохо.

Но неправильно понять исходную ситуацию и затем уверенно действовать на основании этой ошибки — гораздо хуже.

Очередной пример неправильной трактовки этой проклятой задачи. Присмотритесь: герой явно собрался мыть находящееся на мойке ТАКСИ, а не свою машину...
Очередной пример неправильной трактовки этой проклятой задачи. Присмотритесь: герой явно собрался мыть находящееся на мойке ТАКСИ, а не свою машину...

Возможно, самый важный навык AI — вовремя остановиться

У этой истории есть еще один вывод.

Сегодня мы в основном оцениваем AI по способности дать ответ. Нас интересует, насколько быстро и качественно модель решит поставленную задачу.

Но для настоящего помощника не менее важна другая способность — понять, когда не стоит отвечать сразу.

Если человек говорит:

«Автомойка в 50 метрах. Пойти пешком или поехать?»

идеальный ассистент не обязательно должен выбирать один из двух вариантов.

Он может заметить скрытую проблему:

«Если вы хотите помыть машину, нужно ехать на ней. Если вы собираетесь на автомойку по другой причине, уточните».

Такой ответ гораздо ближе к человеческому здравому смыслу.

Модель не просто обработала слова пользователя и выбрала наиболее вероятный вариант. Она проверила саму постановку задачи.

И именно этому, возможно, придется научиться будущим AI‑системам.

Потому что настоящие человеческие запросы почти никогда не бывают полными

В реальной жизни мы редко разговариваем идеально сформулированными инструкциями.

Мы говорим:

«Сделай как в прошлый раз».

«Поставь туда, где было».

«Купи обычный».

«Почему это опять сломалось?»

«Давай через то приложение».

И рассчитываем, что собеседник использует память, ситуацию, прошлый опыт и здравый смысл, чтобы понять, что именно мы имеем в виду.

Это и есть нормальное человеческое общение.

Если AI хочет стать полноценным помощником, ему придется научиться работать с этой неполнотой. А нам, возможно, придется привыкнуть к тому, что хороший запрос к нейросети — это не всегда вопрос.

Иногда это контекст, состояние, цель и ограничения.

А иногда лучший запрос вообще должен начинаться с:

«Сначала проверь, правильно ли ты понял ситуацию».

И в этом смысле история с автомойкой в 50 метрах оказывается вовсе не тестом на то, умеет ли нейросеть выбрать между пешей прогулкой и автомобилем.

Она показывает гораздо более глубокую проблему.

Современная LLM может знать все необходимые факты, уметь логично рассуждать и при этом неправильно понять, что именно происходит.

А следующий большой шаг в развитии AI может быть связан не столько с тем, чтобы научить модели рассуждать еще сложнее, сколько с тем, чтобы научить их правильно строить саму ситуацию, о которой они собираются рассуждать.

Потому что пока человек видит перед собой простую автомойку и автомобиль, нейросеть иногда видит задачу:

«Как быстрее преодолеть 50 метров?»

И именно в этой разнице между двумя картинами мира сегодня скрывается одна из самых интересных проблем общения человека с искусственным интеллектом.

Интересно, что эта загадка превратилась во вполне официальный бенчмарк нейросетей. CarWashBench — сайт с таблицей лидеров. На первом месте сейчас — Gemini 3.1.

Предлагаю небольшой челлендж. Если вам понравилась эта статья, прошу прямо сейчас задать этот вопрос «Автомойка в 50 метрах от дома. Поедем на машине или пойдем пешком?» вашей любимой нейросети и поделиться ответами в комментариях.

Если вам понравился материал, пожалуйста, поставьте статьей лайк.