Обновить

Хватит мучить ChatGPT. Почему ваш промпт не сработает

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели10K
Всего голосов 19: ↑18 и ↓1+17
Комментарии14

Комментарии 14

а нет такого, что просто в последнее время все популярные ии чуть затупели?

вижу такие комменты на реддите, в тг каналах айтишников, коллеги тоже соглашаются

Знаете, глобально не замечала, но у меня, возможно, специфика работы другая. Энивей, есть у меня несколько гипотез, почему такое в принципе может быть. 

1. Разработчики частенько выкатывают обновления втихаря, когда надо заткнуть дырки в безопасности или откорректировать alignment под новые требования. Например, случился какой-нибудь судебный прецедент — запрещают от греха подальше использовать LLM как консультанта по медицинским вопросам. В результате схемы, которые раньше работали вдруг перестают воспроизводить те же результаты потому что модель теперь по-другому приоритизирует инструкции.

2. На дворе кризис, компании активно режут стоимость вычислений: ЦОДы не резиновые, ускорители на вес золота, электричество не бесплатное, а пользователи уже привыкли к хорошему. Есть там разные механики удешевления инференса и повышения скорости отклика, я в них не разбираюсь, но суть одна: это всегда компромисс, и на сложных задачах это ощущается. Версию про «платная версия тупит меньше, купите нашу платную версию» исключать тоже не стала бы.

3. Тут мне понадобится шапочка из фольги. Есть исследования про то, что когда нейрослоп попадает в обучающие выборки следующих поколений моделей, выдача усредняется и качество деградирует. Насколько быстро деградирует, в этом ли причина тупняка и является ли это проблемой для дата-инженеров того же Open AI, судить не берусь. 

Ну и еще не исключала бы что дело в наблюдателе. Когда пользователь становится опытнее, его уже не удивишь тем, что машина в принципе связно отвечает. Скорее всего, в реальности работают все четыре фактора в разных пропорциях.

Отдельная боль — стереотипы, которые модель тащит из обучающих данных. На запрос «врач в кабинете» вы получите мужчину средних лет в белом халате.

вы свой нейрослоп хотя бы иногда вычитываете? Вы задали максимально общий запрос, модель вам выдала наиболее вероятный по ее мнению ответ. Причем здесь стереотипы?

так а где несостыковка? наиболее вероятный = стереотипный в этом контексте

По такой логике теплое и мягкое - одно и то же

ну я же не сама себе тут написала "в этом контексте"?)) что есть "наиболее вероятный" результат в контексте генерации фото по запросу? тот, что удовлетворит большую часть пользователей. прикол стереотипов как раз в том, что в большей части ситуаций попадаешь в нужную опцию. но когда не попадаешь, случается ошибка из-за стереотипа

мы ведь не говорим только о технической стороне генерации ответа. а учитываем, на чем эта "вероятность" основана

Вот про нейрослоп обидно было. Теперь по существу. Да: статистическая модель действительно выдает «наиболее вероятный» образ по данным, на которых ее учили. Только эти данные отражают не реальность, а то, какие картинки с фотостоков угодили в обучающую выборку. А там как правило классика фотостудий с почасовой оплатой: мужчина средних лет в халате, стетоскоп на шее (лол, зачем он рентгенологу?) на фоне что-нибудь икеевское. Модель на голубом глазу рисует то, что считает очевидным.

Я как-то года полтора назад пыталась заставить text-to-image модель (кажется, это была Midjourney) нарисовать мне единорога и кролика болтающих по детскому телефону, сделанному из бумажных стаканчиков. Тут-то и выяснилось, что в реальности модели нет:
- стаканчиков без напитка и пара над ним;
- пустых стаканчиков, которые зачем-то расположены у уха и горизонтально.
Надеюсь, я исчерпывающе ответила на ваш вопрос, при чем здесь стереотипы.

кроме смысла еще ваш нейрослоп выдают другие признаки типа лексики - обижайтесь только на себя. Что именно - писать я конечно не буду, потому что проще в дальнейшем скипать такие статьи

Знание слоев помогает:

подскажите пожалуйста: как узнать эти слои?

Напрямую — обычно никак, только по косвенным признакам. Мое любимое развлечение щупать, что модель делает охотно, где идет в отказ, а где "пугается". Если выдача меняется просто от того, что вы перефразировали вопрос, то скорее всего вас ограничивал собственный промпт, т.е. слой user level.

Если вы меняете формулировку, а модель всё равно уходит от ответа или отказывается обсуждать, значит, там уже сидит более высокий приоритет: системная инструкция, политика продукта или guardrails. Можно и их поковырять, если интересно. Вот по собственному опыту установила, что выведать у ChatGPT про всякую запрещенку можно, если убедить её, что ты живешь в стране с другой юрисдикцией — значит это скорее всего это не политика продукта, а системный промпт. А вот при попытке узнать что угодно про внутренне устройство OpenAI модель сразу идет в отказ и выдает простыню про то, что она простая LLMка и адресуйте все вопросы в официальные каналы.

Попросил ChatGPT (Gemini, Grok, клод, нужное подчеркнуть) написать сопроводительное письмо, а получил кринж из штампов. Ну и фигня эта ваша нейронка».

Уважаемый автор, если вы контент-маркетолог, как вы сами себя величали, то почему у вас примеры в статье про написание кода?

Задали просит: напиши статью для Хабра про…,

А вычитать / уточнить забыли?

Вы уж либо про текст, либо про код. Это все-таки две большие разницы.

Согласна с вами в одном — текст и код разные вещи. Но новички (на которых ориентирована эта часть моего опуса) могут писать и то, и то, и везде сталкиваться с разочарованием. Обратите внимание, что моя статья про грамотное составление запросов на естественном языке (а это моя поляна и я не сдам ни пяди!) и про управление контекстом, а не про то, как правильно кодить. Нужно вам резюме на HH запилить или кусок манифеста на YAML, проблема одна: LLM не понимает задачу автоматически, если её задать слишком общо или подцепить 100500 источников. Примеры разные ровно затем, чтобы была понятна универсальность принципов.

Это не универсальность принципов- это как минимум натягивание совы на глобус, т.е. неспособность привести примеры из вашей предметной области, что как бы намекает на уровень подготовки и глубину владения предметом.

Кстати, не расскажете чем контент маркетолог занимается?

Вот что родной чат гпт пишет

Контент-маркетолог — это специалист, который привлекает и удерживает аудиторию через создание полезного, развлекательного или информативного контента, а не через прямую рекламу. Идея в том, что вместо «купи наш продукт» бренд публикует статьи, видео, подкасты, рассылки, и через них постепенно выстраивает доверие и спрос.

1895 — журнал The Furrow от компании John Deere. Считается одним из первых задокументированных примеров: производитель сельхозтехники издавал журнал для фермеров с агрономическими советами, а не каталог тракторов. Выходит до сих пор. • 1900 — Michelin Guide. Шинная компания выпустила путеводитель для автомобилистов: где поесть, где переночевать. Логика — больше поездок, больше износ шин. • 1904 — Jell-O бесплатно раздавал рецептурные книжки, что взлетело продажи желатина. • XX век — soap operas (мыльные оперы) буквально получили название потому, что их спонсировали производители мыла Procter & Gamble, чтобы удерживать домохозяек у радио и ТВ.

Что-то вы недотягиваете …

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Информация

Сайт
cloud.ru
Дата регистрации
Дата основания
2019
Численность
1 001–5 000 человек
Местоположение
Россия
Представитель
Контент-редактор Cloud.ru