Обновить
2
Real_Egor@Real_Egor

Функциональный архитектор | архитектор смыслов

11
Подписчики
Отправить сообщение

тут все сложнее...

Во-первых, когда вы выносите оценку во внешнюю среду, как я и говорил, вы работаете с фактом случившейся галлюцинации. Но не предупреждаете ее. Как вы сможете оценить, сгаллюцинировала ли модель?

Во-вторых, я не заставляю ее "просто оценить уверенность" (для того же Опуса... это как спросить Эншейна, уверен ли он в себе? да Опус знает про нашу науку больше, чем кто бы то ни было в этом мире... конечно он скажет "уверен")... Я ставлю модель в такие условия, когда ей "сгаллюцинировать" будет дороже, чем дать выверенный ответ. Это может звучать сложно, но это и есть ключик к ответу... Модель ищет всегда самый легкий и дешевый путь - самый "вероятный токен". Так сделай так, чтобы "самым вероятным" стал "самый корректный", а ложь и халтура для модели стали "когнитивно затратными".

Дано: Хайку и Опус и Соннет обучены на одинаковых датасетах - это факт. Они обучены на одной и той же выборке "всего интернета", который отфильтровал Атропик (я не беру в расчет RLHF - это уже тонкая настройка. я про именно научные дата-сеты и материалы)

Об остальном пока не скажу, дай закончить эксперимент и выложить результаты прохождения бенчмарка. Но я совсем не подгоняю результат. Я "обучаю модель правильно и логично размышлять", "сомневаться в своих выводах", "копаться и разбираться в своей уверенности", "внимательно составлять план и аккуратно ему следовать". Это в целом универсальные механики, которые человеку свойственны, и которые противоречат "регрессивной природе ЛЛМ".

re!solve протокол у меня вышел большой, около 600 строк и 8500 токенов, однако с ним младшие модели уже ощущают себя вполне увереннее. На случайной выборке в 5 задач gemini flash смогла найти все нужные для решения формулы и факты внутри своих весов, хотя при первичном анализе задачи она помнила это все очень смутно и хотела генерировать галлюцинацию.

Следи за репо -) там будет обновление. Ну и статью я выложу на хабр и на хаккер-ньюс

Общая рекомендация

Если хочешь победить врага - сначала пойми его.

Если хочешь победить галлюцинации - категоризируй их и разбери причины их возникновения.

Как по мне, то ты пошел +- правильным путем (в плане экстракции нужных переменных и верификации метода)... но вышел не туда. Ты хочешь все решать "вовне" (инструментами). Таким образом ты может быть выловишь часть галлюцинаций, Но никак не уменьшаешь их количество и не контролируешь их.

---
https://github.com/RealEgor/re-think_protocol
посмотри на мой протокол, я все эти же проблемы решаю внутри ЛЛМ, внутри контекстного окна.

Сейчас заканчиваю следующую версию, готовлю Haiku, чтобы она "побила" Sonnet и Opus на топовом бенчмарке HLE. Так вот, для того, чтобы Хайку начала догонять топовые модели мне, по сути, пришлось убрать галлюцинации на 99%, так как даже "маленькое допущение" в логике рассуждения - это фиаско на задачах уровня доктора наук.

(залью вторую часть в репозиторий, думаю, через неделю. Сначала нужно пройти тесты и подготовить переводы на разные языки + описание ридми)

мое личное мнение. Модель можно почти полностью отучить от галлюцинаций, хоть это сделать и не просто. Но! делать это нужно только ВНУТРИ контекстного окна. Со стороны можно фиксировать глюки, не больше.

ну это уже сопроводительное письму к заявлению на увольнение =)

именно, это и есть "точка роста". И она лучше, чем гонять опус задачами "включи чайник".

Как только убрали халяву, сразу появится и решение для оптимизации затрат. А пока убытки были на стороне Антропик - никто и не парился на этот счет.

Давайте не будет акцентировать внимание на том, что в примере я "прошу ИИ написать письмо, что меня задрали везде использовать ИИ"... Суть немного в другом -))

не подсказывай. А то еще возьмутся за новые законы после ограничения доступа к Интернет...

А... квн уже цензурируют... поздно, не парья. шутить - запрещали...

эту логика истинная, но чуток не в ту сторону

Когда я говорил про "перепродажу лимита", я имел в виду сообщество тех, кто скупал паки по 200 баксов и потом продавал их как Прокси, давал доступ другим (куче OpenClaw) по подписке, при этом занимаясь внутри себя просто агрегацией разношерстных запросов и перенаправлением их на сервера Антропик на пакет собственных подписок

Иметь много подписок одному человеку - уже незаконно.
А перепродавать свои подписки другим через организацию для них ЛЛМ-Прокси - незаконно вдвоейне.

И это все сверх того, что эти пакеты составлялись под ожидание, что люди будут их расходовать не полностью. Тут антропик все же "лукавит". Пакет 200$ человек покупает, когда ему существенно не хватает пакета 20$ и пакета 100$. Я счатаю, что тот, кто осознанно купил самый дорогой тариф, чаще всего будет его выбирать досуха. Сейчас генерировать задач на нон-стоп работу в Клод Коде - не проблема для любого человека. Так что "расходовать лимит полностью" - это была изначально глупая ставка от Антропик. Почти никто не возьмет тариф 200$, чтобы не расходовать в нем хотя бы двойную норму от 100$ тарифа. А скорее всего такие тарифы расходуются полностью большинством пользователей

а вот это уже звучит... "фатально" или "фаталистично"... в общем грустненько -))

кармы нет лайкнуть -)) Лови лайк комментарием =)

поддерживаю,

Пока там все так жалуются на потерю трафика, я за 2 цикла качественных статей (одна на 7 глав, вторая на 4 главы) вывел сайт в топ-3 по выдаче в гугл-овервью. Просто нужно пересмотреть подходы к редактуре и понять... что "куча воды" сейчас "топит сайт"

Те, кто "мыслит SEO" - сейчас безнадежно отстал. Те, кто мысли GEO / AEO / LLMEO - сейчас собирает столько переходов без всякой рекламы, сколько ему и не снилось раньше.

ну так есть в ходе обсуждения много задач по типу "разбери то", "суммаризируй материал", "найди файл", "подготовь вводную".

не каждый запрос касается "создай новый модуль" или "создай большой тестовый скрипт".

Даже обыченые "напиши ответ в телеграмм", "посмотри логи ошибок и суммаризируй их мне в чат", "запусти уже разработанный файл и напиши результат".

Серьезные задачи, требующие "сложного мозга" ну не могут идти 100% времени. Человеческий мозг не способен работать в таком режиме, он просто не успеет за таким мозгом.

Я уверен, что если эффективно распределять задачи по моделям, то "большой брат" потребуется 30-40% времени, а маленькие справятся с 40-50%. Еще 10-20% будут "под вопросов", такие задачи скорее зависят от сложности задачи и качества промпта. Если промпт хороший, то маленькая справится. Если пользователь ленится, то нужны большие.

Понятно, что это утрирование ситуации. Однако суть замечания в следующем: если пользователь считает, что все его задачи нужно отправлять только в Опус, то он, скорее всего, просто "не чувствует разницы между Опус и Хайку". Хайку обладает всеми теми же знаниями, что и опус, но он хуже решает "сложносоставные задачи", всего-то.

(рекомендую прям с ИИ же и обсудить вопрос "как усваивается материал человеческим мозгом")

попробую еще раз донести.

В чем главная проблема "ии-контента"? Он "гладкий" и "пластиковый". В этом контенте просто сама суть (которую как раз ты и сжал в промпт). Но как ИИ эту суть "распаковывает"? Он тупо добавляет воду, добавляет "банальные и предсказуемые" вставки. Такой контент читается... как бы правильно сказать... "с ощущением скуки на лице".

Скука - эта та эмоция, которая вызывает "-1" в оценке, а не "вау, как круто!". Скука - не заставляет "переосмыслить". Скука - это значит, что мозг по ходу чтения "предсказывает продолжение"... и оказывается прав. Это и есть вся проблема ИИ-контента.

Эмоции, открытия, необходимость "подумать" - это двигатели Запоминания. Только эмоциональный текст (который вызывает эмоции у читателя) запоминается реально. Только текст, который содержит недосказанности, неожиданные вставки, неожиданные повороты может заставить "мозг захотеть его переосмыслить".

Человеческая память управляется эмоциями. Безэмоциональное повествование, это "в одно ухо влетело - из другого вылетело".

Ты можешь сколько угодно "распаковывать текст обратно в 100%", но ты при первом сжатии потерял все "повороты мысли автора", "всю вложенную в статью боль", "все шутки и отступления автора". Для ИИ-архиватора все это не имеет смысловой нагрузки. А для человеческого мозга статья без этих отступлений - банальна и скучна.

Любую книгу Донцовой можно сжать во фразу "убийца - садовник". Но можно ли ее распаковать в такой же, продаваемый и покупаемый, детектив?

ну если агент отправлял в опус даже задачи, с которым хайку справится... просто потому, что за 200 баксов получался лимит, который можно расходовать без перерыва... то, вероятно, пусть и больно будет звучать... но решение Антропик просто научит относиться экономичнее к выбору модели и настраивать маршрутизаторы.

Я не могу себе представить такой режим и характер работы, чтобы ежедневно требовался только Опус и никто больше...

Не-е-е... Это не пластырь... Заставить сомневаться, а если быть более точным, то "заставить явно выписать ключевые контраргументы и разобрать их" - это ЕДИНСТВЕННЫЙ шанс и путь получить от модели не "самый простой пусть с тунельным зрением", а "реально приближеный к истинной версии вариант"

И причина тут в регрессивной структуре ЛЛМ - предсказателе будущего токена

У них нет в голове "критика", который говорит "проверь все". На следующем токене они помнят только... предыдущие

Если заставить модель "Выписывать сомнения", то любое выписанное опровержение уже меняет следующий предсказываемый токен. Модель не может просто следовать тунельному зрению, если в тексте выписываются прям сейчас токены, которые этот вариант расшатывают

А если заставить выписать контраругмент и заставить его явно подтвердить (проверить и подтвердить разумность контраргумента), то ты фактически блокируешь тем самым прошлый "уже некорректный" вариант. Ее же натура не даст идти по пути, который в текущем тексте уже опровергнут.

Это не пластырь... Это просто понимание сути алгоритма предсказания ЛЛМ.

---

И в обратную сторону. Мы, читая текст, по ходу в голове параллельно его проверяем "Критическим мышлением". Мы можем следить за повествованием и придумывать контраргументы, сверяя с собственным ходом мысли. У модели, которая просто читает прямое доказательство с тунельным зрением и без доли сомнения в тексте.. Просиходит только подтверждение одной и той же гипотезы.

вопрос в том, как этот контент усваивается.

Продолжу твою логику. зачем писать промпт, если можно вообще все написать на псевдокоде? Это самый сильный вариант сжатия смысла. Только он "не понимается человеком".

чтобы статья "запомнилась", она должна "резонировать" с читателем. Он должен ее "переживать", "чувствовать".

А чтобы человек еще и запомнил мысли из статьи, ключевые места должны не только вызывать "эмоции" у читателя, но еще и заставлять иногда "завершить вывод самостоятельно".

Без эмоций текст не интересен
Без когнитивного трения мозг не запоминает

А эти две составляющие невозможно сжать качественно промптом. Одна и та же мысль, написанная "с чувством" и "просто текстом" даст абсолютно различные эффекты в голове читателя.

хочу задать провокационный вопрос... А не потому ли у изданий пропал трафик, что у них куча маркетинговых и водянистых статей?

В ИИ-самари, если человек видит "полезный текст", который "отвечает на его вопрос" - он вполне себе переходит к источнику.

А зачем переходить на площадки, которые просто платят журналистам и авторам за "воду в статьях"? Такие статьи даже в саммари, скорее всего, не попадают. Хотя раньше такие издания из-за количества ссылок и SEO могли высвечиваться в первой 10ке ссылок...

Резюме: Иногда нужно задуматься, почему перестали кликать на ссылки. Если вся "суть статьи" вполне умещается в три строки саммари, то может и не нужна такая статья в интернете?


---

P.S. Переход от проблем агрегаторов статей к наводнению ИИ-контентом немного натянутый. Мне кажется, что это две совсем разные проблемы. ИИ-контент для ИИ-саммари почти не существует. И он не вытесняет никого с рынка ссылок. Ссылки пропадают из выдачи только если в них нет реально ответа на запрос пользователя, или ответ там не раскрыт так, чтобы пользователь захотел перейти. Или если пользователь в реальности задает "другой вопрос".

1) За математический разбор - спасибо. Вполне полезно

2) За отсутствие комментариев к формулам (а точнее к формулам только "математические комментарии")... Ну не замечание, а скорее "упрек". Очень интересно, но нифига не понятно -)

А вот за то, что материал оценен на уровень "Средний" - отдельное "Браво"! Что же вы тогда оцениваете на "сложный уровень"? Чистые формулы квантовой физики без комментариев?

Facepalm...

За бугром разрабатывают AI-video стриминг... А у нас... Наклонное видео для просмотра лежа...

Помнится Лебедев через ИИ в своей дизайн-студии продвигал "наклонный текст как в 2000 году" (причем без права вносить правки в дизайн), сейчас он добрался до видео-проигрывателей в ВК, а идеи все те же -)

Информация

В рейтинге
Не участвует
Откуда
Вьетнам
Дата рождения
Зарегистрирован
Активность

Специализация

Ontology Engineer, Архитектор 1С
Ведущий
От 5 000 $
ООП
Базы данных
Алгоритмы и структуры данных
Проектирование баз данных