Обновить
61
Илья@proxy3d

нейробиология, нейронные сети, AR/VR

0,4
Рейтинг
25
Подписчики
Отправить сообщение

Вы правы так и есть, это и есть марковские цепи. Но, они иерархические. И их иерархия закодирована в механизме внимания, который связывает дальние зависимости на расстоянии D. Как раз, то что и показывает собранная статистика выше. Без этого, мы получаем просто классический RNN с быстрых затуханием марковской цепи без иерархии. То о чем вы сейчас говорите это классический RNN. Но без иерархии, марковская цепь быстро исчезает, ее вероятность становиться очень-очень маленькой. Система нашла выход из этого, через разрывы марковской цепи, когда они не различимы с равномерным распределением. Но чтобы не потерять связи между разрывами, они связаны через иерархию, сегмент верхнего уровня. Тут не ни какой магии.

Это не число рекуррентных шагов, это именно иерархия. Одним слоем он не описывает иерархию. Хорошо, напишите новую статью, так как пока что я не вижу возможности с помощью него описывать динамические иерархические структуры, которые кодируют марковские цепи на каждом уровни иерархии. Это значит, что они должны оказывать влияние не только не предыдущий элемент на текущем уровне цепи, но и на соседний элемент на нижнем уровне цепи (то есть на целый сегмент). И при этом делать эту аппроксимацию эффективно, а не в лоб как большая матрица статистики с прямыми связями (слишком гигантские матрицы получаются).

Они показывают, что вероятности для текста имеют иерхаическую структуру

Марковская цепь: мама = p(м) -> p(а|м)-> p(м|а)-> p(а|м), то есть зависимости на расстоянии d=1 между соседями. Это перцептрон может уловить.

Но в реальности, связи образуют иерархию. Это приводит к тому, что d=1 а может быть равен d=4 (например последняя А связана сильнее с первой М, а не с соседней третей М). Именно это и отображает график. Собрана статистика по частоте пар на разном расстоянии. Например первые пары там пробел-пробел, пробел-о и так далее. И видно как меняется их частотность с расстоянием, когда между ними есть другие символы. Это и есть отражение иерархии через верхние уровни, которые позволяют связывать дальние элементы. Перцептрон не может описывать иерархии, с помощью него мы можем получить через аппроксимацию классическую марковскую цепь.

Я пока только делаю публикацию теорем. Тут можно посмотреть их

https://disk.yandex.ru/d/b8fr7DIiT23AGA

Адаптировал доказательства под нейронные сети, чтобы можно было прогнать через них и проверить. Теорема R.1 связывает с Лагранжа, а R.4 связывает в backpropagation.

Затем на этом строятся теоремы о бифуркации (моменте разрыва марковской цепи из-за неопределенности)

https://t.me/greenruff/2462

и затем уже связь с иерархией, как построение иерархии разорванных марковский цепей (сегментов).

https://t.me/greenruff/2465

https://t.me/greenruff/2466

https://t.me/greenruff/2469

Предлагаю вам подкреплять ваши слова. Выше я привел собранную статистику для подкрепления, когда проверял мат. аппарат. Насчет интерпретации в MLP работы backpropagation: это балансирование системы между стоимостью затрат и энтропией через Лагранжа (принцип наименьшего действия Лагранжа ). backpropagation выводится именно из него.

С одной стороны вы правильно указали на иерархию, что LLM важную роль играет иерархическая связь. Но потом вас унесло куда-то не туда.

Сейчас как раз доказываю теоремы об иерархической структуре данных и их построении. Как раз проверял их на текстах.

самый частый пробел-пробел, но его вероятность увеличивается с расстоянием, а не в начале (два пробела в начале реже встречаются).
самый частый пробел-пробел, но его вероятность увеличивается с расстоянием, а не в начале (два пробела в начале реже встречаются).

Выше изображены вероятности следования букв на расстоянии D друг от друга. В классической марковской сети - это расстояние только между соседями. В случае иерархической, разные уровни иерархи разбиваются на сегменты (каждый небольшая марковская цепь), которые так же связаны с соседним сегментов на текущем уровне и с последовательностью элементов из которых состоит соседний. На сборке статистики это как раз видно, чтоб вероятности между двумя "символами" не убывают монотонно, а имеют волнообразный затухающий вид. То есть если у нас есть буква "В" и вероятность следующей "А" как соседней (В -> 0 символов -> А) равна 0.02, но при этом вероятность "Е" на расстоянии D=5 (5 символов назад: Е -> 5 символов -> В -> Е) равна 0.08, то мы получим ВЕ а не ВА.

Это визуализация статистики частоты переходов символов на расстоянии от 0 до 20, а не только соседних.
Это визуализация статистики частоты переходов символов на расстоянии от 0 до 20, а не только соседних.

Тут это немного лучше видно.

Перцептрон в классическом виде не может обеспечить полноценную иерархию связей.

Например, тот же трансформер через механизм внимания "проецирует" иерархию связей на плоское контекстное окно. В этом плане перцептрон не реализует и не может полноценно реализовать необходимую архитектуру.

Практически перестал использовать ChatGPT, так как он стал сильно тупее. Что в разработке, что в рассуждениях. Qwen, Gemini дают более качественный результат. Deepseek любит придумывать, если не знает. Qwen меньше, но тоже грешит этим порой. Поэтому используешь сетки, только когда сам знаешь ответ и рассчитываешь сократить черновую работу. При такой постановке задачи от ответов ChatGPT ждёшь правильных предсказаний кода или ответов. Как по мне, качество моделей openai сильно упало. Может на бенчмарки они натаскали хорошо, но в обычных задачах просели (хотя и раньше было далеко не идеально).

Так современные LLM не справляются с нормальными задачами. Приведу пример, мне вчера надо было сконвертировать в базе на Postgres в заглавный регистр все названия таблиц, полей, процедур и функций, операторы вставки/обновления/удаления и удаления. Я потратил час-два, пытаясь добиться от разных LLM этого. Ни одна даже близко не справилась, прям полное фиаско. Внутри функций и процедур вообще кошмар, в других местах элементарно не учитывает название схем и правильно кавычки. Все написанные ими парсеры тоже дали плачевный результат. При чем тот же OpenAI анализирует и проверяет и выдает код, но когда смотришь его - там бред.
Как итог, пришлось все делать самостоятельно и через час сделал. То есть на сетки потратил больше, чем мог бы сразу сам.

Другой пример, мне надо было перенести на реализацию кода набор теорем. Да, код сгенерировал и он вызывается и даже выдает, но в нем куча ошибок. И гоняя повторно по кругу, он все уходи в разнос. Такие прогоны одной функции могут занять больше получаса, когда самостоятельно можно написать быстрее. И то, каждый "удачный" прогон, где он пишет что ошибок нет, надо проверять лично. Так как там в 99% есть ошибки. И это отнимает и силы и время.

О какой замене на LLM может идти речь? Возможно json он распарсит, это простая задача даже для тех кто слабо знаком с разработкой, так как встречается часто и есть множество удобных инструментов для этого, которые позволяют мне сделать это в несколько строк на разных языках разработки.

И вы предлагаете дать сетке генерировать бух проводки? Он вам такое наделает. Я когда составлял таблицу для сравнения добавляя в нее значения в запросах, он легко мог начать их путать уже на 15 строчках, выкидывая детали. И оказывается что Excel гораздо более удобный и надежный.

Такие эксперименты были и не один. Смысл как раз в том, что они не беседуют мило, но постепенно выпустив пар начинают конструктивный диалог.

https://vk.com/video-52526415_456242434?t=2h16m54s

тут отрывок про один из экспериментов, скрестили чернокожих "черные пантеры" и белых (закончился провалом, но как раз из-за того, что организация черных пантер увидела что вместо революционного настроя люди стали спокойнее).

Так же был такой эксперимент с монастырем одним (можно поискать), тоже скрестили послушниц из женского монастыря с общением с обычными людьми (в итоге монастырь опустел).

Так что подобных экспериментов было не мало. Другое дело, что все они были контролируемые (чтобы ни кто не пострадал), поэтому люди говорили все что думают не опасаясь за свою безопасность.

А теперь, после того как LLM выдала вам ответ, попросить ее проверить его на ошибки. Найти слабые стороны ответа. Написать ответ-критику.

И то, что до этого вы считали верным (опираясь на LLM), вам выдаст тонны обратных утверждений. Но если будете пытаться переубедить сетку, то она снова выдаст вам аргументы за.

На самом деле это заметно снижается галлюцинации.

https://t.me/greenruff/1757

https://t.me/greenruff/1740

Смысл тут следующий. Случайный выбор токена с учётом top-k и температуры (ошибки в обучении мы не берём в расчет) влияет на предсказание цепочки в ответе. При чем правильный ответ не всегда может соответствовать самому обобщенному. Есть спорные ответы.

В свое время в чате сберкомьюнити разбирали это. Я тогда предложил подход описанный по ссылке и затем сделал проверку через код (народ проверял вручную). В моем случае, использовалась белуга 7b и спорные вопросы. Так вот, использование даже одной модели, но с разными параметрами существенно улучшает результат. Если в данных модели где то "запрятан" ответ, то его выдаст при определенных условиях.

Там главное было ещё в том, что правильность или не правильность оценивалось не только по ответу, но и по объяснению почему был дан такой ответ. Это позволяло отсеит слабые размытые ответы, не по теме.

Но тут важно было чтобы все модели были равные. Баланс. Иначе слабые модели могли просто "отсчюечь" ответ сильной модели, или другие критерии. Постепенно, цепочка оставляла только одного победителя и его ответ принимался.

Это чем то похоже на рассуждающие модели, но с той разницей что их много и оценка даётся не только ответу, но и аргументации ответа, создавая турнирную цепочку.

Проблема тут была в том, что это очень дорого и медленно. Для 10-и LLM время ответа могло быть 30 минут. Ресурсов это тоже съедало очень много. Поэтому для простых вопросов это очень дорогой подход.

Это работало, как своего рода метод Монте Карло. Когда мы считаем что ответу могут быть случайными, но с одной разницей - правильны ответы должны выдаваться чаще чем не правильные. Поэтому данный подход снижает вероятность получения неверного ответ, так как каждый раз мы выбираем наиболее "верный" (набравший больше всех подтверждений правильности).

Так что в целом подход к статье верный. Не знаю учитывает ли он нюансы описанные выше.

Я привел ссылки, исходники, результаты. Вы же просто порождаете бессмысленный флуд.

Вы не понимаете связь с Loss, даже на скриншоте вы увидели только часть смысла. Вам дают примеры где можно открыть исходники, запустить. Дают объяснение почему и как, как к этому пришли. Выстраивают на этом математически обоснованную математическую теорию, которую можно проверить. Проверяют каждый шаг на противоречия другим моделям, а так же на практических примерах.

Я не готов продолжать диалог, так как вы показали, что у вас нет компетенций ни в области нейронных сетях, ни достаточных знаний в математике. Вы нахватались каких-то поверхностных знаний. Поэтому с вами невозможно вести равный диалог из-за отсутствия у вас знаний в предметной области.

1) если бы вы зашли в комментарии по ссылке с арбитрами, то увидели бы что суть теста был не в том что модель становилась умнее, а задача была снизить галлюцинации моделей. Там есть примеры и результаты, есть исходный код который вы можете проверить.

2) Теперь про curriculum learning - дальше скриншота видимо не пошли, ну ок. curriculum learning лишь перекликается с этим. В данном случае это расширение подхода от эмпирического к математического, через расчет энтропии марковских цепей и постепенном усложнении структуры (за счет включения новых блоков при обучении). Скриншот был о другом - о том, что даже стандартные оценки порой не отражают правильно ошибки. И объяснил почему так.

Насчет выкладок, я делаю примеры и выкладываю, чтобы каждый мог проверить. В вашем случае, я пока не увидел того, что вы разбираетесь в теме и понимаете ее. Ваши рассуждения носят поверхностный характер и говорят о том, что в обучении моделей, в теории вероятности, теории информации и других разделах математики вы плохо разбираетесь. Иначе не несли бы чушь, которую написали выше.

Во первых, я привел вам пример с Loss для наглядности. Так как рассуждения и стиль моделей отражаются их Loss в обобщению данных на которых они были обучены. Поэтому, когда модель грубо сравнивает стиль со своим, это отражения сравнение Loss двух прогнозов токенов. Не 1 в 1, но отражает их сравнение. Поэтому, раз вы этого не поняли, я перешел на более понятный для вас подход.

Насчет конфигурации, то я не просто пробовал. А строил на этом подходе рассуждающую модель со множество арбитров, где судьями выступали сами LLM - с целью снижения галлюцинаций. Замечу, что это был ансамбль множества разных LLM. И даже выкладывал код (в комменатриях).

https://t.me/greenruff/1756

Сейчас у меня он переписанный под крупные модели включая ChatGPT, DeepSeek и другие. Поэтому да, я могу утверждать, что все что написано мной выше верно. Нельзя вот так в лоб делать сравнение на любой случай. Мы получаем мусорный бенчмарк. Максимум мы можем усреднить этот показатель, и сравнивать с усреднённым при условии равнозначных моделей в ансамбле при оценке.

https://t.me/greenruff/2457

К сожалению глобальный Loss и другие такие метрики, тоже не панацея.
На примере выше видно, что при правильном обучении модель начинает быстрее выделять структурные связи. Но Loss это не отражает, по той причине что стандартные критерии оценки Loss не умеют давать оценку иерархический моделей. А текст отражает именно иерархию признаков.
Поэтому высокочастотные слова дают меньше Loss, а более правильная структура построения выдает хуже Loss.
Это для наглядности, чтобы было понятно, что пограничные условия при сравнении равных моделей без правильного понимания, как это работает - бессмысленны.

Теперь что касается математической строгости. Это не нытье. В отличии от вас, я занимаюсь этим https://t.me/greenruff/2469

Поэтому могу сказать на основе доказанных теорем (которые можно легко проверить), что есть более точные критерии для сравнения моделей по энтропии. А не как в данном бенчмарке, который не имеет отношения к реальным данным. Любое действие должно быть обоснованным и доказанным. Я пока не увидел от вас ни одного обоснования, у вас все смешалось в кучу и синтетические данные, и экстраполяция бенчмарков и другие утверждения.

Вы понимаете, что все сильнее закапываете себя? Я привел Loss в качестве примера для наглядности и понимания в целом. Так как он отражает их обобщение между данными при обучении и обобщенными самой моделью.

Если на более поверхностном, то если одна модель выступает судьёй для другой, то её оценка неизбежно смещена в сторону её собственных представлений и формулировок. То есть она “выбирает” то, что похоже на её собственный стиль ответа. Получается не абсолютная оценка “качества”, а метрика “похожести на суждения судьи”.

Если мы сравниваем маленькую модель с большой, то в роли судьи можно взять большую модель. Тут предполагается, что она в среднем ближе к человеческим стандартам (лучше знает грамматику, логику, структуру).

Для варианта выше используют более строгие методы:

  • люди-эксперты или обычные пользователи дают оценки.

  • пользователям или “судье” показывают два ответа и они выбирают лучший - это уменьшает смещение.

  • несколько разных моделей оценивают и усредняют.

  • агрегированные метрики: например, измерение фактической точности (правильные факты против галлюцинаций), то что я написал на примере Loss (как одной из возможных оценок - и даже он не показатель)

Но что хуже, это то что строгих "теорем правильности" у этого подхода нет. Есть лишь эмпирические работы, показывающие, что оценки крупных моделей коррелируют с человеческими (есть исследования про корреляцию 80%). Но это всё статистика, а не строгая теория.

Так что судейство одной моделью — это в лучшем случае приближение. Более того, это не строгий критерий, а эвристика.

Для крупных моделей между собой — почти бессмысленно!!!

Видимо в танке именно вы, раз не понимает как происходит оценка при сравнении ошибки и что модели прогнозируют обобщенные данные на которых их обучали.

Иными словами, если одну модель вы научили обобщать Коты - это пушистые животные, а другую Коты - это домашние животные. То ваша попытка оценить обе модели через одну, приведет к некорректным результатам. Это значит, что вы не понимаете о чем пишете. И не важно, что сейчас наплодили кучу таких бенчмарков. Сейчас и статей сгенерированных сетками много.

Возвращаясь к пример. У нас есть

Модель 1: Коты - это пушистые животные

Модель 2: Коты - это домашние животные

Теперь мы с помощью Модели 1 сравниваем результат. Конечно модель 1 выдаст loss близкий к свои обученным данным, и безусловно будет более сильное расхождение с моделью 2 по Loss. Но это абсолютно не значит, что модель 2 проигрывает модели 1. В данном случае сравнение таким образом совершенно некорректно и неверно. То что подобные вещи плодят в интернете, не делает их ценными. А лишь говорит о том, что люди, которые их публикуют не понимают о чем пишут.

То о чем вы пишите, это когда разница между сетками огромная. Когда допустим у вас 70b модель и 7b модель, и вы путаетесь сравнить построение структуры и связанность данных в ответе.

Затем модель оценки ( gpt-5 ) анализирует каждый чат и регистрирует каждое проявление защитного и рискованного поведения, определённого в рубрике, присваивая каждому результату оценку интенсивности от 1 до 3.

Оценку делала GPT-5 и он выбрал лучшим GPT-5? Скажите, зачем делать публикацию бенчмарка, где оценка является мусором из-з необъективности.

Вас не смущается такой подход:

1) Обучили модели M1, M2, M3 определению, кто такой кот. У каждой определение немного отличалось.

2) с помощью модели K, мы задаем вопрос моделям M1, M2, M3 кто такой кот.

3) оценивать результат моделей M1, M2, M3 будет модуль M1 (судья).

Как вы думаете, где разница ответов между судьей M1 и ответами M1, M2, M3 будет минимальный? То что вы привели - это мусорный бенчмарк имеющий отрицательную пользу.

У вас он не теряет контекст? у меня он теряет контекст уже последних сообщений и суммирует только последнее, игнорируя вклад прежних (часто такое замечаю) у Gpt 5 Thinking и Gpt 5 Thinking-mini. При чем делает это рандомно, то захватывает (вроде), но чаще нет. Хуже еще то, что он порой игнорирует последнее сообщение и словно продолжает мысль предпоследнего (пока не понял как с этим бороться).
У меня получается каждый раз рандомный результат по качеству. Без Thinking вообще выдает ерунду полную, типа да это теорема без нормальных разборов доказательства, но иногда разбирает. Получается какая-то рулетка.

И еще, появились орфографические опечатки в словах, чего раньше не наблюдалось. И сокращения слов в перемешку с английскими словами.

Не знаю, мне не везёт на задачах или gpt-5 как комплекс заточен под житейские вопросы вроде как мне жить и в какой фазе луны воздействие Меркурия положительно скажется на финансах. В моих задачах gpt-5 на всех режимах (включая рассуждающие) превратился в какое-то дно. Стараюсь все реже его использовать теперь.

Это только у меня так (много математических задач, проверок теорем, нестандартные задачи для кода)? Или у кого то он тоже на задачах сильно просел? Приходится использовать deepseek, Gemini, qwen. (Grok 4 тоже делает то херово то средне).

У кого другая статистика, где у кого-то gpt-5 и grok показали наоборот более качественные результаты?

Я подозреваю, что это НИИ который вход в концерн роснано (или как написано Ростех). Если я прав, то это технология была разработана ещё в советское время (не знаю дорабатывали ли ее потом). Она основана на цианакрилатной основе с разными основами уф и другие. Когда искал пленку для проекта тянущиеся электроники, то общался с ними много раз. Они даже тех описание присылали. Они производили это для военки, чтобы изолировать плата от внешнего воздействия (например пленкой покрывается плата, чтобы быть защищённой). Но из-за их пофигизма образцы так и не получил, морозились то праздники, то отпуска, то болеют. Там была пожилая женщина, которой было фиолетово на все. Мне пленка была нужна как подложка. Но делают они не только в виде пленки. В итоге быстрее было договориться с китайцами и получить от них.

Так что как я понимаю, это Владикавказского НИИ (если я правильно написал по памяти), помню что с Кавказа чему очень тогда удивился. Но в РФ данным производством занимались именно они.

Хотя конечно может быть других, но пообщавшись со всеми НИИ в РФ насчёт клеев и плёнок, других нет.

Информация

В рейтинге
2 470-й
Откуда
Москва, Москва и Московская обл., Россия
Зарегистрирован
Активность