все так и есть ) В экспериментах на обычном семантическом энкодере мне удалось обучить декодер с ppl~1.5 Причем это был не предел, просто вопрос вычислительной стоимости дальнейшей "полировки".
Полностью согласен, конечная генерация должна быть в токенах. Именно поэтому в одном из своих экспериментов по построению модульной LLM (статья была на Хабре), я отделяю язык, как интерфейс, от мышления. Энкодер/декодер и ядро - отдельные модели.
конечно, равно как и от символов. Но мы не должны делать их конечной формой представления - именно это и делает архитектуру дорогой во всех смыслах. Токены и были придуманы, чтобы сделать архитектуру дешевле. Но масштабировать дискретный словарь бесконечно - невозможно. И нужно переходить из дискретного в непрерывное латентное пространство представлений, чтобы иметь возможность дальше повышать абстракцию представлений.
Мы не думаем словами. Речевая зона коры, и это уже доказано, выступает в роли декодера, который переводит внутреннее скрытое состояние в речь. В этом плане ее функционирование похоже на авторегрессивную генерацию. Но она не "думает", а получает готовые паттерны для выражения.
Если посмотреть на структуру финансируемых у нас в России проектов, то все становится предельно ясно - преимущественно прикладные задачи, с доказанной экономикой. Никто не хочет брать на себя ответственность по финансированию фундаментальных исследований с неясным результатом. По идее этим могли бы заниматься университеты, но те также сидят на аналогичных прикладных грантах, круг замыкается.
Проблема не столько в трансформерах, сколько в токенном представлении. Ключевая проблема, как мне видится, именно в этом. Но будет ли новая прорывная архитектура трансформерной или нет - вопрос открытый.
Маркетпэйсы - паразитический бизнес. По сути это должны быть логистические сервисы с понятным, прозрачным и, самое главное - предсказуемым ценообразованием, а по факту запускают руку в карман бизнеса продавцов, пунктов выдачи. И что самое худшее - абсолютно непредсказуемые и непоследовательные, что в условиях их глобального доминирования просто разрушает мелкий бизнес.
Тоже интересно ) Но сначала нужно как минимум собрать датасет под дообучение адаптера, чтобы извлекать из латента нужные параметры в явном виде. И собственно дообучить сам адаптер. Сейчас эксперимент показал, что модель формирует такие оси, теперь впереди достаточно большая работа по их интерпретации.
Эквивалентность только на общем функциональном уровне - генерировать текст ) А фактически эта модель - модульная. Энкодер и декодер отделены от "мышления" и выполняют только свою узкую функцию. Условно говоря, я могу оставить их и заменить ядро на более мощное или с другой архитектурой. Больше возможностей для экспериментов. Тем более, что обучение ядра - более легкий процесс. Кроме того, ядро в этой модели - отдельный языковой модельный процесс и он в латентном языке, а не в токенах. Т.е. обычная модель за проход должна выбрать следующий токен, а данная - формирует латентный "образ", описываемый 50-150 токенами. Конечно у такого подхода есть свои подводные камни и их немало уже попалось за время экспериментов и думаю еще будут, но на данный момент я убедился, во всяком случае для себя, что подход рабочий и буду его дальше развивать.
При ограниченных ресурсах обучать легче модульную систему. Каждый модуль в отдельности - более легкая модель.
Когда получится завершить архитектурные отладки и более-менее полноценно обучить модель в эквиваленте хотя бы 2 млрд параметров, то планирую ее протестировать на разных открытых бенчах и сравнить уже объективно. Но до этого еще очень много работы. В любом случае, если будут интересные результаты, планирую публиковать подобные обзоры.
извиняюсь, похоже не сразу понял суть вопроса ) Видимо речь о ядре модели? Да, там трансформер, который по последовательности латентов предсказывает следующий.
На эксперименты, как уже написал, ушло полгода. Но это в режиме "хобби": вечера, выходные. А если брать чистые финальные результаты, то суммарно около 120 часов (декодер+ядро) на одиночной 5090. Больше всего времени уходит на обучение именно декодера, примерно 3/4 от всего.
Вы опять же смотрите на популярную интерпретацию и присущую ей форму в виде пирамиды. Отсюда ваша критика. Еще раз повторюсь - информация не "переходит" в знание, иначе бы какая-нибудь CRM система в ходе своего развития вдруг стала бы проявлять признаки появления интеллекта, но это невозможно. Это разные онтологические плоскости. Концепцию нужно читать как различие уровней интерпретации, а не как иерархию абстракций.
Он, как статистическая машина, просто выдает вам популярную интерпретацию, которой, очевидно, вы также придерживаетесь, судя по комментариям выше. Именно поэтому я рекомендовал вам глубже ознакомиться с концепцией, тем более с вашим образовательным и научным бэкграундом вам это не составит большого труда и все вопросы, я надеюсь, будут сняты.
Фактически это определение очень удобное для обывателей, но искажает саму суть. Модель DIKW описывает не процесс преобразования, а различие уровней абстракции и смысла.
Все верно, и не будет. Потому что это эпистемологическая модель, а не вычислительная модель конвейера по переработке данных в мудрость ) Отсутствие математической базы не делает её бесполезной — ровно так же, как отсутствие формальной математики у понятий "данные"/"информация"/"знание" не отменяет их инженерной применимости.
В DIKW знание не выводится из информации алгоритмически - информация и знание действительно принадлежат разным уровням (синтаксис/семантика). Ошибочно понимать концепцию DIKW как конвейер по переработке информации в знание. Это прежде всего различие уровней описания - информация и знание это разные "миры" и концепция это как раз и фиксирует, а не отрицает. Просто многих в заблуждение вводит упрощенная пирамидальная форма изображения концепции.
Это очень хорошо. Только речь была не об определении информации, а об информационной иерархии. Остальное сказанное - какая-то смысловая окрошка. Сначала заявляете, что концепция DKIW – полная хрень, причем в очень странной, для человека с высшим образованием и опытом научной деятельности, манере. А следом, своими словами, рассказываете основы этой же концепции, разделяя данные, информацию и знания.
все так и есть ) В экспериментах на обычном семантическом энкодере мне удалось обучить декодер с ppl~1.5 Причем это был не предел, просто вопрос вычислительной стоимости дальнейшей "полировки".
Полностью согласен, конечная генерация должна быть в токенах. Именно поэтому в одном из своих экспериментов по построению модульной LLM (статья была на Хабре), я отделяю язык, как интерфейс, от мышления. Энкодер/декодер и ядро - отдельные модели.
конечно, равно как и от символов. Но мы не должны делать их конечной формой представления - именно это и делает архитектуру дорогой во всех смыслах. Токены и были придуманы, чтобы сделать архитектуру дешевле. Но масштабировать дискретный словарь бесконечно - невозможно. И нужно переходить из дискретного в непрерывное латентное пространство представлений, чтобы иметь возможность дальше повышать абстракцию представлений.
Мы не думаем словами. Речевая зона коры, и это уже доказано, выступает в роли декодера, который переводит внутреннее скрытое состояние в речь. В этом плане ее функционирование похоже на авторегрессивную генерацию. Но она не "думает", а получает готовые паттерны для выражения.
Если посмотреть на структуру финансируемых у нас в России проектов, то все становится предельно ясно - преимущественно прикладные задачи, с доказанной экономикой. Никто не хочет брать на себя ответственность по финансированию фундаментальных исследований с неясным результатом. По идее этим могли бы заниматься университеты, но те также сидят на аналогичных прикладных грантах, круг замыкается.
Проблема не столько в трансформерах, сколько в токенном представлении. Ключевая проблема, как мне видится, именно в этом. Но будет ли новая прорывная архитектура трансформерной или нет - вопрос открытый.
Маркетпэйсы - паразитический бизнес. По сути это должны быть логистические сервисы с понятным, прозрачным и, самое главное - предсказуемым ценообразованием, а по факту запускают руку в карман бизнеса продавцов, пунктов выдачи. И что самое худшее - абсолютно непредсказуемые и непоследовательные, что в условиях их глобального доминирования просто разрушает мелкий бизнес.
Тоже интересно ) Но сначала нужно как минимум собрать датасет под дообучение адаптера, чтобы извлекать из латента нужные параметры в явном виде. И собственно дообучить сам адаптер. Сейчас эксперимент показал, что модель формирует такие оси, теперь впереди достаточно большая работа по их интерпретации.
Максимальная длина ограничивается по статистике строк из датасета. Остаток стандартно маскируется.
У LoRA совсем другие задачи. И это надстройка к существующей архитектуре LLM.
Эквивалентность только на общем функциональном уровне - генерировать текст ) А фактически эта модель - модульная. Энкодер и декодер отделены от "мышления" и выполняют только свою узкую функцию. Условно говоря, я могу оставить их и заменить ядро на более мощное или с другой архитектурой. Больше возможностей для экспериментов. Тем более, что обучение ядра - более легкий процесс. Кроме того, ядро в этой модели - отдельный языковой модельный процесс и он в латентном языке, а не в токенах. Т.е. обычная модель за проход должна выбрать следующий токен, а данная - формирует латентный "образ", описываемый 50-150 токенами. Конечно у такого подхода есть свои подводные камни и их немало уже попалось за время экспериментов и думаю еще будут, но на данный момент я убедился, во всяком случае для себя, что подход рабочий и буду его дальше развивать.
При ограниченных ресурсах обучать легче модульную систему. Каждый модуль в отдельности - более легкая модель.
Когда получится завершить архитектурные отладки и более-менее полноценно обучить модель в эквиваленте хотя бы 2 млрд параметров, то планирую ее протестировать на разных открытых бенчах и сравнить уже объективно. Но до этого еще очень много работы. В любом случае, если будут интересные результаты, планирую публиковать подобные обзоры.
извиняюсь, похоже не сразу понял суть вопроса ) Видимо речь о ядре модели? Да, там трансформер, который по последовательности латентов предсказывает следующий.
Нет, каждый сегмент текста изолированно. Используемый стандартный энкодер не может генерировать последовательность.
Датасеты открытые есть, но обучать на них - время, все больше упирается в вычислительные мощности. Поэтому пока эксперименты на ограниченном.
На эксперименты, как уже написал, ушло полгода. Но это в режиме "хобби": вечера, выходные. А если брать чистые финальные результаты, то суммарно около 120 часов (декодер+ядро) на одиночной 5090. Больше всего времени уходит на обучение именно декодера, примерно 3/4 от всего.
Вы опять же смотрите на популярную интерпретацию и присущую ей форму в виде пирамиды. Отсюда ваша критика. Еще раз повторюсь - информация не "переходит" в знание, иначе бы какая-нибудь CRM система в ходе своего развития вдруг стала бы проявлять признаки появления интеллекта, но это невозможно. Это разные онтологические плоскости. Концепцию нужно читать как различие уровней интерпретации, а не как иерархию абстракций.
Он, как статистическая машина, просто выдает вам популярную интерпретацию, которой, очевидно, вы также придерживаетесь, судя по комментариям выше. Именно поэтому я рекомендовал вам глубже ознакомиться с концепцией, тем более с вашим образовательным и научным бэкграундом вам это не составит большого труда и все вопросы, я надеюсь, будут сняты.
Фактически это определение очень удобное для обывателей, но искажает саму суть. Модель DIKW описывает не процесс преобразования, а различие уровней абстракции и смысла.
Все верно, и не будет. Потому что это эпистемологическая модель, а не вычислительная модель конвейера по переработке данных в мудрость ) Отсутствие математической базы не делает её бесполезной — ровно так же, как отсутствие формальной математики у понятий "данные"/"информация"/"знание" не отменяет их инженерной применимости.
В DIKW знание не выводится из информации алгоритмически - информация и знание действительно принадлежат разным уровням (синтаксис/семантика). Ошибочно понимать концепцию DIKW как конвейер по переработке информации в знание. Это прежде всего различие уровней описания - информация и знание это разные "миры" и концепция это как раз и фиксирует, а не отрицает. Просто многих в заблуждение вводит упрощенная пирамидальная форма изображения концепции.
Это очень хорошо. Только речь была не об определении информации, а об информационной иерархии. Остальное сказанное - какая-то смысловая окрошка. Сначала заявляете, что концепция DKIW – полная хрень, причем в очень странной, для человека с высшим образованием и опытом научной деятельности, манере. А следом, своими словами, рассказываете основы этой же концепции, разделяя данные, информацию и знания.