совершенно не важно какая будет итоговая случайная форма
Как это не важно, если вращение подгоняет вектор под гауссовское распределение. Именно под такую форму математически строится сетка квантования на 3-4 бита. При этом случайная матрица знаков обязательна быть определенной формы так сказать, иначе чистый Адамар в худшем случае может не размазать, а заново собрать пик.
важно только то, что вектор теперь входит в диапазон 3-4 бит.
Размазывая крупный выброс по всем измерениям, мы превращаем его в распределенный фоновый шум. Вектор начинает влезать в малый диапазон, но из-за этого шума проседает точность скалярных произведений в слоях Внимания. Т.е. важно то, насколько точным будет результат в слоях внимания, а не то что вектор теперь влезает в диапазон.
Видимо таки придется написать небольшую статью-гайд про квантование для малых объемов памяти.
В TurboQuant проблему выбросов решили через вращение Адамара.
TurboQuant использует случайное вращение векторов (метод PolarQuant), чтобы размазать крупные выбросы по всем измерениям. Т.е. повезет/не повезет размазать хорошо.
В общем есть теоретическое обоснование
Приведите ссылки, потому что практически проверки это не показывают.
И вы не со мной спорите, а с логикой работы механизмов квантования.
Я верю, что в отдельных тестах у вас что-то показало хорошее, более того у исследователей из Google тоже показало хорошее, вот только потом независимые проверки показали, что это хорошее относится к узкому набору академических задач и моделям БОЛЬШИХ размеров.
Нет, это не правда, TurboQuant не делает качество KV-кэша выше, чем у исходного формата bf16 просто потому что bf16 это исходная точность для большинства моделей, а TurboQuant дает сжатие с потерями.
Вы транслируете миф не разобравшись в вопросе.
При работе с очень длинным текстом (256K+ токенов) кэш в формате bf16 полностью забивает видеопамять (VRAM). Модель на bf16 либо падает с ошибкой Out Of Memory, либо вынуждена обрезать контекст и за счет этого проваливает задачу. TurboQuant сжимает кэш в 3-5 раз (до 3-4 бит на элемент), благодаря чему длинный текст влезает в GPU и задача успешно решается.
Также, на небольших выборках квантованная модель за счет шума квантования может случайно угадать на 1-2 теста больше, чем bf16.
В IT-новостях оба эти момента подают как TurboQuant превзошел несжатую модель!!!1.
А вы понимаете, что этим делаете лоботомию сети? V кеш еще можно квантовать в Q8, но K кеш должен быть в FP16/BF16. Точность K-кеша критически важна, это суть механизма внимания, в логике которого в конце идет softmax.
Softmax это экспоненциальная функция. Из-за экспоненты даже небольшая погрешность в K сильно искажает веса внимания и модель начинает смотреть не туда или теряет контекст.
Лучше квантуйте напрочь саму модель и урезайте леща длину контекста, вместо того чтобы трогать K кеш, иначе ваши модели будут галлюцинировать и зацикливаться выдавая мусор. А потом пользователи будут писать о том какие плохие модели, не могут ничего.
Квантование модели и квантование кеша это две большие разницы.
Каждый раз одно и тоже, люди используют гиперпарамтеры по умолчанию, потом у них то Qwen 3.6 27B галлюцинирует, то Qwen 3.6 35B A35 зацикливается, то Qwen 3.8 27B долго думает...
Что сложного в том, чтобы открыть, например, unsloth и прочитать:
Qwen3.8-27B is a hybrid thinking model with different default settings for thinking and non-thinking modes. Extra high is enabled by default so if you want shorter thinking traces, you can adjust the thinking effort:
От себя могу добавить, что рекомендуемые параметры точно работают для Q8 и BF16. Для Q4 и ниже уже начинается лотерея т.к. такие модели могут зацикливаться из-за накопленных ошибок.
Моя отдавать мысль нейронка а нейронка расписывать мысль, красочно и доступно, помогая читателю понимать идеи автора, даже те что он сам не смог сформулировать в моменте.
А эти статьи, которые вы так пишете, они с нами сейчас в одной комнате, на этом ресурсе?
Вы путаете хамство с сарказмом, но не суть. В любом случае, я не хотел вас обидеть и приношу свои извинения, если это произошло.
Я лишь наглядно показал, что в текущем виде вы и ваше приложение не проходите первичную проверку в ИБ никоим образом. И для меня немного странно то, что специалист с 10 летним стажем в ИБ этого не понимает.
Была бы ваша бесплатная часть выложена на гитхабе или было бы юрлицо в РФ, то был бы совершенно другой разговор. А так, один сплошной редфлаг.
Я честно каждый раз удивляюсь, зачем вместо чтения материала выискивать какие то смыслы в материале.
Никто ничего не выискивает специально потому-что при прочтении генеративность текста сама создает ощущение песка в глазах, отвлекая о сути того что хотел сказать автор. И чем больше человек в теме, так сказать, тем сильнее у него песок в глазах от таких текстов.
Поймите уже, наконец:
Свои мысли в оформлении нейронки - ИИ слоп.
"Мысли" нейронки в оформлении нейронки - ИИ слоп в квадрате.
Свои мысли в собственном оформлении - лютая годнота.
"Мысли" нейронки в собственном оформлении - внезапно, часто тоже годно.
Все что вам пытаются донести, так это то, что стоит перейти из пункта 1 в пункт 3. После этого мы вас обнимем, покружим и поставим на место.
Просто комментарий такой, для усиления эффекта. У меня так во всех статьях. Я так люблю делать.
Мы вам не верим. Это классический маркер нейронки. Статья хорошая, но доработка нейронкой залила в нее мусора, за который цепляется глаз. Очень много маркеров в тексте, даже лень разбирать очередного "я так пишу". Нет, не пишите.
Нейронки так пишут потому что при изначальной разметке люди маркировавшие варианты текста, которые им больше нравятся маркировали именно такие, с водой, клифхенгерами и тд. (писал об этом в отдельной статье, повторяться не буду) потому что такой текст сильно выделялся от обычного человеческого текста и это вначале вызывало интерес своей новизной. Никто и предположить не мог, что потом это станет эпидемией в ИИ. Люди так не пишут, там есть особенности в монотонности паттернов, которые выходят за рамки этого комментария.
Плохо не то что вы ее доработали нейронкой, это как раз нормально для сбора и проверки фактажа и тд, и даже не то что вы отрицаете это, ссылаясь на свой якобы авторский стиль. Плохо то, что вы не видите проблемы в том как нейронка портит ваше авторское изложение мыслей в действительно хорошем материале. Вы сами своими руками обесцениваете созданное вами. Это печально.
И предлагаете нам при таком раскладе внедрять ваше расширение в контур ИБ? Вы либо трусы либо крестик снимите/наденьте.
решение я сделал и обкатал по работе, а бесплатную версию выложил
А платная энтерпрайз версия у вас на сайте. Т.е. вы предлагает платную версию, без юрилца, на сайте который ассоциируется с Lotus Security по доменному имени. Просто "обкатали по работе". Окей.
Поэтому предлагаю не верить мне на слово
За это не переживайте.
В бесплатной версии вывод пустой: ни одного сетевого вызова во всём коде, ни одного внешнего ресурса в интерфейсе
А вот тут верю, полностью. Верю, что СЕЙЧАС в БЕСПЛАТНОЙ версии все чисто. Останется ли так с последующем обновлением или в энтерпрайз версии одному турку известно.
Не обижайтесь, но для ИБ специалиста вы один огромный red флаг. После 10+ лет работы вы должны это понимать.
Открыл расширение в браузере, внизу написано Offered by Lotus Security и email, который ведет на сайт. Все на русском, все хорошо написано, для безопасности, бла бла бла, есть бесплатная версия (как минимум, пока нужно обкатать само решение), есть кровавый энтерпрайз, все вроде бы ок, но... нет контактов.
Странно, а чего стесняемся? Давайте разбираться. Простой поиск по имени компании и продукта и ой, компания в UK с каким-то турком в бенефициарах. Это ведь вы, да? Прям спать не можете в Великобритании/Турции и делаете бесплатное приложение с закрытым кодом, чтобы сохранить данные россиян.
Какой отдел ИБ подобное пропустит вопрос конечно риторический.
Если эта компания в UK к вам не относится, то прошу предоставить российские контакты/реквизиты.
Главная боль в непостоянстве гигабайтов, понятно. Четырежды переваренный ии-слоп, который даже не потрудились вычитать. Фу таким быть.
Да как я вообще посмел проверять модели разных архитектур на собственных задачах. Как вообще у меня наглости хватило.
Как это не важно, если вращение подгоняет вектор под гауссовское распределение. Именно под такую форму математически строится сетка квантования на 3-4 бита. При этом случайная матрица знаков обязательна быть определенной формы так сказать, иначе чистый Адамар в худшем случае может не размазать, а заново собрать пик.
Размазывая крупный выброс по всем измерениям, мы превращаем его в распределенный фоновый шум. Вектор начинает влезать в малый диапазон, но из-за этого шума проседает точность скалярных произведений в слоях Внимания. Т.е. важно то, насколько точным будет результат в слоях внимания, а не то что вектор теперь влезает в диапазон.
Видимо таки придется написать небольшую статью-гайд про квантование для малых объемов памяти.
TurboQuant использует случайное вращение векторов (метод PolarQuant), чтобы размазать крупные выбросы по всем измерениям. Т.е. повезет/не повезет размазать хорошо.
Приведите ссылки, потому что практически проверки это не показывают.
См. комментарий выше.
Не только мое, ознакомьтесь, раз, два.
И вы не со мной спорите, а с логикой работы механизмов квантования.
Я верю, что в отдельных тестах у вас что-то показало хорошее, более того у исследователей из Google тоже показало хорошее, вот только потом независимые проверки показали, что это хорошее относится к узкому набору академических задач и моделям БОЛЬШИХ размеров.
Нет, это не правда, TurboQuant не делает качество KV-кэша выше, чем у исходного формата
bf16просто потому чтоbf16это исходная точность для большинства моделей, а TurboQuant дает сжатие с потерями.Вы транслируете миф не разобравшись в вопросе.
При работе с очень длинным текстом (256K+ токенов) кэш в формате
bf16полностью забивает видеопамять (VRAM). Модель наbf16либо падает с ошибкой Out Of Memory, либо вынуждена обрезать контекст и за счет этого проваливает задачу. TurboQuant сжимает кэш в 3-5 раз (до 3-4 бит на элемент), благодаря чему длинный текст влезает в GPU и задача успешно решается.Также, на небольших выборках квантованная модель за счет шума квантования может случайно угадать на 1-2 теста больше, чем
bf16.В IT-новостях оба эти момента подают как
TurboQuant превзошел несжатую модель!!!1.Курс обмена конечно приятный, но не стоило. Поставили и поставили.
Еще один.
А вы понимаете, что этим делаете лоботомию сети? V кеш еще можно квантовать в Q8, но K кеш должен быть в FP16/BF16. Точность K-кеша критически важна, это суть механизма внимания, в логике которого в конце идет softmax.
Softmax это экспоненциальная функция. Из-за экспоненты даже небольшая погрешность в K сильно искажает веса внимания и модель начинает смотреть не туда или теряет контекст.
Лучше квантуйте напрочь саму модель и урезайте
лещадлину контекста, вместо того чтобы трогать K кеш, иначе ваши модели будут галлюцинировать и зацикливаться выдавая мусор. А потом пользователи будут писать о том какие плохие модели, не могут ничего.Квантование модели и квантование кеша это две большие разницы.
Вы абсолютно правы, в большинстве случаев так и есть. В Q8/BF16 зацикливание проявляется в основном из-за неверно выставленного параметра temperature.
Каждый раз одно и тоже, люди используют гиперпарамтеры по умолчанию, потом у них то Qwen 3.6 27B галлюцинирует, то Qwen 3.6 35B A35 зацикливается, то Qwen 3.8 27B долго думает...
Что сложного в том, чтобы открыть, например, unsloth и прочитать:
Thinking Mode:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0Instruct (or non-thinking) mode:
temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0Сравните рекомендуемые параметры с вашими.
От себя могу добавить, что рекомендуемые параметры точно работают для Q8 и BF16. Для Q4 и ниже уже начинается лотерея т.к. такие модели могут зацикливаться из-за накопленных ошибок.
Так они и не связаны, я писал про аппаратную поддержку формата видеокартой.
Ваши уточнения полностью принимаются. Действительно, есть набор задач где ESN еще может себя показать и есть подвижки в новых методах вычислений.
Мой комментарий был реакцией на то, что вы описали как:
Не более того.
А эти статьи, которые вы так пишете, они с нами сейчас в одной комнате, на этом ресурсе?
По сравнению с четырежды переваренным ии слопом было лучше, имхо.
Вы путаете хамство с сарказмом, но не суть. В любом случае, я не хотел вас обидеть и приношу свои извинения, если это произошло.
Я лишь наглядно показал, что в текущем виде вы и ваше приложение не проходите первичную проверку в ИБ никоим образом. И для меня немного странно то, что специалист с 10 летним стажем в ИБ этого не понимает.
Была бы ваша бесплатная часть выложена на гитхабе или было бы юрлицо в РФ, то был бы совершенно другой разговор. А так, один сплошной редфлаг.
Никто ничего не выискивает специально потому-что при прочтении генеративность текста сама создает ощущение песка в глазах, отвлекая о сути того что хотел сказать автор. И чем больше человек в теме, так сказать, тем сильнее у него песок в глазах от таких текстов.
Поймите уже, наконец:
Свои мысли в оформлении нейронки - ИИ слоп.
"Мысли" нейронки в оформлении нейронки - ИИ слоп в квадрате.
Свои мысли в собственном оформлении - лютая годнота.
"Мысли" нейронки в собственном оформлении - внезапно, часто тоже годно.
Все что вам пытаются донести, так это то, что стоит перейти из пункта 1 в пункт 3. После этого мы вас обнимем, покружим и поставим на место.
Мы вам не верим. Это классический маркер нейронки. Статья хорошая, но доработка нейронкой залила в нее мусора, за который цепляется глаз. Очень много маркеров в тексте, даже лень разбирать очередного "я так пишу". Нет, не пишите.
Нейронки так пишут потому что при изначальной разметке люди маркировавшие варианты текста, которые им больше нравятся маркировали именно такие, с водой, клифхенгерами и тд. (писал об этом в отдельной статье, повторяться не буду) потому что такой текст сильно выделялся от обычного человеческого текста и это вначале вызывало интерес своей новизной. Никто и предположить не мог, что потом это станет эпидемией в ИИ. Люди так не пишут, там есть особенности в монотонности паттернов, которые выходят за рамки этого комментария.
Плохо не то что вы ее доработали нейронкой, это как раз нормально для сбора и проверки фактажа и тд, и даже не то что вы отрицаете это, ссылаясь на свой якобы авторский стиль. Плохо то, что вы не видите проблемы в том как нейронка портит ваше авторское изложение мыслей в действительно хорошем материале. Вы сами своими руками обесцениваете созданное вами. Это печально.
@
И предлагаете нам при таком раскладе внедрять ваше расширение в контур ИБ? Вы либо трусы либо крестик снимите/наденьте.
А платная энтерпрайз версия у вас на сайте. Т.е. вы предлагает платную версию, без юрилца, на сайте который ассоциируется с Lotus Security по доменному имени. Просто "обкатали по работе". Окей.
За это не переживайте.
А вот тут верю, полностью. Верю, что СЕЙЧАС в БЕСПЛАТНОЙ версии все чисто. Останется ли так с последующем обновлением или в энтерпрайз версии одному турку известно.
Не обижайтесь, но для ИБ специалиста вы один огромный red флаг. После 10+ лет работы вы должны это понимать.
Открыл расширение в браузере, внизу написано
Offered by Lotus Securityи email, который ведет на сайт. Все на русском, все хорошо написано, для безопасности, бла бла бла, есть бесплатная версия (как минимум, пока нужно обкатать само решение), есть кровавый энтерпрайз, все вроде бы ок, но... нет контактов.Странно, а чего стесняемся? Давайте разбираться. Простой поиск по имени компании и продукта и ой, компания в UK с каким-то турком в бенефициарах. Это ведь вы, да? Прям спать не можете в Великобритании/Турции и делаете бесплатное приложение с закрытым кодом, чтобы сохранить данные россиян.
Какой отдел ИБ подобное пропустит вопрос конечно риторический.
Если эта компания в UK к вам не относится, то прошу предоставить российские контакты/реквизиты.
Если же это вы, то АХАХА, АХАХАХАХА.