Иными словами, вы предлагаете в два раза увеличить количесто токенов для того-же самого, что можно достичь просто с помощью двух дополнительных токенов: начало системного промпта и конец системного промпта.
опять-таки не будем разводить про сотрудниечество внутри “банды”!
Почему не будем? Любое угнетение это всегда про сотрудничество, ибо в одиночку не поугнетаешь.
Сотрудничество и мирное сосуществование это разные вещи. Без сотрудничества войны не выигрывают, а проигрывают, как бы мирно себя не вели те, кто не сотрудничал.
Не знаю что там конкретно про этот стартап, но в США у компаний все сильнее растет спрос на модели которые можно запустить внутри компании, на своем железе, или в облаках. При этом зачастую есть требование от безопастников, чтоб обязательно была западная модель, а не китайская. А вот с этим пока очень грустно - китайские открытые модели намного лучше западных открытых моделей.
Зарабатывать на моделях с открытыми весами можно легко: достаточно изменить лицензию. MiniMax модели вроде имеют лицензию свободную когда используешь модели для себя, но если собираешься давать доступ другим - надо с ними договариваться о цене.
Уже не помню точно как там в c#, возможно внутри цикла переопределить индекс, или компилятор не пропустит? Типа такого:
for (int i = 0; i != src.Length; i++) {
sum += src[i];
i += 100;
}
Хотя, даже если и не пропустит, наверняка через unsafe можно поменять.
А если в теории поменять можно, то и проверка границ необходима, ибо != не будет гарантировать ничего. С другой стороны, переопределением индекса на какой-нибудь max int можно поломать вообще любой цикл. Так что, наверное, не так уж и необходима проверка.
На релизе что у геммы, что у квена было полно косяков и с косячными квантами, и с чат темплейтом, и с поддержкой в llama.cpp/lmstudio/итд. У меня есть несколько тестовых вопросов и на релизе гемма сильно лажала - особенно на одном вопросе, генерировала 10к думающих токенов и всегда отвечала фигню. Сейчас намного лучше, gemma4-26b на этом же вопросе делает 1500-6000 (в среднем 3к) думающих токенов и почти всегда отвечает правильно. При этом qwen3.6-35b в среднем думает 6к токенов и отвечает неправильно намного чаще. Я сейчас на работе, вечером могу вопрос показать. Что гемма, что квен, тестил на 6бит квантах.
Этот вопрос не значит, что гемма лучше квена, просто показывает насколько большая разница в качестве геммы на релизе и сейчас.
p.s.s. в gemma 4 не вижу смысла, все последние квены буквально лучше почти во всём (для написания кода)
Ну так-то автор явно сказал, что для чата, а не для кода использует. Ну и в целом, мне gemma вполне себе нравится, для кода ее не используют, потому-что по-дефолту она нихрена с тулзами работать не может и постоянно ломается на их вызовах, гугловцы это вылечили месяц назад, сделав пул-реквест: https://huggingface.co/google/gemma-4-31B-it/discussions/118 но настолько ленивые жопы, что так и не замержили. Если его забрать и использовать - кодить будет значительно лучше. Хотя лучше или хуже Квена - не берусь сказать, пока есть подписки от работодателя, пользуюсь ими для кодинга, с локальными только немного попробовал, но на моем ноуте уж безумно долго даже MoE. Но использую в своих проектах для агентов и с новым темплейтом gemma4-26 ни разу на тулзах не упала, хотя раньше всегда ломалась и она и 31b. И даже 31b через OpenRouter - они все ломаются. Чат темплейт по ссылке, кстати, подходит для любых gemma4, включая qat, он у всех у них одинаковый.
И отличие человека от компьютера именно в том, что он может выйти за рамки формальной системы и сказать: "это парадокс, не имеющий решения в границах заданной формальной системы".
Ну давайте спросим у компьютера с мизерной LLM у которой параметры не float, и даже не байт, а 6 бит:
Оказывается он точно также как и вы может выйти за рамки и так сказать. И даже сказать больше, чисто из-за большего объема фактологических знаний полученных в процессе обучения.
Проблема большинства рукотворных аналоговых систем в том, что человек любыми способами пытается добиться от них стабильности, тогда как в естественных аналоговых системах сама нестабильность является частью механизма стабилизации.
Не любыми, а такими-же как в природе, с помощью отрицательной обратной связи. И скорость у него не как у природы, когда требуются миллиарды лет, а намного выше и постоянно ускоряется. Дойдет дело и до нервной системы муравья.
Пфф, точно такая-же неразрешимость есть и у человеков, давайте разрешите: "это утверждение ложно".
В силу чего любые физические процессы возможно моделировать только приближённо - с неизбежными ошибками.
С аналоговыми системами увы, намного хуже: точность сильно ниже того, что может предложить float, так еще и результаты плывут от любого чиха, типа температурных изменений. Тоже-самое можно сказать и про наш мозг. Но там еще хуже. Чуть дисбаланса химического и все, пошел стреляться, или с высотки прыгать.
Ага, иметь на проде код отменяющий подписки таким образом, что если юзер не задан, то он отменяет вообще все подписки, это нормально, фаундер не дебил, а хороший человек. Виноват алгоритм, которому попалась заявка с пустым юзером и он ее выполнил как есть, согласно системному промпту, где написано, что файндеров не тревожить, делать все по букве.
Но опять-же, чтоб затормозить новое тело с новой массой и новой скоростью, надо потратить энергии ровно столько, сколько было у частицы, когда она вылетела из излучателя.
Сорри, неправильно написал, а исправлять уже нельзя. Должно быть так:
Но опять-же, чтоб затормозить новое тело с новой массой и новой скоростью, надо потратить энергии больше ровно настолько, сколько было кинетической энергии у частицы, когда она вылетела из излучателя.
Но ведь и частицы, имеющие массу - тоже волны! А с ними почему не происходит аналогичного "покраснения"?
С частицами имеющими массу, точно такое-же "покраснение" происходит. :) Но у них в данном случае другая энергия, которая "краснеет" - кинетическая. Допустим излучатель стреляет частицами, которые полностью "прилипают" к телу, не отскакивают от него. Частицы вылетают от излучателя с одной скоростью, то есть имеют одну кинетическую энергию, но из-за разницы скоростей между изучателем и телом, когда они "прилипнут" к телу, у них будет другая скорость относительно тела, а значит и энергии они передадут меньше. Но опять-же, чтоб затормозить новое тело с новой массой и новой скоростью, надо потратить энергии ровно столько, сколько было у частицы, когда она вылетела из излучателя. Так что, когда приводим все к одной инерционной системе, энергия сохраняется, никуда не исчезает.
Фотоны не теряют энергию. Просто в данном случае работает теория относительности. Тело излучившее фотон и тело его поглотившее находятся в разных инерционных системах отсчета, ибо движутся относительно друг друга и не важно, движутся из-за расширения вселенной, или по другой причине.
Допустим, никакого расширения нет. Представьте себе источник лазерного излучения который светит на абсолютно черное тело. Оба находятся в вакууме. Тело движется в противоположную сторону от источника излучения и, согласно эффекту Допплера, будет поглощать фотоны с длинной волны больше, чем была длинна волны, когда их излучили.
Вопрос: куда делась разница энергии?
На самом деле никуда, просто из-за движения, источник и получатель находятся в разных инерционных системах. Чтобы затормозить тело до такого состояния, что оно будет неподвижно по отношению к излучателю, надо совершить работу. После того, как на тело попал фотон от излучателя, тело поглотило его, плюс получило импульс и чуть-чуть ускорилось. Чтобы теперь затормозить тело до неподвижности по отношению к излучателю, надо потратить энергии больше ровно на энергию излученного фотона, а не на энергию поглощенного фотона. Закон сохранения энергии не нарушен, хотя в разных инерционных системах будет разная энергия.
Интересно, Антопик заплатил за эту статью FT, или FT использовали Клауде для выдумывания темы, а затем и текста статьи?
«приостановила» не равно «запретила навсегда».
А также не равно «продолжает», как написано в заголовке.
Запрет на конкретные модели (GPT-5.6, Mythos, Fable) не закрывает доступ к API более старых версий или другим продуктам тех же вендоров.
И что? Власти запретили доступ к определенным моделям, не ко всем, компании делают именно то, что от них попросили.
Китай активно использует метод «дистилляции»
Этим методом пользуются все разработчики моделей, включая Антропиков.
Американские власти одновременно борются с доминированием OpenAI/Google на внутреннем рынке
Совсем у Антропиков крыша поехала, уже себя властью страны называют? Где пример того как американские власти борятся с OpenAI и Google? В корпоративном секторе как-раз Антропики доминируют.
Какой именно рандом вы использовали? Компьютерные генераторы рандома на самом деле псевдорандом, не случайные числа, а строго определенные последовательности.
Какой этот Итан непостоянный. Раньше на вопрос, куда девается энергия фотона, когда из-за расширения вселенной он "краснеет", этот же самый Итан ничуточки не краснея сам заявил, что вселенная совершает работу по расширению и на совершение оной работы тратятся энергия всех этих фотонов: https://habr.com/ru/articles/400759/ и что, мол, закон сохранения работает в расширяющейся вселенной. Вот цитата из той статьи:
Строго говоря, в ОТО энергия для Вселенной не определяется. Но если рассмотреть ткань Вселенной и заставить её сжаться, то что произошло бы с фотонами внутри неё? Сжимающаяся Вселенная совершала бы над фотонами работу, что привело бы к приобретению ими энергии.
А какого количества энергии? Именно столько, сколько они потеряли при расширении Вселенной.
Так что, да, Кристиан, с расширением Вселенной фотоны теряют энергию. Но это не значит, что энергия не сохраняется. Это значит, что энергия уходит в расширение Вселенной в виде работы. И если Вселенная когда-нибудь поменяет расширение и начнёт сжиматься, эта работа будет совершаться в обратном направлении, и перейдёт в находящиеся внутри фотоны.
Вполне возможно, что в более полной, квантовой теории гравитации, появится более строгое определение энергии, и мы сможем реально посмотреть, сохраняется она или нет. Но в отсутствии такового мы можем лишь использовать то, что нам доступно, и эти инструменты и определения у нас уже есть. Да, фотоны теряют энергию, но она не исчезает. Количество потерянной энергии добавляется к тому, что существует в расширяющейся Вселенной.
Иными словами, вы предлагаете в два раза увеличить количесто токенов для того-же самого, что можно достичь просто с помощью двух дополнительных токенов: начало системного промпта и конец системного промпта.
А зачем?
Зануда mode: параметрические sql запросы появились за десятилетия до первой sql injection атаки.
Почему не будем? Любое угнетение это всегда про сотрудничество, ибо в одиночку не поугнетаешь.
Сотрудничество и мирное сосуществование это разные вещи. Без сотрудничества войны не выигрывают, а проигрывают, как бы мирно себя не вели те, кто не сотрудничал.
Будет через пару недель:
https://www.kimi.com/blog/kimi-k3
Не знаю что там конкретно про этот стартап, но в США у компаний все сильнее растет спрос на модели которые можно запустить внутри компании, на своем железе, или в облаках. При этом зачастую есть требование от безопастников, чтоб обязательно была западная модель, а не китайская. А вот с этим пока очень грустно - китайские открытые модели намного лучше западных открытых моделей.
Зарабатывать на моделях с открытыми весами можно легко: достаточно изменить лицензию. MiniMax модели вроде имеют лицензию свободную когда используешь модели для себя, но если собираешься давать доступ другим - надо с ними договариваться о цене.
Спирт уже обнаруживали: https://habr.com/ru/news/675020/
Не, не сможет. Лень сейчас считать, но уже считали, даже миллиарду мартышек не хватит времени жизни вселенной чтоб через рандом войну и мир написать.
Уже не помню точно как там в c#, возможно внутри цикла переопределить индекс, или компилятор не пропустит? Типа такого:
Хотя, даже если и не пропустит, наверняка через unsafe можно поменять.
А если в теории поменять можно, то и проверка границ необходима, ибо != не будет гарантировать ничего. С другой стороны, переопределением индекса на какой-нибудь max int можно поломать вообще любой цикл. Так что, наверное, не так уж и необходима проверка.
На релизе что у геммы, что у квена было полно косяков и с косячными квантами, и с чат темплейтом, и с поддержкой в llama.cpp/lmstudio/итд. У меня есть несколько тестовых вопросов и на релизе гемма сильно лажала - особенно на одном вопросе, генерировала 10к думающих токенов и всегда отвечала фигню. Сейчас намного лучше, gemma4-26b на этом же вопросе делает 1500-6000 (в среднем 3к) думающих токенов и почти всегда отвечает правильно. При этом qwen3.6-35b в среднем думает 6к токенов и отвечает неправильно намного чаще. Я сейчас на работе, вечером могу вопрос показать. Что гемма, что квен, тестил на 6бит квантах.
Этот вопрос не значит, что гемма лучше квена, просто показывает насколько большая разница в качестве геммы на релизе и сейчас.
Ну так-то автор явно сказал, что для чата, а не для кода использует. Ну и в целом, мне gemma вполне себе нравится, для кода ее не используют, потому-что по-дефолту она нихрена с тулзами работать не может и постоянно ломается на их вызовах, гугловцы это вылечили месяц назад, сделав пул-реквест: https://huggingface.co/google/gemma-4-31B-it/discussions/118 но настолько ленивые жопы, что так и не замержили. Если его забрать и использовать - кодить будет значительно лучше. Хотя лучше или хуже Квена - не берусь сказать, пока есть подписки от работодателя, пользуюсь ими для кодинга, с локальными только немного попробовал, но на моем ноуте уж безумно долго даже MoE. Но использую в своих проектах для агентов и с новым темплейтом gemma4-26 ни разу на тулзах не упала, хотя раньше всегда ломалась и она и 31b. И даже 31b через OpenRouter - они все ломаются. Чат темплейт по ссылке, кстати, подходит для любых gemma4, включая qat, он у всех у них одинаковый.
Ну давайте спросим у компьютера с мизерной LLM у которой параметры не float, и даже не байт, а 6 бит:
Оказывается он точно также как и вы может выйти за рамки и так сказать. И даже сказать больше, чисто из-за большего объема фактологических знаний полученных в процессе обучения.
Не любыми, а такими-же как в природе, с помощью отрицательной обратной связи. И скорость у него не как у природы, когда требуются миллиарды лет, а намного выше и постоянно ускоряется. Дойдет дело и до нервной системы муравья.
Пфф, точно такая-же неразрешимость есть и у человеков, давайте разрешите: "это утверждение ложно".
С аналоговыми системами увы, намного хуже: точность сильно ниже того, что может предложить float, так еще и результаты плывут от любого чиха, типа температурных изменений. Тоже-самое можно сказать и про наш мозг. Но там еще хуже. Чуть дисбаланса химического и все, пошел стреляться, или с высотки прыгать.
Ага, иметь на проде код отменяющий подписки таким образом, что если юзер не задан, то он отменяет вообще все подписки, это нормально, фаундер не дебил, а хороший человек. Виноват алгоритм, которому попалась заявка с пустым юзером и он ее выполнил как есть, согласно системному промпту, где написано, что файндеров не тревожить, делать все по букве.
Наняли-бы какую-нибудь девочку обрабатывать заявки вручную, она-бы сделала то-же самое.
Это вы ветки перепутали, в обсуждении с линейками я не участвую и отвечал на ваш конкретный вопрос, который к линейкам отношения не имеет.
Сорри, неправильно написал, а исправлять уже нельзя. Должно быть так:
С частицами имеющими массу, точно такое-же "покраснение" происходит. :) Но у них в данном случае другая энергия, которая "краснеет" - кинетическая. Допустим излучатель стреляет частицами, которые полностью "прилипают" к телу, не отскакивают от него. Частицы вылетают от излучателя с одной скоростью, то есть имеют одну кинетическую энергию, но из-за разницы скоростей между изучателем и телом, когда они "прилипнут" к телу, у них будет другая скорость относительно тела, а значит и энергии они передадут меньше. Но опять-же, чтоб затормозить новое тело с новой массой и новой скоростью, надо потратить энергии ровно столько, сколько было у частицы, когда она вылетела из излучателя. Так что, когда приводим все к одной инерционной системе, энергия сохраняется, никуда не исчезает.
Фотоны не теряют энергию. Просто в данном случае работает теория относительности. Тело излучившее фотон и тело его поглотившее находятся в разных инерционных системах отсчета, ибо движутся относительно друг друга и не важно, движутся из-за расширения вселенной, или по другой причине.
Допустим, никакого расширения нет. Представьте себе источник лазерного излучения который светит на абсолютно черное тело. Оба находятся в вакууме. Тело движется в противоположную сторону от источника излучения и, согласно эффекту Допплера, будет поглощать фотоны с длинной волны больше, чем была длинна волны, когда их излучили.
Вопрос: куда делась разница энергии?
На самом деле никуда, просто из-за движения, источник и получатель находятся в разных инерционных системах. Чтобы затормозить тело до такого состояния, что оно будет неподвижно по отношению к излучателю, надо совершить работу. После того, как на тело попал фотон от излучателя, тело поглотило его, плюс получило импульс и чуть-чуть ускорилось. Чтобы теперь затормозить тело до неподвижности по отношению к излучателю, надо потратить энергии больше ровно на энергию излученного фотона, а не на энергию поглощенного фотона. Закон сохранения энергии не нарушен, хотя в разных инерционных системах будет разная энергия.
Интересно, Антопик заплатил за эту статью FT, или FT использовали Клауде для выдумывания темы, а затем и текста статьи?
А также не равно «продолжает», как написано в заголовке.
И что? Власти запретили доступ к определенным моделям, не ко всем, компании делают именно то, что от них попросили.
Этим методом пользуются все разработчики моделей, включая Антропиков.
Совсем у Антропиков крыша поехала, уже себя властью страны называют? Где пример того как американские власти борятся с OpenAI и Google? В корпоративном секторе как-раз Антропики доминируют.
Что такое золотые столбцы?
Какой именно рандом вы использовали? Компьютерные генераторы рандома на самом деле псевдорандом, не случайные числа, а строго определенные последовательности.
Какой этот Итан непостоянный. Раньше на вопрос, куда девается энергия фотона, когда из-за расширения вселенной он "краснеет", этот же самый Итан ничуточки не краснея сам заявил, что вселенная совершает работу по расширению и на совершение оной работы тратятся энергия всех этих фотонов: https://habr.com/ru/articles/400759/ и что, мол, закон сохранения работает в расширяющейся вселенной.
Вот цитата из той статьи: