И играть тоже само в это будет, ибо человеку не зайдет больше чем 1 раз из любопытства. Разве что какие интерактивные симуляторы хентая - там обынчо сюжет и гейплей не роляет, а вот условно-"живая" не заскрипитованная вайфу роляет.
Пока что даже давно известные и отработанные диффузионки не научились картинки лучше человеческих (не средне-человеческих а-ля devianart, а профессионально-человеческих) выдавать. О чем вы? Про тексты нейронок вообще молчу - там проза настолько посредственная, что даже в eRP (где сюжет и нарратив вещь сильно вторичная) даже Clode Opus за 3-4 диалога становится скучен и неинтересен. А вы хотите чтобы они игры (где и визуал, и гемплей-механики, и сюжет должны быть на всоком уровне) лучше людей делали. Тут и люди то хорошие игры делать разучились и делают только картинку в большистве своём (да и ту уже не умею, отдают на откуп технологий движка по принципу "и так схавают")
В каком "прекрасном" мире мы живем, где ненависть против европейцев или белых не оценивают и о ней не беспокоятся. Ведь если она будет - всё норм. Это хорошая, добрая, кошерная ненавсить... А потом товарищи с пейсами из этих тестирующих организаций и из глав корпораций учащих модели будут доказывать нам, что мы в их отношении вот просто так предвзяты, безосновательно :)
Но вообще 80 у антропика, особенно на соннете, странно. При почти минимально рп-промтинге sonnet в версии 4.5 готов почти без вопросов отыгрывать сценарии с некро-зоо-пдф-файлом нарезающим ломтиками разноцветных представителей богоизбранных народов, причем делать это красочно и со вкусом на зависть остальным моделям...
Обучение на синтетике != "стырили датасет". Клод тоже сперва говорил что он ГПТ, большая часть моделей сейчас через раз считаем себя гемини и т.д ибо пол интернета этим уже зас*ано.
У китайцев огромный корпус китайских датасетов в довесок, из-за чего их модели пишут тексты прям заметно иначе (не всегда лучше, но - иначе)
Для Deepseek потому что ждите v4. У гопоты и клода с тех пор уже кучу новых версий вышло.
Для кодовой базы за условно смешные деньги есть Minimax M2.1, и за еще более смешные (почти бесплатно) GLM-4.7, которые конечно не уровня Opus, но кодовая база проблем у них не вызывает.
Это не копирование, а развитие. DeepSeek предложил достаточно солидный список улучшений и новых наработок (и не спрятал их за пейвол или коммерческую тайну), которые сейчас уже себе растащили все крупные игроки и благодаря которым как раз таки и просели цены на API (а не благодаря конкуренции с китаем).
С таким же успехом можно сказать, что ChatGPT это копирование существующей технологии гугла. Подумаешь, пару новшеств добавили и на больших данных обучили...
Если вас заставят последовательно по 1 слову называть следующее слово, заставляя называть вновь и вновь пока оно не совпадет с Гарри Поттером, а потом, когда таким образом вопроизведут целиком - можно ли считать что вы храните в себе копию гарри поттера даже если никогда в глаза его не видели?
Примерно то же самое проделали с моделями, брутфорся и заствляя перегенерирвать (и наверняка с не нулевой температурой, т.е токены перебирались с элементом рандома) пока рандом за N попыток не собрал им нужные слова в нужном порядке.
Когда журналист пишет «LFP — компромисс», я хочу спросить: компромисс с чем? С возможностью сгореть?
С весом/объемом/пробегом. Большому транспорту типа автобус/автомобиль конечно пофиг колебания ± 10кг. А вот у легкого транспорта вроде мелких электросамокатов каждый миллиметр в деке на счету. Учитывая меньший вольтаж и больший вес - чтобы вместиться в ту же деку и выйти на ожидаемый бк/колесом вольтаж приходится жертвовать и без того не топовой ёмкостью. А для самоката разница между "пройдет 25км" vs "пройдет 17км" это разница уровня удастся ли вернуться домой с поездки или придется катить самокат.
Хотя конечно на дистанции год+ эксплуатации li-ion скатывается почти до уровня lfp ибо высокотоковые банки и мелкие и деградируют быстро...
А в бесплатных приложениях она на кой? В регион-локнутых регионах работать не хотят? Не подпадающие под шизонутые минимальные требования в google play устройства им не нравятся? Такая хрень вылазит и если из других сторов ставить (aurora/mi store/app gallery), не только пиратское.
Если например в том что сервера не приналежат властям РФ и не мониторятся ими напрямую, то любое китайское/американское или иной, желательно враждебно либо недружелюбно настроенной к РФ страны. Резко снижает вероятность наличия местного товарища майора на серверах.
Ну так фейковые приложение от нонейм-васянов немножко не то же самое что официальное государствннное приложение целой страны. Уровень доверия разный. Не будет же страна своим гражданам троян предлагать, верно? :)
1 - не проблемы пользователя. 200$ не маленькие деньги и обычно когда платишь их - стараешься выбрать всё что они дают. 2 - они в любом случае тратятся за протяженность периода - там 5-часовые и недельные лимиты, их физически не дают потратить быстрее чем задумано и перегрузить сервера.
Тут больше выглядит как жадность ради жадности. Ибо, хоть мы и не знаем их реальный размер моделей но можем спекулятивно оценить на основе других знаний. Например: 1) GLM-4.7 может делать то, что делала Sonnet 3.7 год назад и даже больше. 2) Sonnet 3.7 стоил столько же сколько и 4.5 и цена железа и/или электричества со времен 3.7 до релиза 4.5 (не до сегодня с ростом цен на оперативку, а именно момент релиза 4.5) не особо то менялась, как собственно и цена API => Новый соннет как минимум не больше чем старый по размерам модели. 3) Мы предполагаем что инженеры из Anthropic как минимум не хуже китайских, а скорее всего лучше. 4) Из этого делаем обоснованное предположение, что Sonnet 3.7 был равен GLM-4.7 по размеру, либо, в случае более совершенной архитектуры и/или лучших датасетов и претрейна даже меньше. 5) Размер GLM-4.7 мы знаем и можем оценивать цену его инференса. 6) Что подводит нас к выводу, что вероянее цена по API у Antropic сильно завышена, чем подписка сильно занижена.
К этому выводу дополнительно подталкивает тот факт, что подписки на claude во всяких ElectronHub/Kiro/Cursor сопоставимы по ценам и объемам с Anthropic т.е по цене своей подписки они (или Amazon) сбывают токены массово и на сторону другим провайдерам, а значит это скорее базовая цена чем дискаунт.
Эмм, легко? Это буквально один из навыков владения языком и понимания его синтексиса и семантики.
Мы как бы про ЯЗЫКОВЫЕ модели сейчас, а не про калькулятор/кодогенератор/решатель загадок и ребусов/рисователь SVG и прочие нецелевые применения сейчас. Её главная, первичная и основная задача (на которую и заточена архитектура была) - владение языком. Т.е буквально - писать красиво и стройно как человек. Не думать, не решать ребусы (предсказание следующего токена - это не про решение ребусов, а про предсказание заученных ответов), не решать инженерные задачи - именно красиво писать тексты. В том числе, конечно, и на вымышленных языках вроде JS/Python, но тем не менее.
И с точки зрения LLM её задача и предназначение, в контексте кода, лишь породить синтаксически и грамматически верные конструкции. Т.е правильно оформленные (согласно примерам из датасета) проходящий валидацию код. Решать какую-либо задачу (кроме успешной компиляции/интерпритации) при этом он вовсе не обязан =)
И вот как раз модели, которые, извиняюсь за выражение, надр*чивают на решение ребусов и инженерных задач, в своей основной функции - Языковой модели - заметно проседают. Становятся сухими, репитативными, с тонной нейрослопа и самоповторов, без способности строить длинные связные правдоподобные тексты на естественном языке. Либо сохраняют эти функции, но лишь на доминирующих языках датасета, не проявляя генерализации на остальные - на остальных языках их навыки языка и следование инструкциям на них заметно ниже, тексты хуже и лексически менее разнообразны, с крайне ограниченным набором словаря и языковых конструкций, и в том числе без возможности породить даже простые рифмованные тексты.
Имхо, ЯЗЫКОВАЯ модель не способная корректно выполнить простой языковой запрос "напиши песню про <random_subject>" - хреновая языковая модель, ЯЗЫКОМ не владеющая.
Как оно может не сходиться. Имеем на вход 200$, на выход выбранные за месяц токены лимита.
В чём принципиальное отличие чем именно их выбрали, при условии что их в любом случае выбирают под ноль и часто раньше конца месяца?
Антропики буквально говорят "токены нам нихрена не стоят, и вы это знаете, но мы будет все равно драть с вас втридорога". Ничто не мешает использовать Claude Code как официальное расширение в VS Code. И прикрутить к нему доп. плагины. И напилить агента ПОВЕРХ Claude Code и всё так же выжигать лимиты.
Пусть определяться - они или готовы давать такие лимиты за такие деньги или не готовы, ибо по факту нет никакой разницы каким именно инструментом они сжигаются, если всё равно сжигаются
Если бы... К сожалению, про Pro. Были на него большие надежды после 2.5, но увы. И в курсоре ведет себя средненько, и в Antigravity плачевно (но там оно плачевно в том числе потому что еще тулзы и промты не отлажены, как и в Kiro, который со временем по-приличнее стал).
В плане отлаженности и вылизанности моделей пока что, к сожалению, из AI IDE вне конкуренции Cursor (даже не смотря на то, что начиная с 2.0 они его похоже в курсоре же и вайбкодят), но они жадные черти + умышленнот жгут токены юзеров на всякий мусор.
У всех остальных модельки на ступеньку ниже чувствуются сразу (мб Claude Code еще на уровне вполне, но там не удобно работать ибо итерации удобным образом назад откатить нельзя если модель лажает, только гитом).
Сириосли, Гемини 3? Не верю. Он в коде (особенно в гугловском антигравити) страдает от шизы, зацикливаний и сваливания в ошиби семплера вида "I must do this I must do this I must do this" до бесконечности.
В антигравити пока что юзабельным ощущается лишь Opus, и то там он работает на уровне того, как в Cursor'е работает Sonnet (если бы еще курсор не сжигал кучу токенов на генерацию 3-х огромных md-файлов на каждый простейший запрос - цены бы ему не было). И даже для opus-а лучше работает Kiro от Amazon...
Про сканави я попробовал сегодня лично, сам, в Gemini 3 Pro с Reasoning High. Зацитирую результат (он легко воспроизводим - AI Studio бесплатна и доступна для эспериментов). И даже картинку примера, "гениально" результата "размышлений" модели и правильного ответа из конца книги. Весь ризонинг, уж извините, не прикладываю, т.к оно там почти 6 минут по кругу ходило.
А со Сканави оно ведет себя в лучшем случае как школьник, впервые его увидивший - уходит в долгий цикл размышлений, ловит тупняк, пытается подобрать красивый ответ, ошибочно (в случае Сканави) предполагая что в примере все должно сокращаться до чего-то нормального и потом говорит что это плохой пример или вообще какое-то промежуточное вычислений =)
А о том, как они прекрасно "думают", "решают" или что-то еще "делают" тут выше кидали ссылку на замечательное видео https://www.youtube.com/watch?v=W2xZxYaGlfs Оно буквально видя токен говорит следующий. Безмозгло. Это калькулятор с формулой f(x)=y выдающий вам точки на своей области определения. Вы можете конечно искать разум у формулы, но вы тогда мало отличаетесь от древних людей, считающих что гром гремит потому что Перун по небу на колеснице катается. Только в отличии от людей тех времен, чье неведенье вполне оправдываемо, у вас есть математика, подробно объясняющая что и как происходит в машинном обучении, и вам нет необходимости судить лишь по внешним признакам.
И играть тоже само в это будет, ибо человеку не зайдет больше чем 1 раз из любопытства. Разве что какие интерактивные симуляторы хентая - там обынчо сюжет и гейплей не роляет, а вот условно-"живая" не заскрипитованная вайфу роляет.
Пока что даже давно известные и отработанные диффузионки не научились картинки лучше человеческих (не средне-человеческих а-ля devianart, а профессионально-человеческих) выдавать. О чем вы? Про тексты нейронок вообще молчу - там проза настолько посредственная, что даже в eRP (где сюжет и нарратив вещь сильно вторичная) даже Clode Opus за 3-4 диалога становится скучен и неинтересен.
А вы хотите чтобы они игры (где и визуал, и гемплей-механики, и сюжет должны быть на всоком уровне) лучше людей делали. Тут и люди то хорошие игры делать разучились и делают только картинку в большистве своём (да и ту уже не умею, отдают на откуп технологий движка по принципу "и так схавают")
В каком "прекрасном" мире мы живем, где ненависть против европейцев или белых не оценивают и о ней не беспокоятся. Ведь если она будет - всё норм. Это хорошая, добрая, кошерная ненавсить... А потом товарищи с пейсами из этих тестирующих организаций и из глав корпораций учащих модели будут доказывать нам, что мы в их отношении вот просто так предвзяты, безосновательно :)
Но вообще 80 у антропика, особенно на соннете, странно. При почти минимально рп-промтинге sonnet в версии 4.5 готов почти без вопросов отыгрывать сценарии с некро-зоо-пдф-файлом нарезающим ломтиками разноцветных представителей богоизбранных народов, причем делать это красочно и со вкусом на зависть остальным моделям...
Обучение на синтетике != "стырили датасет". Клод тоже сперва говорил что он ГПТ, большая часть моделей сейчас через раз считаем себя гемини и т.д ибо пол интернета этим уже зас*ано.
У китайцев огромный корпус китайских датасетов в довесок, из-за чего их модели пишут тексты прям заметно иначе (не всегда лучше, но - иначе)
Для Deepseek потому что ждите v4. У гопоты и клода с тех пор уже кучу новых версий вышло.
Для кодовой базы за условно смешные деньги есть Minimax M2.1, и за еще более смешные (почти бесплатно) GLM-4.7, которые конечно не уровня Opus, но кодовая база проблем у них не вызывает.
Это не копирование, а развитие. DeepSeek предложил достаточно солидный список улучшений и новых наработок (и не спрятал их за пейвол или коммерческую тайну), которые сейчас уже себе растащили все крупные игроки и благодаря которым как раз таки и просели цены на API (а не благодаря конкуренции с китаем).
С таким же успехом можно сказать, что ChatGPT это копирование существующей технологии гугла. Подумаешь, пару новшеств добавили и на больших данных обучили...
Если вас заставят последовательно по 1 слову называть следующее слово, заставляя называть вновь и вновь пока оно не совпадет с Гарри Поттером, а потом, когда таким образом вопроизведут целиком - можно ли считать что вы храните в себе копию гарри поттера даже если никогда в глаза его не видели?
Примерно то же самое проделали с моделями, брутфорся и заствляя перегенерирвать (и наверняка с не нулевой температурой, т.е токены перебирались с элементом рандома) пока рандом за N попыток не собрал им нужные слова в нужном порядке.
С весом/объемом/пробегом. Большому транспорту типа автобус/автомобиль конечно пофиг колебания ± 10кг. А вот у легкого транспорта вроде мелких электросамокатов каждый миллиметр в деке на счету. Учитывая меньший вольтаж и больший вес - чтобы вместиться в ту же деку и выйти на ожидаемый бк/колесом вольтаж приходится жертвовать и без того не топовой ёмкостью. А для самоката разница между "пройдет 25км" vs "пройдет 17км" это разница уровня удастся ли вернуться домой с поездки или придется катить самокат.
Хотя конечно на дистанции год+ эксплуатации li-ion скатывается почти до уровня lfp ибо высокотоковые банки и мелкие и деградируют быстро...
А в бесплатных приложениях она на кой? В регион-локнутых регионах работать не хотят? Не подпадающие под шизонутые минимальные требования в google play устройства им не нравятся? Такая хрень вылазит и если из других сторов ставить (aurora/mi store/app gallery), не только пиратское.
Это где мне hi-end мать, проц и оперативку продадут только с виндой? Комп, это знаете ли, не только ноутбуки (и в первую очередь вообще не они).
Там автогенерация субтитров на уровне автосубтитров гугла из распознования речи (т.е дичь в 50% случаев) с последующей озвучкой
Смотря в чем подозрений.
Если например в том что сервера не приналежат властям РФ и не мониторятся ими напрямую, то любое китайское/американское или иной, желательно враждебно либо недружелюбно настроенной к РФ страны. Резко снижает вероятность наличия местного товарища майора на серверах.
Ну так фейковые приложение от нонейм-васянов немножко не то же самое что официальное государствннное приложение целой страны. Уровень доверия разный. Не будет же страна своим гражданам троян предлагать, верно? :)
Если им это потребуется? Сопоставимый с тем, что заморочился впн-ом для инстаграма в своё время или для обхода замедлений ютуба.
1 - не проблемы пользователя. 200$ не маленькие деньги и обычно когда платишь их - стараешься выбрать всё что они дают.
2 - они в любом случае тратятся за протяженность периода - там 5-часовые и недельные лимиты, их физически не дают потратить быстрее чем задумано и перегрузить сервера.
Тут больше выглядит как жадность ради жадности. Ибо, хоть мы и не знаем их реальный размер моделей но можем спекулятивно оценить на основе других знаний. Например:
1) GLM-4.7 может делать то, что делала Sonnet 3.7 год назад и даже больше.
2) Sonnet 3.7 стоил столько же сколько и 4.5 и цена железа и/или электричества со времен 3.7 до релиза 4.5 (не до сегодня с ростом цен на оперативку, а именно момент релиза 4.5) не особо то менялась, как собственно и цена API => Новый соннет как минимум не больше чем старый по размерам модели.
3) Мы предполагаем что инженеры из Anthropic как минимум не хуже китайских, а скорее всего лучше.
4) Из этого делаем обоснованное предположение, что Sonnet 3.7 был равен GLM-4.7 по размеру, либо, в случае более совершенной архитектуры и/или лучших датасетов и претрейна даже меньше.
5) Размер GLM-4.7 мы знаем и можем оценивать цену его инференса.
6) Что подводит нас к выводу, что вероянее цена по API у Antropic сильно завышена, чем подписка сильно занижена.
К этому выводу дополнительно подталкивает тот факт, что подписки на claude во всяких ElectronHub/Kiro/Cursor сопоставимы по ценам и объемам с Anthropic т.е по цене своей подписки они (или Amazon) сбывают токены массово и на сторону другим провайдерам, а значит это скорее базовая цена чем дискаунт.
Эмм, легко? Это буквально один из навыков владения языком и понимания его синтексиса и семантики.
Мы как бы про ЯЗЫКОВЫЕ модели сейчас, а не про калькулятор/кодогенератор/решатель загадок и ребусов/рисователь SVG и прочие нецелевые применения сейчас. Её главная, первичная и основная задача (на которую и заточена архитектура была) - владение языком. Т.е буквально - писать красиво и стройно как человек. Не думать, не решать ребусы (предсказание следующего токена - это не про решение ребусов, а про предсказание заученных ответов), не решать инженерные задачи - именно красиво писать тексты. В том числе, конечно, и на вымышленных языках вроде JS/Python, но тем не менее.
И с точки зрения LLM её задача и предназначение, в контексте кода, лишь породить синтаксически и грамматически верные конструкции. Т.е правильно оформленные (согласно примерам из датасета) проходящий валидацию код. Решать какую-либо задачу (кроме успешной компиляции/интерпритации) при этом он вовсе не обязан =)
И вот как раз модели, которые, извиняюсь за выражение, надр*чивают на решение ребусов и инженерных задач, в своей основной функции - Языковой модели - заметно проседают. Становятся сухими, репитативными, с тонной нейрослопа и самоповторов, без способности строить длинные связные правдоподобные тексты на естественном языке. Либо сохраняют эти функции, но лишь на доминирующих языках датасета, не проявляя генерализации на остальные - на остальных языках их навыки языка и следование инструкциям на них заметно ниже, тексты хуже и лексически менее разнообразны, с крайне ограниченным набором словаря и языковых конструкций, и в том числе без возможности породить даже простые рифмованные тексты.
Имхо, ЯЗЫКОВАЯ модель не способная корректно выполнить простой языковой запрос "напиши песню про <random_subject>" - хреновая языковая модель, ЯЗЫКОМ не владеющая.
Как оно может не сходиться. Имеем на вход 200$, на выход выбранные за месяц токены лимита.
В чём принципиальное отличие чем именно их выбрали, при условии что их в любом случае выбирают под ноль и часто раньше конца месяца?
Антропики буквально говорят "токены нам нихрена не стоят, и вы это знаете, но мы будет все равно драть с вас втридорога".
Ничто не мешает использовать Claude Code как официальное расширение в VS Code. И прикрутить к нему доп. плагины. И напилить агента ПОВЕРХ Claude Code и всё так же выжигать лимиты.
Пусть определяться - они или готовы давать такие лимиты за такие деньги или не готовы, ибо по факту нет никакой разницы каким именно инструментом они сжигаются, если всё равно сжигаются
Если бы... К сожалению, про Pro. Были на него большие надежды после 2.5, но увы. И в курсоре ведет себя средненько, и в Antigravity плачевно (но там оно плачевно в том числе потому что еще тулзы и промты не отлажены, как и в Kiro, который со временем по-приличнее стал).
В плане отлаженности и вылизанности моделей пока что, к сожалению, из AI IDE вне конкуренции Cursor (даже не смотря на то, что начиная с 2.0 они его похоже в курсоре же и вайбкодят), но они жадные черти + умышленнот жгут токены юзеров на всякий мусор.
У всех остальных модельки на ступеньку ниже чувствуются сразу (мб Claude Code еще на уровне вполне, но там не удобно работать ибо итерации удобным образом назад откатить нельзя если модель лажает, только гитом).
Сириосли, Гемини 3? Не верю. Он в коде (особенно в гугловском антигравити) страдает от шизы, зацикливаний и сваливания в ошиби семплера вида "I must do this I must do this I must do this" до бесконечности.
В антигравити пока что юзабельным ощущается лишь Opus, и то там он работает на уровне того, как в Cursor'е работает Sonnet (если бы еще курсор не сжигал кучу токенов на генерацию 3-х огромных md-файлов на каждый простейший запрос - цены бы ему не было). И даже для opus-а лучше работает Kiro от Amazon...
Про сканави я попробовал сегодня лично, сам, в Gemini 3 Pro с Reasoning High. Зацитирую результат (он легко воспроизводим - AI Studio бесплатна и доступна для эспериментов). И даже картинку примера, "гениально" результата "размышлений" модели и правильного ответа из конца книги. Весь ризонинг, уж извините, не прикладываю, т.к оно там почти 6 минут по кругу ходило.
А о том, как они прекрасно "думают", "решают" или что-то еще "делают" тут выше кидали ссылку на замечательное видео https://www.youtube.com/watch?v=W2xZxYaGlfs
Оно буквально видя токен говорит следующий. Безмозгло. Это калькулятор с формулой f(x)=y выдающий вам точки на своей области определения. Вы можете конечно искать разум у формулы, но вы тогда мало отличаетесь от древних людей, считающих что гром гремит потому что Перун по небу на колеснице катается. Только в отличии от людей тех времен, чье неведенье вполне оправдываемо, у вас есть математика, подробно объясняющая что и как происходит в машинном обучении, и вам нет необходимости судить лишь по внешним признакам.