А можно выбрать сервис типа openrouter.ai, и не зависеть от впс (по крайней мере пока), не быть привязанным только к моделям опенаи.
Касаемо json: есть такая штука как structured_output.
Касаемо таймаута: можно использовать потоковую генерацию (stream=True) -- тогда не нужно ждать, пока модель вернёт ответ целиком, можно сохранить даже частичный ответ в случае обрыва соединения.
Как насчёт привести количество входных и выходных токенов на каждый из вариантов? Мб в варианте с опенроутера модель сгенерировала 100 токенов, а в варианте с ботхаба -- 1000? (Условные цифры)
Дык в статье речь идёт не про генерацию картинок часов, а про генерацию html-кода, отображающего часы. Разные вещи. Вы пробовали создать html-скрепки?)
Дык в статье речь идёт не про генерацию картинок часов, а про генерацию html-кода, отображающего часы. Разные вещи. Вы пробовали создать html-термометр?)
Интересная сейчас мода: почти про любую llm писать, что она "бросает вызов дипсику". Причём как старому типа 3.2, так и потенциальному v4. Кликбейт на кликбейте и кликбейтом погоняет.
Я из тех, кто предпочитает боковую панель) И вертикальные вкладки в браузере). Когда открыто много приложений/окон, куда удобнее прокручивать их, если они не вмещаются в область видимости -- мне куда удобнее переключать приложения кликом мышки, а не запоминанием комбинаций клавиш клавиатуры, которые, причём, работают медленнее (лишние действия). А для переключения мышкой лучше, чтобы все были в области видимости. На винде 10 панель задач при переполнении просто добавляет вторую строку (или столбец в вертикальной панели на 8 винде), до которой просто прокруткой добраться нельзя, нужно кликать (лишние действия).
На убунте реализация, можно сказать, идеальная. А на винде постоянные свистопляски с "добавят-уберут". И насыплют вдобавок кучу багов. Если на винде 11 добавят возможность вертикальной панели, можно будет наконец обновиться с 10ки)
Полагаю, Вы пытались сгенерировать песню именно на русском языке? Если так, спешу огорчить: проблемы с русским наблюдаются даже у крупных llm (от дипсика до опенаи), не говоря уже про нишевые модели (т.е. используемые под капотом suno/riffusion). По‐моему, только модели антропика сейчас без огрехов в русском.
Проблема, как я понимаю, в дисбалансе тренировочных данных -- гигантский перекос в сторону английского. Теперь касаемо моделей генерации текста в suno/riffusion: про них известно почти ничего. Велика вероятность, что они куда меньше крупных llm, и куда вероятнее, что они были затьюнены под генерацию песен на английском (например, udio. Suno, наверняка, имеет более обширный датасет). Т.е. если тестировать на стихотворные произведения, то на английском.
Попробуйте claude (и лучше на английском) -- возможно, результат удивит в приятном смысле.
А какой процент всех людей смогут сделать то же самое: "песню из 3-х куплетов и 2-х припевов" -- без правок? Из 8 млрд разве что один процент если наберется. Вы сами пробовали? Как тот, кто одно время писал стихи, говорю, что этот процесс довольно непростой, и с первого раза выходило редко.
Теперь посмотрим на LLM: какой процент стихотворных произведений в их обучающем датасете? С учетом фокуса LLM на программирование тоже наверняка проценты-доли процента. Если вспомнить, что LLM -- это среднее по больнице, то довольно логично, что стихи они будут писать хуже.
Собственно, это претензии к "Лёгкий тест" и "Вероятность написания песни из 3-х куплетов и 2-х припевов за один раз без правок со стороны человека у всех ИИ очень близка к нулю". Тест не будет легким ни для человека, ни для LLM, и случайно взятый человек также вряд ли сможет за один раз без правок написать песню. А если и сможет -- случайное попадание, или или он музыкант\поэт (что тоже случайное попадание в выборке из 8 млрд).
Соглашусь с другим комментарием: тест стихами (да и вообще в целом тесты на креативное письмо) хорошо показывают уровень модели.
К самому исследованию никакаих претензий -- все очень познавательно, спасибо) Основная претензия -- ко мнению "если текст написан грамотно (хотя бы пунктуационно), то явно сгенерирован LLM". Довольно странный тренд последнего времени (может быть, года?) в статьях/комментариях к статьям, который, по сути, пытается обесценить знания правил русского языка.
Кстати если проект или статья написанны LLM то это легко палиться если в ней есть много emoji или длинные тире «-» берите на заметку.
Автор, не надо гнать на LLM за то, что они знают правила пунктуации в русском языке. И то, что стоит в Вас в качестве тире -- никак не "тире", а дефис, который должен стоять только между словами, без пробелов. На хабре уже не раз статьи были на эту тему, например Тире минус дефис. Или размер имеет значение / Хабр .
Замечу, что если Вам лень ставить тире -- можно поставить несколько дефисов подряд (два-три). Некоторые редакторы текста по дефолту заменяют их на тире. Если не заменяют -- то даже так куда правильнее, чем пихать везде дефис.
Ну и у Вас в этом же предложении еще несколько ошибок:
нужна запятая после "кстати"
нужна запятая перед "то"
нужна запятая перед "если в ней"
палиться (что сделать?) -> палится (что делает?)
нужно длинное тире перед "берите на заметку"
написанны -> написаны
Признак сгенерированного LLM текста не само наличие длинных тире, а использование их без пробелов (первый попавшийся под руку пример: "...disturbance in the Force—the awakening of a Dyad..."). Не надо говорить на грамотный текст, что он сгенерирован LLM, только потому, что там правильная пунктуация\грамматика.
А что насчет цен? Тариф Premium обойдется в 600 рублей в месяц. За эти деньги вы получаете безлимитный доступ ко всем нейросетям и целых 5 000 000 капсов! Чтобы вы понимали масштаб: этого запаса хватит на 192 генерации в Midjourney (по 4 варианта каждая), 125 изображений в мощнейшем Flux 2 Pro или 35–40 картинок в Nano Banana Pro. И капсы не сгорают, так что можно растягивать удовольствие.
а Вы точно с ботхаба? У них нет месячных подписок, а за 600р предлагают 3 000 000 капсов, а не 5
В результате эксперимента вы получаете некоторое представление о том, что внутри ЛЛМ кажется ей "хорошим" текстом.
И все-таки, не соглашусь: постановка эксперимента по-прежнему непонятна. Причины описал в комментарии выше (пункты 2,3,4). Кроме того, LLM не имеют в человеческом понимании представления "хорошего текста". LLM же по сути статистический усреднитель текста. Обученная на миллионах токенов произведений разных писателей с абсолютно разными стилями (плюс не надо забывать, что она обучена на комментариях с форумов, программировании и прочем, что тоже дает свой вклад) она будет воспроизводить нечто усредненное. И Ваша аналогия с фильмом "Плезантвиль" как раз об этом.
Возвращаясь к эксперименту -- это задача "улучшить текст", причем вырванный из контекста. LLM не шибко понимают, где нужно остановиться (проблема галлюцинаций), и будет пытаться "улучшить" то, что уже нормально (если текст реально хороший), придумывая несуществующие проблемы -- не задуманные автором. Если добавить контекст (все произведение), то в этом случае направление "улучшений" изменится -- станет ближе к реальности. Но это все равно не покажет представление LLM о "хорошем" тексте.
И это не лечится стилизацией а-ля: "Напиши рассказ в стиле (О.Генри, М.Твена, Конан-Дойла, и т.д.)" И это не лечится advanced prompting где мы просим модель сначала написать характерные черты и литературные приемы определенного писателя, потом написать как именно она собирается применить их при создании текста, и только потом писать текст.
Тут помог бы такой метод: скормить в контекст модели рассказы, например, О.Генри. И тогда уже просить написать "в стиле". Иначе "включается" тот самый "статистический усреднитель". Однако, контекст модели обычно 32к-200к токенов, причем при приближении к этому пределу качество понимания этого контекста падает, поэтому рассказы О.Генри просто в этот контекст не влезут. Может сработать разве что на одном-двух-трех рассказах, которые поместятся в контекст.
В качестве прикола - ЛЛМ имеют тенденцию использовать лифт как телепорт. Два абзаца вверх - герой ехал в институт на трамвае, два абзаца вниз - зашел в лифт на работе, вышел дома на лестничной площадке
В описанном случае больше похоже на то, что модель не особо хорошо понимает\помнит контекст) Либо речь не о паре абзацев, а о довольно объемном куске текста. У опуса-4.5 без проблем выходит написать логически согласованными глав 10 текста на 15000+ токенов -- и без особых ляпов. Гемини-3-про и гпт-5.1\5.2 такой длины текст генерировать не особо в состоянии, не говоря уже о согласованности.
виновато мультимодальное обучение на видеоматериалах
На данный момент только gemini и специализированные VL-модели принимают на вход видеоматериалы, соответственно, и обучены на них. У остальных моделей пока что текст\картинки. Разве что текст\субтитры из видео передавали на вход с минимальным описанием. Вот если бы обучали именно на видео-материалах, причем с детализированными пояснениями (текстовыми-картинками), что, почему, когда, и как происходит -- тогда бы качество действительно рвануло ввысь. Но, думаю, это еще нескоро будет.
Ну и одни из наиболее заметных проблем LLM -- она не понимает на должном уровне анатомию человека, положение в пространстве, не может планировать его действия, теряется в контексте... т.е. то, что могло бы вылечиться как раз мультимодальностью (кроме контекста).
Не очень понимаю: в статье сделан вывод о том, какая модель лучше, на основе всего одного примера генерации каждой модели на каждый промпт? Это не статистика, это "пальцем в небо". Если бы хотя бы на 10 примерах показали -- уже был бы хлеб.
По своему опыту, гемини-3-про несколько хуже и gpt-5.2-pro, и sonnet/opus-4.5 в плане логики повествования\продуманности сюжета. В плане "человекоподобного" текста -- на первом месте всегда модели claude. gpt-модели (и 4, и 5) страдают от коротких абзацев (по сравнению с клодом\гемини -- на моих запросах).
Ну и основная проблема -- это качество обучения этих LLM на русском языке: количество обучающих данных на русском языке и на английском несопоставимо. По-хорошему, для креативного письма правильнее давать задачу писать на английском языке, потом результат переводить на русский.
А можно выбрать сервис типа openrouter.ai, и не зависеть от впс (по крайней мере пока), не быть привязанным только к моделям опенаи.
Касаемо json: есть такая штука как structured_output.
Касаемо таймаута: можно использовать потоковую генерацию (stream=True) -- тогда не нужно ждать, пока модель вернёт ответ целиком, можно сохранить даже частичный ответ в случае обрыва соединения.
Как насчёт привести количество входных и выходных токенов на каждый из вариантов? Мб в варианте с опенроутера модель сгенерировала 100 токенов, а в варианте с ботхаба -- 1000? (Условные цифры)
Не подскажете, как сделать так, чтобы гугл через впн не говорил, что сервис "недоступен в вашей стране"?
Большинство бесплатных моделей с опенроутера недоступны( А те, которые тестируют, предоставляя бесплатный доступ, обычно быстро закрывают
Дык в статье речь идёт не про генерацию картинок часов, а про генерацию html-кода, отображающего часы. Разные вещи. Вы пробовали создать html-скрепки?)
Дык в статье речь идёт не про генерацию картинок часов, а про генерацию html-кода, отображающего часы. Разные вещи. Вы пробовали создать html-термометр?)
Дык речь идёт не про генерацию картинок часов, а про генерацию html-кода, отображающего часы. Разные вещи
По смыслу выходит, что раскритикован исходный код за сотрудничество с Microsoft. Реально код сотрудничает? Или таки OnlyOffice?
А где галлюцинации-то?)
Интересная сейчас мода: почти про любую llm писать, что она "бросает вызов дипсику". Причём как старому типа 3.2, так и потенциальному v4. Кликбейт на кликбейте и кликбейтом погоняет.
Я из тех, кто предпочитает боковую панель) И вертикальные вкладки в браузере). Когда открыто много приложений/окон, куда удобнее прокручивать их, если они не вмещаются в область видимости -- мне куда удобнее переключать приложения кликом мышки, а не запоминанием комбинаций клавиш клавиатуры, которые, причём, работают медленнее (лишние действия). А для переключения мышкой лучше, чтобы все были в области видимости. На винде 10 панель задач при переполнении просто добавляет вторую строку (или столбец в вертикальной панели на 8 винде), до которой просто прокруткой добраться нельзя, нужно кликать (лишние действия).
На убунте реализация, можно сказать, идеальная. А на винде постоянные свистопляски с "добавят-уберут". И насыплют вдобавок кучу багов. Если на винде 11 добавят возможность вертикальной панели, можно будет наконец обновиться с 10ки)
Вопрос не ко мне, а к автору исходного комментария)
Если говорить о человеке, то речь про вдохновение)
Полагаю, Вы пытались сгенерировать песню именно на русском языке? Если так, спешу огорчить: проблемы с русским наблюдаются даже у крупных llm (от дипсика до опенаи), не говоря уже про нишевые модели (т.е. используемые под капотом suno/riffusion). По‐моему, только модели антропика сейчас без огрехов в русском.
Проблема, как я понимаю, в дисбалансе тренировочных данных -- гигантский перекос в сторону английского. Теперь касаемо моделей генерации текста в suno/riffusion: про них известно почти ничего. Велика вероятность, что они куда меньше крупных llm, и куда вероятнее, что они были затьюнены под генерацию песен на английском (например, udio. Suno, наверняка, имеет более обширный датасет). Т.е. если тестировать на стихотворные произведения, то на английском.
Попробуйте claude (и лучше на английском) -- возможно, результат удивит в приятном смысле.
А какой процент всех людей смогут сделать то же самое: "песню из 3-х куплетов и 2-х припевов" -- без правок? Из 8 млрд разве что один процент если наберется. Вы сами пробовали? Как тот, кто одно время писал стихи, говорю, что этот процесс довольно непростой, и с первого раза выходило редко.
Теперь посмотрим на LLM: какой процент стихотворных произведений в их обучающем датасете? С учетом фокуса LLM на программирование тоже наверняка проценты-доли процента. Если вспомнить, что LLM -- это среднее по больнице, то довольно логично, что стихи они будут писать хуже.
Собственно, это претензии к "Лёгкий тест" и "Вероятность написания песни из 3-х куплетов и 2-х припевов за один раз без правок со стороны человека у всех ИИ очень близка к нулю". Тест не будет легким ни для человека, ни для LLM, и случайно взятый человек также вряд ли сможет за один раз без правок написать песню. А если и сможет -- случайное попадание, или или он музыкант\поэт (что тоже случайное попадание в выборке из 8 млрд).
Соглашусь с другим комментарием: тест стихами (да и вообще в целом тесты на креативное письмо) хорошо показывают уровень модели.
К самому исследованию никакаих претензий -- все очень познавательно, спасибо) Основная претензия -- ко мнению "если текст написан грамотно (хотя бы пунктуационно), то явно сгенерирован LLM". Довольно странный тренд последнего времени (может быть, года?) в статьях/комментариях к статьям, который, по сути, пытается обесценить знания правил русского языка.
Не знал и не обращал внимания, спасибо) Слишком привык к русскому варианту.
А ведь действительно: на русском LLMки выделяют тире пробелами!
Вывод один: LLMки в плане пунктуации текст пишут лучше большинства из нас. Разве что орфография на русском у некоторых хромает.
Автор, не надо гнать на LLM за то, что они знают правила пунктуации в русском языке. И то, что стоит в Вас в качестве тире -- никак не "тире", а дефис, который должен стоять только между словами, без пробелов. На хабре уже не раз статьи были на эту тему, например Тире минус дефис. Или размер имеет значение / Хабр .
Замечу, что если Вам лень ставить тире -- можно поставить несколько дефисов подряд (два-три). Некоторые редакторы текста по дефолту заменяют их на тире. Если не заменяют -- то даже так куда правильнее, чем пихать везде дефис.
Ну и у Вас в этом же предложении еще несколько ошибок:
нужна запятая после "кстати"
нужна запятая перед "то"
нужна запятая перед "если в ней"
палиться (что сделать?) -> палится (что делает?)
нужно длинное тире перед "берите на заметку"
написанны -> написаны
Признак сгенерированного LLM текста не само наличие длинных тире, а использование их без пробелов (первый попавшийся под руку пример: "...disturbance in the Force—the awakening of a Dyad..."). Не надо говорить на грамотный текст, что он сгенерирован LLM, только потому, что там правильная пунктуация\грамматика.
а Вы точно с ботхаба? У них нет месячных подписок, а за 600р предлагают 3 000 000 капсов, а не 5
И все-таки, не соглашусь: постановка эксперимента по-прежнему непонятна. Причины описал в комментарии выше (пункты 2,3,4). Кроме того, LLM не имеют в человеческом понимании представления "хорошего текста". LLM же по сути статистический усреднитель текста. Обученная на миллионах токенов произведений разных писателей с абсолютно разными стилями (плюс не надо забывать, что она обучена на комментариях с форумов, программировании и прочем, что тоже дает свой вклад) она будет воспроизводить нечто усредненное. И Ваша аналогия с фильмом "Плезантвиль" как раз об этом.
Возвращаясь к эксперименту -- это задача "улучшить текст", причем вырванный из контекста. LLM не шибко понимают, где нужно остановиться (проблема галлюцинаций), и будет пытаться "улучшить" то, что уже нормально (если текст реально хороший), придумывая несуществующие проблемы -- не задуманные автором. Если добавить контекст (все произведение), то в этом случае направление "улучшений" изменится -- станет ближе к реальности. Но это все равно не покажет представление LLM о "хорошем" тексте.
Тут помог бы такой метод: скормить в контекст модели рассказы, например, О.Генри. И тогда уже просить написать "в стиле". Иначе "включается" тот самый "статистический усреднитель". Однако, контекст модели обычно 32к-200к токенов, причем при приближении к этому пределу качество понимания этого контекста падает, поэтому рассказы О.Генри просто в этот контекст не влезут. Может сработать разве что на одном-двух-трех рассказах, которые поместятся в контекст.
В описанном случае больше похоже на то, что модель не особо хорошо понимает\помнит контекст) Либо речь не о паре абзацев, а о довольно объемном куске текста. У опуса-4.5 без проблем выходит написать логически согласованными глав 10 текста на 15000+ токенов -- и без особых ляпов. Гемини-3-про и гпт-5.1\5.2 такой длины текст генерировать не особо в состоянии, не говоря уже о согласованности.
На данный момент только gemini и специализированные VL-модели принимают на вход видеоматериалы, соответственно, и обучены на них. У остальных моделей пока что текст\картинки. Разве что текст\субтитры из видео передавали на вход с минимальным описанием. Вот если бы обучали именно на видео-материалах, причем с детализированными пояснениями (текстовыми-картинками), что, почему, когда, и как происходит -- тогда бы качество действительно рвануло ввысь. Но, думаю, это еще нескоро будет.
Ну и одни из наиболее заметных проблем LLM -- она не понимает на должном уровне анатомию человека, положение в пространстве, не может планировать его действия, теряется в контексте... т.е. то, что могло бы вылечиться как раз мультимодальностью (кроме контекста).
Не очень понимаю: в статье сделан вывод о том, какая модель лучше, на основе всего одного примера генерации каждой модели на каждый промпт? Это не статистика, это "пальцем в небо". Если бы хотя бы на 10 примерах показали -- уже был бы хлеб.
По своему опыту, гемини-3-про несколько хуже и gpt-5.2-pro, и sonnet/opus-4.5 в плане логики повествования\продуманности сюжета. В плане "человекоподобного" текста -- на первом месте всегда модели claude. gpt-модели (и 4, и 5) страдают от коротких абзацев (по сравнению с клодом\гемини -- на моих запросах).
Ну и основная проблема -- это качество обучения этих LLM на русском языке: количество обучающих данных на русском языке и на английском несопоставимо. По-хорошему, для креативного письма правильнее давать задачу писать на английском языке, потом результат переводить на русский.