Не знаю, что ответить. Поймали! Видосы все есть в статье и должны открываться прямо в ней, если только вквидео их опять не заблокирует. А на крайний случай все в телеге.
Про видео, противоречивые локации и все такое. Опять поймали! Не меня в этот раз, а Wan 3.0. Ах какие они ушлые, сделали ролик на входе без референсов и не смогли нормально прописать 6 локаций в промпте, чтобы никакая деталь не повторилась. Отвечу, хотя я на Alibaba (Tongyi Lab) не работаю.
Модель в принципе показала способность делать непрерывные ролики и не терять контекст. Да, может что-то немного и не так. Но, если пойти производственным путем, а не одним промтом, то через референсы и корректировки промптов можно добиться значительно большей точности.
Да, и уже сейчас идут вовсю эксперименты с Блендером. В нем через OpenAI Астру строят 3D модель персонажей и локаций, а скины уже накидывает Seedance 2.5 или Wan 3.0. Прикол в том, что LLM модели еще не могут нормально взаимодействовать с Блендером, поэтому 3D модели персонажей выходят уродливыми, но этого оказывается достаточно! Потому что потом видеогенерация заменяет все детали, копирую только движения.
Перешлете другу, он условно прочитает/посмотрим обсудите. Сейчас же не мешает разную шнягу постить (я в принципе про всех нас, пересылать разные мемы и тп). Ничего не изменится кроме контента
Модель это инструмент. Разработчики моделей показали, как их модели работают в сыром виде без особых настроек, без специального монтажа.
Полгода назад ни она модель не могла делать ничего подобного. Год назад никто бы не рискнул снимать фильмы с помощью ии. А сейчас в каждой видеорекламе используется.
Прогресс мощный, молниеносный. То, что вы сейчас заметили то, что обычному человеку и не свойственно, уже завтра даже вы не будете замечать. Все уйдет вперед и дальше смелых предположений.
Странно критиковать текущий момент летя на сверхсветовой скорости, уже через мгновение будет другой.
Этот вопрос был и раньше, еще до появления нейронок и интернета. Никогда не было единственно правильного источника знаний, написанного человеком. И на этот вопрос как-то отвечали, как-то учились. Воспользуйтесь опытом предыдущих поколений и все получится.
"Тогда как вам другая киллерфича локальных моделей - автоматическая детализация лиц людей на дальних планах вторым проходом?"
У моделей Seedance 2.0 (и, конечно, 2.5), у Wan 3.0 этот функционал называется Video Editing и Video Extension. Его не только для лиц можно использовать. Но эти модели и в первый проход с лицами хорошо работают.
Все зависит от целей. Если вы готовы купить железо под MiniMax H3, чтобы сэкономить на облачных версиях, но при этом остаться на сравнимом качестве - ОК. Так тоже для кого-то работает. Для кого-то это экономически оправдано в его задачах. А для кого-то нет. Другое дело, что завтра выйдут новые версии и, если в облаке, ничего докупать не надо, то локальное железо может потребовать апгрейда. Все относительно.
Главный вывод в другом. Скоро каждый сможет снять фильм на уровне мировых студий прямо у себя дома.
Они до этого в других сферах аналогично отрабатывали и в результате становились лидерами, не просто осваивая новых технологии, а создавая новые технологии. Интересно получается. Потому что я в свое время читал Акио Морита (SONY), японец, и он писал, что японцы отлично могут усовершенствовать технологии, существующие патенты, но не создают принципиально новые. Вероятно, его слова можно отнести в целом к азиатам. Но, как видим, китайцы опровергают эти слова. А, возможно, Акио что-то совершенно другое имел в виду.
Возможно, я что-то пропустил, но из ваших комментариев не понял, что вы мне предлагали поработать над вашим проектом. У меня сейчас другие проекты. Но я уверен, что Codex и/или Claude Code отлично справятся с вашей задачей.
Конечно, вопросы возникают при реализации. Как определять и хранить смыслы? Например, как определить, что два утверждения имеют один смысл, или, как хранить противоречия, контекст, версии, степень уверенности и тп.
Я столкнулся с теми же проблемами, как решалось - вы уже прочитали. Но, уверен, есть и другие варианты. Проблематика гораздо шире. Уверен, что тема многократно обсуждалась в научном и инженерном сообществе. Ведь есть же семантические сети, графы знаний, есть разные стандарты RDF, SKOS, Topic Maps.
То есть, тема достаточно изученная, выведенная на уровень международных стандартов и широко дискутируемая.
Жаль, конечно, что есть только минусы в статье в виде повторяющихся чисел, а плюсов и полезного для себя вы не нашли. Надеюсь, мой отрицательный для вас опыт пригодится вам при написании ваших статей. Буду ждать, когда напишите. Присылайте ссылки. Спасибо!
Не знаю, что ответить. Поймали! Видосы все есть в статье и должны открываться прямо в ней, если только вквидео их опять не заблокирует. А на крайний случай все в телеге.
Про видео, противоречивые локации и все такое. Опять поймали! Не меня в этот раз, а Wan 3.0. Ах какие они ушлые, сделали ролик на входе без референсов и не смогли нормально прописать 6 локаций в промпте, чтобы никакая деталь не повторилась. Отвечу, хотя я на Alibaba (Tongyi Lab) не работаю.
Модель в принципе показала способность делать непрерывные ролики и не терять контекст. Да, может что-то немного и не так. Но, если пойти производственным путем, а не одним промтом, то через референсы и корректировки промптов можно добиться значительно большей точности.
DOOM играл тоже, я еще Spear застал.
Да, и уже сейчас идут вовсю эксперименты с Блендером. В нем через OpenAI Астру строят 3D модель персонажей и локаций, а скины уже накидывает Seedance 2.5 или Wan 3.0. Прикол в том, что LLM модели еще не могут нормально взаимодействовать с Блендером, поэтому 3D модели персонажей выходят уродливыми, но этого оказывается достаточно! Потому что потом видеогенерация заменяет все детали, копирую только движения.
Значит, он вам не друг. У друзей интересы общие, а вкусы пересекаются. В крайнем случае, что под себя по ходу фильма поменяет.
Перешлете другу, он условно прочитает/посмотрим обсудите. Сейчас же не мешает разную шнягу постить (я в принципе про всех нас, пересылать разные мемы и тп). Ничего не изменится кроме контента
Да, тоже впечатляет. ИИ-модели сейчас вовсю используют в рекламе, но тщательно стараются это скрывать. SeeDance 2.5, Wan 3.0 далеко продвинулись.
Модель это инструмент. Разработчики моделей показали, как их модели работают в сыром виде без особых настроек, без специального монтажа.
Полгода назад ни она модель не могла делать ничего подобного. Год назад никто бы не рискнул снимать фильмы с помощью ии. А сейчас в каждой видеорекламе используется.
Прогресс мощный, молниеносный. То, что вы сейчас заметили то, что обычному человеку и не свойственно, уже завтра даже вы не будете замечать. Все уйдет вперед и дальше смелых предположений.
Странно критиковать текущий момент летя на сверхсветовой скорости, уже через мгновение будет другой.
Так и будет. Книги, фильмы на заказ. А еще сценарий книг и фильмов будет меняться прямо по ходу в зависимости от вашей реакции.
Этот вопрос был и раньше, еще до появления нейронок и интернета. Никогда не было единственно правильного источника знаний, написанного человеком. И на этот вопрос как-то отвечали, как-то учились. Воспользуйтесь опытом предыдущих поколений и все получится.
Да, референсы сейчас не проблема у моделей.
"Тогда как вам другая киллерфича локальных моделей - автоматическая детализация лиц людей на дальних планах вторым проходом?"
У моделей Seedance 2.0 (и, конечно, 2.5), у Wan 3.0 этот функционал называется Video Editing и Video Extension. Его не только для лиц можно использовать. Но эти модели и в первый проход с лицами хорошо работают.
Что мешает прислать запрос на инвайт?
Все, кто хотел, тот смотрит.
"p.s. На lichess есть задачи из своих партий и сильные-слабые стороны для тренировок."
Рад, что они появились.
А в чем сложность консистентность поддерживать в длинных клипах в облачных версиях?
Все зависит от целей. Если вы готовы купить железо под MiniMax H3, чтобы сэкономить на облачных версиях, но при этом остаться на сравнимом качестве - ОК. Так тоже для кого-то работает. Для кого-то это экономически оправдано в его задачах. А для кого-то нет. Другое дело, что завтра выйдут новые версии и, если в облаке, ничего докупать не надо, то локальное железо может потребовать апгрейда.
Все относительно.
Главный вывод в другом. Скоро каждый сможет снять фильм на уровне мировых студий прямо у себя дома.
Смотря для чего использовать. Локальные модели несопоставимы по качеству с облачными. Понятно почему. Мощности все же разные.
Они до этого в других сферах аналогично отрабатывали и в результате становились лидерами, не просто осваивая новых технологии, а создавая новые технологии. Интересно получается. Потому что я в свое время читал Акио Морита (SONY), японец, и он писал, что японцы отлично могут усовершенствовать технологии, существующие патенты, но не создают принципиально новые. Вероятно, его слова можно отнести в целом к азиатам. Но, как видим, китайцы опровергают эти слова. А, возможно, Акио что-то совершенно другое имел в виду.
Алибаба не раскрыла, на чем обучала. Но у них есть и те и другие ускорители.
Судя по роликам отлично. Но можно самим попробовать. На openrouter открыли урезанный доступ.
Возможно, я что-то пропустил, но из ваших комментариев не понял, что вы мне предлагали поработать над вашим проектом. У меня сейчас другие проекты. Но я уверен, что Codex и/или Claude Code отлично справятся с вашей задачей.
Спасибо! Идея стала понятнее. Согласен. Для дальнейшего обсуждения нужен прототип. Как появится, с удовольствием посмотрю.
Прочитал. Спасибо!
Идея понята.
Конечно, вопросы возникают при реализации.
Как определять и хранить смыслы?
Например, как определить, что два утверждения имеют один смысл, или, как хранить противоречия, контекст, версии, степень уверенности и тп.
Я столкнулся с теми же проблемами, как решалось - вы уже прочитали. Но, уверен, есть и другие варианты. Проблематика гораздо шире. Уверен, что тема многократно обсуждалась в научном и инженерном сообществе. Ведь есть же семантические сети, графы знаний, есть разные стандарты RDF, SKOS, Topic Maps.
То есть, тема достаточно изученная, выведенная на уровень международных стандартов и широко дискутируемая.
Жаль, конечно, что есть только минусы в статье в виде повторяющихся чисел, а плюсов и полезного для себя вы не нашли. Надеюсь, мой отрицательный для вас опыт пригодится вам при написании ваших статей. Буду ждать, когда напишите. Присылайте ссылки. Спасибо!