Информация
- В рейтинге
- 3 322-й
- Откуда
- Санкт-Петербург, Санкт-Петербург и область, Россия
- Дата рождения
- Зарегистрирован
- Активность
Специализация
UI/UX дизайнер, 3d моделлер
Старший
От 300 000 ₽
UI/UX дизайн
Blender
3d моделирование
Предметная визуализация
Текстурирование
Дизайн-система
Адаптивный дизайн
GUI дизайн
Дизайн уровней
Скажу от себя лично.
Я глухой UI UX дизайнер, и у меня есть некоторые поправки к тому что вы написали в вашей статье. Сама статья хорошая, но она несколько поверхностна. Хотелось бы увидеть не только итоги исследования но и варианты развития вашего сервиса исходя из услышанного.
Разберу по частям.
Записи видеовстреч.
В вашей статье не было указано что качество звука для глухого, как ни парадоксально не звучало, это важно для нас тоже.
Это считается сейчас важным критерием, так как сейчас существуют возможности смотреть видео и автоматически переводить в специализированных сервисах или программах, либо при закидывании на яндекс диск где через браузер накладываются субтитры. Так же на текущий момент, с учетом развития LLM, появилась возможность разбирать все видео на части и просить их перевести всю речь прямо в субтитры, либо существуют плееры такие как llplayer, которые, транскрибируют речь прямо в режиме просмотра.
Соотвественно: видео в идеале должно иметь максимальную четкость звука не только для вас самих но и тех кто смотрит потом. Я сталкивался с тем, что видео передавалось с битым аудиоканалом, либо же на самих встречах был фоновый шум, который, ломал моделям как локальным так и встроенным в браузер возможность перевести речь. Когда передавалось видео обычно думали что нам звук не важен. А он то как раз и был важен.
В вашей статье так же было указано
* В идеальном интерфейсе человек сможет изменить положение и стиль субтитров под себя. *
Но это не совсем полностью описывает идеальный интерфейс. Идеальный интерфейс, это тот где имеется возможность вытащить спикера в отдельное окно с видеорядом и оно висит поверх видео с спикером. У меня пару раз было так что спикер и переводчик были в разных видеоканалах и вместо того чтобы фиксироваться на РЖЯ переводчике, можно было просто дать возможность открепить видео с переводчиком и закрепить поверх спикера рядом.
Что касается самих субтитров - отмечу, что важно не просто субтитры иметь, но и их автоматическое хранение как отдельный саммари всей встречи. Сейчас существует много сервисов где ты подсоединяешься с видеовстречей и после встречи тебе выдает саммари того о чем говорилось, кто говорил, какой контекст речи был и к чему пришли в итоге.
так же я бы порекомендовал добавить еще возможность откреплять субтитры от слова совсем и перемещать в любую удобную точку экрана, чтобы когда шаришь экран ты мог бы вытащить субтитры и показывать те же макеты в фигме. Хороший пример - перемещаемые субтитры в гугл браузере либо же локальная программа DotAudio
Сейчас попробовал использовать. К сожалению не смог даже запустить полноценно чтобы проверить.
1) каким образом определяется выгрузка модели в видеокарту есть ли возможность выбирать модели?
2) Попробовал запустить на ноутбуке с 4060 - зависает на 55% сам вишпер на стадии загрузки в память видеокарты
3) На процессоре запустилось но с трудом. Программа тестировалась на слабых ноутбуках? Полагаю что на домашнем 5090 будет намного более комфортным.
4) Вишпер позволяет работать в целом с любыми языками - потом за счет нейронки можно перевести на русский любой из языков в том числе и китайский, как я понимаю у вас решили от этоот отказаться?
5) Сам выбор модели не предусматривает что у меня могут быть свои претрейн модели обученные переводить? как я могу из своих моделей добавить?
6) Как я понимаю это вайбкодинг приложения на электрон?
7) Так же отсутствует в целом внятная структура почему зависает, сколько осталось для подготовки модели, почему он не хочет работать, не хватает уведомлений.
8) Инструкции для модели можно ли где то изменить? Возможно ли настроить вишпер чтобы работал с более короткими чанками и подключить вычистку от шума?
По человечески спасибо. Мне как глухому очень важно что такие приложения есть в опенсорсе.
Сам имею опыт работы с вишпером и обвязкой моделей для качества субтитров и батчингом множества видео через форк llplayer.И ваше решение очень и очень хорошее. Надеюсь вы не будете против если форкну чтобы попробовать поднастроить под себя с учетом глухоты. Если я могу вам чем то помочь в вашей работе, то пишите, постараюсь вам помочь чем смогу.
Радоваться. Просить 100% к ЗП. Вы же теперь чертов харнесс-дизайнер-инженер а не просто дизигнер.
После чего муторно и долго начинать переносить компоненты и готовить спецификацию читаемую для нейронок, чтобы был недетермированный перенос компонентов и прописать правила, где что используется и какие условия верстки. Прописать скиллы где нужно пояснить, что нельзя создавать новые компоненты с почти одинаковыми названиями и множить сущности просто так. Ругаемся с фротендерами которые чувствуют как к их филейной части подбирается пушистый зверек. Берем только используемые с понятным кодом и ничего больше. И только после этого можно уже говорить о чем то более серьезном чем просто ваять прототипы и думать в сторону поддерживаемой системы. И начать уже из подготовленных компонентов ваять организмы и блоки.
Это как раз и отвечает на вопрос в том числе, для чего будет использоваться фигма. Как раз для документирования и архивации спецификаций компонентов
Самый простой вариант. Зайти в фигму и в панели внизу, при открытом рабочем столе, в кнопке, там где квадратик плюсик и кружочек, написать enable desktop mcp server и нажать галочку. Выдаст в буфер обмена ссылку. С ней можно пойти к локальной модели живущей в харнессе и дать ссылку и попросить прописать мост. Он сделает все сам
Да, такое возможно.
Я использую Z code где есть возможность сделать мост к фигме. Так же, я бы порекомендовал Qwen дать скиллы, которые, заточены на перенос дизайна из фигмы. Подсмотреть можно их в разделе скиллы в самой фигме, либо же в интернете, без этого получится много пробных попыток неудачных.