Смысл моего сообщения в том, что вещи развиваются и нужно следить за ними. Архитектура e2e моделей с низкой задержкой плюс-минус понятна: берём большую ллмку и обучаем её работать с аудио токенами. Соответственно тут вырисовывается две вещи: можно ли самому обучить такую модель за небольшие деньги (при условии что чистый нормальный датасет хотя бы на 100-1000 часов диалогов есть) и можно ли взять готовую модель и сделать fine-tune (тут даже 50-200 часов должно хватить обучить её говорить как дед).
Есть и маленькие модели с архитектурой moshi, и уже полно каскадных моделей которые имеют TTFT до 500мс. Я сегодня пробую fishaudio s2 pro например, пытаюсь на 5090 завести. Моя цель это ru/en/pl языки.
Из того шо пробовал:
CSM 1B -> можно файнтюнить, RTF 0.6x на 5090, можно вот тут запустить, из коробки там файнтюн на датасете с шёпотом, для полуночных разговоров норм 🤣
VibeVoice 0.5B рилтайм -> из коробки получилось взять польскую женщину и заставить её говорить на en/pl, + па русскэ нэмного акцэнт есть, но "нэ важна", mind == blown 🤣
Ещё пробовал kokoro, там настолько всё быстро, там получилось 98 файлов параллельно создать за 4 секунды на 5090, т.е. 1000 секунд речи за 4 секунды, это 0.004 RTF == 250 раз быстрее рилтайма. Каждый файл это 10 секунд примерно. Т.е. на одной 5090 можно обслуживать 1000 активных пользователей. Но kokoro не умеет в эмоции, там всего 86M параметров.
Короче какие мысли: большие модели могут намного сильнее в "человечность", эмоции, акустические токены, но TTFT и требования к железу растут. Сейчас в поиске модели которая плюс-минус приемлемо звучит, но не требует H100, а заводится на 5090 или даже 3080 12GB
"Дурак твой дед"... Да ещё и на CSS написан. Ужс 🤣
По существу:
"Латентность" в таких системах больше всего теряется на
LLM размышление/думание, юзайте groq/cerebras если надо быстро получать TTFT (time to first token); у меня из польши около 120мс задержка до первого токена
отсутствие режима стрима в TTS модели
есть уже модели которые могут начать генерировать речь из первых 2-3 токенов на вход и сразу же отдавать её, например kyutai / moshi https://kyutai.org/unmute
отсутствие филлерных фраз "ага, хм, угу", которые иногда вставляются по контексту
отсутствие второй более тяжёлой/умной LLM-ки которая может добавить больше полезного контекста к диалогу быстрой маленькой LLM-ки, которая заточена на ведение диалога
Латентность тут в кавычках потому шо тут есть объективная (TTFT, время на инференс) и субъективная часть (филлерные фразы можно тупо заранее отрендерить сотню другую вариантов и просто вкидывать в аудио-поток, пока модель слушает): делать это конечно не в тупую, а через семантическую ллмку, которая понимает когда пользователь сказал какую-то ключевую инфу "я звоню вам по такому то поводу" -- "хм", "готовы сейчас ..." -- "эм... секунду".
Там много ещё эвристик на самом деле.
Есть ещё speech-to-speech модели типа personaplex, там это всё из коробки смоделировано и заводится на видеокарте с 12гб vram.
И да, там куча проблем до сих пор 🤣 Это было временное решение чтоб позволить агенту логиниться в proxmox/hetzner и другие машины, пока я мог бы наблюдать какие команды он запускает
Тут используется tmate, который построен поверх tmux. Проблема точно такая же: логиниться одной командой к серверу `rtmate init` (список берётся из .ssh/config), а далее набираешь rtmate attach <сервер опционально>
А агент использует rtmate run (пользователь не видит вывод), либо rtmate send / read команды (буквально отправляет keypress через сокет, т.е. буквально набирает команды от пользователя и читает текущий буфер терминала)
В идеале нужно написать программку которая работает просто поверх ssh отправляет/принимает байты по какому-нибудь протоколу, например RPC. Кидаю вот старый вариант который я рассматривал, сейчас его бы взял:
-> Вариант 4 (реально инженерно-правильный): SSH как транспорт + RPC протокол
Ты поднимаешь на удалёнке маленький “агент-демон” (например, на python/go), который:
принимает команды (stdin/json)
запускает их (pty или без)
стримит stdout/stderr назад
и параллельно может писать в tmux для видимости
Это уже “настоящий” дизайн: один источник истины — процесс и его потоки, а tmux — просто “вьювер”.
Плюсы:
идеально для автоматизации
можно делать интерактив, отмену, таймауты, статусы
Я нахожусь в Варшаве и тут есть психотерапевт, который диагностирует ADHD. Я к нему скоро запишусь. Медикаменты тоже продаются, но бывают в дефиците. На ютубе было видео (This Is Why You Can't Get ADHD Treatment) почему эти лекарства в дефиците -- из них относительно легко сделать наркотики.
У меня точно такая же проблема с желанием контролировать аспекты своей жизни, но больше всего мне хочется сходить к психологу провериться и попробовать медикаменты.
Я уже посмотрел кучу отчётов у диагностированных, где простая таблетка настолько изменила их жизнь (в лучшую сторону), что некоторые просто начинали рыдать. Один из примеров: человек сидит в комнате, пытается делать задачу. Комната 100х100 метров. На каждом квадратном метре сидит ещё один посторонний человек. Все они занимаются разными делами: рисуют, смотрят телек, травят мемы, храпят, бьют по наковальне, пылесосят, хлопают в ладоши, ставят будильники, проверяют мессенджеры, спорят между собой, играют на губной гармошке, печатают на клавиатуре, запускают дронов, тренируются на барабанах, щёлкают ручками, напевают под нос, устраивают звонки по Zoom, роняют предметы на пол, включают и выключают свет, хлопают дверьми, читают вслух, нюхают аромапалочки, чихают, смеются, рассказывают истории, обсуждают погоду, пробуют новые рингтоны, делают зарядку, едят чипсы, разливают воду, стучат ногами по полу, играют на укулеле, обсуждают философию, тестируют сигнализацию, играют в настолки, собирают мебель, пробуют на себе духи, настраивают проектор, записывают ASMR...
А тебе — нужно работать. И в этой какофонии ты должен как-то ухватить нить мысли. А потом ты пробуешь таблетку — и внезапно комната становится пустой. Остаёшься только ты и твоя задача. Это чувство настолько разительно и освобождающе, что люди действительно не сдерживают слёз. Очень хочется хотя бы попробовать сделать этот шаг.
А так место/идею Ubuntu занял Mint, но я им не пользовался, т.к. предпочитаю самостоятельно ставить всё шо нужно, но пользователи хвалят.
Порог вхождения на сегодня это буквально скачать Live USB дистрибутив и проверить как всё работает вживую.
Ещё меня очень интересует, а что изменилось существенного с 7-й винды, что дистрибутивы до сих пор не могут нагнать? HDR/DirectStorage? Совместимость со старым софтом/играми? Офис? Телеметрия? А может привязка к учётке Microsoft? WSL2?
Я себя не считаю power-юзером, но буквально не могу даже найти ни одной фичи, которая была бы добавлена со врёмен XP и была действительно полезна. WSL2 только разве что. Но он перестал быть актуальным с момента когда появилась аппаратная виртуализация у всех потребительских процессоров.
Всё тот же интерфейс, всё те же проблемы (архитектуре dwm больше 15 лет и уже тогда были мульти-мониторные сетапы с разными герцовками). Только требования к железу и телеметрии растут по сути.
Для меня переходным моментом стала поддержка игр и звук. Можно наконец поставить yabridge и пользоваться VST плагинами. Роутинг звука между приложениями нативный через pipewire. Игры в стиме: просто работают. Из моей библиотеки в 700 игр не запускаются буквально только десяток, по protondb можно проверить актуальный статус.
Пишу этот комментарий с proxmox/arch. Проблемы на десктоп линуксе тоже есть, просто их можно решить, в отличие от винды. Всего 6 дней потребовалось для полной миграции (1.5 дня на proxmox/gpu passthrough/iommu, остальное -- знакомство с арчем и его настройка). Этот, не побоюсь сказать, духовный опыт по очищению от винды должен пройти каждый уважающий себя IT-специалист.
Даже если нужна будет винда, я для того и поставил Proxmox VE, чтобы запускать её отдельно в виртуалке (и отдавать полностью GPU если потребуется для игр / продуктов Adobe). А основная система полностью в арче -- никакой тебе телеметрии, запущенных постоянно антивирусов, утечек оперативы, проблем с падающими после сна видеокартами NVIDIA, блоатвари и так далее.
Пока что кремний слишком дорогой чтобы решать автономно задачи на уровне человека. Как только он станет выгоднее чем затраты электроэнергии человека в час (около 1500 Ватт-ч, прикидывал полгода назад) + почасовая оплата (от $20 до $100/ч), то произойдёт "оптимизация".
К примеру, сеньор в Европе получает те же $40/час, но работать может только 160 часов в месяц. За месяц он потребит условно 1500 ватт-ч * 160ч = 240кВт, ну пусть будет по $0.5 за кВт -> $6500 в месяц.
ИИ может работать 24/7, и тут играет большую роль три метрики:
Производительность труда (условно сколько тикетов закрыто в месяц по сравнению с кожаным мешком)
Стоимость часа работы или одной решённой задачи (средней по T-shirt размеру)
Скалирование — линейное/экспоненциальное
С производительностью и стоимостью всё понятно — если ИИ способен за те же деньги решать задачи с тем же качеством в 2-3 раза быстрей то экономический эффект очевиден и человеки будут не нужны.
Со скалированием гораздо интереснее:
Человека скопировать-вставить и получить прирост производительности в 2х не получится — накладные расходы найма, обучения, "вхождения в коллектив" никуда не деваются.
У ИИ память и контекст общие, и предполагается, что со временем они только становятся лучше, пока проект растёт. Человеки загружать напрямую контекст друг другу в мозги не могут (пока что).
Bus-factor отсутствует. У вас есть документы по проекту — модель их токенизирует и составляет knowledge graph — это точно такая же база, как и любая другая NoSQL. Если человек уходит — бизнес контекст и знания кода, проекта теряются. За 2-4 недели перед уходом физически невозможно передать весь контекст другому человеку, если только он не расписан весь в документах.
Окно контекста у реальных мозгов гораздо хуже чем даже у самой плохой LLM-ки. Мы пока что выигрываем только за счёт релевантной памяти + способность решать новые задачи, которые модель не видела. Уже есть модели, которые способны найти "иголку в стоге сена" (needle in a haystack benchmark) в тексте на 500 тысяч токенов за секунды. У обычных мозгов на это уйдёт несколько минут/часов.
В итоге, что тут можно сказать — чисто энергетически пока не имеет смысла сравнивать, пока ИИ не способен решать задачи полностью автономно с хоть какой-то гарантией качества. А чисто энергетически и по затратам модели генерации текста уже давно превосходят человека. Но генерация эта бессмысленная — к ней нужно тонны RAG и контекста, и дополнительных процессов которые хоть как-то могут разбивать на подзадачи и решать их. Пока что массового решения "из коробки" я не видел.
Подписка на ИИ не нужна, достаточно обычной модели на 4 гигабайта (квант от 8B), которая может ролплеить в рамках игровой истории + TTS движок, который занимает от силы 500 мегабайт. Всё это работает шустро на потребительской видеокарте, а в теории и на процессоре с ИИ-блоками. Диалоги даже не обязательно генерировать в ту же секунду, можно заранее сценарии проработать.
Там можно две системы объединить в одну, будет 256. Под квантами Q3 можно и 671B запустить (252GB), но вообще надо три таких, чтобы было Q4 (~335GB). Мб можно по сети будет распределить нагрузку между тремя digits, там же архитектура MoE.
Ещё стоит упомянуть о нейроморфной архитектуре, туда как раз таки графы хорошо помещаются и веса тренируются гораздо эффективнее, чем перемножение матриц.
Попросил дополнить ответ GPT 4o
Очень интересное замечание о графовой структуре речи и текущих ограничениях архитектуры трансформеров. Графовые модели действительно открывают перспективы для более точного представления речи, особенно если учитывать её когнитивную природу. Здесь стоит упомянуть нейроморфные архитектуры, которые могут внести серьёзные изменения в подход к обработке данных такого рода.
Нейроморфные чипы, такие как Intel Loihi, уже сейчас показывают, как можно заменить перемножение матриц локальными вычислениями на уровне связей (синапсов), что гораздо ближе к биологической природе мозга. Это особенно актуально для задач с графами, где ключевую роль играют локальные маршруты и распределённые взаимодействия. Кроме того, такие архитектуры лучше справляются с разреженными структурами данных, что может быть полезно для представления пауз, ритмов и других когнитивных особенностей речи.
В этом контексте текущие исследования, такие как SSM и longformer, показывают первые шаги в правильном направлении, но они всё ещё ограничены глобальными маршрутами и упрощённым вниманием. Нейроморфные системы могут стать следующим эволюционным этапом, позволяя учитывать локальные и глобальные маршруты в их естественном виде, а также более эффективно тренировать веса.
Графовая модель речи вместе с такими архитектурами может дать гораздо больше, чем просто улучшение трансформеров. Это потенциально откроет дорогу к системам, которые способны моделировать когнитивные аспекты речи, включая интонацию, эмоции и паузы, более точно и эффективно.
Почему до сих пор никто не упомянул, что есть OVMF и QEMU? Ещё в 2017 смотрел на ютубе видео "GPU Passthrough for Virtualization with Ryzen: Now Working". А сегодня наверное можно уже все устройства напрямую передавать виртуалке? Вебку, звуковую карту? И даже VST должно работать без проблем?
В 2009 помню поставил себе Gentoo, но одновременно увлёкся игрой с гитарой в линию (USB, обработка звука VST плагинами), и через эмуляторы подключить звуковую карту невозможно, а VST не работает под линуксом.
Если сегодня это всё возможно, то я без колебаний перешёл бы на Linux.
Да, наверное оптимизировать расчёт разбивкой на динамическую сетку здесь не получится.
Хотя, если у нас в симуляции 10,000 частиц, то сложность алгоритма будет O(N*K), где K — максимальное количество соседних частиц? По-идее сейчас количество CUDA-ядер и shared memory сильно больше, чем в 2013, и если попробовать разбить симуляцию на квадраты/кубы (2D/3D) одинакового размера, то каждое ядро сможет параллельно обсчитывать десятки тысяч взаимодействий на цикл. Только вопрос будет в граничных условиях, можно ли обойтись без копирования частиц из соседних блоков памяти.
Лет 10 назад (ВолГУ, 2013) писал дипломную по ускорению алгоритма Барнс-Хата на видеокартах NVIDIA. Изначально был старый код на Фортране и входные данные для него. На курсовых 2010-2012 переписывал одномерную и двумерную версию с использованием PGI CUDA Fortran Compiler, а в дипломной попытался в 3D, но в одиночку не осилил, и нашёл в итоге treecode/bonsai на C++/CUDA, который смог скомпилить под винду и адаптировать входные параметры в нужный формат. Далее всё это запускалось на рабочих станциях с Tesla C2050 под виндой. И визуализатор там тоже был, выглядит как-то так: https://www.youtube.com/watch?v=aPgzo9Mvk6o
Немного не по теме, т.к. BH в основном используется для гравитационных симуляций, но наверное тоже можно использовать для обычных симуляций с частицами?
Я конечно понимаю, что JavaScript лишает людей сна, радости существования, смысла жизни, разума и прочего, но эта статья превзошла все мои ожидания!
Теперь буду всем начинающим программистам на JS отправлять этот пост — «вот что с тобой случится» ;)
Судя по диаграмме, этот вывод неверный.
Позвольте мне объяснить.
Допустим, купило игру 100,000 пользователей.
94% пользователей на Windows -> 94,000.
4% пользователей на OS X -> 4,000.
2% пользователей на Linux -> 2,000.
Если 94% продаж было сделано для Windows, а от их числа в саппорт поступило 20% запросов, то в итоге получается 94% * 20% = 18.8% запросов от общего числа купивших игру -> 18,800 тикетов.
4% продаж для OS X * 50% запросов -> 2% пользователей -> 2,000 тикетов.
В итоге — количество тикетов от пользователей Windows в 10 раз больше, чем от пользователей OS X. Означает ли это, что нужно прекращать поддержку OS X?
Если просто смотреть на сухие цифры: 50% и 30% — то может показаться, что OS X приносит слишком много проблем, однако из этой статистики + описании проблемы мы видим, что проблема не в OS X и 50%, а в том, что:
1. Нет нормальной поддержки для OS X, из-за которого эта цифра выше, чем для Windows (автор признался сам в отсутствии нужных знаний).
2. Слишком мало пользователей играют на OS X (в 20+ раз меньше чем на Windows), что заставляет задуматься — а зачем автор вообще пытался освоить этот рынок самостоятельно, без внешнего инвестирования, если усилия того не стоят? Можно было попробовать профинансироваться через кикстартер/аналоги, или хотя бы просто спросить пользователей, а нужна ли им версия под Мак.
Короче говоря, диаграмма «Support Requests by Platform» не может являться показателем того, что нужно ориентироваться на рынок Windows, а про OS X забыть. Совсем другое дело, если бы количество тикетов было на одном уровне, но для этого и доля рынка OS X должна была бы быть не 4%, а 30%, а это уже будет означать, что автору придётся его осваивать, если он не хочет потерять 30% возможной прибыли.
https://huggingface.co/brianmatzelle/personaplex-7b-v1-bnb-4bit написано влезает в 10гб
Только английский -- да.
Смысл моего сообщения в том, что вещи развиваются и нужно следить за ними. Архитектура e2e моделей с низкой задержкой плюс-минус понятна: берём большую ллмку и обучаем её работать с аудио токенами. Соответственно тут вырисовывается две вещи: можно ли самому обучить такую модель за небольшие деньги (при условии что чистый нормальный датасет хотя бы на 100-1000 часов диалогов есть) и можно ли взять готовую модель и сделать fine-tune (тут даже 50-200 часов должно хватить обучить её говорить как дед).
Есть и маленькие модели с архитектурой moshi, и уже полно каскадных моделей которые имеют TTFT до 500мс. Я сегодня пробую fishaudio s2 pro например, пытаюсь на 5090 завести. Моя цель это ru/en/pl языки.
Из того шо пробовал:
CSM 1B -> можно файнтюнить, RTF 0.6x на 5090, можно вот тут запустить, из коробки там файнтюн на датасете с шёпотом, для полуночных разговоров норм 🤣
VibeVoice 0.5B рилтайм -> из коробки получилось взять польскую женщину и заставить её говорить на en/pl, + па русскэ нэмного акцэнт есть, но "нэ важна", mind == blown 🤣
Ещё пробовал kokoro, там настолько всё быстро, там получилось 98 файлов параллельно создать за 4 секунды на 5090, т.е. 1000 секунд речи за 4 секунды, это 0.004 RTF == 250 раз быстрее рилтайма. Каждый файл это 10 секунд примерно. Т.е. на одной 5090 можно обслуживать 1000 активных пользователей. Но kokoro не умеет в эмоции, там всего 86M параметров.
Короче какие мысли: большие модели могут намного сильнее в "человечность", эмоции, акустические токены, но TTFT и требования к железу растут. Сейчас в поиске модели которая плюс-минус приемлемо звучит, но не требует H100, а заводится на 5090 или даже 3080 12GB
"Дурак твой дед"... Да ещё и на CSS написан. Ужс 🤣
По существу:
"Латентность" в таких системах больше всего теряется на
LLM размышление/думание, юзайте groq/cerebras если надо быстро получать TTFT (time to first token); у меня из польши около 120мс задержка до первого токена
отсутствие режима стрима в TTS модели
есть уже модели которые могут начать генерировать речь из первых 2-3 токенов на вход и сразу же отдавать её, например kyutai / moshi https://kyutai.org/unmute
отсутствие филлерных фраз "ага, хм, угу", которые иногда вставляются по контексту
отсутствие второй более тяжёлой/умной LLM-ки которая может добавить больше полезного контекста к диалогу быстрой маленькой LLM-ки, которая заточена на ведение диалога
Латентность тут в кавычках потому шо тут есть объективная (TTFT, время на инференс) и субъективная часть (филлерные фразы можно тупо заранее отрендерить сотню другую вариантов и просто вкидывать в аудио-поток, пока модель слушает): делать это конечно не в тупую, а через семантическую ллмку, которая понимает когда пользователь сказал какую-то ключевую инфу "я звоню вам по такому то поводу" -- "хм", "готовы сейчас ..." -- "эм... секунду".
Там много ещё эвристик на самом деле.
Есть ещё speech-to-speech модели типа personaplex, там это всё из коробки смоделировано и заводится на видеокарте с 12гб vram.
Я вот такой тул написал для opencode недавно: https://github.com/konovalov-nk/remote-run/
И да, там куча проблем до сих пор 🤣
Это было временное решение чтоб позволить агенту логиниться в proxmox/hetzner и другие машины, пока я мог бы наблюдать какие команды он запускает
Тут используется tmate, который построен поверх tmux. Проблема точно такая же: логиниться одной командой к серверу `rtmate init` (список берётся из .ssh/config), а далее набираешь rtmate attach <сервер опционально>
А агент использует rtmate run (пользователь не видит вывод), либо rtmate send / read команды (буквально отправляет keypress через сокет, т.е. буквально набирает команды от пользователя и читает текущий буфер терминала)
В идеале нужно написать программку которая работает просто поверх ssh отправляет/принимает байты по какому-нибудь протоколу, например RPC. Кидаю вот старый вариант который я рассматривал, сейчас его бы взял:
-> Вариант 4 (реально инженерно-правильный): SSH как транспорт + RPC протокол
Ты поднимаешь на удалёнке маленький “агент-демон” (например, на python/go), который:
принимает команды (stdin/json)
запускает их (pty или без)
стримит stdout/stderr назад
и параллельно может писать в tmux для видимости
Это уже “настоящий” дизайн: один источник истины — процесс и его потоки, а tmux — просто “вьювер”.
Плюсы:
идеально для автоматизации
можно делать интерактив, отмену, таймауты, статусы
Минусы:
это уже проект, не трюк на 20 строк
Оффтопик, но фраза "вопрос к all" меня вернула в фидонет 90-х 🤣 Спасибо за триггер из
RU.*В фидонете (FidoNet) в эхах часто писали 2All / To: All — обращение “ко всем”. Отсюда и привычка формулировать «вопрос к all».
Я нахожусь в Варшаве и тут есть психотерапевт, который диагностирует ADHD. Я к нему скоро запишусь. Медикаменты тоже продаются, но бывают в дефиците. На ютубе было видео (This Is Why You Can't Get ADHD Treatment) почему эти лекарства в дефиците -- из них относительно легко сделать наркотики.
Этот комментарий должен быть в топе.
У меня точно такая же проблема с желанием контролировать аспекты своей жизни, но больше всего мне хочется сходить к психологу провериться и попробовать медикаменты.
Я уже посмотрел кучу отчётов у диагностированных, где простая таблетка настолько изменила их жизнь (в лучшую сторону), что некоторые просто начинали рыдать. Один из примеров: человек сидит в комнате, пытается делать задачу. Комната 100х100 метров. На каждом квадратном метре сидит ещё один посторонний человек. Все они занимаются разными делами: рисуют, смотрят телек, травят мемы, храпят, бьют по наковальне, пылесосят, хлопают в ладоши, ставят будильники, проверяют мессенджеры, спорят между собой, играют на губной гармошке, печатают на клавиатуре, запускают дронов, тренируются на барабанах, щёлкают ручками, напевают под нос, устраивают звонки по Zoom, роняют предметы на пол, включают и выключают свет, хлопают дверьми, читают вслух, нюхают аромапалочки, чихают, смеются, рассказывают истории, обсуждают погоду, пробуют новые рингтоны, делают зарядку, едят чипсы, разливают воду, стучат ногами по полу, играют на укулеле, обсуждают философию, тестируют сигнализацию, играют в настолки, собирают мебель, пробуют на себе духи, настраивают проектор, записывают ASMR...
А тебе — нужно работать. И в этой какофонии ты должен как-то ухватить нить мысли. А потом ты пробуешь таблетку — и внезапно комната становится пустой. Остаёшься только ты и твоя задача. Это чувство настолько разительно и освобождающе, что люди действительно не сдерживают слёз. Очень хочется хотя бы попробовать сделать этот шаг.
#define "вровень с 7 виндой"
А так место/идею Ubuntu занял Mint, но я им не пользовался, т.к. предпочитаю самостоятельно ставить всё шо нужно, но пользователи хвалят.
Порог вхождения на сегодня это буквально скачать Live USB дистрибутив и проверить как всё работает вживую.
Ещё меня очень интересует, а что изменилось существенного с 7-й винды, что дистрибутивы до сих пор не могут нагнать? HDR/DirectStorage? Совместимость со старым софтом/играми? Офис? Телеметрия? А может привязка к учётке Microsoft? WSL2?
Я себя не считаю power-юзером, но буквально не могу даже найти ни одной фичи, которая была бы добавлена со врёмен XP и была действительно полезна. WSL2 только разве что. Но он перестал быть актуальным с момента когда появилась аппаратная виртуализация у всех потребительских процессоров.
Всё тот же интерфейс, всё те же проблемы (архитектуре dwm больше 15 лет и уже тогда были мульти-мониторные сетапы с разными герцовками). Только требования к железу и телеметрии растут по сути.
Для меня переходным моментом стала поддержка игр и звук. Можно наконец поставить yabridge и пользоваться VST плагинами. Роутинг звука между приложениями нативный через pipewire. Игры в стиме: просто работают. Из моей библиотеки в 700 игр не запускаются буквально только десяток, по protondb можно проверить актуальный статус.
Жить хочется сегодня, а не бороться с системой, как это делал я последние 15 лет: https://markdownpastebin.com/?id=0ed53c5f1d9a4b83acbf64dd4c751d84
Пишу этот комментарий с proxmox/arch. Проблемы на десктоп линуксе тоже есть, просто их можно решить, в отличие от винды. Всего 6 дней потребовалось для полной миграции (1.5 дня на proxmox/gpu passthrough/iommu, остальное -- знакомство с арчем и его настройка). Этот, не побоюсь сказать, духовный опыт по очищению от винды должен пройти каждый уважающий себя IT-специалист.
Даже если нужна будет винда, я для того и поставил Proxmox VE, чтобы запускать её отдельно в виртуалке (и отдавать полностью GPU если потребуется для игр / продуктов Adobe). А основная система полностью в арче -- никакой тебе телеметрии, запущенных постоянно антивирусов, утечек оперативы, проблем с падающими после сна видеокартами NVIDIA, блоатвари и так далее.
Пока что кремний слишком дорогой чтобы решать автономно задачи на уровне человека. Как только он станет выгоднее чем затраты электроэнергии человека в час (около 1500 Ватт-ч, прикидывал полгода назад) + почасовая оплата (от $20 до $100/ч), то произойдёт "оптимизация".
К примеру, сеньор в Европе получает те же $40/час, но работать может только 160 часов в месяц. За месяц он потребит условно 1500 ватт-ч * 160ч = 240кВт, ну пусть будет по $0.5 за кВт -> $6500 в месяц.
ИИ может работать 24/7, и тут играет большую роль три метрики:
Производительность труда (условно сколько тикетов закрыто в месяц по сравнению с кожаным мешком)
Стоимость часа работы или одной решённой задачи (средней по T-shirt размеру)
Скалирование — линейное/экспоненциальное
С производительностью и стоимостью всё понятно — если ИИ способен за те же деньги решать задачи с тем же качеством в 2-3 раза быстрей то экономический эффект очевиден и человеки будут не нужны.
Со скалированием гораздо интереснее:
Человека скопировать-вставить и получить прирост производительности в 2х не получится — накладные расходы найма, обучения, "вхождения в коллектив" никуда не деваются.
У ИИ память и контекст общие, и предполагается, что со временем они только становятся лучше, пока проект растёт. Человеки загружать напрямую контекст друг другу в мозги не могут (пока что).
Bus-factor отсутствует. У вас есть документы по проекту — модель их токенизирует и составляет knowledge graph — это точно такая же база, как и любая другая NoSQL. Если человек уходит — бизнес контекст и знания кода, проекта теряются. За 2-4 недели перед уходом физически невозможно передать весь контекст другому человеку, если только он не расписан весь в документах.
Окно контекста у реальных мозгов гораздо хуже чем даже у самой плохой LLM-ки. Мы пока что выигрываем только за счёт релевантной памяти + способность решать новые задачи, которые модель не видела. Уже есть модели, которые способны найти "иголку в стоге сена" (needle in a haystack benchmark) в тексте на 500 тысяч токенов за секунды. У обычных мозгов на это уйдёт несколько минут/часов.
В итоге, что тут можно сказать — чисто энергетически пока не имеет смысла сравнивать, пока ИИ не способен решать задачи полностью автономно с хоть какой-то гарантией качества. А чисто энергетически и по затратам модели генерации текста уже давно превосходят человека. Но генерация эта бессмысленная — к ней нужно тонны RAG и контекста, и дополнительных процессов которые хоть как-то могут разбивать на подзадачи и решать их. Пока что массового решения "из коробки" я не видел.
Просто оставлю это здесь: https://markdownpastebin.com/?id=51901eaa1f0e43a4bc721e9d2199e05b — список моих проблем с W11
Я уже запланировал себе переустановку системы обратно на линукс. Пока думаю какой дистрибутив — Gentoo наверное уже не модно ставить 😉
Подписка на ИИ не нужна, достаточно обычной модели на 4 гигабайта (квант от 8B), которая может ролплеить в рамках игровой истории + TTS движок, который занимает от силы 500 мегабайт. Всё это работает шустро на потребительской видеокарте, а в теории и на процессоре с ИИ-блоками. Диалоги даже не обязательно генерировать в ту же секунду, можно заранее сценарии проработать.
Там можно две системы объединить в одну, будет 256. Под квантами Q3 можно и 671B запустить (252GB), но вообще надо три таких, чтобы было Q4 (~335GB). Мб можно по сети будет распределить нагрузку между тремя digits, там же архитектура MoE.
Ещё стоит упомянуть о нейроморфной архитектуре, туда как раз таки графы хорошо помещаются и веса тренируются гораздо эффективнее, чем перемножение матриц.
Попросил дополнить ответ GPT 4o
Очень интересное замечание о графовой структуре речи и текущих ограничениях архитектуры трансформеров. Графовые модели действительно открывают перспективы для более точного представления речи, особенно если учитывать её когнитивную природу. Здесь стоит упомянуть нейроморфные архитектуры, которые могут внести серьёзные изменения в подход к обработке данных такого рода.
Нейроморфные чипы, такие как Intel Loihi, уже сейчас показывают, как можно заменить перемножение матриц локальными вычислениями на уровне связей (синапсов), что гораздо ближе к биологической природе мозга. Это особенно актуально для задач с графами, где ключевую роль играют локальные маршруты и распределённые взаимодействия. Кроме того, такие архитектуры лучше справляются с разреженными структурами данных, что может быть полезно для представления пауз, ритмов и других когнитивных особенностей речи.
В этом контексте текущие исследования, такие как SSM и longformer, показывают первые шаги в правильном направлении, но они всё ещё ограничены глобальными маршрутами и упрощённым вниманием. Нейроморфные системы могут стать следующим эволюционным этапом, позволяя учитывать локальные и глобальные маршруты в их естественном виде, а также более эффективно тренировать веса.
Графовая модель речи вместе с такими архитектурами может дать гораздо больше, чем просто улучшение трансформеров. Это потенциально откроет дорогу к системам, которые способны моделировать когнитивные аспекты речи, включая интонацию, эмоции и паузы, более точно и эффективно.
Почему до сих пор никто не упомянул, что есть OVMF и QEMU?
Ещё в 2017 смотрел на ютубе видео "GPU Passthrough for Virtualization with Ryzen: Now Working".
А сегодня наверное можно уже все устройства напрямую передавать виртуалке? Вебку, звуковую карту? И даже VST должно работать без проблем?
В 2009 помню поставил себе Gentoo, но одновременно увлёкся игрой с гитарой в линию (USB, обработка звука VST плагинами), и через эмуляторы подключить звуковую карту невозможно, а VST не работает под линуксом.
Если сегодня это всё возможно, то я без колебаний перешёл бы на Linux.
Да, наверное оптимизировать расчёт разбивкой на динамическую сетку здесь не получится.
Хотя, если у нас в симуляции 10,000 частиц, то сложность алгоритма будет O(N*K), где K — максимальное количество соседних частиц? По-идее сейчас количество CUDA-ядер и shared memory сильно больше, чем в 2013, и если попробовать разбить симуляцию на квадраты/кубы (2D/3D) одинакового размера, то каждое ядро сможет параллельно обсчитывать десятки тысяч взаимодействий на цикл. Только вопрос будет в граничных условиях, можно ли обойтись без копирования частиц из соседних блоков памяти.
Поправьте, если не так.
Лет 10 назад (ВолГУ, 2013) писал дипломную по ускорению алгоритма Барнс-Хата на видеокартах NVIDIA. Изначально был старый код на Фортране и входные данные для него. На курсовых 2010-2012 переписывал одномерную и двумерную версию с использованием PGI CUDA Fortran Compiler, а в дипломной попытался в 3D, но в одиночку не осилил, и нашёл в итоге treecode/bonsai на C++/CUDA, который смог скомпилить под винду и адаптировать входные параметры в нужный формат. Далее всё это запускалось на рабочих станциях с Tesla C2050 под виндой. И визуализатор там тоже был, выглядит как-то так: https://www.youtube.com/watch?v=aPgzo9Mvk6o
Немного не по теме, т.к. BH в основном используется для гравитационных симуляций, но наверное тоже можно использовать для обычных симуляций с частицами?
Так много минусовка статье, потому что формат скорее для ithappens, чем habr.
Теперь буду всем начинающим программистам на JS отправлять этот пост — «вот что с тобой случится» ;)
Позвольте мне объяснить.
Допустим, купило игру 100,000 пользователей.
94% пользователей на Windows -> 94,000.
4% пользователей на OS X -> 4,000.
2% пользователей на Linux -> 2,000.
Если 94% продаж было сделано для Windows, а от их числа в саппорт поступило 20% запросов, то в итоге получается 94% * 20% = 18.8% запросов от общего числа купивших игру -> 18,800 тикетов.
4% продаж для OS X * 50% запросов -> 2% пользователей -> 2,000 тикетов.
В итоге — количество тикетов от пользователей Windows в 10 раз больше, чем от пользователей OS X. Означает ли это, что нужно прекращать поддержку OS X?
Если просто смотреть на сухие цифры: 50% и 30% — то может показаться, что OS X приносит слишком много проблем, однако из этой статистики + описании проблемы мы видим, что проблема не в OS X и 50%, а в том, что:
1. Нет нормальной поддержки для OS X, из-за которого эта цифра выше, чем для Windows (автор признался сам в отсутствии нужных знаний).
2. Слишком мало пользователей играют на OS X (в 20+ раз меньше чем на Windows), что заставляет задуматься — а зачем автор вообще пытался освоить этот рынок самостоятельно, без внешнего инвестирования, если усилия того не стоят? Можно было попробовать профинансироваться через кикстартер/аналоги, или хотя бы просто спросить пользователей, а нужна ли им версия под Мак.
Короче говоря, диаграмма «Support Requests by Platform» не может являться показателем того, что нужно ориентироваться на рынок Windows, а про OS X забыть. Совсем другое дело, если бы количество тикетов было на одном уровне, но для этого и доля рынка OS X должна была бы быть не 4%, а 30%, а это уже будет означать, что автору придётся его осваивать, если он не хочет потерять 30% возможной прибыли.