Весьма маловероятно что zoom и подобные, вообще будут использовать этот формат, потому что у них свои средства для стенограмм и выдача записей в удобном для распознавания формате нефига не в их интересах. Не говоря о том что под капотом они скорее всего и так пишут каждого участника созвона по отдельности.
Можно попробовать сделать опенсорс плагин для маттермост.
Whisper ощутимо медленнее и тишину воспринимает как повод писать субтитры. Лучше использовать gigaAm v3. Zipformer тоже весьма интересен, но не очень подходит потому что работает только с одним языком. Поделка от nvidia может много языков, но люто путается и требует очистки записей.
часто ли продукты в магазинах дешевеют... есть подозрение что дефляция хуже инфляции. Полгода назад кусал логти и думал брать или не брать, теперь кусаю логти из за того что не взял
Имхо ии это печатная машинка. В руках профи он напишет нормально, а в руках нуба будет шляпа. Потому что профи будет играть роль архитектора, составит спеки и достаточно подробно распишет что и как должно быть реализовано. Меньше пишем, больше думаем над тем каким должен быть конечный результат.
Если дилетант выглядит как профи, и стоит дешевле чем профи. Тогда кто из этих двоих на самом деле профи. Тот кто задачу решает, или тот кто на чистый код наяривает.
как обладатель 5090 могу вам позавидовать, но увы затрудняюсь понять. Использую gemma4 31b qat + mtp + кеш и каких то ощутимых проблем не вижу. Там используется тритон, но в плане производительности меня вполне устраивает ~45 tps при контексте 96к. Больше увы при vllm не лезет, но мне как будто бы не особо то и надо.
Попробуйте, может тоже зайдет. Если пробовали раньше - вероятно ловили косяки парсера тулов\ризонинга, сейчас эти косяки вроде победили.
Llama.cpp не годится для агентов, потому что не умеет нормально работать с kv (читаем про сдвиг контекста). По этому лучше брать vllm. Нет необходимости запихивать весь kv в vram, достаточно одной страницы. Vllm без проблем будет подкладывать в vram страницы из ram. При pcie5 это не приводит к драматичному падению производительности. Ну и moe - странный выбор, уж лучше плотную взять, с mtp получится вполне приятная скорость генерации при нормально работающем kv cache, не падающий по oom и не теряющий системный промпт на длинном контексте.
Если бинарник является микросервисом который надо версионировать, крутить в нескольких экземплярах, динамически настраивать наблюдаемость.. Вот тогда контейнеры внезапно становятся нужны.
Ничем не лучше, потому что это разные инструменты. Mcp это тулы интеграции с почти чем угодно + описание как и зачем они нужны. Скилы это шпаргалки о том как сделать чтото. Скилы могут описывать и вызов mcp и вызов cli. Но как использовать cli модель вангует из датасета.
Еще бы в agy cli это прикрутили. Чтобы можно было легально юзать локальную в купе с gemini по подпиське
так они же на каком то своем языке говорят, он вроде как похож на нормальный, но трактуется вообще не так как все привыкли.
Весьма маловероятно что zoom и подобные, вообще будут использовать этот формат, потому что у них свои средства для стенограмм и выдача записей в удобном для распознавания формате нефига не в их интересах. Не говоря о том что под капотом они скорее всего и так пишут каждого участника созвона по отдельности.
Можно попробовать сделать опенсорс плагин для маттермост.
Whisper ощутимо медленнее и тишину воспринимает как повод писать субтитры. Лучше использовать gigaAm v3. Zipformer тоже весьма интересен, но не очень подходит потому что работает только с одним языком. Поделка от nvidia может много языков, но люто путается и требует очистки записей.
Почему не WInUI, почему WebView..
а если использовать loki, mimir, tempo то все будет доступно в одной графане и будет не нужно открывать лишние интерфейсы.
И еще есть автоинструменирование, позволяющее добавить трейсы без усилий с стороны разработчиков
Мозги не обязательно засовывать внутрь, достаточно любой esp с wifi и возможностью крутить сервы, а сигналы брать снаружи.
часто ли продукты в магазинах дешевеют... есть подозрение что дефляция хуже инфляции. Полгода назад кусал логти и думал брать или не брать, теперь кусаю логти из за того что не взял
vllm и nvfp4 не то чтобы связаны, vvlm просто умеет нормально с kv работать и не падать по oom.
Нужен nvfp4 от unslosh. Потому что пускалки gguf нормально с kv кешем работать не умеют. Осваиваем Vllm и радуемся
Имхо ии это печатная машинка. В руках профи он напишет нормально, а в руках нуба будет шляпа. Потому что профи будет играть роль архитектора, составит спеки и достаточно подробно распишет что и как должно быть реализовано. Меньше пишем, больше думаем над тем каким должен быть конечный результат.
Если дилетант выглядит как профи, и стоит дешевле чем профи. Тогда кто из этих двоих на самом деле профи. Тот кто задачу решает, или тот кто на чистый код наяривает.
Возможно аналог mattermost
в том то и дело, если дорогому кочевнику уже за 35, требования к доходу ощутимо меняются в сторону заградительных.
как обладатель 5090 могу вам позавидовать, но увы затрудняюсь понять. Использую gemma4 31b qat + mtp + кеш и каких то ощутимых проблем не вижу. Там используется тритон, но в плане производительности меня вполне устраивает ~45 tps при контексте 96к. Больше увы при vllm не лезет, но мне как будто бы не особо то и надо.
Попробуйте, может тоже зайдет. Если пробовали раньше - вероятно ловили косяки парсера тулов\ризонинга, сейчас эти косяки вроде победили.
Возрастной ценз не только от 18 но еще и до 34.
Llama.cpp не годится для агентов, потому что не умеет нормально работать с kv (читаем про сдвиг контекста). По этому лучше брать vllm. Нет необходимости запихивать весь kv в vram, достаточно одной страницы. Vllm без проблем будет подкладывать в vram страницы из ram. При pcie5 это не приводит к драматичному падению производительности. Ну и moe - странный выбор, уж лучше плотную взять, с mtp получится вполне приятная скорость генерации при нормально работающем kv cache, не падающий по oom и не теряющий системный промпт на длинном контексте.
Если бинарник является микросервисом который надо версионировать, крутить в нескольких экземплярах, динамически настраивать наблюдаемость.. Вот тогда контейнеры внезапно становятся нужны.
а что собственно раньше мешало модели сходить за документацией... Революции не случилось, просто сделали официальную обертку
Ничем не лучше, потому что это разные инструменты. Mcp это тулы интеграции с почти чем угодно + описание как и зачем они нужны. Скилы это шпаргалки о том как сделать чтото. Скилы могут описывать и вызов mcp и вызов cli. Но как использовать cli модель вангует из датасета.