а какой полный конфиг системы? PCI-E 5.0 ? DDR5 32 или 64 гб ? CPU ? хочется понять примерно к чему стремиться. 75 токенов в секунду это прям нравится.
А если что-то из Masstransit чтобы реализовать transactionOutbox из коробки? Допустим создать Consumer и нацелить его на таблицу в БД. А внутрь реализации сделать отправку в Кафку/Реббит ? Или может сразу в конфигурации прописать делегатом публикацию сообщения.
Ага и получится как в известной истории про диваны.
нейросеть: — кожанный мешок купил диван? значит он любит диваны. надо предложить ему еще 100500 диванов в почтовой рассылке!
так например АлиЭкспресс поступает. Несколько месяцев подряд получал от них «купите еще один видео-регистратор».
Нейросеть не понимает, что их всего надо 1 шт в машину. Больше не нужно!
у меня Windows. Colima не совместима.
я сейчас попробовал gemma-4-26b-a4b-qat
31 токен в секунду.
а qwen3.6-35b-a3b дает 8 токенов. Запускал на deafult параметрах в LM Studio.
Промпт был одинаковый - "напиши о себе, что ты умеешь, какие у тебя возможности".
Почему такая разница - ведь они обе MoE
а LM Studio или LLama.cpp умеет так раскидывать веса в одну-две видяхи, контекст в другие? если я возьму 4 шт 5060.
Просто пропускная способность 5060ti - 448 Гбайт/сек это ну прям очень мало по сравнению с 5090.
две видяхи? 5090 и 5060ti ? сейчаc же не работает SLI режим?
у меня есть условные 700-800к. Хочу получить максимальный профит. Планировал взять максимальный макбук M5 Max на 128 Gb. Но теперь склоняюсь к 5090
спасибо. все указывает что пора поднимать систему с 5090, pci-e 5.0, 64 ddr5
А насколько Podman, как альтернатива docker, лучше?
а Nvidia DGX Spark 128GB 4TB вариант? продают за 500к на Авито.
а Nvidia DGX Spark 128GB 4TB вариант? продают за 500к на Авито.
а какой полный конфиг системы? PCI-E 5.0 ? DDR5 32 или 64 гб ? CPU ?
хочется понять примерно к чему стремиться. 75 токенов в секунду это прям нравится.
Просто я сейчас перед выбором или взять M5 Max с 128GB или взять 5090 с 32 гб
Задачи - локальная модель для кодинга.
Тот же Qwen 3.6 35B A3B уже щупал, но 8 токенов в секунду на 3080Ti с 64 GB DDR4 прям очень слабо. Хочется разогнать скорость, не потеряв качество.
А как архитектура с мульти-экспертами даст больше генерации токенов?
Я думал есть условно GGUF и есть MLX формат. Один лучше раскрывается на GPU типо Nvidia, вторая на Apple Silicon архитектуре-процессорах.
Но одни и те же открытые модели собирают под оба формата.
Получается M5 Max 18-Core, GPU 40-Core, 128GB за 700+ тыс. руб. с пропускной скоростью в 614 ГБ/с даст только 35 токенов в секунду?
А если что-то из Masstransit чтобы реализовать transactionOutbox из коробки?
Допустим создать Consumer и нацелить его на таблицу в БД. А внутрь реализации сделать отправку в Кафку/Реббит ? Или может сразу в конфигурации прописать делегатом публикацию сообщения.
нейросеть: — кожанный мешок купил диван? значит он любит диваны. надо предложить ему еще 100500 диванов в почтовой рассылке!
так например АлиЭкспресс поступает. Несколько месяцев подряд получал от них «купите еще один видео-регистратор».
Нейросеть не понимает, что их всего надо 1 шт в машину. Больше не нужно!