Pull to refresh
0
Иван Филатов@IvanFilatov

Разработчик

Send message

у меня Windows. Colima не совместима.

я сейчас попробовал gemma-4-26b-a4b-qat
31 токен в секунду.

а qwen3.6-35b-a3b дает 8 токенов. Запускал на deafult параметрах в LM Studio.

Промпт был одинаковый - "напиши о себе, что ты умеешь, какие у тебя возможности".

Почему такая разница - ведь они обе MoE

а LM Studio или LLama.cpp умеет так раскидывать веса в одну-две видяхи, контекст в другие? если я возьму 4 шт 5060.

Просто пропускная способность 5060ti - 448 Гбайт/сек это ну прям очень мало по сравнению с 5090.

две видяхи? 5090 и 5060ti ? сейчаc же не работает SLI режим?

у меня есть условные 700-800к. Хочу получить максимальный профит. Планировал взять максимальный макбук M5 Max на 128 Gb. Но теперь склоняюсь к 5090

спасибо. все указывает что пора поднимать систему с 5090, pci-e 5.0, 64 ddr5

А насколько Podman, как альтернатива docker, лучше?

а Nvidia DGX Spark 128GB 4TB вариант? продают за 500к на Авито.

а Nvidia DGX Spark 128GB 4TB вариант? продают за 500к на Авито.

а какой полный конфиг системы? PCI-E 5.0 ? DDR5 32 или 64 гб ? CPU ?
хочется понять примерно к чему стремиться. 75 токенов в секунду это прям нравится.

Просто я сейчас перед выбором или взять M5 Max с 128GB или взять 5090 с 32 гб
Задачи - локальная модель для кодинга.

Тот же Qwen 3.6 35B A3B уже щупал, но 8 токенов в секунду на 3080Ti с 64 GB DDR4 прям очень слабо. Хочется разогнать скорость, не потеряв качество.

А как архитектура с мульти-экспертами даст больше генерации токенов?

Я думал есть условно GGUF и есть MLX формат. Один лучше раскрывается на GPU типо Nvidia, вторая на Apple Silicon архитектуре-процессорах.

Но одни и те же открытые модели собирают под оба формата.

Получается M5 Max 18-Core, GPU 40-Core, 128GB за 700+ тыс. руб. с пропускной скоростью в 614 ГБ/с даст только 35 токенов в секунду?

А если что-то из Masstransit чтобы реализовать transactionOutbox из коробки?
Допустим создать Consumer и нацелить его на таблицу в БД. А внутрь реализации сделать отправку в Кафку/Реббит ? Или может сразу в конфигурации прописать делегатом публикацию сообщения.

Ага и получится как в известной истории про диваны.
нейросеть: — кожанный мешок купил диван? значит он любит диваны. надо предложить ему еще 100500 диванов в почтовой рассылке!

так например АлиЭкспресс поступает. Несколько месяцев подряд получал от них «купите еще один видео-регистратор».
Нейросеть не понимает, что их всего надо 1 шт в машину. Больше не нужно!

Information

Rating
4,653-rd
Location
Москва, Москва и Московская обл., Россия
Registered
Activity