Раньше солнце светило ярче флешки были лучше, случайно нашел ~10+ летнюю 2Gb флешку сзади фоторамки (кто помнит сей гаджет ?) при уборке коробок на балконе (правда закрытом) - JPG-файлы были успешно прочитаны =)
Я правильно понимаю, как раньше меломаны хранили кассеты в холодильнике, у нас все аналогично - храним в нем же + раз в месяц достаем и втыкаем на полчаса в любой USB-порт включенного оборудования - электричество компенсирует утечки =)
Поддержу, локальное использование модели на ПК с VRAM 16Gb и оперативой 128+ Gb имеет право на существование. На llama_server + i7-265 + 192Gb DDR5-5200 + rtx5070Ti на Q4 стартует с 22 ток/сек , далее плавно просаживается (через полчаса рассуждений до ~16-17 )
Полгода назад считывал данные с "Сlassic Fond" (dos игры) второй половины 90-х - вроде без проблем. Жаль не выстрелили оптические носители (очень многослойные и т.п.) с заявленным объемом 1Тб+. Видимо облака победили. Как домашний архив хранения использую обычные HDD (зеркалирую), по мере деградации носителей (или необходимости увеличить емкость) - обновляю HDD (обычно 8-10 лет). Последние, гелевые IronWolf - уже 3 года без проблем.
Но результат... давно я так не смеялся ("хлебальник" душевный получился, карикатурный даже ... По моему, у Q3 из ответа выше - лучше справился, хотя детализации меньше):
Запускал в llama с параметрами --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080 ( -c 262144 , за исключением Q6 - там -c 131000).
Интересно наблюдать за уровнем детализации - например незакрепленные крылья колес, кол-во спиц, некорректность слоев , подчеркивание контуров и т.п. Также резкий просад по скорости на Q5/Q6 (а вот Q5 от Q6 почти не отличаются).
Результаты
Qwen3.8-Flash-Next-UD-IQ3_XXS 24 t/s
Qwen3.8-Flash-Next-UD-Q4_K_XL 23 t/s
Qwen3.8-Flash-Next-UD-Q6_K_XL 16.5 t/s
А вот с Qwen3.8-Flash-Next-UD-Q5_K_XL вообще не сложилось, формировал неполное изображение (причем не вываливался, дальше в сессии можно было продолжать работать с нормальными ответами). 3-4 попытки с разными размерами макс размера контекстного окна и top_k/top_p + прописывание –cache_type_k/v q4_0 не разрешили ситуацию (просто иная "битая" картинка). Скорость ~18 t/s. Странно, Q6 отрабатывал полностью.
Qwen3.8-Flash-Next-UD-Q5_K_XL 17.5 t/s
Возможно Q5 и починится... Пока для 16G VRAM- все же лучше Q3/Q4 (в зависимости от кол-ва DRAM). Q6 - сильно падает скорость генерации.
Цены, думаю, и в будущем неприятно удивят. Обновлял-покупал родственникам 3 компа в мае (повод - детишки удачно закончили школу или поступают в ВУЗы). В качестве видеокарты ставил 5060Ti-16G за 44-48к руб (новые с гарантией), спустя 3 (всего три) месяца - очень печально (и думаю стоимость не будет останавливаться). Про ОЗУ и говорить не стоит.
Можете для статистики написать ваш CPU + снять нагрузку CPU/GPU-s при генерации токенов. Меня немного удивляет i7-265+1x5070Ti дает нагрузку 90-98% на всех ядрах CPU + 26-36% на GPU при скорости 23t/s. Нагрузка на GPU низкая (при этом VRAM используется "по самые помидоры") в следствии обмена VRAM <- RAM ?
5070Ti-16Gb Изначальный минималистичный промт: Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style Модель jrell/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller (если кто посоветует что лучше для 16Gb VRAM - очень надеюсь). Параметры запуска -cmoe -ngl 99 -c 64000 -fit off --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 --host 0.0.0.0 --port 8080 --cache_type_k q4_0 --cache_type_v q4_0
Нарисовало ужасно:
Поменяв промт на Нарисуй в SVG пеликана в шапке на старинном велосипеде. Нарисуй без анимации, сначала составь план на 32 шага и по нему рисуй не отклоняясь от него Получилось много лучше
Скорость генерации составила 45-48t/sec (в обоих случаях потратила более 30000 токенов)
Вспоминается отечественная БК-0010 у которой было 32Кб ОЗУ в режиме 16К под видео и 16К (почти, полкилобайта кушал стек + регистры). У неё был интересный режим, когда видео память уменьшалась до 4Кб, увеличивая доступную до 28Кб: на экране инфа отображалась только в верхней четверти -). Этим режимом пользовались программы отладчики, копировщики и т.п, которым обычной памяти не хватило бы.
Дороже, но проще, наверное из БУ 2х3090 на 48Gb (50-60к руб) или (кому важна тишина и есть неуверенность в БУ) - новые 2-3 5060Ti-16Gb (за 42-44к руб каждая). Да и проще их потом сбывать с рук при апгрейдах дальнейших.
Еще важно сохранить рутер. Я вот провайдерский сразу поменял на свой (а куда его закинул или подарил - не помню), а когда спустя N лет разорвал договор (перешел на другого) - еле уговорил менеджера вместо провайдеровского, упомянутого в договоре, вернуть более современный того же производителя (чтобы по бамажкам сошлось).
Немного похожая ситуация: Есть ПК 64G DDR5 + 5070Ti (16G VRAM), показывает на локальном Qwen3.5-35B-A3B (под ollama) ~27tok-s. Хочется попробовать уже более толстые A10B и под рукой есть "запасная" 5060Ti-16Gb. Есть также возможность добить память до 128Gb (при апгрейде через месяц). - Кто-нибудь игрался с конфигурацией 2 разные видеокарты (но одинакового объема) - реально ли "распихивать" слои по разным картам (карты одного семейства)?
Нарушаю ли закон если оставлю книгу в больнице, где её могут прочитать 50+ чел ? Вообще грани с литературой тонкие: я могу передать гаджет электронную книгу почитать знакомому, но не могу передать файл с неё ему же :) P.S. Чем больше читателей познакомится с книгой - тем больше шансов, что у авторов купят их произведения.
Тоже купил внешний 3 года назад. Раз в квартал приходится использовать для знакомых/родственников: МРТ и прочие анализы, старые оцифровки видео-фото, записать музыку-аудиокниги для авто 15+ лет с магнитолой без USB...
Еще есть неплохой, сейчас наверное даже несколько ламповый сериал Числа (2005 года) про математика, помогающего ФБР (применяющего различные разделы математики в раскрытии преступлений).
Раньше
солнце светило ярчефлешки были лучше, случайно нашел ~10+ летнюю 2Gb флешку сзади фоторамки (кто помнит сей гаджет ?) при уборке коробок на балконе (правда закрытом) - JPG-файлы были успешно прочитаны =)Я правильно понимаю, как раньше меломаны хранили кассеты в холодильнике, у нас все аналогично - храним в нем же + раз в месяц достаем и втыкаем на полчаса в любой USB-порт включенного оборудования - электричество компенсирует утечки =)
Поддержу, локальное использование модели на ПК с VRAM 16Gb и оперативой 128+ Gb имеет право на существование.
На llama_server + i7-265 + 192Gb DDR5-5200 + rtx5070Ti на Q4 стартует с 22 ток/сек , далее плавно просаживается (через полчаса рассуждений до ~16-17 )
Полгода назад считывал данные с "Сlassic Fond" (dos игры) второй половины 90-х - вроде без проблем.
Жаль не выстрелили оптические носители (очень многослойные и т.п.) с заявленным объемом 1Тб+. Видимо облака победили.
Как домашний архив хранения использую обычные HDD (зеркалирую), по мере деградации носителей (или необходимости увеличить емкость) - обновляю HDD (обычно 8-10 лет). Последние, гелевые IronWolf - уже 3 года без проблем.
Ну а старые файлы читаются медленнее просто потому, что заряд в ячейках утекает, и контроллеру приходится угадывать, что же там было записано.
То есть разумное (чтобы не исчерпать ресурс) периодическое принудительно перекопирование починит эту проблему ?
Спасибо
Да, помогло `llama-server -m Qwen3.8-Flash-Next-UD-Q5_K_XL-00001-of-00006.gguf -c 100000 --top-p 0.95 --top-k 20 --temp 0.9 --min-p 0.00 --host 0.0.0.0 --port 8080 --cache_type_k q8_0 --cache_type_v q8_0`
Но результат... давно я так не смеялся ("хлебальник" душевный получился, карикатурный даже ... По моему, у Q3 из ответа выше - лучше справился, хотя детализации меньше):
А по мне и Q3 - неплохо:
Попробовал разную квантизацию для одного и того "популярного" нечеткого промпта:
Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style
ПК - i7-265 + DDR5-5200 (192G) + 5070Ti(16G VRAM)
gguf - из https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF/tree/main
Запускал в llama с параметрами --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080 ( -c 262144 , за исключением Q6 - там -c 131000).
Интересно наблюдать за уровнем детализации - например незакрепленные крылья колес, кол-во спиц, некорректность слоев , подчеркивание контуров и т.п. Также резкий просад по скорости на Q5/Q6 (а вот Q5 от Q6 почти не отличаются).
Результаты
А вот с Qwen3.8-Flash-Next-UD-Q5_K_XL вообще не сложилось, формировал неполное изображение (причем не вываливался, дальше в сессии можно было продолжать работать с нормальными ответами). 3-4 попытки с разными размерами макс размера контекстного окна и top_k/top_p + прописывание –cache_type_k/v q4_0 не разрешили ситуацию (просто иная "битая" картинка). Скорость ~18 t/s. Странно, Q6 отрабатывал полностью.
Возможно Q5 и починится... Пока для 16G VRAM- все же лучше Q3/Q4 (в зависимости от кол-ва DRAM). Q6 - сильно падает скорость генерации.
Цены, думаю, и в будущем неприятно удивят. Обновлял-покупал родственникам 3 компа в мае (повод - детишки удачно закончили школу или поступают в ВУЗы). В качестве видеокарты ставил 5060Ti-16G за 44-48к руб (новые с гарантией), спустя 3 (всего три) месяца - очень печально (и думаю стоимость не будет останавливаться). Про ОЗУ и говорить не стоит.
Можете для статистики написать ваш CPU + снять нагрузку CPU/GPU-s при генерации токенов. Меня немного удивляет i7-265+1x5070Ti дает нагрузку 90-98% на всех ядрах CPU + 26-36% на GPU при скорости 23t/s. Нагрузка на GPU низкая (при этом VRAM используется "по самые помидоры") в следствии обмена VRAM <- RAM ?
Получаю 22-24 t/s на i7-265 +DDR5-5200 (192G) + 5070Ti(16G VRAM)
llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 262144 --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080
Звучит интересно, я так понимаю, что на ПК подобному 192Gb DRAM (DDR5-5200) + 16GbVRAM - возможно одно из оптимальных решений.
5070Ti-16Gb Изначальный минималистичный промт:
Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style
Модель jrell/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller (если кто посоветует что лучше для 16Gb VRAM - очень надеюсь).
Параметры запуска -cmoe -ngl 99 -c 64000 -fit off --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 --host 0.0.0.0 --port 8080 --cache_type_k q4_0 --cache_type_v q4_0
Нарисовало ужасно:
Поменяв промт на
Нарисуй в SVG пеликана в шапке на старинном велосипеде. Нарисуй без анимации, сначала составь план на 32 шага и по нему рисуй не отклоняясь от него
Получилось много лучше
Скорость генерации составила 45-48t/sec (в обоих случаях потратила более 30000 токенов)
Вспоминается отечественная БК-0010 у которой было 32Кб ОЗУ в режиме 16К под видео и 16К (почти, полкилобайта кушал стек + регистры).
У неё был интересный режим, когда видео память уменьшалась до 4Кб, увеличивая доступную до 28Кб: на экране инфа отображалась только в верхней четверти -). Этим режимом пользовались программы отладчики, копировщики и т.п, которым обычной памяти не хватило бы.
Дороже, но проще, наверное из БУ 2х3090 на 48Gb (50-60к руб) или (кому важна тишина и есть неуверенность в БУ) - новые 2-3 5060Ti-16Gb (за 42-44к руб каждая).
Да и проще их потом сбывать с рук при апгрейдах дальнейших.
Еще важно сохранить рутер. Я вот провайдерский сразу поменял на свой (а куда его закинул или подарил - не помню), а когда спустя N лет разорвал договор (перешел на другого) - еле уговорил менеджера вместо провайдеровского, упомянутого в договоре, вернуть более современный того же производителя (чтобы по бамажкам сошлось).
Немного похожая ситуация:
Есть ПК 64G DDR5 + 5070Ti (16G VRAM), показывает на локальном Qwen3.5-35B-A3B (под ollama) ~27tok-s. Хочется попробовать уже более толстые A10B и под рукой есть "запасная" 5060Ti-16Gb. Есть также возможность добить память до 128Gb (при апгрейде через месяц).
- Кто-нибудь игрался с конфигурацией 2 разные видеокарты (но одинакового объема) - реально ли "распихивать" слои по разным картам (карты одного семейства)?
Нарушаю ли закон если оставлю книгу в больнице, где её могут прочитать 50+ чел ?
Вообще грани с литературой тонкие: я могу передать гаджет электронную книгу почитать знакомому, но не могу передать файл с неё ему же :)
P.S. Чем больше читателей познакомится с книгой - тем больше шансов, что у авторов купят их произведения.
Тоже купил внешний 3 года назад. Раз в квартал приходится использовать для знакомых/родственников: МРТ и прочие анализы, старые оцифровки видео-фото, записать музыку-аудиокниги для авто 15+ лет с магнитолой без USB...
Еще есть неплохой, сейчас наверное даже несколько ламповый сериал Числа (2005 года) про математика, помогающего ФБР (применяющего различные разделы математики в раскрытии преступлений).
можно для "набивки руки" также использовать https://sql-ex.ru/
За такое, без конкретизации, можно получить и 0.20.1