Pull to refresh
4

User

0,2
Rating
1
Subscribers
Send message

Раньше солнце светило ярче флешки были лучше, случайно нашел ~10+ летнюю 2Gb флешку сзади фоторамки (кто помнит сей гаджет ?) при уборке коробок на балконе (правда закрытом) - JPG-файлы были успешно прочитаны =)

Я правильно понимаю, как раньше меломаны хранили кассеты в холодильнике, у нас все аналогично - храним в нем же + раз в месяц достаем и втыкаем на полчаса в любой USB-порт включенного оборудования - электричество компенсирует утечки =)

Поддержу, локальное использование модели на ПК с VRAM 16Gb и оперативой 128+ Gb имеет право на существование.
На llama_server + i7-265 + 192Gb DDR5-5200 + rtx5070Ti на Q4 стартует с 22 ток/сек , далее плавно просаживается (через полчаса рассуждений до ~16-17 )

Полгода назад считывал данные с "Сlassic Fond" (dos игры) второй половины 90-х - вроде без проблем.
Жаль не выстрелили оптические носители (очень многослойные и т.п.) с заявленным объемом 1Тб+. Видимо облака победили.
Как домашний архив хранения использую обычные HDD (зеркалирую), по мере деградации носителей (или необходимости увеличить емкость) - обновляю HDD (обычно 8-10 лет). Последние, гелевые IronWolf - уже 3 года без проблем.

Ну а старые файлы читаются медленнее просто потому, что заряд в ячейках утекает, и контроллеру приходится угадывать, что же там было записано.

То есть разумное (чтобы не исчерпать ресурс) периодическое принудительно перекопирование починит эту проблему ?

Спасибо

Да, помогло `llama-server -m Qwen3.8-Flash-Next-UD-Q5_K_XL-00001-of-00006.gguf -c 100000 --top-p 0.95 --top-k 20 --temp 0.9 --min-p 0.00 --host 0.0.0.0 --port 8080 --cache_type_k q8_0 --cache_type_v q8_0`

Но результат... давно я так не смеялся ("хлебальник" душевный получился, карикатурный даже ... По моему, у Q3 из ответа выше - лучше справился, хотя детализации меньше):

Qwen3.8-Flash-Next-UD-Q5_K_XL 17.8 t/s
Qwen3.8-Flash-Next-UD-Q5_K_XL 17.8 t/s

А по мне и Q3 - неплохо:

Попробовал разную квантизацию для одного и того "популярного" нечеткого промпта:

Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style

ПК - i7-265 + DDR5-5200 (192G) + 5070Ti(16G VRAM)

gguf - из https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF/tree/main

Запускал в llama с параметрами --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080 ( -c 262144 , за исключением Q6 - там  -c 131000).

Интересно наблюдать за уровнем детализации - например незакрепленные крылья колес, кол-во спиц, некорректность слоев , подчеркивание контуров и т.п. Также резкий просад по скорости на Q5/Q6 (а вот Q5 от Q6 почти не отличаются).

Результаты

Qwen3.8-Flash-Next-UD-IQ3_XXS 24 t/s
Qwen3.8-Flash-Next-UD-IQ3_XXS 24 t/s
Qwen3.8-Flash-Next-UD-Q4_K_XL 23 t/s
Qwen3.8-Flash-Next-UD-Q4_K_XL 23 t/s
Qwen3.8-Flash-Next-UD-Q6_K_XL 16.5 t/s
Qwen3.8-Flash-Next-UD-Q6_K_XL 16.5 t/s

А вот с Qwen3.8-Flash-Next-UD-Q5_K_XL вообще не сложилось, формировал неполное изображение (причем не вываливался, дальше в сессии можно было продолжать работать с нормальными ответами). 3-4 попытки с разными размерами макс размера контекстного окна и top_k/top_p + прописывание –cache_type_k/v q4_0 не разрешили ситуацию (просто иная "битая" картинка). Скорость ~18 t/s. Странно, Q6 отрабатывал полностью.

Qwen3.8-Flash-Next-UD-Q5_K_XL 17.5 t/s
Qwen3.8-Flash-Next-UD-Q5_K_XL 17.5 t/s

Возможно Q5 и починится... Пока для 16G VRAM- все же лучше Q3/Q4 (в зависимости от кол-ва DRAM). Q6 - сильно падает скорость генерации.

Цены, думаю, и в будущем неприятно удивят. Обновлял-покупал родственникам 3 компа в мае (повод - детишки удачно закончили школу или поступают в ВУЗы). В качестве видеокарты ставил 5060Ti-16G за 44-48к руб (новые с гарантией), спустя 3 (всего три) месяца - очень печально (и думаю стоимость не будет останавливаться). Про ОЗУ и говорить не стоит.

Можете для статистики написать ваш CPU + снять нагрузку CPU/GPU-s при генерации токенов. Меня немного удивляет i7-265+1x5070Ti дает нагрузку 90-98% на всех ядрах CPU + 26-36% на GPU при скорости 23t/s. Нагрузка на GPU низкая (при этом VRAM используется "по самые помидоры") в следствии обмена VRAM <- RAM ?

Получаю 22-24 t/s на i7-265 +DDR5-5200 (192G) + 5070Ti(16G VRAM)
llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 262144 --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080

Звучит интересно, я так понимаю, что на ПК подобному 192Gb DRAM (DDR5-5200) + 16GbVRAM - возможно одно из оптимальных решений.

5070Ti-16Gb Изначальный минималистичный промт:
Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style
Модель jrell/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller (если кто посоветует что лучше для 16Gb VRAM - очень надеюсь).
Параметры запуска -cmoe -ngl 99 -c 64000 -fit off --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 --host 0.0.0.0 --port 8080 --cache_type_k q4_0 --cache_type_v q4_0

Нарисовало ужасно:

Поменяв промт на
Нарисуй в SVG пеликана в шапке на старинном велосипеде. Нарисуй без анимации, сначала составь план на 32 шага и по нему рисуй не отклоняясь от него
Получилось много лучше

Скорость генерации составила 45-48t/sec (в обоих случаях потратила более 30000 токенов)

Вспоминается отечественная БК-0010 у которой было 32Кб ОЗУ в режиме 16К под видео и 16К (почти, полкилобайта кушал стек + регистры).
У неё был интересный режим, когда видео память уменьшалась до 4Кб, увеличивая доступную до 28Кб: на экране инфа отображалась только в верхней четверти -). Этим режимом пользовались программы отладчики, копировщики и т.п, которым обычной памяти не хватило бы.

Дороже, но проще, наверное из БУ 2х3090 на 48Gb (50-60к руб) или (кому важна тишина и есть неуверенность в БУ) - новые 2-3 5060Ti-16Gb (за 42-44к руб каждая).
Да и проще их потом сбывать с рук при апгрейдах дальнейших.

Еще важно сохранить рутер. Я вот провайдерский сразу поменял на свой (а куда его закинул или подарил - не помню), а когда спустя N лет разорвал договор (перешел на другого) - еле уговорил менеджера вместо провайдеровского, упомянутого в договоре, вернуть более современный того же производителя (чтобы по бамажкам сошлось).

Немного похожая ситуация:
Есть ПК 64G DDR5 + 5070Ti (16G VRAM), показывает на локальном Qwen3.5-35B-A3B  (под ollama) ~27tok-s. Хочется попробовать уже более толстые A10B и под рукой есть "запасная" 5060Ti-16Gb. Есть также возможность добить память до 128Gb (при апгрейде через месяц).
- Кто-нибудь игрался с конфигурацией 2 разные видеокарты (но одинакового объема) - реально ли "распихивать" слои по разным картам (карты одного семейства)?

Нарушаю ли закон если оставлю книгу в больнице, где её могут прочитать 50+ чел ?
Вообще грани с литературой тонкие: я могу передать гаджет электронную книгу почитать знакомому, но не могу передать файл с неё ему же :)
P.S. Чем больше читателей познакомится с книгой - тем больше шансов, что у авторов купят их произведения.

Тоже купил внешний 3 года назад. Раз в квартал приходится использовать для знакомых/родственников: МРТ и прочие анализы, старые оцифровки видео-фото, записать музыку-аудиокниги для авто 15+ лет с магнитолой без USB...

Еще есть неплохой, сейчас наверное даже несколько ламповый сериал Числа (2005 года) про математика, помогающего ФБР (применяющего различные разделы математики в раскрытии преступлений).

За такое, без конкретизации, можно получить и 0.20.1

Information

Rating
2,905-th
Registered
Activity