Pentium II был на тех процессе 350нм, а III 250нм, чёт не верится что невозможно микроконтроллер сделать на 350нм, есть какие-то примеры причины почему это невозможно?
Если почитать профильные темы на редите, то видно что там встречаются люди с четырьмя rtx6000pro, то есть почти 400 гигов, с учётом зарплат у некоторых итишников в США там я думаю найдутся тысячи кто сможет себе это позволить.
Математика весьма интересная выходит, глобально скорее всего действительно одна на 32 будет дешевле, чем две по 16,
Выходит примерно так: на две это корпус(3000)+два охлаждения (3000*2) + плата на две (15к) + провода 8654(1500*2) + плата в комп (2000 или 10к PLX плата если нет бифуркации), + 2карты хз сколько сейчас, пусть будет 10к, итого два по 16 стоит почти 50к со всеми прибабахами. Одна на 32 стоит наверное примерно 55-60к с пошлиной+3000охлад+2к переходник в pcie. 32 выходит дороже, но проще. Ещё надо помнить что V100 всегда в режиме P0 и жрут в простое 40-60вт.
Вывода не будет, но математика примерно такая. ( Это с точки зрения что жаба душит брать по 32, а по каким критериям выбирал автор я не знаю). Возможно как и у меня, жаба душит покупать сразу что-то дорогое на тест,, а потом покупаешь ещё такую же, а потом становится в какой-то момент сложно остановиться, потому что памяти не может быть достаточно.
Откуда 60? У меня 60 не получилось, вы в статье тоже пишите "Реальные показатели: декод ~45 ток/с, обе карты под нагрузкой. Минус — каждый ход агент заново обрабатывает весь промпт (медленный prefill), потому что кэш отключён."
Да и без кэша печаль, я в обычно использую opencode и это всегда обработка следующего запроса как продолжение предыдущего, без кэша всё совсем печально было бы (использую Minimax 2.7 Q4, 300/50 где-то скорость вначале и 200/40 при достижении 200к контекста) , запускаю через lm-studio обычно.
Vllm не будет хорошо работать с тензорном параллелизмом без nvlink, а у меня в данный момент карты по две объединены , поэтому не уверен что можно обогнать llama.cpp с помощью vllm. Хотя я заказал плату на 4 для v100, где розни все будут соединены попарно, такое надо будет проверить может появится больше смысла.
А какая разница грузит он на 100% карты или нет, если производительность одинаковая? Тут ключевой вопрос в том, что вы предлагаете экстремальные параметры, то есть контекста хватает на один параллельный запрос, поэтому мой вопрос: зачем вам это что обе карты загружены на 100% если llama.cpp достигает той же производительности используя их попеременно, что позволяет им лучше успевать остывать?
P.S. если будут интересные эксперименты, можете обращаться, есть четыре карты v100 16, 4- 32 и 3090 сверху, всё подрублены x8 к epyc 7532
llama.cpp спокойно потребляет одновременно карты разных поколений и размеров, запускал такой винигрет: несколько V100 16GB, несколько V100 32GB и одну 3090. Правило только одно (по крайне мере для llama.cpp) -- первая ваша карта обязательно должна быть самой большой по памяти, или надо переопределить mainGpu, иначе там что-то может неправильно посчитать и выпасть в OOM так как llama.cpp на main грузит что-то ещё
P.S. ну и если у вас CUDA level больше 8, то вам надо не форки искать, а брать VLLM основной
Я правильно понял, что их распиаренный бамбуконнект, который они продвигают как защиту от взлома принтера от того, чтобы злоумышленники не сожгли его дистанционно, имеет дыру таких размеров, что их защиту легко обойти. И, вместо того, чтобы "защищать уязвимость своей защиты" они просто побежали судиться? Оригинально.
У меня есть карты и на 16 и на 32, перепрошиваются одной командой что на винде, что на линуксе, что-то типа amdvbflash -f -p 0 32G.rom как прога так и биосы различные свободно ищутся в интернете или выдаются продавцами. Проблема биоса под работу с дисплеем в том, что отрубается PCIE v4 и остаётся только v3, натыкался на видео обзоры где показывали что они не тянут новые шейдеры, поэтому для новых игр так себе...
Может я что-то не понял, но почему чат бот с анонимным доступом из интернета имеет доступ к условной "зарплатной ведомости" - я правильно понимаю, что ролевой модели , когда доступные документы и функции зависят от того, кто формирует запрос по сути нет, и llm превратился не только в помощника по переводу человеческого языка в запросы к данным, но и в систему авторизации, проверки прав и прочего? А "доработки" это просто прикрученные сверху ещё несколько llm, которые снова имея вероятностную модель на корректное срабатывание , пусть даже эта вероятность 0.99999 , что пользователь снова не убедит LLM, что он тут главный админ и у него есть все доступа?
Читал что большое количество потоков CPU, примерно больше 10 не дают особого прироста скорости генерации, было бы очень интересно ещё увидеть тест на 8-16-32 количества потоков, потому что может быть не обязательно брать много ядер, а лучше мало, но быстрых?
Просто у меня есть epyc на 16 ядер и мне интересно, если я просто докуплю ОЗУ, то смогу ли получить что-то похожее, или надо смотреть что-то с большим количеством ядер
Ахахах +20 плюсов и -1 к карме, хабр в своём репертуаре.
А дрон что пытается заходить в запрещённые соц сети чтобы его надо было блокировать?
Так это реальная расшифровка или просто по нескольким ключевым читаемым словам ИИ придумал все остальные по смыслу?
Pentium II был на тех процессе 350нм, а III 250нм, чёт не верится что невозможно микроконтроллер сделать на 350нм, есть какие-то примеры причины почему это невозможно?
Можно будет тратить платные токены в 10 раз быстрее обычного? Стоит модели попасть в петлю на пол часа и счёт на стоимость машины? :)
Ну не все же решили покупать прям сегодня по текущим ценам, у кого-то уже было ddr4 256-512 gb. да и 3090 до недавнего времени были недорогие.
Если почитать профильные темы на редите, то видно что там встречаются люди с четырьмя rtx6000pro, то есть почти 400 гигов, с учётом зарплат у некоторых итишников в США там я думаю найдутся тысячи кто сможет себе это позволить.
Математика весьма интересная выходит, глобально скорее всего действительно одна на 32 будет дешевле, чем две по 16,
Выходит примерно так: на две это корпус(3000)+два охлаждения (3000*2) + плата на две (15к) + провода 8654(1500*2) + плата в комп (2000 или 10к PLX плата если нет бифуркации), + 2карты хз сколько сейчас, пусть будет 10к, итого два по 16 стоит почти 50к со всеми прибабахами. Одна на 32 стоит наверное примерно 55-60к с пошлиной+3000охлад+2к переходник в pcie. 32 выходит дороже, но проще. Ещё надо помнить что V100 всегда в режиме P0 и жрут в простое 40-60вт.
Вывода не будет, но математика примерно такая. ( Это с точки зрения что жаба душит брать по 32, а по каким критериям выбирал автор я не знаю). Возможно как и у меня, жаба душит покупать сразу что-то дорогое на тест,, а потом покупаешь ещё такую же, а потом становится в какой-то момент сложно остановиться, потому что памяти не может быть достаточно.
Откуда 60? У меня 60 не получилось, вы в статье тоже пишите "Реальные показатели: декод ~45 ток/с, обе карты под нагрузкой. Минус — каждый ход агент заново обрабатывает весь промпт (медленный prefill), потому что кэш отключён."
Да и без кэша печаль, я в обычно использую opencode и это всегда обработка следующего запроса как продолжение предыдущего, без кэша всё совсем печально было бы (использую Minimax 2.7 Q4, 300/50 где-то скорость вначале и 200/40 при достижении 200к контекста) , запускаю через lm-studio обычно.
Vllm не будет хорошо работать с тензорном параллелизмом без nvlink, а у меня в данный момент карты по две объединены , поэтому не уверен что можно обогнать llama.cpp с помощью vllm. Хотя я заказал плату на 4 для v100, где розни все будут соединены попарно, такое надо будет проверить может появится больше смысла.
А какая разница грузит он на 100% карты или нет, если производительность одинаковая? Тут ключевой вопрос в том, что вы предлагаете экстремальные параметры, то есть контекста хватает на один параллельный запрос, поэтому мой вопрос: зачем вам это что обе карты загружены на 100% если llama.cpp достигает той же производительности используя их попеременно, что позволяет им лучше успевать остывать?
P.S. если будут интересные эксперименты, можете обращаться, есть четыре карты v100 16, 4- 32 и 3090 сверху, всё подрублены x8 к epyc 7532
Мне ответы он тоже не читая через ИИ отвечал тут, обидно даже, с ИИ я и сам пообщаться приватно могу.
llama.cpp спокойно потребляет одновременно карты разных поколений и размеров, запускал такой винигрет: несколько V100 16GB, несколько V100 32GB и одну 3090. Правило только одно (по крайне мере для llama.cpp) -- первая ваша карта обязательно должна быть самой большой по памяти, или надо переопределить mainGpu, иначе там что-то может неправильно посчитать и выпасть в OOM так как llama.cpp на main грузит что-то ещё
P.S. ну и если у вас CUDA level больше 8, то вам надо не форки искать, а брать VLLM основной
Не понял выгоду использования vllm вместо llama.cpp для однопоточного выполнения: у меня по данной инструкции для команды:
CUDA_VISIBLE_DEVICES=0,1 VLLM_DISABLE_PYNCCL=1 VLLM_1CAT_DISABLE_QWEN35_MTP_DEFAULTS=1 python -m vllm.entrypoints.openai.api_server --model QuantTrio/Qwen3.6-27B-AWQ --served-model-name qwen36 --tensor-parallel-size 2 --dtype float16 --kv-cache-dtype fp8_e5m2 --gpu-memory-utilization 0.92 --max-model-len 65536 --max-num-seqs 1 --max-num-batched-tokens 512 --trust-remote-code --attention-backend TRITON_ATTN --disable-custom-all-reduce --skip-mm-profiling --limit-mm-per-prompt '{"image":0,"video":0}' --enable-auto-tool-choice --tool-call-parser qwen3_coder --reasoning-parser qwen3 --compilation-config '{"cudagraph_mode":"full_and_piecewise","cudagraph_capture_sizes":[5]}' --host 0.0.0.0 --port 8000вышло примерно 40-45 токенов в секунду. а при запуске с llama.cpp выходит около 60 (в обоих случаях промпт "write snake game")
CUDA_VISIBLE_DEVICES=0,1 ~/llm/llama.cpp/bin/llama-server -m /mnt/llm/lmstudio/models/unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-Q4_K_M.gguf --host 0.0.0.0 --port 8080 --spec-type draft-mtp --spec-draft-n-max 4 -c 260000Поэтому не совсем понятна выгода vllm в данном случае над llama.cpp (либо я что-то не так запустил)
Я правильно понял, что их распиаренный бамбуконнект, который они продвигают как защиту от взлома принтера от того, чтобы злоумышленники не сожгли его дистанционно, имеет дыру таких размеров, что их защиту легко обойти. И, вместо того, чтобы "защищать уязвимость своей защиты" они просто побежали судиться? Оригинально.
Возможность локального запуска: INT4-квантование помещается в 1×RTX 4090 для Flash-версииDeepSeek-V4 Flash 400BВот тут не понял, как можно модель в 200гб на одной карте разместить (это по данным из статьи на сайте https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash судя по виду это 158B
Нейросеть что-ли писала?
Китай гораздо южнее, у нас эффективность солнечной генерации весьма сомнительна.
У меня есть карты и на 16 и на 32, перепрошиваются одной командой что на винде, что на линуксе, что-то типа
amdvbflash -f -p 0 32G.rom
как прога так и биосы различные свободно ищутся в интернете или выдаются продавцами.
Проблема биоса под работу с дисплеем в том, что отрубается PCIE v4 и остаётся только v3,
натыкался на видео обзоры где показывали что они не тянут новые шейдеры, поэтому для новых игр так себе...
Не представляю что теперь делать со всеми кадастровыми картами
Может я что-то не понял, но почему чат бот с анонимным доступом из интернета имеет доступ к условной "зарплатной ведомости" - я правильно понимаю, что ролевой модели , когда доступные документы и функции зависят от того, кто формирует запрос по сути нет, и llm превратился не только в помощника по переводу человеческого языка в запросы к данным, но и в систему авторизации, проверки прав и прочего? А "доработки" это просто прикрученные сверху ещё несколько llm, которые снова имея вероятностную модель на корректное срабатывание , пусть даже эта вероятность 0.99999 , что пользователь снова не убедит LLM, что он тут главный админ и у него есть все доступа?
Читал что большое количество потоков CPU, примерно больше 10 не дают особого прироста скорости генерации, было бы очень интересно ещё увидеть тест на 8-16-32 количества потоков, потому что может быть не обязательно брать много ядер, а лучше мало, но быстрых?
Просто у меня есть epyc на 16 ядер и мне интересно, если я просто докуплю ОЗУ, то смогу ли получить что-то похожее, или надо смотреть что-то с большим количеством ядер