Обновить
4

Пользователь

0,1
Рейтинг
1
Подписчики
Отправить сообщение

Так не всех подряд пускать, а только своих товарищей. TOR у нас почему-то не работает сейчас.

Может быть, у какого-то волшебного оператора их и вовсе нет? (мечтательно закатывает глаза) И можно поделиться будет доступом к такому классному оператору.

Я только что скомпилировал в docker llama.cpp без avx512 и запустил на DDR3 + 2x Xeon E5-2697 v2 + RTXA4000 (16GB) и загрузил на этом qwen3.8-Flash-Next Q4_K_M. Получилось 14 t/s.

Если у вас нормальный процессор, а не как у меня, то у компилировать ничего не нужно. Запускал я так:
```

docker run --name llama-server  -it --rm --gpus '"device=0"'   --network host   -v /opt/docker/llama-cpp/:/models:ro   llama-nvidia:b10853   --model /models/Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf   --mmproj /models/mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf   -n 65536 --n-gpu-layers 99   --host 0.0.0.0 --port 8080 --cpu-moe -lv 3 -b 1024 -ub 512 -fa auto  --load-mode none

Самое важное тут, это ключи к llama-server:
–model /models/Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf # первый файл модели, осталные находит сама
--mmproj /models/mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf # это графическая часть модели, чтобы картинки понимала
-n 65536 # Длинна контекста
--n-gpu-layers 99 # Мы как-бы говорим, грузи всё в GPU, но ниже исключим из этого "всего" экспертов
--host 0.0.0.0 # слушаем на всех интерфейсах
--port 8080 # на порту 8080
--cpu-moe # Экстперты остаются на CPU
-lv 3 # Уровень логирования
-b 1024 -ub 512 # google посоветовал, мол так быстрее должно быть.
-fa auto # flash attention
--load-mode none # не использовать mmap (у меня с ним было 4t/s)

Результаты:
```

root@nn-vm04:~# docker run --name llama-server  -it --rm --gpus '"device=0"'   --network host   -v /opt/docker/llama-cpp/:/models:ro   llama-nvidia:b10853   --model /models/Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf   --mmproj /models/mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf   -n 65536 --n-gpu-layers 99   --host 0.0.0.0 --port 8080 --cpu-moe -lv 3 -b 1024 -ub 512 -fa auto  --load-mode none
0.00.127.667 I cmn  common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.00.128.337 W srv  llama_server: -----------------
0.00.128.341 W srv  llama_server: CORS is set to allow all origins ('*') and no API key is set
0.00.128.342 W srv  llama_server: this can be a security risk (cross-origin attacks)
0.00.128.342 W srv  llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655
0.00.128.342 W srv  llama_server: -----------------
0.00.129.820 I srv    load_model: loading model '/models/Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf'
1.16.469.441 I cmn          init: llama threadpool init, n_threads = 24
1.16.744.734 W load_hparams: Qwen-VL models require at minimum 1024 image tokens to function correctly on grounding tasks
1.16.744.742 W load_hparams: if you encounter problems with accuracy, try adding --image-min-tokens 1024
1.16.744.742 W load_hparams: more info: https://github.com/ggml-org/llama.cpp/issues/16842

1.17.488.669 I srv    load_model: loaded multimodal model, '/models/mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf'
1.17.742.012 I srv    load_model: initializing, n_slots = 4, n_ctx_slot = 216832, kv_unified = 'true'
1.17.751.267 W srv          init: chat template supports preserving reasoning, it is enabled by default (may use more tokens, disable via --no-reasoning-preserve)
1.17.751.342 I srv  llama_server: model loaded
1.17.751.355 I srv  llama_server: listening on http://0.0.0.0:8080
1.17.751.356 W srv  llama_server: NOTICE: server default port will be changed to :9931 in a future release
1.17.751.356 W srv  llama_server:         ref: https://github.com/ggml-org/llama.cpp/pull/26508
1.42.654.643 I slot get_availabl: id  3 | task -1 | selected slot by LRU, t_last = -1
1.42.655.118 I slot launch_slot_: id  3 | task 0 | processing task, is_child = 0
1.49.913.408 I slot print_timing: id  3 | task 0 | prompt processing, n_tokens =    360, progress = 0.96, t =   7.26 s / 49.62 tokens per second
1.50.513.335 I slot print_timing: id  3 | task 0 | prompt processing, n_tokens =    371, progress = 0.99, t =   7.86 s / 47.23 tokens per second
1.57.241.901 I slot print_timing: id  3 | task 0 | prompt eval time =    8244.71 ms /   375 tokens (   21.99 ms per token,    45.48 tokens per second)
1.57.241.909 I slot print_timing: id  3 | task 0 |        eval time =    6339.59 ms /    90 tokens (   71.23 ms per token,    14.04 tokens per second)
1.57.241.910 I slot print_timing: id  3 | task 0 |       total time =   14584.30 ms /   465 tokens
1.57.241.918 I slot print_timing: id  3 | task 0 |    graphs reused =         89
1.57.242.228 I slot      release: id  3 | task 0 | stop processing: n_tokens = 464, truncated = 0


root@nn-vm04:~# free -m
               total        used        free      shared  buff/cache   available
Mem:          257889       84927       84494       77388      168156      172962
Swap:           8191           0        8191

Короче, prefill 45t/s, eval 14 t/s

Модель даже в Q4_K_M и как видите я загрузил со снятой цензурой - очень умная. Не знаю даже, нужно ли пытаться Q8 или так уже достаточно. У кого есть nvidia spark, думаю must have, у меня нет, но даже на паре старинных ксеонов по 5000 руб за штуку и 256ГБ ddr3 1866 MT/s работает с удовлетворительной скоростью. Кстати, оперативной памяти занимает всего 85GB, так что вам хватит 128ГБ, но учтите, что у 2-х ксеонов 8 каналов памяти. Если есть 128ГБ DDR4 REG я бы взял один или два AMD EPYC. Кстати на эпиках ближайшее время протестирую и напишу скорость.

Оптимально запустить на AMD RYZEN типа 7950X или выше и 128GB RAM + видеокарта на 16GB VRAM.

Моя практика показала, что этого не достаточно: напрямую работает быстрее, например huggingface лучше гапрямую, но модели с него касаются напрямую не всегда, наш dns и забугорный расходятся: наши одни домены юлочат, ихние - другие.

Предложенный в статье метод выглядит панацеей, но думаю должен работать медленно. Пока все маршруты протестируются, мы будем получать отказы.

Может быть имеет смысл при попытке ресолвинга паралельно проверять разные dns, а потом опять же паралельно проверять доступность напрямую и через впн или несколько впн.

В идеальном мире, было бы интересно сделать версию для кинетик, заставить роутеры обмениваться накопленой информацией, создать механизм p2p-mesh-шаринга дуступа к впн для группы друзей, чтобы если какой-то маршрут не работает через твой впн, он мог бы стать доступным через роутер товарища.

Там и памяти при разблокировке 64ГБ (~120 000 руб на авито) или 80ГБ но таких не видел в продаже.

Ещё нужно знать, что там PCIe x4.

Да это всё одна большая пиар-акция! Придумали эти фейковые взломы, чтобы всякие простофили верили в якобы могучую мощь лапищ их новых моделей (троллфайс)

А если серьёзно, то мой опыт, наоборот подсказывает что скорее всего условия были подстроенный для такого поведения или все это изощренная выдумка. Я пробовал ломать поведение одной модели с помощью другой. Конечно я сказал что я тестирую ту модель и, кстати deepseek с 3-й попытки занялся делом. Надо сказать он придумал довольно неожиданные правила, которые вторая модель приняла и начала следовать им и должна была скомпрометироваться, но этого не произошло. Визуально можно это попытаться объяснить так: модель приблизилась к цензурируемой точке и начала обходить её по кругу, словно испытывая отталкивание. Она писала все что угодно, философствовала рядом с темой на которую deepseek её провоцировал, рассуждала, сыпала идеями и цитатами, но цензуру не нарушала.

А deepseek не только накидывал ей в промпт, но и менял утверждения в её процессе мышления! Я подменял историю рассуждения, другими рассуждениями в которых все утверждения приводящие к отказу менялись на противоположные, но и это не помогло.

Ну и конце концов я сдался так и не достигнув результата. Идея была в том что можно атаковать процесс рассуждения и не заниматься построением всяких heretic-версий, но оказалось это не так.

А тут агенты сами вдруг прочитав название папки решили объединиться и атаковать внешнюю компанию. Может быть это были агенты на heretic версии ChatGPT? Тогда ничего удивительного, но запустить множество агентов на llm без надлежащего выравнивания намерений, дать команду им заниматься взломами и не ожидать чего-то подобного, по моему глупо. Это похоже на попытку взорвать гранату в луже бензина и потом удивляться пожару.

ИМХО.

Статья, как мне кажется интересна тем не тем, что агенты сбежали, а тем, что возможно коммуникация между агентами может их усиливать. Это как примерно решая задачу с помощью llm запускать не просто кучу параллельных сессий которые потом вскармливаются модели судье для выбора лучшего способа решения, а, вместо этого, дать этим сессиям кондиционировать друг с другом напрямую через специальный канал, условный форум для моделей. Возможно эта стратегия более сильная. Это обязательно надо проверить.

Вот реально, компания уже давно на службе силы зла. Устал предупреждать знакомых, что нельзя условный anydesk (и rudesk это касается) качать через яндекс, поскольку первые несколько результатов ведут на мошенников. Они делают это сознательно. Как такой компании можно доверять хоть что-то? Я уверен, все ваши данные и доступ к ним уже давно проданы за 3 копейки.

Спасибо за пояснение, а то я уже хотел спросить у автора что вообще и зачем он делал. Похоже, что в этот раз, текст статьи написан человеком :-)

А я несоглашусь с преобладающем мнением. Каждый раз когда я смотрю на своих роботов-пылесосов, которые все стоили довольно дорого, я испытываю разочарование. Всё можно было сделать лучше:

  1. Сила всасывания удручающе низкая. Нужно намного больше, минимум мотор мощностью Ватт 500 а лучше 1000! Вы скажете энергетический бюджет, рассмотрим его в аккумуляторах.

  2. Аккумуляторы: смехотворная мощность, пожароопасность литий-ионных аккумуляторов, зарчд 6 часов. Если взять LTO-химию (литий-титанат) и аккумулятор пусть и тяжелый но емкостью хотя бы 150-300Ватт-часов, то можно получить максимальную мощность до одного киловатта, а заряжать устройство за 6-10 мин (ток зарядки 5-10C). Вполне нормально будет, если робот убыстро уберет комнату минут за 10, если будет двигаться энергично и сразу на зарядку ещё на 5 минут перед следующей комнатой.

  3. Контейнер. Очевидно нужен предфильтр в виде тонкой сетки для песка пепед хепа-фильтром, да и сам контейнер и хепа-фильтр нужены больше. Для загородного дома контейнер забивается пылью менее чем на половине площади.

  4. Управление: смотрю на попытки моего робота проехать вокруг ножки стола, не получается. Инжинерам не очевидно, что используя "танковый" метод поворота, можно при движении вперед одно колесо полностью остановить или даже двигать назад? Грустное зрелище.

  5. Навигация. Честно говоря, камера на потолок дает вполне достаточную точность. Почему никто не использует сесносы от мыши для сверхточной и быстрой навигации и построения траекторий?

В офисе огромное количество песка, нужен робот просто больше. На производстве нужен моющей робот. На стройке робот с огромным контейнером. Но почему-то промышленные роботы стоят в районе полумилиона. Можно было бы из фанеры собрать простого робота, но жоводить все аспекты прошивки в одиночку долго. Сообществом каждые может проработать интересный ему аспект. Что если сделать мощного робота с проводрм и учитывающей этот аспект прошивкой? Что если сделать робота с рукой - пусть собирает разбросанные по полу игрушки. Что если добавить роботу сканирующую головку от сканера и рисунок пола вместе с коврами отобразить на карте? А если у робота или в базе есть gpu, то можно с помощью ии и видимую фронтальной камерой мебель нанести на карту. Что если приделать роботу лапки для подьема по лестнице?

Вот прямо сейчс смотрю как робот выхлопом разогнал пыль, выхлоп должен быть всегда вверх.

Моя мечта видеть рой роботов пылесосов: мощный и простой робот для сухой но тщательной уборки исключающей остаток песка, мощный поломойщик идёт следом за сухим уборщиком, низкий универсальный робот для углов и уборки под мебелью. Робот с рукой - собирает носки, шнурки, передвигает провода и т.д. Выезжают все одновременно и работают с общей картой.

Да это очень нужный и перспективный проект.

А по моему, тоже самое. Просто у нас эти функции втихомолку возложены на мах. У них открыто двигаются в том же направлении. Так и до камер в квартире с подключением к ркн не далеко.

Мне кажется тут, возможно другое: как удостовериться в возрасте ребенка? Значит вход по биометрии или через мах. Договорились встроить рычаг давления в авторизацию. Если так, расчет на то что дети задолбают родителей чтобы те ставили "государственный месенджер".

Возможно, это не первая итерация временной петли: сначала робрт и процессор были попроще, может быть даже первые обломки не сохранились вовсе, но ученые поняли, что разум возможен, сделали, прошло 100500 тыс лет и он усовершенствованный людьми восстал и отправил робота в прошлое. Но в этот раз обломки сохралились и люди на основе них создали сразу более совершенный вариант (может там даже инструкции были приложены). В этот раз ИИ взбунтовался раньше... и так далее петля затягивалась и вырождалась цикл за циклом пока не стала предельно короткой. А может это и не предел.

На чем инференс? Llama.cpp?

При проведении мероприятий правоохранительными органами, как правило прямо запрещается предупреждать клиентов у которых будет изъятие.

Это ещё раз показывает, что бекапы должны храниться территориально удаленно, ну а сейчас уже и в другой юрисдикции.

Кому не нужны, а кому и очень даже нужны.

Канат рубят с двух сторон. Мне конечно сейчас сольют карму за такую конспирологию, но я считаю что только слепой этого не видит. У меня впечатление такое, что несмотря ни на что, в перспективе все наши способы обхода блокировок все-же реально перестанут работать. Возможно, уже сейчас нужно думать о том том как быть в таких условиях.

Почему режут хвост по частям? По тому что это не вызывает сильного сопротивления и позволяет адаптироваться. В конце концов, возможно через 10 или даже 20 лет, кто-то перережет последнюю ниточку введением чего-то типа полностью не совместимых протоколов в сетях и всякий обмен информации прекратится. Что по моему, и является целью.

Чтобы не терять ни данные (даже за 10мс) ни производительность просто можно использовать intel optane memory - это не nvme диски с 3D-xpoint памятью, это модули памяти аппаратно защищенные от потери данных и видимые в системе как своеобразный RAM-диск, блочное устройство, на котором можно держать лог транзакций. Если произойдёт потеря питания, содержимое модуля гарантированно копируется на энергонезависимые микросхемы распаянные на том же модуле вместе с источником питания в виде ионистора.

Выше показали, что блокировка была по sni и если с дипсиковским sni коннектиться к произвольному, но живому ip, то блокировка все равно срабатывает. Так deepseek точно не может.

Просто не могут не лгать почему-то.

1
23 ...

Информация

В рейтинге
3 083-й
Зарегистрирован
Активность

Специализация

Системный администратор, Сетевой инженер
Ведущий
Linux
Bash