Pull to refresh

Comments 14

Вам не кажется что 2 x M1 для ocr задач это, как бы, ну многовато что ли?

Смотря для каких моделей

Мы проверяли от дипсика которые реально весят до 4ГБ - они слабо справляются с исходной задачей, нужно прикладывать доп усилия (обработку, подготовка и т/д) чтобы распознование прошло

По итогу мы остановились на Qwen3.6-35B - она сходу распознает, без всяких доп плясок и не сильно много требует 19ГБ, как раз на 2 M1

Без доп плясок abby Hot folder распознавал уже в 2008 входящие картинки в папке с исправлением ориентациию картинки, искажение линий, с обрезкой, улучшение контраста (там штук 16 инструментов) с определением языка, язые,правда, из предустановленных. Единственное отличие - модель и 2м1 были не нужны.

Сама идея прикольная, эдакий распределеный computing. Только не биткоины майнятся, а токены. Действительно надо попробовать, у меня тоже есть коробка с компами как и в коммент ниже.

круто, пишите по итогу

Здравствуйте. Из текста не очень понял, может ли быть больше двух маков? У меня на складе как раз целая коробка ноутов валяется, было бы забавно попробовать что нибудь эдакое собрать.

Направляйте нам коробку макбуков, мы протестируем =)

Да может, в целом EXO описывает что рабочая схема при которой остается эффективна 4 мака в сети.

Спасибо, изучу подробнее. На таком количестве уже сетевой слой как будто бы появляется, да и порты на маках сильно не бесконечные.

тандерболт 4 у м1 поддерживается поэтому лимиты тут 40 Гбит/с в обе стороны (двунаправленно). В целом неплохие, если вы не огромная корпорация

А вот уже например у современных м5 тандерболт 5ой версии и тут уже все приятнее - 80 Гбит/с в обе стороны (двунаправленно).

мы в сетевые ограничения не упираемся

Какие потери из за сети? Я смотрел на подобное ролик примерное 3 месяца назад и там было 4 mac studio. И скажем так 4 компьютера были отнюдь не равны производительности каждого из них умноженного на 4. Вполне вероятно, что за это время реализация таких вычислений потянулась, но так или иначе сеть для этого - бутылочное горлышко.

P.s. вообще 28 гб мало, я вот так мак взял на 64 гб, думал, ну сейчас то что то произойдёт:). Ровным счётом 64 тоже мало, как и 32, что было до этого.

У нас компания малая, наши потребности закрывает, в сеть мы никак не упираемся.

Да вы правы, 4 мака это не х4 скорость обработки, потому что важны еще также CPU для токенизации ввода, вывода. Т/е 4 в одну сеть это именно для поднятия бОльших моделей, которые на 64Гб вашем ноуте не взлетит, но взлетит если их будет 2)

Зачем это делается - понятно, видимо у вас реально малые потребности, что вам хватает и M1 у которого в целом пропускная способность памяти маленькая + объединяете. Мне интересно было для программирования и в целом готов сказать, что 27B модели еще пока не тянут нормально + квантизацию лучше использовать не 4, а 6 или 8 бит.

Понятно, что я даже решал что то на процессоре i5-8350U, но в целом если нет необходимости отказываться от внешних ИИ сетей - как бы не выгодно даже с точки зрения электричества использовать ИИ на своем железе. А если занавес, то да, тут без вариантов.

Для кодинга конечно это мало, для ревью, как описано в статье - Qwen3-Coder-30B
вполне делает неплохо, если прописаны чоткие инструкции что ему проверять и как.

Сейчас мы на стадии покупки Nvidia (https://www.nvidia.com/en-us/products/workstations/dgx-spark/)

Купим сразу 2, в итоге получится уже более серьезный объем и скорости. Потестим - отпишем инфу для всех желающих)

Если у кого-то тоже есть опыт локальных серверов для ИИ — делитесь, интересно сравнить подходы..

Начинал с простейшего выделенного сервера инференса на одной RTX-3060/12GB + i5-4520/32GB DDR3 для llama-server под MX Linux 25.2 XFCE на обычных GGUF моделях. Это самый бюджетный однопользовательский вариант ( --parallel 1 - не забываем!).
Сейчас в том же корпусе с более мощным БП 2х RTX-3060/12GB, MB ASUS P9X79 LE, i7-4820k, 4x 8GB DDR3 + "самописное" приложение для удалённого управления сервером.

MODEL=“/srv/models/gemma-4-26B‑A4B‑it‑qat‑q4_0-unquantized‑uncensored‑heretic.i1-Q4_K_M/gemma-4-26B‑A4B‑it‑qat‑q4_0-unquantized‑uncensored‑heretic.i1-Q4_K_M.gguf”

HOST=“0.0.0.0”

PORT=“8080”

THREADS=“8”

CTX=“36864”

BATCH=“768”

NGL=“auto”
И финал лога по задаче:
авг 01 19:35:02 rtx run-llama.sh[197016]: 2.33.827.998 I slot print_timing: id 0 | task 0 | prompt eval time = 3136.40 ms / 5265 tokens ( 0.60 ms per token, 1678.68 tokens per second)

авг 01 19:35:02 rtx run-llama.sh[197016]: 2.33.828.003 I slot print_timing: id 0 | task 0 | eval time = 102895.95 ms / 5964 tokens ( 17.25 ms per token, 57.96 tokens per second)

авг 01 19:35:02 rtx run-llama.sh[197016]: 2.33.828.004 I slot print_timing: id 0 | task 0 | total time = 106032.35 ms / 11229 tokens

авг 01 19:35:02 rtx run-llama.sh[197016]: 2.33.828.020 I slot print_timing: id 0 | task 0 | graphs reused = 5940

авг 01 19:35:02 rtx run-llama.sh[197016]: 2.33.828.366 I slot release: id 0 | task 0 | stop processing: n_tokens = 11228, truncated = 0

круто, а почему скорость выдачи токенов так скачет? в первом 1678 замере, во втором уже всего 57

Sign up to leave a comment.

Articles