Comments 14
Вам не кажется что 2 x M1 для ocr задач это, как бы, ну многовато что ли?
Смотря для каких моделей
Мы проверяли от дипсика которые реально весят до 4ГБ - они слабо справляются с исходной задачей, нужно прикладывать доп усилия (обработку, подготовка и т/д) чтобы распознование прошло
По итогу мы остановились на Qwen3.6-35B - она сходу распознает, без всяких доп плясок и не сильно много требует 19ГБ, как раз на 2 M1
Без доп плясок abby Hot folder распознавал уже в 2008 входящие картинки в папке с исправлением ориентациию картинки, искажение линий, с обрезкой, улучшение контраста (там штук 16 инструментов) с определением языка, язые,правда, из предустановленных. Единственное отличие - модель и 2м1 были не нужны.
Сама идея прикольная, эдакий распределеный computing. Только не биткоины майнятся, а токены. Действительно надо попробовать, у меня тоже есть коробка с компами как и в коммент ниже.
Здравствуйте. Из текста не очень понял, может ли быть больше двух маков? У меня на складе как раз целая коробка ноутов валяется, было бы забавно попробовать что нибудь эдакое собрать.
Направляйте нам коробку макбуков, мы протестируем =)
Да может, в целом EXO описывает что рабочая схема при которой остается эффективна 4 мака в сети.

Спасибо, изучу подробнее. На таком количестве уже сетевой слой как будто бы появляется, да и порты на маках сильно не бесконечные.
тандерболт 4 у м1 поддерживается поэтому лимиты тут 40 Гбит/с в обе стороны (двунаправленно). В целом неплохие, если вы не огромная корпорация
А вот уже например у современных м5 тандерболт 5ой версии и тут уже все приятнее - 80 Гбит/с в обе стороны (двунаправленно).
мы в сетевые ограничения не упираемся
Какие потери из за сети? Я смотрел на подобное ролик примерное 3 месяца назад и там было 4 mac studio. И скажем так 4 компьютера были отнюдь не равны производительности каждого из них умноженного на 4. Вполне вероятно, что за это время реализация таких вычислений потянулась, но так или иначе сеть для этого - бутылочное горлышко.
P.s. вообще 28 гб мало, я вот так мак взял на 64 гб, думал, ну сейчас то что то произойдёт:). Ровным счётом 64 тоже мало, как и 32, что было до этого.
У нас компания малая, наши потребности закрывает, в сеть мы никак не упираемся.
Да вы правы, 4 мака это не х4 скорость обработки, потому что важны еще также CPU для токенизации ввода, вывода. Т/е 4 в одну сеть это именно для поднятия бОльших моделей, которые на 64Гб вашем ноуте не взлетит, но взлетит если их будет 2)
Зачем это делается - понятно, видимо у вас реально малые потребности, что вам хватает и M1 у которого в целом пропускная способность памяти маленькая + объединяете. Мне интересно было для программирования и в целом готов сказать, что 27B модели еще пока не тянут нормально + квантизацию лучше использовать не 4, а 6 или 8 бит.
Понятно, что я даже решал что то на процессоре i5-8350U, но в целом если нет необходимости отказываться от внешних ИИ сетей - как бы не выгодно даже с точки зрения электричества использовать ИИ на своем железе. А если занавес, то да, тут без вариантов.
Для кодинга конечно это мало, для ревью, как описано в статье - Qwen3-Coder-30B
вполне делает неплохо, если прописаны чоткие инструкции что ему проверять и как.
Сейчас мы на стадии покупки Nvidia (https://www.nvidia.com/en-us/products/workstations/dgx-spark/)
Купим сразу 2, в итоге получится уже более серьезный объем и скорости. Потестим - отпишем инфу для всех желающих)
Если у кого-то тоже есть опыт локальных серверов для ИИ — делитесь, интересно сравнить подходы..
Начинал с простейшего выделенного сервера инференса на одной RTX-3060/12GB + i5-4520/32GB DDR3 для llama-server под MX Linux 25.2 XFCE на обычных GGUF моделях. Это самый бюджетный однопользовательский вариант ( --parallel 1 - не забываем!).
Сейчас в том же корпусе с более мощным БП 2х RTX-3060/12GB, MB ASUS P9X79 LE, i7-4820k, 4x 8GB DDR3 + "самописное" приложение для удалённого управления сервером.
MODEL=“/srv/models/gemma-4-26B‑A4B‑it‑qat‑q4_0-unquantized‑uncensored‑heretic.i1-Q4_K_M/gemma-4-26B‑A4B‑it‑qat‑q4_0-unquantized‑uncensored‑heretic.i1-Q4_K_M.gguf”
HOST=“0.0.0.0”
PORT=“8080”
THREADS=“8”
CTX=“36864”
BATCH=“768”
NGL=“auto”
И финал лога по задаче:
авг 01 19:35:02 rtx run-llama.sh[197016]: 2.33.827.998 I slot print_timing: id 0 | task 0 | prompt eval time = 3136.40 ms / 5265 tokens ( 0.60 ms per token, 1678.68 tokens per second)
авг 01 19:35:02 rtx run-llama.sh[197016]: 2.33.828.003 I slot print_timing: id 0 | task 0 | eval time = 102895.95 ms / 5964 tokens ( 17.25 ms per token, 57.96 tokens per second)
авг 01 19:35:02 rtx run-llama.sh[197016]: 2.33.828.004 I slot print_timing: id 0 | task 0 | total time = 106032.35 ms / 11229 tokens
авг 01 19:35:02 rtx run-llama.sh[197016]: 2.33.828.020 I slot print_timing: id 0 | task 0 | graphs reused = 5940
авг 01 19:35:02 rtx run-llama.sh[197016]: 2.33.828.366 I slot release: id 0 | task 0 | stop processing: n_tokens = 11228, truncated = 0
Локальный ИИ из MacBook M1