Pull to refresh
8
1
Subscribers
Send message

Сложно по аватарке диагностировать. Навскидку - либо что-то со скачанной моделью не то (попробовать скачать другой квант, другого автора, etc), либо попробовать обновить LMStudio или запустить под чистой llamacpp

У llamacpp есть несколько тредов где собирают производительность в относительно унифицированном виде, по AMD посмотрите здесь https://github.com/ggml-org/llama.cpp/discussions/15021 Имейте ввиду что производительность приводится на очень небольшой модели.

Если это запуски для дома, и не надо гонять параллельно 100500 потоков, то в PCI упереться невероятно сложно, трафик между картами по меркам шины мизерный. Зимой измерял на облачном кластере, при запуске дипсика было ~700Mbps. Дома на запусках сеток попроще шина выше 10% не забивалась. Даже запуск между устройствами в локалке на 2.5GbE упирался отнюдь не в сеть.

Минусы 128гб систем к ней относятся точно также. Насколько помню, по вычислительной мощи это ~1\4 от 5090\6000, по пропускной способности ~1\6. Для себя не рассматривал её по собственными причинам (arm на linux - не то, с чем хотелось бы возиться и альтернативно применять). Из плюсов - отлично стакается через фирменный интерконект на очень высокой скорости и это всё ещё cuda. Минусы - дорогая и небыстрая cuda :( Если бы она вышла по той цене и в те сроки когда её анонсировали - было бы неплохо. Сейчас и в почти два раза дороже - довольно нишевое устройство

Кстати, квен скачался, запустил, получил на CPU/ddr5 15tps, т.е. 8 это все-таки маловато.

  1. Посмотрите внимательнее на текущий сетап, 8т\с это навскидку маловато. На чистом CPU у меня гемма 26B/A4 выдает под 13 т\с. Поставил скачаться квен для проверки, но повторюсь, навскидку это выглядит странно (или это ddr4 так сильно влияет, что перекрывает буст от видяхи..). Радикально не ускорится конечно, но, мне кажется, процентов 50+ ещё можно выжать

  2. Если вам 35B достаточно, то конечно 5090, она уделает мак как стоячий. Особенно с кодом, особенно, если подразумевается много префила, где макам особенно больно (m5 в этом плане заметно подкрутили, но разница все еще очень велика)

  3. У 128Гб систем сейчас есть дурацкая проблема в отсутствии разнообразия моделей. Есть заметное число в районе 20-35 (gemma, пачка qwen, вот героиня статьи ). И дальше дырка до ~250B с очень редкими вкраплениями. Очень немолодая OSS120, упомянутый выше зимний квен ровно в одной редакции, странноватый nemotron и кажется всё (есть ещё второй\третий эшелон, но там кажется в основном доработки на базе топов, и их проверять у меня лично уже сил не хватает).. Очень сильно попрыгав, утаптывая, можно всунуть младшие кванты нового дипсик-флеша или инклинга или 235B квена.. Но у мака (и например систем на базе AMD395+) в 128гб еще и систему надо разместить.. А еще хочется контексту, да побольше, а еще если агенты, то и в два-три-n потоков... А если еще и работать на ней же, а не оставить чисто как LLM-сервер, то среда разработки, запуски и т.п. и т.д..

Извините, но не понял, где здесь множество трактовок? Полная фраза все-таки “С планетой всё в порядке. Это людям п…ц”. И значит она ровно то, что вы указали - с астрономическим телом всё в порядке. И даже биосферу угробить в ноль - задача невероятно сложная. А вот людям - он самый, белый и пушистый. Да и не лозунг это, а так, констатация факта..

Жажду подробностей про сборку 128GB VRAM на 3090/4090/5090 (особенно на последних) за $4К. За эти деньги даже пару 5090 купить - отдельный квест, разве что ловить по барахолкам на удачу, не считая задачи собрать железо в которое их можно воткнуть четыре штуки

Для дома - терпимо, если понимать лимиты, агенты шуршащие в фоне - норм. Любая серьезная нагрузка, параллельные сессии с десятка пользователей и т.п. - мимо. По факту даже 200B будет неприятно, 500 - без шансов (Q1 с куцым контекстом, запинающийся через вопрос - не в счёт)

Из джемини достать ссылки, которые оно реально использовало для ответа - это вообще отдельный квест (что каждый раз ставит меня в ступор)

Если честно, даже если слухи оправдаются, то будет выглядеть как бесполезное обновление ради обновления (ну надо ж за два года хоть что-то показать..)

Память на вес золота, а нам предлагают решение в виде "давайте добавим больше памяти". Г - Логика. При том, что карты 50 семейства по РРЦ кроме как на слайдах презентации надо было еще поискать (был небольшой промежуток, когда затянувшийся период стартового дефицита уже закончился, а память еще не успела взлететь)..

Если у вас к 2026 году для ответа на вопрос "что с проектом" нужно идти в лички - то может это не ваше?

Это не зарплата, это график биткоина. У меня единственное объяснение - маленькая выборка (n=344 за всё время) + редкие, но очень дорогие вакансии типа «ищем сеньора в банк за 500К». Одна такая вакансия в месяце с n=10 - и медиана улетает в космос.

Могли бы пояснить этот момент? Вроде ж медиана как раз для того и медиана, а не среднее, чтобы слабо реагировать на выбросы?

Надо будет позже очень внимательно почитать, но я максимально сильно сомневаюсь в реалистичности работающей квантовой системы на 200 логических запутываемых совместно кубитов в 2026 году

Так и вижу, как компании радостно покупают кипятильник на киловатты за тыщи долларов и во всю мощь начинают использовать силу квантово-классических вычислений аж на все шесть кубитов ни в чем себе не отказывая

у меня одно время висел распечатаный комикс про "в интернете снова кто-то неправ". После написания коментария, перед отправкой, кидал взгляд, секундная пауза, и часто закрывал страницу без отправки. Пару месяцев продержался, забавный опыт был :D

Про это целый раздел в статье, так и называется "Зачем писать своего агента"

+1
Тоже летал на нём в десятых пару раз на внутренних рейсах. Первый раз при входе сильно удивился компоновке кресел 2+3 (737/320 всегда видел только 3+3), сев на место полез смотреть в билет в поисках модели самолёта. Еще помню удивление с того рейса, что давали полноценный горячий обед вместо сэндвичей с нанометровыми начинками, на которые уже перешли другие перевозчики.

Для pdf никакого плагина не надо, ctrl+p и отправка на виртуальный принтер. В винде он вроде давно уже в стандартной поставке, в *nix- вероятно каждый сам себе творец счастья..

По теме - когда-то сохранял в mhtml, сейчас просто ctrl+s в режиме "полностью". Да есть оверхед, да, не сохраняются приложенные видео. Оба минуса пока устраивают. На гитару посмотрю, но скорее всего необходимость в отдельном инструменте перевесит плюсы.

И кстати вопрос рядом, если в рекламе книги будет приведен участок текста со словом не попавшим в словари - закон будет радостно срабатывать?

О, еще один бизнес с рентабельностью в лучшем случае на уровне процентной ставки. Однако здесь еще и бонус - прибыль "около 22 тысяч в месяц чистыми"

:headbang

@slava_ruminа не было идеи сделать серию "тот же бизнес спустя x лет" (когтеточкиии! как они? живы, процветают?) . Извиняюсь, если пропустил.

1
23 ...

Information

Rating
5,076-th
Registered
Activity