Обновить
-1
Андрей@perebour

Человек

Отправить сообщение

Хорошо, что вовремя позаботился и взял mac studio для иишных дел. Модельки в 70b влетают на ура.

Ну а те, кто тоже поумнее, собирают свои ИИ риги для локального инференса, так хотя бы капитализация затрат и ликвидное железо останется в своих стенах в отличие от подписок.

Ценники логичные, нужно кормить директора, замдиректора и кучу остальных умных дядь и тёть на зарплате, а ещё нужно кормить таких же тёть и дядь, которые держат дата-центры, а ещё кормить тёть и дядь из прочих минцифр, ну и так далее по списку...

На горизонте очень сильно пахнет очередной блокировкой суверенностью, только уже в разделе llm

Этот аттракцион извращения осталось догнать до полбита квантования, и с радостным гиканьем запускать на пульте от микроволновки - смотрите, работает!

Появилась новая группа странных людей с потребительским барахлом, которые всеми силами хотят закатиться в ИИ несмотря ни на что.

Но ведь с практической действительностью все эти потуги не имеют ничего общего.

95% точности в промышленных вещах - это фатальный писец.

А на поговорить ведь достаточно и гигачата

Будет само собой помедленнее в декодере, но у мака и памяти будет поболя, причем единым пулом, и потребляет от не киловатты, нагреваясь как духовка )

Смогу запихивать модели побольше, либо спекулятивку и мультиагентов катать

Меняю скорость инференса на общее удобство

Тоже игрался с этим делом, теперь переезжаю с 2*3090 на мак студио.

V100 морально устарели и с квантованными моделями работают через дополнительные абстракции

Если уж v100, то однозначно 32Гб версии, что открывает доступ к 70b моделям, а они значительно "умнее"

Ну и квантование для кода - исключительно fp8 и выше, плюс подстройка температуры и прочих кэфов

Все большие закрытые пром модели сейчас - Мое, но вес выделенных экспертов превышает веса плотных моделей для "локальных бичей" )

Хочется попробовать локально что то вроде кими или минимакс, но там бюджеты на железяки улетают в космос и без А6000 не обойтись

Все вышесказанное справедливо исключительно при тензором параллелизме.

При пайплайн параллелизме слои делятся горизонтально между картами, результаты вычислений в слоях передаются от карты к карте мгновенно и весят буквально килобайты

Для инференса этого предостаточно, вычислительная мощность упирается лишь в способности самих карт, а не в передачу данных.

В таком режиме топовые карты могут спокойно работать и на псие 3.0 х4, хватит с избытком.

Поэтому вся ваша математика тут бесполезна.

Типичное воздуханство с попыткой обмануть математику.

Почту почитать, новости собрать в кучу, будильники позаряжать и прочей мелкой дрисней поуправлять хватит, особенно с учётом детерминированных тулов и скиллов, а так же готовыми на блюдечке эмбеддингами.

В ризонинг там будет полный покой.

Прекращайте насиловать карты и соберите их в горизонтальный продуваемый майнерский корпус.

Если потребительский корпус, то лучше Phanteks Enthoo Pro 2 не будет, но и он не вывозит толком.

Температура ГПУ совершенно не важна, а вот память ужарите.

Квантования 8бит предостаточно для кодинга и вообще всего бытового, ниже - хуже

Плотные модели лучше ведут себя на длине, лучше трейдят и мыслят, меньше циклятся

Оперативки предостаточно 1:1 к объему VRAM, зачем этот daisy chain?

MTP зарешал скорость очень прилично, скорости инференса теперь предостаточно на 3090, плотные победили.

Карты М2 соединить нвлинком и будет шикарно

Первое - уйти на нативный Линукс, прекратить изврат с wsl

На сотые адаптеры из Китая лучше не смотреть, это EOL архаизм с помойки

Может, скажем ей?

Что за дичь я сейчас прочитал.

70b модель на четырех Н200 и 256 оперативы?

Вы там отбитые наглухо, хотя бы раз в суть локального инференса вдавались то?

Я смотрю, нейрошлак уже даже не проверяют перед высером, главное своих ссылочек и ключевиков напихать

Ни стыда ни совести ни ссылки на приобретение методички

Казна пустеет, милорд!

2026 год объявлен годом поборов во имя крылатых ракет.

А кто не согласен, тот иноагент.

Что конкретно не так?

С примерами, аргументами.

Или очередной агрошкольник с авторским подходом к опсу кубера?

Ерунда полная. Так комментарии не пишут. Лишь бы что нибудь написать.

Улавливаешь?

Главный вопрос - зачем хранить столько данных рядом с сервисами, ради чего такой огород?

Окей, рады, но нету главного:

А плотят то скока?

Хорошо сидеть в business operation критичности, можно и текстовки пописать...

После всего этого хочется только одного - выйти из гонки ради гонки и дауншифтить в теплой стране.

С сениора спрашивают хардкодинг?

Рискуют примерами с ресурсов для джунов?

Задают задачи типа построй нам 100% пром энтерпрайз в одну будку за час?

Уже сразу в топку такие места.

Поработав и так и сяк и эдак, скажу - лучше всего смесь водопадов с доской.

В таком случае практически не плодятся ленивые бездари в команде пригоревших, задачи имеют поставленные сроки и ответственных. Работа и этапы выполнения задач гораздо меньше прокрастинируются.

Скрам и эти все спринты это хомячье колесо, из которого не вынимают хомячков, пока не сдохнут в угоду ттм и красивых отчётов о процессе ради процесса. ЧФ разваливает всю теорию этого подхода.

И да, паразитирующих даже больше, чем на знаменитой картинке с работником Васей в траншее.

Освойте ещё эту как бы профессию эджайл-евангелиста, ну чтобы точно быть полезным в команде.

Информация

В рейтинге
4 598-й
Откуда
Москва, Москва и Московская обл., Россия
Дата рождения
Зарегистрирован
Активность

Специализация

DevOps-инженер, Инженер по доступности сервисов
Ведущий
От 999 999 ₽