Хорошо, что вовремя позаботился и взял mac studio для иишных дел. Модельки в 70b влетают на ура.
Ну а те, кто тоже поумнее, собирают свои ИИ риги для локального инференса, так хотя бы капитализация затрат и ликвидное железо останется в своих стенах в отличие от подписок.
Ценники логичные, нужно кормить директора, замдиректора и кучу остальных умных дядь и тёть на зарплате, а ещё нужно кормить таких же тёть и дядь, которые держат дата-центры, а ещё кормить тёть и дядь из прочих минцифр, ну и так далее по списку...
На горизонте очень сильно пахнет очередной блокировкой суверенностью, только уже в разделе llm
Все вышесказанное справедливо исключительно при тензором параллелизме.
При пайплайн параллелизме слои делятся горизонтально между картами, результаты вычислений в слоях передаются от карты к карте мгновенно и весят буквально килобайты
Для инференса этого предостаточно, вычислительная мощность упирается лишь в способности самих карт, а не в передачу данных.
В таком режиме топовые карты могут спокойно работать и на псие 3.0 х4, хватит с избытком.
Типичное воздуханство с попыткой обмануть математику.
Почту почитать, новости собрать в кучу, будильники позаряжать и прочей мелкой дрисней поуправлять хватит, особенно с учётом детерминированных тулов и скиллов, а так же готовыми на блюдечке эмбеддингами.
Поработав и так и сяк и эдак, скажу - лучше всего смесь водопадов с доской.
В таком случае практически не плодятся ленивые бездари в команде пригоревших, задачи имеют поставленные сроки и ответственных. Работа и этапы выполнения задач гораздо меньше прокрастинируются.
Скрам и эти все спринты это хомячье колесо, из которого не вынимают хомячков, пока не сдохнут в угоду ттм и красивых отчётов о процессе ради процесса. ЧФ разваливает всю теорию этого подхода.
И да, паразитирующих даже больше, чем на знаменитой картинке с работником Васей в траншее.
Освойте ещё эту как бы профессию эджайл-евангелиста, ну чтобы точно быть полезным в команде.
Хорошо, что вовремя позаботился и взял mac studio для иишных дел. Модельки в 70b влетают на ура.
Ну а те, кто тоже поумнее, собирают свои ИИ риги для локального инференса, так хотя бы капитализация затрат и ликвидное железо останется в своих стенах в отличие от подписок.
Ценники логичные, нужно кормить директора, замдиректора и кучу остальных умных дядь и тёть на зарплате, а ещё нужно кормить таких же тёть и дядь, которые держат дата-центры, а ещё кормить тёть и дядь из прочих минцифр, ну и так далее по списку...
На горизонте очень сильно пахнет очередной
блокировкойсуверенностью, только уже в разделе llmЭтот аттракцион извращения осталось догнать до полбита квантования, и с радостным гиканьем запускать на пульте от микроволновки - смотрите, работает!
Появилась новая группа странных людей с потребительским барахлом, которые всеми силами хотят закатиться в ИИ несмотря ни на что.
Но ведь с практической действительностью все эти потуги не имеют ничего общего.
95% точности в промышленных вещах - это фатальный писец.
А на поговорить ведь достаточно и гигачата
Будет само собой помедленнее в декодере, но у мака и памяти будет поболя, причем единым пулом, и потребляет от не киловатты, нагреваясь как духовка )
Смогу запихивать модели побольше, либо спекулятивку и мультиагентов катать
Меняю скорость инференса на общее удобство
Тоже игрался с этим делом, теперь переезжаю с 2*3090 на мак студио.
V100 морально устарели и с квантованными моделями работают через дополнительные абстракции
Если уж v100, то однозначно 32Гб версии, что открывает доступ к 70b моделям, а они значительно "умнее"
Ну и квантование для кода - исключительно fp8 и выше, плюс подстройка температуры и прочих кэфов
Все большие закрытые пром модели сейчас - Мое, но вес выделенных экспертов превышает веса плотных моделей для "локальных бичей" )
Хочется попробовать локально что то вроде кими или минимакс, но там бюджеты на железяки улетают в космос и без А6000 не обойтись
Все вышесказанное справедливо исключительно при тензором параллелизме.
При пайплайн параллелизме слои делятся горизонтально между картами, результаты вычислений в слоях передаются от карты к карте мгновенно и весят буквально килобайты
Для инференса этого предостаточно, вычислительная мощность упирается лишь в способности самих карт, а не в передачу данных.
В таком режиме топовые карты могут спокойно работать и на псие 3.0 х4, хватит с избытком.
Поэтому вся ваша математика тут бесполезна.
Типичное воздуханство с попыткой обмануть математику.
Почту почитать, новости собрать в кучу, будильники позаряжать и прочей мелкой дрисней поуправлять хватит, особенно с учётом детерминированных тулов и скиллов, а так же готовыми на блюдечке эмбеддингами.
В ризонинг там будет полный покой.
Прекращайте насиловать карты и соберите их в горизонтальный продуваемый майнерский корпус.
Если потребительский корпус, то лучше Phanteks Enthoo Pro 2 не будет, но и он не вывозит толком.
Температура ГПУ совершенно не важна, а вот память ужарите.
Квантования 8бит предостаточно для кодинга и вообще всего бытового, ниже - хуже
Плотные модели лучше ведут себя на длине, лучше трейдят и мыслят, меньше циклятся
Оперативки предостаточно 1:1 к объему VRAM, зачем этот daisy chain?
MTP зарешал скорость очень прилично, скорости инференса теперь предостаточно на 3090, плотные победили.
Карты М2 соединить нвлинком и будет шикарно
Первое - уйти на нативный Линукс, прекратить изврат с wsl
На сотые адаптеры из Китая лучше не смотреть, это EOL архаизм с помойки
Может, скажем ей?
Что за дичь я сейчас прочитал.
70b модель на четырех Н200 и 256 оперативы?
Вы там отбитые наглухо, хотя бы раз в суть локального инференса вдавались то?
Я смотрю, нейрошлак уже даже не проверяют перед высером, главное своих ссылочек и ключевиков напихать
Ни стыда ни совести ни ссылки на приобретение методички
Казна пустеет, милорд!
2026 год объявлен годом поборов во имя крылатых ракет.
А кто не согласен, тот иноагент.
Ждём в Death Stranding 3 😂
Что конкретно не так?
С примерами, аргументами.
Или очередной агрошкольник с авторским подходом к опсу кубера?
Ерунда полная. Так комментарии не пишут. Лишь бы что нибудь написать.
Улавливаешь?
Главный вопрос - зачем хранить столько данных рядом с сервисами, ради чего такой огород?
Окей, рады, но нету главного:
А плотят то скока?
Хорошо сидеть в business operation критичности, можно и текстовки пописать...
После всего этого хочется только одного - выйти из гонки ради гонки и дауншифтить в теплой стране.
С сениора спрашивают хардкодинг?
Рискуют примерами с ресурсов для джунов?
Задают задачи типа построй нам 100% пром энтерпрайз в одну будку за час?
Уже сразу в топку такие места.
Поработав и так и сяк и эдак, скажу - лучше всего смесь водопадов с доской.
В таком случае практически не плодятся ленивые бездари в команде пригоревших, задачи имеют поставленные сроки и ответственных. Работа и этапы выполнения задач гораздо меньше прокрастинируются.
Скрам и эти все спринты это хомячье колесо, из которого не вынимают хомячков, пока не сдохнут в угоду ттм и красивых отчётов о процессе ради процесса. ЧФ разваливает всю теорию этого подхода.
И да, паразитирующих даже больше, чем на знаменитой картинке с работником Васей в траншее.
Освойте ещё эту как бы профессию эджайл-евангелиста, ну чтобы точно быть полезным в команде.