Обновить
70

Пользователь

0,8
Рейтинг
43
Подписчики
Отправить сообщение

озобновятся проекты поднятия джунов/стажеров

каким вы видите этот процесс? кто будет это финансировать?

до ИИ стажеров нанимали компании, потому что их труд имел смысл, но после появления ИИ (не сейчас так скоро) этот труд будет обесценен.

что бы появились джуны и они развивались, нужно что бы компании начали за это платить, даже если им это не выгодно... не представляю что бы это произошло сейчас с крупными компаниями (да и с мелкими), без к примеру регуляторного пинка (а его сделать некому по иным причинам).

А 'зачем' сво заканчивать? Хотели бы, давно бы закончили. То что это длится как больной зуб вне логики говорит что это очень нужно тем кто принимает решение от этом. Будет ещё один вечный конфликт, до полного разрушения страны.. да в принципе уже.

Война стран это война экономик, это здоровье граждан, это банальное повышение рождаемости... Ничего это не наблюдается, как подавали гомеопатию на госуровне, так и продают, как прокладывают асфальт из говна ровно на год, так и продолжают закапывают в землю сотни миллиардов денег...

из России, покатайтесь по стране, встречаются такие места, где даже в центре города можно уже не поймать даже gprs (буквально, такси не вызвать звонком, какое уж приложение, и речь не о блокировках, до них дело было).

а Москва, конечно, пока паразитирует на всей остальной России, отбирая все доступные ресурсы (прямо или косвенно), пока еще будет пировать и радоваться.

Как только вы попытаетесь заняться чем то по больше, чем развлечения, вы сразу столкнетесь с ограничениями, пока еще их можно преодолеть, но так как лягушку варят медленно, процесс будет растянут на годы.

как же мы жили до XXI века

жили гораздо хуже чем сейчас, к примеру средний человек из развитого государства живет значительно комфортнее и интереснее чем даже знать и короли прошлого (с оговорками по власти над другими людьми)

Интернет нужен людям не только для развлечений, они скорее способ его монетизации,.. он нужен для общения, сбора и предоставления информации и знаний, в общем смысле этого слова. Как ломает развитие социализации в мире глобального интернета, когда все общение на себя берут централизованные компании (а в России к примеру идет явный запрет и активное противодействие любым иным способам общения, пресловутый больше 3 не собираться, только сейчас это примерно 3000 человек)

Текущая тенденция уничтожения глобализации откатывает страны в развитии лет на 20-30, это видно в России уже сейчас, не так явно (потому что с некоторыми телодвижениями и затратами, доступ в мировой интернет все еще пока есть, т.е. ограничен доступ к массам, и с каждым днем все сильнее и сильнее). Как вам медицина? понравилось пользоваться услугами топовых стран... попользовались и хватит, возвращайтесь к подорожнику и гомеопатиию

Доступ к технологиям, нужным для существования компаний в современной их форме например возможен только при наличии софта и поддержки, нет софта (а его в России уже почти нет) - откат на десятилетия, отставание, причем фатальное,.. догнать не будет никакой возможности. Нет доступа к современному железу - тормозит развитие ИИ, это вообще краеугольный камень дальнейшего развития страны в целом.

А так да, жрать, спать и размножаться не перестанете.

И ведь проблему создают не соцсети, и внедряемые ими рекомендательные алгоритмы, но нет, регулировать будут общение... до асоциализации населения, интересно к каким формам психоза это в конце концов приведет, особенно когда живых собеседников будут заменять массово на идентичных натуральному

В какой момент это оружие направят на конкурентов, хотя бы на те же ИИ компании, того же Китая, прекрасно помню годы назад меморандум, в котором призвали стрелять ракетами по датацентрам, обучающим нейоонки не такие 'как следует'

в этой аналогии - llm это 'язык программирования' (хотя правильно компилятор), а вот промпт - это именно программа.

Если совсем душнить, то программой является пайплайн, в частном случае это набор агентов и промпты к ним.

фактически - промпт, новые программы

контекст в другие

нет, kv-cache должен размещаться рядом с весами (требования по объему пропорционально занятому весами пространству, с оговорками на роутер moe архитектуры и др.)

квантизация у вас скорее всего разная, сравнивать нужно в одинаковых условиях

Да, llama.cpp умеет распределять нагрузку между gpu и даже умеет между нодами кластера. Умеет разные вендоров gpu amd/nvidia/intel и т.п.

в корне неверное понимание моего комментария.

никакого sli нет и не нужно и не нужен интерконнект для инференса, для маленьких моделей более чем достаточно передачи данных между gpu через pcie->cpu->pcie

у меня две независимые рекомендации:
* вместо ОДНОЙ 5090 32gb покупаете 2 а лучше 4 дешевых 5060ti 16gb (они стоят порядка 50-60т.р. за штуку) и серверную материнку (с 2-4 pci-e 16x). Кстати для 2-ух gpu можно найти материнку не серверную (pcie будут работать в 8x режиме, для слабых моделей это не критично, у меня вообще в 4x работают) что еще сильнее удешевит конфиг.

p.s. настоятельно рекомендую собрать 64gb vram конфиг из 4x 16gb gpu

* если все же решите купить одну 5090, то добавьте любую современную nvidia gpu хоть на 8gb, на которой отдельно перенесете веса vision (mmproj файл) и в идеале модель (порядка 1-2gb) для спекулятивного декодирования (повышает скорость генерации в 2-4 раза в зависимости от везения), и не важно если вы ее посадите на x4 pcie.

upd. одна gpu 32b хороша для генерации видео и изображений, так как софт, распределяющий на несколько gpu сложнее в настройке или отсутствует

32gb vram это совсем совсем впритык, что бы запускать 'топовые маленькие' модели qwen3.6..3.8 27b/35b-a3b, только 4битная квантизация и 8бит квантизация кеша (можно без него но тогда контекст будет не полный) а так же vision способности с оговоркой, может придется переносить на cpu.

рассмотрите варианты добавить в сетап хотя бы еще одну gpu на 8gb (на ней будете запускать vision модуль и спекулятивное декодирование для ускорения генерации)

у меня совет, за эти деньги приобретите серверную материнку (в китае например HUANANZHI для amd epyc 7002/7003) и 4-ре 4060ti 16gb (или 5060ti 16gb), они тормознее примерно в два раза чем 5090, холоднее и на порядок дешевле (потому что тормозные, в современных играх с трудом 40 кадров даже на средних, и ни о каких 4k даже не думать).

запускать модели полностью или даже частично на ram - это путь в никуда, агенты будут работать невероятно медленно (часами там где могли бы минуты), поэтому постарайтесь даже не рассматривать этот вариант.

если модель будет помещаться в gpu полностью, то ram практически не требуется, т.е. ее может быть меньше чем суммарно vram (но 32gb все же рекомендуется оставить)

поделитесь пожалуйста хорошим отрывком (пару глав) именно фантастики и оригиналом, для сравнения.

он имеет смысл только из-за компактности и энергопотребления (при очень медленной генерации), за те же деньги можно собрать x86 машину с gpu, будет работать быстрее (особенно moe модели)

оптика для локального (микроны) прогрева быстрого, а нам бы хотя быв глубину.

вроде бы для этого подходит длина волны по длиннее, условная микроволновка по мощнее.

с кпд процесса в 0.5%?

в статье акцент на то что метод очень эффективный по энергии (и похоже эффективнее простого миксера)

слабые открытые модели сильно деградируют с превышением контекста где то в районе 100к (qwen3.6 как я вижу уже после 64к.. это плавный процесс, для уточнения предела этого потребуются сложные бенчмарки), так какой смысл вкладывать ресурсы (экспоненциальные от размера контекста) в это.

У алибаба проблемы (команду которая занималась открытой частью разогнали), они не смогли монетизировать свои решения, и скорее всего в ближайшее время мы не увидим их крутые решения, если не совсем.

Обидно, больше полугода назад их компания создала открытое решение, которое до сих пор другие открытые решения обогнать не могут.

1
23 ...

Информация

В рейтинге
2 211-й
Зарегистрирован
Активность