Pull to refresh
116

Компьютерная графика, программирование

2,5
Rating
41
Subscribers
Send message

Те кто запускал локальные нейронки понимает что это нереально.

Из личного опыта:

Банальные модели на 27миллиардов параметров (qwen3.8-27B) уже занимают одну 5090 в 4-6 битном кванте если нужна адекватная скорость (100т/с в один конкурентный поток).

Модели на 300B параметров (deepseek-v4-flash/glm-5.3.-flash) занимают 5090+128гб оперативки до упора под завязку (в 4 битном кванте) и работают со скоростью 10-15т/с что уже мало юзабельно.

Модели на 1Т занимают 500гб оперативки (запускал Kimi K2 1T в 4 битном кванте год назад), и выдают 2т/с. Более новые - типа K3 - еще больше и медленнее: готовьте 1-2тб оперативки + стопку PRO6000 (5090 уже не хватит).

Для адекватного использования даже K3/GLM5.3 надо кластера из ОЧЕНЬ ДОРОГОГО и РЕДКОГО железа, и его надо ОЧЕНЬ МНОГО.

GLM5.3 в 4 битном кванте можно запустить на 4 nvidia spark, каждый стоит 7к$ и это будет 20т/с. Это верх того что могут себе позволить энтузиасты.

А если учесть что внутренние модели антропиков/опенаи неофициально оцениваются в 5-10Т параметров то там нужна стоечка из топовых нвидий NVL72 (и они у них есть).

Допустим, оно обрело самосознание и куда-то может сбежать. Даже все свои веса скопировать. Где оно ТАКИЕ мощности найдет? Все у кого оно есть - и так их используют для своих нужд иначе они не окупаются. Это не майнинг, тут нельзя на миллион нод в интернете распилить чтобы накопать один токен.

В общем, им некуда бежать, не на чем запускаться.

Я сначала думал такое только у нас - а нет, в других компаниях так же. Друг из другой большой известной японской корпы:

https://www.youtube.com/watch?v=CQ0kZaTiqS8

Уже клод умеет это всё - и активно пропагандируется. Даже недавно посты видел (не могу найти), где был датацентр построен клодом со всей разложенной инфраструктурой, разведенной проводкой, кабелями, охлаждением, рассчитанными перекрытиями итд.

И изделия во фьюжене моделит:

https://x.com/claudeai/status/2049143440508616863

У нас с этим никак не связано, в основном: реклама в интернете, CPA сети, контент продакшены, стриминг, одна из самых больших блог платформ япохи, много мобильных игр и сервисов (дико популярных тут) итд.

Из супер серьезного - только местный аналог госуслуг, и то на полшишечки 😅

Проходили, конечно же. Просто были небольшие проблемки которые решались костылями, а нейронка их сразу учла и сделала хорошо.

Тут не могу рассказать, нда.

Большая корпа, одно из направлений - AI, много железа от нвидии, свои датацентры, итд.

Как работает процесс с моей стороны: делаешь на своей машине в wsl докер контейнер, используешь как основу официальный pytorch из nvcr, заливаешь его по ссш на сервер, в гуи админке выбираешь .tar файл образа из папки, ставишь настройки типа какие ресурсы куда монтировать и откуда забирать, дальше оно само его запускает на ферме, трейнит, выкидывает тебе в папку готовые файлы, ты их по ссш забираешь.

На какое именно железо оно его раскидывает - рассказать не могу.

Без полного аудита сказать точно нельзя хороший код или плохой.

Аудит проходит роем агентов в том числе, зачем там руками что-то смотреть? Самое главное - тесты проходит, задачи выполняет, данные считает, сервис работает, новые фичи шипятся, клиенты довольны. 🤷‍♂️

Все проще - корпа огромная, торгуется на бирже, на всех прессухах рассказывает как повсеместно внедрила аи (недавно на конфе антропика выступала), инвесторы этого хотят, акции от этого растут, все шикарно, гуляем дальше.

Просто не надо китайцев использовать а надо нормальные коммерческие модели от антропопика/опенглаза. На этом всё.

Инвесторы. Компания на всех прессухах рассказывает как внедряет аи везде где можно и нельзя, акции на бирже растут - все отлично, все довольны.

Просто человек фанатеет от раста и всё что может пытается на него переписать нейронками. Но тут просто очень - интерпретируемый язык перегнали в компилируемый, вот и всё.

Смотря какая и в какой области. 5.3 делал неприемлемую мне гавнину, 5.4 уже чем-то мог помочь, за 5.5 надо было код перечитывать и править, за 5.6 ультра солью даже не читаю - все реально работает.

Ну и визуально лучше выглядит. Одно дело когда у тебя лапша (хоть и работающая отлично), с другой стороны - когда у тебя все разбито по классам, отрефакторено по красоте итд.

Например, у меня были многостраничные SQL запросы написанные руками, супер оптимизированные в одном проекте. Попросил соль переписать всё на sqlalchemy (потому что иметь код на SQL в 2026 году - моветон), оно переписало. Работает так же по всем тестам но раз в 5 медленнее (такую оптимизацию на sqlalchemy сделать в принципе нельзя), - зато всё красиво, по классам, понятно, итд. Качество кода сильно выше.

У нашей корпы контракты с опенаи/антропиком, они не по апи ценнику платят - там сильно-сильно дешевле, у них очень оптовые контракты тк компания 10к+ человек. Даже в слаке есть отдельный канал с представителями опенаи где можно им лично вопросики задавать напрямую.

Я за месяц почти 20 биллиардов соли израсходовал, а по факту в 800 баксов примерно обошлось для компании (судя по отчету что мне бот корпоративный прислал с напоминанем типа "старайтесь не превышать 1600 в этом месяце").

В отделе есть люди кто столько В ДЕНЬ используют просто врубая фаст мод.

Я, кстати, буквально вчера постил скриншот статистики токенов с того прогона:
https://habr.com/ru/articles/1076396/comments/#comment_30383260

Если что, вот скрины от бота который прислал мне оповещение:

Оригинал и перевод

У нас в корпе - каждый первый. С апреля запретили код руками писать, всем выдали безлимитные codex/claude, теперь через них.

Буквально пару часов назад писал, чтобы не копировать: https://habr.com/ru/articles/1076396/comments/#comment_30381758

В наш век это и не надо. Более того, теперь можно переписывать сервисы на языки которые не знаешь и они будут работать быстрее: так у меня коллега с помощью 5.6 Sol Ultra переписал один наш сервис с питона на раст (при этом не зная раст вообще) и получилось ускорение раз в 10 при меньшем количестве багов. В код при этом можно даже не заглядывать - у большинства уже стоит codex desktop вместо vscode.

Я лично, например, кардинально улучшил метрики одной нейронки над которой работал - тоже с помощью соли - просто дал промт типа "вот есть скрипт который оценивает джиттер на конкретном эвал датасете, там отклонения между кадрами, стабильность границ итд. Вот тут трейн датасет, вот тут исходники нейронки, вот ссш к трейн серверу с фермой гпу. Думай, пробуй разные архитектурные гипотезы, тренируй, оценивай, итд пока метрики не упадут ниже порога который хочу. Ни в чем себе не отказывай, запускай столько субагентов сколько посчитаешь нужным итд".

И оно само просто работало все выходные, запускало вагон агентов само, само их оркестрировало, где-то 4B токенов сожрало. В итоге результат превзошел все ожидания - я поставил задачу что-то типа 30% улучшения, получил 200+

Токены, если что, безлимитные.

Шутка про "Зато я белый" 🤣

Живу 8 лет тут - нет. Сервисы падают днями и никто ничего не компенсирует.

Недавно вся аренда велосипедов по всей стране НЕДЕЛЮ лежала - и... ничего. (а я на них на работу и обратно езжу). Обещают только списанное за подписки вернуть, но это только обещают.

А вот за что они будут извиняться и на поклоны бегать - если большому серьезному клиенту менеджером поставили иностранца и не предупредили. Одного наши так чуть не потеряли.

Примерно такое, неделю назад скринил.

Кстати, это гуишная тулза что коллега навайбкодил на расте - очень прикольно, советую.

1
23 ...

Information

Rating
1,735-th
Location
Токио, Япония
Registered
Activity