Так, как я понимаю, перекупы именно делают полный mitm и дают свой эндпоинт - они же оформляют на себя подписки (на дропов причем), а тебе просто ключик от своего сервиса дают, не от опенаи. Заодно запросы логируют для перепродажи. Опенаи же в россии не работает, и, вроде как, по паспорту банит.
Сам я через них не работал - в россии давно не живу. Но так сделать было бы единственно логично, скорее всего так именно и сделано.
Те кто запускал локальные нейронки понимает что это нереально.
Из личного опыта:
Банальные модели на 27миллиардов параметров (qwen3.8-27B) уже занимают одну 5090 в 4-6 битном кванте если нужна адекватная скорость (100т/с в один конкурентный поток).
Модели на 300B параметров (deepseek-v4-flash/glm-5.3.-flash) занимают 5090+128гб оперативки до упора под завязку (в 4 битном кванте) и работают со скоростью 10-15т/с что уже мало юзабельно.
Модели на 1Т занимают 500гб оперативки (запускал Kimi K2 1T в 4 битном кванте год назад), и выдают 2т/с. Более новые - типа K3 - еще больше и медленнее: готовьте 1-2тб оперативки + стопку PRO6000 (5090 уже не хватит).
Для адекватного использования даже K3/GLM5.3 надо кластера из ОЧЕНЬ ДОРОГОГО и РЕДКОГО железа, и его надо ОЧЕНЬ МНОГО.
GLM5.3 в 4 битном кванте можно запустить на 4 nvidia spark, каждый стоит 7к$ и это будет 20т/с. Это верх того что могут себе позволить энтузиасты.
А если учесть что внутренние модели антропиков/опенаи неофициально оцениваются в 5-10Т параметров то там нужна стоечка из топовых нвидий NVL72 (и они у них есть).
Допустим, оно обрело самосознание и куда-то может сбежать. Даже все свои веса скопировать. Где оно ТАКИЕ мощности найдет? Все у кого оно есть - и так их используют для своих нужд иначе они не окупаются. Это не майнинг, тут нельзя на миллион нод в интернете распилить чтобы накопать один токен.
Уже клод умеет это всё - и активно пропагандируется. Даже недавно посты видел (не могу найти), где был датацентр построен клодом со всей разложенной инфраструктурой, разведенной проводкой, кабелями, охлаждением, рассчитанными перекрытиями итд.
У нас с этим никак не связано, в основном: реклама в интернете, CPA сети, контент продакшены, стриминг, одна из самых больших блог платформ япохи, много мобильных игр и сервисов (дико популярных тут) итд.
Из супер серьезного - только местный аналог госуслуг, и то на полшишечки 😅
Большая корпа, одно из направлений - AI, много железа от нвидии, свои датацентры, итд.
Как работает процесс с моей стороны: делаешь на своей машине в wsl докер контейнер, используешь как основу официальный pytorch из nvcr, заливаешь его по ссш на сервер, в гуи админке выбираешь .tar файл образа из папки, ставишь настройки типа какие ресурсы куда монтировать и откуда забирать, дальше оно само его запускает на ферме, трейнит, выкидывает тебе в папку готовые файлы, ты их по ссш забираешь.
На какое именно железо оно его раскидывает - рассказать не могу.
Без полного аудита сказать точно нельзя хороший код или плохой.
Аудит проходит роем агентов в том числе, зачем там руками что-то смотреть? Самое главное - тесты проходит, задачи выполняет, данные считает, сервис работает, новые фичи шипятся, клиенты довольны. 🤷♂️
Все проще - корпа огромная, торгуется на бирже, на всех прессухах рассказывает как повсеместно внедрила аи (недавно на конфе антропика выступала), инвесторы этого хотят, акции от этого растут, все шикарно, гуляем дальше.
Просто человек фанатеет от раста и всё что может пытается на него переписать нейронками. Но тут просто очень - интерпретируемый язык перегнали в компилируемый, вот и всё.
Смотря какая и в какой области. 5.3 делал неприемлемую мне гавнину, 5.4 уже чем-то мог помочь, за 5.5 надо было код перечитывать и править, за 5.6 ультра солью даже не читаю - все реально работает.
Ну и визуально лучше выглядит. Одно дело когда у тебя лапша (хоть и работающая отлично), с другой стороны - когда у тебя все разбито по классам, отрефакторено по красоте итд.
Например, у меня были многостраничные SQL запросы написанные руками, супер оптимизированные в одном проекте. Попросил соль переписать всё на sqlalchemy (потому что иметь код на SQL в 2026 году - моветон), оно переписало. Работает так же по всем тестам но раз в 5 медленнее (такую оптимизацию на sqlalchemy сделать в принципе нельзя), - зато всё красиво, по классам, понятно, итд. Качество кода сильно выше.
Только вот в винде все из коробки работает, а в линупсе - стоимость владения сильно выше, скажем так.
Зачем брать макбук чтобы ставить на него линупс? Можно же просто взять и использовать систему где всё и так работает.
Ай вонт бест кволити, мейк но мистейкс
Так, как я понимаю, перекупы именно делают полный mitm и дают свой эндпоинт - они же оформляют на себя подписки (на дропов причем), а тебе просто ключик от своего сервиса дают, не от опенаи. Заодно запросы логируют для перепродажи. Опенаи же в россии не работает, и, вроде как, по паспорту банит.
Сам я через них не работал - в россии давно не живу. Но так сделать было бы единственно логично, скорее всего так именно и сделано.
А не использовал ли он чг из россии через прокси-перекупов? Если да, то там что угодно могут по пути подменить.
В общем, бесполезное.
Сделали свой аналог litellm, но лайт умеет роутить тупо всё: и облачных провайдеров, и ламуцпп, и vllm, и олламу, и что хочешь.
У этой же пепяки поддерживается только ollama и lm studio как ноды.
Еще у многих блоггеров кого смотрю ими закуплена нативная реклама. Ощущение что у каждого третьего, маркетинговые бюджеты точно не жалеют.
Те кто запускал локальные нейронки понимает что это нереально.
Из личного опыта:
Банальные модели на 27миллиардов параметров (qwen3.8-27B) уже занимают одну 5090 в 4-6 битном кванте если нужна адекватная скорость (100т/с в один конкурентный поток).
Модели на 300B параметров (deepseek-v4-flash/glm-5.3.-flash) занимают 5090+128гб оперативки до упора под завязку (в 4 битном кванте) и работают со скоростью 10-15т/с что уже мало юзабельно.
Модели на 1Т занимают 500гб оперативки (запускал Kimi K2 1T в 4 битном кванте год назад), и выдают 2т/с. Более новые - типа K3 - еще больше и медленнее: готовьте 1-2тб оперативки + стопку PRO6000 (5090 уже не хватит).
Для адекватного использования даже K3/GLM5.3 надо кластера из ОЧЕНЬ ДОРОГОГО и РЕДКОГО железа, и его надо ОЧЕНЬ МНОГО.
GLM5.3 в 4 битном кванте можно запустить на 4 nvidia spark, каждый стоит 7к$ и это будет 20т/с. Это верх того что могут себе позволить энтузиасты.
А если учесть что внутренние модели антропиков/опенаи неофициально оцениваются в 5-10Т параметров то там нужна стоечка из топовых нвидий NVL72 (и они у них есть).
Допустим, оно обрело самосознание и куда-то может сбежать. Даже все свои веса скопировать. Где оно ТАКИЕ мощности найдет? Все у кого оно есть - и так их используют для своих нужд иначе они не окупаются. Это не майнинг, тут нельзя на миллион нод в интернете распилить чтобы накопать один токен.
В общем, им некуда бежать, не на чем запускаться.
Я сначала думал такое только у нас - а нет, в других компаниях так же. Друг из другой большой известной японской корпы:
https://www.youtube.com/watch?v=CQ0kZaTiqS8
Уже клод умеет это всё - и активно пропагандируется. Даже недавно посты видел (не могу найти), где был датацентр построен клодом со всей разложенной инфраструктурой, разведенной проводкой, кабелями, охлаждением, рассчитанными перекрытиями итд.
И изделия во фьюжене моделит:
https://x.com/claudeai/status/2049143440508616863
У нас с этим никак не связано, в основном: реклама в интернете, CPA сети, контент продакшены, стриминг, одна из самых больших блог платформ япохи, много мобильных игр и сервисов (дико популярных тут) итд.
Из супер серьезного - только местный аналог госуслуг, и то на полшишечки 😅
Проходили, конечно же. Просто были небольшие проблемки которые решались костылями, а нейронка их сразу учла и сделала хорошо.
Тут не могу рассказать, нда.
Большая корпа, одно из направлений - AI, много железа от нвидии, свои датацентры, итд.
Как работает процесс с моей стороны: делаешь на своей машине в wsl докер контейнер, используешь как основу официальный pytorch из nvcr, заливаешь его по ссш на сервер, в гуи админке выбираешь .tar файл образа из папки, ставишь настройки типа какие ресурсы куда монтировать и откуда забирать, дальше оно само его запускает на ферме, трейнит, выкидывает тебе в папку готовые файлы, ты их по ссш забираешь.
На какое именно железо оно его раскидывает - рассказать не могу.
Аудит проходит роем агентов в том числе, зачем там руками что-то смотреть? Самое главное - тесты проходит, задачи выполняет, данные считает, сервис работает, новые фичи шипятся, клиенты довольны. 🤷♂️
Все проще - корпа огромная, торгуется на бирже, на всех прессухах рассказывает как повсеместно внедрила аи (недавно на конфе антропика выступала), инвесторы этого хотят, акции от этого растут, все шикарно, гуляем дальше.
Есть тесты которые проходятся или нет.
Просто не надо китайцев использовать а надо нормальные коммерческие модели от антропопика/опенглаза. На этом всё.
Инвесторы. Компания на всех прессухах рассказывает как внедряет аи везде где можно и нельзя, акции на бирже растут - все отлично, все довольны.
Просто человек фанатеет от раста и всё что может пытается на него переписать нейронками. Но тут просто очень - интерпретируемый язык перегнали в компилируемый, вот и всё.
Смотря какая и в какой области. 5.3 делал неприемлемую мне гавнину, 5.4 уже чем-то мог помочь, за 5.5 надо было код перечитывать и править, за 5.6 ультра солью даже не читаю - все реально работает.
Ну и визуально лучше выглядит. Одно дело когда у тебя лапша (хоть и работающая отлично), с другой стороны - когда у тебя все разбито по классам, отрефакторено по красоте итд.
Например, у меня были многостраничные SQL запросы написанные руками, супер оптимизированные в одном проекте. Попросил соль переписать всё на sqlalchemy (потому что иметь код на SQL в 2026 году - моветон), оно переписало. Работает так же по всем тестам но раз в 5 медленнее (такую оптимизацию на sqlalchemy сделать в принципе нельзя), - зато всё красиво, по классам, понятно, итд. Качество кода сильно выше.