Обновить

Про арендованные протезы и ИИ-аугментации

 Обложка и кадры из выпуска #5
Обложка и кадры из выпуска #5

Я постоянно использую ИИ в своих разработках: обсуждаю архитектуру, ищу ошибки, проверяю идеи, пишу сценарии и ускоряю производство видео.

И недавно поймал себя на одной мысли.

Кажется, мы немного перепутали аугментацию с протезом. Причём с протезом, которым даже не владеем.

Сразу уточню: это не попытка дать медицинское или инженерное определение. Скорее рабочая метафора, через которую мне стало проще описывать собственные отношения с ИИ.

В этой метафоре протез возвращает человеку утраченную возможность. Аугментация же даёт возможность, которой раньше вообще не было.

Одно помогает сохранить прежнего себя. Другое — неизбежно тебя изменяет.

Но у любого расширения есть обратная сторона.

С новым инструментом ты можешь больше. Однако без него постепенно начинаешь хуже ощущать собственные границы.

Смартфоны уже сделали нас аугментированными. Мы вынесли наружу часть памяти, навигацию, коммуникацию, доступ к информации и множество бытовых решений.

ИИ-агенты расширят нас ещё сильнее. Они смогут не только хранить и показывать информацию, но и анализировать её, выбирать варианты и совершать действия от нашего имени.

И здесь возникает важный вопрос: сохраняем ли мы при этом способность самостоятельно думать, выбирать и отказываться от предложенного?

Пока инструмент расширяет тебя — это аугментация.
Когда без него ты уже не можешь оставаться собой — он становится протезом.

Я использую ИИ почти каждый день, но стараюсь держать рядом один вопрос:
смогу ли я продолжать творить, если завтра этого инструмента не станет?

Не обязательно с той же скоростью. Не обязательно с тем же объёмом. Но смогу ли я сам придумать мысль, сформулировать её и довести до результата?

Этот вопрос важен ещё и потому, что своими цифровыми аугментациями мы, как правило, не владеем.

Мы арендуем доступ к моделям, облачным сервисам и вычислительным мощностям. А настоящие владельцы в любой момент могут изменить цену, лимиты, правила или просто отключить нужную функцию.

Сегодня инструмент почти бесплатен и встроен в привычный рабочий процесс. Завтра его цена может вырасти в десять раз, нужная модель исчезнет, API изменится или сервис решит, что определённые действия больше недоступны.

И тогда выяснится, какую именно часть собственной работы мы успели вынести наружу.

Поэтому, возможно, главный вопрос заключается не в том, насколько мощным стал наш инструмент.

А в том, кто теперь является основой системы: человек, использующий машину, или машина, которой человек предоставляет свои руки, голос и намерения.

Так мы действительно расширили себя — или просто арендовали себе протез?

Эту же мысль я собрал в короткий анимационный выпуск.
Видеоверсия длится около минуты и доступна по ссылке.

P.S. Прошлый выпуск и история создания моего аватара

Теги:
Всего голосов 6: ↑4 и ↓2+4
Комментарии5

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации