Обновить

Паровозик

Одна из типичных проблем, возникающих в текущей работе с клиентом – «паровозик». Обычно возникает с новыми клиентами, которые ещё не воспитаны для продюсерского сопровождения, и лояльность низкая. Но тем не менее, про паровозик стоит рассказать – иногда он возникает и у вполне себе старых клиентов.

Паровозик – это когда клиент увязывает принятие и/или оплату одних работ с результатами других. Например, решали клиенту несколько не связанных друг с другом задач. Некоторые успешно решили, сдали, поместили в рабочую инфраструктуру, всё хорошо. А по части задач (обычно – по одной) результата нет, а проблемы – есть.

Как положено по закону Мерфи, эта одна задача – или срочная, или важная, или всё вместе. Зачастую оказывается на контроле у кого-то из руководства клиента (хотя обычно руководство не лезет в сопровождение 1С). И вот клиент увязывает выполненные задачи с невыполненной. Говорит – не буду подписывать и оплачивать те, решённые задачи, потому что нет результата по главной, ключевой, которая вот самая прям важная.

Формулировки могут быть самые разные. Например, «директор сказал ничего вам не оплачивать, пока не сделаете». Или «без этой задачи всё остальное не имеет значения, понимаете?». И т.д.

Что делать?

Начнём с конца. В последнюю очередь надо бросать решение задачи и кидаться доказывать клиенту, что он не прав. Это – последнее средство. Особенно с объявлением локдауна (остановки работ). Когда ничего другого не поможет – используем это последнее средство.

Теперь другой край спектра – концентрируемся на решении ключевой задачи. Привлекаем экспертов (которые, напомню, должны всегда иметь резерв времени для подобных привлечений). Готовимся к инвестициям – работу экспертов надо будет оплатить, но далеко не факт, что получится выставить её клиенту.

Главное – решить задачу. Вот на этом и стоит сконцентрироваться. Параллельно нужно обязательно заниматься пропагандой – освещением наших усилий, трудностей, экспертности привлечённой команды. Клиент должен знать, что его задачу решают – причём весь отдел, чуть ли не вся компания. Это крайне важно, чтобы у клиента не было аргументов «да вы вообще нами не занимались», «вы ничего не изменили в работе, невзирая на наши просьбы и срочность» и т.д.

Когда клиент видит усилия, напряжение, он может простить плохой результат. В большинстве случаев – простит. Очень хорошо будет не просто информировать клиента, а постоянно привлекать его каким-то образом. Давать что-то на проверку, задавать ему вопросы, просить что-то согласовать и т.д. Таким образом мы заменяем пассивное действие клиента (что-то прочитать или послушать) на активное (что-то сделать). В активном действии он, во-первых, точно обратит на нас больше внимания, а во-вторых – будет соучастником решения задачи.

Такая концентрация не даст паровозику разогнаться – в этом суть. Не допускать лавинообразных эффектов, эскалации и прочих непоправимых (в короткой перспективе) последствий.

Посередине спектра методов стоит предотвращение подобных ситуаций. Об этом читайте в разделе «Управление качеством».

Теги:
0
Комментарии2

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации