Обновить

Развивать отношения с клиентом

Есть несколько архетипов общения сайтов со своими пользователями.

Наставник. Уважительное экспертное общение с уклоном в менторство и обучение.

Друг. Всегда на ты, переход на личности, подарки, близость.

Мама. Много часто ненужного обучения, окна, подсказки, любовь и забота, что бы юзер ни делал.

Партнёр. Просто профессионально делают свою работу без лишних слов.

Базарная бабка. Навязчивая реклама, всегда лучше тебя знают, что тебе нужно.

Ну и ещё есть. Они по-разному называются, но суть примерно одинаковая. Ещё это всё можно назвать Tone of Voice (голос продукта).

К чему это я? Многие сайты, один раз выбрав стиль общения, уже не отходят от него, как бы долго юзер ни пользовался сервисом. И получается эффект примерно как в жизни. Когда мы маленькие дети — нам нравится, что мама о нас заботится. Чем взрослее, тем всё больше эта забота нам кажется навязчивой и даже бесит.

Мне кажется, что часть раздражения пользователя от сервиса кроется именно в «застое отношений» между ними. Юзер уже «вырос», изучил сервис, ему уже не нужны подсказки на каждом шагу и «тупая» реклама. Может сервису уже стоит превратиться из «мамы» или «ментора» в друга или партнёра? А где-то может наоборот — из «наставника» в «маму».

Конечно всё зависит от сервиса и от пользователей. Чтобы нивелировать подобное раздражение, сервисы используют немного разные стили общения в разных сценариях.

Да, единый и неизменный стиль общения это и есть часть бренда, его узнаваемость и всё такое. Не всем сервисам нужны подобные смены «голоса». Но можно и смену «голоса» сделать фишкой, стилистически «взрослеть» вместе с пользовательским опытом на основании метрик, опросов и настроек.

Теги:
Рейтинг0
Комментарии0

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации