Обновить

Часть 2. (начало здесь)

Какой заказчик согласится на такие прелести при сотрудничестве с физлицом по договору ГПХ? Поэтому, никто блогерам, как физическим лицам без статуса СЗ, официально по договорам не платил, а все шло по серой схеме на карту либо нал. Чтобы вывести эти потоки из тени государство и ввело статус Самозанятый, чтобы мягкой силой принудить работать по законным схемам. Действительно, заказчикам работать с СЗ гораздо проще и не требует выплаты за них налогов, страховых взносов и отчетности в ФНС.

Также надо иметь ввиду физлицам, что если физическое лицо не зарегистрировано в качестве ИП, при этом на регулярной основе получает доходы от предпринимательской деятельности, то этот факт делает физическое лицо плательщиком НДС (даже при отсутствии регистрации в качестве ИП). А НДС это жесть как в плане уплаты так и в плане отчетности.

В итоге сотрудничество заказчиков с СЗ возможно по договору ГПХ, но без встраивания в рекламную цепочку в качестве посредника, а для выполнения конечных услуг. Например, выполнить отчетность в ОРД вместо участника рекламной цепочки, изготовление креатива, консультации по маркировке рекламы, размещение на своих интернет-страницах рекламных материалов от заказчиков и прочие работы по договору оказание услуг, которые не могут быть квалифицированы как посреднические со стороны ФНС.

Так что налоговый статус вашего партнера надо всегда проверять, иначе последствия могут быть достаточно неприятными, в том числе в финансовом плане.

Теги:
Рейтинг0
Комментарии0

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации