А также оценит статью как полезную или бесполезную, и если информация, описанная в статье уже была на хабре или википедии, то заменит соответствующие абзацы на ссылки… /s
хмм… не проще ли тогда сразу у ИИ спрашивать ответы на интересующие темы? Oh Shi!
Можно пойти еще дальше, не покупать 2x rtx3090 по 1200$ текущей цены, а купить 4x rtx3080 20Gb по 600$ из Китая, получив почти вдвое больше vram (80вместо 48). Конечно придётся еще потратиться на мать и БП, но подходящие DDR4 матери с 4мя PCIe x4 не так уж и дороги - после майнеров их куча на рынке.
Вечер риторических вопросов? Вся ЮВА южнее, Индия, Африка - во этих странах мопедов, мотоциклов, велосипедов на улице в разы больше, чем машин.
Я конечно ошибся использовав общий квантификатор “любую южную страну”. В Турции и Греции мотоциклов на улице в разы больше чем в РФ, но не в разы более, чем авто.
Так что полная ерунда это ваше докапывание до мелочей, по сути есть что возразить?
Всё равно не надо шарахаться. Едьте ровно и вас объедут, а не объедут так притормозят. Никто специально не хочет вам зеркало разбить и бочину поцарапать. Мотовладельцы точно также любят себя и свою технику как и вы, и не хотят её царапать.
Не шиза а дело привычки. В Швейцарии например за малейшее превышение штрафуют, а за большое и машину конфискуют и в тюрьму садят. Люди едут -2 -3 км/ч от разрешённого, все привыкли и всем нормально. В списке смертности от ДТП в нижней десятке всех стран.
Я спорил с предложением запретить мотоциклы, под предлогом что их мало. Этот предлог только в Сибири и Канаде работает наверное, отсюда и ссылка на южные страны.
Если вы пересадите мопедистов Стамбула или Рима на автомобили, никто даже со двора выехать не сможет.
В Llama.cpp один параметр может обрушить или поднять скорость генерации в разы. А параметров десятки. Нужно понимать, что ты делаешь и как части системы, движка и модели между собой взаимодействуют.
может ускорить генерацию в 2-2.5 раза. Если vram для MTP головы не хватит, выгрузите визуальный блок на CPU, там он чуть медленнее, но вы же не грузите картинки в каждом сообщении обычно.
Если KV кеш от предыдущих запросов сохраняется, то при новом сообщении в тот же чат пересчитываться будет только это сообщение и новые файлы, которые агент читает.
Кеш сбрасывается, когда в VRAM не хватает места для новых KV. Например, если параллельно приходит второй запрос (другой чат или агент с уже раздутым контекстом). Чтобы избежать сброса кеша, на машинах с малым VRAM нужно работать в один поток, без суб-агентов.
У vLLM можно включить выгрузку KV-кеша в ОЗУ при нехватке VRAM. Это позволяет пользоваться несколькими агентами паралельно без пересчитывания кеша, даже если в vram влезает всего один просчитанный KV cache полного контекста (типично для 16-32 гб vram и 27b моделей). Подтянуть кеш из ОЗУ в десятки раз быстрее, чем пересчитывать его заново.
Ну вот получат миллион, пусть купят Веру Рубин с сотней терабайтов VRAM и запускают локальные модели размером поболее. А там и на второй теорем нарешают.
Это вы живёте в стране, где машин очень много, а людей мало (в пересчёте на площадь). Хоть раз в жизни выберитесь в любую южную страну - двухколёсный транспорт там в разы превышает по количеству автомобили, и не зря.
Лихо вы Китай, всю ЮВА включая Индонезию, и всю Южную Америку в категорию развивающиеся страны засунули? Да даже в той же Италии и Турции - в любых жарких странах смотаться за хлебушком, на работу и тп удобнее на мопеде или мотоцикле, чем выводить гудящий и жрущий бензин агрегат, рассчитанный на 5 человек, на улицы, где 60-90% населения ездит на более подходящем для мелких поездок средстве передвижения.
А также оценит статью как полезную или бесполезную, и если информация, описанная в статье уже была на хабре или википедии, то заменит соответствующие абзацы на ссылки… /s
хмм… не проще ли тогда сразу у ИИ спрашивать ответы на интересующие темы? Oh Shi!
Можно пойти еще дальше, не покупать 2x rtx3090 по 1200$ текущей цены, а купить 4x rtx3080 20Gb по 600$ из Китая, получив почти вдвое больше vram (80вместо 48). Конечно придётся еще потратиться на мать и БП, но подходящие DDR4 матери с 4мя PCIe x4 не так уж и дороги - после майнеров их куча на рынке.
Вечер риторических вопросов? Вся ЮВА южнее, Индия, Африка - во этих странах мопедов, мотоциклов, велосипедов на улице в разы больше, чем машин.
Я конечно ошибся использовав общий квантификатор “любую южную страну”. В Турции и Греции мотоциклов на улице в разы больше чем в РФ, но не в разы более, чем авто.
Так что полная ерунда это ваше докапывание до мелочей, по сути есть что возразить?
Всё равно не надо шарахаться. Едьте ровно и вас объедут, а не объедут так притормозят. Никто специально не хочет вам зеркало разбить и бочину поцарапать. Мотовладельцы точно также любят себя и свою технику как и вы, и не хотят её царапать.
Не шиза а дело привычки. В Швейцарии например за малейшее превышение штрафуют, а за большое и машину конфискуют и в тюрьму садят. Люди едут -2 -3 км/ч от разрешённого, все привыкли и всем нормально. В списке смертности от ДТП в нижней десятке всех стран.
Процентные докуски это очень разумно, в отличие от тупого правила +20 для любой скорости.
Я спорил с предложением запретить мотоциклы, под предлогом что их мало. Этот предлог только в Сибири и Канаде работает наверное, отсюда и ссылка на южные страны.
Если вы пересадите мопедистов Стамбула или Рима на автомобили, никто даже со двора выехать не сможет.
Это неудачный (плохо настроенный) пример.
У других людей получается 15-20t/s на RTX 5060 Ti 16GB и чуть быстрее на RTX 4090 24GB и 32GB DDR5.
В Llama.cpp один параметр может обрушить или поднять скорость генерации в разы. А параметров десятки. Нужно понимать, что ты делаешь и как части системы, движка и модели между собой взаимодействуют.
Включите спекулятивное декодирование
–spec-type draft-mtp –spec-draft-n-max 4
может ускорить генерацию в 2-2.5 раза. Если vram для MTP головы не хватит, выгрузите визуальный блок на CPU, там он чуть медленнее, но вы же не грузите картинки в каждом сообщении обычно.
Если KV кеш от предыдущих запросов сохраняется, то при новом сообщении в тот же чат пересчитываться будет только это сообщение и новые файлы, которые агент читает.
Кеш сбрасывается, когда в VRAM не хватает места для новых KV. Например, если параллельно приходит второй запрос (другой чат или агент с уже раздутым контекстом). Чтобы избежать сброса кеша, на машинах с малым VRAM нужно работать в один поток, без суб-агентов.
У vLLM можно включить выгрузку KV-кеша в ОЗУ при нехватке VRAM. Это позволяет пользоваться несколькими агентами паралельно без пересчитывания кеша, даже если в vram влезает всего один просчитанный KV cache полного контекста (типично для 16-32 гб vram и 27b моделей). Подтянуть кеш из ОЗУ в десятки раз быстрее, чем пересчитывать его заново.
Инструкции для vLLM тут: https://vllm.ai/blog/2026-01-08-kv-offloading-connector https://github.com/vllm-project/vllm/blob/main/docs/features/kv_offloading_usage.md
В LLama и SGLang такой фишки к сожалению нет.
Ну вот получат миллион, пусть купят Веру Рубин с сотней терабайтов VRAM и запускают локальные модели размером поболее. А там и на второй теорем нарешают.
Это вы из той страны пишите, где избивают врачей, пытающихся помочь алкоголикам и наркоманам? Ну да и антипрививочников десятки процентов?
В сибири может 99% авто, а в любых тёплых странах мототехники больше чем авто.
Это вы живёте в стране, где машин очень много, а людей мало (в пересчёте на площадь). Хоть раз в жизни выберитесь в любую южную страну - двухколёсный транспорт там в разы превышает по количеству автомобили, и не зря.
Лихо вы Китай, всю ЮВА включая Индонезию, и всю Южную Америку в категорию развивающиеся страны засунули? Да даже в той же Италии и Турции - в любых жарких странах смотаться за хлебушком, на работу и тп удобнее на мопеде или мотоцикле, чем выводить гудящий и жрущий бензин агрегат, рассчитанный на 5 человек, на улицы, где 60-90% населения ездит на более подходящем для мелких поездок средстве передвижения.
А мне понравилось, как он мысли формулирует - читается как компьютерная программа!
Да, очень элегантно.
То есть модель того же веса прибавляет +20 условных попугаев за счёт циклического пробегания по тем же слоям, тратя вычисления и время?
Мне всё же непонятно откуда прирост, ведь слой уже повлиял на вектор при первом пробеге. Пойду почитаю про рекуррентные сети.
Макс предустановленный уже…
Сейчас уже наверное можно эти сцены в каком-нибудь видео-генераторе поставить.