Но на практике реальную разницу между Q4/Q6/Q8 я засекал в 2025 году на старых моделях. На новых (с апреля 2026, когда две Qwen 3.6 вышли) я её в своих практических задачах (разных — и работа с доками, и кодинг, и vision‑задачи, и вёрстка и прочее) не увидел. Не могу сказать что я прям целенаправленно тестил во всех возможных сценариях, но и сказать, что использование было однообразным, тоже нельзя. Как и нельзя сказать что все задачи были простые.
Qwen 36 27b в Q6K_M, Q5K_XL, Q4K_XL, Q8 — одинаково сыпались и частенько зацикливались на контексте 65–128к. Только 5-6-8 бит при этом работали медленнее, особенно Q8, где много слоёв в RAM надо было оффлоадить чтобы под KV кеш освободить место.
Есть мысль, что «на малых моделях Q4=мусор» сейчас уже не так жёстко, как раньше.
Да и модели хочется побольше запускать, да в кванте "поумнее".
Сильной разницы сейчас не ждите ИМХО. Они (локальные ЛЛМ) сейчас переползают из состояния игрушек и автоматизации рутины в состояние «можно делать что‑то серьёзное». Плато по локальным ЛЛМ ещё не достигнуто, поэтому вполне вероятно, что то, что сейчас имеет 100 млрд параметров, будет через год иметь 30 млрд. Хотя рост способностей постепенно замедляется. А ещё движки инференса оптимизируют — производительности мало всем, поэтому она постепенно растёт у всех просто за счёт оптимизации кода + производители сеток придумывают всякие MTP и n‑gram кеши.
А какой квант? MTP завёлся? По идее скорость поднимется как движки инференса подтянутся. И есть еще момент с квантом: некоторые кванты криво распаковываются на GPU из‑за кривого движка и могут тормозить не смотря на то что вроде мелкие. KV‑кеш можно квантовать — он когда занимает меньше быстрее пролазит через шины в видеокарте, может получиться буст. И ещё — пробовали настраивать руками точно количество экспертов, выгружаемых в VRAM? Или у Вас там она вся помещается?
Не совсем так радикально. Так Вам будет тяжко собирать железяки под большое число параметров.
1. Очень важно MoE сетка или плотная. Если плотная — тогда да, крайне желательно чтобы всё влезло в VRAM. Но если она MoE (а жирные сетки в основном все MoE) то главное чтобы в VRAM поместились активные параметры и KV‑кеш. Все остальные эксперты — могут жить в ОЗУ. Это неприятно, это надо грамотно настраивать (подбирать сколько экспертов держать в VRAM и прочее) и скорость будет не сильно большой (10–30 т/с если грамотно настроить), но это проще, чем строить кластер из видеокарт. Разумеется, ширина шины PCIe, каналы памяти, скорость, и способность материнки и проца всё это переварить — очень важны. Соответственно, для жирных MoE сеток важнее сколько у Вас ОЗУ, а видеокарта главное чтобы активные параметры и KV смогла съесть. Если съест больше — конечно лучше.
2. NVFP4 и MXFP4 — очень вкусные виды квантования, которые на Blackwell ускоряют в полтора‑два раза, при этом жрут память как примерно Q4, а по точности на уровне Q6 (некоторые говорят Q8 но что‑то не верится). Помимо этого, если мы говорим о ситуации когда большая часть лежит в ОЗУ — малый вес весов (да) позволяет им быстрее прокачиваться через шины данных, что дает буст. NVFP4/MXFP4 вроде бы умеют эмулировать программно на картах старше Blackwell, но скорость там скорее всего будет не очень.
3. В недавно появившейся Qwen 3.8 Flash Next появилась штука когда в дополнение к весам ещё идёт n‑gram кеш весом в десятки гигабайт. Желательно пихать его в ОЗУ, но на SSD именно его класть можно — чтения на каждый токен предсказуемы и довольно малы, поэтому производительность не упадёт в пол (но инференс должен быть не тупой и корректно с этим работать, а не так что всё скинуто на своп ОС, которая, разумеется, сделает это всё криво). Если такая архитектура закрепится и станет популярной, то стоит повнимательнее отнестись к SSD, если в RAM вся эта доп. требуха не помещается.
Интересно. А что за модель? MoE/Dense? И кванты — NVFP4/MXFP4 или что нибудь целочисленное?
Безотносительно вопроса хорошо/плохо именно «выпиливать лицензию» (не берусь судить) — неделя любой масштабной работы требует какой‑то памяти. Чем она была? md‑доки/бд/rag?
Есть сайты, где модели сравнивают. Таблица: одна набрала 86, другая 88. Мне это мало что говорит. Мои задачи выглядят иначе: «напиши FreeRTOS‑задачу для ESP32, которая опрашивает DHT22 не чаще раза в 2 секунды, управляет реле через гистерезис, не использует delay() и сбрасывает watchdog». Вставь delay(1000) в loop(), и контроллер уйдёт в перезагрузку. Баллы такое не покажут.
А можно подробнее?
Потому что разница между моделями и классами моделей видна именно на когнитивно сложных задачах, требующих более‑менее абстрактного мышления, где нужно одновременно «держать в голове» несколько слоёв системы и кучу сущностей, и их взаимодействие между собой. Вот на таких штуках слабые модели рожают горы костылей над костылями над костылями, сыпятся и застревают в болоте велосипедов, а сильные вывозят потому что способны на некотором уровне «системно мыслить», даже если ты их по этому вопрос не пинаешь вручную. И чем сложнее задача, тем сильнее разрыв.
По моему опыту из около 30b моделей вменяемо стала решать задачи только Qwen 3.6 27b Q4K_XL (не M), и то на длинных контекстах (больше 100к токенов) сыпалась. И только на Qwen 3.8 27b NVFP4 стало возможно более‑менее спокойно давать ей не самые тривиальные задачи и не бояться что она завалится и не закопается, и не начнет сыпаться с вызовом тулов и не зациклится. Плюс рантаймы за год стали существенно пошустрее работать + MTP завезли.
100% используется. Сталкивался с подобной проблемой изнутри несколько раз, руками (до эпохи ЛЛМ). Не только непосредственно запись в видео, а просто сам по себе захват рабочего стола.
В общем случае чтобы это работало быстро и меньше грузило комп, нужно, чтобы максимум работы делалось аппаратно (видеокартой например). В очень упрощённом виде картинка рабочего стола в ОС лежит либо в видеопамяти, либо в общей памяти (если ноут/разделяемая память) в формате RGB. Для видео её надо:
Опционально — отмасштабировать (если разрешение записи отличается от разрешения экрана)
Перегнать из RGB в YCbCr (яркость + дельта красного + дельта синего) — видео в RGB редкость
Сделать субдискретизацию — инфа о яркости в оригинальном разрешении, а о цвете (дельты красного/синего) — в 1/4. Бывает видео и без этой штуки, но оно очень редкое
Закодировать кодеком (H264/H265/AV1 и прочие)
Записать полученную порцию данных на диск
То есть у нас тут участвует куча железяк (проц, оперативка, видеочип, видеопамять, диск) и то, про что все любят забывать — каналы связи между ними.
Если всё делать аппаратно, будет хорошо. Но если выбирать, то самое тяжёлое тут — кодек.
Однако помимо самих вычислений есть ещё проблема перекачки данных между памятью через PCIe — это касается компов где RAM (основная оперативная память) и VRAM (память видеокарты) разделены. Типовой рабочий стол будет создавать поток данных в 1,5 Гбит/с (1920 * 1080 * 30 к/с * 3 канала * 8 бит в байте = 1,492992 гбит/с). Впрочем, компов с общей памятью это тоже касается: просто так копировать такой поток тоже небесплатно.
Так вот. Если реализация всего этого конвейера корявая — она уже на 1 этапе будет копировать всё в RAM, что нагрузит шину, и далее будет грузить CPU предобработкой и кодированием. Если реализация более‑менее вменяемая — она будет делать копирование из VRAM в другую область VRAM (копия рабочего стола), потом делать предобработку, потом копировать в RAM, потом из RAM обратно в VRAM (1,5 + 1,5 гбит/с = 3 гбит/с нагрузки) и там пинать аппаратный кодек. А результат обратно в RAM (впрочем, он уже мелкий) и оттуда в диск.
То есть даже если используется аппаратный кодек там всё равно есть чему положить слабый CPU. Шина памяти узкая (за раз копируется мало), операций копирования нужно вызвать много, всё, приехали. Поток данных толстый — любой лишний мув съедает ресурсы.
И вот если всё делается на месте без копирований — цепляемся напрямую к буферу рабочего стола, не копируем, сразу преобразуем, субдискретизируем и пихаем его в аппаратный кодек тут же на видеокарте, и только потом сжатый поток крошечного размера скидываем в RAM чтобы проц просто скинул его на диск — вот тогда получается вкусно.
Судя по всему — софт автора — это оно.
Но засунуть весь этот конвейер в видеокарту и предусмотреть все возможные конфигурации железа пользователей (разделяемая/общая память, nvenc, quick sync и прочие; разные ОС) — довольно геморное занятие. И автоперебор на тему «что прокатит то юзаем» — это один из вариантов. Правда, нужно чтобы автоматом остальная часть конвейера собиралась под удавшуюся реализацию.
Железо это еще не всё. Как правило (не всегда но чаще всего) у Apple с завода хорошая калибровка цвета. И не только у мониторов - айфоноайпады тоже хороши.
PS. Сам ушёл от мониторов, юзаю телики. Цвета не точные, но в остальном сплошные плюсы.
Потому что она стоит на месте. Герцы раскрываются в движении.
Если эта лампочка будет быстро двигаться мимо Вас в темноте со скоростью например 40 км/ч и Вы попытаетесь сопроводить её взглядом — она рассыпется на двадцатисантиметровые пунктиры на фоне размытого окружения, а не будет статичным объектом вокруг которого движется окружение, как это ожидается.
Если днем смотреть на едущую мимо машину — она статично проецируется на сетчатку, а окружение вокруг двигается назад. Если бы машина не двигалась, а дискретно 50 раз в секунду телепортировалась на 20 см вперед — то сопроводить взглядом бы ее не получилось, потому что глаз ожидает, что если он крутится то на сетчатке статичная машина на фоне размытого фона. При 50 Гц глаз вращается плавно, а проекция машины дрожит на сетчатке вперед‑назад.
Так вот, на мониторах объекты не двигаются — они как раз так дискретно телепортируются. Поэтому чем больше герц, тем меньше дрожь на сетчатке при сопровождении взглядом.
Модельку выложил на Sketchfab и просто вставил ссылку в «Медиаэлемент» — насколько я понимаю, штука довольно универсальная. То, что так можно делать, выявил чисто эмпирически, что она ещё умеет не знаю, но подозреваю что много чего :)
Решил поковырять задачу локально. Предварительно перегнал в фотореализм через flux2dev (надпись он сохранил), потом сунул в Hunyuan-3D-2.1. Надпись уничтожена, остальное на троечку. Впрочем, я ожидал худшего:)
3DAiStudio кстати заработал и даже выдал что-то вменяемое, но лимиты у них конченые, это да
Имхо — 3д генераторы заточены под восстановление геометрии из фотореализма, где светотень подсказывает сетке, где выпкулость/вогнутость. Мультик для них это боль.
Тут фокус в том что то что есть сейчас (почти) достигло потолка. У нас сейчас уже те самые «микросхемы с ручками для переноски» — посмотрите как ставят Threadripper в сокет. Видеокарта весит 4 кг. Для датацентров планируют карты в 15квт делать. Чипы уже такие есть (и они размером с тарелку). Дальнейшее увеличение производительности требует физического увеличения размера устройства и его потребления. Даже Microsoft вспомнил что пихать браузерный движок в блокнот это возможно не самый лучший подход.
Поэтому если горизонты не видны — их придётся найти, если мы хотим избежать стагнации/упадка прогресса. Текущий подход себя исчерпывает.
Когда узнал про принцип работы RAG представлял его себе как большое многомерное пространство с точками‑смыслами, и когда LLM хочет оттуда что‑то дернуть она вычленяет общие смыслы того что надо, и по их координатам дергает ближайшие точки из этого пространства и сцепленные с ними цитаты.
И была идея воткнуть в это пространство смыслов кротовые норы, которые бы отражали логические связи между смыслами. Логические связи по задумке надо было обнаруживать на этапе формирования БД. Идея в том, что если два смысла имеют логическую связь, но при этом находятся на большом декартовом расстоянии, то добавление такого вот портала рядом с ними создавало бы аномалию с существенно меньшим расстоянием между ними.
Типо вот
Но идея уперлась в то, что такое искривленное неравномерное пространство считать гораздо сложнее, чем прямое. Ну то есть наверно можно засунуть RAG в какое‑нибудь гиперболическое пространство (Пуанкаре‑эмбеддинги, привет) но при решении в лоб это будет жрать столько, что все плюсы будут нивелироваться, плюс поверх этого отвалятся стандартные плюшки вроде индексов faiss/hnsw. Хотя можно вместо искривлённого пространства просто насовать туда точек‑телепортов, наподобие входов в пв‑туннели у Буджолд. Только тут вместо пятимерности пятитысячемерность, которая немножечко более ресурсоёмка.
И вот эта штука из статьи имхо решает эту задачу, и решает круто, красиво и изящно.
Нейросети жрут видеопамять большой ложкой. 32 Гб это минимум на котором можно запускать жирные LLM (120b+) с более‑менее приемлемой скоростью; всякие толстые генераторы картинок с вменяемым качеством (которое может и пахнет нейрослопом, но не так сильно). Flux2dev 8bit например, или Wan2.2. А ещё есть такая штука как файнтюнинг.
Есть 3ds maxы и blenderы, которые на хорошей видеокарте могут рендерить трассировкой пути (не та которая в играх а полноценной) чуть ли не в реалтайме, или в разрешениях 130 МПикс+. Видеокартой. Можно даже запрягать несколько рендерингов одновременно. Можно грузить одновременно генерацию видео и монтажную программу: пока рендерится одно, монтируешь другое.
Плюс есть вот такие вот конфигурации мониторов
в которых современные недооптимизированные игры на человеческой видеокарте выдадут, в лучшем случае, 10 фпс. Если вообще запустятся.
В общем, смысл в том, что граница между профессиональным использованием и игровым нечёткая, она размыта — это раз, два — есть особо тяжелые игровые сетапы с большой площадью экранов и/или высокими требованиями к fps, которые обычные видеокарты просто не потянут.
Какие модели? Какой движок? Какие gpu? Сколько vram? Какой CPU? Версия PCIe? От этих факторов все зависит. Чем выше интенсивность обмена и хуже скорость этого pcie, тем меньше будет пользы.
Часто натыкаюсь подобную критику Q4.
Но на практике реальную разницу между Q4/Q6/Q8 я засекал в 2025 году на старых моделях. На новых (с апреля 2026, когда две Qwen 3.6 вышли) я её в своих практических задачах (разных — и работа с доками, и кодинг, и vision‑задачи, и вёрстка и прочее) не увидел. Не могу сказать что я прям целенаправленно тестил во всех возможных сценариях, но и сказать, что использование было однообразным, тоже нельзя. Как и нельзя сказать что все задачи были простые.
Qwen 36 27b в Q6K_M, Q5K_XL, Q4K_XL, Q8 — одинаково сыпались и частенько зацикливались на контексте 65–128к. Только 5-6-8 бит при этом работали медленнее, особенно Q8, где много слоёв в RAM надо было оффлоадить чтобы под KV кеш освободить место.
Есть мысль, что «на малых моделях Q4=мусор» сейчас уже не так жёстко, как раньше.
Сильной разницы сейчас не ждите ИМХО. Они (локальные ЛЛМ) сейчас переползают из состояния игрушек и автоматизации рутины в состояние «можно делать что‑то серьёзное». Плато по локальным ЛЛМ ещё не достигнуто, поэтому вполне вероятно, что то, что сейчас имеет 100 млрд параметров, будет через год иметь 30 млрд. Хотя рост способностей постепенно замедляется. А ещё движки инференса оптимизируют — производительности мало всем, поэтому она постепенно растёт у всех просто за счёт оптимизации кода + производители сеток придумывают всякие MTP и n‑gram кеши.
А какой квант? MTP завёлся? По идее скорость поднимется как движки инференса подтянутся. И есть еще момент с квантом: некоторые кванты криво распаковываются на GPU из‑за кривого движка и могут тормозить не смотря на то что вроде мелкие. KV‑кеш можно квантовать — он когда занимает меньше быстрее пролазит через шины в видеокарте, может получиться буст. И ещё — пробовали настраивать руками точно количество экспертов, выгружаемых в VRAM? Или у Вас там она вся помещается?
Не совсем так радикально. Так Вам будет тяжко собирать железяки под большое число параметров.
1. Очень важно MoE сетка или плотная. Если плотная — тогда да, крайне желательно чтобы всё влезло в VRAM. Но если она MoE (а жирные сетки в основном все MoE) то главное чтобы в VRAM поместились активные параметры и KV‑кеш. Все остальные эксперты — могут жить в ОЗУ. Это неприятно, это надо грамотно настраивать (подбирать сколько экспертов держать в VRAM и прочее) и скорость будет не сильно большой (10–30 т/с если грамотно настроить), но это проще, чем строить кластер из видеокарт. Разумеется, ширина шины PCIe, каналы памяти, скорость, и способность материнки и проца всё это переварить — очень важны. Соответственно, для жирных MoE сеток важнее сколько у Вас ОЗУ, а видеокарта главное чтобы активные параметры и KV смогла съесть. Если съест больше — конечно лучше.
2. NVFP4 и MXFP4 — очень вкусные виды квантования, которые на Blackwell ускоряют в полтора‑два раза, при этом жрут память как примерно Q4, а по точности на уровне Q6 (некоторые говорят Q8 но что‑то не верится). Помимо этого, если мы говорим о ситуации когда большая часть лежит в ОЗУ — малый вес весов (да) позволяет им быстрее прокачиваться через шины данных, что дает буст. NVFP4/MXFP4 вроде бы умеют эмулировать программно на картах старше Blackwell, но скорость там скорее всего будет не очень.
3. В недавно появившейся Qwen 3.8 Flash Next появилась штука когда в дополнение к весам ещё идёт n‑gram кеш весом в десятки гигабайт. Желательно пихать его в ОЗУ, но на SSD именно его класть можно — чтения на каждый токен предсказуемы и довольно малы, поэтому производительность не упадёт в пол (но инференс должен быть не тупой и корректно с этим работать, а не так что всё скинуто на своп ОС, которая, разумеется, сделает это всё криво). Если такая архитектура закрепится и станет популярной, то стоит повнимательнее отнестись к SSD, если в RAM вся эта доп. требуха не помещается.
Интересно. А что за модель? MoE/Dense? И кванты — NVFP4/MXFP4 или что нибудь целочисленное?
Безотносительно вопроса хорошо/плохо именно «выпиливать лицензию» (не берусь судить) — неделя любой масштабной работы требует какой‑то памяти. Чем она была? md‑доки/бд/rag?
А можно подробнее?
Потому что разница между моделями и классами моделей видна именно на когнитивно сложных задачах, требующих более‑менее абстрактного мышления, где нужно одновременно «держать в голове» несколько слоёв системы и кучу сущностей, и их взаимодействие между собой. Вот на таких штуках слабые модели рожают горы костылей над костылями над костылями, сыпятся и застревают в болоте велосипедов, а сильные вывозят потому что способны на некотором уровне «системно мыслить», даже если ты их по этому вопрос не пинаешь вручную. И чем сложнее задача, тем сильнее разрыв.
По моему опыту из около 30b моделей вменяемо стала решать задачи только Qwen 3.6 27b Q4K_XL (не M), и то на длинных контекстах (больше 100к токенов) сыпалась. И только на Qwen 3.8 27b NVFP4 стало возможно более‑менее спокойно давать ей не самые тривиальные задачи и не бояться что она завалится и не закопается, и не начнет сыпаться с вызовом тулов и не зациклится. Плюс рантаймы за год стали существенно пошустрее работать + MTP завезли.
Спойлер от Qwen 3.8 27b NVFP4
100% используется. Сталкивался с подобной проблемой изнутри несколько раз, руками (до эпохи ЛЛМ). Не только непосредственно запись в видео, а просто сам по себе захват рабочего стола.
В общем случае чтобы это работало быстро и меньше грузило комп, нужно, чтобы максимум работы делалось аппаратно (видеокартой например). В очень упрощённом виде картинка рабочего стола в ОС лежит либо в видеопамяти, либо в общей памяти (если ноут/разделяемая память) в формате RGB. Для видео её надо:
Опционально — отмасштабировать (если разрешение записи отличается от разрешения экрана)
Перегнать из RGB в YCbCr (яркость + дельта красного + дельта синего) — видео в RGB редкость
Сделать субдискретизацию — инфа о яркости в оригинальном разрешении, а о цвете (дельты красного/синего) — в 1/4. Бывает видео и без этой штуки, но оно очень редкое
Закодировать кодеком (H264/H265/AV1 и прочие)
Записать полученную порцию данных на диск
То есть у нас тут участвует куча железяк (проц, оперативка, видеочип, видеопамять, диск) и то, про что все любят забывать — каналы связи между ними.
Если всё делать аппаратно, будет хорошо. Но если выбирать, то самое тяжёлое тут — кодек.
Однако помимо самих вычислений есть ещё проблема перекачки данных между памятью через PCIe — это касается компов где RAM (основная оперативная память) и VRAM (память видеокарты) разделены. Типовой рабочий стол будет создавать поток данных в 1,5 Гбит/с (1920 * 1080 * 30 к/с * 3 канала * 8 бит в байте = 1,492992 гбит/с). Впрочем, компов с общей памятью это тоже касается: просто так копировать такой поток тоже небесплатно.
Так вот. Если реализация всего этого конвейера корявая — она уже на 1 этапе будет копировать всё в RAM, что нагрузит шину, и далее будет грузить CPU предобработкой и кодированием. Если реализация более‑менее вменяемая — она будет делать копирование из VRAM в другую область VRAM (копия рабочего стола), потом делать предобработку, потом копировать в RAM, потом из RAM обратно в VRAM (1,5 + 1,5 гбит/с = 3 гбит/с нагрузки) и там пинать аппаратный кодек. А результат обратно в RAM (впрочем, он уже мелкий) и оттуда в диск.
То есть даже если используется аппаратный кодек там всё равно есть чему положить слабый CPU. Шина памяти узкая (за раз копируется мало), операций копирования нужно вызвать много, всё, приехали. Поток данных толстый — любой лишний мув съедает ресурсы.
И вот если всё делается на месте без копирований — цепляемся напрямую к буферу рабочего стола, не копируем, сразу преобразуем, субдискретизируем и пихаем его в аппаратный кодек тут же на видеокарте, и только потом сжатый поток крошечного размера скидываем в RAM чтобы проц просто скинул его на диск — вот тогда получается вкусно.
Судя по всему — софт автора — это оно.
Но засунуть весь этот конвейер в видеокарту и предусмотреть все возможные конфигурации железа пользователей (разделяемая/общая память, nvenc, quick sync и прочие; разные ОС) — довольно геморное занятие. И автоперебор на тему «что прокатит то юзаем» — это один из вариантов. Правда, нужно чтобы автоматом остальная часть конвейера собиралась под удавшуюся реализацию.
PS. Софт огонь, попробую устроить ему стресс‑тест
Железо это еще не всё. Как правило (не всегда но чаще всего) у Apple с завода хорошая калибровка цвета. И не только у мониторов - айфоноайпады тоже хороши.
PS. Сам ушёл от мониторов, юзаю телики. Цвета не точные, но в остальном сплошные плюсы.
Потому что она стоит на месте. Герцы раскрываются в движении.
Если эта лампочка будет быстро двигаться мимо Вас в темноте со скоростью например 40 км/ч и Вы попытаетесь сопроводить её взглядом — она рассыпется на двадцатисантиметровые пунктиры на фоне размытого окружения, а не будет статичным объектом вокруг которого движется окружение, как это ожидается.
Если днем смотреть на едущую мимо машину — она статично проецируется на сетчатку, а окружение вокруг двигается назад. Если бы машина не двигалась, а дискретно 50 раз в секунду телепортировалась на 20 см вперед — то сопроводить взглядом бы ее не получилось, потому что глаз ожидает, что если он крутится то на сетчатке статичная машина на фоне размытого фона. При 50 Гц глаз вращается плавно, а проекция машины дрожит на сетчатке вперед‑назад.
Так вот, на мониторах объекты не двигаются — они как раз так дискретно телепортируются. Поэтому чем больше герц, тем меньше дрожь на сетчатке при сопровождении взглядом.
https://habr.com/ru/articles/682140/#Частота
Глаз может и 10000 Гц увидеть. Обычный. Ваш тоже.
С кулак они были во времена HD/FullHD, сейчас вполне ок
24 дюйма 4К с расстояния 50 см это то же самое, что 55 дюймов 4К с 114 см — угловой размер пикселя одинаковый
Как монитор оно очень удобное
Вот это ключевое. А если говорить про качественные — то там все поголовно смарт.
Модельку выложил на Sketchfab и просто вставил ссылку в «Медиаэлемент» — насколько я понимаю, штука довольно универсальная. То, что так можно делать, выявил чисто эмпирически, что она ещё умеет не знаю, но подозреваю что много чего :)
Решил поковырять задачу локально. Предварительно перегнал в фотореализм через flux2dev (надпись он сохранил), потом сунул в Hunyuan-3D-2.1. Надпись уничтожена, остальное на троечку. Впрочем, я ожидал худшего:)
3DAiStudio кстати заработал и даже выдал что-то вменяемое, но лимиты у них конченые, это да
Имхо — 3д генераторы заточены под восстановление геометрии из фотореализма, где светотень подсказывает сетке, где выпкулость/вогнутость. Мультик для них это боль.
Тут фокус в том что то что есть сейчас (почти) достигло потолка. У нас сейчас уже те самые «микросхемы с ручками для переноски» — посмотрите как ставят Threadripper в сокет. Видеокарта весит 4 кг. Для датацентров планируют карты в 15квт делать. Чипы уже такие есть (и они размером с тарелку). Дальнейшее увеличение производительности требует физического увеличения размера устройства и его потребления. Даже Microsoft вспомнил что пихать браузерный движок в блокнот это возможно не самый лучший подход.
Поэтому если горизонты не видны — их придётся найти, если мы хотим избежать стагнации/упадка прогресса. Текущий подход себя исчерпывает.
Когда узнал про принцип работы RAG представлял его себе как большое многомерное пространство с точками‑смыслами, и когда LLM хочет оттуда что‑то дернуть она вычленяет общие смыслы того что надо, и по их координатам дергает ближайшие точки из этого пространства и сцепленные с ними цитаты.
И была идея воткнуть в это пространство смыслов кротовые норы, которые бы отражали логические связи между смыслами. Логические связи по задумке надо было обнаруживать на этапе формирования БД. Идея в том, что если два смысла имеют логическую связь, но при этом находятся на большом декартовом расстоянии, то добавление такого вот портала рядом с ними создавало бы аномалию с существенно меньшим расстоянием между ними.
Но идея уперлась в то, что такое искривленное неравномерное пространство считать гораздо сложнее, чем прямое. Ну то есть наверно можно засунуть RAG в какое‑нибудь гиперболическое пространство (Пуанкаре‑эмбеддинги, привет) но при решении в лоб это будет жрать столько, что все плюсы будут нивелироваться, плюс поверх этого отвалятся стандартные плюшки вроде индексов faiss/hnsw. Хотя можно вместо искривлённого пространства просто насовать туда точек‑телепортов, наподобие входов в пв‑туннели у Буджолд. Только тут вместо пятимерности пятитысячемерность, которая немножечко более ресурсоёмка.
И вот эта штука из статьи имхо решает эту задачу, и решает круто, красиво и изящно.
Нейросети жрут видеопамять большой ложкой. 32 Гб это минимум на котором можно запускать жирные LLM (120b+) с более‑менее приемлемой скоростью; всякие толстые генераторы картинок с вменяемым качеством (которое может и пахнет нейрослопом, но не так сильно). Flux2dev 8bit например, или Wan2.2. А ещё есть такая штука как файнтюнинг.
Есть 3ds maxы и blenderы, которые на хорошей видеокарте могут рендерить трассировкой пути (не та которая в играх а полноценной) чуть ли не в реалтайме, или в разрешениях 130 МПикс+. Видеокартой. Можно даже запрягать несколько рендерингов одновременно. Можно грузить одновременно генерацию видео и монтажную программу: пока рендерится одно, монтируешь другое.
Плюс есть вот такие вот конфигурации мониторов
в которых современные недооптимизированные игры на человеческой видеокарте выдадут, в лучшем случае, 10 фпс. Если вообще запустятся.
В общем, смысл в том, что граница между профессиональным использованием и игровым нечёткая, она размыта — это раз, два — есть особо тяжелые игровые сетапы с большой площадью экранов и/или высокими требованиями к fps, которые обычные видеокарты просто не потянут.
Какие модели? Какой движок? Какие gpu? Сколько vram? Какой CPU? Версия PCIe? От этих факторов все зависит. Чем выше интенсивность обмена и хуже скорость этого pcie, тем меньше будет пользы.