Обновить
64K+

Видеокарты

Графические адаптеры

77,25
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Полтора месяца ускорял MoE на GTX 1660 SUPER: выиграл штатный флаг llama.cpp

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели6.8K

Я тепломеханик, начальник отдела в проектной организации, не программист. С августа ковыряю форк llama.cpp: хочу, чтобы большие MoE‑модели нормально шли на обычном домашнем ящике, где видеокарта на 6 ГБ, 24 ГБ памяти и SATA‑диск. Полигоном была gpt‑oss-20b. Итог пока обидный: выиграл штатный флаг ‑fit, на длинном запросе он в 2,44 раза быстрее привычного ‑ngl 99, а мои ускорения поверх него не дали ничего. Зато по дороге я собрал неплохую коллекцию способов, которыми замер скорости врет, и пару настроек, которые пригодятся любому владельцу небольшой видеокарты.

Читать далее

Новости

Провисание видеокарты. Что сломается первым, слот или сама карта

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.3K

В конце 2025 года много обсуждали то, как владелец ROG Astral RTX 5090 спорил с ASUS по поводу гарантии. Карта выдавала черные экраны и перезагружала компьютер. Экспертиза в сервисе показала, что есть неровность поверхности у разъема, а на снимке под микроскопом видна тонкая трещина у защелки слота. Повреждение признали негарантийным, а заменить карту предложили за 3350 долларов. На тот момент это было дороже, чем купить новую. Владелец говорил, что пользовался подпоркой, но на решение это не повлияло. Кто был прав тогда, сейчас уже не проверить, но в очередной раз поднять вопрос поломок больших карт стоит.

Читать далее

PPU Zhenwu 810E от Alibaba: как китайский AI-ускоритель справляется с LLM

Уровень сложностиСложный
Время на прочтение26 мин
Охват и читатели11K

Привет, я Дмитрий, MLOps-инженер в Selectel. 

Современный ландшафт AI-ускорителей изобилует всевозможными устройствами: GPU, TPU, NPU, LPU и прочими удивительными аббревиатурами. Китайские компании активно участвуют в этой колоссальной гонке, и в данном материале я расскажу, как мы тестировали AI-ускоритель от Alibaba Group.

В первую очередь мы хотели понять, что за устройство перед нами и как его можно использовать в наших стандартных сценариях для инференса — прежде всего в качестве ноды для облачного Kubernetes или как самостоятельный dedicated-сервер. Что ж, давайте разбираться.

Читать далее

Инженерная тайна AMD из нулевых: что общего между Xbox 360, HTC HD2, Sony Ericsson Xperia Play и LG Optimus L2

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели17K

Порой, когда погружаешься в исходный код драйверов и даташиты на железо, удивляешься тому, какие интересные инженерные решения использовались в устройствах прошлых лет. И пожалуй самым диковинным таким решением можно назвать подход AMD к разработке видеочипов в нулевых годах.

В этой статье всё как вы любите — подробная предыстория, анализ зацепок, изучение исходного кода и ответ на вопрос: что же общего между коммуникатором из 2007'ого, смартфоном 2009'ого, ноутбуком 2012'ого и Xbox 360?

Читать далее

Blackview Gamibook 16 — самый честный обзор на ноутбук за 160к с RTX5060

Время на прочтение10 мин
Охват и читатели8K

В современных ноутбуках меня пугает только одно: в моделях дешевле 1.000$ чаще всего дискретного GPU вообще нет и роль видеоускорителя выполняет урезанный Arc/RDNA, а в некоторых случаях совсем уж слабый UHD Graphics. И хотя на современных встройках вполне можно поиграть в AAA года эдак до 2023'его, 720P гейминг на минималках даже с апскейлингом выглядит так себе на 2.5K матрице...

Недавно ребята из Blackview предложили на обзор свой новый ноутбук с RTX 5060, i7-13650HX и 300Гц 2.5K матрицей - Gamibook 16. Я решил сделать честный обзор - с бенчмарками в портативном/десктопном режиме, тесте игр, скорости компиляции проектов на C++/C#, а также разборкой и осмотром конструктива устройства. Интересно? Тогда жду вас под катом!

Читать далее

Самый подробный обзор AMD FSR (1-3): он лучше NVIDIA DLSS — и вот почему

Уровень сложностиСредний
Время на прочтение20 мин
Охват и читатели6.9K

Привет, постоянные и не очень читатели!

В первой части цикла я разобрал технологию DLSS во всех её версиях — с предпосылками и историей появления, байками и мемами про Хуанга и даже применением в бизнес-приложениях (чиво?). Материал вышел огромным, и, вероятно, самым подробным про DLSS в Рунете. Почитать можно здесь: «Судный день грядёт [часть 1]: глобальный разбор апскейлера DLSS — от игр к работе»

Теперь пора обозреть пролетарскую FSR (FidelityFX Super Resolution) — технологию улучшения изображения от AMD, которая, по моему мнению, превосходит DLSS от NVIDIA. Почему? Расскажу в конце статьи.

Дропдаун

Часть 4. Обошел еще одно ограничение NVIDIA: первым в мире включил P2P на CMP90HX, а помогли мне в этом… инженеры NVIDIA

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели21K

В ходе моего исследования видеокарт линейки NVIDIA CMP, обхода их ограничений и снятия лимитов, оставалась еще одна проблема - видеокарты не могли нормально обмениваться данными напрямую друг с другом. Для моей задачи это было довольно неприятно, потому что сервер собирался ради запуска больших языковых моделей на нескольких дешевых видеокартах одновременно.

В итоге я полез разбираться, можно ли открыть на CMP 90HX настоящий P2P. И получилось - впервые в мире включить прямой обмен между этими картами, заставить одну CMP реально обращаться к памяти другой и получить нормальную скорость передачи.

Самое забавное, что по дороге мне очень сильно помогли сами инженеры NVIDIA. Не лично, конечно. Они просто забыли в драйвере ровно те внутренние механизмы, которыми сами пользовались при разработке и отладке.

Взломать драйвер NVIDIA

GTX 1080 Ti не сдаётся: выбираем лучшую MoE-модель для llama-server среди 35B, 120B и 176B

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели9.8K

Привет, Хабр! В прошлой статье я рассказывал, как запустить 176B-класс Qwen3.8-Flash-Next на GTX 1080 Ti, и тогда это был, скорее, эксперимент на грани возможного. Но недавно я наткнулся на материал на ast-softpro.ru, где ребята запустили Qwen 3.8-27B на двух RTX 5060 Ti по 16 ГБ (32 ГБ суммарно). Если коротко, они подтвердили, что гибридная архитектура DeltaNet + attention позволяет эффективно работать с длинным контекстом, а на их стенде модель в квантизации Q4_K_M выдавала около 24 токенов/с. Именно это, а также комментарии на Хабре, подтолкнуло меня к серии экспериментов, о которых пойдёт речь. Забегу наперед, я был удивлён результату: на моём стенде, который я опишу ниже, результаты на одной из моделей, которая как минимум не хуже, оказались сопоставимыми.

Читать далее

Qwen3.8–27B на двух RTX 3060 12ГБ: как я разогнал OpenCode с ~9 до ~40 токенов/с при 128K контекста

Уровень сложностиСредний
Время на прочтение22 мин
Охват и читатели12K

Можно ли превратить две RTX 3060 12 ГБ на старой Z97-платформе в нормальный локальный backend для OpenCode? Я начал с 9 токенов/с на длинном контексте и в итоге получил около 40 токенов/с в реальной агентной сессии с контекстом за 100K без уменьшения модели и без отказа от 128K.

В статье — tensor split без CUDA P2P, Q8 KV‑cache, встроенный MTP, подбор n-max, неудачные эксперименты с NCCL и shared buffers, реальные long‑context тесты и проверка качества на coding‑задачах.

Читать далее

Как запустить 176B‑класс Qwen3.8-Flash‑Next в DeepSeek Harness на GTX 1080 Ti

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели11K

Когда смотришь на характеристики современных MoE‑моделей, иногда возникает странная мысль: а что будет, если взять модель с сотнями миллиардов параметров и попробовать запустить её на старом игровом GPU?

С Qwen3.8-Flash‑Next этот эксперимент оказался особенно интересным.

Qwen3.8-Flash‑Next — мультимодальная MoE‑модель, которую сама команда Qwen называет ранним предпросмотром архитектуры, лежащей в основе Qwen4. В основной части модели 125 млрд параметров, дополнительно используется около 51 млрд параметров n‑gram embedding‑таблиц, а на один токен активируется около 6 млрд параметров. Поэтому в сообществе модель часто называют 176B‑классом: 125B + 51B. В model card отдельно также указан 4B MTP‑компонент.

Модель использует гибридную архитектуру Gated DeltaNet (GDN) и Qwen Sparse Attention (QSA). Всего в ней 48 слоёв: три из четырёх используют GDN, а каждый четвёртый — QSA. Кроме того, здесь используется 512 экспертов MoE, из которых на каждом токене выбираются 10 маршрутизируемых экспертов плюс shared expert.

Нативный контекст модели составляет 262 144 токена, то есть 256K в обычном обозначении.

На бумаге всё это выглядит впечатляюще. На практике возникает главный вопрос: куда поместить более 100 GB модели, если видеокарта располагает всего 11 GB VRAM?

В моём случае ответ оказался неожиданным: GTX 1080 Ti действительно достаточно, чтобы запустить такую модель, если использовать llama.cpp и правильно распределить вычисления между GPU и оперативной памятью.

Читать далее

Что на самом деле происходит, когда видеопамять заканчивается

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели6.5K

В сентябре 2026-го разводить холивар о том, хватает ли 8 ГБ видеопамяти, уже как‑то неприлично. И даже не потому что вопрос закрыт, а потому что выбора особо не осталось. Ну, посудите сами. RTX 50 Super, которую нам два года обещали как спасение с 3-гигабайтными чипами GDDR7, на Gamescom похоронили окончательно. А то, что осталось на полках, дорожает на глазах: за один только август восьмигиговая RTX 5060 Ti у нас подорожала почти на 30–40%. И не потому что доллар вырос. Реальная причина — это дефицит памяти и то, что партнеры NVIDIA в попытках выжить первым зарезали именно дешевые карточки. Ну, оно и понятно: в условиях, когда чипов не хватает, штамповать копеечную Dual или Ventus — де‑факто самоубийство.

Читать далее

12 ГБ VRAM и WAN 2.2 I2V‑A14B: как заставить RX6700XT генерировать видео неограниченной длины

Уровень сложностиСложный
Время на прочтение4 мин
Охват и читатели8.3K

12 ГБ VRAM, AMD, WAN 2.2 I2V‑A14B. Начал решать проблемы с генерацией видео и ограничениями железа — в итоге собрал пайплайн, который генерирует видео неограниченной длины, без швов. Вот как это работает и что пришлось принять как данность.

Читать далее

Поиск идеального ML ноута — с макбука на x86+Linux

Уровень сложностиПростой
Время на прочтение18 мин
Охват и читатели13K

В этом несерьёзном посте попробую разобраться с вполне серьёзным вопросом: каким должен быть идеальный ноутбук для ML-разработчика.

Читать далее

Ближайшие события

Хакинтош на i5-13600KF и Radeon RX 5700 XT: как поставить macOS на Gigabyte Z690 UD с OpenCore 1.0.7

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.6K

Пошагово от BIOS до первой загрузки: кому подойдёт эта сборка и что менять, если железо отличается; что скачать; какой SMBIOS; подмена CPUID; ACPI; кексты с версиями и назначением; карта USB на 15 портов; звук, сеть, NVMe, гибридные ядра. В конце — проверки после установки и порядок обновления загрузчика.

Читать далее

Тест DeepSeek, Qwen, GLM и прочих LLM на продвинутом пользовательском железе

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели13K

В статье рассказываю о личном опыте запуска современных LLM на домашнем ПК, сравниваю модели, кванты и движки, показываю результаты практических тестов и делюсь выводами о том, что сегодня по моему мнению имеет смысл запускать локально.

Читать далее

Конец эры ПК: вычисления переезжают в дата-центры

Время на прочтение18 мин
Охват и читатели8.9K

Первая часть этого материала рассказала о пути Nvidia от производителя видеокарт для игровых компьютеров до самой влиятельной корпорации мира. За последние несколько лет ее технологии изменили всю планету— теперь человечество вошло в эру искусственного интеллекта.

Однако для его развития нужны все новые ресурсы: огромные энергетические запасы, гигантские строительные площадки размером с целые города, но прежде всего — кремниевые чипы. Их нехватка может привести не только к исчезновению многих некогда крупных производителей комплектующих для ПК, но и видоизменить сам персональный компьютер. 

Многие считают, что это и есть план Nvidia. Так ли это на самом деле? Разберемся во второй части материала.

Читать далее

Как наращивают память видеокарты и сколько это стоит

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели9.4K

Несколько недель назад интернет гудел новостными заголовками, в которых говорили, что продавец из Гонконга выложил на eBay видеокарту GeForce RTX 2080 Ti с 22 ГБ видеопамяти вместо штатных одиннадцати. При этом он просил за нее всего 499 долларов. Тогда мало кто вспомнил, что про такие же карты с тем же ценником еще в феврале 2024 года рассказывали ребята из Tom's Hardware, но в то время переделкой занимались китайские мастерские. Сама по себе эта история очень интересная, особенно учитывая, что это не курьез из новостной ленты, а вполне сложившийся рынок со своими ценами и своей логикой. Сейчас расскажу все по порядку.

Читать далее

Почему профессиональная GPU стоит впятеро дороже игровой с той же начинкой

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели16K

Привет, Хабр! На связи Илья Мартысь из Рег.облака. Видеокарты RTX 5090 и RTX PRO 6000 Blackwell собраны на одном кристалле. Разница в цене — почти вчетверо.

Объяснить ее одним словом «профессиональная» не выйдет. Причин три: объем памяти, ECC и лицензионное соглашение на драйвер. Последняя вообще не про железо, но именно она решает, попадет карта в стойку или нет. Заодно расскажу, почему A100 2020 года до сих пор в работе, хотя рядом стоят карты втрое быстрее.

Читать далее

Глупый пользователь против Умного Ноутбука ч. 2. Флагманы — Зло

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели11K

Графомания - штука такая. В отсутствии новых идей, приходится возвращаться к старым. Собственно новая статья – является продолжением вот этой вотъ.

Сегодня в программе:

1. P-cores vs E-cores
2. Болезненный переход с АМД на Интел.
3. Почему не получается резать частоту, но можно резать PL.
4. Почему 80 ватт*час для Intel Ultra 9 275HX не тоже самое, что 80 ватт*час для ryzen 5 5600h.
5. Криво нанесенный ЖМ с завода.
6. Троттлинг.
7. Много троттлинга.
8. Графомания.
И полная безграмотность. Всё в общем как всегда.

Похихикать над автором... Снова :-)

Моддеры хакнули DLSS 5 и запихнули его во всё подряд — от Skyrim до GTA San Andreas

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели15K

Иногда что-то супер-мега-секретное вылезает наружу не через слив, а просто потому что кто-то забыл вынуть один файл из билда. Ну забыли и забыли, с кем не бывает.

Именно так всё и произошло на прошлой неделе с DLSS 5 – скандальной штукой от Nvidia. Официального анонса не было, зато была ранняя версия игры NBA 2K27, в которой была незаметная DLL-ка nvngx_dlssnr.dll на 158 мегабайт... и понеслось.

За считанные дни модеры натянули нейросетевой рендер на добрых три десятка игр, от Cyberpunk 2077 до GTA San Andreas, которой уже двадцать лет в обед (хотя ремастеру чуть меньше).

Если вы следили за DLSS 5 с марта, то помните все эти мемы и хейт. Попробуем разобраться, что произошло, как работает технически, что показывают тесты и почему до сих пор спорят о судьбах игровой индустрии. Заодно накидаю картинок и видео, потому что тут тот случай, когда лучше один раз увидеть, чем сто раз прочитать.

Читать далее
1
23 ...