Pull to refresh
16K+
5
Артемий@mr8bit

User

25
Rating
3
Subscribers
Send message

Как 17B активных бьют 70B плотных: анатомия Mixture-of-Experts (MoE)

Level of difficultyEasy
Reading time6 min
Reach and readers3.5K

Если вдруг вы моргнули на моменте, когда разработчики нейросетей мерились, у кого больше цифра рядом с названием модели, а выморгнув, обнаружили, что теперь модно флексить скромными размерами активных параметров, эта статья для вас. Сегодня объясняю, как же так произошло, что все флагманы опенсорса внезапно стали MoE, почему Qwen3.5 на 397 миллиардов параметров строчит токены, как будто ей 17 и почему никто не разорился на видеокартах.

Ну и для тех, кому «только спросить» откроем тайну: в каком же кабинете живет эксперт по медицине.

Читать далее

H-Neurons: 0.1% нейронов, из-за которых LLM врут

Level of difficultyEasy
Reading time6 min
Reach and readers7.3K

А вы когда-нибудь задумывались, почему ваша любимая LLM-ка на 70 лярдов параметров, обученная на всем интернете, может с уверенностью университетского профессора выдать, например, что Наполеон изобрел электричество? Откуда это берется?

Долгое время индустрия списывала галлюцинации на плохие данные, кривой RLHF или декодинг. Но группа ученых из Университета Цинхуа залезла внутрь нейросети и нашла конкретных виновников — 0.1% нейронов, которые буквально заставляют модель врать. И это не метафора, это реальные веса в FFN-слоях трансформера.

В этой статье расскажу, что же обнаружили китайские исследователи, как нейроны-галлюцинаторы связаны с чрезмерной уступчивостью модели и почему корень зла лежит в претрейне. Возможно будет любопытно ML- и дата-инженерам, а также всем, кто не хочет быть одураченным в очередном диалоге с GPT-шкой.

Читать далее

Unlimited-OCR от Baidu: читает страницу как картинку

Level of difficultyMedium
Reading time5 min
Reach and readers8.6K

Как вы себе представляете работу OCR? Страничка сканируется, программа находит области с буквами, распознает их и выдает текст. Старый добрый Tesseract так и пашет. А вот новый baidu/Unlimited-OCR делает финт ушами: он вообще не ищет буквы. Он берет всю страницу как картинку, жмет ее в горстку визуальных токенов и скармливает языковой модели, которая разворачивает их обратно в структурированный текст. Звучит как извращение, но… работает.

Это прямой наследник идеи DeepSeek-OCR. Сегодня коротко разложу: что это, как устроено, что умеет и как запустить у себя. Будет полезно всем, кто хочет распознавать многостраничные документы за одну проходку или вписать такую функцию в свой проект.

Читать далее

Квантизация LLM: как запихнуть 70B модель в свою видюху

Level of difficultyMedium
Reading time7 min
Reach and readers5.9K

Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.

Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.

Материал будет полезен как мимо проходящим ИИ-любопытствующим, так и ML-инженерам и специалистам по инференсу LLM, которые хотят запускать большие модели на ограниченном железе. Покажу, как все это гонять на практике и с кодом.

Читать далее

Information

Rating
350-th
Registered
Activity