Articles / Profile of freQuensy23 / Habr

@freQuensy23

User

Profile Publications 8Comments 40Bookmarks 1

freQuensy23 yesterday at 00:04

Как (не)удачно превращали LLM в 2d виртуальных сотрудников

3 min

2.1K

Programming*HTML*Machine learning*

Digest

Эта идея получила новую жизнь примерно восемь месяцев назад, когда Reworked AI представили llama 2d. Они научили языковые модели не просто «читать» текст, а по-настоящему воспринимать структуру и смысл двухмерных документов, таких как веб-страницы. Перед тем как расскажу как это работает - пару не очень удачных подходов, по которым пытались идти их конкуренты

freQuensy23 Jun 25 at 10:51

Кластерное обучение нейросетей

Medium

5 min

1.8K

Mathematics*Machine learning*

Review

Multi gpu training overview

Если обучение модели на одном графическом процессоре происходит слишком медленно или если веса модели не помещаются в VRAM, переход на обучение с несколькими графическими процессорами (или с несколькими устройствами с несколькими графическими процессорами в каждом) может быть целесообразным вариантом.
Ниже рассмотрим некоторые стратегии по масштабируемости обучения между несколькими GPU или нодами.

Глобально следует рассмотреть 3 сценария

freQuensy23 May 21 at 11:47

Разбираем KAN по полочкам

4 min

7.5K

Mathematics*Machine learning*

Analytics

Недавно аспиранты из MIT выпустили очень интересную статью про концептуально новый подход к проектированию наверное самого базового "кирпичика" нейронок - полносвязного слоя.

Постараюсь дать небольшое описание того, что происходит под каптом кана, при этом не превращая публикацию в учебник по матанализу

+27

freQuensy23 Apr 20 at 14:53

Выбираем правильный инференс: Как мы сэкономили 70к $ на ЛЛМках

4 min

4.7K

Machine learning*DevOps*Data Engineering*

Недавно ко мне обратились знакомые, которые активно впиливали LLM в своей продукт, однако их смущала стоимость такого решения - они платили около 8$/час за Huggingface inference Endpoint 24/7, на что уходили просто невиданные ~100 тысяч долларов в год. Мне нужно было заресерчить какие есть способы развертывания больших текстовых моделей, понять какие где есть проблемы и выбрать оптимальных из них. Результатами этого ресерча и делюсь в этой статье)

-4

freQuensy23 Sep 14 2023 at 10:08

Dream Booth — очень умное дообучение stable diffusion

Medium

4 min

11K

Machine learning*Artificial Intelligence

Review

Как можно наказать модель за то что она забывает "абстрактные" признаки какого-то обьекта? Почему это важно при обучении дифузионных генеративных моделей на специфичном датасете

+10

freQuensy23 Jul 24 2023 at 08:52

Учим ламу говорить на руcском

Easy

5 min

6.5K

Python*Machine learning*

Tutorial

Тут я рассказывал как можно использовать магию низкорангового разложения (Low Rank Adaption) матриц для того что бы легко дообучать большие текстовые модели. Сейчас же я напишу свою реализацию LoRA используя PyTorch, переведу весь датасет alpaca-cleaned (на котором училась альпака - языковая модель родом из стенфорда) на русский язык, используя взломаный яндекс переводчик, и наконец "скормлю" его языковой модели, что бы она наконец смогла понимать русский язык.

Советую ознакомится с кратким теоретическим описанием происходящего (хотя вроде как такие просьбы не работют()

+13

freQuensy23 Jul 12 2023 at 15:00

Кто же такая это ваша LoRA

Medium

5 min

44K

Mathematics*Machine learning*

Review

В сети в последнее время регулярно мелькают статьи типа - как обучить Stable Diffusion генерировать ваши фотографии/фотографии в определенном стиле/фотографии определенного лора/такие фотографии итп.

Однако к сожалению, даже на хабре, об этой технологии рассказывают супер-поверхностно - как скачать какую-то GUI программу, и куда тыкать кнопочки. Поэтому я решил исправить это недоразумение, и выпустить первую статьи на русском, где полностью рассказывается что по настоящему стоит за этими 4-мя буквами.

+35

freQuensy23 Mar 20 2023 at 22:47

Реверсинжинерим московское метро

Easy

6 min

11K

Development for Android*Transport

From sandbox

Получим матрицу весов метро Москвы из APK файла. Обработаем эти данные и попытаемся сделать некоторые визуализации.

+32