Pull to refresh
8K+
33

User

13
Rating
12
Subscribers
Send message

Жаль наткнулся только сейчас, и уже нельзя поставить плюс. Спасибо за статью!

За GBNF спасибо. Пригодится для самодельного агента на llm.

Еще можно попробовать в Amuse (3.5.8)

Скрин

Да, мне практически в каждой статье пишут: "зачем это? ведь есть X".

"Обучение LLM с нуля" - это непрактично, заучивает только "немногочисленные диалоги".
ImageBrowserAI - зачем, ведь есть Immich.
VoiceReader - прививает "неправильные паттерны ребёнку".
"Алиса, подвинься" - "Столько трудов и не получилось ничего".

Я не делаю готовый продукт, мне никто за это не платит. Каждая статья - попытка самому разобраться как это работает.

На Ryzen AI 9 HX 370 служба Windows Search активно использует NPU. Пришлось отключить.

0.7B — это мало. Для нормальных связных диалогов нужно минимум 3-7B, и это при условии хорошего файн-тюнинга поверх.

А 0,000103744B хватит что бы модель зазубрила пару диалоговых строк https://habr.com/ru/articles/1017484/ :)

Плюсанул везде где можно. Получилось очень хорошо!

Исходный код: https://github.com/virex-84/LLMGPT2

Добавил выбор всех доступных "ускорителей" на выбор при запуске программы: CPU, OpenCL, CUDA.

Скрытый текст

Анализ корпуса - показывает какую модель можно сделать на основе данного корпуса.

Скрытый текст

Так же добавил авто-конфигуратор модели: конфигурация модели создается исходя из текущего корпуса.

Ну и собственно все классы были оптимизированы для ускорения обучения.

Это реализация gpt-2 архитектуры использующая для обучения OpenCL (CUDA, CPU), с возможностью экспорта в gguf. Для наглядности была выбрана минимально возможная конфигурация, что бы любой мог повторить обучение с нуля на своем железе. Вне этих диалогов будет мусор.

Но никто не мешает вам увеличить конфигурацию и корпус, и получить более осмысленную модель.

З.Ы. на github кто-то уже попробовал обучить микро модель на Nvidia RTX 3090, через CUDA.

Интересное приложение. Но нужно немного доработать.

Пишу Михалычу вопрос, долго пишу, старюсь. Нажимаю "отправить". Выдает "Неполадки связи". Заново писать всё это - тяжело. Нет кнопки "повторить" у неотвеченного запроса.

Выхожу из диалога. Захожу заново, что бы еще раз попытать счастья, повторить вопрос - чат пустой.

Спасибо! В моей статье не только поиск фото по текстовому описанию, но и видео. Плюс поиск по лицу среди фото и видео.

Если кто решится переключиться на новый драйвер, для возможности загрузки в безопасном режиме необходимо добавить:

reg add "HKLM\SYSTEM\CurrentControlSet\Control\SafeBoot\Network\{75416E63-5912-4DFA-AE8F-3EFACCAFFB14}" /ve /d "Storage Disks" /f
reg add "HKLM\SYSTEM\CurrentControlSet\Control\SafeBoot\Minimal\{75416E63-5912-4DFA-AE8F-3EFACCAFFB14}" /ve /d "Storage Disks" /f

Планируется ли использование архитектуры MoE?

Добавил описание видео mp4, дополнил статью. Изменения выложил на гитхаб.

Добавил поиск по лицу, дополнил статью. Изменения выложил на гитхаб.

Кроме того скорость обработки зависит и от скорости чтения с диска

Про "сильно" я не говорил, но влияние от дисковой подсистемы есть.

Для HDD: это может быть старая версия SATA, сильная фрагментация, текущая нагрузка диска другими процессами.

Для SSD: проседание скорости во время операции TRIM, тротлинг при перегреве, либо при почти полной заполненности диска.

Решал схожую задачу Поиск в личном фото архиве по текстовому описанию. Но в вашем случае ollama не нужна. Это умеет llama.cpp, на которой собственно основана ollama.

Запускаете модель через llama-server

Ставите пакет Microsoft.Extensions.AI, код можно посмотреть в разделе "Мультимодальность" https://habr.com/ru/articles/914392/

Information

Rating
663-rd
Registered
Activity