Обновить
0
Александр М.@guest_00

Пользователь

Отправить сообщение

docling - им обработать документы, превратив их в .md. Если цель аналитика, то суём их в RAG. Мне зашел kotaemon, только на скромном железе идите в file collection и не городите Knowledge Graph, так как у промпт kotaemon все документы нарезает в граф по онтологии "люди, связи, организации", и этот промпт лучше поправить под свою онтологию, например, если отрасль химия, то "сырье, процессы, выходы".

Модель поднимите хоть на ollama, хоть в питоне, главное чтобы по API kotaemon к ней мог достучаться.

Попросил я как то очень умную ИИ накидать требования на таких вводных: "Хочу вот такую систему и вот так и чтобы тут аж так, а потом вот тут бац-бац и красота! И да, на андроиде хочу и сайт хочу!". Накидала. Пишу ей: "Верни их в ТЗ", вернула. Накидать архитектуры - накидала, на этапы разбить - разбила. Потом прошу вернуть оценку трудозатрат в человко-часах, с ролями и прочее. Вернула. Что то там 3-и месяца в 3 лица. Ну я потом спросил в другой сессии: "Вот требования, вот ТЗ, вот архитектура, вот этапы. Кожаные сделают за столько. А рой ваших за сколько? Чего вашим не хватает во вводных и чего докинуть?". Ответила, что у её роя уже всё есть и они всё сделают за 3 дня, из которых 2 дня мне надо курить их конвейер. День рой будет совещаться и писать софт и на выходе выдадут мне адрес действующего сайта и apk для установки и инструкию что делать. Пояснила, что это будет прототип проверить мои гипотезы, особенно пункт "бац-бац". Я еще ради прикола попросил одного из роя в промпте сделать строгим надзирателем с фразами "шнель! натурлих!" и прочими.

Кроме шуток, я конечно понимаю, что общался с LLM исходя из своего собственного опыта самостоятельной, командной и управленческой работы и держал этапы как разработки так и эксплуатации в голове. Но скорости меня заставили вообще абстрагироваться и взглянуть на всё происходящее с другой стороны. От идеи до прототипа для проверки гипотез всего то несколько часов.

Я уже такое проходил много лет назад с ECO Bold, потом с MDriven и прочими low-code платформами. Когда проверенный прототип отдавался в изготовление, потом ко мне возвращались подрядчики с "мы этот прототип превратим в приложение за 2 месяца, на java перепишем и это будет стоить ....". И прикладывали расчеты как у автора статьи. Однажды были посланы заказчиком со словами, что ему и прототипа хватает и гипотезу свою он уже проверил.

Давайте честно: всё равно вашу будущую систему будет писать LLM, просто контролировать результат будет технически грамотный специалист, а не заказчик которому будет тяжело понять все эти ваши куберы с ингресами.

Всё таки созданные нейросетью программы - это выходные данные, которые суть - результат работы ее обученной функции преобразования входной информации. И да, продолжая шаблон автора, раньше с нас требовали много чего делать, а теперь 2.0 - программирует условия. А я попробовал развить его тему: 3.0 будет программировать намерения, обвязка будет выравнивать ответы в сторону детерминизма. С развитием таких механизмов и учитывая исторические аналогии вполне вероятен переход к очень специализированным локальным моделям и с меньшим числом параметров, вполне себе и на несколько миллиардов. И пусть себе шуршит сегодня под одну задачу, а завтра под другую.

Хорошо, уберем шутки. А чего я неправильного написал в определении нейросети? Вроде ничего. Тогда вопрос: зачем программу заставлять писать другие программы, когда она - программа. Она что, входной поток не разберёт при правильной обвязке и настройках, или в нужном формате данные на выходе не выдаст, если ей надеть экзоскелет хотя бы на старом uml и пример обработки входного потока дать. А если этот экзоскелет - доменная модель какого-нибудь бизнес процесса? И что в сухом остатке будет для не моделей людей? Обвязки обвязывать?

[типаванга]Разработчик 3.0. В виду того, что нейросеть сама по себе является программой, которая обрабатывает входящую информацию согласно обученной функции преобразования, то после прохода точки сингулярности весной 2030 г. (а вы хорошо помните, как директивно стали запрещать использовать любые классические программы кроме нейросетей после того ада атак обученных LLM и отказов всего самописного ПО по всему миру) само понятие разработчик компьютерных программ под строгим запретом. Разрешено только писать небольшие скрипты для 3% недетерменированности, которая еще не закрыта у современных нейросетей (мы горды тем, что наши модели с вероятностью 97% отвечают на любую поставленную задачу), но эта привилегия осталась у разработчиков больших моделей. Встречаются индивиды, которые на своих допотопных домашних компьютерах что то делают для себя и узкого круга таких же повстанцев, но последние законы заставят их отказаться от своих действий [/типаванга]

Что я сделал не так, когда в древний потребительский комп с мамой Z390 aorus xtreme с 64Гб RAM, Intel i7-9700K воткнул две RTX5060Ti по 16Gb VRAM каждая? Которые по 50К руб. на маркетплейсах. Понизил им мощности до 80%, чтобы не грели друг дружку. Для инференса скорости хватает за глаза. Они обе под нагрузкой пашут максимум под 60 градусов. И это я еще не распечатал задуманный на старте пластиковый диффузор от второго фронтального вентилятора в щель между ними. Сказал себе, что не греются и так сойдет. А с диффузором, который будет работать как эжектор, вообще можно и до 40 градусов снизить, но это я сделаю, когда карты на обучение включу. Да, блок питания в старом ПК был 1000 и голд, а по умной розетке нагрузки вообще мизерные.

Не пугайте людей, можно и несколько карт. Даже через райзер. И x8 вполне себе норм, и pci-4. Опыт. И даже оффлоад части модельки в старую DDR4 64Гб не такое уж и бутылочное горлышко.

А tensor parallelism с CUDA отрабатывает, но в comfyUI надо шаманить, но там две карты в конвейере друг за другом даже лучше, чем две в параллельке.

Языковые просто тараторят так, что иногда напрягает.

И это теперь самый рабочий "сервер" именно в кавычках, так как он пока на винде. А как переедет на линукс, то я уберу кавычки.

И последнее, Q4, особенно MoE подводили на задачах. Пришел опытным путем к Q8, самый край Q5.

Извините, но Ollama так себе совет. Две настройки в два ряда.

Хорошо, оставим Open WebUI для сотрудников. Но лучше если кто вдруг как я с "сервером" на винде, то стартуйте с llama.cpp (край - LM Studio сразу как OpenAI API сервер, всё одно он - надстройка над llama.cpp но покручее Ollama) и к нему уже прикручивать или Open WebUI или всякие RAG/KG/и т.д. агентские пайплайны и прочие модные клиенты которые, по своей сути тоже простые обертки к вызовам API с разной степенью продвинутости.

AI-агент - это junior-разработчик, junior-дизайнер, junior-допишите_сами_роль.

Несколько AI-агентов - уже несколько junior'ов у вас в подчинении.

Выходит, что становишься наставником. Переходишь на новый уровень - управлять теми, кто будет делать то, что ты уже умеешь делать, только в начале они ничего не умеют делать и не знают как правильно.

В процессе отладки мучаешься с промптами, пока однажды не осознаешь, что 100500 раз отправляешь один и тот же шаблон (системны промпт: "ты - младший помощник старшего сантехника ..." + "тех.документация по колодцу водоснабжения и задвижкам" + твой промпт:"проверь задвижку по холодной воде") в пустую голову агента (stateless же). А агент, в силу своей вероятностной природы, даже с подкрученными temperature/seed/top'ами всякими и т.д. выберет другой удобный токен. Как говорится "как карта (GPU) ляжет в текущей фазе Меркурия розетки". И вернется с тебе агент с описанием задвижки, её марки и предложит найти такую же на озоне. Как говорится, послал молодого задвижку проверить. И не придерешься, проверил же. Что просил то и получил. Выписываешь молодому люлей обратную связь.

А когда осознаешь что тебе надо, чтобы твои junior'ы учились от запуска к запуску, то в обратную связь им пишешь: "найди задвижку синего цвета, верни % открытия штока, сделай фотографию, отправь фото на анализ другому балбесу". Так потихоньку или городишь агентам свой RAG и следишь за его наполнением, или срисовываешь HermesAgent (почти тоже самое, вид сбоку), или поступаешь как chat[.]qwen[.]com. Их инженеры в настройках пользователя в персонализации добавили Memory, который заполняется краткими результатами разных сессий с модельками типа "Начальник не любит громкого смеха". Если кратко, то после первого погружения в колодец агент запишет в память именно твою обратную связь: "там темно - возьми фонарь, фотоаппарат, рулетку". И в следующий запуск шаблон будет побольше, особенно в разделе тех.документации.

Итеративная инженерная задача, на измор ))

Перфекционист, которому надо задачу решить и сразу на 5-ку кричит матом, а подход другой - сделай на 3-ку -> обратная связь -> доведем до 4-ки, потом до 4+. Везде human-инзалуп.

А вот если заказчику надо на 5-ку, то тут уже и сроки другие и бюджеты и подходы. На 5-ку желательно свою модельку обучить, а там надо не менее 2 000, а лучше побольше "вопросов - правильных ответов" и карты с мозгами.

Нельзя 1 раз в неделю, проклянете потом. Как человек, который в зале с начала 2000-х годов пишу. Оптимально - 4 дня по 40 минут, ну 1 час максимум. И по одной группе мышц за день. У меня цикл начинается с приседа, потом день отдыха, потом жим, день отдыха, становая, опять день отдыха. Можно два дня отдохнуть, если тянул много. Потом в один день делаю легкий присед и легкий жим, или грушу побить, если надоело железо тягать. Уже явно не неделя получилась. Я не спортсмен, у меня работа сидячая, а с бумом ИИ только зал спину и спасает.

Раньше делал 5 подходов по 5 раз, сейчас 4 по 4. Мне за 50, больше и не надо. Разогрев именно таким же упражнением: с пустым грифом (10 раз) - 60 кг (8 раз) - 100 кг (6 раз) и так далее. Не самореклама, но в свои годы легкие тренировки у меня все по 140кг при собственном весе 110 кг. На тяжелые перехожу в осень-зиму.

За всё время пробовал и 1 раз в неделю и 2 и 3 и 4 и 5. Самые быстрые тренировки - когда 5 раз в неделю: присед тяжелый-жим тяжелый-становая всегда тяжелая-легкий присед-легкий жим-отдых-отдых. Но это хорошо, когда живешь один. 1, 2 и 3 раза в неделю - когда занят, но не дольше 1 месяца. Потом усталость заберет желание.

А с опытом пришло 4 раза в неделю. И пузо на месте и веса на зависть молодым ))

Одно действие я довел до автоматизма на винде под локальный инференс: сразу андерволтинг видеокарты до 80% от максимума через утилиты производителя, а процессору убираю boost mode. Инференс должен идти на 60-70 градусах и проца и карты. Не убивайте компы, ИИ того не стоит.

Информация

В рейтинге
4 718-й
Откуда
Новороссийск, Краснодарский край, Россия
Дата рождения
Зарегистрирован
Активность