Обновить
57
0x62.a.sh@0x62ash

Пользователь

16
Подписчики
Отправить сообщение

вещи, которые раньше "хотелось попробовать, но руки не доходили", теперь можно пробовать легко и довольно дешево.


В софтверных компания точно так же. Стали делать очень много задач до которых раньше руки не доходили. Т.е. нейросеть помогает условный бэклог разгребсти не самых приоритетных и важных задач. А такие задачи не сильно повышают окупаемость

Не то что бы учится. Мы просто агента обкладываем полезным контекстом что бы он лучше понимал домен, текущую техническую реализацию, код стайлы и т.д.

а когда нейронки прокачаются вместо дорогих сеньоров как раз и придет новое поколение дешевых джунов + мощные нейронки и заменит их ))

Сейчас короткое окно когда получив ИИ ассистанта можно получить на выходе или свободные часы в работе или ускорение относительно конкурентов. Но когда ИИ будет у всех внедрен - мы опять уровняемся

Таблица ngram нужна как раз в момент префила, что бы получать вектора по смежным токенам. Причем, судя по метрикам, данных гоняется мало и все упирается в дополнительный латенси. У модели префил и так не самый быстрый и очень быстро деградирует с ростом контекста, так что я нграммы держу в памяти. Наверняка будут еще какие-то раунды оптимизации и нас ждут какие-нибудь улучшения.

Я пробовал с nvme. У меня prefill просел в два раза.

Не берусь предсказывать. Раньше в локальных моделях делался упор на MoE модели требовательные к VRAM, пока не пришел qwen со своей маленькой 27b dense моделью и стал царем горы.

MLX странный формат. На маке на маленьком контексте он действительно работает лучше чем GGUF, но с ростом контекста хотя бы до 64к (а это обычная агентская разработка) скорости начинают деградировать сильнее чем GGUF.

Плюс очень странная история с MTP. Его очень долго добавляли в MLX и как будто бы добавили тоже не очень правильно. Но тут нужно поресерчить, говорю по ощущениям с дискуссий реддита

MoE модели обычно надо много VRAM, но скорость памяти не так критична потому что активных параметров меньше. К примеру у меня moe qwen 3.5 122b a10b генерирует ответ быстрее чем dense qwen 3.5 27b.

Примерно так, да. Для Dense моделей m5max/128gb не самое подходящее решение. Зато если выйдет MoE ~ 80-100B/A10B то тут этот конфиг заиграет новыми красками

Запись kv на диск имеет смысл только если вы хотите к этому контексту вернуться потом (например быстро обработать стартовый промпт opencode). Вам так и так весь контекст (kv-cache) надо держать в памяти что бы сгенерировать ответ.

"Сделай GTA VI в html, не ошибайся" как бы тоже спецификация, просто слишком фривольная )

"знаю по себе" - очень плохой заход в "системное мышление"

По ощущениям статья на год просто опоздала. В те времена ничего особо лучше и не было. Даже gpt-oss-20b еще не релизнули

Ютуб мне иногда подбрасывает видосики одного автора и очень уж мне нравится звук и сама клава у автора. Может подскажите что это за свитчи и что за клава https://youtu.be/wwJA9mDqIVc?si=mtvVU67c9JLKMBUH&t=111

А это интересная тема. Unsloth для агентов рекомендуют 0 что бы не ограничивать модель в повторении токенов, т.к. в агентской истории по написании кода это частое явление. А для обычного чата рекомендуется 1.5

Аналогично с температурой. Для агентов минимально, для обычного общения побольше

https://unsloth.ai/docs/models/qwen3.6

Так, MTP не влияет на активные параметры и т.д.

MTP есть и для dense медленной и качественно модели qwen3.6 27b и MTP есть для быстрой и менее сообразительной moe модели qwen3.6 35b.

Надо понимать что MTP ускоряет генерацию токенов, но не ускоряет парсинг промпта. Последнее останавливает меня от использования 27b в агентских задачах, где контекст может быть очень большим.

Рекомендую просто пробовать все варианты и искать тот что вам больше подходит.

Поведения с кешированием промпта валидно для любой модели. Тормозить может и дальше, когда модели нужно будет еще 20к исходников прочитать например.

pp/tg метрик инференса которые показывает llama

на маке mlx обычно лучше работает чем gguf от llama, потому и вопрос возник

Запуск клауд кода с локальным ллм не зависит от того будет это llama.cpp/lm-studio/omlx и т.д.

Угумс... еще и pp совсем маленький. Разве что на ночь отдавать кодить план сгенеренный в каком-нибудь клоде

m4 pro? сколько гпу ядер? какая скорость pp/tg? почему не mlx?

1
23 ...

Информация

В рейтинге
5 476-й
Зарегистрирован
Активность