Обновить
64K+
24

Пользователь

37,8
Рейтинг
15
Подписчики
Отправить сообщение

Еще раз спасибо! обновил llama.cpp, поставил
--spec-type draft-mtp
--spec-draft-n-max 2
и скорость выросла до 55-79 токенов в секунду. Средний прирост скорости 1.74 раза. (Контекст правда пришлось ужать со 180000 до 140000, работает, но практически без резерва vRAM)

Спасибо! нужно будет попробовать.

да qemu. Подробную инструкцию дать не смогу, делал пару лет назад, не помню, но не очень сложно, может 1-2 часа. Использовал Archwiki, тогдашний ChatGPT и что-то с форумов.

рад слышать! Спасибо, что прочитали.

может быть, нужно будет просмотреть, но в целом, то что выдает qwen с 0.6 меня устраивает

у меня была статья на эту тему: Почему Qwen3.6-27B лучше чем Claude? Железная коробка, которая научилась думать - в которой я попробовал сформлировать ответ на Ваш вопрос - "Зачем". И там длинное обсуждение в комментариях, почитайте.

А если в нескольких словах: приватность, стоимость, гарантированное качество ответа, возможность автономной работы, альтернатива монополии биг-теха на интеллект и знания.
Не уверен, что это действительно уровень Opus, но это неважно. Важно то, что она делает то, что мне нужно (нужно именно мне а не какому-то чуваку из Google, OpenAI, кгб, цру, масад, <подставьте свое>) и делает это значительно быстрее, чем могу сделать я сам и с качеством достаточным для выполнения поставленных задач.

Я вот все хочу разобраться, как самому сделать uncensored модель, да руки не доходят. Думаю, если бы кто-то написал руководство было бы круто. Хотя наверняка кто-то уже написал, вы в эту сторону не смотрели?

Вот и хорошо! Это не сложно!

интересно! если будет время посижу в выходные посмотрю растройки llama-server. Можете еще раз подсказать какая скорость у Вас получается с какими настройками?

нашел!!! :) я поставил ограничение мощности видеокарты на 360 Ватт а потом об этом забыл! :))) Так-что виртуалка тут ни при чем

(спасибо! попробую mtp и разные квантования)

Поправил. Спасибо!

Спасибо! У вас кстати скорость получилась больше чем у меня (у меня примерно 45-50 токенов в секунду)

просто я как-то давно вместо винды установил Arch, у него rolling release, вот он так и катится от обновления к обновлению. Виртуалка удобна для экспериментов, потому, что если что-то сломается не нужно все переустанавливать, ну а Arch на виртуалке - потому, что удобно иметь одну систему везде.

unsloth у меня как-то не зашел, а на счет mtp - хорошая идея, попробую. Спасибо!

на виртуалке с Arch и проброшенной внутрь RTX4090

так получилось. Я редко использую модель для написания красивых текстов, на письма и что-то короткое 0.6 - нормально, а излишнее творчество мне ни к чему, пусть лучше на один и тот-же вопрос она отвечает более-менее одинаково.

кажется возникло недопонимание по поводу reasoning-budget
Изначально я добавил эту настройку для 3.6, потому, что 3.6 периодически зацикливалась на: "...I will provide the best answer, I will provide ..." и так по-кругу.
Т.е. reasoning-budget для 3.6 использовался как ограничитель, чтобы модель остановилась, если ушла в цикл. Нужно отметить, что reasoning-budget не обрывает рассуждение на середине, а довольно мягко способствует тому, чтобы модель в него уложилась.
3.8 в этом плане гораздо лучше, за последние 4 дня она ни разу не уходила в подобный цикл. Поэтому я увеличил reasoning-budget и планирую его еще увеличить. Т.е. меня полностью устраивает как она рассуждает и я готов дать ей еще немного пространства для рассуждения (не ограничить, а добавить), рассуждения выглядят обоснованными и вполне логичными, и не затягиваются надолго, если задача сложная модель может потратить больше токенов, но для простых задач тратит совсем немного (значительно меньше чем тратила 3.6), т.е. выглядит так, что 3.8 эффективние использует бюджет.
(вообще конечно нужно поиграть с настройками, но вроде как все и так работает, а времени пока нет)

Согласен, в такой ситуации возможно Opus лучше.

Позволю себе привести пример, может он вам пригодится. (я последние 3-4 недели очень активно тестирую возможности локальных моделей, на примере Qwen3.6-27B и открыл для себя много нового, а так тоже использовал Opus)

Есть у меня длиннющая портянка кода, которую Opus написал примерно пол-года назад (4846 строк) код работает, задачу выполняет. Но хорошо бы было подключить этот код к API, чтобы он данные мог дергать и инструменты использовать. Сам я этот код не писал, просто пролистал и честно сказать охоты разбираться, да и времени у меня нет. Скажу только, что разбить этот код на несколько файликов поменьше невозможно, системе нужен 1 файл который включает все. Ну в общем решил я скормить эту задачу Qwen и Opus и посмотреть что получится.

С опусом пришлось минут 40 поспорить, т.к. он тупил, говорил что без API код лучше и что это вообще невозможно. Потом я его "уговорил", он вроде все понял и запыхтел.

С Qwen - все было немного проще. Она сразу согласилась все сделать как я прошу. Но перед редактированием кода я попросил ее сделать следующее:
1. Инициировать Git и закоммитить текущее состояние (чтобы она могла откатиться если что.
2. Создать файл TODO в который сохранить информацию о том, что она собирается сделать, а именно:

  • Найти и проанализировать API требуемое для решения задачи и имеющийся код, найти, как должен быть изменен код для решения поставленной задачи, сколько изменений, точки изменения, сниппеты для каждого изменения, порядок изменения - все сохранить в файл TODO. (было найдено 26 точек в которых код должен быть добавлен или изменен)

  • Проанализировать возможные риски, определить тесты которые должны быть выполнены - все тоже в TODO

  • Составить чек-лист всего того, что должно быть проверенно после завершения процесса - тоже в TODO


3. Писать все изменения в log файл.

Qwen подумала и составила список. Это заняло примерно 15 минут (на все). Далее я попросил ее выполнить изменение кода. Изменение со всеми тестами заняло примерно 10 минут. Код оказался рабочий но подключение к API с первого раза не удалось, я сам немного подумал и понял, что на сервере используется порт нестандартный для этого API. После изменения порта все заработало. (т.е. фактически с первого раза, т.к. ошибка была моя)

Контекстное окно модели было 120000 токенов. Использовался стандартный фильтр с параметрами:

  • Default Budget Tokens 118К

  • Response Headroom Tokens: 84К

Максимальный расход токенов на чтение составил 76К

С этими установками, модель помнила примерно 14 последних сообщений чата (собственно потому я и заставил ее сначала составить TODO и писать каждую выполненную операцию в лог-файл (вариант долговременной памяти)

Что до опуса - его код с первого раза не заработал и упал с ошибкой чтения входных данных. Т.е. он сломал что-то и не позаботился протестировать и исправить ошибку.

Кстати на счет вашей статистики - львиную долю занимают Messages - 400k токенов. Контекст безусловно важен, но если заставить llm сначала составить небольшой файлик в котором суммировать то, что должно быть сделано, то его можно и обрезать до 7-8 последних сообщений. И для модели и для вас сильно проще: 20 - 30 страниц ТЗ вместо 400к токенов чата, и расход токенов существенно меньше. (я понимаю, что вы используете ТЗ и файлы, которые нужны модели для разработки, в данном случае под ТЗ я скорее понимаю план изменения кода (что будет сделано, где, как, как протестировано и т.п.)

Но вообще, каждый выбирает инструмент, который удобен именно ему, так-что я ничего не навязываю, просто поделился любопытным наблюдением.

1

Информация

В рейтинге
219-й
Зарегистрирован
Активность