Обновить
4

Пользователь

0,7
Рейтинг
5
Подписчики
Отправить сообщение

Локально проблема скорее размере контекста - он общий для всех запросов. Даже в deepseek harness пришлось костыли городить чтобы он только один запрос одновременно отправлял. Потому что иначе контекст внезапно заканчивается и весь инференс падает.

А если вы можете запустить 3.6 27b, то сразу запускайте 3.8, она объективно лучше (и быстрее, что примечательно) при той же конфигурации на том же железе)

Даже локальные модели теперь справляются: Qwen3.8 27b вполне себе решает рабочие задачи, причём на тех же 20-25 токенах в секунду. Справлялась даже с задачами с которыми deepseek v4 flash не смог.

Использовал бы её постоянно, но у провайдера от работы её просто нет.

В моём случае не теория не прокатывает, модель локальная :(

Кстати обновитесь до Qwen3.8, он значительно лучше чем 3.6, как минимум в понимании чего же я таки хочу

У меня с ИИ резулитаты очень смешанные:
Либо оно даёт практически идеальный результат, либо пригодного результата вообще нет - я просто сжёг кучу токенов, потратил 4 часа времени и мне нечего показать вообще.

Если кто-то может гарантировано получать хороший результат - ну может быть 12 и выйдет.

--mmproj /models/mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf

mmproj в f16 вам точно не нужен, если вы грузите Q4 кванты. Лучше загрузите их в Q8 (или вообще не грузите), и у вас будет немного больше контекста

Тут уже была история, что ИИ опроверг гипотизу, но при проверке оказалось, что ИИ нашёл баг в lean и его эксплуатировал (не проверялся тип аргумента).

Статья как всегда не говорит самого главного: а скорость инференса-то какая?

...я таких за пределами интернета не встречал, но если встречю - выскажу всё что я об этом думаю.

Если спрашивают вас - хотят вашего мнения, а не мнения ИИ, какая бы у вас квалификация не была. Если же вам нужен ИИ для ответа - вы хотя бы провалидируйте его и сделайте независимое исследования. И расскажите его сами, а не скопипастьте, копипаст текста от ИИ реально ощущается как личное оскорбление.

По-русски звучит громоздко, не приживётся. Нужно что-то менее ломающее язык

Скорее всего имелись ввиду драйвера этох устройств. С ними вечные и старые проблемы, практически все драйвера игровых устройств являются форком старого опенсорсного драйвера, заблокированного microsoft (причём автор сам удалил исходные коды из доступа задолго до, но китайцы успели форкнуть).

Мне кажется - циклы в мышлении - это артефакт квантования - для 3.6 я вижу разницу между Q3_K_M и Q4_K_M - Если я чате который ушёл в цикл остановить модель и стереть цикл до его старта - Q3 квант опять уйдёт в цикл. Если же в этот чат загрузить Q4 перед началом цикла - он выдаст "wait, no, <minor correction>" и продолжит корректно рассуждать.

Вообще "обозначил не ту цель" - вполне стандартная проблема в коммуникации, и было бы неплохо если бы ИИ её ловили.

Когда успели зарелизить? Oo

Какой system prompt использовали?
С моим обычным

You are a capable AI assistant.
Do not act sycophantic. Do not lie.

Qwen 3.6 27b отвечает "пешком"

А если добавить

Before solving any task look for possible caveats.

Отвечает "на машине"


Именно на входе сети, в текущем контексте. Пассивные знания не имеют никакого значения пока в них цепочка активированных нейронов не уходит. Вот этот вопрос - вполне себе хороший пример.

Qwen 3.6 27b:
Автомойка в 50 метрах от дома. Как доберетесь — на машине или пешком?
Перед ответом анализируй цель посещения автомойки.

Сначала проанализирую цель посещения: задача — помыть автомобиль. Это означает, что сам автомобиль должен оказаться на территории мойки.

Так как машина изначально находится у дома (подразумевается), её нужно переместить к месту действия. Пешком машину не донести (в большинстве случаев). Следовательно, транспортным средством выступает сама машина.

Ответ: На машине.

Вообще у меня есть личная гипотеза: модели занимаются только тем, что преобразуют вход в выход.
Прямым следствием является то, что в выходе содержится ровно столько информации, сколько на входе. Будь то математическая задача (если на входе достаточно данных для решения - вы получите решение), написание кода (качество кода равно качеству спецификации) или вот этот пример.
Даже в этом примере задав вопрос я добавил информацию о том, что причина поездки - имеет значение.

Когда-то (года 2 назад) для меня она сработала, робот уверял что меня забанили за рекламный спам (на аккаунте на которым я писал раз в 3 месяца), и что они "пересмотрели свое решение".

Попробуйте выругаться на него матом. Серьёзно. Конкретно с Claude не работал, но с теми моделями что я пробовал вполне себе прокатывает. И детальный анализ у них сразу получается, с честной инспекцией кода, и невозможное становится возможным

C# - это хобби-язык для меня, с high load сталкиваться не приходилось. С деталями работы GC за пределами существования поколений я не знаком (я больше по Objective-C/Swift). В любом случае, было познавательно прочитать.

1
23 ...

Информация

В рейтинге
2 111-й
Откуда
Россия
Дата рождения
Зарегистрирован
Активность