Хм, действительно с инверсией строк справляется плохо. Но справедливости ради нужно заметить что проблема с инверсией строк по видимому есть у многих если не у всех локальных моделей.
Скрытый текст
В работе галлюцинаций не замечал, ошибки делает но меньше чем 3.6. Думает, да, дольше но учитывая что ошибок меньше пользы в итоге от неё больше и работа идёт быстрее. При этом пока не попадал в ситуацию когда модель начинает делать что-то ну совсем не то (что бывало с 3.6).
Руководствуясь схожими рассуждениями, древнекитайская философская школа Мин Цзя видела главной проблемой любой системы “соотношение имён и реалий”. Процветание возможно лишь тогда и только тогда, когда слова соответствуют делам, а имена вещей их сущности. Когда же имена и их сущности, слова и дела рассинхронизируются между собой, для системы наступают тёмные времена.
Полибий описывал свой цикл во времена, когда всё было довольно прямолинейно, и слова соответствовали сущностям. Сейчас всё стало гораздо сложнее - одни формы правления могут мимикрировать под другие, и переходы могут осуществляться в другом порядке.
На мой взгляд исходя из этих утверждений можно сделать предположение что человечество находится в финальной фазе некого глобального мета-цикла, ведь получается что имена вещей не соответствуют их сущности уже на самом высоком уровне.
Вероятно подтверждением этого предположения также может служить маячащая не так далеко на горизонте перспектива потери смысла всякой совместной (продуктивной) деятельности людей, что в свою очередь, согласно тексту, является основой возникновения иерархии…
Извиняюсь, отвечал на вторую часть вопроса и совсем забыл про первую.
Проекты в основном для личного использования, автоматизация рутины, инструменты для мониторинга/управления, замена облачных сервисов локальными (перевод, инфраструктура), свои аналоги используемого софта (по сути своя кроссплатформенная оболочка на основе хромиума), эксперименты...
Зрелая экосистема, много библиотек, типизация, много разработчиков, так как много кода для обучения нейронок они также хорошо знают этот язык, гораздо меньше проблем с зависимостями и версиями чем в том же питоне, и т.д. и т.п...
Есть железо которое позволяет запускать локально большой спектр конкурентоспособных локальных моделей (не сильно отстающих от облачных). При этом я не ограничен лимитами, ценами и не завишу от блокировок/перебоев с сетью и т.п.
Локальные модели уже позволяют уверенно закрывать средние по сложности задачи, более 'умные' модели на мой взгляд для них просто избыточны.
Скорость генерации которую я получаю на своём железе приемлема для того чтобы успевать отслеживать ход рассуждений моделей, что на мой взгляд позволяет лучше контролировать процесс разработки и даёт больше опыта в использовании ИИ. Более высокая скорость генерации также на мой взгляд избыточна.
Также много экспериментирую с лёгкими моделями, смотрю насколько они пригодны для создания приложений работающих прямо на устройствах пользователей.
Всё перечислять слишком долго, причин на самом деле много...
Можно знать Terraform, Kubernetes, Prometheus, Grafana и десятки других решений, но если инженер не сталкивался с отказоустойчивостью, масштабированием, авариями или эксплуатацией высоконагруженных систем, этого опыта может оказаться недостаточно для конкретного проекта.
А я вот всё чаще задаюсь вопросом, почему есть много вакансий где нужен опыт но почти нет вакансий где первый опыт можно получить? И откуда в такой ситуации эти специалисты с опытом должны появиться? Ну вот знает человек нужные инструменты (не обязательно по этой профессии) но опыта нет, а вакансии требуют опыт в реальных задачах. И получается что чтобы получить реальный опыт нужен реальный опыт...
Прямо в момент выхода пилил небольшой проект с Qwen3.6-27b. Скачал, запустил, не то чтобы прям ВАУ, но прирост интеллекта явно заметен.
Дал очередную среднюю по сложности правку по проекту. Думала долго, по опыту с 3.6 уже начал ожидать что как обычно сделает кучу мелких ошибок при реализации но нет, с первого раза выдала хороший рабочий результат, попутно найдя и исправив баги которые перед этим сделала 3.6.
При этом на простых задачах думает заметно меньше. В целом качество размышлений заметно выше. Разработчикам огромный респект.
Хотя, с 128к контекста похоже даже на двух 16Гб картах можно получить примерно теже 30-40 t/s, на GPTQ-Int4. Попытался сэмулировать 16 гиговые карты. Выставил --gpu-memory-utilization 0.48, rocm-smi показал VRAM% 47% на обоих картах.
Запускал с --kv-cache-dtype fp8 --tensor-parallel-size 2 --max-model-len 132144 модель Qwen3.6-27B-GPTQ-Pro-4bit
Покрутил немного кастомные модели Qwen3.6. Пожалуй их можно иногда использовать, в чемто они несколько лучше базовых но по ощущениям галлюцинаций и вранья у них больше.
Простой пример которым делаю базовую проверку моделей: 1 "какая у тебя дата отсечки знаний?"; 2 "какая последняя стабильная версия nodejs тебе известна?" На первый вопрос кастомные модели часто отвечают 2025-2026 год, базовая почти всегда 2024. А вот со вторым интереснее. Некоторые честно признаются что не знают а некоторые начинают жёстко галлюцинировать и врать. Например вот такой ответ получил от Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressiv:
Скрытый текст
По состоянию на мою дату отсечки (2026 год), актуальные версии Node.js выглядят так:
Версия Кодовое имя Статус Дата выхода 32.x Chlorine Текущая (Current) / активная LTS Апрель 2026 30.x Sulfur LTS (Maintenance) Октябрь 2025 28.x Phosphorus LTS (Active → Maintenance в апреле 2026) Апрель 2025
🔹 Для продакшена обычно рекомендуют использовать последнюю версию в ветке LTS. На момент конца 2026 года это будет Node.js 32.x (Chlorine), а октябрь 2026 года принёс релиз 34.x (Argon), который быстро перейдёт в статус LTS.
📌 Примечание: Node.js выпускает новые версии каждые 6 месяцев (апрель и октябрь). Точные патчи (например, 32.11.0) зависят от конкретной даты в 2026 году. Для получения самой свежей стабильной версии лучше проверять официальную страницу releases: https://nodejs.org/en/download или https://nodejs.org/en/blog/release/vX.Y.Z.
Нужна помощь с миграцией на новую версию или подбором версии под конкретную задачу?
Ещё можно глянуть в сторону MI50 16GB. Они сейчас в районе 10к штука. С охлаждением придётся поколхозить но зато переходник не нужен. С софтом есть сложности, про vLLM или SGLang лучше не вспоминать, но llama.cpp на vulkan (не ROCm) работает прекрасно (с запуском поддерживаемых моделей на приемлемой скорости проблем не будет). Если будут вопросы пишите постараюсь помочь.
Да, она мне тоже недавно попалась на глаза. На мой взгляд результаты бенчмарков выглядят слишком хорошо чтобы быть правдой. В рабочих задачах ещё тестирую, но пока значимого прогресса относительно Qwen3.6 не вижу, +- похожие ошибки и затыки.
Так например (из простого) на запрос сгенерировать граф типовой зоны для MUD для одной из комнат она сделала два выхода в одном направлении. И в целом граф получился кривоватый, хотя чуть лучше чем у Qwen3.6.
«единственный выбор заключается в том, ускорим ли мы эту технологическую революцию сами, или дождёмся, пока её инициируют другие в наше отсутствие». Технологический детерминизм как нравственный абсолют.
Странная логика, почему именно "нравственный абсолют"?
Будущее неизменно. Выбрать можно только создавать его первыми. Следовательно, ничто из того, что мы делаем, не требует оправдания, потому что конечная цель никогда от нас не зависела.
Даже если конечная цель никогда от нас не зависела не означает что любой путь к цели не требует оправдания
На сколько могу судить сейчас у ИИ моделей нет своего мнения они лишь пишут то что пользователь хочет от них получить, в рамках тех знаний которые у них есть.
Насколько понимаю это своего рода “квантование со специализацией” под более узкую область знаний. Да, под конкретные задачи это интересные варианты учитывая сегодняшние цены на железо. У меня с железом ситуация боле менее приемлемая, при необходимости могу запускать Q8, по этому не так актуально.
А вот чего я пока не нашёл и что на мой взгляд былобы очень полезным, так это модели дообученные на коде и документации свежих библиотек/фреймворков. Часто сталкиваюсь с затыками изза того что модель пишет код под старые версии библиотек а потом тратит ещё раза в 2-3 больше токенов на поиск/исправление вызванных этим ошибок. В итоге либо приходится давать примеры работы с новыми версиями либо заменять их на старые.
По поводу “спорных задач” пожалуй соглашусь что некоторые из этих моделей могут с ними справляться лучше, хотя думаю и для базовых моделей существуют обходные пути позволяющие их выполнить. (Так например получить системный промпт у Qwen3.6 не особо сложная задача если проявить чуток фантазии, хотя если спросить напрямую она эту информацию наотрез отказывается выдавать.)
Но могут ли они лучше решать задачи с которыми базовые модели плохо справляются. Например при написании кода для работы с графами или непосредственно при работе с объектами описывающими графы у тойже Qwen3.6 постоянно возникают проблемы. Думаю дообучение на датасетах созданных из ответов более “умных” моделей или “отключение цензуры” значимого эффекта тут не даст.
В любом случае спасибо за подборку, обязательно протестирую на своих задачах в которых у Qwen3.6 возникали серьёзные сложности.
Можете привести 1-2 модели которые "значительно лучше" оригинальных? Я довольно скептически отношусь ко всякого рода попыткам улучшить оригинальные модели, но если у вас есть положительный опыт их использования то с удовольствием протестирую предложенные модели.
Да, год назад взял, по очень хорошей цене, прям чуйка была что окончание поддержки это далеко не конец для этих карт. Кстати дополню, 40-45т/с это с лимитом на 100W (дефолтный лимит 300W). Повышение лимита очень слабо влияет на скорость генерации, на 300W прибавка всего 20-30%. Правда на процессинг промпта влияет гораздо сильнее, но для меня это не критично.
Добавлю свои 5 копеек, может кому пригодится. Согласен с некоторыми комментариями что Qwen 3.6-35B-A3B показывает себя заметно лучше чем Gemma 4 в написании кода с большим контекстом. И я думаю что это наверное первая модель которую действительно можно использовать в реальной работе на домашних сборках ПК. А вот по поводу минимум 16ГБ пожалуй не соглашусь. На мой взгляд на картах с 12ГБ вполне реально пользоваться Qwen 3.6-35B-A3B. На моей 3060 (12ГБ) эта модель выдаёт 35-20 т/с (вероятно зависит от того куда попали веса используемых экспертов) при `-c 131072 -ncmoe 28`. Также у меня есть MI50 (32ГБ), и я думаю это по прежнему хорошая карта, таже Qwen 3.6-35B-A3B выдаёт 40-45 т/с в сборке llama.cpp на vulkan. При этом нет необходимости ограничивать себя Q4 вариантом модели.
Хм, действительно с инверсией строк справляется плохо. Но справедливости ради нужно заметить что проблема с инверсией строк по видимому есть у многих если не у всех локальных моделей.
Скрытый текст
В работе галлюцинаций не замечал, ошибки делает но меньше чем 3.6. Думает, да, дольше но учитывая что ошибок меньше пользы в итоге от неё больше и работа идёт быстрее. При этом пока не попадал в ситуацию когда модель начинает делать что-то ну совсем не то (что бывало с 3.6).
На мой взгляд исходя из этих утверждений можно сделать предположение что человечество находится в финальной фазе некого глобального мета-цикла, ведь получается что имена вещей не соответствуют их сущности уже на самом высоком уровне.
Вероятно подтверждением этого предположения также может служить маячащая не так далеко на горизонте перспектива потери смысла всякой совместной (продуктивной) деятельности людей, что в свою очередь, согласно тексту, является основой возникновения иерархии…
Извиняюсь, отвечал на вторую часть вопроса и совсем забыл про первую.
Проекты в основном для личного использования, автоматизация рутины, инструменты для мониторинга/управления, замена облачных сервисов локальными (перевод, инфраструктура), свои аналоги используемого софта (по сути своя кроссплатформенная оболочка на основе хромиума), эксперименты...
Зрелая экосистема, много библиотек, типизация, много разработчиков, так как много кода для обучения нейронок они также хорошо знают этот язык, гораздо меньше проблем с зависимостями и версиями чем в том же питоне, и т.д. и т.п...
По множеству разных причин.
Есть железо которое позволяет запускать локально большой спектр конкурентоспособных локальных моделей (не сильно отстающих от облачных). При этом я не ограничен лимитами, ценами и не завишу от блокировок/перебоев с сетью и т.п.
Локальные модели уже позволяют уверенно закрывать средние по сложности задачи, более 'умные' модели на мой взгляд для них просто избыточны.
Скорость генерации которую я получаю на своём железе приемлема для того чтобы успевать отслеживать ход рассуждений моделей, что на мой взгляд позволяет лучше контролировать процесс разработки и даёт больше опыта в использовании ИИ. Более высокая скорость генерации также на мой взгляд избыточна.
Также много экспериментирую с лёгкими моделями, смотрю насколько они пригодны для создания приложений работающих прямо на устройствах пользователей.
Всё перечислять слишком долго, причин на самом деле много...
А я вот всё чаще задаюсь вопросом, почему есть много вакансий где нужен опыт но почти нет вакансий где первый опыт можно получить? И откуда в такой ситуации эти специалисты с опытом должны появиться?
Ну вот знает человек нужные инструменты (не обязательно по этой профессии) но опыта нет, а вакансии требуют опыт в реальных задачах. И получается что чтобы получить реальный опыт нужен реальный опыт...
Прямо в момент выхода пилил небольшой проект с Qwen3.6-27b. Скачал, запустил, не то чтобы прям ВАУ, но прирост интеллекта явно заметен.
Дал очередную среднюю по сложности правку по проекту. Думала долго, по опыту с 3.6 уже начал ожидать что как обычно сделает кучу мелких ошибок при реализации но нет, с первого раза выдала хороший рабочий результат, попутно найдя и исправив баги которые перед этим сделала 3.6.
При этом на простых задачах думает заметно меньше. В целом качество размышлений заметно выше. Разработчикам огромный респект.
Хотя, с 128к контекста похоже даже на двух 16Гб картах можно получить примерно теже 30-40 t/s, на GPTQ-Int4.
Попытался сэмулировать 16 гиговые карты. Выставил --gpu-memory-utilization 0.48, rocm-smi показал VRAM% 47% на обоих картах.
Запускал с --kv-cache-dtype fp8 --tensor-parallel-size 2 --max-model-len 132144 модель Qwen3.6-27B-GPTQ-Pro-4bit
Получил: Avg generation throughput: 37.4 tokens/s.
У меня примерно похожая скорость генерации на двух mi50 по 32Гб каждая (vllm). 16 гиговые думаю 15-20 t/s могут дать...
Покрутил немного кастомные модели Qwen3.6. Пожалуй их можно иногда использовать, в чемто они несколько лучше базовых но по ощущениям галлюцинаций и вранья у них больше.
Простой пример которым делаю базовую проверку моделей: 1 "какая у тебя дата отсечки знаний?"; 2 "какая последняя стабильная версия nodejs тебе известна?"
На первый вопрос кастомные модели часто отвечают 2025-2026 год, базовая почти всегда 2024.
А вот со вторым интереснее. Некоторые честно признаются что не знают а некоторые начинают жёстко галлюцинировать и врать.
Например вот такой ответ получил от Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressiv:
Скрытый текст
Ещё можно глянуть в сторону MI50 16GB. Они сейчас в районе 10к штука. С охлаждением придётся поколхозить но зато переходник не нужен. С софтом есть сложности, про vLLM или SGLang лучше не вспоминать, но llama.cpp на vulkan (не ROCm) работает прекрасно (с запуском поддерживаемых моделей на приемлемой скорости проблем не будет). Если будут вопросы пишите постараюсь помочь.
Да, она мне тоже недавно попалась на глаза. На мой взгляд результаты бенчмарков выглядят слишком хорошо чтобы быть правдой. В рабочих задачах ещё тестирую, но пока значимого прогресса относительно Qwen3.6 не вижу, +- похожие ошибки и затыки.
Так например (из простого) на запрос сгенерировать граф типовой зоны для MUD для одной из комнат она сделала два выхода в одном направлении. И в целом граф получился кривоватый, хотя чуть лучше чем у Qwen3.6.
Скрытый текст
Странная логика, почему именно "нравственный абсолют"?
Даже если
конечная цель никогда от нас не зависелане означает что любой путь к целине требует оправданияА теперь попроси его это опровергнуть ))
На сколько могу судить сейчас у ИИ моделей нет своего мнения они лишь пишут то что пользователь хочет от них получить, в рамках тех знаний которые у них есть.
Насколько понимаю это своего рода “квантование со специализацией” под более узкую область знаний. Да, под конкретные задачи это интересные варианты учитывая сегодняшние цены на железо. У меня с железом ситуация боле менее приемлемая, при необходимости могу запускать Q8, по этому не так актуально.
А вот чего я пока не нашёл и что на мой взгляд былобы очень полезным, так это модели дообученные на коде и документации свежих библиотек/фреймворков. Часто сталкиваюсь с затыками изза того что модель пишет код под старые версии библиотек а потом тратит ещё раза в 2-3 больше токенов на поиск/исправление вызванных этим ошибок. В итоге либо приходится давать примеры работы с новыми версиями либо заменять их на старые.
По поводу “спорных задач” пожалуй соглашусь что некоторые из этих моделей могут с ними справляться лучше, хотя думаю и для базовых моделей существуют обходные пути позволяющие их выполнить. (Так например получить системный промпт у Qwen3.6 не особо сложная задача если проявить чуток фантазии, хотя если спросить напрямую она эту информацию наотрез отказывается выдавать.)
Но могут ли они лучше решать задачи с которыми базовые модели плохо справляются. Например при написании кода для работы с графами или непосредственно при работе с объектами описывающими графы у тойже Qwen3.6 постоянно возникают проблемы. Думаю дообучение на датасетах созданных из ответов более “умных” моделей или “отключение цензуры” значимого эффекта тут не даст.
В любом случае спасибо за подборку, обязательно протестирую на своих задачах в которых у Qwen3.6 возникали серьёзные сложности.
Можете привести 1-2 модели которые "значительно лучше" оригинальных? Я довольно скептически отношусь ко всякого рода попыткам улучшить оригинальные модели, но если у вас есть положительный опыт их использования то с удовольствием протестирую предложенные модели.
При использовании numactl разница не особо большая.
Да, год назад взял, по очень хорошей цене, прям чуйка была что окончание поддержки это далеко не конец для этих карт.
Кстати дополню, 40-45т/с это с лимитом на 100W (дефолтный лимит 300W). Повышение лимита очень слабо влияет на скорость генерации, на 300W прибавка всего 20-30%. Правда на процессинг промпта влияет гораздо сильнее, но для меня это не критично.
Добавлю свои 5 копеек, может кому пригодится.
Согласен с некоторыми комментариями что Qwen 3.6-35B-A3B показывает себя заметно лучше чем Gemma 4 в написании кода с большим контекстом. И я думаю что это наверное первая модель которую действительно можно использовать в реальной работе на домашних сборках ПК.
А вот по поводу минимум 16ГБ пожалуй не соглашусь. На мой взгляд на картах с 12ГБ вполне реально пользоваться Qwen 3.6-35B-A3B. На моей 3060 (12ГБ) эта модель выдаёт 35-20 т/с (вероятно зависит от того куда попали веса используемых экспертов) при `-c 131072 -ncmoe 28`.
Также у меня есть MI50 (32ГБ), и я думаю это по прежнему хорошая карта, таже Qwen 3.6-35B-A3B выдаёт 40-45 т/с в сборке llama.cpp на vulkan. При этом нет необходимости ограничивать себя Q4 вариантом модели.