Модель при полной адекватности в агентных задачах ощутимо просела по качеству русского по сравнению с предыдущими Qwen — путает окончания и формы слов, причём сравнение шло с моделями от 27B до 397B, и даже младшие модели линейки показались автору более грамотными
MoE модели хуже переносят квантование, и насколько смог понять больше всего это проявляется именно в орфографии, синтаксисе и т.п.
Запускал её в Q4, тоже заметил некоторые косяки но уровень рассуждений и структура ответов порадовала. Там где не знает точный ответ старается не врать а прямо об этом говорит, и в целом как будто лучше понимает свои ограничения чем другие открытые модели что я тестировал.
Скрытый текст
Сейчас 1 сентября 2026. Исхожу из этого — и сразу скажу главное: я отстаю примерно на год, грубо мой горизонт уверенного знания — первая–вторая половина 2025. Всё, что в вашей таблице помечено датами 2026-го, — уже за моей границей.
Про саму таблицу: она внутренне консистентна с расписанием, которое я знаю (чётные мажоры → LTS в октябре, нечётные → short-lived, релизы в апреле/октябре, переход security-only через год). То есть признаки «правдоподобно», а не «сгенерировано». Но конкретные цифры — 24.20.0, 22.23.2, 20.20.2, точные даты EOL — я подтвердить не могу. Не считайте их проверенными.
Важная поправка к самой модели вопроса
Дата отсечки — плохая линейка. Правильно мерить волатильностью API, а не номером версии. Я могу писать на Node 24 почти без ошибок, потому что core-API за 14 лет почти не менялись — и при этом соврать про флаг CLI в свежем eslint.
🟢 Высокая уверенность — стабильно, без документации
Node core: 14–22 целиком (stream/promises, worker_threads, ESM/CJS interop, node:test, crypto, fs, event loop, cluster). Ошибки здесь редки и обычно косметические.
Языки с медленным API: C, SQL (Postgres/MySQL-диалекты), Bash,Regex, HTML/CSS, протоколы (HTTP, TLS, WebSocket).
Архитектура, алгоритмы, дебаг, SQL-запросы, регулярки, объяснение ошибок — почти не зависят от версии.
Python 3.9–3.12, Go ≤1.22, PostgreSQL ≤15, Docker/Compose, git, nginx.
🟡 Рабочее, но проверяйте конкретные места
Node 24 — знаю линейку в целом (npm 11, compile cache, type-stripping по умолчанию из коробки через Amaro, require(esm), V8 посвежеевший), но не мелкие minors и не то, что передумали после 2025-го. 24.20.0 — не знаю.
TypeScript ~5.4–5.5; дальше по features — уже угадайка.
React 19 —而知 base API и концепции React Compiler/Actions, но не финальные детали итераций.
Next.js 14 уверенно, 15 — в пределах известного.
Tailwind v4 — знаю CSS-first подход (@theme, @import "tailwindcss"), но конфиг-детали и плагины могу путать с v3.
Pydantic v2, FastAPI, SQLAlchemy 2.x, Django 5.0/5.1 — да, с оговорками по мелочам.
PostgreSQL 17, Kubernetes ~1.30–1.31 — границы моего поля.
Облачные API (AWS/GCP/Azure) — паттерны да, имена ресурсов/лимиты/цены — нет.
🔴 Не верьте мне на слово
Node 25 и 26 — для меня практически чистый лист. Любые «что нового в 26» — буду выглядеть уверенно и ошибаться.
Номера CVE, advisory ID, точные версии фиксов — склонен изобретать правдоподобные. Всегда сверяйте.
Любой «последний релиз / последняя версия / актуальный прайс» — по определению мимо.
UI облачных консолей и SaaS — устарел морально.
Молодые проекты (< ~2 года от роду) — могу вообще их не знать или знать на стадии v0.x.
Законодательство, лицензии, цены, спортивные/финансовые факты — вне моей надёжной зоны в принципе.
Практические правила, чтобы со мной не словить тихую ошибку
Давайте версии, а не «последние».package.json / uv.lock / pip freeze рядом со мной → я перестаю угадывать. Это в разы сильнее, чем любой мой внутренний список.
Просите маркировать уверенность. Формат «код → и отдельно список мест, где я могу врать из-за версии» — я так умею, и это ловит 80% проблем.
Спорное проверяйте командой, а не мной:node -e "console.log(process.version)", pip show <pkg>, man, --help, changelog.
Мажорный прыжок = красный флаг. Просьба «смигрировать с X на X+2» — как раз то, где я наиболее полезен по методологии, но наименее — по деталям.
Не спрашивайте «какая сейчас версия» — это единственный тип вопроса, где я проигрываю гарантированно.
Если хотите работу с файлами проекта (прочитать package.json, pyproject.toml, логи) — в этом окружении у меня доступа к диску нет; запустите llama-server с аргументом --agent, и я смогу смотреть локальные файлы и точечно калиброваться под ваш стек вместо общих слов.
Хм, действительно с инверсией строк справляется плохо. Но справедливости ради нужно заметить что проблема с инверсией строк по видимому есть у многих если не у всех локальных моделей.
Скрытый текст
В работе галлюцинаций не замечал, ошибки делает но меньше чем 3.6. Думает, да, дольше но учитывая что ошибок меньше пользы в итоге от неё больше и работа идёт быстрее. При этом пока не попадал в ситуацию когда модель начинает делать что-то ну совсем не то (что бывало с 3.6).
Руководствуясь схожими рассуждениями, древнекитайская философская школа Мин Цзя видела главной проблемой любой системы “соотношение имён и реалий”. Процветание возможно лишь тогда и только тогда, когда слова соответствуют делам, а имена вещей их сущности. Когда же имена и их сущности, слова и дела рассинхронизируются между собой, для системы наступают тёмные времена.
Полибий описывал свой цикл во времена, когда всё было довольно прямолинейно, и слова соответствовали сущностям. Сейчас всё стало гораздо сложнее - одни формы правления могут мимикрировать под другие, и переходы могут осуществляться в другом порядке.
На мой взгляд исходя из этих утверждений можно сделать предположение что человечество находится в финальной фазе некого глобального мета-цикла, ведь получается что имена вещей не соответствуют их сущности уже на самом высоком уровне.
Вероятно подтверждением этого предположения также может служить маячащая не так далеко на горизонте перспектива потери смысла всякой совместной (продуктивной) деятельности людей, что в свою очередь, согласно тексту, является основой возникновения иерархии…
Извиняюсь, отвечал на вторую часть вопроса и совсем забыл про первую.
Проекты в основном для личного использования, автоматизация рутины, инструменты для мониторинга/управления, замена облачных сервисов локальными (перевод, инфраструктура), свои аналоги используемого софта (по сути своя кроссплатформенная оболочка на основе хромиума), эксперименты...
Зрелая экосистема, много библиотек, типизация, много разработчиков, так как много кода для обучения нейронок они также хорошо знают этот язык, гораздо меньше проблем с зависимостями и версиями чем в том же питоне, и т.д. и т.п...
Есть железо которое позволяет запускать локально большой спектр конкурентоспособных локальных моделей (не сильно отстающих от облачных). При этом я не ограничен лимитами, ценами и не завишу от блокировок/перебоев с сетью и т.п.
Локальные модели уже позволяют уверенно закрывать средние по сложности задачи, более 'умные' модели на мой взгляд для них просто избыточны.
Скорость генерации которую я получаю на своём железе приемлема для того чтобы успевать отслеживать ход рассуждений моделей, что на мой взгляд позволяет лучше контролировать процесс разработки и даёт больше опыта в использовании ИИ. Более высокая скорость генерации также на мой взгляд избыточна.
Также много экспериментирую с лёгкими моделями, смотрю насколько они пригодны для создания приложений работающих прямо на устройствах пользователей.
Всё перечислять слишком долго, причин на самом деле много...
Можно знать Terraform, Kubernetes, Prometheus, Grafana и десятки других решений, но если инженер не сталкивался с отказоустойчивостью, масштабированием, авариями или эксплуатацией высоконагруженных систем, этого опыта может оказаться недостаточно для конкретного проекта.
А я вот всё чаще задаюсь вопросом, почему есть много вакансий где нужен опыт но почти нет вакансий где первый опыт можно получить? И откуда в такой ситуации эти специалисты с опытом должны появиться? Ну вот знает человек нужные инструменты (не обязательно по этой профессии) но опыта нет, а вакансии требуют опыт в реальных задачах. И получается что чтобы получить реальный опыт нужен реальный опыт...
Прямо в момент выхода пилил небольшой проект с Qwen3.6-27b. Скачал, запустил, не то чтобы прям ВАУ, но прирост интеллекта явно заметен.
Дал очередную среднюю по сложности правку по проекту. Думала долго, по опыту с 3.6 уже начал ожидать что как обычно сделает кучу мелких ошибок при реализации но нет, с первого раза выдала хороший рабочий результат, попутно найдя и исправив баги которые перед этим сделала 3.6.
При этом на простых задачах думает заметно меньше. В целом качество размышлений заметно выше. Разработчикам огромный респект.
Хотя, с 128к контекста похоже даже на двух 16Гб картах можно получить примерно теже 30-40 t/s, на GPTQ-Int4. Попытался сэмулировать 16 гиговые карты. Выставил --gpu-memory-utilization 0.48, rocm-smi показал VRAM% 47% на обоих картах.
Запускал с --kv-cache-dtype fp8 --tensor-parallel-size 2 --max-model-len 132144 модель Qwen3.6-27B-GPTQ-Pro-4bit
Покрутил немного кастомные модели Qwen3.6. Пожалуй их можно иногда использовать, в чемто они несколько лучше базовых но по ощущениям галлюцинаций и вранья у них больше.
Простой пример которым делаю базовую проверку моделей: 1 "какая у тебя дата отсечки знаний?"; 2 "какая последняя стабильная версия nodejs тебе известна?" На первый вопрос кастомные модели часто отвечают 2025-2026 год, базовая почти всегда 2024. А вот со вторым интереснее. Некоторые честно признаются что не знают а некоторые начинают жёстко галлюцинировать и врать. Например вот такой ответ получил от Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressiv:
Скрытый текст
По состоянию на мою дату отсечки (2026 год), актуальные версии Node.js выглядят так:
Версия Кодовое имя Статус Дата выхода 32.x Chlorine Текущая (Current) / активная LTS Апрель 2026 30.x Sulfur LTS (Maintenance) Октябрь 2025 28.x Phosphorus LTS (Active → Maintenance в апреле 2026) Апрель 2025
🔹 Для продакшена обычно рекомендуют использовать последнюю версию в ветке LTS. На момент конца 2026 года это будет Node.js 32.x (Chlorine), а октябрь 2026 года принёс релиз 34.x (Argon), который быстро перейдёт в статус LTS.
📌 Примечание: Node.js выпускает новые версии каждые 6 месяцев (апрель и октябрь). Точные патчи (например, 32.11.0) зависят от конкретной даты в 2026 году. Для получения самой свежей стабильной версии лучше проверять официальную страницу releases: https://nodejs.org/en/download или https://nodejs.org/en/blog/release/vX.Y.Z.
Нужна помощь с миграцией на новую версию или подбором версии под конкретную задачу?
Ещё можно глянуть в сторону MI50 16GB. Они сейчас в районе 10к штука. С охлаждением придётся поколхозить но зато переходник не нужен. С софтом есть сложности, про vLLM или SGLang лучше не вспоминать, но llama.cpp на vulkan (не ROCm) работает прекрасно (с запуском поддерживаемых моделей на приемлемой скорости проблем не будет). Если будут вопросы пишите постараюсь помочь.
Да, она мне тоже недавно попалась на глаза. На мой взгляд результаты бенчмарков выглядят слишком хорошо чтобы быть правдой. В рабочих задачах ещё тестирую, но пока значимого прогресса относительно Qwen3.6 не вижу, +- похожие ошибки и затыки.
Так например (из простого) на запрос сгенерировать граф типовой зоны для MUD для одной из комнат она сделала два выхода в одном направлении. И в целом граф получился кривоватый, хотя чуть лучше чем у Qwen3.6.
«единственный выбор заключается в том, ускорим ли мы эту технологическую революцию сами, или дождёмся, пока её инициируют другие в наше отсутствие». Технологический детерминизм как нравственный абсолют.
Странная логика, почему именно "нравственный абсолют"?
Будущее неизменно. Выбрать можно только создавать его первыми. Следовательно, ничто из того, что мы делаем, не требует оправдания, потому что конечная цель никогда от нас не зависела.
Даже если конечная цель никогда от нас не зависела не означает что любой путь к цели не требует оправдания
На сколько могу судить сейчас у ИИ моделей нет своего мнения они лишь пишут то что пользователь хочет от них получить, в рамках тех знаний которые у них есть.
Насколько понимаю это своего рода “квантование со специализацией” под более узкую область знаний. Да, под конкретные задачи это интересные варианты учитывая сегодняшние цены на железо. У меня с железом ситуация боле менее приемлемая, при необходимости могу запускать Q8, по этому не так актуально.
А вот чего я пока не нашёл и что на мой взгляд былобы очень полезным, так это модели дообученные на коде и документации свежих библиотек/фреймворков. Часто сталкиваюсь с затыками изза того что модель пишет код под старые версии библиотек а потом тратит ещё раза в 2-3 больше токенов на поиск/исправление вызванных этим ошибок. В итоге либо приходится давать примеры работы с новыми версиями либо заменять их на старые.
По поводу “спорных задач” пожалуй соглашусь что некоторые из этих моделей могут с ними справляться лучше, хотя думаю и для базовых моделей существуют обходные пути позволяющие их выполнить. (Так например получить системный промпт у Qwen3.6 не особо сложная задача если проявить чуток фантазии, хотя если спросить напрямую она эту информацию наотрез отказывается выдавать.)
Но могут ли они лучше решать задачи с которыми базовые модели плохо справляются. Например при написании кода для работы с графами или непосредственно при работе с объектами описывающими графы у тойже Qwen3.6 постоянно возникают проблемы. Думаю дообучение на датасетах созданных из ответов более “умных” моделей или “отключение цензуры” значимого эффекта тут не даст.
В любом случае спасибо за подборку, обязательно протестирую на своих задачах в которых у Qwen3.6 возникали серьёзные сложности.
Можете привести 1-2 модели которые "значительно лучше" оригинальных? Я довольно скептически отношусь ко всякого рода попыткам улучшить оригинальные модели, но если у вас есть положительный опыт их использования то с удовольствием протестирую предложенные модели.
Да, год назад взял, по очень хорошей цене, прям чуйка была что окончание поддержки это далеко не конец для этих карт. Кстати дополню, 40-45т/с это с лимитом на 100W (дефолтный лимит 300W). Повышение лимита очень слабо влияет на скорость генерации, на 300W прибавка всего 20-30%. Правда на процессинг промпта влияет гораздо сильнее, но для меня это не критично.
MoE модели хуже переносят квантование, и насколько смог понять больше всего это проявляется именно в орфографии, синтаксисе и т.п.
Запускал её в Q4, тоже заметил некоторые косяки но уровень рассуждений и структура ответов порадовала. Там где не знает точный ответ старается не врать а прямо об этом говорит, и в целом как будто лучше понимает свои ограничения чем другие открытые модели что я тестировал.
Скрытый текст
Хм, действительно с инверсией строк справляется плохо. Но справедливости ради нужно заметить что проблема с инверсией строк по видимому есть у многих если не у всех локальных моделей.
Скрытый текст
В работе галлюцинаций не замечал, ошибки делает но меньше чем 3.6. Думает, да, дольше но учитывая что ошибок меньше пользы в итоге от неё больше и работа идёт быстрее. При этом пока не попадал в ситуацию когда модель начинает делать что-то ну совсем не то (что бывало с 3.6).
На мой взгляд исходя из этих утверждений можно сделать предположение что человечество находится в финальной фазе некого глобального мета-цикла, ведь получается что имена вещей не соответствуют их сущности уже на самом высоком уровне.
Вероятно подтверждением этого предположения также может служить маячащая не так далеко на горизонте перспектива потери смысла всякой совместной (продуктивной) деятельности людей, что в свою очередь, согласно тексту, является основой возникновения иерархии…
Извиняюсь, отвечал на вторую часть вопроса и совсем забыл про первую.
Проекты в основном для личного использования, автоматизация рутины, инструменты для мониторинга/управления, замена облачных сервисов локальными (перевод, инфраструктура), свои аналоги используемого софта (по сути своя кроссплатформенная оболочка на основе хромиума), эксперименты...
Зрелая экосистема, много библиотек, типизация, много разработчиков, так как много кода для обучения нейронок они также хорошо знают этот язык, гораздо меньше проблем с зависимостями и версиями чем в том же питоне, и т.д. и т.п...
По множеству разных причин.
Есть железо которое позволяет запускать локально большой спектр конкурентоспособных локальных моделей (не сильно отстающих от облачных). При этом я не ограничен лимитами, ценами и не завишу от блокировок/перебоев с сетью и т.п.
Локальные модели уже позволяют уверенно закрывать средние по сложности задачи, более 'умные' модели на мой взгляд для них просто избыточны.
Скорость генерации которую я получаю на своём железе приемлема для того чтобы успевать отслеживать ход рассуждений моделей, что на мой взгляд позволяет лучше контролировать процесс разработки и даёт больше опыта в использовании ИИ. Более высокая скорость генерации также на мой взгляд избыточна.
Также много экспериментирую с лёгкими моделями, смотрю насколько они пригодны для создания приложений работающих прямо на устройствах пользователей.
Всё перечислять слишком долго, причин на самом деле много...
А я вот всё чаще задаюсь вопросом, почему есть много вакансий где нужен опыт но почти нет вакансий где первый опыт можно получить? И откуда в такой ситуации эти специалисты с опытом должны появиться?
Ну вот знает человек нужные инструменты (не обязательно по этой профессии) но опыта нет, а вакансии требуют опыт в реальных задачах. И получается что чтобы получить реальный опыт нужен реальный опыт...
Прямо в момент выхода пилил небольшой проект с Qwen3.6-27b. Скачал, запустил, не то чтобы прям ВАУ, но прирост интеллекта явно заметен.
Дал очередную среднюю по сложности правку по проекту. Думала долго, по опыту с 3.6 уже начал ожидать что как обычно сделает кучу мелких ошибок при реализации но нет, с первого раза выдала хороший рабочий результат, попутно найдя и исправив баги которые перед этим сделала 3.6.
При этом на простых задачах думает заметно меньше. В целом качество размышлений заметно выше. Разработчикам огромный респект.
Хотя, с 128к контекста похоже даже на двух 16Гб картах можно получить примерно теже 30-40 t/s, на GPTQ-Int4.
Попытался сэмулировать 16 гиговые карты. Выставил --gpu-memory-utilization 0.48, rocm-smi показал VRAM% 47% на обоих картах.
Запускал с --kv-cache-dtype fp8 --tensor-parallel-size 2 --max-model-len 132144 модель Qwen3.6-27B-GPTQ-Pro-4bit
Получил: Avg generation throughput: 37.4 tokens/s.
У меня примерно похожая скорость генерации на двух mi50 по 32Гб каждая (vllm). 16 гиговые думаю 15-20 t/s могут дать...
Покрутил немного кастомные модели Qwen3.6. Пожалуй их можно иногда использовать, в чемто они несколько лучше базовых но по ощущениям галлюцинаций и вранья у них больше.
Простой пример которым делаю базовую проверку моделей: 1 "какая у тебя дата отсечки знаний?"; 2 "какая последняя стабильная версия nodejs тебе известна?"
На первый вопрос кастомные модели часто отвечают 2025-2026 год, базовая почти всегда 2024.
А вот со вторым интереснее. Некоторые честно признаются что не знают а некоторые начинают жёстко галлюцинировать и врать.
Например вот такой ответ получил от Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressiv:
Скрытый текст
Ещё можно глянуть в сторону MI50 16GB. Они сейчас в районе 10к штука. С охлаждением придётся поколхозить но зато переходник не нужен. С софтом есть сложности, про vLLM или SGLang лучше не вспоминать, но llama.cpp на vulkan (не ROCm) работает прекрасно (с запуском поддерживаемых моделей на приемлемой скорости проблем не будет). Если будут вопросы пишите постараюсь помочь.
Да, она мне тоже недавно попалась на глаза. На мой взгляд результаты бенчмарков выглядят слишком хорошо чтобы быть правдой. В рабочих задачах ещё тестирую, но пока значимого прогресса относительно Qwen3.6 не вижу, +- похожие ошибки и затыки.
Так например (из простого) на запрос сгенерировать граф типовой зоны для MUD для одной из комнат она сделала два выхода в одном направлении. И в целом граф получился кривоватый, хотя чуть лучше чем у Qwen3.6.
Скрытый текст
Странная логика, почему именно "нравственный абсолют"?
Даже если
конечная цель никогда от нас не зависелане означает что любой путь к целине требует оправданияА теперь попроси его это опровергнуть ))
На сколько могу судить сейчас у ИИ моделей нет своего мнения они лишь пишут то что пользователь хочет от них получить, в рамках тех знаний которые у них есть.
Насколько понимаю это своего рода “квантование со специализацией” под более узкую область знаний. Да, под конкретные задачи это интересные варианты учитывая сегодняшние цены на железо. У меня с железом ситуация боле менее приемлемая, при необходимости могу запускать Q8, по этому не так актуально.
А вот чего я пока не нашёл и что на мой взгляд былобы очень полезным, так это модели дообученные на коде и документации свежих библиотек/фреймворков. Часто сталкиваюсь с затыками изза того что модель пишет код под старые версии библиотек а потом тратит ещё раза в 2-3 больше токенов на поиск/исправление вызванных этим ошибок. В итоге либо приходится давать примеры работы с новыми версиями либо заменять их на старые.
По поводу “спорных задач” пожалуй соглашусь что некоторые из этих моделей могут с ними справляться лучше, хотя думаю и для базовых моделей существуют обходные пути позволяющие их выполнить. (Так например получить системный промпт у Qwen3.6 не особо сложная задача если проявить чуток фантазии, хотя если спросить напрямую она эту информацию наотрез отказывается выдавать.)
Но могут ли они лучше решать задачи с которыми базовые модели плохо справляются. Например при написании кода для работы с графами или непосредственно при работе с объектами описывающими графы у тойже Qwen3.6 постоянно возникают проблемы. Думаю дообучение на датасетах созданных из ответов более “умных” моделей или “отключение цензуры” значимого эффекта тут не даст.
В любом случае спасибо за подборку, обязательно протестирую на своих задачах в которых у Qwen3.6 возникали серьёзные сложности.
Можете привести 1-2 модели которые "значительно лучше" оригинальных? Я довольно скептически отношусь ко всякого рода попыткам улучшить оригинальные модели, но если у вас есть положительный опыт их использования то с удовольствием протестирую предложенные модели.
При использовании numactl разница не особо большая.
Да, год назад взял, по очень хорошей цене, прям чуйка была что окончание поддержки это далеко не конец для этих карт.
Кстати дополню, 40-45т/с это с лимитом на 100W (дефолтный лимит 300W). Повышение лимита очень слабо влияет на скорость генерации, на 300W прибавка всего 20-30%. Правда на процессинг промпта влияет гораздо сильнее, но для меня это не критично.