В продолжение обсуждения Qwen3.8 решил проверить её не только на обычных промптах, но и в агентском режиме — когда модель сама читает файлы, ищет информацию, меняет код или данные, запускает тесты и решает, когда работу можно закончить. С помощью Claude собран фиксированный корпус из 15 задач трёх уровней сложности (L1, L2, L3). Были обычные исправления кода, работа с несколькими файлами, ложные подсказки, ошибки инструментов, ограничения на изменение файлов, последовательные вычисления и задачи, где вообще ничего исправлять не нужно — надо это понять и вовремя остановиться. Тесты выполнялись на DGX Spark (Ubuntu 24.04, NVIDIA GB10, ARM64) через OpenAI-совместимые vLLM endpoint’ы. Qwen3.8 в отдельном контейнере - модель unsloth/Qwen3.8-27B-NVFP4 max-model-len=32768, max-num-seqs=1, gpu-memory-utilization=0.55, max-num-batched-tokens=8192. Native MTP был включён через --speculative-config {“method”:“mtp”,“num_speculative_tokens”:1}. Qwen3.6 в контейнере - unsloth/Qwen3.6-35B-A3B-NVFP4-Fast, tensor-parallel-size=1, max-model-len=262144, max-num-seqs=4, gpu-memory-utilization=0.40, max-num-batched-tokens=8192. Также был включён MTP, но с двумя speculative tokens, а также prefix caching. В обоих контейнерах использовалась сборка vLLM 0.26.1rc1.dev18+gd223c900d, квантование NVFP4 в формате compressed-tensors, FP8 KV-cache, FlashInfer attention backend и fastsafetensors. У агента было 11 простых tools: чтение и поиск файлов, работа с JSON/CSV, запись файлов, запуск тестов, просмотр ошибок и diff и т.д. Сначала сравнивается Qwen3.8-27B-NVFP4 + MTP и Qwen3.6-35B-A3B-NVFP4 при temperature=0 и включённом thinking:
3.8 прошла всё, но оказалась почти в 7 раз медленнее. Единственная ошибка 3.6 была интересной: код уже был правильным, тесты проходили, но модель продолжила искать проблему, внесла ненужное изменение и зациклилась. После этого повторен весь тест с отключённым thinking (reasoning_effort=none):
здесь результат весьма неожиданный - Qwen3.6 без thinking стала одновременно быстрее и лучше: 15/15, ошибочная задача теперь решалась нормально: проверить код → запустить тест → убедиться, что всё хорошо → закончить. Qwen3.8 без thinking ускорилась почти в 5 раз, но получила одну ошибку. Причём не на самой сложной задаче. Ошибка возникла в простой последовательной арифметике: нужно было применить к значению несколько операций и записать результат 1079.0. Модель записывала неправильное число, хотя в финальном тексте потом сама правильно вычисляла 1079.0.
Затем попробовал короткий reasoning:
Budget Результат Первый write Время
64 3/3 PASS ошибка → исправила 59 с
128 0/3 FAIL ошибка 50 с
256 3/3 PASS сразу правильно 82 с
unlimited PASS сразу правильно 79 с
OFF FAIL ошибка 25 с
256 reasoning tokens уже достаточно для правильного вычисления, но по времени выигрыша нет. Ещё один отдельный результат: MTP у Qwen3.8 оказался полезен — скорость выросла примерно с 10,5 до 15,6–17,2 tok/s
Если есть интерес - подробные описания тестов, исходники и результаты могу куда-нибудь выложить.
Чем больше я на всё это смотрю, то всё больше убеждаюсь что секта скрама/аджайла со всеми своими псевдорелигиозными догматами и иерархией успешно пожирает сама себя. И да, эта система, как кона есть, должна умереть.
Нет, это ублюдочная полусектанская иерархия
когда я вижу “Джунам” - моя рука непроизвольно нащупывает парабеллум
В продолжение обсуждения Qwen3.8 решил проверить её не только на обычных промптах, но и в агентском режиме — когда модель сама читает файлы, ищет информацию, меняет код или данные, запускает тесты и решает, когда работу можно закончить. С помощью Claude собран фиксированный корпус из 15 задач трёх уровней сложности (L1, L2, L3). Были обычные исправления кода, работа с несколькими файлами, ложные подсказки, ошибки инструментов, ограничения на изменение файлов, последовательные вычисления и задачи, где вообще ничего исправлять не нужно — надо это понять и вовремя остановиться. Тесты выполнялись на DGX Spark (Ubuntu 24.04, NVIDIA GB10, ARM64) через OpenAI-совместимые vLLM endpoint’ы. Qwen3.8 в отдельном контейнере - модель
unsloth/Qwen3.8-27B-NVFP4 max-model-len=32768, max-num-seqs=1, gpu-memory-utilization=0.55, max-num-batched-tokens=8192. Native MTP был включён через --speculative-config {“method”:“mtp”,“num_speculative_tokens”:1}. Qwen3.6 в контейнере - unsloth/Qwen3.6-35B-A3B-NVFP4-Fast, tensor-parallel-size=1, max-model-len=262144, max-num-seqs=4, gpu-memory-utilization=0.40, max-num-batched-tokens=8192. Также был включён MTP, но с двумя speculative tokens, а также prefix caching. В обоих контейнерах использовалась сборка vLLM0.26.1rc1.dev18+gd223c900d, квантование NVFP4 в форматеcompressed-tensors, FP8 KV-cache, FlashInfer attention backend и fastsafetensors. У агента было 11 простых tools: чтение и поиск файлов, работа с JSON/CSV, запись файлов, запуск тестов, просмотр ошибок и diff и т.д. Сначала сравнивается Qwen3.8-27B-NVFP4 + MTP и Qwen3.6-35B-A3B-NVFP4 при temperature=0 и включённом thinking:3.8 прошла всё, но оказалась почти в 7 раз медленнее. Единственная ошибка 3.6 была интересной: код уже был правильным, тесты проходили, но модель продолжила искать проблему, внесла ненужное изменение и зациклилась. После этого повторен весь тест с отключённым thinking (reasoning_effort=none):
здесь результат весьма неожиданный - Qwen3.6 без thinking стала одновременно быстрее и лучше: 15/15, ошибочная задача теперь решалась нормально: проверить код → запустить тест → убедиться, что всё хорошо → закончить. Qwen3.8 без thinking ускорилась почти в 5 раз, но получила одну ошибку. Причём не на самой сложной задаче. Ошибка возникла в простой последовательной арифметике: нужно было применить к значению несколько операций и записать результат 1079.0. Модель записывала неправильное число, хотя в финальном тексте потом сама правильно вычисляла 1079.0.
Затем попробовал короткий reasoning:
256 reasoning tokens уже достаточно для правильного вычисления, но по времени выигрыша нет. Ещё один отдельный результат: MTP у Qwen3.8 оказался полезен — скорость выросла примерно с 10,5 до 15,6–17,2 tok/s
Если есть интерес - подробные описания тестов, исходники и результаты могу куда-нибудь выложить.
Чем больше я на всё это смотрю, то всё больше убеждаюсь что секта скрама/аджайла со всеми своими псевдорелигиозными догматами и иерархией успешно пожирает сама себя. И да, эта система, как кона есть, должна умереть.
никто не будет выпаивать сгоревший и впаивать новый конденсатор. и даже вентилятор