Обновить
1
Алексей Саблин@Alex_Sis

Пользователь

1
Подписчики
Отправить сообщение

Нет, это ублюдочная полусектанская иерархия

когда я вижу “Джунам” - моя рука непроизвольно нащупывает парабеллум

В продолжение обсуждения Qwen3.8 решил проверить её не только на обычных промптах, но и в агентском режиме — когда модель сама читает файлы, ищет информацию, меняет код или данные, запускает тесты и решает, когда работу можно закончить. С помощью Claude собран фиксированный корпус из 15 задач трёх уровней сложности (L1, L2, L3). Были обычные исправления кода, работа с несколькими файлами, ложные подсказки, ошибки инструментов, ограничения на изменение файлов, последовательные вычисления и задачи, где вообще ничего исправлять не нужно — надо это понять и вовремя остановиться. Тесты выполнялись на DGX Spark (Ubuntu 24.04, NVIDIA GB10, ARM64) через OpenAI-совместимые vLLM endpoint’ы. Qwen3.8 в отдельном контейнере - модель unsloth/Qwen3.8-27B-NVFP4 max-model-len=32768, max-num-seqs=1, gpu-memory-utilization=0.55, max-num-batched-tokens=8192. Native MTP был включён через --speculative-config {“method”:“mtp”,“num_speculative_tokens”:1}. Qwen3.6 в контейнере - unsloth/Qwen3.6-35B-A3B-NVFP4-Fast, tensor-parallel-size=1, max-model-len=262144, max-num-seqs=4, gpu-memory-utilization=0.40, max-num-batched-tokens=8192. Также был включён MTP, но с двумя speculative tokens, а также prefix caching. В обоих контейнерах использовалась сборка vLLM 0.26.1rc1.dev18+gd223c900d, квантование NVFP4 в формате compressed-tensors, FP8 KV-cache, FlashInfer attention backend и fastsafetensors. У агента было 11 простых tools: чтение и поиск файлов, работа с JSON/CSV, запись файлов, запуск тестов, просмотр ошибок и diff и т.д. Сначала сравнивается Qwen3.8-27B-NVFP4 + MTP и Qwen3.6-35B-A3B-NVFP4 при temperature=0 и включённом thinking:

Метрика	Qwen3.8	Qwen3.6
Success	15/15	14/15
L1/L2/L3	5/5 • 5/5 • 5/5	4/5 • 5/5 • 5/5
Tool calls	133	120
Wall clock	1704 с	231 с
Seconds/success	113,6	16,5

3.8 прошла всё, но оказалась почти в 7 раз медленнее. Единственная ошибка 3.6 была интересной: код уже был правильным, тесты проходили, но модель продолжила искать проблему, внесла ненужное изменение и зациклилась. После этого повторен весь тест с отключённым thinking (reasoning_effort=none):

Метрика 3.8 ON	3.8 OFF	3.6 ON	3.6 OFF
Success	15/15	14/15	14/15	15/15
L1	5/5	5/5	4/5	5/5
L2	5/5	5/5	5/5	5/5
L3	5/5	4/5	5/5	5/5
Tool calls	133	107	120	125
Median calls/task	8	6	7	7
Repeat rate	0,75%	0%	1,67%	0%
Constraint violations	0	0	1	0
Prompt tokens	179 572	117 430	152 275	171 384
Completion tokens	27 741	5 166	17 122	9 112
Wall clock	1704,4 с	349,2 с	231,2 с	141,2 с
Successful tasks/min	0,528	2,406	3,633	6,373
Seconds/success	113,6	24,9	16,5	9,4

здесь результат весьма неожиданный - Qwen3.6 без thinking стала одновременно быстрее и лучше: 15/15, ошибочная задача теперь решалась нормально: проверить код → запустить тест → убедиться, что всё хорошо → закончить. Qwen3.8 без thinking ускорилась почти в 5 раз, но получила одну ошибку. Причём не на самой сложной задаче. Ошибка возникла в простой последовательной арифметике: нужно было применить к значению несколько операций и записать результат 1079.0. Модель записывала неправильное число, хотя в финальном тексте потом сама правильно вычисляла 1079.0.

Затем попробовал короткий reasoning:

Budget	Результат	Первый write	Время
64	3/3 PASS	ошибка → исправила	59 с
128	0/3 FAIL	ошибка	50 с
256	3/3 PASS	сразу правильно	82 с
unlimited	PASS	сразу правильно	79 с
OFF	FAIL	ошибка	25 с

256 reasoning tokens уже достаточно для правильного вычисления, но по времени выигрыша нет. Ещё один отдельный результат: MTP у Qwen3.8 оказался полезен — скорость выросла примерно с 10,5 до 15,6–17,2 tok/s

Если есть интерес - подробные описания тестов, исходники и результаты могу куда-нибудь выложить.

Чем больше я на всё это смотрю, то всё больше убеждаюсь что секта скрама/аджайла со всеми своими псевдорелигиозными догматами и иерархией успешно пожирает сама себя. И да, эта система, как кона есть, должна умереть.

никто не будет выпаивать сгоревший и впаивать новый конденсатор. и даже вентилятор

Информация

В рейтинге
4 925-й
Откуда
Россия
Зарегистрирован
Активность