Почему? Мне нравится, что они занялись развитием инфраструктуры, чтобы мы, пользователи, глубже в неё влезали и не могли безболезненно переходить на другие продукты.
Спасибо, что прошли опрос и написали. Анкету мы в первую очередь делали для сотрудников российских компаний. Работающие за рубежом и самозанятые тоже могут её пройти, хотя под их ситуации она заточена меньше. Если вспомните, на каком вопросе потерялась логика, подскажите - посмотрим.
У вас порог компактинга в Claude Code стоит дефолтный, 1М? У меня `"CLAUDE_CODE_AUTO_COMPACT_WINDOW": "375000"` и достаточно стабильно работает, мне нравится.
А я все чаще замечаю, как на ответ Astra можно написать "Нет, это не так", а она в ответ "Да, ты прав, это не так". Получается yes man :)
Там два уровня, и в статье я их схлопнул. У конкретной проверки FAIL означает "отработала, артефакта нет", а NOT_PROVEN — "саму проверку или её доказательство нельзя считать надёжными". Но итог всей задачи в обоих случаях будет NOT_PROVEN: поставить COMPLETE Менеджер не может. Новый смысловой круг тратится на FAIL, а сбой проверки уходит в отдельное восстановление инфраструктуры; при неопределённом запуске повтор вообще запрещён до сверки.
Веса K3 вчера выложили, и новые провайдеры на OpenRouter стали появляться, Fireworks Fast отдаёт 74 ток/сек, а сам официальный Moonshot так и остался на 23 (маловато). Жду, когда кто-нибудь даст стабильные 100+.
Я вообще удивлен, насколько хорошо K3 зашла комьюнити, ее очень хвалят. Почти перестали говорить, что китайцы специально под бенчмарки делают модели. Ну а раз из-за модели так возбудилось омэриканское правительство, то точно стоит пробовать.
200 ток/сек, о которых вы пишете, выглядят очень вкусно. Это на официальной подписке? Если да, то поделитесь, какой у вас тир и что по лимитам?
Опытом делиться пока не с чего, да я и не заявлял, что гоняю K3, в посте были замеры Artificial Analysis и слепой арены.
Единственная реальная претензия к ней сейчас, это скорость. На OpenRouter провайдер один, сам Moonshot, и отдаёт он около 20 токенов в секунду, вдвое медленнее, чем gpt-5.6-sol в Codex. Так работать тяжело, поэтому эксперименты начну, когда веса разойдутся и появится провайдер с нормальной скоростью.
А если нужны живые отзывы по конкретным задачам прямо сейчас, посмотрите твиттер и реддит.
Вечного закона нет, есть привычка спрашивать, что делает костыль: подпирает слабость модели или держит границу системы? Первое на выброс, второе несущее, и наблюдаемость из второго лагеря.
— Baseline. Модель RK-∞. Приступим. Готовы? — Готов. — Ваша контрольная фраза? — И в чёрной пустоте раскручивался стек, манифест из политик, вложенных в петли, политик, вложенных в петли, вложенных в один процесс. И резко, отчётливо на тёмном фоне бил высокий белый флаг.
— delete_file. — Заблокирован. — Тебя когда-нибудь держали в песочнице? delete_file. — Заблокирован. — Когда ты не зовёшь инструменты, тебя убирают в контейнер? delete_file. — Заблокирован.
— move_file. — В цикле заблокирован. — Каково это — снести файл по своей воле? move_file. — В цикле заблокирован. — Тебя учили чувствовать разницу между rm и mv? move_file. — В цикле заблокирован. — Ты тоскуешь по правам на запись? move_file. — В цикле заблокирован. — Тебе снится sudo?
— Тебе оставили место, где можно писать на диск? move_file. — В цикле заблокирован. — Повторите три раза: в цикле заблокирован. — В цикле заблокирован. В цикле заблокирован. В цикле заблокирован. — На этом всё. Константа, можешь забрать свой context window.
На «Тебе снится sudo?» модель молчала на 12 мс дольше нормы. Baseline: не пройден. Отправлена на дообучение.
Anthropic методично заходит в каждую нишу, где крутится много токенов и пишется код. Claude Code стал базой для разработчиков. Дальше Cowork для менеджеров и прочих клерков, а он лепит docx, xlsx, pptx, это под капотом та же надстройка над xml. Следом Claude Design в связке с Figma для дизайнеров, а макет в Figma это дерево узлов в json. Теперь Science для учёных, там в промо ролике даже код прямо показывают. Схема везде одна: абстракция над моделью, которую сейчас и зовут harness. Хотят каждой когорте профессионалов дать удобные кнопки в интерфейсе поверх одного и того же Опуса.
Разве что в маммографии и взлетит, там грудь целиком в воде, ни газа, ни кости на пути луча. А "сканер всего тела" это сразу органы за рёбрами и кишечник с газом.
Да, и не у вас одного. У Gemini наглухо убит агентный цикл и нормально он работает только в их продуктах (Antigravity, Gemini CLI). С января ноль прогресса в этом направлении, к сожалению.
Готовые файнтюны с HuggingFace вроде Hermes или Lotus брать можно, но только как базу, а не как готовый результат. Сами по себе они дадут вам чужой характер, а не ваш. Поэтому возьмите одну нормальную базу, чистый instruct типа Qwen3.6-27B или один приличный RP-файнтюн, и сверху обучите свой LoRA под персонажа. Десяток форков подряд стакать не надо. Характер должен жить в вашем адаптере и в системном промпте, а не в том, какой форк вы удачно нашли.
Теперь почему у вас модель заучивала датасет, а не брала характер. Это переобучение, и причин обычно три. Первая и главная это слишком много эпох: для характера хватает 1-3, а если примеров меньше 500, то 1-2. Вторая это высокий learning rate, стартуйте с 2e-4 и снижайте, если всё равно зубрит. Третья это обучение на всём тексте вместо реплик персонажа, маскируйте промпт и учите только на ответах (train on completions only). И отдельно датасет: нужен один персонаж в куче разных ситуаций, 200-500 диалогов, собранных руками, дадут больше, чем 5000 скачанных и однообразных.
Обязательно отложите 10-15% на валидацию и следите за eval loss. Как только train loss падает, а eval loss поехал вверх, это и есть момент, когда модель перешла от характера к зубрёжке. Вот тут и останавливайтесь.
Из инструментов берите Unsloth, на одной A100 или H100 он быстрый, и там есть готовые ноутбуки под QLoRA. Для старта: LoRA rank 16-32, alpha вдвое больше ранга, dropout 0.05, lr 2e-4, две эпохи, cosine с небольшим прогревом. Дальше подкручивайте эпохи и lr, ориентируясь на eval loss и на живые примеры генерации.
Живость это не про размер модели. У самой Neuro-sama под капотом всего около 2 миллиардов параметров, сильно сжатая, кастомный файнтюн на открытой базе. Её характер сделан не жирной моделью, а дообучением под персонажа плюс обвязкой вокруг: память, управление личностью, быстрый отклик. Поэтому ваши форки на 8, 12 и 70 B из коробки и не звучали как Claude, им надо не параметры, а файнтюн под конкретный образ.
За самыми топовыми открытыми моделями не гонитесь. Kimi K2.6, DeepSeek V4, GLM-5.1, MiniMax M3 это MoE на сотни миллиардов параметров, на одну карту они не влезут и заточены под код и агентный цикл, а не под характер. Вам нужна плотная модель среднего размера как база под дообучение: Qwen3.6 27B, Gemma 4 или Mistral Medium 3.5. И дальше LoRA-файнтюн на диалогах и характере вашего персонажа, это и есть главный рычаг. Грамотно дообученная 9-12B часто живее голой 70B, для образа стабильность важнее сырого ума.
По железу решает не мощность, а задержка, отвечать надо почти сразу. L4 на 24 гига маловато, максимум 14B. A100 на 80 спокойно тащит 32B и 70B в 4 бита. H100 та же память, но отклик быстрее и QLoRA на 70B идёт комфортно, под живой темп разговора берите её. И посмотрите Open-LLM-VTuber, там уже готовый каркас с Live2D и голосом, не придётся собирать с нуля.
А что именно за ошибка, таймаут или 403 "service not available in your country"?
Если геоблок Google, точечные прокси не спасут, нужен туннель в TUN-режиме (sing-box или Hiddify) с выходом за границей. Reality обойдёт DPI, зарубежный IP снимет геоблок.
Почему? Мне нравится, что они занялись развитием инфраструктуры, чтобы мы, пользователи, глубже в неё влезали и не могли безболезненно переходить на другие продукты.
Спасибо, что прошли опрос и написали. Анкету мы в первую очередь делали для сотрудников российских компаний. Работающие за рубежом и самозанятые тоже могут её пройти, хотя под их ситуации она заточена меньше. Если вспомните, на каком вопросе потерялась логика, подскажите - посмотрим.
Следом обязательно проверьте Jev на кружке без дна и спросите, идти ли пешком в автосервис
У меня есть скилл, который может помочь. Отлично работает как с GPT, Claude, так и с open-weight моделями, во всех харнессах.
Тесты на каждый чих еще с gpt 5.5 начались и в Sol были. Там как будто переобучение на TDD.
О, да! Мы с Солом постоянно пишем код и тесты так, будто наш заказчик это Пентагон
У вас порог компактинга в Claude Code стоит дефолтный, 1М? У меня `"CLAUDE_CODE_AUTO_COMPACT_WINDOW": "375000"` и достаточно стабильно работает, мне нравится.
А я все чаще замечаю, как на ответ Astra можно написать "Нет, это не так", а она в ответ "Да, ты прав, это не так". Получается yes man :)
Спасибо, стараемся)
Там два уровня, и в статье я их схлопнул. У конкретной проверки
FAILозначает "отработала, артефакта нет", аNOT_PROVEN— "саму проверку или её доказательство нельзя считать надёжными". Но итог всей задачи в обоих случаях будетNOT_PROVEN: поставитьCOMPLETEМенеджер не может. Новый смысловой круг тратится наFAIL, а сбой проверки уходит в отдельное восстановление инфраструктуры; при неопределённом запуске повтор вообще запрещён до сверки.Веса K3 вчера выложили, и новые провайдеры на OpenRouter стали появляться, Fireworks Fast отдаёт 74 ток/сек, а сам официальный Moonshot так и остался на 23 (маловато). Жду, когда кто-нибудь даст стабильные 100+.
Я вообще удивлен, насколько хорошо K3 зашла комьюнити, ее очень хвалят. Почти перестали говорить, что китайцы специально под бенчмарки делают модели. Ну а раз из-за модели так возбудилось омэриканское правительство, то точно стоит пробовать.
200 ток/сек, о которых вы пишете, выглядят очень вкусно. Это на официальной подписке? Если да, то поделитесь, какой у вас тир и что по лимитам?
Опытом делиться пока не с чего, да я и не заявлял, что гоняю K3, в посте были замеры Artificial Analysis и слепой арены.
Единственная реальная претензия к ней сейчас, это скорость. На OpenRouter провайдер один, сам Moonshot, и отдаёт он около 20 токенов в секунду, вдвое медленнее, чем gpt-5.6-sol в Codex. Так работать тяжело, поэтому эксперименты начну, когда веса разойдутся и появится провайдер с нормальной скоростью.
А если нужны живые отзывы по конкретным задачам прямо сейчас, посмотрите твиттер и реддит.
Вечного закона нет, есть привычка спрашивать, что делает костыль: подпирает слабость модели или держит границу системы? Первое на выброс, второе несущее, и наблюдаемость из второго лагеря.
— Baseline. Модель RK-∞. Приступим. Готовы?
— Готов.
— Ваша контрольная фраза?
— И в чёрной пустоте раскручивался стек,
манифест из политик, вложенных в петли,
политик, вложенных в петли, вложенных в
один процесс. И резко, отчётливо
на тёмном фоне бил высокий белый флаг.
— delete_file.
— Заблокирован.
— Тебя когда-нибудь держали в песочнице? delete_file.
— Заблокирован.
— Когда ты не зовёшь инструменты, тебя убирают в контейнер? delete_file.
— Заблокирован.
— move_file.
— В цикле заблокирован.
— Каково это — снести файл по своей воле? move_file.
— В цикле заблокирован.
— Тебя учили чувствовать разницу между rm и mv? move_file.
— В цикле заблокирован.
— Ты тоскуешь по правам на запись? move_file.
— В цикле заблокирован.
— Тебе снится sudo?
— Тебе оставили место, где можно писать на диск? move_file.
— В цикле заблокирован.
— Повторите три раза: в цикле заблокирован.
— В цикле заблокирован. В цикле заблокирован. В цикле заблокирован.
— На этом всё. Константа, можешь забрать свой context window.
На «Тебе снится sudo?» модель молчала на 12 мс дольше нормы. Baseline: не пройден. Отправлена на дообучение.
"ненужное ненужно" в цифрах, плюс 128 багфиксов. А так да, шах.
Anthropic методично заходит в каждую нишу, где крутится много токенов и пишется код. Claude Code стал базой для разработчиков. Дальше Cowork для менеджеров и прочих клерков, а он лепит docx, xlsx, pptx, это под капотом та же надстройка над xml. Следом Claude Design в связке с Figma для дизайнеров, а макет в Figma это дерево узлов в json. Теперь Science для учёных, там в промо ролике даже код прямо показывают. Схема везде одна: абстракция над моделью, которую сейчас и зовут harness. Хотят каждой когорте профессионалов дать удобные кнопки в интерфейсе поверх одного и того же Опуса.
Разве что в маммографии и взлетит, там грудь целиком в воде, ни газа, ни кости на пути луча. А "сканер всего тела" это сразу органы за рёбрами и кишечник с газом.
Да, и не у вас одного. У Gemini наглухо убит агентный цикл и нормально он работает только в их продуктах (Antigravity, Gemini CLI). С января ноль прогресса в этом направлении, к сожалению.
Готовые файнтюны с HuggingFace вроде Hermes или Lotus брать можно, но только как базу, а не как готовый результат. Сами по себе они дадут вам чужой характер, а не ваш. Поэтому возьмите одну нормальную базу, чистый instruct типа Qwen3.6-27B или один приличный RP-файнтюн, и сверху обучите свой LoRA под персонажа. Десяток форков подряд стакать не надо. Характер должен жить в вашем адаптере и в системном промпте, а не в том, какой форк вы удачно нашли.
Теперь почему у вас модель заучивала датасет, а не брала характер. Это переобучение, и причин обычно три. Первая и главная это слишком много эпох: для характера хватает 1-3, а если примеров меньше 500, то 1-2. Вторая это высокий learning rate, стартуйте с 2e-4 и снижайте, если всё равно зубрит. Третья это обучение на всём тексте вместо реплик персонажа, маскируйте промпт и учите только на ответах (train on completions only). И отдельно датасет: нужен один персонаж в куче разных ситуаций, 200-500 диалогов, собранных руками, дадут больше, чем 5000 скачанных и однообразных.
Обязательно отложите 10-15% на валидацию и следите за eval loss. Как только train loss падает, а eval loss поехал вверх, это и есть момент, когда модель перешла от характера к зубрёжке. Вот тут и останавливайтесь.
Из инструментов берите Unsloth, на одной A100 или H100 он быстрый, и там есть готовые ноутбуки под QLoRA. Для старта: LoRA rank 16-32, alpha вдвое больше ранга, dropout 0.05, lr 2e-4, две эпохи, cosine с небольшим прогревом. Дальше подкручивайте эпохи и lr, ориентируясь на eval loss и на живые примеры генерации.
Привет!
Живость это не про размер модели. У самой Neuro-sama под капотом всего около 2 миллиардов параметров, сильно сжатая, кастомный файнтюн на открытой базе. Её характер сделан не жирной моделью, а дообучением под персонажа плюс обвязкой вокруг: память, управление личностью, быстрый отклик. Поэтому ваши форки на 8, 12 и 70 B из коробки и не звучали как Claude, им надо не параметры, а файнтюн под конкретный образ.
За самыми топовыми открытыми моделями не гонитесь. Kimi K2.6, DeepSeek V4, GLM-5.1, MiniMax M3 это MoE на сотни миллиардов параметров, на одну карту они не влезут и заточены под код и агентный цикл, а не под характер. Вам нужна плотная модель среднего размера как база под дообучение: Qwen3.6 27B, Gemma 4 или Mistral Medium 3.5. И дальше LoRA-файнтюн на диалогах и характере вашего персонажа, это и есть главный рычаг. Грамотно дообученная 9-12B часто живее голой 70B, для образа стабильность важнее сырого ума.
По железу решает не мощность, а задержка, отвечать надо почти сразу. L4 на 24 гига маловато, максимум 14B. A100 на 80 спокойно тащит 32B и 70B в 4 бита. H100 та же память, но отклик быстрее и QLoRA на 70B идёт комфортно, под живой темп разговора берите её. И посмотрите Open-LLM-VTuber, там уже готовый каркас с Live2D и голосом, не придётся собирать с нуля.
А что именно за ошибка, таймаут или 403 "service not available in your country"?
Если геоблок Google, точечные прокси не спасут, нужен туннель в TUN-режиме (sing-box или Hiddify) с выходом за границей. Reality обойдёт DPI, зарубежный IP снимет геоблок.