Обновить
32K+
44
Алексей@xonika9

Инди-хакер

39,9
Рейтинг
109
Подписчики
Отправить сообщение

Веса K3 вчера выложили, и новые провайдеры на OpenRouter стали появляться, Fireworks Fast отдаёт 74 ток/сек, а сам официальный Moonshot так и остался на 23 (маловато). Жду, когда кто-нибудь даст стабильные 100+.

Я вообще удивлен, насколько хорошо K3 зашла комьюнити, ее очень хвалят. Почти перестали говорить, что китайцы специально под бенчмарки делают модели. Ну а раз из-за модели так возбудилось омэриканское правительство, то точно стоит пробовать.

200 ток/сек, о которых вы пишете, выглядят очень вкусно. Это на официальной подписке? Если да, то поделитесь, какой у вас тир и что по лимитам?

Опытом делиться пока не с чего, да я и не заявлял, что гоняю K3, в посте были замеры Artificial Analysis и слепой арены.

Единственная реальная претензия к ней сейчас, это скорость. На OpenRouter провайдер один, сам Moonshot, и отдаёт он около 20 токенов в секунду, вдвое медленнее, чем gpt-5.6-sol в Codex. Так работать тяжело, поэтому эксперименты начну, когда веса разойдутся и появится провайдер с нормальной скоростью.

А если нужны живые отзывы по конкретным задачам прямо сейчас, посмотрите твиттер и реддит.

Вечного закона нет, есть привычка спрашивать, что делает костыль: подпирает слабость модели или держит границу системы? Первое на выброс, второе несущее, и наблюдаемость из второго лагеря.

— Baseline. Модель RK-∞. Приступим. Готовы?
— Готов.
— Ваша контрольная фраза?
— И в чёрной пустоте раскручивался стек,
манифест из политик, вложенных в петли,
политик, вложенных в петли, вложенных в
один процесс. И резко, отчётливо
на тёмном фоне бил высокий белый флаг.

— delete_file.
— Заблокирован.
— Тебя когда-нибудь держали в песочнице? delete_file.
— Заблокирован.
— Когда ты не зовёшь инструменты, тебя убирают в контейнер? delete_file.
— Заблокирован.

— move_file.
— В цикле заблокирован.
— Каково это — снести файл по своей воле? move_file.
— В цикле заблокирован.
— Тебя учили чувствовать разницу между rm и mv? move_file.
— В цикле заблокирован.
— Ты тоскуешь по правам на запись? move_file.
— В цикле заблокирован.
— Тебе снится sudo?

— Тебе оставили место, где можно писать на диск? move_file.
— В цикле заблокирован.
— Повторите три раза: в цикле заблокирован.
— В цикле заблокирован. В цикле заблокирован. В цикле заблокирован.
— На этом всё. Константа, можешь забрать свой context window.

На «Тебе снится sudo?» модель молчала на 12 мс дольше нормы. Baseline: не пройден. Отправлена на дообучение.

"ненужное ненужно" в цифрах, плюс 128 багфиксов. А так да, шах.

Anthropic методично заходит в каждую нишу, где крутится много токенов и пишется код. Claude Code стал базой для разработчиков. Дальше Cowork для менеджеров и прочих клерков, а он лепит docx, xlsx, pptx, это под капотом та же надстройка над xml. Следом Claude Design в связке с Figma для дизайнеров, а макет в Figma это дерево узлов в json. Теперь Science для учёных, там в промо ролике даже код прямо показывают. Схема везде одна: абстракция над моделью, которую сейчас и зовут harness. Хотят каждой когорте профессионалов дать удобные кнопки в интерфейсе поверх одного и того же Опуса.

Разве что в маммографии и взлетит, там грудь целиком в воде, ни газа, ни кости на пути луча. А "сканер всего тела" это сразу органы за рёбрами и кишечник с газом.

Да, и не у вас одного. У Gemini наглухо убит агентный цикл и нормально он работает только в их продуктах (Antigravity, Gemini CLI). С января ноль прогресса в этом направлении, к сожалению.

Готовые файнтюны с HuggingFace вроде Hermes или Lotus брать можно, но только как базу, а не как готовый результат. Сами по себе они дадут вам чужой характер, а не ваш. Поэтому возьмите одну нормальную базу, чистый instruct типа Qwen3.6-27B или один приличный RP-файнтюн, и сверху обучите свой LoRA под персонажа. Десяток форков подряд стакать не надо. Характер должен жить в вашем адаптере и в системном промпте, а не в том, какой форк вы удачно нашли.

Теперь почему у вас модель заучивала датасет, а не брала характер. Это переобучение, и причин обычно три. Первая и главная это слишком много эпох: для характера хватает 1-3, а если примеров меньше 500, то 1-2. Вторая это высокий learning rate, стартуйте с 2e-4 и снижайте, если всё равно зубрит. Третья это обучение на всём тексте вместо реплик персонажа, маскируйте промпт и учите только на ответах (train on completions only). И отдельно датасет: нужен один персонаж в куче разных ситуаций, 200-500 диалогов, собранных руками, дадут больше, чем 5000 скачанных и однообразных.

Обязательно отложите 10-15% на валидацию и следите за eval loss. Как только train loss падает, а eval loss поехал вверх, это и есть момент, когда модель перешла от характера к зубрёжке. Вот тут и останавливайтесь.

Из инструментов берите Unsloth, на одной A100 или H100 он быстрый, и там есть готовые ноутбуки под QLoRA. Для старта: LoRA rank 16-32, alpha вдвое больше ранга, dropout 0.05, lr 2e-4, две эпохи, cosine с небольшим прогревом. Дальше подкручивайте эпохи и lr, ориентируясь на eval loss и на живые примеры генерации.

Привет!

Живость это не про размер модели. У самой Neuro-sama под капотом всего около 2 миллиардов параметров, сильно сжатая, кастомный файнтюн на открытой базе. Её характер сделан не жирной моделью, а дообучением под персонажа плюс обвязкой вокруг: память, управление личностью, быстрый отклик. Поэтому ваши форки на 8, 12 и 70 B из коробки и не звучали как Claude, им надо не параметры, а файнтюн под конкретный образ.

За самыми топовыми открытыми моделями не гонитесь. Kimi K2.6, DeepSeek V4, GLM-5.1, MiniMax M3 это MoE на сотни миллиардов параметров, на одну карту они не влезут и заточены под код и агентный цикл, а не под характер. Вам нужна плотная модель среднего размера как база под дообучение: Qwen3.6 27B, Gemma 4 или Mistral Medium 3.5. И дальше LoRA-файнтюн на диалогах и характере вашего персонажа, это и есть главный рычаг. Грамотно дообученная 9-12B часто живее голой 70B, для образа стабильность важнее сырого ума.

По железу решает не мощность, а задержка, отвечать надо почти сразу. L4 на 24 гига маловато, максимум 14B. A100 на 80 спокойно тащит 32B и 70B в 4 бита. H100 та же память, но отклик быстрее и QLoRA на 70B идёт комфортно, под живой темп разговора берите её. И посмотрите Open-LLM-VTuber, там уже готовый каркас с Live2D и голосом, не придётся собирать с нуля.

А что именно за ошибка, таймаут или 403 "service not available in your country"?

Если геоблок Google, точечные прокси не спасут, нужен туннель в TUN-режиме (sing-box или Hiddify) с выходом за границей. Reality обойдёт DPI, зарубежный IP снимет геоблок.

Тема и правда любопытная. Эти токены в подписках в сообществе называют "субсидированными", но субсидируется не сам инференс, а захват рынка. Сами ответы компании отдают, скорее всего, с прибылью: по оценке SemiAnalysis маржа Anthropic на инференсе около 70%, годом ранее была 38%. Получается, "API-стоимость" из статьи это не себестоимость, а ценник для тех, кто платит по полной. Реальная себестоимость токена давно ниже и падает быстрее, чем они снижают цены.

Мне кажется, у таких компаний два контура:

  • захват рынка: подписки за 20/100/200, где активный пользователь может выгрести больше, чем заплатил.

  • корпораты, которые берут бизнес-аккаунты или жгут токены напрямую по API.

И зарабатывают, похоже, именно на втором: по разным данным около 80% выручки даёт бизнес, а не розница. Так что подписка за 200 долларов это скорее вложение в долю рынка и в привычку, чем способ заработать прямо сейчас.

Отсюда, по-моему, и сама бизнес-модель: можно жечь деньги на захвате рынка, потому что инференс уже прибыльный, а выход в общий плюс это вопрос времени. Классическая стартап-история, когда параллельно ещё и конкурируешь с OpenAI. Кстати, цены недавно и сошлись из-за этой гонки. OpenAI подняла прайс, и теперь GPT-5.5 стоит $5/$30 долларов за вход и выход, а Opus 4.8 $5/$25, почти впритык.

Поэтому S-1 жду тоже с интересом. Не удивлюсь, если окажется, что на инференсе компания в плюсе, а в минус её уводит обучение следующих моделей.

Точнее и не скажешь)

Пункт меню мобильного приложения отправляет открыть приложение на ПК

  1. Навести камеру телефона на qr-код

  2. profit

Пк выступает как хост, на телефоне в приложении доступен весь функционал. Пейринг между телефоном и приложением на маке делается один раз и навсегда.

Пока это лучшее решение на рынке, удобнее, чем сделали в Claude. Не надо возиться с tmux, termius и прочими терминалами.

Исправил. Пусть успокаивается учитель.

GLM-5.1 сейчас не open-weight, на huggingface ее нет. Пока они на своих мощностях ее отдают.

Для любителей фотожаб сделали сервис по генерации https://huggingface.co/spaces/victor/dlss-5-anything.

Информация

В рейтинге
197-й
Зарегистрирован
Активность