Pull to refresh
4
Константин@dkeiz

кастомный харнесс: https://github.com/dkeiz

0,2
Rating
Send message

а на что тогда ворчать?

вы ещё предложите человеку deepSWE бенч посмотреть.

в скуку это все перерастает, после нескольких недель общения предложения становятся слишком предсказуемыми.

Всякие руки и датчики и голосовые уже добавляли. Пока - вау эффект на недельку, потом скука, потом раздражение от уровня глупости или стоимости токенов.

крутить оставшиеся деньги тех кто купил подписку но не выжег все токены, очевидно же? Тут купил, там продал, складское в обороте.

так атропик маску платят за компьют в датацентрах

>Мы выявили девять учетных записей, связанных с этой группой; восемь из них использовались только для обычной фрилансерской работы, а не для разработки программного обеспечения, связанного с вооружением

Нашли аж 9 аккаунтов, один из которых писал прошивку для дронов. Ну это успех. Мифосом искали, или фейблом?

бенчмарки тут все относительны, интересно другое: 1) это первая n gram модель от deepseek; 2) миллион контекста помещается в <1гб памяти.

для понимания, у прошлой модели было 30гб памяти, а это определяет и скорость работы с контекстом и возможность нарастить контекст до 30млн в том же объеме. Вряд ли нативно модель сейчас такое потащит, но в следующем году нас могут ждать модельки по 10 лямов.

А ещё ассиметричный енкодер/декодер, но тут надо разбираться.

а до сотни контекста разогнать можно? так то рабочие показатели

так там активно 6b всего, такую активацию можно на серверных процессорах гонять.

Интересно это gpt генерировала или sonnet?
Сколько полезных действий, вместо примитивного ollama run, чтобы уже у модельки спросить как поставить llama.cpp со всеми mtp'шками

я так понимаю это первая большая модель с N-gram, очень интересно посмотреть что там у квена получилось. Раз выпустили - значит точно не хуже предыдущих моделей своего класса.

прикрутить mtp или dflash, получается от +50% до x4. Зачем вам MoE, когда есть mtp, который тот же мое, только модель активируется вся.

Что удивляет - они используют одну и ту же базовую модель/архитектуру, т.е. это по сути годовалый deepseek v3.2 с безумным пост-трейном.

И умудряются запихнуть все больше и больше знаний в одни и те же веса.

единственный плюс этих моделей для простых обывателей - они доступно free на опенроутере, т.е. при 10 баксах вы получаете 1000(?) апи запросов в сутки.
Ну или на прямую к нвидиа подключаться, если не из РФ.
Модельки забавные, но в кодинге были ужасными.

разрабы из opencode говорят что смогли повторить текущую цену v4 flash на арендованных в датацентрах железках. Говорит о многом.

видимо сбор датасетов и качество датасетов их устраивает. v4flash обновленный вышел шедевром.
Смогут поднять качество на v4pro - выставят ценник как положено.
v4flash легко хостится у сторонних провайдеров, за него можно не переживать.
В любом случае, сообществу важнее наличие качественной модели, чем её цена.

не только с разрешением но и длительностью, 5 секунд 768p будет делаться минуты 2.

Скачек DeepSWE 7.3 -> 54.4 это безумная сила файнтюна.
Радостно. Хотя даже у инженеров DeepSeek ушло больше полу года на дообучение небольшой модели. Ждем v4pro обгоняющий все 3T модели :)
Если что и deepseek v4flash и glm5.2 пока что доступны бесплатно у Cline, можете сами сравнить для себя.

1
23 ...

Information

Rating
3,010-th
Location
Чебоксары, Чувашия, Россия
Date of birth
Registered
Activity