Pull to refresh
4
0,1
Rating
Send message

Текст идёт слева направо. Это одно измерение. Когда мы делаем таблицу от у нас появляется два измерения. Но ещё мы видим цвета. Поэтому таблица с цветами позволяет уже отображать три измерения спроецированные на двухмерную плоскость

да. промпт найти погоду и сгенерировать html. сгенерировано токенов 11324, скорость 124.9 t/s

На коротких промтах 27В выдает больше 100т/с на 5090 (MTP max = 3)

Кажется статью готовили месяца 2 назад. MTP уже давненько в основной ветке llama.cpp и для qwen и для gemma. Там и скорости побольше стало в tg и pp.

Небольшие модели для генерации видео и изображений это 20-80 млрд.

Нет никаких моделей ИИ меньше 1 млрд.

Меньше 1 млрд - это модели для распознавания текста, распознавания единичных слов.

На телефоне тупенькие модели 2 млрд можно запускать. Они могут написать бредовый текст. Или сделать суммаризацию.

Все нормальные маленькие модели это десятки млрд параметров. Тупенькие модели: Яндекс лайт 5 млрд. Гигачат лайт 30 млрд.

Открытые китайские маленькие модели 35 млрд.

Google Gemma 4 31 млрд.

Это минимально рабочие маленькие модели.

Китайские открытые модели аналоги Chatgpt 4 это модели размером 500-1000 млрд. Такие как раз используют внутри Яндекса, Сбера, Тбанка.

Deepseek R1, прошлогодний, 685млрд параметров. Его взяли за основу для сбер гигачата.

Есть. Diff называется

Не нашел в статье как автор использует Гермеса. Зачем-то описал настройки десктоп версии.

Также хочу отметить что агенту можно через чат написать какие настройки изменить и он это легко сделает, потому что у него такой скилл есть.

Ещё в телеграмме можно с каждой командой выводить использование контекста через команду /footer

Таких статей тут уже штук 5. Неужели вы думаете что ваша копипаста несёт какую-то ценность ?

Внутри одного кластера

P.S. локальные модели очень удобны в SRE/Devops задачах. На внешний LLM нельзя просто так отправить конфиги. Напротив, в локальную модель отправить конфиги со всеми секретами - безопасно. Все ConfigMap, DeploymentSet, etc из k8s и прочую SRE инфу ~30B модели достаточно хорошо обрабатывают.

На 5090 Gemma4 26B Q6_K/Qwen3.6 35B Q4_K_M влезает с полным контекстом 256К (без квантизации).

Скорость генерации начинается от 170 т/с - очень хорошая скорость для агентов. На 200К контекста скорость падает до 90 т/с.

Минимально умные модельки для агентов как раз начинаются в районе 30B. При наличии RAM, можно запускать гораздо большие MoE около 120B (20т/с) - это почти уровень GPT4.

У меня локальные модели в обычном применении заменяют 90% запросов (справка, суммаризация, анализ текста, перевод, простые программки, или когда код нельзя отправлять в сторонние сервисы). 10% приходится на платные через openrouter. Но я не обмазываюсь агентами openclaw/hermes/etc. Легкое использование opencode - для вайбкодинга элементарных вещей или нарисовать mermaid блок-схему неизвестного кода чтобы ускорить загрузку кода себе в голову.

Из минусов, хоть prompt processing легко переваливает за 1000 т/с, но т.к. все модели запускаются через llama.cpp и его форки, то поддержка часто сырая. Что приводит к тому что такие агенты как opencode/claude code/codex не совсем совместимы. Из-за несовместимости kv-кеш достаточно часто инвалидируется, а значит весь сеанс приходится пересчитывать. 100К контекста со скоростью prompt processing 1000 т/с занимает полторы минуты.

В общем не следует считать 5090 альтернативой, а только дополнением. После покупки 5090 где-то через месяц, два, три, захочется что-то типа RTX 6000 Blackwell.

Есть ещё дистилляция top tier моделей. Не дает ли это уменьшение перплексии для deepseek/mimo и иже с ними ?

Так суть статьи в том чтобы у агента был верный контекст. Много контекста - шум. Мало контекста - нет конкретики, модель будет делать наугад.

В Твиттере уже писали что бенчмарки, в частности swe-bench verified, не правильно выполнены. Модель видела историю гита и таким образом сжульничала.

Также другие тесты от пользователей показали что ей далеко до gpt 5.2, claude и других топовых моделей.

В windows 98 был active desktop.

В папках можно было сделать чтобы она отображалась как веб страница

Судя по наличию мобильных ОС.

Это скорее замена react native.

может тогда через docker model распространять

Как же вы заманали с этими дистилятами.

1
23 ...

Information

Rating
4,035-th
Location
Москва, Москва и Московская обл., Россия
Date of birth
Registered
Activity

Specialization

Backend Developer, System Administration
Lead
C#
Docker
CI/CD
SQL
Linux
RabbitMQ
Apache Kafka
Kubernetes
Redis
Elasticsearch