Текст идёт слева направо. Это одно измерение. Когда мы делаем таблицу от у нас появляется два измерения. Но ещё мы видим цвета. Поэтому таблица с цветами позволяет уже отображать три измерения спроецированные на двухмерную плоскость
P.S. локальные модели очень удобны в SRE/Devops задачах. На внешний LLM нельзя просто так отправить конфиги. Напротив, в локальную модель отправить конфиги со всеми секретами - безопасно. Все ConfigMap, DeploymentSet, etc из k8s и прочую SRE инфу ~30B модели достаточно хорошо обрабатывают.
На 5090 Gemma4 26B Q6_K/Qwen3.6 35B Q4_K_M влезает с полным контекстом 256К (без квантизации).
Скорость генерации начинается от 170 т/с - очень хорошая скорость для агентов. На 200К контекста скорость падает до 90 т/с.
Минимально умные модельки для агентов как раз начинаются в районе 30B. При наличии RAM, можно запускать гораздо большие MoE около 120B (20т/с) - это почти уровень GPT4.
У меня локальные модели в обычном применении заменяют 90% запросов (справка, суммаризация, анализ текста, перевод, простые программки, или когда код нельзя отправлять в сторонние сервисы). 10% приходится на платные через openrouter. Но я не обмазываюсь агентами openclaw/hermes/etc. Легкое использование opencode - для вайбкодинга элементарных вещей или нарисовать mermaid блок-схему неизвестного кода чтобы ускорить загрузку кода себе в голову.
Из минусов, хоть prompt processing легко переваливает за 1000 т/с, но т.к. все модели запускаются через llama.cpp и его форки, то поддержка часто сырая. Что приводит к тому что такие агенты как opencode/claude code/codex не совсем совместимы. Из-за несовместимости kv-кеш достаточно часто инвалидируется, а значит весь сеанс приходится пересчитывать. 100К контекста со скоростью prompt processing 1000 т/с занимает полторы минуты.
В общем не следует считать 5090 альтернативой, а только дополнением. После покупки 5090 где-то через месяц, два, три, захочется что-то типа RTX 6000 Blackwell.
Текст идёт слева направо. Это одно измерение. Когда мы делаем таблицу от у нас появляется два измерения. Но ещё мы видим цвета. Поэтому таблица с цветами позволяет уже отображать три измерения спроецированные на двухмерную плоскость
да. промпт найти погоду и сгенерировать html. сгенерировано токенов 11324, скорость 124.9 t/s
На коротких промтах 27В выдает больше 100т/с на 5090 (MTP max = 3)
Кажется статью готовили месяца 2 назад. MTP уже давненько в основной ветке llama.cpp и для qwen и для gemma. Там и скорости побольше стало в tg и pp.
Небольшие модели для генерации видео и изображений это 20-80 млрд.
Нет никаких моделей ИИ меньше 1 млрд.
Меньше 1 млрд - это модели для распознавания текста, распознавания единичных слов.
На телефоне тупенькие модели 2 млрд можно запускать. Они могут написать бредовый текст. Или сделать суммаризацию.
Все нормальные маленькие модели это десятки млрд параметров. Тупенькие модели: Яндекс лайт 5 млрд. Гигачат лайт 30 млрд.
Открытые китайские маленькие модели 35 млрд.
Google Gemma 4 31 млрд.
Это минимально рабочие маленькие модели.
Китайские открытые модели аналоги Chatgpt 4 это модели размером 500-1000 млрд. Такие как раз используют внутри Яндекса, Сбера, Тбанка.
Deepseek R1, прошлогодний, 685млрд параметров. Его взяли за основу для сбер гигачата.
Есть. Diff называется
Не нашел в статье как автор использует Гермеса. Зачем-то описал настройки десктоп версии.
Также хочу отметить что агенту можно через чат написать какие настройки изменить и он это легко сделает, потому что у него такой скилл есть.
Ещё в телеграмме можно с каждой командой выводить использование контекста через команду /footer
Таких статей тут уже штук 5. Неужели вы думаете что ваша копипаста несёт какую-то ценность ?
Внутри одного кластера
P.S. локальные модели очень удобны в SRE/Devops задачах. На внешний LLM нельзя просто так отправить конфиги. Напротив, в локальную модель отправить конфиги со всеми секретами - безопасно. Все ConfigMap, DeploymentSet, etc из k8s и прочую SRE инфу ~30B модели достаточно хорошо обрабатывают.
На 5090 Gemma4 26B Q6_K/Qwen3.6 35B Q4_K_M влезает с полным контекстом 256К (без квантизации).
Скорость генерации начинается от 170 т/с - очень хорошая скорость для агентов. На 200К контекста скорость падает до 90 т/с.
Минимально умные модельки для агентов как раз начинаются в районе 30B. При наличии RAM, можно запускать гораздо большие MoE около 120B (20т/с) - это почти уровень GPT4.
У меня локальные модели в обычном применении заменяют 90% запросов (справка, суммаризация, анализ текста, перевод, простые программки, или когда код нельзя отправлять в сторонние сервисы). 10% приходится на платные через openrouter. Но я не обмазываюсь агентами openclaw/hermes/etc. Легкое использование opencode - для вайбкодинга элементарных вещей или нарисовать mermaid блок-схему неизвестного кода чтобы ускорить загрузку кода себе в голову.
Из минусов, хоть prompt processing легко переваливает за 1000 т/с, но т.к. все модели запускаются через llama.cpp и его форки, то поддержка часто сырая. Что приводит к тому что такие агенты как opencode/claude code/codex не совсем совместимы. Из-за несовместимости kv-кеш достаточно часто инвалидируется, а значит весь сеанс приходится пересчитывать. 100К контекста со скоростью prompt processing 1000 т/с занимает полторы минуты.
В общем не следует считать 5090 альтернативой, а только дополнением. После покупки 5090 где-то через месяц, два, три, захочется что-то типа RTX 6000 Blackwell.
Есть ещё дистилляция top tier моделей. Не дает ли это уменьшение перплексии для deepseek/mimo и иже с ними ?
Так суть статьи в том чтобы у агента был верный контекст. Много контекста - шум. Мало контекста - нет конкретики, модель будет делать наугад.
В Твиттере уже писали что бенчмарки, в частности swe-bench verified, не правильно выполнены. Модель видела историю гита и таким образом сжульничала.
Также другие тесты от пользователей показали что ей далеко до gpt 5.2, claude и других топовых моделей.
В windows 98 был active desktop.
В папках можно было сделать чтобы она отображалась как веб страница
Места жрёт на 80, а скорость как на 13, круто.
Судя по наличию мобильных ОС.
Это скорее замена react native.
может тогда через docker model распространять
Как же вы заманали с этими дистилятами.