Но почему-то эти проблемы пытаются решить через технологии для текстовых ИИ.
Будь у таких разработчиков задача "создать текстовый редактор" тоже бы не справились. Ведь интерфейс и курсор текстового редактора тоже будут рисовать через трансформер. И конечно бы не хватило мощности.
Погенерировал через неё рассказы. По интересности DeepSeek уступает. До MiMo тоже далеко. Но технические ИИ превосходит. В общем не только нравоучения. Есть сюжет, без особых интриг.
Обозначу пометки по статье. Которые мне показались важными. На истину не претендую.
1) Так как обозначен vllm, предположу: сборка на видеокартах уровня одинарных или сдвоенных v100 с авито/wb/... Или что было модно и доступно годами ранее. Влияет на выбор модели. Возможно nvfp4 надо заменить на иное. Даже 5 бит иногда на малых моделях заметно лучше 4 бит. Хотя если есть набор rtx 5090 - то не актуально.
2) Раз сравнение cpu и gpu хотелось бы видеть упоминание гибридного запуска. Когда MOE модель тяжелая, но требования к видеопамяти 3-5 ГБ.
3) По записи
>>role: "You are a professional information provider specialized in technical troubleshooting and clear explanations."
Такого быть не должно. Срочно изучить промт инжиниринг. Желательно по полноценным книгам или курсам с живыми преподавателями и сокурсниками. А не газетным и новостным вырезкам с wow эффектами. Считаю самым важным пунктом.
4) модель gemma 4 - сложная. После замены на аналог вроде qwen возможно не потребуется так сильно ужимать вывод по temperature и top_k
Ну не знаю.
По тестам nebius swe-rebench модели туда сюда болтаются.
Может задачи со временем усложняются. И технически более простые, отваливаются. Например те что в конце 2025 года массово типы внимания поменяли.
А в остальном: вот GLM 5.1 обгоняет GLM 5.2
Странно это.
Был нормальный Epyc 4го поколения: 9654, 96 ядер, 384 МБ кеш памяти.
Потом был слегка срезанный Epyc 5го поколения: 9655, 96 ядер, 384 МБ кеш памяти
А теперь нет полноценного тяжелого процессора 9656, а текущий 9656, судя по повышенному кешу L3 - это отбраковка на легких ядрах
Какое-то натягивание совы на глобус.
Задачи банальные.
Но почему-то эти проблемы пытаются решить через технологии для текстовых ИИ.
Будь у таких разработчиков задача "создать текстовый редактор" тоже бы не справились. Ведь интерфейс и курсор текстового редактора тоже будут рисовать через трансформер. И конечно бы не хватило мощности.
Помню в 2012 ИИ обучал.
Рисование котеек по шаблону.
И ведь работало.
Раньше технари были нужны. А теперь мантра про всезаменяющий ИИ и вкатунов.
день фанатов сгенерировать операционную систему через ИИ.
Последнее предложение - это боль.
Ну да. Был момент: эксяндекс, nebius на проверке налетел. Последнюю строку по качеству занял.
Гуглится по kimi vendor verifier.
Главное чтобы Kimi выдавала качество.
А не снижение сложности ответов, как у gpt при нагрузке.
Или запретные темы у Антропика. Вроде: БУ! Кибербезопасность!
Это ограничение снизу. А что сверху?
Nokia хвалились 25G и 50G PON. Из Китая схожие новости. Но такие новости только пару раз в год вспоминают. И так уже лет 5.
Погенерировал через неё рассказы. По интересности DeepSeek уступает. До MiMo тоже далеко. Но технические ИИ превосходит. В общем не только нравоучения. Есть сюжет, без особых интриг.
https://longcat.chat/t
Есть подозрение, что единственная цель оригинальной статьи:
Продать can переходник с мониторчиком.
За 350-600 евро.
И в этом проблема. Заявляют о больших возможностях. А результатов - нет.
Подешевеет.
Это не первый скачек памяти.
Был с 1995 по 1996 года.
Нельзя долго удерживать цену.
Пусть сейчас скачек цен - липовый. А не настоящая нехватка памяти, как была в 90е.
В смысле сейчас мобилки 8ГБ/128ГБ в стартовом сегменте как стоили до 15 т.р., так и стоят.
Обозначу пометки по статье. Которые мне показались важными. На истину не претендую.
1) Так как обозначен vllm, предположу: сборка на видеокартах уровня одинарных или сдвоенных v100 с авито/wb/... Или что было модно и доступно годами ранее. Влияет на выбор модели. Возможно nvfp4 надо заменить на иное. Даже 5 бит иногда на малых моделях заметно лучше 4 бит. Хотя если есть набор rtx 5090 - то не актуально.
2) Раз сравнение cpu и gpu хотелось бы видеть упоминание гибридного запуска. Когда MOE модель тяжелая, но требования к видеопамяти 3-5 ГБ.
3) По записи
>>
role: "You are a professional information provider specialized in technical troubleshooting and clear explanations."Такого быть не должно. Срочно изучить промт инжиниринг. Желательно по полноценным книгам или курсам с живыми преподавателями и сокурсниками. А не газетным и новостным вырезкам с wow эффектами. Считаю самым важным пунктом.
4) модель gemma 4 - сложная. После замены на аналог вроде qwen возможно не потребуется так сильно ужимать вывод по temperature и top_k
Открытый вопрос понятен.
Думаю скоро изобретут github для математиков.
Где вместо фиатной валюты поддержки проекта. Вместо звезд и форков будет что-то понятное математикам.
Внимательно относитесь к инференсу.
Kimi проводит проверку инференса своих моделей. И компания Nebius показала не лучшие результаты.
В чем причина: не хватило компетенций или развернули квант - не в курсе.
Но исходя из того, что предоставляют не самые последние модели - скорее первое.
А так, если не смотреть на последние достижения. А скорее на базовые модели - то вполне есть.
И есть исключения. Например: Qwen 397B у многих получается развернуть.
Думаю зависть. А вообще поздравляю.
Сорвала первую статью о лучшей нейронке за год.
На ресурсе, почти полностью посвященном ИИ.
Если зайти в приложение Альфа-Банк. И оно не просит обновиться - значит что-то пошло не так.
Я вчера подписку взял. Хотя с осени не оплачивал. Потребовался deep research. И первое что вспомнил.