Единственное что я понял - пробовать надо на моделях-аналогах до 1B. А лучше четверть B. Чем меньше, тем лучше. Я сам с диффузионными графическими flux не работал.
Сам хоть как-то освоился с базовым запуском тестовых ии, когда перестал скачивать монстров. Чтобы просто понять, что это такое и как я могу приспособить. Число проверок гипотез за час резко выросло.
Все ИИ материалы полны выдумывания монстров. И героического сражения с ними.
И ведь тебе не только модель нужна. А весь стек с AUTOMATIC1111 или что там сейчас актуально для обработки изображений.
В общем я на малолитражке в бездорожье не лезу. А по твоему вопросу вижу набор гипотез про "flux", "fp8", "gguf", "windows". Которые можно тестировать не выходя за пределы пары ГБ видеопамяти.
Да. Быстрее и 8 бит квантов. И более плотного квантования. Связываю с нативной поддержкой epyc 9004 формата BF16. Хотя точную причину не знаю. Просто накачал qwen 0.8B и потестировал в ik_llama.cpp. И потом ещё пару gguf qwen 3.5 a3b. В 8 и 16 бит. И опять 16 бит был быстрее в среднем процентов на 10. Обсуждаемую memory wall не встречал. А что по расходу памяти: мне не важно. Что 35ГБ, что 70. Хотя будь оборудование от Nvidia - возможно все было иначе.
Всухую обыгрывала fable и подобных. Воспринималась почти как нормальное творчество. Даже MiMo обходила, с его ставкой на философию.
А сейчас попросил написать историю про девушку в Питере эту новую V4. А там какая-то Марго. И по качеству типичный нейрослоп уровня уже указанного антропика. Получилась очередная упрощённая STEM модель.
Хуже только чатгпт с его постоянными нотациями и текстами как под копирку.
Но почему-то эти проблемы пытаются решить через технологии для текстовых ИИ.
Будь у таких разработчиков задача "создать текстовый редактор" тоже бы не справились. Ведь интерфейс и курсор текстового редактора тоже будут рисовать через трансформер. И конечно бы не хватило мощности.
Хотя может кто ИИ профессионально изучал.
Возник вопрос. Хоть я и отрицательно отношусь к трансформерам в автопилотах. Имеет ли смысл переводить аналог Qwen-drive-1.0 на looped transformer?
Не. Норм лепили. Но сильно не вкладывались. Вот looped transformer из 2025 от ByteDance
https://huggingface.co/ByteDance/Ouro-2.6B
Единственное что я понял - пробовать надо на моделях-аналогах до 1B. А лучше четверть B. Чем меньше, тем лучше. Я сам с диффузионными графическими flux не работал.
Сам хоть как-то освоился с базовым запуском тестовых ии, когда перестал скачивать монстров. Чтобы просто понять, что это такое и как я могу приспособить. Число проверок гипотез за час резко выросло.
Все ИИ материалы полны выдумывания монстров. И героического сражения с ними.
И ведь тебе не только модель нужна. А весь стек с AUTOMATIC1111 или что там сейчас актуально для обработки изображений.
В общем я на малолитражке в бездорожье не лезу. А по твоему вопросу вижу набор гипотез про "flux", "fp8", "gguf", "windows". Которые можно тестировать не выходя за пределы пары ГБ видеопамяти.
Да. Быстрее и 8 бит квантов. И более плотного квантования. Связываю с нативной поддержкой epyc 9004 формата BF16. Хотя точную причину не знаю. Просто накачал qwen 0.8B и потестировал в ik_llama.cpp. И потом ещё пару gguf qwen 3.5 a3b. В 8 и 16 бит. И опять 16 бит был быстрее в среднем процентов на 10. Обсуждаемую memory wall не встречал. А что по расходу памяти: мне не важно. Что 35ГБ, что 70. Хотя будь оборудование от Nvidia - возможно все было иначе.
Мало. Но сейчас смотрю как аналог текущей настроенной Qwen 3.5 35 a3b bf16. А у неё за пределами 60к не очень. У меня epyc 192ГБ, а не nvl72.
Кто тестировал 5, 6 бит кванты? Как на запросах в 30-60к контекста в программировании?
Есть интерес запустить на 192 ГБ памяти. Но с моими возможностями по скачиванию - 160 ГБ данных - несколько дней займет. Поэтому вопрос.
Забавно. 7 терабит.
Скорость примерно как nvlink у nvidia b200. В обе стороны 1.8 ТБайт/сек или 0.9*8=7.2 терабит/сек
Грустно это.
Первая V4 была сильна в рассказах.
Всухую обыгрывала fable и подобных. Воспринималась почти как нормальное творчество. Даже MiMo обходила, с его ставкой на философию.
А сейчас попросил написать историю про девушку в Питере эту новую V4. А там какая-то Марго. И по качеству типичный нейрослоп уровня уже указанного антропика. Получилась очередная упрощённая STEM модель.
Хуже только чатгпт с его постоянными нотациями и текстами как под копирку.
Лет 12 назад знание PMBoK наизусть в youtube продвигали.
Как требование для должности.
Или это про другую должность?
Судя по PaperBench, CharXiv и LVBench получился аналитик-бумагописатель.
У Кими вроде тоже скидки во второй половине дня по Московскому времени
Ну не знаю.
По тестам nebius swe-rebench модели туда сюда болтаются.
Может задачи со временем усложняются. И технически более простые, отваливаются. Например те что в конце 2025 года массово типы внимания поменяли.
А в остальном: вот GLM 5.1 обгоняет GLM 5.2
Странно это.
Был нормальный Epyc 4го поколения: 9654, 96 ядер, 384 МБ кеш памяти.
Потом был слегка срезанный Epyc 5го поколения: 9655, 96 ядер, 384 МБ кеш памяти
А теперь нет полноценного тяжелого процессора 9656, а текущий 9656, судя по повышенному кешу L3 - это отбраковка на легких ядрах
Какое-то натягивание совы на глобус.
Задачи банальные.
Но почему-то эти проблемы пытаются решить через технологии для текстовых ИИ.
Будь у таких разработчиков задача "создать текстовый редактор" тоже бы не справились. Ведь интерфейс и курсор текстового редактора тоже будут рисовать через трансформер. И конечно бы не хватило мощности.
Помню в 2012 ИИ обучал.
Рисование котеек по шаблону.
И ведь работало.
Раньше технари были нужны. А теперь мантра про всезаменяющий ИИ и вкатунов.
день фанатов сгенерировать операционную систему через ИИ.
Последнее предложение - это боль.
Ну да. Был момент: эксяндекс, nebius на проверке налетел. Последнюю строку по качеству занял.
Гуглится по kimi vendor verifier.
Главное чтобы Kimi выдавала качество.
А не снижение сложности ответов, как у gpt при нагрузке.
Или запретные темы у Антропика. Вроде: БУ! Кибербезопасность!