Ну это сложный вопрос, с одной стороны я наворачиваю как энтузиаст, а с другой стороны для оптимизации некоторых процессов свой организации если у меня все получится.
Зато быстро отвечает. Одна проблема что очень часто неправильно. Хотя на простые запросы может и истину сказануть. Но на простые вопросы неплохо отвечают модели которые можно запустить даже без GPU, ну медленней конечно.
Если да, то мне кажется запуск инференса на win платформе вообще малоперспективная задача, но это не утверждение, а только мое предположение.
Во вторых 16Гб видеопамяти возможно недостаточно для этой модели.
Нужно смотреть на то, какие ресурсы у ПК задействованы во время работы модели, в Linux это довольно просто, а в windows незнаю.
Скорее всего проблема в том что ваша видеокарта единственная в системе и часть ее видеопамяти уже занята системой для отображения на мониторе того что вы делаете.
В моей системе сейчас 2 видеокарты RTX4090 модернизированные китайцами до 48Gb видеопамяти в каждой и еще видеокарта процессора I9 которая выводит изображение на экран. Но я не пользуюсь экраном этого компьютера, так как подключаюсь к нему с рабочего ноутбука через сеть.
Вот так примерно выглядит мой состав видеоадаптеров
Ну, тут извините ничем не могу помочь, я публикую только свой опыт и на основе того что у меня есть, платформа AMD Ryzen AI Max+ 395 + 128гб меня не интересует, слишком мала для моих мечтаний. Я сейчас рассматриваю возможность заменить железо своего "сервера" на реальное серверное железо, а именно на amd threadripper pro 7965wx-7975wx. Но это весьма дорого и пока я сам с собой не договорился на эти затраты. );
Не переживайте, данную задачу не решил ни Гигачат ни GPTChat ни Grok
При чем Гигачат её не решил даже с четвертой попытки, GPT и Grok решили со второй, причем времени у них заняло более 3 минут. Ну это конечно понятно, к моей нейросети имеют доступ немного людей, а к этим Грокам сотни тысяч. Но факт в том что локальный запуск LLM намного эффективней.
Я никогда не делаю один прогон что бы что то утверждать.
Спасибо, попробую.
А железо планирую апгрейдить.
Ну это сложный вопрос, с одной стороны я наворачиваю как энтузиаст, а с другой стороны для оптимизации некоторых процессов свой организации если у меня все получится.
Установи ubunutu 24.04, все возможно станет быстрей
Ну я так и понял что ты запускаешь в винде, там все плохо.
Вот как у меня на линуксе работает с контекстом 130к и модель 120b
Если при инференсе на CPU то неудивительно
А как из этой таблицы понять ответ?
А толку от этой таблицы?
Где четкий ответ?
типа такого
А почему Грок не смог сказать проще?
И из этой кучи текста пока все равно не видно четкого ответа.
Извините, у вас много кавычек в ответе на комментарий, соберитесь и задайте свой вопрос грамотней.
Присылай фото своего паспорта в любом ракурсе, прогоню его через свою нейронку, вдруг она распознает.
краткая характеристика моего сервера:
Процессор Core I9 14900KF
RAM: DDR5 192 Gb.
GPU 2 x RTX4090D 48Gb (96 Гб. VRAM GDDR6X), производительность по меркам huggingface 166 TFLOPS
Эта Алиса тупая пока, как пробка.
Зато быстро отвечает. Одна проблема что очень часто неправильно. Хотя на простые запросы может и истину сказануть. Но на простые вопросы неплохо отвечают модели которые можно запустить даже без GPU, ну медленней конечно.
А решение то где?
Вы запускаете на windows?
Если да, то мне кажется запуск инференса на win платформе вообще малоперспективная задача, но это не утверждение, а только мое предположение.
Во вторых 16Гб видеопамяти возможно недостаточно для этой модели.
Нужно смотреть на то, какие ресурсы у ПК задействованы во время работы модели, в Linux это довольно просто, а в windows незнаю.
Скорее всего проблема в том что ваша видеокарта единственная в системе и часть ее видеопамяти уже занята системой для отображения на мониторе того что вы делаете.
В моей системе сейчас 2 видеокарты RTX4090 модернизированные китайцами до 48Gb видеопамяти в каждой и еще видеокарта процессора I9 которая выводит изображение на экран. Но я не пользуюсь экраном этого компьютера, так как подключаюсь к нему с рабочего ноутбука через сеть.
Вот так примерно выглядит мой состав видеоадаптеров
Например тексты с картинок taobao
Ну, тут извините ничем не могу помочь, я публикую только свой опыт и на основе того что у меня есть, платформа AMD Ryzen AI Max+ 395 + 128гб меня не интересует, слишком мала для моих мечтаний. Я сейчас рассматриваю возможность заменить железо своего "сервера" на реальное серверное железо, а именно на amd threadripper pro 7965wx-7975wx. Но это весьма дорого и пока я сам с собой не договорился на эти затраты. );
Вы создаете ответы с пустыми сообщениями.
Не переживайте, данную задачу не решил ни Гигачат ни GPTChat ни Grok
При чем Гигачат её не решил даже с четвертой попытки, GPT и Grok решили со второй, причем времени у них заняло более 3 минут. Ну это конечно понятно, к моей нейросети имеют доступ немного людей, а к этим Грокам сотни тысяч. Но факт в том что локальный запуск LLM намного эффективней.
В моей оболочке не так выглядит, но все настройки на максимум, если это вам поможет.