Комментарии 17
И все-таки есть ощущение, что это был тест ради теста. С практическим-то применением что в итоге? Имеет смысл на "1080 Ti на 11 ГБ" поставленную в начале поста задачу решать?
конечно имеет, она легко справляется с этой задачей, я щас еще прикручиваю автоматом транскрибатор через Giga AM, сервис fast api на компе разверну, он просто мега шустро транскрибит, там правда надо использовать PyAnnote VAD чтобы не терять слова на склейках записи, но уже протестил, работает. и все, будет автоматом по любой ссылке с ютуба или по локальному файлу транскрибить и отбирать моменты и монтажить с субтитрами.
если из за контекста так сильно страдает скорость советую использовать инструмент от гугла TurboQuant, сжимает его вес до х6 раз без потерь точности
странно, у меня бонсай на 6700 выдает 11 токенов..
Тоесть 1080ti ещё актуальна?) я подумывал не взять, но решил что на ней мало что заработает
На ней работает все, но надо найти не ужаренную. Я видел на них облака даже дают в аренду.
Все зависит от задачи. Я для эксперимента, когда LLM стали выдавать хорошие результаты, решил взять 5060ti на 16 Гб. Для задач кодирования в итоге более-менее внятные результаты удалось получить только на MoE моделях с частичной выгрузкой на CPU, потому что контекст 100к+ - рядовой случай, а это около 5 Гб только под кэш. Таким образом все же пришёл к "стандартному" варианту с 3090
Она разве хоть когда-то теряла актуальность?
Мой опыт:
## 1. Железо и окружение (Локальный сервер)
- GPU: 2× RTX 3060 12GB.
- CPU: i7-4820K.
- RAM: 32GB DDR3 (4x8GB).
- MB: ASUS P9X79 LE.
- OS: MX Linux 25.2 XFCE.
- Стек: llama.cpp (только GPU-инференс) - сервер, Python, PySide6 - клиент.
## 2. Архитектура инференс-сервера
- Сценарий A: Одна большая модель на 2 GPU (--tensor-split 1,1 или 12,12, порт 8080).
- Сценарий B: Две малые модели одновременно (по одной на GPU, порты 8080 и 8081).
- Управление: Приложение с GUI на PySide6 (LLM-Control BY).
Модель Salience-1.5-Pro.Q4_K_S (MoE 35b) при контексте 131032 выдаёт 89..32 t/s по мере заполнения, усреднённо около 50 t/s при хорошем качестве ответов.
Qwen очень сильно зависит от настроек, особенно последние версии (3.5, 3.6). Очень рекомендую перепроверить свои результаты на рекомендуемых для использования настройках, тогда Qwen будет и без размышлений, и с ними лучше работать

Тест Qwen3.5 9b, Gemma 4 12b и Bonsai 27b на легенде пенсионного возраста GTX 1080 ti