Обновить
0

Пользователь

Отправить сообщение

На авито продают. Самое интересное, что две такие 44 GB VRAM и в tensor режиме дают 35-75 токенов в секунду на Q8 кванте 265тыс контекст q8 KV cache. Что больше чем на одной и меня сильно удивило и порадовало. За 70 тыс рублей пока самый недорогой вариант получить модель для кодинга уровня почти GPT 5.5

Да лучшая модель для локальной, очень долго думает, зато первая локальная модель которая на threejs сделала в 3d игрушку и сразу заработала, делала через codex агент 40 минут(симулятор гонок на квадракоптере). На RTX2080ti 22GB с небольшим разгоном Q4 квант 148тысяч контекст с MTP дает 25-55 токенов в секунду ( в зависимости от текущего использованияглубины контекста, сначала 55 токенов в секунду, потом снижается по мере использования всего контекста до 25 токенов в секунду).

Информация

В рейтинге
Не участвует
Зарегистрирован
Активность