5090 имеет гораздо большую площадь. Да она обычным воздухом охлаждается до 60°. Плотность теплового потока (а соответственно и электрического тока) в ней в несколько раз меньше чем в топовых процессорах.
Температуру и top_* настройки можно передавать прям в запросе. Например вы можете использовать один и тот же инстанс модели с высокой температурой для оркестрации и с низкой для сабагентов. Самое худшее что в этом случае может случиться - не попадете в кэш и llama начнет весь контекст заново парсить.
Гонял локально 27B и 35B. Не знаю что там по тестам, но на практике лично для меня 27B выдает более качественные ответы. 35B иногда ломается и даже тулы перестает запускать, вместо этого в чат выкидывает xml теги тулов.
Важное уточнение: обе модели каантизованы в q4. Но без этого даже 32 гигов в 5090 будет мало.
Gitlab 2017
Вместо энергии лучше силу Земли
Т.е. вы заменили прослушку от LG прослушкой от Яндекса.
Наоборот. До первой мировой войны границы по большей части были открыты. Едь куда хочешь.
А вдруг наводнение? Альтернатива это утки.
Не TS, а zig
В голливудских фильмах номера с +7 начинаются?
Температура и другие параметры инференса это часть запроса. Можно на одном инстансе модели делать запросы с разной температурой.
То что вы в llama настраиваете это просто дефолты, которые используются если в запросе ничего не передано.
Все так. Просто статья о том, как сложно подвести питание к чипу, а к 5090 не сложно.
Запустите модель на CPU. Скорее всего скорость генерации будет выше, а потом догадаетесь почему так.
5090 имеет гораздо большую площадь. Да она обычным воздухом охлаждается до 60°. Плотность теплового потока (а соответственно и электрического тока) в ней в несколько раз меньше чем в топовых процессорах.
Но ведь в ванильной llama.cpp нет турбоквантов, только в форках?
Температуру и top_* настройки можно передавать прям в запросе. Например вы можете использовать один и тот же инстанс модели с высокой температурой для оркестрации и с низкой для сабагентов. Самое худшее что в этом случае может случиться - не попадете в кэш и llama начнет весь контекст заново парсить.
А кто проверял компилятор?
У меня есть и клод и кодекс рабочий. Суть не в этом.
А температуру и другие настройки крутили?
Гонял локально 27B и 35B. Не знаю что там по тестам, но на практике лично для меня 27B выдает более качественные ответы. 35B иногда ломается и даже тулы перестает запускать, вместо этого в чат выкидывает xml теги тулов.
Важное уточнение: обе модели каантизованы в q4. Но без этого даже 32 гигов в 5090 будет мало.
На 5090 влезет квантизованная 27B с 256к контекстом. Если kv кэш опустить до q4, то и на 4090 влезает. 27B это плотная модель, она умнее 35B.
Ну они хотя бы выдумывать ничего не стали, а взяли за основу проверенный JodaTime.
Возвращаем иммутабельную обёртку, а потом получаем
ConcurrentModificationException