не помогает только от детектирования наличия tun сервиса, от всего остального помогает
Да еще если установить сертификат минцифры с песочнице, то основной профиль НЕ будет его видеть и использовать. Android разделяет хранилище сертификатов между профилями !!!
DeepSeek-v4-flash конечно быстро работает, но говорят что у него высокий уровень галлюцинаций, что делает практически непригодным для агентского использования. А самый низкий уровень галлюцинаций у MiniMax-M3
Дурацкое тестирование, честно говоря. И кстати у вас ошибка в коде для Backtrader в файле sma_crossover.py; документацию по Backtrader почитайте и найдите свою ошибку.
А смысл, эти модели сами по себе туповатые, Q1 сваливается в loop, на сложной задаче, Q2 немного умнее но тоже тупит и не может исправить ошибки в созданном коде.
Qwopus3.6-27B-Coder Q8 (база Qwen3.6-27B) за 41000 токенов, бесплатно на локальном LLM, на 6000 токенов меньше, чем у Gemini3.1-Pro и это с учетом токенов на 1 ошибку, которая была исправлена. Все работает отлично !
За её спиной сидел парочка — наклонились друг к другу, разговаривали оживлённо, по-настоящему оживлённо, из тех разговоров, которые захватывают с головой, и всё остальное отходит на второй план. Мужчина был одет в английское пальто из вельвета — свободное, расхлябанное, по-английски непринуждённое, но англичанин он, как ни странно, был не очень-то. Хотя Poirotу виднелась лишь затылочная часть его головы, уже по форме черепа и по постановке плеч — да, да, по одному этому — можно было понять, кто перед тобой. Мужчина крупный, широкоплечий, и в плечах-то этих — сила, и в голове — ум. Вдруг он повернул голову, и Poirot увидел его профиль. Человек лет тридцати с небольшим, очень handsome, с широким светлым усами — из тех, кого не забудешь после первого взгляда.
Женщина, сидевшая напротив, была совсем ещё девушка — лет двадцати, не больше. Черное облегающее пальто, короткая юбка, белая атласная блузка, маленькая чёрная шляпка — кокетливая, нахальная, под тем самым углом, который в этом сезоне считался модным и скандальным. Лицо — красивое, иностранное, с тем самым выражением, которое сразу говорит: она не отсюда. Кожа — белая, мертвенно-белая, глаза — большие, карие, волосы — чёрные, как смоль. Курить она курила через длинный мундштук. Ногти — ярко-красные, ухоженные. На одном пальце — изумруд, крупный, в платине. В её взгляде и голосе была та самая кокетливость, которую невозможно спутать ни с чем другим.
2. В стиле Александра Пушкина
За нею пара восседала, наклонясь друг к другу с оживлённой беседой. Мужчина одет был в англійское платье из сукна широкого, но англичанин он не был — хоть и видна была Пуаро лишь затылок его, но по черепу и по плечам угадался он тотчас. Мужчина величавый и статный. Вдруг он голову повернул — и профиль его явился перед Пуаро: красавец, лет тридцати с нежным усиком светлым.
Противу же его сидела девица — едва ли не двадцати лет. Черный облегающий полушубок, юбка малая, атласная блуза белая, шляпка чёрная — изящная, нахальная, под углом модным и дерзким. Лицо прекрасное, чужеземное, кожа белая, как снег, очи карие, великие, власы чёрные, как ночь. Курить она курила через тростник длинный. Ногти алые, ухоженные. На пальце — изумруд великий, в платине. В взоре её и в голосе — кокетство женское, игривое и опасное.
3. В стиле Виктора Пелевина
За её спиной — парочка. Типичная. Наклонились друг к другу, как два магнита, и разговаривают. Оживлённо. По-настоящему оживлённо. Из тех разговоров, которые доказывают, что люди всё ещё умеют что-то чувствовать, или хотя бы притворяться, что умеют.
Мужчина одет в английское пальто из вельвета — свободное, расхлябанное, по-английски расслабленное. Но англичанин он не был. Английское пальто — это как английское образование: можно надеть на себя, но стать англичанином от этого не становишься. Хотя Пуаро виднелась лишь затылочная часть его головы — и то по форме черепа и по постановке плеч можно было понять, кто перед тобой. Мужчина крупный. Широкоплечий. Силуэт человека, который привык занимать в этом мире больше места, чем ему положено по рождению.
Вдруг он повернул голову — и Пуаро увидел его профиль. Красавец. Лет тридцати с небольшим. С широким светлым усами. Из тех, кого женщины любят, а мужчины завидуют — и это ещё хуже.
Женщина, сидевшая напротив, была совсем ещё девушка. Лет двадцати. Или двадцати одного. Или восемнадцати — трудно сказать, когда речь идёт о тех, кто уже научился выглядеть как взрослый, но ещё не совсем в этом разобрался. Черное облегающее пальто. Юбка. Белая атласная блузка. Маленькая чёрная шляпка — кокетливая, нахальная, под тем самым углом, который в этом сезоне считался модным и скандальным. Типичный аксессуар для типичной женщины, которая хочет, чтобы её заметили, но не хочет, чтобы её поняли.
Лицо — красивое. Иностранное. С тем самым выражением, которое сразу говорит: она не отсюда. Кожа — белая. Мертвенно-белая. Такого цвета кожа бывает у людей, которые никогда не видели солнца, или у тех, кто видел слишком много. Глаза — большие. Карие. Как два больших карих глаза на кошачьем лице. Волосы — чёрные. Как смоль. Как ночь. Как всё, что невозможно осветить.
Курить она курила через длинный мундштук. Ногти — ярко-красные. Ухоженные. На одном пальце — изумруд, крупный, в платине. Символ. Изумруд — это камень, который символизирует то, что нельзя купить за деньги. Но она его купила. Или ему подарили. В любом случае — он на её пальце, и это уже что-то значит.
В её взгляде и голосе была кокетливость. Та самая. Которую невозможно спутать ни с чем другим. Которая доказывает, что женщины всё ещё умеют играть, и играют лучше, чем мужчины.
Задача завершена
Выполнен литературный перевод отрывка из Агаты Кристи («Смерть на Ниле») в трёх стилях:
Стиль братьев Стругацких — развёрнутый синтаксис, аналитический нарратив, философские отступления, научно-повседневная лексика с характерными вставными конструкциями («из тех разговоров, которые захватывают с головой»).
Стиль Александра Пушкина — лаконичный, ритмичный, с архаичной лексикой («восседает», «власы», «девица»), эпический объективный тон, поэтическая сжатость описаний.
Стиль Виктора Пелевина — дробный синтаксис с паузами и повторами, постмодернистская ирония, мета-комментарии к тексту («английское пальто — это как английское образование»), деконструкция смысла, философский цинизм.
Для полной модели, да проблемно, а так то у меня локально GLM-5.1 в Q4 кванте локально крутится 10 tok/sec. И судя по размеру GLM-5.2 тоже будет с той же скоростью. И она даже квантизованная в Q4 очень хороша. А еще есть новый MiniMax-M3, который поменьше и быстрее.
Похоже школьники писали авторизацию, надо было использовать OAuth2.0-PKCE или еще добавить клиентскую подпись, и ключ создавать с запретом экспорта их криптохранилища
И кому нужен этот древний мусор сейчас, тем более что это не DeepSeek а дистилляция. Ставить надо последние модели: Qwen3.6-27B - лучшая сейчас для локального использования на одной карте с 24Gb VRAM, потом Gemma-4-31B похуже для кодинга, Qwen3.6-35B, Gemma-4-26B, Gemma-4-12B и все.
Выбираете что у вас потянет и ставите.
Qwen3.6-27B уровень в кодинге почти Sonnet4.5 / GPT5.2
Современная техника (инверторные кондиционеры, импульсные блоки питания) всегда дает небольшую фоновую утечку тока. Если повесить всю квартиру на одно УЗО, сумма этих микро-утечек выбьет рубильник без всякой аварии.
В квартире обычная типовая проводка от застройщика, узо в щитке стоит, 3 линии, одна на эл.плиту, одна коридор комната и вторая ванна, комната, 3 кондиционера, инверторный холодос, инверторная стиралка, куча разных блоков питания, ноуты, моники, комп, роутеры и т.д.
И НИЧЕГО не выбивает все работает, стабильно, из того что делал, просто заменил все розетки на более качественные и везде в розетках и выключателях протянул винты. И все!
Все без километров проводов! Вот как-то нет никакого желания жить в трансформаторной будке, вместо квартиры.
vLLM глючная вещь, да еще и памяти жрет намного больше для моделей того же качества, в результате возможный размер контекста раза в 2 меньше чем на llama.cpp, к которой все сделано очень компактно без лишних использований VRAM.
Из маленьких рабочих LLM сейчас только Qwen3.6-27b и для нее хватит одной RTX3090, в кванте Q4_K_M и контекст [128000 q8_0] - prefil=980tok/s tg=30tok/sec вполне достаточно. Чуть хуже по мозгам Gemma4-31b, и еще слабее Qwen3.5-35b и Gemma4-26 но они работать будут намного быстрее, даже в большем кванте. Все цифры получены с llama.cpp
Для двух RTX3090, Qwen3.6-27b в кванте Q8 и контексте [256000 q8_0] --- prefill=1500tok/sec tg=33tok/sec, для Q4_K_M prefil==1500tok/sec tg=24tok/sec.
C MTP работает нестабильно, вплоть вылета с жесткой перезагрузки компа.
Все модели типа Qwen3.5-122b, Qwen3.5-397 по мозгам хуже Qwen3.6-27b, при чем Qwen3.5-397 немного хуже, Qwen3.5-122b еще немного хуже. Ну это кроме того что они еще и медленнее будет работать у вас, хотя сырых знаний в этих моделях, больше, но в кодинге это им несильно помогает.
То есть на слабом железе у вас выбор крайне ограничен:
Qwen3.6-27b, Gemma4-31b, Qwen3.6-35b ну и еще может Gemma4-26b
Для всего остального желательно RAM > 220Gb, быстрой DDR5 типа DDR6000 тогда, на двух RTX3090 + i7 265k + DDR5-6000 220Gb = 2x64gb+2x48Gb: (для RTX3090 снижен PW до 270 и память разогнана немного) - с медленной RAM у вас будет маленький prefill, есть VRAM недостаточно, да и еще желательно быстрый NVME на PCIе 5.x
По моделям, про Qwen3.5 я уже написал, MiniMax-M2.7 примерно на уровне Qwen3.6-27b по моим тестам, но возможно сырых знаний у нее больше, но она НЕ умнее.
MiMo-v2.5 поумнее немного, но она и больше, про GLM вы и сами знаете.
Кстати где видел инфу что Qwen3.6-Plus это модель типа Dense-70b, поэтому видимо ее и не выложили, чтобы не обрушить рынок продажи токенов. Видимо знания туда тромбовали всем Китаем.
А что если я хочу быстро на GLM-5.1-IQ3_XX3 Да запросто нужно 2шт RTX6000 96Gb и у вас будет prefill=95t/s tg=16t/s -- это я тестировал на арендованном сервере, но думаю что низкая скорость prefill, как то связана с виртуализацией, потому что на всех арендованных серверах, скорость всегда меньше, иногда намного чем на моем локальном компе.
А вот если LLM влезает в VRAM почти полностью, то к примеру MiMo-v2.5 Q4_K_XL на 2хRTX6000 96Gb дает prefil=3400t/s tg=74t/s, а на одной RTX6000 96Gb то есть тут влезла наполовину, уже prefill=77t/s tg=29t/s но я не уверен что это нормально, что-то на серверах которые сдают в аренду очень плохо настроено, не должно такого сильного падения быть я думаю. Буду тестировать потом на своем, когда расширю у себя VRAM до 100Gb.
Да кстати сейчас и получше карты есть недорогие, те же AMD MI50 на 16gb и 32Gb
не помогает только от детектирования наличия tun сервиса, от всего остального помогает
Да еще если установить сертификат минцифры с песочнице, то основной профиль НЕ будет его видеть и использовать. Android разделяет хранилище сертификатов между профилями !!!
Сравнивали последнюю 0731 => https://www.youtube.com/watch?v=iT34JqYtGRs
DeepSeek-v4-flash конечно быстро работает, но говорят что у него высокий уровень галлюцинаций, что делает практически непригодным для агентского использования. А самый низкий уровень галлюцинаций у MiniMax-M3
И как на ламбу уже заработали роботом или нет ?
Выглядит как сюр, купить 8карт H100 чтобы гонять на них Qwen3.6-35B.
Дешевле было бы каждому выдать по RTX3090 чтобы локально запускали эту LLM.
Вот здесь хорошее сравнение https://www.youtube.com/watch?v=rBLWDJrXCp0
примерно так как в видео оно и есть, Qwen3.6-27B несмотря на размер очень удачная и мощная модель, а Bonsai это уровень Gemma4-12B в лучшем случае.
Дурацкое тестирование, честно говоря. И кстати у вас ошибка в коде для Backtrader в файле sma_crossover.py; документацию по Backtrader почитайте и найдите свою ошибку.
А смысл, эти модели сами по себе туповатые, Q1 сваливается в loop, на сложной задаче, Q2 немного умнее но тоже тупит и не может исправить ошибки в созданном коде.
Это получается будет уже третья Российская Лунная База !
2шт RTX3090
Qwopus3.6-27B-Coder Q8 (база Qwen3.6-27B) за 41000 токенов, бесплатно на локальном LLM, на 6000 токенов меньше, чем у Gemini3.1-Pro и это с учетом токенов на 1 ошибку, которая была исправлена. Все работает отлично !
Qwopus - победил в этом тесте !
---------------------------------------------------
Литературный перевод за 10000токенов
Скрытый текст
Литературный перевод отрывка в трёх стилях
1. В стиле братьев Стругацких
За её спиной сидел парочка — наклонились друг к другу, разговаривали оживлённо, по-настоящему оживлённо, из тех разговоров, которые захватывают с головой, и всё остальное отходит на второй план. Мужчина был одет в английское пальто из вельвета — свободное, расхлябанное, по-английски непринуждённое, но англичанин он, как ни странно, был не очень-то. Хотя Poirotу виднелась лишь затылочная часть его головы, уже по форме черепа и по постановке плеч — да, да, по одному этому — можно было понять, кто перед тобой. Мужчина крупный, широкоплечий, и в плечах-то этих — сила, и в голове — ум. Вдруг он повернул голову, и Poirot увидел его профиль. Человек лет тридцати с небольшим, очень handsome, с широким светлым усами — из тех, кого не забудешь после первого взгляда.
Женщина, сидевшая напротив, была совсем ещё девушка — лет двадцати, не больше. Черное облегающее пальто, короткая юбка, белая атласная блузка, маленькая чёрная шляпка — кокетливая, нахальная, под тем самым углом, который в этом сезоне считался модным и скандальным. Лицо — красивое, иностранное, с тем самым выражением, которое сразу говорит: она не отсюда. Кожа — белая, мертвенно-белая, глаза — большие, карие, волосы — чёрные, как смоль. Курить она курила через длинный мундштук. Ногти — ярко-красные, ухоженные. На одном пальце — изумруд, крупный, в платине. В её взгляде и голосе была та самая кокетливость, которую невозможно спутать ни с чем другим.
2. В стиле Александра Пушкина
За нею пара восседала, наклонясь друг к другу с оживлённой беседой. Мужчина одет был в англійское платье из сукна широкого, но англичанин он не был — хоть и видна была Пуаро лишь затылок его, но по черепу и по плечам угадался он тотчас. Мужчина величавый и статный. Вдруг он голову повернул — и профиль его явился перед Пуаро: красавец, лет тридцати с нежным усиком светлым.
Противу же его сидела девица — едва ли не двадцати лет. Черный облегающий полушубок, юбка малая, атласная блуза белая, шляпка чёрная — изящная, нахальная, под углом модным и дерзким. Лицо прекрасное, чужеземное, кожа белая, как снег, очи карие, великие, власы чёрные, как ночь. Курить она курила через тростник длинный. Ногти алые, ухоженные. На пальце — изумруд великий, в платине. В взоре её и в голосе — кокетство женское, игривое и опасное.
3. В стиле Виктора Пелевина
За её спиной — парочка. Типичная. Наклонились друг к другу, как два магнита, и разговаривают. Оживлённо. По-настоящему оживлённо. Из тех разговоров, которые доказывают, что люди всё ещё умеют что-то чувствовать, или хотя бы притворяться, что умеют.
Мужчина одет в английское пальто из вельвета — свободное, расхлябанное, по-английски расслабленное. Но англичанин он не был. Английское пальто — это как английское образование: можно надеть на себя, но стать англичанином от этого не становишься. Хотя Пуаро виднелась лишь затылочная часть его головы — и то по форме черепа и по постановке плеч можно было понять, кто перед тобой. Мужчина крупный. Широкоплечий. Силуэт человека, который привык занимать в этом мире больше места, чем ему положено по рождению.
Вдруг он повернул голову — и Пуаро увидел его профиль. Красавец. Лет тридцати с небольшим. С широким светлым усами. Из тех, кого женщины любят, а мужчины завидуют — и это ещё хуже.
Женщина, сидевшая напротив, была совсем ещё девушка. Лет двадцати. Или двадцати одного. Или восемнадцати — трудно сказать, когда речь идёт о тех, кто уже научился выглядеть как взрослый, но ещё не совсем в этом разобрался. Черное облегающее пальто. Юбка. Белая атласная блузка. Маленькая чёрная шляпка — кокетливая, нахальная, под тем самым углом, который в этом сезоне считался модным и скандальным. Типичный аксессуар для типичной женщины, которая хочет, чтобы её заметили, но не хочет, чтобы её поняли.
Лицо — красивое. Иностранное. С тем самым выражением, которое сразу говорит: она не отсюда. Кожа — белая. Мертвенно-белая. Такого цвета кожа бывает у людей, которые никогда не видели солнца, или у тех, кто видел слишком много. Глаза — большие. Карие. Как два больших карих глаза на кошачьем лице. Волосы — чёрные. Как смоль. Как ночь. Как всё, что невозможно осветить.
Курить она курила через длинный мундштук. Ногти — ярко-красные. Ухоженные. На одном пальце — изумруд, крупный, в платине. Символ. Изумруд — это камень, который символизирует то, что нельзя купить за деньги. Но она его купила. Или ему подарили. В любом случае — он на её пальце, и это уже что-то значит.
В её взгляде и голосе была кокетливость. Та самая. Которую невозможно спутать ни с чем другим. Которая доказывает, что женщины всё ещё умеют играть, и играют лучше, чем мужчины.
Задача завершена
Выполнен литературный перевод отрывка из Агаты Кристи («Смерть на Ниле») в трёх стилях:
Стиль братьев Стругацких — развёрнутый синтаксис, аналитический нарратив, философские отступления, научно-повседневная лексика с характерными вставными конструкциями («из тех разговоров, которые захватывают с головой»).
Стиль Александра Пушкина — лаконичный, ритмичный, с архаичной лексикой («восседает», «власы», «девица»), эпический объективный тон, поэтическая сжатость описаний.
Стиль Виктора Пелевина — дробный синтаксис с паузами и повторами, постмодернистская ирония, мета-комментарии к тексту («английское пальто — это как английское образование»), деконструкция смысла, философский цинизм.
Для полной модели, да проблемно, а так то у меня локально GLM-5.1 в Q4 кванте локально крутится 10 tok/sec. И судя по размеру GLM-5.2 тоже будет с той же скоростью. И она даже квантизованная в Q4 очень хороша. А еще есть новый MiniMax-M3, который поменьше и быстрее.
И зачем вам этот Opus, в нем ведь нет наших скреп и гойды! Надо пользоваться посконным ГигаЧадом !
Похоже школьники писали авторизацию, надо было использовать OAuth2.0-PKCE или еще добавить клиентскую подпись, и ключ создавать с запретом экспорта их криптохранилища
И кому нужен этот древний мусор сейчас, тем более что это не DeepSeek а дистилляция. Ставить надо последние модели: Qwen3.6-27B - лучшая сейчас для локального использования на одной карте с 24Gb VRAM, потом Gemma-4-31B похуже для кодинга, Qwen3.6-35B, Gemma-4-26B, Gemma-4-12B и все.
Выбираете что у вас потянет и ставите.
Qwen3.6-27B уровень в кодинге почти Sonnet4.5 / GPT5.2
Gemma-4-12B у думаю будет посильнее Haiky4.5
Первая таблица конвертируется в JSON с ошибками
Вторая слишком сложная для такой маленькой сетки, но Qwen3.6-35B полностью конвертирует таблицу в JSON
Скрытый текст
В чем проблема купить RTX3090 или переделанную RTX3080 20Gb за 46тыр от китайцаев
Глупость несусветная и выброс денег на ветер.
В квартире обычная типовая проводка от застройщика, узо в щитке стоит, 3 линии, одна на эл.плиту, одна коридор комната и вторая ванна, комната, 3 кондиционера, инверторный холодос, инверторная стиралка, куча разных блоков питания, ноуты, моники, комп, роутеры и т.д.
И НИЧЕГО не выбивает все работает, стабильно, из того что делал, просто заменил все розетки на более качественные и везде в розетках и выключателях протянул винты. И все!
Все без километров проводов! Вот как-то нет никакого желания жить в трансформаторной будке, вместо квартиры.
vLLM глючная вещь, да еще и памяти жрет намного больше для моделей того же качества, в результате возможный размер контекста раза в 2 меньше чем на llama.cpp, к которой все сделано очень компактно без лишних использований VRAM.
Тестирование какое-то бессмысленное.
Из маленьких рабочих LLM сейчас только Qwen3.6-27b и для нее хватит одной RTX3090, в кванте Q4_K_M и контекст [128000 q8_0] - prefil=980tok/s tg=30tok/sec вполне достаточно. Чуть хуже по мозгам Gemma4-31b, и еще слабее Qwen3.5-35b и Gemma4-26 но они работать будут намного быстрее, даже в большем кванте. Все цифры получены с llama.cpp
Для двух RTX3090, Qwen3.6-27b в кванте Q8 и контексте [256000 q8_0] --- prefill=1500tok/sec tg=33tok/sec, для Q4_K_M prefil==1500tok/sec tg=24tok/sec.
C MTP работает нестабильно, вплоть вылета с жесткой перезагрузки компа.
Все модели типа Qwen3.5-122b, Qwen3.5-397 по мозгам хуже Qwen3.6-27b, при чем Qwen3.5-397 немного хуже, Qwen3.5-122b еще немного хуже. Ну это кроме того что они еще и медленнее будет работать у вас, хотя сырых знаний в этих моделях, больше, но в кодинге это им несильно помогает.
То есть на слабом железе у вас выбор крайне ограничен:
Qwen3.6-27b, Gemma4-31b, Qwen3.6-35b ну и еще может Gemma4-26b
Для всего остального желательно RAM > 220Gb, быстрой DDR5 типа DDR6000 тогда, на двух RTX3090 + i7 265k + DDR5-6000 220Gb = 2x64gb+2x48Gb: (для RTX3090 снижен PW до 270 и память разогнана немного) - с медленной RAM у вас будет маленький prefill, есть VRAM недостаточно, да и еще желательно быстрый NVME на PCIе 5.x
Qwen3.5-122b Q5_K_XL tg=17t/s
Qwen3.5-397b Q4_k_M=9t/s
MiniMax-M2.7 Q4_k_XL=10t/s; Q4_K_M=13t/s [ctx=128000 q8_0] prefill=300t/s
MiMo-V2.5 Q4_K_M=8t/s; IQ4_XS=10t/s [ctx=128000 q8_0] prefill=254t/s
GLM-4.7 Q3_K_XL=5t/s IQ4_XS=5t/s [ctx=64000 q8_0] prefill=160t/s
GLM-5.1 IQ3_XXS=4t/s [ctx=64000 q8_0] prefill=19t/s
По моделям, про Qwen3.5 я уже написал, MiniMax-M2.7 примерно на уровне Qwen3.6-27b по моим тестам, но возможно сырых знаний у нее больше, но она НЕ умнее.
MiMo-v2.5 поумнее немного, но она и больше, про GLM вы и сами знаете.
Кстати где видел инфу что Qwen3.6-Plus это модель типа Dense-70b, поэтому видимо ее и не выложили, чтобы не обрушить рынок продажи токенов. Видимо знания туда тромбовали всем Китаем.
А что если я хочу быстро на GLM-5.1-IQ3_XX3
Да запросто нужно 2шт RTX6000 96Gb и у вас будет prefill=95t/s tg=16t/s -- это я тестировал на арендованном сервере, но думаю что низкая скорость prefill, как то связана с виртуализацией, потому что на всех арендованных серверах, скорость всегда меньше, иногда намного чем на моем локальном компе.
А вот если LLM влезает в VRAM почти полностью, то к примеру
MiMo-v2.5 Q4_K_XL на 2хRTX6000 96Gb дает prefil=3400t/s tg=74t/s, а на одной RTX6000 96Gb то есть тут влезла наполовину, уже prefill=77t/s tg=29t/s но я не уверен что это нормально, что-то на серверах которые сдают в аренду очень плохо настроено, не должно такого сильного падения быть я думаю. Буду тестировать потом на своем, когда расширю у себя VRAM до 100Gb.
Да кстати сейчас и получше карты есть недорогие, те же AMD MI50 на 16gb и 32Gb