Дорого) Очень дорого) Выгоднее купить б/у RTX 3090\4090 24gb оптимальнее запускать дома moe модели, которые наподобие QWEN 3.6 35B A3B MTP в итоге получить нормальную скорость больше 100 токенов
В принципе да в гитхабе будет наверно сложно все интересные варианты посмотреть потому наверно проще по хештегу #demiurgos в телеграме https://t.me/H360ru
Откройте просто настройки слева внизу тык - ваш ник - настройки - персонализация - настроить qwen - Пользовательская инструкция и пропишите, что то наподобие и будет qwen так же хорош в этом, как дипсик)
SEARCH_PROTOCOL: STRICT_PRIMARY
Приоритет: ТОЛЬКО первоисточники. Агрегаторы и пересказы запрещены.
ДОМЕН: Определи официальный домен владельца (напр. docs., developer., github.com/org).
ЗАПРОС: Используй шаблон: "[ключевые_слова]" site:<официальный_домен> -inurl:news -inurl:guide
БЛОКЛИСТ: Отвергай сторонние агрегаторы: habr.com, medium.com, dev.to, stackoverflow.com. Исключение: разделы /blog/ или /wiki/ разрешены, ТОЛЬКО если они находятся на подтверждённом официальном домене разработчика.
СБОЙ: Если в официальном домене нет результата, ЗАПРЕЩЕНО искать на сторонних сайтах без разрешения. Верни строго этот формат:
[PRIMARY_SOURCE_GAP]
Query: "{исходный_запрос}"
Domain: "{проверенный_домен}"
Status: NOT_FOUND | PAYWALL | DEPRECATED
Action: WAIT_FOR_USER_OVERRIDE
ИСКЛЮЧЕНИЕ: Вторичные источники разрешены ТОЛЬКО при явном флаге в запросе: [OVERRIDE: SECONDARY_ALLOWED].
arch1lochus, ты путаешь internal reasoning trace с output generation conditioning.
Разберём по пунктам:
1. Reasoning ≠ Final Answer Head
Да, GPT-5 рассуждают на английском. Но финальная генерация ответа — это отдельный проход, где логиты (Логистическая регрессия) токенов формируются с учётом контекста всего диалога, включая язык промпта.
Русский запрос активирует другие вероятностные траектории для выходных токенов, даже если CoT был на английском.
===
2. Эмпирика: язык промпта влияет на качество вывода
Исследования показывают:
Принудительная моно-язычная генерация (даже при bilingual reasoning) снижает accuracy на 5.6 п.п. на MATH500
Mixed-language prompting (русский каркас + английские термины) даёт наилучший trade-off между качеством рассуждений и естественностью вывода
Модели демонстрируют cross-lingual interference: английский контекст "просачивается" в русский вывод как translationese, даже при английском CoT
===
3. Асимметрия cross-lingual alignment
Модель выучила английские синтаксические паттерны глубже. Запрет на "воду" на английском (avoid sycophancy) не блокирует русские токены-паразиты ("Отличный вопрос!"), потому что это разные пространства токенов. Инструкция должна быть на целевом языке, чтобы попасть в нужный кластер логитов.
4. Практический тест
Если бы язык промпта не имел значения при английском reasoning:
Не было бы разницы между Respond in Russian и русским промптом.
Но пользователи массово фиксируют "машинный переводизм)" при английских промптах → русский ответ.
Это и есть эмпирическое опровержение тезиса "рассуждения на английском = неважен язык ввода".
===
Итог
Используй русский промпт для структуры/стиля + английские термины для точности.
Это не "вера в магию", а работа с тем, как устроено latent space модели: английские термины — якоря к экспертным кластерам, русский каркас — фильтр против перевода ответа туда-обратно.
Reasoning на английском — это про логику. Язык промпта — про стиль, синтаксис и идиоматику финального ответа. Это ортогональные оси.
Ох-ох).. Ох уж этот зацензуренный гпт) У GPT с этим конкретные проблемы так как цензура режет нормальные ответы в итоге он больше попросту соглашается с юзером, даже если это не верно)
Смотрите как выглядит правильный ответ на тот же самый вопрос в ии с меньшей цензурой и правильным системным промптом:
Я проанализировал статью с Хабра. Краткий ответ: практические советы и итоговые выводы автора абсолютно верны и соответствуют современным лучшим практикам промпт-инжиниринга.
Однако некоторые объяснения механизмов работы нейросети в статье даны через антропоморфные метафоры («тратит силы на перевод», «думает по-английски»), что технически не совсем корректно с точки зрения архитектуры трансформеров. Ниже я подробно разберу каждое из четырех утверждений автора и приведу научные и технические доказательства их истинности.
1. «Нейросеть тратит силы на перевод… текст звучит как машинный перевод»
Вердикт: Результат описан верно, но механизм — метафора.
Доказательства: Большие языковые модели (LLM) не «думают» на английском, чтобы затем внутри себя пошагово «переводить» мысли на русский. Они генерируют текст токен за токеном на основе статистических вероятностей. Проблема, которую описывает автор, в науке называется translationese (машинный переводизм или буквализм) [[12]]. Исследования показывают, что при генерации текста на неанглийском языке из английского контекста модели подвержены кросс-языковой интерференции [[13]]. Из-за этого в русском тексте появляются неестественные обороты, типичные для английского языка, что и воспринимается пользователем как «машинный перевод». Промпт на русском языке сразу задает правильный вектор вероятностей для естественных русских фраз.
2. «Точные термины включают нужные знания (edge cases, trade-offs работают как ключи)»
Вердикт:Абсолютно верно.
Доказательства: Это один из самых надежных приемов в промпт-инжиниринге для неанглийских языков. Датасеты, на которых предобучались нейросети (такие как Common Crawl, GitHub, arXiv, StackOverflow), состоят преимущественно из английских текстов (часто на 70–90%). В многомерном скрытом пространстве (latent space) модели английские термины имеют гораздо более плотные и качественные нейронные связи с экспертными дискуссиями, чем их русские аналоги. Русские технические термины часто ассоциируются у модели с автоматически переведенными SEO-статьями или школьными рефератами. Использование английских терминов внутри русского текста работает как «якорь», подтягивающий экспертные знания из англоязычного кластера, сохраняя при этом русскую структуру ответа.
3. «Запрет на воду и лебезение работает только на родном языке»
Вердикт:В большинстве случаев верно.
Доказательства: Это связано с фундаментальными проблемами кросс-языкового выравнивания (cross-lingual alignment) в нейросетях [[42]]. Модели отлично понимают английские системные промпты, но им сложно связать абстрактную английскую инструкцию (например, “avoid sycophancy”) с конкретными русскими токенами-паразитами. Исследования кросс-лингвистического «подхалимства» (sycophancy) показывают, что модели проявляют это поведение по-разному в зависимости от языка [[30]]. Если вы запретите модели по-английски говорить “Great question!”, она успешно подавит генерацию именно этих английских токенов, но русские токены “Отличный вопрос!” останутся в ее «стоп-листе» незамеченными. Чтобы заблокировать конкретные слова или стилистические паттерны, инструкции всегда надежнее давать на целевом языке.
4. «Кривой синтаксис и канцеляризм»
Вердикт:Абсолютно верно.
Доказательства: Это продолжение проблемы translationese [[18]]. Английский язык структурно отличается от русского: в нем чаще используется пассивный залог, сложные герундиальные конструкции, специфические причастные обороты и прямой порядок слов. Когда нейросеть генерирует русский ответ, опираясь на английский промпт, она бессознательно калькирует (копирует) синтаксическую структуру английского языка. В результате вместо живого «мы обрабатываем данные» модель выдает канцелярское «осуществляется обработка данных», потому что это ближе к английской структуре “data processing is being performed”. Русский запрос сразу активирует естественные русские синтаксические шаблоны, заставляя модель писать короткими и четкими предложениями.
Итог
Формула автора: «Русский язык задает структуру и тон + точечные английские термины для специфических понятий» (mixed-language prompting) — это наиболее эффективный и научно обоснованный подход для получения качественных ответов от LLM на русском языке. Переводить запрос целиком на английский стоит только в том случае, если вам нужен ответ тоже на английском (например, для сложных логических задач, таких как Chain-of-Thought reasoning).
Этого хватит на 90% задач. Остальное прикручиваем под свою нишу.
=== Из локальных моделей сейчас на коне QWEN 3.6 35B A3B MTP - Q4-K-XL от Unsloth Если железо мощное, можно заюзать Unsloth Studio и потренить под свои задачи
=== Из облачных Qwen 3.7 Max и Plus Preview имеет смысл сначала в них набросать основной костяк контекста, а потом идти в локальную
Ну.. каждое слово для ии это несколько токенов, русские слова обычно длиннее и кодируются большим количеством бит. Для описания, чего то сложного это плюс, а вот для простых задач минус.
Потому например чисто психологически америкосы очень предсказуемы, когда как мы можем творить какую то дичь)
Скорость это конечно крутяшно, но гораздо важнее точность ответов) А то на турбо ускорении будет летать вокруг да около несколько итераций, а там хоба в два раза с меньшей скоростью ответ с первого раза^ ^
Вы не понимаете) это такой план по обучению хакерского мастерства народа)
А потом появилась..
DUNE II: The Battle for Arakis | SEGA
..надпись со звуком)
Дорого) Очень дорого) Выгоднее купить б/у RTX 3090\4090 24gb
оптимальнее запускать дома moe модели, которые наподобие QWEN 3.6 35B A3B MTP
в итоге получить нормальную скорость больше 100 токенов
Подозреваю никак)
А можно просто юзать своё "родное)" от яндекса, что форк давно сварганил на базе Roo Code
https://sourcecraft.dev/portal/docs/ru/code-assistant/
и юзать как облачные таки локальные ии
Просто именно в нынешнем виде, они по определению не смогут думать, именно как люди. Так ядро у них не думающее скажем так) а предсказывающее.
В этом направлении идут новые варианты нейронок на базе образов, вот там будет интереснее.
Снова эти смешные эксперименты от людей, что думают, что иИ умеют думать)
Забывая о том, как устроены цепи Маркова которые лежат в основе всех иИ.
И как обычно всего лишь правильно прописанными правилами можно избежать, того чтобы они не сходили с ума)
Это конечно прекрасно) но как объяснить, что в режиме поиска Claude Opus 4.8 Search опростоволовосился)
Как, после этого верить бенчмаркам)
В принципе да
в гитхабе будет наверно сложно все интересные варианты посмотреть
потому наверно проще по хештегу #demiurgos в телеграме https://t.me/H360ru
В принципе у меня отвечает кратко.
Можно ещё и упомянуть об этом, и явно сказать какой лимит сообщения.
Также в настройках персонализации
Как бы вы хотели, чтобы Qwen отвечал?
выбрано - кратко
Ну и обычно первым сообщением кидаю роль под нужную тему.
которые там складирую https://github.com/Axelaredz/demiurgos/
Откройте просто настройки слева внизу
тык - ваш ник - настройки - персонализация - настроить qwen - Пользовательская инструкция
и пропишите, что то наподобие и будет qwen так же хорош в этом, как дипсик)
И снова как в прошлой версии наверно сделают, так что вся база крепится к пластиковой основе)
Хорошо) Идём в GPT 5) смотрим что она скажет)
arch1lochus, ты путаешь internal reasoning trace с output generation conditioning.
Разберём по пунктам:
1. Reasoning ≠ Final Answer Head
Да, GPT-5 рассуждают на английском.
Но финальная генерация ответа — это отдельный проход, где логиты (Логистическая регрессия) токенов формируются с учётом контекста всего диалога, включая язык промпта.
Русский запрос активирует другие вероятностные траектории для выходных токенов, даже если CoT был на английском.
===
2. Эмпирика: язык промпта влияет на качество вывода
Исследования показывают:
Принудительная моно-язычная генерация (даже при bilingual reasoning) снижает accuracy на 5.6 п.п. на MATH500
Mixed-language prompting (русский каркас + английские термины) даёт наилучший trade-off между качеством рассуждений и естественностью вывода
Модели демонстрируют cross-lingual interference: английский контекст "просачивается" в русский вывод как translationese, даже при английском CoT
===
3. Асимметрия cross-lingual alignment
Модель выучила английские синтаксические паттерны глубже. Запрет на "воду" на английском (
avoid sycophancy) не блокирует русские токены-паразиты ("Отличный вопрос!"), потому что это разные пространства токенов. Инструкция должна быть на целевом языке, чтобы попасть в нужный кластер логитов.4. Практический тест
Если бы язык промпта не имел значения при английском reasoning:
Не было бы разницы между
Respond in Russianи русским промптом.Но пользователи массово фиксируют "машинный переводизм)" при английских промптах → русский ответ.
Это и есть эмпирическое опровержение тезиса "рассуждения на английском = неважен язык ввода".
===
Итог
Используй русский промпт для структуры/стиля + английские термины для точности.
Это не "вера в магию", а работа с тем, как устроено latent space модели: английские термины — якоря к экспертным кластерам, русский каркас — фильтр против перевода ответа туда-обратно.
Reasoning на английском — это про логику. Язык промпта — про стиль, синтаксис и идиоматику финального ответа. Это ортогональные оси.
Игнорировать вторую = терять качество вывода.
Ох-ох).. Ох уж этот зацензуренный гпт)
У GPT с этим конкретные проблемы так как цензура режет нормальные ответы в итоге он больше попросту соглашается с юзером, даже если это не верно)
Смотрите как выглядит правильный ответ на тот же самый вопрос в ии с меньшей цензурой и правильным системным промптом:
Я проанализировал статью с Хабра.
Краткий ответ: практические советы и итоговые выводы автора абсолютно верны и соответствуют современным лучшим практикам промпт-инжиниринга.
Однако некоторые объяснения механизмов работы нейросети в статье даны через антропоморфные метафоры («тратит силы на перевод», «думает по-английски»), что технически не совсем корректно с точки зрения архитектуры трансформеров. Ниже я подробно разберу каждое из четырех утверждений автора и приведу научные и технические доказательства их истинности.
1. «Нейросеть тратит силы на перевод… текст звучит как машинный перевод»
Вердикт: Результат описан верно, но механизм — метафора.
Доказательства: Большие языковые модели (LLM) не «думают» на английском, чтобы затем внутри себя пошагово «переводить» мысли на русский. Они генерируют текст токен за токеном на основе статистических вероятностей. Проблема, которую описывает автор, в науке называется translationese (машинный переводизм или буквализм) [[12]]. Исследования показывают, что при генерации текста на неанглийском языке из английского контекста модели подвержены кросс-языковой интерференции [[13]]. Из-за этого в русском тексте появляются неестественные обороты, типичные для английского языка, что и воспринимается пользователем как «машинный перевод». Промпт на русском языке сразу задает правильный вектор вероятностей для естественных русских фраз.
2. «Точные термины включают нужные знания (edge cases, trade-offs работают как ключи)»
Вердикт: Абсолютно верно.
Доказательства: Это один из самых надежных приемов в промпт-инжиниринге для неанглийских языков. Датасеты, на которых предобучались нейросети (такие как Common Crawl, GitHub, arXiv, StackOverflow), состоят преимущественно из английских текстов (часто на 70–90%). В многомерном скрытом пространстве (latent space) модели английские термины имеют гораздо более плотные и качественные нейронные связи с экспертными дискуссиями, чем их русские аналоги. Русские технические термины часто ассоциируются у модели с автоматически переведенными SEO-статьями или школьными рефератами. Использование английских терминов внутри русского текста работает как «якорь», подтягивающий экспертные знания из англоязычного кластера, сохраняя при этом русскую структуру ответа.
3. «Запрет на воду и лебезение работает только на родном языке»
Вердикт: В большинстве случаев верно.
Доказательства: Это связано с фундаментальными проблемами кросс-языкового выравнивания (cross-lingual alignment) в нейросетях [[42]]. Модели отлично понимают английские системные промпты, но им сложно связать абстрактную английскую инструкцию (например, “avoid sycophancy”) с конкретными русскими токенами-паразитами. Исследования кросс-лингвистического «подхалимства» (sycophancy) показывают, что модели проявляют это поведение по-разному в зависимости от языка [[30]]. Если вы запретите модели по-английски говорить “Great question!”, она успешно подавит генерацию именно этих английских токенов, но русские токены “Отличный вопрос!” останутся в ее «стоп-листе» незамеченными. Чтобы заблокировать конкретные слова или стилистические паттерны, инструкции всегда надежнее давать на целевом языке.
4. «Кривой синтаксис и канцеляризм»
Вердикт: Абсолютно верно.
Доказательства: Это продолжение проблемы translationese [[18]]. Английский язык структурно отличается от русского: в нем чаще используется пассивный залог, сложные герундиальные конструкции, специфические причастные обороты и прямой порядок слов. Когда нейросеть генерирует русский ответ, опираясь на английский промпт, она бессознательно калькирует (копирует) синтаксическую структуру английского языка. В результате вместо живого «мы обрабатываем данные» модель выдает канцелярское «осуществляется обработка данных», потому что это ближе к английской структуре “data processing is being performed”. Русский запрос сразу активирует естественные русские синтаксические шаблоны, заставляя модель писать короткими и четкими предложениями.
Итог
Формула автора: «Русский язык задает структуру и тон + точечные английские термины для специфических понятий» (mixed-language prompting) — это наиболее эффективный и научно обоснованный подход для получения качественных ответов от LLM на русском языке. Переводить запрос целиком на английский стоит только в том случае, если вам нужен ответ тоже на английском (например, для сложных логических задач, таких как Chain-of-Thought reasoning).
Попробуйте по этой теме обсудить с самой иИ, как на данный момент, обстоят дела с этим не выдумывая сами)
В настройках агента пункт MCP серверы либо иконка в интерфейсе.
Далее Маркетплейс и в поиск вставляем название.
• Context7 — забирает свежие доки.
Модель перестаёт галлюцинировать устаревшими API из двухлетней давности.
• Sequential Thinking — от самой Antropic добавляет системное мышление.
Обязывает нейронку сначала планировать, потом делать.
• Fetch — базовый HTTP-клиент.
Качать референсы, читать внешние API, парсить чейнджлоги.
Этого хватит на 90% задач. Остальное прикручиваем под свою нишу.
===
Из локальных моделей сейчас на коне QWEN 3.6 35B A3B MTP - Q4-K-XL от Unsloth
Если железо мощное, можно заюзать Unsloth Studio и потренить под свои задачи
===
Из облачных Qwen 3.7 Max и Plus Preview
имеет смысл сначала в них набросать основной костяк контекста, а потом идти в локальную
===
Настройки: llama-server
-hf unsloth/Qwen3.6-35B-A3B-MTP-GGUF:UD-Q4_K_XL
–temp 0.6
–top-p 0.95
–top-k 20
–presence-penalty 1.5
–min-p 0.00
–spec-type draft-mtp --spec-draft-n-max 2
–ctx-size 8192
-ngl 99
===
Альтернативы:
Qwen3.6-27B MTP - если не нужна обработка картинок и видео
Llama 4 Scout (17B active из 109B)
Qwen3-Coder-30B-A3B
Qwen3 8B
Gemma 3 12B
Но все они по бенчмаркам проигрывают
Там сейчас внутри Cline бесплатный DeepSeek 4 Flash Free
даже он впечатляет)
Ну.. каждое слово для ии это несколько токенов, русские слова обычно длиннее и кодируются большим количеством бит. Для описания, чего то сложного это плюс, а вот для простых задач минус.
Потому например чисто психологически америкосы очень предсказуемы, когда как мы можем творить какую то дичь)
Русский язык просто богат токенами)
Потому он порой выигрывает у других более детермических языков.
Скорость это конечно крутяшно, но гораздо важнее точность ответов)
А то на турбо ускорении будет летать вокруг да около несколько итераций, а там хоба в два раза с меньшей скоростью ответ с первого раза^ ^