Обновить
7

Пользователь

Отправить сообщение

Какая-то у Вас неправильная «зазывайка»

Однако, относительно вопроса урегулирования отказов в области кредитного скоринга по крайней мере у РФ достаточно четкая позиция. Результат работы нейронной сети должен быть интерпретируемым, так что, фактически запрет на создание сложных нелинейных взаимосвязей — это головная боль уже банка а не клиента. + отдельная история есть про то, как в Соединенных Штатах запретили использовать признаки расы и пола при работе алгоритмов
Достаточно интересный вопрос.
Из соображений того, что в таких тестах обычно набираются осмысленные предложения, а не набор «очищенных» слов, выбрал такие датасеты:

ENGLISH: github.com/dwyl/english-words/blob/master/words_alpha.txt
RUSSIAN: github.com/danakt/russian-words

Результаты достаточно интересные, гистограммы для разных языков:
image

95% доверительные интервалы для средних + разницы средних:
image

Но что-то я подзабыл можно ли на таких больших выборках использовать z и t критерий (Вроде как распределение нормальное для длин слов, но все же это дискретные величины, а значит не непрерывные), на всякий пожарный проверил отдельно для бутстрэпа (результат похожий), но все равно не уверен. Код примерно такой, буду рад если в случае ошибки, кто-то меня поправит.
import pandas as pd
import matplotlib.pylab as plt
from statsmodels.stats.weightstats import *
from tqdm.notebook import tqdm


russian_pd = pd.read_csv("russian_dict.txt", header=None, sep='\n', encoding="windows-1251")
russian_pd.columns = ["WORD"]
russian_pd["LEN"] = russian_pd["WORD"].apply(lambda x: len(x) - 1 if str(x)[0] == '-' else len(x))
english_pd = pd.read_csv("english_dict.txt", header=None, sep='\n')
english_pd.columns = ["WORD"]
english_pd["LEN"] = english_pd["WORD"].apply(lambda x: len(str(x)) - 1 if str(x)[0] == '-' else len(str(x)))
plt.figure(figsize=(15,7))
plt.subplot(1,2,1)
plt.title('ENGLISH')
plt.hist(english_pd.LEN, color='blue', edgecolor='black')
plt.subplot(1,2,2)
plt.title('RUSSIAN')
plt.hist(russian_pd.LEN, color='blue', edgecolor='black')
plt.show()
print("ENGLISH [{0[0]:.4f}, {0[1]:.4f}]".format(zconfint(english_pd.LEN.values)))
print("RUSSIAN [{0[0]:.4f}, {0[1]:.4f}]".format(zconfint(russian_pd.LEN.values)))
print("MEAN 95% confidence interval [{0[0]:.4f}, {0[1]:.4f}]".format(CompareMeans(DescrStatsW(russian_pd.LEN.values), DescrStatsW(english_pd.LEN.values)).zconfint_diff()))
def get_bootstrap_interval(sample, n_samples):
    indices = np.random.randint(0, len(sample), size=(n_samples, len(sample)))
    samples = sample[indices]
    return samples

def stat_quantile(stat, alpha=.05):
    boundaries = np.percentile(stat, [100 * alpha / 2., 100 * (1 - alpha / 2.)])
    return boundaries

delta_means = list((map(lambda x: x[1] - x[0], zip(list(tqdm(map(np.mean, get_bootstrap_interval(russian_pd.LEN.values, 100)), total=100)), list(tqdm(map(np.mean, get_bootstrap_interval(english_pd.LEN.values, 100)), total=100))))))

print('Разница средних')
print(stat_quantile(delta_means))


По итогу результат примерно следующий:
Средняя длина английского слова — [9.4331, 9.4519], русского — [10.9127, 10.9224]

Мне почему-то кажется что в сложившейся ситуации, пиратство не столь критично, особенно при условии того что защита игры изначально толком отсутствовала, а нынешние продажи игры показывают печальные результаты. Тут возможен путь исправления и полировки игры к моменту выхода крупных DLC, что вернёт костяк старых игроков и «приманит» новых.

С другой стороны, я склонен полагать что у CDProject есть очень «преданная» часть активных игроков, которые при виде возможности помочь в разработке непременно предоставят свои силы, и в итоге, исправляться будет не экономика игры (не следил за хот. фиксами, буду рад если я ошибаюсь и меня поправят), а отсутсвие контента (что лично для меня самая больная тема, связанная с игрой).

*Я не говорю что пиратство это хорошо.

Киберпанк спасёт только open-source :)

Информация

В рейтинге
Не участвует
Зарегистрирован
Активность