Ну я пока считаю золотой серединой ПК типа неттопов, Zotac (кажется так) например довольно компактные, прикрутил сзади на моник да и все. А обычного размера системники конечно неудобно.
Нужно что бы на нем работала винда. PXE, терминальный сервер или виртуальные рабочие станции например пока недоступны. Поскольку масштабы довольно большие то каждая тысяча-другая выльется в большую сумму.
Просто кошмарный маркетинг! Почему на картинке с порядком включения в первом варианте, не НР, Подключение и Вход в систему на разных картинках, а на втором, НР, они на одной? Ну и что, что в первом варианте между ними есть еще операция, это не означает, что можно объединить во втором.
Либо, если Подключение в первом случае это не тоже самое, что подключение во втором, назовите по разному эти операции.
Бросилось в глаза — «Не требует регистрации», а выше здоровая кнопка «Регистрация»!
И в ролике тоже говорится, что нужно зарегистрироваться. Настораживает ситуация.
Я ищу дубликаты новостей. Если А похож на Б, Б похож на С, но А не похож на С то А и С останутся, и это рпвильно. Например А это какая то новость, а С это более полный обзор этой новости, так пусть он останется. А если Б отличается от А парой слов, тотакое нам не надо, вот Б и будет удален. Так оно и надо, это нормально.
Спасибо за статью, только уж очень запутано, много незнакомых слов и нет практических примеров.
Сразу говорю я плохой математик, может свяязано с этим, может с чем то еще, но делаю так:
1. Чищю текст от мусора, примерно как сказано в этой статье;
2. Разбиваю на шинглы по 2 слова (тексты у меня небольшие, мне хватает);
3. Генерю хеш использую md5 (пробовал другие алгоритмы, но не покатило как то, хотя слышал, что это не самый быстрый алгоритм и плюс хеш получается символьно-числовой, а такой, опять же по слухам. сравнимать тяжелее чем чисто числовой);
4. Заливаю в БД (таблица из двух столбцов — doc_id и word_hash, названия взял из одной из предыдущих статей на эту тему);
5. В таблице в документами есть поля id, parent, percent (это конечно не все, но для примера больше и не надо, что бы не путать), поле parent указывает id документа наиболее похожего на текущий (значение по умолчанию 0), поле percent — процент похожести (значение по умолчанию -1);
6. Таблиц с хешами у меня две — основная и временная, в основной хранятся хеши уникальных документов, во временной еще не проверенных на уникальность;
7. В БД стоит event (можно и внешними средствами выполнять его фенкцию), который и обрабатывает с определенным интервалом временную таблицу, выполняя процедуру которая содержит такой запрос (конечно не только его, но именно этот запрос ищет ID документы с наибольшим количеством одинаковых с проверяемым документом шинглов):
SELECT t1.doc_id, count(t1.word_hash) AS parent into p_parent,p_c_doc_id
FROM items_hashes t1, items_hashes_tmp t2
WHERE t2.doc_id=p_item_id AND t1.word_hash=t2.word_hash
GROUP BY t1.doc_id
ORDER BY parent DESC
LIMIT 1;
Этот запрос используется в хранимой процедуре MySQL поэтому тут есть вещи типа «into p_parent,p_c_doc_id
» — сохраняем полученный значения в эти переменные и p_item_id — эта переменная содержит ID проверяемого документы, значение получает через курсор.
8. Затем выполняю:
SELECT 100/p_count*p_c_doc_id into p_percent;
p_count = количество шинглов в проверяемом документе, p_c_doc_id=количество идентичных шинглов в документе максимально похожем на проверяемый (как то не очень понятно предложение получилось, но глядя на звпросы будет все понятно, надеюсь).
9. После выясиления. если считаю документ оригинальным переношу его шинглы в постоянную таблицу, если документ признается дубликатом — его шинглы удаляются и в дальнейшем с ним уже ничего не сравнивается.
Вот примерно так, буду рад критике и предложениям. Надеюсь кому то это поможет понять.
про енота и евангелие не допишет т.к. я таких слов не использую, не припомню что бы использовал по крайней мере.
По поводу ограничений — интересная тема. Как бы проанализоровать например хабр (вот занул :) ) на количетво уникальных слов. Было бы очень иннтересно. Да и не тольо Хабр, любой сайт, потом бы сайты еще соревноваться начали у кого самый большой словарный запас, у кого малнький.
Выбор и нажатие Ентара можно заменить нажатием только одной кнопки — Tab или номер варианта.
Автодополнение постоянное и да, использовать словари конечно. Есть же и бесплатные и в некоторых ПО встроенные но доступные сторонним приложениям.
я наберу «у мня е» а остальное она за меня допишет и поставит пробел, это 4 нажатия экономия :) А сколько это в день\неделю\месяц\год будет? :)
Все таки я вижу пользу от такой вещи.
Не понял немного, причем он? Просто не обзавелся и всех функций не знаю. Кроме того программу для ПК предлагаю, а не для мобильных устройств. Хотя там она будет не менее, а может и более, востребована.
Только одно но — совершенное не подходит сборка на коленке, т.к. нужны сотни, если не тысячи, единиц техники и устанешь собирать в конце концов.
Либо, если Подключение в первом случае это не тоже самое, что подключение во втором, назовите по разному эти операции.
И в ролике тоже говорится, что нужно зарегистрироваться. Настораживает ситуация.
Сразу говорю я плохой математик, может свяязано с этим, может с чем то еще, но делаю так:
1. Чищю текст от мусора, примерно как сказано в этой статье;
2. Разбиваю на шинглы по 2 слова (тексты у меня небольшие, мне хватает);
3. Генерю хеш использую md5 (пробовал другие алгоритмы, но не покатило как то, хотя слышал, что это не самый быстрый алгоритм и плюс хеш получается символьно-числовой, а такой, опять же по слухам. сравнимать тяжелее чем чисто числовой);
4. Заливаю в БД (таблица из двух столбцов — doc_id и word_hash, названия взял из одной из предыдущих статей на эту тему);
5. В таблице в документами есть поля id, parent, percent (это конечно не все, но для примера больше и не надо, что бы не путать), поле parent указывает id документа наиболее похожего на текущий (значение по умолчанию 0), поле percent — процент похожести (значение по умолчанию -1);
6. Таблиц с хешами у меня две — основная и временная, в основной хранятся хеши уникальных документов, во временной еще не проверенных на уникальность;
7. В БД стоит event (можно и внешними средствами выполнять его фенкцию), который и обрабатывает с определенным интервалом временную таблицу, выполняя процедуру которая содержит такой запрос (конечно не только его, но именно этот запрос ищет ID документы с наибольшим количеством одинаковых с проверяемым документом шинглов):
SELECT t1.doc_id, count(t1.word_hash) AS parent into p_parent,p_c_doc_id
FROM items_hashes t1, items_hashes_tmp t2
WHERE t2.doc_id=p_item_id AND t1.word_hash=t2.word_hash
GROUP BY t1.doc_id
ORDER BY parent DESC
LIMIT 1;
Этот запрос используется в хранимой процедуре MySQL поэтому тут есть вещи типа «into p_parent,p_c_doc_id
» — сохраняем полученный значения в эти переменные и p_item_id — эта переменная содержит ID проверяемого документы, значение получает через курсор.
8. Затем выполняю:
SELECT 100/p_count*p_c_doc_id into p_percent;
p_count = количество шинглов в проверяемом документе, p_c_doc_id=количество идентичных шинглов в документе максимально похожем на проверяемый (как то не очень понятно предложение получилось, но глядя на звпросы будет все понятно, надеюсь).
9. После выясиления. если считаю документ оригинальным переношу его шинглы в постоянную таблицу, если документ признается дубликатом — его шинглы удаляются и в дальнейшем с ним уже ничего не сравнивается.
Вот примерно так, буду рад критике и предложениям. Надеюсь кому то это поможет понять.
По поводу ограничений — интересная тема. Как бы проанализоровать например хабр (вот занул :) ) на количетво уникальных слов. Было бы очень иннтересно. Да и не тольо Хабр, любой сайт, потом бы сайты еще соревноваться начали у кого самый большой словарный запас, у кого малнький.
Выбор и нажатие Ентара можно заменить нажатием только одной кнопки — Tab или номер варианта.
Автодополнение постоянное и да, использовать словари конечно. Есть же и бесплатные и в некоторых ПО встроенные но доступные сторонним приложениям.
Все таки я вижу пользу от такой вещи.