Обновить
8
Алексей@AleXeyS55

Пользователь

2
Подписчики
Отправить сообщение
Хорошо написано, читается приятно и не затянуто. Пишите еще, с удовольствием прочитаю, и можно даже подлиннее.
Ну я пока считаю золотой серединой ПК типа неттопов, Zotac (кажется так) например довольно компактные, прикрутил сзади на моник да и все. А обычного размера системники конечно неудобно.
Прям разгромил :)

Только одно но — совершенное не подходит сборка на коленке, т.к. нужны сотни, если не тысячи, единиц техники и устанешь собирать в конце концов.
Нужно что бы на нем работала винда. PXE, терминальный сервер или виртуальные рабочие станции например пока недоступны. Поскольку масштабы довольно большие то каждая тысяча-другая выльется в большую сумму.
Спасибо. Посмотрел проц — по производительно один в один как Атом. Мне нужно в Инет и видео оттуда FullHD смотреть и т.п.
Смотрел — дороже выходит, он же тут без памяти и диска, и диск там не простой нужен.
А кстати не подскажет кто неттоп около 10к и с процом х86 но не Atom? Засада просто какая то, все дороже гараздо.
Просто кошмарный маркетинг! Почему на картинке с порядком включения в первом варианте, не НР, Подключение и Вход в систему на разных картинках, а на втором, НР, они на одной? Ну и что, что в первом варианте между ними есть еще операция, это не означает, что можно объединить во втором.

Либо, если Подключение в первом случае это не тоже самое, что подключение во втором, назовите по разному эти операции.
Бросилось в глаза — «Не требует регистрации», а выше здоровая кнопка «Регистрация»!
И в ролике тоже говорится, что нужно зарегистрироваться. Настораживает ситуация.
Я ищу дубликаты новостей. Если А похож на Б, Б похож на С, но А не похож на С то А и С останутся, и это рпвильно. Например А это какая то новость, а С это более полный обзор этой новости, так пусть он останется. А если Б отличается от А парой слов, тотакое нам не надо, вот Б и будет удален. Так оно и надо, это нормально.
Спасибо за статью, только уж очень запутано, много незнакомых слов и нет практических примеров.
Сразу говорю я плохой математик, может свяязано с этим, может с чем то еще, но делаю так:
1. Чищю текст от мусора, примерно как сказано в этой статье;
2. Разбиваю на шинглы по 2 слова (тексты у меня небольшие, мне хватает);
3. Генерю хеш использую md5 (пробовал другие алгоритмы, но не покатило как то, хотя слышал, что это не самый быстрый алгоритм и плюс хеш получается символьно-числовой, а такой, опять же по слухам. сравнимать тяжелее чем чисто числовой);
4. Заливаю в БД (таблица из двух столбцов — doc_id и word_hash, названия взял из одной из предыдущих статей на эту тему);
5. В таблице в документами есть поля id, parent, percent (это конечно не все, но для примера больше и не надо, что бы не путать), поле parent указывает id документа наиболее похожего на текущий (значение по умолчанию 0), поле percent — процент похожести (значение по умолчанию -1);
6. Таблиц с хешами у меня две — основная и временная, в основной хранятся хеши уникальных документов, во временной еще не проверенных на уникальность;
7. В БД стоит event (можно и внешними средствами выполнять его фенкцию), который и обрабатывает с определенным интервалом временную таблицу, выполняя процедуру которая содержит такой запрос (конечно не только его, но именно этот запрос ищет ID документы с наибольшим количеством одинаковых с проверяемым документом шинглов):
SELECT t1.doc_id, count(t1.word_hash) AS parent into p_parent,p_c_doc_id

FROM items_hashes t1, items_hashes_tmp t2

WHERE t2.doc_id=p_item_id AND t1.word_hash=t2.word_hash

GROUP BY t1.doc_id

ORDER BY parent DESC

LIMIT 1;
Этот запрос используется в хранимой процедуре MySQL поэтому тут есть вещи типа «into p_parent,p_c_doc_id
» — сохраняем полученный значения в эти переменные и p_item_id — эта переменная содержит ID проверяемого документы, значение получает через курсор.
8. Затем выполняю:
SELECT 100/p_count*p_c_doc_id into p_percent;
p_count = количество шинглов в проверяемом документе, p_c_doc_id=количество идентичных шинглов в документе максимально похожем на проверяемый (как то не очень понятно предложение получилось, но глядя на звпросы будет все понятно, надеюсь).
9. После выясиления. если считаю документ оригинальным переношу его шинглы в постоянную таблицу, если документ признается дубликатом — его шинглы удаляются и в дальнейшем с ним уже ничего не сравнивается.
Вот примерно так, буду рад критике и предложениям. Надеюсь кому то это поможет понять.
Сори, похоже дела в эту сторону уже движутся, я рад.
Ждал выхода этой системы. Похоже зря. Даже смотреть не буду по причине боязни лицензии. Надеюсь на то, что автор одумается и сменит ее.
На экране поместится, я же указал что по 5 ариантом слова и словосочетаний. Ну и конечно это настраиваемо.
А в основном? Польза есть?
про енота и евангелие не допишет т.к. я таких слов не использую, не припомню что бы использовал по крайней мере.
По поводу ограничений — интересная тема. Как бы проанализоровать например хабр (вот занул :) ) на количетво уникальных слов. Было бы очень иннтересно. Да и не тольо Хабр, любой сайт, потом бы сайты еще соревноваться начали у кого самый большой словарный запас, у кого малнький.
Выбор и нажатие Ентара можно заменить нажатием только одной кнопки — Tab или номер варианта.
Автодополнение постоянное и да, использовать словари конечно. Есть же и бесплатные и в некоторых ПО встроенные но доступные сторонним приложениям.
ЧТо то интересно мне стало, сейчас тоже поставлю и попробую :)
я наберу «у мня е» а остальное она за меня допишет и поставит пробел, это 4 нажатия экономия :) А сколько это в день\неделю\месяц\год будет? :)
Все таки я вижу пользу от такой вещи.
Не понял немного, причем он? Просто не обзавелся и всех функций не знаю. Кроме того программу для ПК предлагаю, а не для мобильных устройств. Хотя там она будет не менее, а может и более, востребована.

Информация

В рейтинге
Не участвует
Откуда
Россия
Дата рождения
Зарегистрирован
Активность