Big Data *

Большие данные и всё о них

СтатьиПостыНовостиАвторыКомпании

SergeyMarin 14 июн 2016 в 05:54

Школа Данных «Билайн», без перерыва на лето

1 мин

2.9K

Блог компании билайн бизнесBig Data * Data Mining * R * Алгоритмы *

Итак, 20 июня мы запускаем наш следующий курс для аналитиков. Для тех, кто летом в Москве и хочет посвятить это время учебе. Следующий курс для менеджеров стартует 5-го июля.

Отзывы по нашим предыдущим курсам можно почитать здесь.

К нам часто поступают вопросы касательно того, как подготовиться к нашему курсу, где изучить Python или математику.

Специально для тех, кто хотел бы развиваться в направлении анализа данных, но чувствует потребность подтянуть знания по математике или программированию мы запустили наш новый курс: Введение в Data Science.

Читать дальше →

varagian 13 июн 2016 в 06:19

Граф цитирования статей Хабрахабра

5 мин

22K

Big Data * Data Mining * Визуализация данных * Математика *

Однажды, мне стало интересно: насколько статьи на Хабре связаны между собой? Поэтому сегодня мы займемся исследованием связности статей, и конечно не только посчитаем численные метрики, но и увидим картину целиком.

(это не просто картинка для привлечения внимания, а граф цитирования статей внутри Хабрахабра, где размер вершин определяется числом входящих рёбер, i.e., "количеством цитат внутри Хабра")

Началось всё с того, что в комментариях к статье про Хабра-граф и карму Tiberius и Loriowar озвучили идею, фактически витающую в воздухе: а почему бы не взглянуть на граф цитирования статьёй внутри самого Хабра?

Вы спрашивали? Мы отвечаем. Для того чтобы рассказ не был размахиванием рук, конкретизируем разбираемые вопросы:

Q₁: Как выглядит граф цитирования Хабрахабра и какие в нём хабы (hubs and authorities)?
Q₂: Насколько связным является сообщество (граф цитирования) и какие в нём кластеры?
Q₃: Как изменится граф, если из него убрать самоцитирование?

Под катом трафик. Все картинки кликабельны.

Читать дальше →

+60

RCNTEC 9 июн 2016 в 14:23

Импортозамещение в сфере систем хранения данных: где искать российские решения?

3 мин

4.1K

Big Data *

Recovery Mode

На фоне высокого курса валют и сложной геополитической ситуации, которая может грозить также срывами поставок оборудования или прекращением доступа к технологиям для некоторых российских компаний, заказчики ищут возможные пути минимизации рисков при модернизации инфраструктуры. На первый план выходят решения, способные заменить импорт.

Рассказывает Владимир Колганов, руководитель направления систем хранения данных компании КРОК:
«Мы со своей стороны исследуем рынок, подбирая рабочие варианты с замещающим потенциалом. Так, только за последний год в нашей лаборатории протестировано порядка шести решений различных российских и восточных производителей".

Читать дальше →

-15

rzykov 7 июн 2016 в 13:50

Курс молодого бойца для Spark/Scala

3 мин

27K

Блог компании Retail RocketBig Data * Data Mining * Hadoop * Scala *

Хабр, привет!

Команда Retail Rocket использует узкоспециализированный стек технологий Hadoop + Spark для вычислительного кластера, о котором мы уже писали обзорный материал в самом первом посте нашего инженерного блога на Хабре.

Готовых специалистов для таких технологий найти довольно сложно, особенно, если учесть, что программируем мы исключительно на Scala. Поэтому я стараюсь найти не готовых специалистов, а людей, имеющих минимальный опыт работы, но обладающих большим потенциалом. Мы берем даже людей с частичной занятостью, чтобы было удобно совмещать учебу и работу, если кандидат — студент последних курсов.

Читать дальше →

+15

NNikolay 6 июн 2016 в 05:55

Наблюдаем за пользователем – два типа timestamp

2 мин

10K

Data Mining * Data Engineering * Big Data *

Давным-давно, один специалист по базам данных (из тех, бородатых и уже седых) сказал мне, что метки времени (timestamp) — это самая сложная тема в базах данных. Я ему, правда, не поверил, но приколы со временем реально встречаются.

Есть стандартная проблема, которую часто вижу в чужих данных. Положим собрались вы отслеживать события/действия пользователя. Обычно у вас будет это делать некий код (JS в вебе или SDK для аппов), который будет слать данные серверу.

Каждому событию нужна метка времени. И есть выбор из двух: локальное время на клиенте или время получения события сервером. Один хороший совет что делать и загадка без ответа под катом

Читать дальше →

saintp16 31 мая 2016 в 08:46

Облачный дайджест #6: Работа с данными и безопасность

2 мин

3.5K

Big Data * Разработка под e-commerce *

Читать дальше →

ITI_Capital 30 мая 2016 в 08:29

Технологии фондового рынка: 10 заблуждений о нейронных сетях

17 мин

55K

Блог компании ITI CapitalBig Data * Машинное обучение * Программирование *

Перевод

Нейронные сети – один из самых популярных классов алгоритмов для машинного обучения. В финансовом анализе они чаще всего применяются для прогнозирования, создания собственных индикаторов, алгоритмического трейдинга и моделирования рисков. Несмотря на все это, репутация у нейронных сетей подпорчена, поскольку результаты их применения можно назвать нестабильными.

Количественный аналитик хедж-фонда NMRQL Стюарт Рид в статье на сайте TuringFinance попытался объяснить, что это означает, и доказать, что все проблемы кроются в неадекватном понимании того, как такие системы работают. Мы представляем вашему вниманию адаптированный перевод его статьи.

Читать дальше →

+11

ibegtin 30 мая 2016 в 08:27

Перепись российского и русскоязычного сообщества по открытым данным

1 мин

Блог компании «Информационная культура»Проектирование API * Big Data * Открытые данные *

Вы все, наверняка, видите что мы уже много лет занимаемся темой открытых данных, организуем мероприятия, конкурсы, митапы и многое другое.

За эти годы в России сложилось активное сообщество и мы знаем что многие занимаются открытыми данными от участия в хакатонах до организации собственных мероприятий, проведения исследований и не только.

Где-то нам удаётся взаимодействовать с представителями государства, где-то пока нет, а где-то чиновники сами являются инициаторами проектов по открытых данных.

И вот, чтобы понять кто-то происходит в нашей большой стране, мы организуем перепись сложившегося сообщества.

Для участия просим Вас заполнить анкету по адресу — https://infoculture.typeform.com/to/QXF6a6

Читать дальше →

1cloud 30 мая 2016 в 07:21

Работа с данными: Как это делают крупные компании

5 мин

10K

Блог компании 1cloud.ruИнтернет вещейРазработка под e-commerce * Big Data *

/ фото Jason Tester Guerrilla Futures CC

Компания IDC сообщает, что в 2011 году человечеством было сгенерировано 1,8 зеттабайт информации. В 2012 году эта цифра составила уже 2,8 зеттабайт, а к 2020 она увеличится до 40 зеттабайт.

Существенную часть этих данных генерируют крупные мировые компании, такие как Google, Facebook, Apple. Им нужно не просто хранить данные, но и выполнять резервное копирование, следить за их актуальностью, обрабатывать, причем делать это с минимальными затратами. Поэтому ИТ-отделы крупных организаций разрабатывают собственные системы для решения этих задач.

Читать дальше →

MagisterLudi 28 мая 2016 в 18:11

Всероссийская инженерная олимпиада для старшеклассников: BigData и Интеллектуальные энергетические системы

23 мин

15K

Big Data * Занимательные задачкиМатематика * Машинное обучение * Промышленное программирование *

— Вовочка, бросай свои эксперименты с холодным ядерным синтезом, иди к ЕГЭ готовься.
— Ща, мам.

Олимпиады — это круто. Они позволили такому ~~раздолбаю~~ свободолюбивому и умном, как я, поступить в университет без экзаменов.

Помню пришли мы в приемную комиссию с приятелем, в шортах и с рюкзаками, в которых были полотенца и волейбольный мяч, заполнили анкеты, выложили по пачке дипломов с олимпиад и поехали на море.

— Что вы сегодня на час опоздали?
— Да так, в универ поступали.

Я очень рад, что нашлись инициативные ребята, которым не все равно, что талантливый школьник-инженер тратит свои последние беззаботные годы, судорожно готовясь к сдаче ЕГЭ, вместо того, чтобы строить реактивные ранцы или программировать зародыш искусственного интеллекта.

Чтобы создать лазейку для молодых талантливых инженеров, они придумали следующую штуковину — давайте замутим инженерную олимпиаду, которая дает возможность поступить в вуз.

Недавно в ВДЦ «Орленок» прошел «тест-драйв» Всероссийской инженерной олимпиады. Участвовали 5000 детей со всей России, до финала дошли около 100 человек. Призов много, но самое полезное — по +10 очков к ЕГЭ.

Я за всем присматривал и готов поделиться своими впечатлениями.

Олимпиада шла по четырем профилям.

Большие данные и машинное обучение.
Интеллектуальные энергетические системы.
Космические системы.
Автономные транспортные системы.

Про первые два профиля расскажу здесь (чуток задач и фоток), про вторые два — немного попозже на GT.
(UPD — отчет про «Космические системы».)

Читать дальше →

+23

diourinski 26 мая 2016 в 19:15

Не мы такие — жизнь такая: Тематический анализ для самых нетерпеливых

13 мин

16K

Блог компании SurfingbirdСемантические сети * Машинное обучение * Data Mining * Big Data *

Почему?

Сейчас Relap.io генерирует 40 миллиардов рекомендаций в месяц на 2000 медиаплощадках Рунета. Почти любая рекомендательная система, рано или поздно, приходит к необходимости брать в расчет содержимое рекомендуемого контента, и довольно быстро упирается в необходимость как-то его классифицировать: найти какие-то кластеры или хотя бы понизить размерность для описания интересов пользователей, привлечения рекламодателей или еще для каких-то темных или не очень целей.

Задача звучит довольно очевидно и существует немало хорошо зарекомендовавших себя алгоритмов и их реализаций: Латентное размещение Дирихле (LDA), Вероятностный латентно-семантический анализ (pLSA), явный семантический анализ (ESA), список можно продолжить. Однако, мы решили попробовать придумать что-нибудь более простое, но вместе с тем, жизнеспособное.

Читать дальше →

+17

codezombie 19 мая 2016 в 02:07

R в Microsoft Azure для победы на хакатоне. Инструкция по применению

9 мин

7.3K

Big Data * Microsoft Azure * R * Машинное обучение *

Стандартный план любого хакатона ↓
Microsoft Azure Machine Learning Hackathon

R, один из популярнейших языков программирования среди data scientist'ов, получает все большую и большую поддержку как среди opensource-сообщества, так и среди частных компаний, которые традиционно являлись разработчиками проприетарных продуктов. Среди таких компаний – Microsoft, чья интенсивно увеличивающая поддержка языка R в своих продуктах/сервисах, привлекла к себе и мое внимание.

Одним из «локомотивов» интеграции R с продуктами Майкрософт является облачная платформа Microsoft Azure. Кроме того, появился отличный повод повнимательнее взглянуть на связку R + Azure – это проходящий в эти выходные (21-22 мая) хакатон по машинному обучению, организованный Microsoft.

Хакатон – мероприятие, где ~~кофе~~ время чрезвычайно ценный ресурс. В контексте этого я ранее писал о best practices обучения моделей в Azure Machine Learning. Но Azure ML – это не инструмент для прототипирования; это скорее сервис для создания продукта с SLA со всеми вытекающими отсюда затратами как на время разработки, так и на стоимость владения.

R же прекрасно подходит для создания прототипов, для копания (mining) в данных, для быстрой проверки своих гипотез – то есть
всего того, что нам нужно на такого типа соревнованиях! Ниже я расскажу, как использовать всю мощь R в Azure – от создания прототипа до публикации готовой модели в Azure Machine Learning.

Читать дальше →

+14

XaocCPS 17 мая 2016 в 11:27

Анонс: 8 июня пройдет виртуальный форум Microsoft «Данные. Технологии. SQL Server 2016»

2 мин

3.6K

Блог компании MicrosoftBig Data * Microsoft Azure * Microsoft SQL Server *

Мы рады пригласить Вас на ключевое событие года в мире данных – Виртуальный Форум Microsoft «Данные. Технологии. SQL Server 2016», который состоится 8 июня 2016 года. Форум приурочен к выходу новой версии платформы управления данными Microsoft на базе SQL Server 2016, лидеру квадранта Gartner по системам управления базами данных*.

Успех цифровой трансформации бизнеса сегодня напрямую зависит от способности организации использовать передовые технологии и инструменты по работе с данными, которые становятся важнейшим ресурсом развития бизнеса – сравнимым, пожалуй, с ролью электричества в эпоху трансформации XIX века. В рамках форума мы обсудим, какие требования сегодня предъявляются к современным платформам по работе с данными, какие ключевые технологии must have в арсенале любой компании.

Основная программа форума состоит из трех паралельных технологических сесссий:

SQL Server 2016: новые стандарты в мире транзакции;
Бизнес-aналитика: SQL, Power BI, R, Mobile;
Azure: новое поколение решений для аналитики, Big Data& IoT.

Подробная программа доступна на сайте мероприятия.

Читать дальше →

AndreyIvanoff 13 мая 2016 в 11:55

Как работает кросс-девайс реклама: сложности и перспективы развития технологии

11 мин

16K

Блог компании DCA (Data-Centric Alliance)Big Data * Алгоритмы *

Введение

Все большее число пользователей выходят в сеть с помощью различных устройств. При этом взаимодействие рекламодателя с потенциальным покупателем происходит с использованием множества рекламных каналов. Часто, устройство с которого человек потребляет контент и определяет этот канал взаимодействия. Пользователь может заинтересоваться телевизионной рекламой или наоборот — отвлечься во время её показа для общения в социальной сети на мобильном телефоне или персональном компьютере. Потенциальный покупатель на своем пути от первого контакта с брендом или товаром до момента покупки может сменить не одно устройство, и при этом не всегда оно будет персональным.

Читать дальше →

Mykolauskas 11 мая 2016 в 15:27

Ожидания направлений развития в сфере хранения и обработки данных до 2020 года. Основные тренды

13 мин

Блог компании ua-hosting.companyBig Data *

Recovery Mode

Развитие ИТ-инфраструктуры — это неуклонный процесс, который был, есть и непременно будет, набирая все только большие обороты. Взяв очередную высоту стандартов осуществления своей деятельности, перед сетевыми инженерами открываются новые горизонты, достижение которых становится для них очередным вызовом и основой их повседневных трудов. Для успешного функционирования ИТ-компаний всегда было очень важным точно определить цели, направления развития, самые актуальные тренды ведь как можно наблюдать именно ИТ-сфера находится на самом острие технологического прогресса и особо подвержена внедрению нововведений. В древности, за возможностью заглянуть в день грядущий, люди обращались к оракулам и вещунам, сейчас же эту столь вакантную деятельность «окучивают» профессиональные ассоциации, проводя всевозможные опросы и создавая на их основе самые разносторонне направленные отчеты.

Именно таким отчетом, совсем недавно, порадовала ИТ-сообщество AFCOM(Association for Computer Operation Management). Предметом полномасштабного исследования стало функционирование дата-центров. Со слов представителей AFCOM представленный отчет является настоящим событием, поскольку охватил самые широкие слои специалистов задействованных в работе ЦОД(Центр Оброботки Данных). Сетевые инженеры, менеджеры, программисты и владельцы компаний-провайдеров в представленном докладе дадут нам более четкое виденье той ситуации, в которой отрасль находится сейчас и где она окажется в ближайшие 3-4 года. Далее в статье будут представлены основные акценты на которых базируется вышеупомянутый отчет, что претендует быть наиболее репрезентативным и наиболее актуальным среди всех аналогичных проведеных в 2015 году.

Читать дальше →

asash 11 мая 2016 в 09:40

Big Data от A до Я. Часть 5.1: Hive — SQL-движок над MapReduce

9 мин

101K

Big Data * Hadoop *

Туториал

Привет, Хабр! Мы продолжаем наш цикл статьей, посвященный инструментам и методам анализа данных. Следующие 2 статьи нашего цикла будут посвящены Hive — инструменту для любителей SQL. В предыдущих статьях мы рассматривали парадигму MapReduce, и приемы и стратегии работы с ней. Возможно многим читателям некоторые решения задач при помощи MapReduce показались несколько громоздкими. Действительно, спустя почти 50 лет после изобретения SQL, кажется довольно странным писать больше одной строчки кода для решения задач вроде «посчитай мне сумму транзакций в разбивке по регионам».

С другой стороны, классические СУБД, такие как Postgres, MySQL или Oracle не имеют такой гибкости в масштабировании при обработке больших массивов данных и при достижении объема большего дальнейшая поддержка становится большой головоной болью.

Собственно, Apache Hive был придуман для того чтобы объединить два этих достоинства:

Масштабируемость MapReduce
Удобство использования SQL для выборок из данных.

Под катом мы расскажем каким образом это достигается, каким образом начать работать с Hive, и какие есть ограничения на его применения.

Читать дальше →

+13

bbk 10 мая 2016 в 13:18

Объектное хранилище NetApp StorageGrid

9 мин

14K

Big Data *

В этой статье я отклонюсь от традиционной для меня темы систем хранения FAS и подниму тему объектного хранения данных в системах NetApp StorageGrid WebScale. Если кратко, то объектное хранение — это третий тип хранения наряду с NAS и SAN. Представьте себе, что каждый файл состоит из данных и метаинформации (владелец, права, время модификации и т.д.), так вот объектное хранение позволяет разъединить эти части и хранить их в виде «ключ/значение». Такой подход хранения информации открывает возможности децентрализованного, распределённого хранения данных огромных масштабов с прозрачной миграцией данных, репликацией и прозрачным переключением конечных потребителей между нодами объектного кластера. В широком смысле объектное хранилище может быть реализовано как на уровне устройства (жесткого диска), при помощи специализированных SCSI команд (Object-based Storage Device Commands), так и на уровне протокола доступа к системе хранения, которая состоит из нескольких дисков (которые, в свою очередь, вовсе не обязаны быть объектными). В обоих случаях используется Ethernet для подключения и IP протокол для передачи данных. Примером реализации объектного хранилища на уровне устройства являются жесткие диски линейки Seagate Kinetic Open Storage platform. Примером систем хранения данных в облаке может быть Microsoft Azure BLOB, Amazon S3. В этой статье я остановлюсь на объектных СХД, которые можно развернуть у себя на сайте и при необходимости подключить к облаку. Широкую популярность приобрели объектные протоколы S3, SWIFT, CDMI, все они являются надстройкой над HTTP.

Читать про Объектные Хранилища

Nazarenko_Roman 10 мая 2016 в 12:46

Укрощаем слона или что такое HUE

6 мин

40K

Java * Big Data *

Из песочницы

Пост будет о том, как сделать работу на Хадупе немного комфортнее.

В данной статье я хочу рассмотреть один из компонентов экосистемы Hadoop – HUE. Произносим правильно «Хьюи» или «Эйч Ю И», но не другими, созвучными с широко известным русским словом, вариантами.

Читать дальше →

1cloud 6 мая 2016 в 07:55

Как дата-центры меняются прямо сейчас: Энергоэффективность, хранение данных и «облака»

5 мин

12K

Блог компании 1cloud.ruBig Data * IT-стандарты * Анализ и проектирование систем *

На этой неделе мы говорили о плюсах и минусах виртуальной ИТ-инфраструктуры и рассказывали о том, как выбрать направление для развития ИТ-проекта на основе своего опыта работы над провайдером виртуальной инфраструктуры 1cloud.

Сегодня хотелось бы поговорить о технологических трендах и направлениях, которые развиваются в сфере хранения и управления данными, ИТ-инфраструктурой и дата-центрами. Появление новых технологий и подходов к построению инфраструктуры оказывает серьезное влияние на то, как сейчас выглядят дата-центры и на то, какими они будут уже в ближайшем будущем.

Читать дальше →

GemaltoRussia 4 мая 2016 в 07:00

Интернет пчел, или Зеленое будущее M2M приложений

7 мин

7.8K

Блог компании Gemalto RussiaBig Data * Геоинформационные сервисы * Информационная безопасность *

Все обсуждение вокруг феномена Интернета вещей обычно сводится к тем потенциальным преимуществам для бизнеса и к тем удобствам для пользователей, которые предлагают наши интеллектуальные устройства и объекты, окружающие нас в повседневной жизни. При этом многие аналитики не исключают вероятности того, что мы находимся на пороге второй цифровой революции.

Однако недавно прошедший День Земли натолкнул нас на идею рассмотреть вопрос шире – это был отличный повод изучить, каким образом Интернет вещей, и даже скорее индустриальный Интернет вещей (M2M – machine-to-machine), то есть беспроводная передача данных и информации между устройствами и объектами, сможет оказать благотворное влияние на нашу жизнь и будет способствовать устойчивому развитию и защите окружающей среды на нашей взаимосвязанной планете.

Читать дальше: Любопытные реализации IoT для 'зеленого' будущего

1 2 ...

165 166

167

168 169 ...

195 196

Big Data *

Школа Данных «Билайн», без перерыва на лето

Граф цитирования статей Хабрахабра

Импортозамещение в сфере систем хранения данных: где искать российские решения?

Курс молодого бойца для Spark/Scala

Наблюдаем за пользователем – два типа timestamp

Облачный дайджест #6: Работа с данными и безопасность

Технологии фондового рынка: 10 заблуждений о нейронных сетях

Перепись российского и русскоязычного сообщества по открытым данным

Работа с данными: Как это делают крупные компании

Всероссийская инженерная олимпиада для старшеклассников: BigData и Интеллектуальные энергетические системы

Не мы такие — жизнь такая: Тематический анализ для самых нетерпеливых

Почему?

R в Microsoft Azure для победы на хакатоне. Инструкция по применению

Анонс: 8 июня пройдет виртуальный форум Microsoft «Данные. Технологии. SQL Server 2016»

Ближайшие события

Как работает кросс-девайс реклама: сложности и перспективы развития технологии

Введение

Ожидания направлений развития в сфере хранения и обработки данных до 2020 года. Основные тренды

Big Data от A до Я. Часть 5.1: Hive — SQL-движок над MapReduce

Объектное хранилище NetApp StorageGrid

Укрощаем слона или что такое HUE

Как дата-центры меняются прямо сейчас: Энергоэффективность, хранение данных и «облака»

Интернет пчел, или Зеленое будущее M2M приложений

Вклад авторов