Обновить
128K+

Big Data *

Большие данные и всё о них

140,7
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Как перенести сертификаты и значки Databricks при смене работодателя

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели3.2K

Рынок ИТ нестабилен, и люди могут менять работодателей. Ваша предыдущая компания была партнером Databricks, и у вас был аккаунт в Databricks Partner Academy с сертификатами, значками и информацией о пройденных курсах. В новой компании у вас новый аккаунт, а ваши предыдущие достижения и сертификаты остаются в предыдущей компании. Оказывается, вам не нужно проходить все заново. Вы можете перенести всю свою историю.

Читать далее

Новости

RAG в медицинской аналитике: как построить управляемый контур вместо очередного чат‑бота

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели7.2K

Медицинская организация одновременно работает с электронными медицинскими картами, результатами исследований, врачебными заключениями, клиническими рекомендациями, внутренними регламентами, отчётностью и аналитическими витринами. Проблема состоит не только в объёме информации. Эти данные имеют разную структуру, обновляются с разной скоростью и доступны разным группам пользователей.

BI-система хорошо показывает показатель и его изменение, но обычно не отвечает на вопросы, какие документы связаны с отклонением, что происходило с конкретным процессом и на какие источники опирается объяснение. Большая языковая модель умеет формулировать связный ответ, но без контролируемого контекста может использовать устаревшие сведения, смешивать факты и правдоподобные предположения.

Здесь появляется RAG, или Retrieval-Augmented Generation. Но в медицинской среде я бы рассматривал его не как чат-бота и тем более не как автономного медицинского советника. Более полезная модель - управляемый слой между данными, документами, аналитическими системами и пользователями.

Читать далее

Выбор Kafka UI: сравнение популярных инструментов для Apache Kafka от VK Data Platform

Время на прочтение12 мин
Охват и читатели8K

Apache Kafka — популярная система потоковой обработки событий, предназначенная для сбора, хранения и передачи больших объемов данных в режиме реального времени. Она используется тысячами компаний и разработчиков для построения высокопроизводительных, отказоустойчивых и масштабируемых решений в области аналитики данных, IoT, микросервисов и многих других сфер.

Однако у Kafka есть один важный нюанс: «из коробки» у нее нет графического интерфейса (GUI), что затрудняет понимание текущего состояния кластера, диагностику неполадок и эффективное управление инфраструктурой и самим сервисом, особенно для начинающих пользователей или тех, кому сложно взаимодействовать с консольными инструментами.

Поэтому для комфортной работы с Apache Kafka активно используются специализированные UI-инструменты. Например, ранее для облачного сервиса Managed Kafka от VK Cloud мы использовали Provectus Kafka UI, но в рамках развития сервиса решили заменить UI на более современный и функциональный.

Меня зовут Никита Суровегин. Я продукт-менеджер в команде VK Data Platform, VK Tech. В этой статье я расскажу, с чего мы стартовали, какие инструменты проанализировали и что выбрали в итоге.

Читать далее

Из Oracle в PostgreSQL одним INSERT: DuckDB как ETL без Oracle-клиента

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.6K

Когда говорят о DuckDB, обычно вспоминают аналитику: локальные запросы к Parquet, быстрые агрегации, ноутбуки. Но у него есть свойство, к аналитике отношения не имеющее: он умеет соединять источник и приёмник данных внутри одного SQL-плана. С расширениями для Oracle и PostgreSQL перенос данных сводится к одному запросу — без Instant Client, без OCI, без Python и без промежуточных файлов. А если одной сессии Oracle мало, чтение разбивается на параллельные шарды, читающие один согласованный снимок по единому SCN.

Читать далее

Предзаказ на книгу: «Data integration. Объединение данных для улучшения процесса принятия решений»

Время на прочтение2 мин
Охват и читатели5.8K

Привет, Хаброжители! Совсем недавно мы открыли предзаказ на книгу:«Data integration. Объединение данных для улучшения процесса принятия решений». Мы хотим немного больше вам о ней рассказать.

Джей Бортен дает подробное практическое руководство по интеграции данных — от базовых понятий и терминологии до реального сквозного примера, который шаг за шагом превращает разрозненные источники в работающий конвейер на AWS, Qlik, Databricks и Confl uent. Независимо от того, разбираетесь ли вы в теме, впервые приступили к этой задаче или хотите систематизировать уже накопленный опыт, идеи и практические примеры Бортена помогут вам выстроить эффективную работу с данными в компании.

Читать далее

Теория и практика DWH: все виды SCD по Кимбаллу

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели12K

Разбор всех видов SCD (slowly changing dimensions) по Кимбаллу:
— от простого к сложному
— на примерах
— с цитатами Кимбалла

В конце обзора — заполненная шкала со всеми типами и подсказками

Читать далее

Инфраструктура данных 2052: что, если у данных больше не будет «прода» и «истории»?

Время на прочтение8 мин
Охват и читатели10K

Если мысленно вернуться в 1980-е, аналитика во многом находилась буквально над production

Данные появлялись в операционных системах, затем из них строились отчёты, выгрузки и аналитические витрины. Постепенно мы начали выносить аналитику подальше от production: появились отдельные хранилища, ETL, data warehouse, затем data lake, lakehouse и, наконец, огромный набор специализированных систем для streaming, batch, realtime и research

Каждый раз мы решали вполне реальные проблемы своего времени. Но вместе с этим постепенно привыкли к довольно странной модели:

production хранит настоящее, data lake - прошлое, Kafka - поток, а research живёт где-то ещё

И вот здесь мне стало интересно немного заглянуть вперед...

А что, если в 2052 году мы перестанем воспринимать всё это как разные сущности?

Опираясь не на фантазии, а на то, что смог найти в технических блогах - не концепты, а реальные прототипы

Если не хотите много читать, в конце статьи вся суть одной картинкой

Читать далее

TrueForge: открытая обвязка, которая превращает LLM в полноценного агента

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели10K

Собрать демо-агента сегодня несложно. Подключаешь модель, добавляешь пару инструментов — и она уже читает файлы, вызывает API и бодро обещает выполнить любую задачу.

Сложности начинаются, когда такого агента нужно запустить в проде.

Кто будет хранить состояние между запросами? Как пережить перезапуск? Где выполнять сгенерированный код? Как не передать ему секреты? Когда запрашивать подтверждение пользователя? Что делать, когда контекст разрастается до сотен тысяч токенов?

Глубже

BACamp: как мы запустили школу бизнес‑анализа и что из этого вышло

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7K

У нас было 14 лекцией и столько же практических семинаров, 100 заявок в первый день запуска, множество кейсов и теоретической базы всех цветов и размеров, 36 участников и 5 матёрых наставников, защита итоговых проектов. Не то, чтобы это был необходимый минимум для решения кадрового вопроса. Но если начал делать «Нешколу» для поиска бизнес-аналитиков – становится трудно остановиться. 

Привет, Хабр, на связи Мария и Александр из департамента бизнес-анализа в ecom.tech. В этой статье мы расскажем, как запустили открытую школу бизнес-анализа, не тратя ни рубля на маркетинг. Поехали!

Читать далее

Как мы автоматизировали обработку входящих клиентских обращений

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели6K

Привет, Хабр! Меня зовут Дмитрий Тимохин, я лидер команды ML CRM «Кластер CRM и клиентский опыт» в ВТБ. В этой статье расскажу, как мы разрабатывали сервис анализа и категоризации клиентских обращений для центра клиентской поддержки корпоративно-инвестиционного бизнеса (ЦКП КИБ). 

В реальных бизнес-процессах автоматизировать клиентскую поддержку довольно непросто. Клиентские обращения редко представляют собой один цельный текст с понятным запросом: это звонки, чаты и письма одновременно, оборванные фразы, переключение между несколькими темами внутри одного диалога и неполные данные из разных источников.

Как собрать из этого потока единое обращение, выделить необходимую информацию, чтобы корректно решить проблему клиента?

Разберемся в статье.

Читать далее

От LLM-портала до фабрики внутренних агентов: как в Авито строят корпоративного ассистента «Виталик»

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели9.7K

По данным McKinsey, к концу 2025 года 71% компаний пробовали интегрировать искусственный интеллект как минимум в один из бизнес-процессов. Звучит мощно, но по отчётам MIT из всех пилотов в реальный продакшн переезжают около 5%.

Разрыв между демо и реальностью заключается в том, что продакшн-готовое решение должно отвечать на сложные вопросы: 

- как из множества разносторонних источников выбрать ту информацию, которая приведёт к успешному выполнению процесса?

- как обогатить языковую модель инструментами, при помощи которых она может довести процесс до конца?

- как оценить качество траектории, по которой движется модель, пока решает задачу?

Мы нашли ответы на эти вопросы с помощью системы, которая постепенно превращает внутренние знания и процессы Авито в корпоративных агентов. Расскажу про неё подробнее.

Привет! Меня зовут Никита, я старший DS-инженер в Авито. В этой статье расскажу, как мы строили «Виталика» — нашу корпоративную экосистему ИИ-агентов. Отвечу на три главных вопроса: как процесс становится агентом, как сделать систему production-ready и куда развивать её дальше.

Статья будет полезна ML-инженерам, AI-архитекторам и техническим лидам, которые строят агентные системы на базе LLM в корпоративной среде.

Читать далее

Как продвигать твиты в X: разбираем рекомендательный алгоритм Twitter

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели10K

13 августа сайт X опубликовал значительно обновлённую версию исходного кода рекомендательной ленты. В репозитории под лицензией Apache 2.0 выложили код модели Phoenix, реальные значения основных коэффициентов ранжирования, механизмы отбора кандидатов, фильтрации видимости, поддержки новых авторов и обеспечения разнообразия ленты.

Заметная доля пользователей X предпочитает называть сайт микроблогов по старинке — Twitter. Другая неискоренимая вредная привычка — чтение алгоритмической ленты. Чтобы увеличить охват микроблога, было бы неплохо хотя бы в общих чертах разобраться, как работает рекомендательный алгоритм, а затем рассмотреть все основные коэффициенты. Этим в данной статье мы и займёмся.

Читать далее

Учим небольшую LLM с нуля: гибридное внимание, XSA, доменные бленды и загадки роста онлайн-бенчмарков

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели8.2K

Обучение LLM — это в первую очередь инфраструктурная задача: нужен пайплайн, который можно перезапускать с новыми данными, архитектурой или другим расписанием обучения и получать повторяемый внутри команды результат. В этом материале — рассказ команды обучения и инференса моделей RWB о том, как мы с нуля, без загрузки pretrained-весов, обучили текстовую модель на основе гибридной архитектуры Qwen3.5-2B-Base и какие выводы сделали по пути — от сборки датасетов до чтения графиков онлайн-оценки.

Читать далее

Ближайшие события

У каждой системы своя правда. Кто решает, какая из них корпоративная?

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели12K

Корпоративную НСИ не всегда можно «сначала почистить», потому что иногда единого корпоративного объекта данных ещё нет. Разные системы могут содержать разные, но обоснованные части одного объекта. Тогда задача проекта – не выбрать самую удобную базу, а определить, где возникает каждый значимый факт, кто отвечает за его смысл, какой источник считается авторитетным и кто завершает спор. Эту неопределённость удобно разбирать через карту источников и ответственности за данные.

Читать далее

Где искать темы и материалы для PhD в ML/AI: 10 бесплатных ресурсов

Время на прочтение3 мин
Охват и читатели7.8K

Если вы занимаетесь ML / AI, Computer Science или научными исследованиями, диссертации могут быть очень полезным источником идей для research.

🔬 Если вы занимаетесь ML/AI research — сохраните этот пост.

Здесь собрала 20 бесплатных ресурсов, где можно искать:

🎓 PhD-диссертации
🏆 архивы лучших ML/AI-конференций
📚 научные статьи
🧠 research ideas и research gaps
📊 datasets и новые направления исследований

Читать далее

Торговый бот за 60 минут: гайд с нуля без знаний программирования и рынка

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели15K

Перед тем как писать эту статью, я сделал небольшой ресёч: посмотрел, что уже есть на Хабре по разработке торговых ботов и гайдам в формате «с чего начать»

Одни слишком простые, другие заточенные на одну стратегию, не нашел чего-то такого, что было бы как минимальной базой для начала

Не учить одной конкретной стратегии, а собрать минимальный рабочий фреймворк, который можно взять за основу и дальше развивать под себя

Поэтому в статье мы с нуля соберём торгового бота, который умеет получать рыночные данные, принимать решение, выставлять заявку, проверять состояние позиции и фиксировать результат сделки

И да - всё это попробуем сделать примерно за 60 минут Вся необходимая информация будет здесь, никуда переходить не нужно - статья полностью самостоятельная

Спойлер: Собранный бот заработал за 5 минут 22 цента, сделки приложил в конце статьи, можно их проверить если сомневаетесь

Читать далее

Предиктивное обслуживание в промышленности: три системных условия, без которых технологии не работают

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.4K

Сотни миллиардов вложены в IIoT, предиктивную аналитику и цифровые двойники. Но часто проекты предиктивного ТОиР достигают технологического успеха — и операционного провала: модели верно прогнозируют отказы, а оборудование по-прежнему ремонтируют «по факту».

В статье разбираю три условия, без которых предиктивная диагностика не становится частью реальной работы.

Читать далее

Пишем свой Native Filter плагин для Apache Superset: пошаговый рабочий туториал

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.9K

Всем привет! Меня зовут Александр Цай, я ведущий инженер-аналитик в МТС Web Services.
Занимаюсь всем, что связано с данными и ИИ. Найти, заполучить, обработать, спроектировать, развернуть — это все ко мне.

Опущу все нудные подробности, решили мы развернуть себе Superset 6.1.0 — последнюю версию, но столкнулись с тем, что заказчику категорически не нравится штатный фильтр по датам и он не хочет пересаживаться со своего BI, а хочет он календарик. А еще — пару плагинов с оглядкой на PowerBI. Поэтому встал вопрос создания собственного плагина-фильтра.

Казалось бы, задача несложная. Пара-тройка гайдов в en сегменте имеется, есть даже документация и штатный генератор шаблонов. Но по факту оказалось, что все это не работает. Генератор так вообще не обновлялся аж с 2024 года: выдает шаблон, который ссылается на уже несуществующие классы и типы, что автоматически делает все гайды неактуальными…

А что все это значит? Время написать свой собственный!
Об этом и расскажу в сегодняшнем материале. 

Дисклеймер: Я питонист до мозга костей и в тайпскрипте, да и фронте в целом, понимаю не очень много. Простите меня, адепты сего языка программирования, но код самого плагина навайбкожен (хоть и проверен насколько я смог).
В npm не запушил тоже умышленно, цель статьи дать исходники и показать, как можно собрать плагин. Любой желающий может что-то додумать и доработать, собрать или разобрать и так далее.

Читать дальше

Почему Илону Маску не удается создать по-настоящему правдивую нейросеть?

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.6K

Илон Маск как одержимый выпускает на рынок все новые модели своей нейронной сети Grok, и 12 августа уже стала доступной версия 4.6, но, хотя он постоянно подчеркивает, что его детище является максимально правдивым ИИ, правдивость ответов Grok в некоторых случаях не обеспечивает. Это не случайно – в модели содержится принципиальный дефект – она не владеет научными правилами отличия правды от лжи и заблуждений. Чтобы исправить этот дефект, к алгоритмам обучения SFT и RL следует добавить новый – НРД.

Несколько лет назад Илон Маск захотел создать альтернативу ChatGPT – нейросеть TruthGPT, в которой упор был бы сделан на поиск правды, однако что-то пошло не так, и у него получилась в 2023 году нейросеть Grok, у которой из-за минимальной цензуры существует значительный риск воспроизведения непроверенных данных, поэтому ее пользователям рекомендуют обязательно проверять факты.

Тем не менее, сам Илон Маск постоянно подчеркивает, что его детище является максимально правдивым ИИ, даже если эта истина иногда противоречит общепринятой точке зрения или политкорректности. Да и название нейросети, которое взято из романа Роберта Хайнлайна «Чужак в чужой стране», там использовалось в смысле интуитивного, глубинное понимание чего-либо. То есть претензии на правду остались, несмотря на другое название.

Маск считает, в частности, что другие нейросети содержат скрытые элементы идеологии разнообразия, равенства и инклюзивности (DEI), а это представляет серьезную угрозу, так как ИИ может из-за этого принимать неверные решения. Например, если ИИ научить, что разнообразие является единственным приемлемым результатом, то нейросеть может сказать, что у власти слишком много белых парней, и их надо просто казнить. А если, допустим, запрограммировать ИИ думать, что неправильное определение пола – это худшее, что может произойти, тот, чтобы гарантировать, что неправильное определение пола никогда не произойдет, решит просто уничтожить всех людей, так как это сведет к нулю  вероятность неправильного определения пола.

Читать далее

TabFM против XGBoost: 5 фактов, которых нет в релизе

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели11K

TabFM умеет получать предсказания по таблицам без обучения на конкретном датасете — и на бенчмарках уже обходит настроенный бустинг. Разбираемся, насколько убедительны эти результаты, где у модели заканчивается преимущество и что изменится для тех, кто держит табличный ML в проде.

Читать далее
1
23 ...