Обновить
128K+

Хранение данных *

Что имеем, то храним

211,17
Рейтинг
Сначала показывать
Порог рейтинга

Дайджест Рег.облака за август

Август выдался насыщенным: ввели оплату ИИ-моделей по токенам, выпустили новый тариф со 192 ГБ видеопамяти, опубликовали два кейса по миграции, подвели итоги первого полугодия, провели вебинар по выделенным серверам и выложили несколько полезных статей на Хабре. Дальше — кратко о главном.

Запустили оплату ИИ-моделей по токенам

Добавили возможность оплаты по токенам на ИИ-платформе. Теперь можно подключаться к 29 LLM-моделям через OpenAI-совместимый API без развертывания собственной инфраструктуры. Этот формат рассчитан на компании, которые внедряют генеративный ИИ, но не готовы к затратам на выделенные GPU. 

Выпустили новый тариф со 192 ГБ видеопамяти

Внутри — две NVIDIA RTX 6000 Pro по 96 ГБ, 32 vCPU, 128 ГБ RAM и 1024 ГБ NVMe. Подойдет для крупных LLM, обучения моделей и генерации видео. Протестировать можно здесь.  

Опубликовали два новых кейса

В блоге вышли материалы с реальными примерами из практики:

Подвели итоги первого полугодия 2026 года

Опубликовали в блоге статью с аналитикой рынка и результатами Рег.облака за первые шесть месяцев года. Приток новых клиентов публичного облака за первое полугодие 2026 года вырос на 113% по сравнению с аналогичным периодом 2025-го. Общая база клиентов достигла 30 тысяч, а за последние 12 месяцев пользователи подняли 165,1 тысячи новых облачных серверов.

Провели вебинар по выделенным серверам

13 августа прошел вебинар, посвященный переходу с виртуальных серверов (VPS) на физические выделенные серверы (Bare Metal). Запись — по ссылке

Следующий вебинар — уже 17 сентября. Покажем, где S3 может заменить классические файловые хранилища, как встроить его в процессы разработки и эксплуатации и на что обратить внимание при выборе архитектуры хранения. Зарегистрироваться можно по ссылке.

Публиковали полезные статьи

В августе вышло несколько статей — если пропустили, читайте:

Мы продолжаем развивать сервисы для бизнеса и делать облачные технологии доступнее. Впереди — новые релизы, полезные материалы и еще больше кейсов. Спасибо, что с нами!

Теги:
+1
Комментарии0
UI
UI

Сделал S3-браузер в один HTML-файл (S3Feather)

TL;DR: один index.html, открываешь в браузере, работаешь с бакетом. Без установки и сервера. AWS, MinIO, Cloudflare R2 и вообще любой S3-совместимый. Потыкать, код.

Почему AWS Console медленная и перегруженная. Cyberduck надо ставить, на телефоне не работает. А хотелось просто открыть вкладку в браузере и перекинуть файлы, где бы ни был. Веб-приложение с бэкендом не хотел, потому что надо где-то хостить и думать про ключи. В итоге пришёл к тому, что вся логика живёт в браузере. SigV4 подписывается на клиенте, CORS настраивается на бакете, никакого прокси нет.

Как устроено Один файл: HTML, JS, CSS, логика подписи запросов. Открываешь локально или хостишь чоб было доступно везде, ну или уже захосченый - линк выше.

Ключи живут в sessionStorage, закрыл вкладку, исчезли. Если надоедает вводить каждый раз, можно сохранить подключения в зашифрованный файл. Кинул его в облако, открыл на телефоне, ввёл пароль, всё.

Что умеет

  • Листинг, загрузка, скачивание, удаление

  • Несколько файлов сразу в ZIP прямо в браузере

  • Presigned-ссылки для шаринга

  • Drag and drop

  • Адресная строка с s3:// и командная палитра по Ctrl+K

  • Flatten-режим: показывает всё рекурсивно плоским списком, когда помнишь имя файла но не помнишь папку

На Android качал файлы пакетами по несколько гигабайт, работает нормально.

Буду рад фидбеку, особенно от тех кто использует нестандартные S3-совместимые хранилища.

Теги:
+8
Комментарии1

Laconian: короткий ответ без потери смысла

Сделал Laconian - agent skill, построенный вокруг принципа the shortest complete answer. Не самый короткий ответ вообще, а самый короткий из тех, которые остаются корректными и практически полезными.

Логика простая: сначала определить полный ответ, затем удалить только то, без чего не пострадают точность, безопасность, существенные факты, ограничения и требования пользователя.

Skill убирает приветствия, пересказ запроса, незапрошенное описание процесса, повторы и декоративные выводы. При этом сохраняет важные оговорки, неопределённость, нужную детализацию, код, команды, числа, URL и другие данные, точная форма которых имеет значение.

Вся пользовательская часть проекта — один файл SKILL.md. В нём нет скриптов, зависимостей, сетевых вызовов, дополнительных разрешений или привязки к инструментам конкретной платформы.

В репозитории также развивается открытый benchmark: Laconian сравнивается с baseline, обычной инструкцией Answer concisely. и Caveman. Инфраструктура уже работает, но публичных результатов пока нет — поэтому пока не заявляю о выигрыше в длине, качестве или стоимости раньше данных.

Ссылки

Теги:
+4
Комментарии0

Юлий Гольдберг (GlowByte): Lakehouse — уже не экспериментальное направление

В интервью на РБК руководитель направления GlowByte Юлий Гольдберг рассказал о том, как меняется рынок СУБД в России, почему Lakehouse перестал быть экспериментом и какие барьеры остаются у отечественных вендоров.

Ключевое из интервью:

Рынок СУБД: от срочного импортозамещения к зрелости. Заказчики всё реже ищут просто «российскую альтернативу» — они выбирают платформу под архитектуру данных, аналитику и ИИ-сценарии. При этом многие крупные компании не торопятся отказываться от Oracle и MS SQL: лицензии постоянные, системы «вылизаны», а миграция — дорогой и долгий проект.

Главный тренд — переход к Lakehouse. Вместо монолитных СУБД (Oracle, Teradata) — разделение хранения (S3+Parquet/Iceberg) и систем обработки (Spark, Trino, Impala). Подход доказал состоятельность: GlowByte совместно с Data Sapience за три года реализовали более 15 проектов, крупнейшие — на несколько петабайт данных.

Архитектура усложняется, но становится гибче. СУБД в новой парадигме — это набор взаимодополняющих компонентов. Можно собрать ровно то, что нужно, и не платить за лишнее. Но нагрузка на архитекторов и DevOps‑инженеров растет в разы.

Главный барьер — размер рынка. Российский рынок СУБД небольшой по сравнению с мировым, экспорт технологий затруднен. Инвестиции в продукты несопоставимы с зарубежными. Почти все российские СУБД, кроме ClickHouse и Tarantool, базируются на open source, а риски смены лицензий (как в случае с Greenplum) сохраняются.

ИИ меняет требования к СУБД. LLM и AI-агенты работают с неструктурированными данными — текстами, картинками. Традиционные СУБД заточены под структурированную информацию, а Lakehouse с S3-хранилищем и набором движков обработки закрывает этот пробел.

Критерии выбора СУБД на 2027 год: стоимость владения, горизонтальное масштабирование для крупных компаний, managed‑сервисы для небольших игроков.

Российский рынок СУБД на сегодня — это рынок различных клонов Postgres. Как ни смотри, хоть в штуках, хоть в деньгах. И вряд ли что-то здесь изменится в ближайшем будущем, тем более что Postgres тоже не стоит на месте и развивается туда, куда ждут потребители, — в область поддержки ИИ (pgvector, например) или в сторону параллелизма вычислений. Если кто-то и бросает вызов, то в конкретных нишах — как, например, Lakehouse в аналитических задачах на больших объемах данных, — говорит Юлий Гольдберг, GlowByte.

Читать интервью эксперта GlowByte в РБК

Теги:
+11
Комментарии0
https://vkvideo.ru/clip-237277610_456239029

Видео доступно по ссылке -> https://vkvideo.ru/clip-237277610_456239029

Давайте сегодня поговорим про бумажную безопасность, но не в привычном ее понимании: политики, контроли и комплаенс; а в буквальном смысле - безопасность информации, представленной на бумаге. Сотрудник ФБР (по крайней мере он так представился) на наглядных примерах показывает разницу между шредерами и качеством выполнения их работы.

На сегодня существует 3 типа уничтожителей бумаги: прямые, ромбовидные и конфетти. 
Первые уничтожают бумагу, разрезая ее на ровные полоски. При таком подходе собрать обратно пазл не составляет особого труда и занимает не более 1 часа на восстановление информации. Тоже самое относится и к банковским картам - получить номер карты, ФИО и CVV код займет от силы 1 минуту (30 секунд из которых вы будет искать кончик скотча, чтобы склеить ее обратно).

С ромбовидными сложнее, но восстановление тоже возможно, хотя и занимает намного больше времени. По информации сотрудника, собрать обратно документ составляет около 8 часов.

Самые лучшие, и которые стоят в офисах ФБР (спасибо за подсказку) - это шредеры, которые превращают документ в конфетти. При таком подходе собрать документ обратно не возможно (но тут бы я поспорил). 

Естественно, стоимость бумагоизмельчителей пропорционально растет в зависимости от качества уничтожения документов. С другой стороны, купить шредер ради шредера (первый вариант) - выглядит бездумной тратой денег. К сожалению, не всегда удается донести до закупки почему нужно покупать дорогую вещь, когда существует версии в 10 раз дешевле. 

И к слову сказать, мы в своей работе в рамках Red Team проектах нередко прибегаем к таким методам, так поиск информации в шредерах. Психология людей обычно сводится к тому, что раз документ прошел через измельчитель, значит информация безвозвратно уничтожена. Однако вы теперь знаете, что это далеко не так.
Так что, какой берем?

п.с. нас еще учили, чтобы безвозвратно уничтожить документ, его сначала сжигают, а потом просеивают через мелкозернистую сеть. К сожалению, таких устройств еще не существует, поэтому дарю бизнес-идею ;) 

🧠 Обязательно поделись с теми, кому это может быть полезно 💬 Телеграм | 💬 Max | 📝 Хабр | 💙 ВКонтакте

Теги:
-2
Комментарии11

Подборка вебинаров на август

В августе разберем, как быть во всеоружии на случай отказа ЦОД, выбрать инфраструктуру для ИИ-проектов и упростить работу со Spark-задачами. Регистрируйтесь, чтобы не пропустить.

Отказ ЦОД: выстраиваем защиту с DRaaS и BaaS
Разберем, как подготовиться к отказу дата-центра и выстроить защиту инфраструктуры с помощью Evolution Disaster Recovery и Evolution Agent Backup. Обсудим, чем отличаются DRaaS, BaaS, репликация и аварийное восстановление, а также как выбрать решение с учетом требований к непрерывности, скорости восстановления и безопасности.
🧑‍💻 Для кого: ИТ-директора, руководители инфраструктуры, системные администраторы и специалисты по информационной безопасности.
📅 Когда: 18 августа, 11:00 мск.
📍 Где: Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.

ИИ-проекты: когда и как переходить от API к Bare Metal
Расскажем, когда API для инференса перестает отвечать требованиям проекта и почему стоит переходить на выделенную инфраструктуру. Разберем, чем Evolution Bare Metal отличается от облачной виртуализации, как подобрать GPU-конфигурацию для инференса, обучения и дообучения моделей, а также как масштабировать ИИ-нагрузки.
🧑‍💻 Для кого: ML-инженеры, разработчики ИИ-продуктов, архитекторы и технические руководители.
📅 Когда: 25 августа, 11:00 мск.
📍 Где: Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.

Как ИИ помогает создавать и сопровождать Spark-задачи в облаке
Покажем, как Evolution Managed Spark с ИИ помогает создавать, запускать и анализировать Spark-задачи с помощью запросов на естественном языке. Разберем работу с данными в Evolution Object Storage, поиск причин ошибок, рекомендации по их устранению и оптимизацию производительности приложений.
🧑‍💻 Для кого: дата-инженеры, разработчики Spark-приложений, аналитики данных и DevOps-инженеры.
📅 Когда: 27 августа, 11:00 мск.
📍 Где: Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.

Теги:
+3
Комментарии0

Что, если бы на вопрос «почему просел показатель» отвечал не аналитик, а сам BI?

Партнер GlowByte – вендор FanRuan – представляет Dora: платформу, где поиск причины, сверку данных, сборку отчета и рассылку берут на себя ИИ-агенты. Работают они поверх ваших BI-активов – готовых моделей данных, метрик и прав доступа, а не по сырым таблицам.

На вебинаре четыре агента пройдут полный цикл вживую:

🔹 Дата-аналитик: отвечает на запросы к данным и ищет причину.

🔹 Исследователь отчетов: собирает аналитику без участия человека.

🔹 Ассистент по дайджестам: доставляет сводки адресатам по расписанию.

🔹 Офицер по рискам: находит проблему до того, как она станет дорогой.

Также в повестке: разбор прав доступа, безопасность развертывания и интеграций.

Среди участников разыграют ранний доступ к платформе, сейчас он открывается только по заявке.

📅 13 августа, 10:00–11:00 МСК, Zoom.

🌍 Вебинар на английском языке.

⚠ Количество мест ограничено.

🔗 Регистрация

Теги:
+9
Комментарии0

Как реализовать семантический поиск для RAG-архитектуры в PostgreSQL без усложнения инфраструктуры?

Ситуация: вы разрабатываете чат-бота для техподдержки на базе RAG-архитектуры. Используете PostgreSQL как хранилище знаний и делаете поиск по текстовым полям, но качество ответов нестабильное: система плохо справляется с синонимами, профессиональным сленгом и переформулировками запросов. Обязательно ли внедрять отдельную векторную базу данных, или можно реализовать семантический поиск прямо в PostgreSQL? Возможна ли простая проверка продуктовой гипотезы без усложнения архитектуры?

Да, семантический поиск в RAG-сценариях можно реализовать прямо в PostgreSQL без выделенной векторной базы данных (ClickHouse, Opensearch, Qdrant, Milvus и т. д). 

Для этого используется PostgreSQL + расширение pgvector, которое добавляет поддержку хранения эмбеддингов (векторов) и поиск по расстоянию до ближайших соседей (KNN) прямо внутри SQL-движка. Разберем, как это работает на практике.

В RAG-пайплайне текст документов и запрос пользователя преобразуются в векторные представления. PostgreSQL хранит эти векторы в таблице и позволяет выполнять поиск по смысловой близости, а не по точному совпадению слов.

Для этой задачи будем использовать pgvector — это расширение к PostgreSQL, которое добавляет тип данных vector и операторы поиска по расстоянию до ближайших соседей (KNN).

Поддерживаются три основные метрики сравнения векторов:

  • L2 (евклидово расстояние) — классическое расстояние между двумя точками в многомерном пространстве. Хорошо работает, если векторы не нормализованы и распределение значений относительно равномерное.

  • Cosine similarity (косинусное сходство). В отличие от предыдущей метрики измеряет не абсолютное расстояние, а угол между двумя векторами. Подходит для текстовых эмбеддингов, где важна направленность, а не масштаб. Требует нормализации векторов.

  • Inner product (внутреннее произведение) — скалярное произведение двух векторов. Может использоваться как прокси для оценки «сходства» при обучении моделей и в задачах ранжирования.

Допустим, мы получаем на наш запрос именно такой вектор от модели OpenAI. Для хранения создаем таблицу с типом VECTOR:

CREATE TABLE items (
 id SERIAL PRIMARY KEY,
 title TEXT,
 embedding VECTOR(1536)
);

Добавим данные для нескольких векторов разных объектов:

INSERT INTO items (title, embedding) VALUES
 ('PostgreSQL embeddings', '[0.10, -0.80, 0.45]'),
 ('Neural image processing', '[0.42, 0.18, -0.35]'),
 ('Sound pattern matching', '[-0.20, 0.70, 0.60]'),
 ('Document clustering', '[0.09, -0.79, 0.48]');

Теперь сравним их попарно и отсортируем по расстоянию:

SELECT
  a.title AS title_a,
  b.title AS title_b,
  a.embedding <-> b.embedding AS distance
FROM items a
JOIN items b ON a.id < b.id
ORDER BY distance;

Оператор <-> здесь вычисляет расстояние между двумя векторами. Таким образом, мы можем оценивать степень семантической близости любых объектов, представленных векторами. Какая именно метрика используется, зависит от операторного класса, заданного при создании индекса.

В подобных RAG-сценариях нет необходимости сразу вводить отдельный класс инфраструктуры типа векторная БД. Семантический поиск можно реализовать эволюционно поверх существующего PostgreSQL.

А если вы не хотите самостоятельно заниматься настройкой индексов, тюнингом памяти и производительности, а также обновлением версии PostgreSQL, то воспользуйтесь DBaaS от Selectel. Мы предоставим вам кластер PostgreSQL с преднастроенными расширениями, готовый к эксплуатации под нагрузкой. Это позволит сосредоточиться на RAG-логике и качестве поиска, а не на инфраструктурной оптимизации.

Теги:
+11
Комментарии0

Backup 2.0 в «Хайстекс Акура»: дедупликация на уровне хранения и новый уровень эффективности

Когда объемы данных растут, увеличиваются и требования к корпоративным системам резервного копирования. Компаниям необходимо хранить больше резервных копий, соблюдать установленные сроки хранения и при этом контролировать затраты на инфраструктуру. Чтобы решить эту проблему, мы переработали слой хранения в платформе «Хайстекс Акура» и выпустили обновление Backup 2.0.

Что изменилось:

  • Дедупликация данных на уровне хранилища для снижения объема хранения и оптимизации использования дисковых ресурсов.

  • Сжатие резервных копий для дополнительной экономии дискового пространства с возможностью выбора оптимальных алгоритмов компрессии.

  • Шифрование данных при хранении, обеспечивающее базовую защиту резервных копий в состоянии покоя.

  • Выделенное хранение метаданных резервных копий, гарантирующее целостность, управляемость.

Наибольший эффект новая архитектура может дать в средах с большим количеством однотипных виртуальных машин и регулярно создаваемых точек восстановления.

В ближайших версиях:

  • Гибкие сценарии резервного копирования.

  • Отчуждаемые резервные копии.

  • Долгосрочное архивное хранение.

Если хотите примерить Backup 2.0 на свою инфраструктуру, оставьте заявку — инженеры «Хайстекс» помогут рассчитать параметры хранилища для вашей инфраструктуры.

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии0

Вебинар уже через 20 минут: расскажем, как защищать данные в S3

В 12:00 мск на вебинаре разберем все: от базовых Bucket Policies и версионирования до продвинутых Conditional Write, Object Lock (WORM) и клиентского шифрования. Расскажем, как комбинировать эти инструменты для защиты от случайного удаления и кибератак. Объясним, как соответствовать регуляторным требованиям. Вебинар практический, так что вы увидите реальные примеры настройки S3 через API и CLI.

Вы узнаете

  • Какие уровни защиты данных в S3 существуют 

  • Как настраивать версионирование, Conditional Write, Object Lock, шифрование с реальными командами и примерами кода 

  • Какие границы и подводные камни существуют у каждого инструмента 

  • Как комбинировать механизмы для защиты от ransomware, случайного удаления, взлома ключей и соответствия 152-ФЗ 

Подключайтесь: 

📹 на YouTube;

📹 во ВКонтакте.

Теги:
Всего голосов 3: ↑3 и ↓0+8
Комментарии0

Новости мира Datalakehouse - DWH: на 26.06.26

"гонка сместилась к ИИ-агентам"

Полгода назад про корпоративные хранилища данных спорили, чей движок быстрее обрабатывает запросы. Сейчас почти каждый крупный анонс - про то, как пустить к данным ИИ-агентов и не дать им наломать дров. Собрал главное человеческим языком.

Сначала про слово, которое будет дальше. Lakehouse - это подход, когда вся аналитика компании живёт в одном общем хранилище поверх дешёвых файлов, без отдельной дорогой базы под отчёты. Дальше речь о том, что с этим подходом случилось за полгода.

Databricks (их большая конференция прошла 16 июня). Показали новый движок Lakehouse//RT - он обещает выдавать аналитику почти мгновенно прямо из общего хранилища, без отдельной быстрой базы под витрины. Пока это ранняя версия и работает только на чтение, то есть данные через него можно читать, но не записывать. Второй анонс - способ держать «живые» рабочие данные и аналитику в одном месте, без постоянной перекачки между системами (обычно компании гоняют данные туда-сюда ночными выгрузками). Третий, и самый показательный - набор инструментов, чтобы пускать к данным ИИ-агентов: объяснять программе смысл данных и контролировать, куда ей можно лезть, а куда нет.

ClickHouse (своя конференция 27 мая). Это очень быстрая база для аналитики. Они запустили собственную управляемую версию Postgres - популярной базы, на которой работают тысячи приложений, - и научили её мгновенно отдавать все изменения в аналитику, без задержек. Плюс добавили ИИ-агентов поверх данных, построенных на Claude. По деньгам у них всё хорошо: годовая выручка за год утроилась и перевалила за 250 миллионов долларов.

Snowflake. Открыли свой каталог данных Polaris - это, грубо говоря, общее оглавление всех таблиц, по которому разные программы понимают, где что лежит. Раньше он был только их, теперь его передали в открытый фонд Apache, чтобы пользоваться им могли любые инструменты. А популярный открытый формат таблиц Iceberg дорос до новой версии и научился хранить более сложные данные.

SAP покупает компанию Dremio (сделка ещё не закрыта). Крупный вендор корпоративного софта докупает технологию, чтобы собрать собственное хранилище нового типа под ИИ. Это часть общего движения: рынок сходится вокруг одного открытого формата данных - того самого Iceberg.

DuckLake дорос до версии 1.0. Маленький и нарочно простой проект: он хранит оглавление данных в обычной знакомой базе (Postgres), а не в куче разрозненных служебных файлов, как делают старшие конкуренты. Меньше магии - проще обслуживать.

Если совсем коротко: скорость никуда не делась, её даже больше. Но она перестала быть главным козырем и стала фундаментом. Поверх неё все теперь строят слой управления ИИ-агентами - как объяснить программе смысл данных и как не пустить её туда, куда нельзя. По сути это ровно то, чем администраторы баз данных занимаются уже много лет, просто теперь у этого модные названия.

Дальше разберу каждый анонс по отдельности. Ждите продолжения.

Подъехало продолжение:

Databricks (их большая конференция прошла 16 июня) - ссылка на подробный разбор

ClickHouse (своя конференция 27 мая) - ссылка на подробный разбор

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии0

Подборка вебинаров на июнь 

В июне вас ждут еще три онлайн-встречи с экспертами Cloud.ru — о Spark, облачных расходах и Redis. Регистрируйтесь заранее, чтобы ничего не пропустить.

🎥Spark Connect для ИТ-команд: упрощаем разработку и работу с данными

Покажем, как сделать использование Apache Spark удобным для всей команды с помощью Spark Connect и Evolution Managed Spark. Затронем вопросы разработки в IDE, анализа данных в Jupyter и построения ETL на чистом SQL в dbt. Не бойтесь споткнуться о порог входа — здесь он минимальный. 

🧑‍💻 Для кого: дата-инженеры, аналитики, руководители дата-отделов.

📅 Когда? 23 июня 11:00 мск.

📍 Где? Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.

🎥Как управлять расходами в облаке и не удивляться счетам

Разберем, как сделать облачные расходы прозрачными с помощью FinOps-инструментов. Вы узнаете, почему важно назначать владельцев ресурсов, как правильно выбирать тариф, выставлять автоматические квоты и настраивать алерты, чтобы сократить затраты на 20–30%. Всё — с живым демо в личном кабинете.

🧑‍💻 Для кого: ИТ-менеджеры, DevOps, финансовые директора.

📅 Когда? 25 июня 11:00 мск.

📍 Где?  Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.

🎥Эволюция приложения в облаке: как настроить кеш с Redis и ничего не сломать

Четвертый вебинар большого трека про эволюцию приложений. Обсудим стратегии кеширования и какую из них выбрать под ваш сценарий, типичные ошибки инвалидации и защиту от всплесков нагрузки. Разберем, как оценивать эффективность кеша и ситуации, когда он только маскирует проблемы. 

🧑‍💻 Для кого: бэкенд-разработчики, DevOps-инженеры, архитекторы.

📅 Когда? 30 июня 11:00 мск.

📍 Где?  Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.


Теги:
Всего голосов 2: ↑2 и ↓0+4
Комментарии0

Модернизировали дата-центры для быстрого внедрения ИИ

Команда Yandex Infrastructure модернизировала подход к строительству и охлаждению дата‑центров. Новая концепция кампусов дата‑центров и внедрение жидкостного охлаждения поможет ускорить создание и вывод на рынок ИИ‑сервисов Яндекса.

Концепция «кампус дата‑центров». Кампусы — несколько независимых дата‑центров в одной локации с общей внешней инфраструктурой. Команда внедрила концепцию кампусов, чтобы повысить эффективность использования ресурсов, снизить издержки и увеличить мощности в три раза до 180 МВт — рекордного в России показателя.

Жидкостное охлаждение. Для модернизации существующей инфраструктуры инженеры компании разработали сайдкары — дополнительные стойки с жидкостно‑воздушными радиаторами. Они позволяют использовать жидкостное охлаждение в дата‑центрах с фрикулингом без масштабной реконструкции. Сочетание двух технологий обеспечивает эффективное терморегулирование и ускоряет адаптацию инфраструктуры к растущим нагрузкам. 

Благодаря фрикулингу и отказу от доохлаждения дата‑центры Яндекса уже достигают показателя энергоэффективности PUE 1,1. Внедрение жидкостного охлаждения позволит дополнительно снизить энергозатраты и повысить экологичность дата‑центров, делая их ещё более «зелёными».

Теги:
Всего голосов 8: ↑8 и ↓0+10
Комментарии0

Ближайшие события

Как перестать надеяться на бэкап и автоматизировать Disaster Recovery

В одном из материалов я уже проводил границу между бэкапом и DR, которые решают принципиально разные задачи. Если бэкап — это архивный «огнетушитель», то DR — это система пожаротушения и план эвакуации. По реакции сообщества стало понятно: разницу осознают многие, но главный вопрос остается открытым — как обеспечить предсказуемый подъем сервисов, когда инфраструктура отказала?

Наличие резервных копий гарантирует, что данные не пропадут бесследно. Но бэкап не обеспечивает непрерывность бизнеса. При масштабном сбое восстановление из архивов вручную превращается в многочасовой (а иногда и многодневный) квест, который в условиях стресса часто ведет к человеческим ошибкам и увеличению простоя.

Чтобы перевести обсуждение из теории в плоскость работающих сценариев, мы с командой решили провести технический вебинар. 27 мая в 13:00 МСК в прямом эфире представим практические кейсы по восстановлению инфраструктуры после сбоя.

В программе:

  • Разберем почему бэкап не всегда спасает, и в какой момент нужен полноценный DR. Поговорим о том, как реалистично оценивать RTO и RPO.

  • Покажем сценарии восстановления инфраструктуры и посмотрим, какой подход работает лучше в каждой ситуации.

  • Покажем на практике:

    • восстановление данных через подключение дисков;

    • как это используется в реальных сценариях;

    • на что обратить внимание при восстановлении.

Вебинар будет полезен архитекторам, системным администраторам и всем, кто отвечает за доступность критичных систем. Приходите с вопросами по вашей инфраструктуре — разберем их в конце эфира во время сессии вопросов и ответов.

В финале встречи каждый участник получит актуализированный чек-лист для аудита плана аварийного восстановления.

👉 Зарегистрироваться на вебинар

Теги:
Всего голосов 1: ↑0 и ↓1-1
Комментарии0

Когда у ИИ не выходит каменная чаша.

Сколько же они весят?
Сколько же они весят?

Когда архитектору нечего делать, а гибкость у спины уже не та, что раньше - он начинает разговаривать сам с собой или с ИИ. Проблема, которую хотелось решить достаточно редко встречается - как бы сохранить преимущественно пустые массивы данных для аудита и не разориться при этом спустя несколько месяцев. Чтобы обуздать неуёмные галлюцинации - ИИ сразу был ограничен широко распространёнными архиваторами, результат работы которых желательно открывается из под win систем также как и из под *nix .

С позволения читателей я не буду пересказывать процесс, и перейду к тому, до чего ИИ дошёл - до 7z с рядом флажков. В прилагаемом ниже архиве вместо реальных данных - тестовые и совсем-совсем пустые. Но что ИИ пока не сумел придумать, и что внушает надежду на будущее людей в программировании и вокруг - полученный архив логично было архивировать ещё раз, тем-же 7z . Результат лично мне кажется интересным. Все желающие могут попробовать скачать почти 2 килобайта архива и предположить - какова же ёмкость исходных данных? А потом проверить себя, думаю результат вас удивит.

Архив можно Скачать с SendSpace повторюсь - в нём внутри лежит ещё один 7z архив, а уже в том - тестовые файлы числом менее 20.

Чтобы случайное разархивирование не испортило сюрприз - внешний архив закрыт паролем

Galantereyshik_i_Kardinal_eto_sila

Логически, при ещё большем количестве данных - рекурсию можно будет повторить, но в ближайшем будущем мне кажется и так неплохо вышло. Во всяком случае совсем не каждый ssd сумеет в себя вместить разархивированные из этих 1841 байтов исходные данные.

Предполагаю, что с теорией предмета знакомы все, попробуйте сами получить небольшой архив любым из широко распространённых архиваторов из скажем sparse файла в 5 гигабайт. Спорим он у вас получится больше прилагаемого к посту архива, в котором лежат терабайты.

Теги:
Всего голосов 6: ↑2 и ↓4-1
Комментарии15

Приходите на вебинар — покажем, как построить потоковый конвейер данных с латентностью в минуты

Батчевый ETL раз в сутки перестает справляться, когда бизнесу нужна аналитика в режиме, близком к реальному времени. Как перейти на потоковую обработку без лишней сложности в инфраструктуре?

Разберем это на вебинаре по Evolution Data Platform. Будет полезно дата-инженерам, которые проектируют конвейеры, аналитикам и BI-специалистам, которым важно работать с актуальными данными, а еще архитекторам и руководителям дата-отделов.

На вебинаре расскажем и покажем:

  • как проектировать архитектуру конвейера под near real-time: когда брать микробатчинг в Managed Spark Streaming, а когда хватит классического батча;

  • зачем нужен Managed Trino как единый слой запросов поверх «горячих» и «холодных» данных — и как это убирает дублирование логики;

  • как партиционировать данные по времени в Object Storage, чтобы запросы не тормозили;

  • как управлять схемой через Managed Metastore, когда структура потока меняется;

  • как настроить дашборд в Managed BI с автообновлением и алертами на отклонения;

  • как измерять латентность конвейера — от генерации события до появления на дашборде.

На практической части соберем реальный сценарий: оконная агрегация транзакций в Managed Spark Streaming, оркестрация через Managed Airflow, витрина в Object Storage, ad-hoc запросы через Managed Trino без копирования данных, дашборд с обновлением раз в две минуты.

📅 Когда? 21 мая в 11:00 мск.

📍 Где? Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикеру в прямом эфире.

P.S. А еще мы тут подготовили чек-лист, как создать качественное хранилище данных за 15 шагов — забирайте, нам не жалко. 

Теги:
Рейтинг0
Комментарии0

Коллеги-бумажные инфобезники, у меня к вам тема на поразмыслить. У каждого из нас есть мобильный телефон, в котором имеется телефонная книга и куда мы записываем телефон, фио и иные персональные данные конкретного человека. По сути, с момента нажатия на кнопку “Сохранить” мы начинаем обработку персональных данных (запись, систематизация, накопление, хранение) и должны руководствоваться 152-ФЗ. Но есть пару нюансов.

Во-первых, в соответствии с п. 1 ч. 2 ст. 1 Федерального закона, действие последнего не распространяются на отношения, возникающие при обработке ПДн физическими лицами исключительно для личных и семейных нужд. Простыми словами, если у нас в контактах исключительно родственники и друзья, то нам нечего переживать.

А что если я работаю, например, менеджером по продажам и у меня записаны сотни телефонов клиентов и подрядчиков? В данном случае может ли быть применен п. 5 ч. 1 ст. 6 ФЗ-152, в соответствии с которым обработка ПДн допускается для исполнения договора, стороной которого либо выгодоприобретателем или поручителем по которому является субъект персональных данных?

В продолжении темы: я хочу записать в свою телефонную книгу всех граждан страны (сейчас не рассматриваем технологические ограничения на объем памяти), включая их фио, телефоны, даты рождения, адреса и другую важную для меня информацию. Естественно, я их лично всех не знаю и мне они не нужны для работы. Я не собираюсь передавать их третим лицам или использовать в качестве рекламы. Я просто хочу знать кто мне звонит 😉 (по сути, использовать для личных нужд). Это законно?

С одной стороны, речь идёт о всех гражданах страны и фактические подразумевает массовый сбор и создание базы данных. С другой стороны, а как мне определить число, что это пока еще личные цели, но еще не массовость и, соответсвенно, наоборот: это уже массовый сбор и не подпадает под личные нужды? Кроме того, если мой номер телефона был “слит” в интернет, я такого согласия не давал, но люди записали его себе в справочник: будет ли это нарушением закона как незаконный сбор ПДн?

В общем, ситуация простая, а вопросов много. Предлагаю подискутировать по данному вопрос и уже наконец-то определиться, нужно ли брать согласие субъекта на обработку персональных данных перед добавлением контакта человека в свой телефон? ;)

🧠 Обязательно поделись с теми, кому это может быть полезно: 💬 Телеграм | 💬 Max | 📝 Хабр | 💙 ВКонтакте

Теги:
Всего голосов 3: ↑2 и ↓1+1
Комментарии5

Когда бизнес получил self-service BI и построил внутри него собственное хранилище данных

Знакомая ситуация: вы даёте бизнесу инструмент для самостоятельной аналитики, а через год обнаруживаете, что FineBI выполняет функции корпоративного хранилища. Данные загружаются из файлов, логика считается прямо в датасетах, одни и те же «велосипеды» пересобираются десятки раз. Документации нет, доверия к отчётам всё меньше.

В ОТП Банке за год с момента запуска FineBI выросли до 1 000 пользователей и 660 отчётов при приросте 50 пользователей в месяц. Масштаб впечатляет, но вместе с ним пришло и теневое хранилище.

Пётр Гордиенко, руководитель команды BI в ОТП Банке, расскажет, как они к этому пришли, почему осознанно выбрали «больше свободы» на старте и какой план из трёх шагов готовят, чтобы вернуть контроль, не убив при этом скорость.

📅 22 апреля | 15:00 МСК | FineDay Online 2026

Бесплатно, онлайн, ~3 часа

→ Регистрация

Теги:
Всего голосов 2: ↑1 и ↓10
Комментарии0

Когда у тебя 50 отчётов в FineReport, 100+ дашбордов в FineBI, и никто не знает, откуда берутся данные 

Знакомая история: дашборды живут своей жизнью, новый сотрудник открывает отчёт и не понимает, что значит «ТО 5 руб.», а когда что-то ломается, полдня уходит на то, чтобы пройти по цепочке ETL и найти, где именно.

В Галамарте решили это системно: подключили дата-каталог DataHub к продуктам FanRuan. Как именно это сделали, какие стены пришлось пробить и чего не нашлось ни в одной документации, расскажет Дмитрий Конюхов на FineDay Online.

Что получили на выходе:

— бизнес-глоссарий, где каждый термин привязан к формуле, источнику и конкретным дашбордам

— lineage от витрины до сырых данных — в одном окне, за пределами FanRuan

— возможность за секунды найти, в каких из 100+ дашбордов используется нужнаяметрика

— базу для self-service: аналитики переиспользуют существующие датасеты вместо создания новых

📅 22 апреля | 15:00 МСК | FineDay Online 2026

Бесплатно, онлайн, ~3 часа

→ Регистрация

Теги:
Всего голосов 5: ↑3 и ↓2+1
Комментарии0

Вебинар «BI + ETL + КХД за 1,5 млн: как Modus закрывает весь стек корпоративной аналитики»

21 апреля в 12 по МСК приглашаем на вебинар, на котором эксперты ИТ-интегратора «Белый код» расскажут, как малому и среднему бизнесу внедрить BI-систему за 1,5 миллиона рублей.

Одна из задач, с которой к интегратору приходит малый и средний бизнес, — внедрение BI в рамках ограниченного бюджета. При этом есть жесткие требования, например, единая экосистема BI + ETL, без «зоопарка» инструментов, а также нативная работа с 1С как основным источником данных. 

На вебинаре специалисты поделятся практикой внедрения в сегменте МСБ, а также ответят на вопросы. 

Вы узнаете:

  • Почему BI сам по себе не решает проблему разночтений в данных

  • Какие организационные изменения нужны, чтобы аналитика начала работать

  • Modus ETL: как устроена загрузка и обработка данных

  • Modus BI: аналитический портал без лишней сложности

  • Структура проекта за 1,5 млн рублей: стоимость лицензий, этапы проекта и результат

Спикеры вебинара

  • Андрей Рыжик, product owner BI-направления компании «Белый код»

  • Наталья Лобанова, коммерческий директор компании «Белый код»

📌Дата и время: 21 апреля 12:00 МСК (онлайн)

Участие бесплатное, требуется предварительная регистрация.

Принять участие

Теги:
Всего голосов 1: ↑1 и ↓0+1
Комментарии0
1
23 ...