Обновить
128K+

Хранение данных *

Что имеем, то храним

215,67
Рейтинг
Сначала показывать
Порог рейтинга

«Диасофт» приглашает на День СУБД 2026

27 октября в Кибердоме (Москва) пройдет вторая конференция «Диасофт», посвященная промышленной эксплуатации СУБД.

Почему стоит идти:

🔵 Увидеть сценарий миграции вживую

Демонстрация переноса целевой схемы с MS SQL и Oracle без переписывания кода — на сцене, с реальной консолью, а не на слайдах.

 🔵 Задать вопросы команде разработки

Архитекторы и руководители направлений Digital Q.DataBase ответят лично — без тикетов, SLA и линии поддержки.

 🔵 Забрать готовый чек-лист миграции

Участники получат методику оценки трудоемкости перехода: что считать, где закладывать запас, какие пакеты станут проблемой.

🔵 Поговорить с теми, кто уже завершил миграцию

Три часа нетворкинга с командами, которые прошли переход в 2025-2026 годах. Можно записаться на персональную консультацию прямо в форме.

 О чем поговорим:

  1. Изменение подхода к импортозамещению СУБД: от «заменить любой ценой» — к управляемой миграции.

  2. Национальная СУБД как важный элемент технологического суверенитета – итоги первого полугодия в открытом доступе.

  3. Импортозамещение СУБД в высоконагруженных системах: MPP, шардирование, терабайтные объемы данных.

  4. Кейсы клиентов и партнеров «Диасофт» по переходу на Digital Q.DataBase — с конкретными цифрами и сроками.

  5. Совместимость как продукт: диалекты Oracle и MS SQL, протокол TDS, эмуляция Instant Client.

Digital Q.DataBase — сертифицированная ФСТЭК российская СУБД на ядре PostgreSQL. Встроенная поддержка диалекта и транспортного протокола TDS позволяет перейти с MS SQL без участия разработчиков, поддержка PL/SQL и эмуляция Oracle Instant Client — быстро мигрировать с Oracle. Запись в реестре российского ПО № 15 561, сертификат ФСТЭК по 4-му уровню доверия № 4843.

 ➡️ Зарегистрироваться на мероприятие можно по ссылке

Теги:
+3
Комментарии0

Еще 6 причин быть на GoCloud Tech 2026: приходите с ноутбуком и забирайте готовые решения

Доклады дают теорию, воркшопы — рабочий прототип. На GoCloud Tech 2026 мы организовали шесть практических сессий, где вы сами настроите инфраструктуру, запустите приложение и развернете защиту прямо в своем личном кабинете под руководством команды Cloud.ru.

11:50–12:50 | Spark Connect: интерактивная работа с данными
Федор Фаизов, ведущий аналитик, Cloud.ru
Покажем три сценария работы с Evolution Managed Spark:

  • разработчики подключаются к Spark из локальной IDE;

  • аналитики работают с данными и визуализациями в Jupyter Notebooks;

  • системные аналитики DWH строят ETL-процессы в dbt на чистом SQL.

13:10–14:10 | Запускаем приложения через ИИ-агента
Антон Щеколдин, менеджер продукта, Cloud.ru
Воркшоп для тех, кто хочет сокращать путь от идеи до прода. Научим работать с ИИ-агентом: вы формулируете задачу на естественном языке — агент генерирует код, собирает образ и деплоит приложение. За 60 минут пройдете весь цикл и заберете работающее приложение на выделенном домене с доступом к интерфейсу управления и инструкцией по использованию для ваших задач.

14:30–15:00 | Синтетический мониторинг своими руками
Андрей Жирунов, менеджер продуктов, Cloud.ru
Разберемся, как проверять реальный пользовательский путь с помощью flow-тестов: за 30 минут соберете сценарий проверки на подготовленном стенде, создадите flow-тест, запустите его через готовых агентов и посмотрите результаты выполнения, включая диагностику ошибок. После воркшопа сможете внедрить постоянную проверку пользовательского сценария и использовать ее для мониторинга сервисов — заберете инструкцию по настройке и готовые шаблоны тестов для вашей инфраструктуры.

15:20–16:20 | Data Lakehouse с использованием ADB и PXF
Максим Еремин, менеджер продукта, Cloud.ru
Научитесь строить Data Lakehouse-хранилища на платформе данных Cloud.ru Evolution. Разберем, что такое DLH и зачем он нужен, причем тут Greenplum и PXF, как реализовать архитектуру с облачными сервисами.

16:35–17:15 | Guardrails Filter для защиты LLM-приложений
Никита Стешов, менеджер продукта, Cloud.ru
Воркшоп для тех, кто хочет защитить свои LLM-приложения от утечек чувствительных данных и нежелательного контента. Разберемся, как настроить Guardrails-фильтр под ваши сценарии: пройдете путь от готового решения «из коробки» до гибкой настройки open source-решения с собственными правилами фильтрации. За 40 минут получите пошаговый опыт настройки — от базового интерфейса до кастомизации под специфические требования безопасности. 

17:30–18:00 | VPN до другого облака
Алексей Болотин, менеджер продукта, Cloud.ru
В деталях разберем создание VPN-туннеля:

  • создадим отказоустойчивый VPN-шлюз;

  • построим IPsec до удаленной локации;

  • настроим персональный профиль безопасности с кастомными параметрами шифрования;

  • научимся использовать сертификаты из Certificate Manager для авторизации;

  • настроим мониторинг и события по этому VPN-туннелю.

📅 Когда: 15 октября, воркшопы с 11:50 до 18:00 мск.
📍 Где: Москва, ул. Волочаевская, 48, стр. 1 (м. Площадь Ильича), Loft #8 (ДК «Серп и молот»).

👉 Зарегистрироваться и выбрать воркшопы

Теги:
+3
Комментарии0

Как применить одну функцию к нескольким колонкам, не перечисляя их в SELECT

В прошлом посте я рассказывал про модификатор REPLACE, с помощью которого можно менять значения «на лету», не перечисляя все колонки в SELECT. Сегодня расскажу про еще один полезный модификатор — APPLY.

Иногда бывают ситуации, когда нам нужно применить одну и ту же функцию сразу к нескольким колонкам (например, посчитать сумму).

В классических транзакционных базах, таких как PostgreSQL, мы бы вручную перечисляли в SELECT абсолютно все поля, которые хотим просуммировать.

В ClickHouse это делается проще.

Чтобы не писать десятки колонок руками, можно использовать модификатор APPLY. Он работает в связке со звездочкой * и автоматически применяет указанную функцию ко всем колонкам в выборке.

В качестве примера рассмотрим таблицу metrics, в которой хранится количество кликов, просмотров и затрат:

┌─clicks─┬─views─┬─spend─┐
│     10 │   100 │    50 │
│     15 │   150 │    70 │
└────────┴───────┴───────┘

Чтобы посчитать сумму по каждому полю обычно мы привыкли писать так:

SELECT
  sum(clicks),
  sum(views),
  sum(spend)
FROM metrics

┌─sum(clicks)┬─sum(views)─┬─sum(spend)─┐
│         25 │        250 │        120 │
└────────────┴────────────┴────────────┘

С использованием APPLY можно написать короче:

SELECT * APPLY(sum) 
FROM metrics

┌─sum(clicks)┬─sum(views)─┬─sum(spend)─┐
│         25 │        250 │        120 │
└────────────┴────────────┴────────────┘

Несколько нюансов:

  1. Правила вызова пишутся в круглых скобках. Синтаксис такой: APPLY(имя_функции) без аргументов.

  2. Передаваемая функция в APPLY должна уметь работать со всеми полями выборки и их типами данных. Например, для sum все поля должны быть числовыми.

  3. Если мы хотим применить sum, но в таблице есть нечисловые типы данных, мы можем исключить их через EXCEPT или выбрать только нужные через модификатор COLUMNS, о котором я расскажу в следующем посте.

  4. APPLY можно использовать не только для агрегации, но и для изменения типов данных. Например, APPLY(toString) быстро переведет все выбранные колонки в строковый формат.

Ссылка на доку.

Мои статьи по ClickHouse на Хабре.

P.S. Систематизировать знания и получить крепкую базу можно на моем бесплатном курсе «ClickHouse с нуля». А закрепить пройденный материал на его практическом продолжении «ClickHouse с нуля: практика».

Теги:
+5
Комментарии0

Как менять значения «на лету», не перечисляя все колонки в SELECT

В прошлом посте я рассказывал про модификатор EXCEPT, с помощью которого можно исключить ненужные колонки из выборки. Сегодня расскажу про еще один полезный модификатор — REPLACE.

Возьмем все тот же пример: широкую таблицу, в которой 50 или более колонок. Часто бывают ситуации, когда нам нужно модифицировать значения только в одном-двух полях (например, привести email к нижнему регистру, округлить цену или захешировать данные), а все остальные поля вывести как есть.

В классических транзакционных базах, таких как PostgreSQL, мы бы вручную перечисляли в SELECT абсолютно все поля: и те, которые нужно просто вывести, и те, значения в которых нужно как-то изменить.

В ClickHouse это делается проще.

Чтобы не писать десятки колонок руками, можно использовать модификатор REPLACE. Он работает в связке со звездочкой * и позволяет вывести все поля, заменив значения только в конкретных.

Обычно мы пишем так:

SELECT
  id,
  category,
  user_id,
  -- ... перечисляем десятки остальных колонок руками ...
  LOWER(email) AS email
FROM table

С использованием REPLACE запрос становится короче:

SELECT * REPLACE (LOWER(email) AS email)
FROM table

А если нам надо и исключить колонки, и заменить значения, можно писать EXCEPT и REPLACE вместе:

SELECT * 
    EXCEPT (updated_at) 
    REPLACE (LOWER(email) AS email)
FROM table

Несколько нюансов:

  1. Правила замены пишутся в круглых скобках. Синтаксис такой: (выражение AS имя_существующей_колонки).

  2. Можно изменять сразу несколько колонок, перечислив их через запятую: REPLACE (LOWER(email) AS email, price * 0.85 AS price).

  3. Тип данных колонки в итоговой выборке поменяется, если ваше выражение возвращает новый тип (например, вы заменили число на строку).

Про еще один модификатор расскажу в следующем посте.

Ссылка на доку.

Мои статьи по ClickHouse на Хабре.

P.S. Систематизировать знания и получить крепкую базу можно на моем бесплатном курсе «ClickHouse с нуля». А закрепить пройденный материал на его практическом продолжении «ClickHouse с нуля: практика».

Теги:
+4
Комментарии0

Как снизить стоимость хранения данных с помощью комбинаторики и линейной алгебры? Узнаете на GoCloud Tech 2026

При проектировании систем хранения приходится искать баланс между тремя параметрами: производительностью, надежностью и стоимостью инфраструктуры. На практике улучшение одного показателя нередко требует пожертвовать другим. Разберемся, из чего складывается стоимость хранения данных и как снизить ее с помощью продвинутых алгоритмов отказоустойчивого кодирования. Поговорим о математике нового кодировщика, принципах его работы и сложностях production-ready реализации. А еще покажем на графиках, как решение влияет на скорость работы и потребление ресурсов. Доклад поможет архитекторам, инженерам и системным администраторам подобрать оптимальный баланс между производительностью, надежностью системы и затратами на инфраструктуру.

Спикер:
Сергей Баширов — ведущий разработчик R&D, Cloud.ru.

Трек: Инфраструктура.

📅 Когда: 15 октября в 16:35–17:15 мск.

👉 Зарегистрироваться

А пока ждете выступление, можете узнать, как мы создавали собственную SDS для платформы Cloud.ru Evolution. 

Теги:
+3
Комментарии0

Как исключить ненужные колонки из SELECT *

Когда пишешь SQL-запрос к широким таблицам (где 50 и больше колонок), часто необходимо вывести только конкретные поля исключив ненужные. В стандартном SQL для этого, как правило, приходится вручную перечислять в SELECT все необходимые колонки (например 48 из 50). Ну, либо копировать их список из DDL и удалять лишнее. А если таблица меняется, запрос приходится переписывать.

В ClickHouse можно исключать ненужные колонки проще.

Чтобы не перечислять десятки полей руками, можно использовать модификатор EXCEPT. Он работает в связке со звездочкой и позволяет вывести все колонки, исключив ненужные.

Обычно мы пишем так:

SELECT
  id,
  category,
  user_id,
  -- ... перечисляем остальные колонки руками ...
FROM table

С использованием EXCEPT запрос становится короче:

SELECT * EXCEPT (updated_at)
FROM table

Несколько нюансов:

  1. Исключаемые колонки пишутся в круглых скобках через запятую.

  2. Не путайте модификатор EXCEPT с оператором вычитания множеств.

  3. Модификатор отлично комбинируется с другими модификаторами, например с REPLACE или APPLY (напишу про них в следующих постах).

Ссылка на доку.

Мои статьи по ClickHouse на Хабре.

P.S. Систематизировать знания и получить крепкую базу можно на моем бесплатном курсе «ClickHouse с нуля». А закрепить пройденный материал на его практическом продолжении «ClickHouse с нуля: практика».

Теги:
+4
Комментарии0

Настраиваем S3-доступы так, как нужно проекту

Добавили редактор политик для пользователей S3. Теперь в панели можно как выдать готовую роль, так и настроить собственную политику — редактируете ее в интерфейсе или загружаете готовый JSON.

Когда пригодится:

1️⃣ Открыть разработчику только чтение логов — без возможности изменить или удалить данные.

2️⃣ Выдать клиенту доступ к нужной папке в бакете — остальные объекты останутся недоступны.

3️⃣ Разрешить скрипту бэкапов запись без права удаления — старые копии останутся целы.

Права можно задать как для новых пользователей при создании, так и для уже существующих в S3 → «Пользователи». Еще политика доступна в настройках конкретного бакета.

Раздать персональные права →

Теги:
+12
Комментарии0

Найден способ использовать безлимит на Google Photos (загружать фото и видео так, чтобы они не занимали место в аккаунте). Google давно выдал бессрочную льготу для контента, сделанного с первым Pixel XL. Открытый проект gotohp позволяет создавать загрузки в Google Photos с профилем первого Pixel XL. А вот доя iPhone понадобится джейбрейк или приложение Sideloadly на ПК/macOS для установки модифицированного клиента GoToHP for iOS — Gunshot.

Теги:
+1
Комментарии0

Сайты в S3 теперь доступны на вашем домене

Технический адрес имя_бакета.website.twcstorage.ru больше не единственный вариант. В S3 появилась возможность разместить статический сайт и открыть его на собственном домене — например, blog.example.ru или docs.example.ru.

Работает так: вы собрали лендинг или портфолио — загружаете файлы в бакет, привязываете свой домен и отправляете ссылку в соцсети.

Что это дает:

1️⃣ Сайт работает на вашем домене, а не на техническом.

2️⃣ Не нужен отдельный веб-сервер, то есть обходитесь без аренды и настройки.

3️⃣ Контент раздается через CDN, и сайт грузится быстрее.

Как подключить: в настройках бакета выберите «Веб-сайт» → «Привязать собственный домен» → «Создать CDN-ресурс» → добавьте свой домен.

Подробнее о настройке → в доке

Разместить сайт на своем домене →

Теги:
+14
Комментарии0

Облачные провайдеры поднимают российский ИТ-рынок

Аналитики считают, что российский ИТ-рынок вырастет в 2026 году всего на 4%, а к двузначному росту вернётся не раньше 2028 года. Основные причины — замедление экономики и смещение фокуса с цифровизации к поддержке базовых процессов. Мы бы ещё прибавили значительный рост цен на комплектующие и их дефицит.

Кто тянет российский рынок? Облачные сервисы — хотя в 2026 году темп роста замедлится, но все равно составит 20%. А сервис аренды GPU-мощностей — на 36% и будет столько же прибавлять до 2028 года. Полагаем, что главным драйвером развития рынка остаётся ИИ: компании разрабатывают собственные модели, локально запускают доступные мировые решения. И аналитики считают, что рост проходил бы ещё быстрее, если бы не дефицит площадок под дата-центры, из-за которого замораживаются проекты постройки новых ЦОДов. RUVDS уже писала, что повышение аренды земли под вычислительные комплексы в десятки раз — не лучший стимул для развития отрасли.

Возвращаясь к дефициту компонентов, он приводит к интересным последствиям — аналитики OCS сообщили, что впервые поставки серверных SSD превысили продажи жестких дисков для серверов. Хотя твердотельные накопители дорожают быстрее, в условиях ограниченных ресурсов компании выбирают более эффективное решение. Производству жёстких же дисков мешает дефицит комплектующих — производители начинают уделять внимание самым топовым моделям, но они стоят дороже и у клиента уже возникают вопросы — не целесообразнее ли купить HDD. Естественно, базовые преимущества SSD (скорость) и жёстких дисков (низкая цена хранения) остаются, и в мировом масштабе основная информация хранится именно на HDD.

В итоге облачные провайдеры остаются оптимальным решением: они за пользователя решают проблему с дефицитом и удорожанием комплектующих и дают ему возможность без капитальных инвестиций проверить, серверы на каких комплектующих нужны для бизнеса.

Теги:
Всего голосов 16: ↑16 и ↓0+30
Комментарии0

Дайджест Рег.облака за август

Август выдался насыщенным: ввели оплату ИИ-моделей по токенам, выпустили новый тариф со 192 ГБ видеопамяти, опубликовали два кейса по миграции, подвели итоги первого полугодия, провели вебинар по выделенным серверам и выложили несколько полезных статей на Хабре. Дальше — кратко о главном.

Запустили оплату ИИ-моделей по токенам

Добавили возможность оплаты по токенам на ИИ-платформе. Теперь можно подключаться к 29 LLM-моделям через OpenAI-совместимый API без развертывания собственной инфраструктуры. Этот формат рассчитан на компании, которые внедряют генеративный ИИ, но не готовы к затратам на выделенные GPU. 

Выпустили новый тариф со 192 ГБ видеопамяти

Внутри — две NVIDIA RTX 6000 Pro по 96 ГБ, 32 vCPU, 128 ГБ RAM и 1024 ГБ NVMe. Подойдет для крупных LLM, обучения моделей и генерации видео. Протестировать можно здесь.  

Опубликовали два новых кейса

В блоге вышли материалы с реальными примерами из практики:

Подвели итоги первого полугодия 2026 года

Опубликовали в блоге статью с аналитикой рынка и результатами Рег.облака за первые шесть месяцев года. Приток новых клиентов публичного облака за первое полугодие 2026 года вырос на 113% по сравнению с аналогичным периодом 2025-го. Общая база клиентов достигла 30 тысяч, а за последние 12 месяцев пользователи подняли 165,1 тысячи новых облачных серверов.

Провели вебинар по выделенным серверам

13 августа прошел вебинар, посвященный переходу с виртуальных серверов (VPS) на физические выделенные серверы (Bare Metal). Запись — по ссылке. 

Следующий вебинар — уже 17 сентября. Покажем, где S3 может заменить классические файловые хранилища, как встроить его в процессы разработки и эксплуатации и на что обратить внимание при выборе архитектуры хранения. Зарегистрироваться можно по ссылке.

Публиковали полезные статьи

В августе вышло несколько статей — если пропустили, читайте:

Мы продолжаем развивать сервисы для бизнеса и делать облачные технологии доступнее. Впереди — новые релизы, полезные материалы и еще больше кейсов. Спасибо, что с нами!

Теги:
Всего голосов 2: ↑2 и ↓0+4
Комментарии0
UI
UI

Сделал S3-браузер в один HTML-файл (S3Feather)

TL;DR: один index.html, открываешь в браузере, работаешь с бакетом. Без установки и сервера. AWS, MinIO, Cloudflare R2 и вообще любой S3-совместимый. Потыкать, код.

Почему AWS Console медленная и перегруженная. Cyberduck надо ставить, на телефоне не работает. А хотелось просто открыть вкладку в браузере и перекинуть файлы, где бы ни был. Веб-приложение с бэкендом не хотел, потому что надо где-то хостить и думать про ключи. В итоге пришёл к тому, что вся логика живёт в браузере. SigV4 подписывается на клиенте, CORS настраивается на бакете, никакого прокси нет.

Как устроено Один файл: HTML, JS, CSS, логика подписи запросов. Открываешь локально или хостишь чоб было доступно везде, ну или уже захосченый - линк выше.

Ключи живут в sessionStorage, закрыл вкладку, исчезли. Если надоедает вводить каждый раз, можно сохранить подключения в зашифрованный файл. Кинул его в облако, открыл на телефоне, ввёл пароль, всё.

Что умеет

  • Листинг, загрузка, скачивание, удаление

  • Несколько файлов сразу в ZIP прямо в браузере

  • Presigned-ссылки для шаринга

  • Drag and drop

  • Адресная строка с s3:// и командная палитра по Ctrl+K

  • Flatten-режим: показывает всё рекурсивно плоским списком, когда помнишь имя файла но не помнишь папку

На Android качал файлы пакетами по несколько гигабайт, работает нормально.

Буду рад фидбеку, особенно от тех кто использует нестандартные S3-совместимые хранилища.

Теги:
Всего голосов 5: ↑5 и ↓0+8
Комментарии1

Laconian: короткий ответ без потери смысла

Сделал Laconian - agent skill, построенный вокруг принципа the shortest complete answer. Не самый короткий ответ вообще, а самый короткий из тех, которые остаются корректными и практически полезными.

Логика простая: сначала определить полный ответ, затем удалить только то, без чего не пострадают точность, безопасность, существенные факты, ограничения и требования пользователя.

Skill убирает приветствия, пересказ запроса, незапрошенное описание процесса, повторы и декоративные выводы. При этом сохраняет важные оговорки, неопределённость, нужную детализацию, код, команды, числа, URL и другие данные, точная форма которых имеет значение.

Вся пользовательская часть проекта — один файл SKILL.md. В нём нет скриптов, зависимостей, сетевых вызовов, дополнительных разрешений или привязки к инструментам конкретной платформы.

В репозитории также развивается открытый benchmark: Laconian сравнивается с baseline, обычной инструкцией Answer concisely. и Caveman. Инфраструктура уже работает, но публичных результатов пока нет — поэтому пока не заявляю о выигрыше в длине, качестве или стоимости раньше данных.

Ссылки

Теги:
Всего голосов 2: ↑2 и ↓0+4
Комментарии0

Ближайшие события

Юлий Гольдберг (GlowByte): Lakehouse — уже не экспериментальное направление

В интервью на РБК руководитель направления GlowByte Юлий Гольдберг рассказал о том, как меняется рынок СУБД в России, почему Lakehouse перестал быть экспериментом и какие барьеры остаются у отечественных вендоров.

Ключевое из интервью:

Рынок СУБД: от срочного импортозамещения к зрелости. Заказчики всё реже ищут просто «российскую альтернативу» — они выбирают платформу под архитектуру данных, аналитику и ИИ-сценарии. При этом многие крупные компании не торопятся отказываться от Oracle и MS SQL: лицензии постоянные, системы «вылизаны», а миграция — дорогой и долгий проект.

Главный тренд — переход к Lakehouse. Вместо монолитных СУБД (Oracle, Teradata) — разделение хранения (S3+Parquet/Iceberg) и систем обработки (Spark, Trino, Impala). Подход доказал состоятельность: GlowByte совместно с Data Sapience за три года реализовали более 15 проектов, крупнейшие — на несколько петабайт данных.

Архитектура усложняется, но становится гибче. СУБД в новой парадигме — это набор взаимодополняющих компонентов. Можно собрать ровно то, что нужно, и не платить за лишнее. Но нагрузка на архитекторов и DevOps‑инженеров растет в разы.

Главный барьер — размер рынка. Российский рынок СУБД небольшой по сравнению с мировым, экспорт технологий затруднен. Инвестиции в продукты несопоставимы с зарубежными. Почти все российские СУБД, кроме ClickHouse и Tarantool, базируются на open source, а риски смены лицензий (как в случае с Greenplum) сохраняются.

ИИ меняет требования к СУБД. LLM и AI-агенты работают с неструктурированными данными — текстами, картинками. Традиционные СУБД заточены под структурированную информацию, а Lakehouse с S3-хранилищем и набором движков обработки закрывает этот пробел.

Критерии выбора СУБД на 2027 год: стоимость владения, горизонтальное масштабирование для крупных компаний, managed‑сервисы для небольших игроков.

Российский рынок СУБД на сегодня — это рынок различных клонов Postgres. Как ни смотри, хоть в штуках, хоть в деньгах. И вряд ли что-то здесь изменится в ближайшем будущем, тем более что Postgres тоже не стоит на месте и развивается туда, куда ждут потребители, — в область поддержки ИИ (pgvector, например) или в сторону параллелизма вычислений. Если кто-то и бросает вызов, то в конкретных нишах — как, например, Lakehouse в аналитических задачах на больших объемах данных, — говорит Юлий Гольдберг, GlowByte.

Читать интервью эксперта GlowByte в РБК

Теги:
Всего голосов 12: ↑11 и ↓1+12
Комментарии0
https://vkvideo.ru/clip-237277610_456239029

Видео доступно по ссылке -> https://vkvideo.ru/clip-237277610_456239029

Давайте сегодня поговорим про бумажную безопасность, но не в привычном ее понимании: политики, контроли и комплаенс; а в буквальном смысле - безопасность информации, представленной на бумаге. Сотрудник ФБР (по крайней мере он так представился) на наглядных примерах показывает разницу между шредерами и качеством выполнения их работы.

На сегодня существует 3 типа уничтожителей бумаги: прямые, ромбовидные и конфетти. 
Первые уничтожают бумагу, разрезая ее на ровные полоски. При таком подходе собрать обратно пазл не составляет особого труда и занимает не более 1 часа на восстановление информации. Тоже самое относится и к банковским картам - получить номер карты, ФИО и CVV код займет от силы 1 минуту (30 секунд из которых вы будет искать кончик скотча, чтобы склеить ее обратно).

С ромбовидными сложнее, но восстановление тоже возможно, хотя и занимает намного больше времени. По информации сотрудника, собрать обратно документ составляет около 8 часов.

Самые лучшие, и которые стоят в офисах ФБР (спасибо за подсказку) - это шредеры, которые превращают документ в конфетти. При таком подходе собрать документ обратно не возможно (но тут бы я поспорил). 

Естественно, стоимость бумагоизмельчителей пропорционально растет в зависимости от качества уничтожения документов. С другой стороны, купить шредер ради шредера (первый вариант) - выглядит бездумной тратой денег. К сожалению, не всегда удается донести до закупки почему нужно покупать дорогую вещь, когда существует версии в 10 раз дешевле. 

И к слову сказать, мы в своей работе в рамках Red Team проектах нередко прибегаем к таким методам, так поиск информации в шредерах. Психология людей обычно сводится к тому, что раз документ прошел через измельчитель, значит информация безвозвратно уничтожена. Однако вы теперь знаете, что это далеко не так.
Так что, какой берем?

п.с. нас еще учили, чтобы безвозвратно уничтожить документ, его сначала сжигают, а потом просеивают через мелкозернистую сеть. К сожалению, таких устройств еще не существует, поэтому дарю бизнес-идею ;) 

🧠 Обязательно поделись с теми, кому это может быть полезно 💬 Телеграм | 💬 Max | 📝 Хабр | 💙 ВКонтакте

Теги:
Всего голосов 4: ↑1 и ↓3-2
Комментарии11

Подборка вебинаров на август

В августе разберем, как быть во всеоружии на случай отказа ЦОД, выбрать инфраструктуру для ИИ-проектов и упростить работу со Spark-задачами. Регистрируйтесь, чтобы не пропустить.

Отказ ЦОД: выстраиваем защиту с DRaaS и BaaS
Разберем, как подготовиться к отказу дата-центра и выстроить защиту инфраструктуры с помощью Evolution Disaster Recovery и Evolution Agent Backup. Обсудим, чем отличаются DRaaS, BaaS, репликация и аварийное восстановление, а также как выбрать решение с учетом требований к непрерывности, скорости восстановления и безопасности.
🧑‍💻 Для кого: ИТ-директора, руководители инфраструктуры, системные администраторы и специалисты по информационной безопасности.
📅 Когда: 18 августа, 11:00 мск.
📍 Где: Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.

ИИ-проекты: когда и как переходить от API к Bare Metal
Расскажем, когда API для инференса перестает отвечать требованиям проекта и почему стоит переходить на выделенную инфраструктуру. Разберем, чем Evolution Bare Metal отличается от облачной виртуализации, как подобрать GPU-конфигурацию для инференса, обучения и дообучения моделей, а также как масштабировать ИИ-нагрузки.
🧑‍💻 Для кого: ML-инженеры, разработчики ИИ-продуктов, архитекторы и технические руководители.
📅 Когда: 25 августа, 11:00 мск.
📍 Где: Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.

Как ИИ помогает создавать и сопровождать Spark-задачи в облаке
Покажем, как Evolution Managed Spark с ИИ помогает создавать, запускать и анализировать Spark-задачи с помощью запросов на естественном языке. Разберем работу с данными в Evolution Object Storage, поиск причин ошибок, рекомендации по их устранению и оптимизацию производительности приложений.
🧑‍💻 Для кого: дата-инженеры, разработчики Spark-приложений, аналитики данных и DevOps-инженеры.
📅 Когда: 27 августа, 11:00 мск.
📍 Где: Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии0

Что, если бы на вопрос «почему просел показатель» отвечал не аналитик, а сам BI?

Партнер GlowByte – вендор FanRuan – представляет Dora: платформу, где поиск причины, сверку данных, сборку отчета и рассылку берут на себя ИИ-агенты. Работают они поверх ваших BI-активов – готовых моделей данных, метрик и прав доступа, а не по сырым таблицам.

На вебинаре четыре агента пройдут полный цикл вживую:

🔹 Дата-аналитик: отвечает на запросы к данным и ищет причину.

🔹 Исследователь отчетов: собирает аналитику без участия человека.

🔹 Ассистент по дайджестам: доставляет сводки адресатам по расписанию.

🔹 Офицер по рискам: находит проблему до того, как она станет дорогой.

Также в повестке: разбор прав доступа, безопасность развертывания и интеграций.

Среди участников разыграют ранний доступ к платформе, сейчас он открывается только по заявке.

📅 13 августа, 10:00–11:00 МСК, Zoom.

🌍 Вебинар на английском языке.

⚠ Количество мест ограничено.

🔗 Регистрация

Теги:
Всего голосов 7: ↑7 и ↓0+9
Комментарии0

Как реализовать семантический поиск для RAG-архитектуры в PostgreSQL без усложнения инфраструктуры?

Ситуация: вы разрабатываете чат-бота для техподдержки на базе RAG-архитектуры. Используете PostgreSQL как хранилище знаний и делаете поиск по текстовым полям, но качество ответов нестабильное: система плохо справляется с синонимами, профессиональным сленгом и переформулировками запросов. Обязательно ли внедрять отдельную векторную базу данных, или можно реализовать семантический поиск прямо в PostgreSQL? Возможна ли простая проверка продуктовой гипотезы без усложнения архитектуры?

Да, семантический поиск в RAG-сценариях можно реализовать прямо в PostgreSQL без выделенной векторной базы данных (ClickHouse, Opensearch, Qdrant, Milvus и т. д). 

Для этого используется PostgreSQL + расширение pgvector, которое добавляет поддержку хранения эмбеддингов (векторов) и поиск по расстоянию до ближайших соседей (KNN) прямо внутри SQL-движка. Разберем, как это работает на практике.

В RAG-пайплайне текст документов и запрос пользователя преобразуются в векторные представления. PostgreSQL хранит эти векторы в таблице и позволяет выполнять поиск по смысловой близости, а не по точному совпадению слов.

Для этой задачи будем использовать pgvector — это расширение к PostgreSQL, которое добавляет тип данных vector и операторы поиска по расстоянию до ближайших соседей (KNN).

Поддерживаются три основные метрики сравнения векторов:

  • L2 (евклидово расстояние) — классическое расстояние между двумя точками в многомерном пространстве. Хорошо работает, если векторы не нормализованы и распределение значений относительно равномерное.

  • Cosine similarity (косинусное сходство). В отличие от предыдущей метрики измеряет не абсолютное расстояние, а угол между двумя векторами. Подходит для текстовых эмбеддингов, где важна направленность, а не масштаб. Требует нормализации векторов.

  • Inner product (внутреннее произведение) — скалярное произведение двух векторов. Может использоваться как прокси для оценки «сходства» при обучении моделей и в задачах ранжирования.

Допустим, мы получаем на наш запрос именно такой вектор от модели OpenAI. Для хранения создаем таблицу с типом VECTOR:

CREATE TABLE items (
 id SERIAL PRIMARY KEY,
 title TEXT,
 embedding VECTOR(1536)
);

Добавим данные для нескольких векторов разных объектов:

INSERT INTO items (title, embedding) VALUES
 ('PostgreSQL embeddings', '[0.10, -0.80, 0.45]'),
 ('Neural image processing', '[0.42, 0.18, -0.35]'),
 ('Sound pattern matching', '[-0.20, 0.70, 0.60]'),
 ('Document clustering', '[0.09, -0.79, 0.48]');

Теперь сравним их попарно и отсортируем по расстоянию:

SELECT
  a.title AS title_a,
  b.title AS title_b,
  a.embedding <-> b.embedding AS distance
FROM items a
JOIN items b ON a.id < b.id
ORDER BY distance;

Оператор <-> здесь вычисляет расстояние между двумя векторами. Таким образом, мы можем оценивать степень семантической близости любых объектов, представленных векторами. Какая именно метрика используется, зависит от операторного класса, заданного при создании индекса.

В подобных RAG-сценариях нет необходимости сразу вводить отдельный класс инфраструктуры типа векторная БД. Семантический поиск можно реализовать эволюционно поверх существующего PostgreSQL.

А если вы не хотите самостоятельно заниматься настройкой индексов, тюнингом памяти и производительности, а также обновлением версии PostgreSQL, то воспользуйтесь DBaaS от Selectel. Мы предоставим вам кластер PostgreSQL с преднастроенными расширениями, готовый к эксплуатации под нагрузкой. Это позволит сосредоточиться на RAG-логике и качестве поиска, а не на инфраструктурной оптимизации.

Теги:
Всего голосов 8: ↑7 и ↓1+11
Комментарии0

Backup 2.0 в «Хайстекс Акура»: дедупликация на уровне хранения и новый уровень эффективности

Когда объемы данных растут, увеличиваются и требования к корпоративным системам резервного копирования. Компаниям необходимо хранить больше резервных копий, соблюдать установленные сроки хранения и при этом контролировать затраты на инфраструктуру. Чтобы решить эту проблему, мы переработали слой хранения в платформе «Хайстекс Акура» и выпустили обновление Backup 2.0.

Что изменилось:

  • Дедупликация данных на уровне хранилища для снижения объема хранения и оптимизации использования дисковых ресурсов.

  • Сжатие резервных копий для дополнительной экономии дискового пространства с возможностью выбора оптимальных алгоритмов компрессии.

  • Шифрование данных при хранении, обеспечивающее базовую защиту резервных копий в состоянии покоя.

  • Выделенное хранение метаданных резервных копий, гарантирующее целостность, управляемость.

Наибольший эффект новая архитектура может дать в средах с большим количеством однотипных виртуальных машин и регулярно создаваемых точек восстановления.

В ближайших версиях:

  • Гибкие сценарии резервного копирования.

  • Отчуждаемые резервные копии.

  • Долгосрочное архивное хранение.

Если хотите примерить Backup 2.0 на свою инфраструктуру, оставьте заявку — инженеры «Хайстекс» помогут рассчитать параметры хранилища для вашей инфраструктуры.

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии0

Вебинар уже через 20 минут: расскажем, как защищать данные в S3

В 12:00 мск на вебинаре разберем все: от базовых Bucket Policies и версионирования до продвинутых Conditional Write, Object Lock (WORM) и клиентского шифрования. Расскажем, как комбинировать эти инструменты для защиты от случайного удаления и кибератак. Объясним, как соответствовать регуляторным требованиям. Вебинар практический, так что вы увидите реальные примеры настройки S3 через API и CLI.

Вы узнаете

  • Какие уровни защиты данных в S3 существуют 

  • Как настраивать версионирование, Conditional Write, Object Lock, шифрование с реальными командами и примерами кода 

  • Какие границы и подводные камни существуют у каждого инструмента 

  • Как комбинировать механизмы для защиты от ransomware, случайного удаления, взлома ключей и соответствия 152-ФЗ 

Подключайтесь: 

📹 на YouTube;

📹 во ВКонтакте.

Теги:
Всего голосов 3: ↑3 и ↓0+8
Комментарии0
1
23 ...