Все потоки

SQL *

Формальный непроцедурный язык программирования

83,43

Рейтинг

СтатьиПостыНовостиАвторыКомпании

FaryaRos 15 ноя 2024 в 11:33

7 продвинутых приемов pandas для науки о данных

4 мин

27K

Python * SQL * PostgreSQL * Data Engineering *

Аналитика

Перевод

Pandas — это основная библиотека для работы с данными. Вот несколько приёмов, которые я использую, чтобы быстрее и проще выполнять повторяющиеся задачи по работе с данными.

Читать далее

+22

badcasedaily1 13 ноя 2024 в 08:32

Триггеры в PostgreSQL: основы

Простой

6 мин

46K

Блог компании OTUSPostgreSQL * Базы данных * SQL *

Обзор

Приветствую! В этой статье поговорим про триггеры в PostgreSQL.

Начнём с базы: триггер в PostgreSQL — это такая функция, которая запускается автоматически при определённом событии в таблице. С триггерами можно автоматизировать массу рутины и освободить приложение от сложных проверок и вычислений, но это палка о двух концах.

Читать далее

+19

SbWereWolf 12 ноя 2024 в 12:43

Никогда не используйте MySQL, всегда используйте PostgreSQL

Простой

4 мин

28K

SQL * PostgreSQL * MySQL *

Мнение

Recovery Mode

Никогда не используйте MySQL, всегда используйте PostgreSQL

И вот почему, по результатам нагрузочного тестирования:

PostgreSQL в два раза меньше потребляет ресурса CPU, PostgreSQL в два раза меньше потребляет ресурса RAM, PostgreSQL в полтора раза меньше потребляет ресурса HDD (storage), PostgreSQL в три раза быстрее выполняет запросы, PostgreSQL после выполнения команды очистки (TRUNCATE TABLE) полностью очистил диск , MySQL очистил диск только наполовину.

Наверное MySQL надо уметь готовить ? Наверное. Если кто то напишет рецепт в комментариях, то благодарное человечество, в лице меня лично, скажет большое спасибо.

Одновременно с этим есть PostgreSQL, который можно не уметь готовить и иметь большую (такую же?) эффективность, стоит ли связываться с MySQL ?

Подробности (с картинками!)

-19

Daria_Chetyrkina 12 ноя 2024 в 10:16

Как фрагментация индексов в SQL Server «подкладывает свинью» производительности, и что с этим делать

Простой

4 мин

11K

Блог компании АвтомаконSQL * Microsoft SQL Server *

Мнение

Из песочницы

Привет, Хабр и его читатели!

Меня зовут Дарья Четыркина, я программист SQL в IT-компании «Автомакон». Предлагаю обсудить проблему, которая может «съедать» производительность вашего SQL Server — фрагментация индексов, в конце статьи будут решения этой ситуации. Если вам важно, чтобы SQL Server всегда работал на полную мощность, эта статья — для вас.

Когда дело касается SQL Server, индексы — это ваши верные помощники: они организуют данные так, что сервер может находить нужные записи быстрее, чем обычный поиск. При этом со временем индексы начинают «разваливаться» и создают массу проблем. Фрагментация индексов — невидимый враг, который замедляет запросы, увеличивает нагрузку на сервер и лишает ваш SQL Server той оптимальной скорости, ради которой и создаются индексы. Разберемся, почему возникает фрагментация индекса, как она вредит производительности и что можно с этим сделать.

Читать далее

+3

Sivchenko_translate 11 ноя 2024 в 19:32

Запросто собираем базу данных при помощи команд Linux

6 мин

24K

Ненормальное программирование * Программирование * SQL * Linux *

Перевод

База данных — это сердце многих приложений, от полнофункциональных корпоративных сайтов до сравнительно простых инструментов, например, для ведения списков покупок и финансовых трекеров. Популярны реляционные базы данных на основе SQL, но в Linux можно собрать более простую и прозрачную альтернативную базу данных.

Читать далее

+53

Tzimie 8 ноя 2024 в 14:07

Насколько сложна ваша работа MS SQL server DBA?

1 мин

5.3K

SQL * Microsoft SQL Server *

Мнение

Посчитаем по пунктам потенциальные грабли и проблемы, с которым встречается DBA на своем рабочем месте. Сколько получилось у вас? Отпишитесь в комментариях.

Читать далее

+7

koanse 8 ноя 2024 в 13:01

Определяем доли и коэффициенты проникновения с помощью DAX

Простой

4 мин

3.8K

Блог компании VisiologySQL * Big Data * Визуализация данных *

Кейс

Привет, Хабр! Одной из важных задач в аналитических запросах является расчет долей, который позволяет узнать, какая часть записей из общего количества по всей таблице соответствует какому-либо критерию. Также нередко полезными оказываются коэффициенты проникновения (в общем-то тоже являющиеся долями). Они позволяют оценить продажи, найти взаимосвязи признаков и сделать много еще чего полезного. Чтобы проводить такого рода расчеты идеально подходит язык DAX. Если Вам интересно, насколько это удобно и как именно сделать это в DAX — добро пожаловать под кат :)

Читать далее

+3

KDim4eg91 7 ноя 2024 в 07:37

SQL для Junior Data Engineers: примеры бизнес-задач

Простой

6 мин

19K

Роадмэп

Вход в профессию Data Engineer требует не только владения инструментами для построения данных, но и уверенного знания SQL для решения задач различной сложности.

Несмотря на то, что многие SQL-запросы могут казаться «аналитическими», на практике именно Data Engineers часто отвечают за их написание и оптимизацию. Ведь аналитикам и специалистам по продукту требуется быстрый и точный доступ к данным для их анализа, а это означает, что DE должны обеспечить доступ к нужным данным и помочь в создании запросов для обработки больших объемов информации.

В этой статье я привожу примеры SQL-запросов, которые соответствуют уровню владения языком, необходимому для Junior Data Engineer.

Читать далее

+1

pluzanov 6 ноя 2024 в 11:35

PostgreSQL 18: Часть 1 или Коммитфест 2024-07

Средний

10 мин

7.8K

Блог компании Postgres ProfessionalPostgreSQL * SQL * Базы данных *

Эта статья открывает цикл о новостях будущей, 18-ой, версии PostgreSQL. Рассмотрим следующие возможности попавшие в июльский коммитфест.

Планировщик: поддержка правого полусоединения хешированием
Планировщик: материализация внутреннего набора строк для соединения вложенными циклами в параллельном плане
Вспомогательные функции планировщика для generate_series
EXPLAIN (analyze): статистика рабочих процессов узла Parallel Bitmap Heap Scan
Функции min и max для составных типов
Имена параметров для функций regexp*
Режим отладки в pgbench
pg_get_backend_memory_contexts: столбец path вместо parent и новый столбец type
Функция pg_get_acl
pg_upgrade: оптимизация работы pg_dump
Предопределенная роль pg_signal_autovacuum_worker

Читать дальше →

+10

Tehnologika 6 ноя 2024 в 09:46

Тестируем LLM для русского языка: Какие модели справятся с вашими задачами?

Средний

12 мин

47K

Искусственный интеллектМашинное обучение * Natural Language Processing * SQL * Python *

Аналитика

✏️ Технотекст 7

В последние годы большие языковые модели (LLM) стали важной частью бизнес-решений на базе ИИ, применяемых для генерации текста и анализа данных. Однако, большинство разработок ориентированы на англоязычные проекты, что создает сложности для компаний, работающих с русскоязычными данными.

Готовые LLM для русского языка часто показывают низкую точность и ограниченные возможности. Проблемы конфиденциальности также вынуждают компании выбирать локальные модели.

Наша компания давно занимается искусственным интеллектом и стала часто получать подобные запросы от клиентов — создание ИИ-решения с локальной обработкой данных. Мы задались вопросом, какие LLM хороши для таких решений, что мы можем предложить заказчику? Всё это вылилось в большой рисеч разных языковых моделей.

В статье рассмотрим, какие LLM подходят для задач на русском языке, протестируем их по разным параметрам и выявим лидеров. Мы оценили генерацию текста, ответы на вопросы, исправление ошибок и другие функции.

Читать далее

+9

life_of_junior_dev 5 ноя 2024 в 08:18

HHH90003004: firstResult/maxResults specified with collection fetch; applying in memory

Средний

2 мин

2.9K

Туториал

Перевод

Это предупреждение, которое выведет хибернейт, если для осуществления пагинации ему придется загрузить ВСЕ данные из таблицы, а не по одной странице.

Почему возникает и как пофиксить...

+2

xDimus 3 ноя 2024 в 13:40

Марии (db) 15 лет! 15 причин чтобы её полюбить (или хотя бы с ней познакомиться)

Простой

7 мин

12K

Базы данных * SQL * MySQL * PostgreSQL *

Мнение

Перевод

MariaDB Server исполняется 15 лет! Вот 15 причин, по которым разработчики и администраторы баз данных любят его!

Читать далее

+18

yakvenalex 3 ноя 2024 в 06:44

Асинхронный SQLAlchemy 2: улучшение кода, методы обновления и удаления данных

20 мин

32K

Блог компании AmveraPython * PostgreSQL * SQL * DevOps *

Третья статья цикла по асинхронному SQLAlchemy 2 посвящена оптимизации кода, обновлению и удалению данных. Рассмотрены улучшения базового класса, подходы к обновлению записей и методы удаления, с акцентом на повышение производительности. Нажмите «Читать», чтобы ознакомиться с материалом.

Читать далее

+11

KainoRhine 2 ноя 2024 в 16:45

СTE, подзапрос или представление?

5 мин

43K

PostgreSQL * SQL *

Обзор

Здравствуйте, дорогие друзья! Сегодня мы окунёмся в мир SQL запросов и рассмотрим различные подходы, которые разработчики используют для работы с данными в БД. В современном мире разработки, где информация становитесь все больше и больше, и скорость получения данных имеет большое значение, умение эффективно извлекать и обрабатывать данные становится неотъемлемой частью работы многих SQL специалистов (особенно тех кто работает с нагруженными системами и DWH). Мы поговорим о таких методах, как Common Table Expressions (CTE), подзапросы, представления и материализованные представления.

Читать далее

+4

koanse 31 окт 2024 в 20:58

Работа с календарями в BI — с DAX и без него

7 мин

6.9K

Блог компании VisiologyВизуализация данных * SQL * Big Data *

Кейс

Привет, Хабр! При работе с Business Intelligence и дашбордами практически в любой предметной области встречаются даты и календари, поэтому от выбора представления дат и их составных частей (день, месяц, квартал, полугодие, год и т.д.), ключей дат и таблицы с датами зависит производительность всех дашбордов. В этой статье я расскажу о том, как можно оптимизировать работу с датами в Visiology — с использованием DAX и без него. Интересно? Добро пожаловать под кат! :)

Читать далее

+10

llotar 29 окт 2024 в 13:27

Как ускорить высокопараллельные вставки строк в SQL Server за считанные часы: опыт Mindbox

Средний

7 мин

8.7K

Блог компании MindboxБазы данных * Microsoft SQL Server * SQL *

Туториал

Привет, Хабр!

Меня зовут Тимур Маннапов, и я самый обычный senior-разработчик в Mindbox.

На примере нашего продукта я расскажу, почему при загрузке CPU наполовину или меньше скорость параллельных вставок на SQL-сервере упирается в «невидимый» предел, а потом и вовсе замедляется. На нашем железе предел был в районе ~120 тысяч строк в минуту в одну таблицу. Поделюсь, как его преодолеть, не потратив годы на разработку и миллионы на новый сервер.

Читать далее

+15

mrmcmva 26 окт 2024 в 13:27

Где циклу while нет альтернативы

Средний

4 мин

6.4K

Python * SQL * Oracle *

Кейс

Уверен многие тру-программисты и без меня знают их, но я решил собрать во едино все реализации циклов через while, которыми я активно пользуюсь, как автоматизатор, тестировщик и разработчик ETL.

Читать далее

0

fr3ddy_f 25 окт 2024 в 06:59

SQLAlchemy 2.0 + Python Generic, или как создать универсальный репозиторий для работы с БД

Простой

5 мин

12K

Туториал

Доброго времени суток, товарищи, эта статья, так скажем, продолжение предыдущей статьи об SQLAlchemy 2.0 для новичков, в этой статье мы узнаем что такое Python Generic и как его можно использовать в наших целях при взаимодействии с БД.

Читать далее

+8

mafet 24 окт 2024 в 10:28

Ручное восстановление БД PostgreSQL после аппаратного сбоя

Сложный

28 мин

8K

PostgreSQL * Базы данных * Системное администрирование * SQL *

Туториал

В очередной рабочий день поступила задача обновить Gitlab. Задача в общем-то не сложная, ни смотря на то, что там он установлен в докере из многим знакомого образа от sameersbn, что впоследствии было переделано на omnibus (что бы это не значило), т.к. по моему опыту omnibus версия (установка на чистый линукс) гораздо проще и предсказуемей в эксплуатации. Впрочем статья совсем не об этом.

Но как можно понять из наличия этой статьи, что-то пошло не так...

Читать далее

+19

datamisha 24 окт 2024 в 08:49

Что такое DWH?

Простой

4 мин

76K

Big Data * Data Engineering * SQL *

DWH (Data Warehouse или по русски Хранилище данных) - это специализированная система для хранения и управления большими объемами данных, которые объединяются из разных источников с целью анализа и построения отчетов

Короче, это место, где все нужные данные из разных мест собираются и потом ими уже удобно пользоваться - строить разные отчетики, строить ИИ на благо всему человечеству и подобные вещи

Грубо говоря, задача при построении хорошего DWH состоит в том, чтобы построить Базу Данных и все необходимое вокруг него, в которой будут лежать правильные данные в удобном виде и в которую можно слать большие-сложные SQL запросы и не бояться, что что-то сломается и всем этим было удобно пользоваться

Читать далее

+2

1 2 ...

31

32 33 ...