Pull to refresh
3
Владислав Мельников@Lazycat_su

User

Send message

Отличная статья.

P.S. Думаю, ахтунгов и веселья у тестировщиков хватает с лихвой.

У нас нет цели создать КХД - этим занимается другая команда. Мы не пересчитываем бухгалтерию и себестоимость по FIFO. Мы строим аналитические отчеты на основании имеющихся данных. Сейчас у нас максимальная глубина 2022 год (а не 2017, хотя я представляю где и когда возникают такие расхождения и я сам не понимаю, зачем вносить/удалять данные задним числом, скажем даже полугодовой давности). На самом деле на данный момент 3х лет для сравнения данных у нас хватает. Уровень возможных расхождений согласован с методологами и бизнес-пользователями.

Сверка есть, но не на уровне 5-летней давности ;-)

Мы сталкиваемся с пересчетом партиций задним числом - поскольку данные пересчитывались в Терадате. Мы так же их перезаливаем в облако. Именно использование параллельно создаваемых кластеров DataProc позволяет нам относительно быстро перегрузить эти данные.

Мы перенесли данные которые есть и которые нам необходимы для построения аналитики (это далеко не все данные). Далее накапливаем то что, считается. Кроме того, на данный момент у нас самый большой горизонт - 3 года. Часть данных опускается в Hadoop из Терадаты, а не удаляются. Так или иначе, с проблемой восстановления удаленных данных мы до сих пор не сталкивались.

У нас есть два алгоритма работы в данном случае - простой, когда мы просто перегружаем данные за день (в том случае, когда нет необходимости перетаскивать данные на большую глубину, и сложный - когда когда приходится вытаскивать изменения). в сложном случае, мы просто не удаляем, а обнуляем значение.

Information

Rating
Does not participate
Registered
Activity

Specialization

Разработчик баз данных, Архитектор баз данных
Ведущий
Базы данных