Comments 1
Хорошая иллюстрация того, что таблица rejects — не побочный продукт конвейера, а самое интересное в нём.
Добавлю сюжет из соседней области. Мы разбирали открытую товарную выгрузку, и 13,5 % записей (5 120 из 37 892) не проходили проверку контрольной цифры штрихкода — то есть номер был записан с опечаткой. Такие строки видно, они честно уходят в отклонения.
Хуже другое. Контрольная цифра EAN-13 ловит любую одиночную ошибку, но если цифры испорчены сразу в нескольких позициях, примерно каждый десятый испорченный номер проверку проходит. Такая строка в rejects не попадёт никогда: она валидна по всем формальным правилам и просто указывает не на тот товар.
У вас четыре причины отклонения, и все формальные — тип, пустота, дубль, знак. Есть ли в схеме проверки, которые ловят правдоподобные, но неверные значения? Мне кажется, именно они дают самые дорогие расхождения, потому что до BI доходят молча.
В CSV было 11 строк, до BI дошло 7. Куда пропали остальные четыре?