Data pipeline — это управляемый путь данных: источник, загрузка, staging, очистка, трансформация, витрина и потребитель. Ошибка новичка — писать один большой скрипт без границ. Инженер делит процесс на слои, чтобы можно было перепроиграть загрузку, найти сбой и проверить качество.
Сырые данные сохраняют максимально близко к источнику. Staging приводит типы и поля. Transform строит бизнес-логику. Mart отдаёт стабильную таблицу аналитикам, BI или ML. Такая архитектура делает данные проверяемыми.