me_edu
Data Engineering: SQL, Airflow, пайплайны и качество данныхШаг 10 из 18 · 0% пройдено
Модель data pipeline

От источника к витрине

Шаг 10 из 1811 минТеория
Цель

Понять основной механизм темы «От источника к витрине» без заучивания отдельных терминов.

Как работать

Прочитайте блок один раз целиком, затем вернитесь к схеме или примеру и перескажите идею своими словами.

Критерий

Сформулированное правило, пример применения и одно ограничение метода.

PROCESS DIAGRAM1source2raw3staging4transform5mart6consumer
Слои пайплайна: каждый слой имеет назначение, владельца и проверку
Опорная идея

Data pipeline — это управляемый путь данных: источник, загрузка, staging, очистка, трансформация, витрина и потребитель. Ошибка новичка — писать один большой скрипт без границ. Инженер делит процесс на слои, чтобы можно было перепроиграть загрузку, найти сбой и проверить качество.

Сырые данные сохраняют максимально близко к источнику. Staging приводит типы и поля. Transform строит бизнес-логику. Mart отдаёт стабильную таблицу аналитикам, BI или ML. Такая архитектура делает данные проверяемыми.

Назад

Обсуждение

Войдите, чтобы участвовать в обсуждении.

Пока нет сообщений.