数据仓库首要解决的问题是数据孤岛问题!在企业生产过程中,每个部门、子公司都会产生数据,数据如果不能统一管理,久而久之部门间或子公司间的数据会烟囱式生产,最终会形成数据孤岛。
数据孤岛只能片面的反应生产经营情况,缺乏全局的数据支持,是分析决策的大忌。因此,数据仓库在解决了数据孤岛问题后,才可以谈指标体系、资产管理等概念。良好的数据仓库管理体系需覆盖企业生产经营的所有数据,才能全面、真实、客观的反应企业发展情况。数据仓库需具备企业全域数据收集和存储能力(数据湖),在此基础上展开ETL分析。
为保证数据处理的时效性,实时数据仓库也需要规划到数据仓库体系中。数据仓库的下游对应不同主题域的数据集市,数据使用方从数据集市中获取他们需要的数据。
因此我觉得良好的数据仓库管理体系应该包含以下几部分内容:
1.数据湖:负责企业全范围的数据收集和存储,避免数据烟筒式生产的关键;
2.数据仓库:离线数据仓库(传统意义上的数据仓库)、实时数据仓库(解决数据时效性问题),负责对数据湖中的数据进行ETL;
3.数据集市:数据仓库分析结果的载体,根据不同场景划分为不同的主题域。是后续开展指标体系、数据质量体系,数据资产体系的关键因素。
- 版权申明:此文如未标注转载均为本站原创,自由转载请表明出处《草原上的建筑- 草原上的建筑模型-玉龍之鄉》。
- 本文网址:https://liangzhidong.cn/?post=110
- 上篇文章:大数据平台建设系列:(三)实时数据仓库(实时数仓)建设
- 下篇文章:大数据平台建设系列:(一)浅谈数据中台提供的能力