搭建数据仓库的具体步骤有哪些?

搭建数据仓库的步骤如下:需求分析、逻辑分析、设计ODS系统、数仓建模、数据集市建模、数据源分析、数据获取和整合、应用分析和报表展现。

1、需求分析
数据仓库的设计和建立是为了企业服务的,所以在实际的调研过程中需要与业务方或客户方一起分析需求,将数据仓库所能实现的目标和不容易解决的问题协商清楚,对于不同的需求分类进行详细分析、评估和优先级定义,补充需求文件,最好确定需求、开展建设工作、保障质量。

2、数据仓库的逻辑分析

3、设计数据仓库ODS层
ODS数据缓冲区、ODS统一信息视图区

4、数据仓库建模:概念模型设计、逻辑模型设计、物理模型设计
(需要重点关注)

5、数据集市建模:选择合适的维度和度量,以及建立正确的关系和连接方式,以实现准确和高效的数据分析和提取。同时,也需要考虑数据清洗和数据转换等问题,以确保数据的质量和有效性。

6、数据源分析:
需求调研:了解用户的数据需求和数据使用场景,确定需要从哪些数据源抽取数据,并确定数据抽取的频率和方式等。
数据源分析:在需求调研的基础上,对数据源进行进一步的分析和总结

7、数据获取与整合:ETL数据处理过程是数据获取和整合的核心过程。在进行数据的获取和整合时,一定要注意数据的一致性和可靠性。

8、数据应用分析和报表展示:数据仓库的最终价值落地,往往是通过报表实现的,它可以为企业决策和业务应用提供必要的数据支持和依据。

案例流程分析

1.指标需求分析
输出【指标需求表】:指标需求方-分析场景-数据指标-展示形式
2.数据指标口径
输出【指标口径表】:业务流程-指标名称-指标口径-是否需要新增埋点数据源-源系统-数据源表-数据字段-字段计算
注意:暂时不考虑维度,只聚焦于度量指标梳理
3.可视化看板设计
输出【数据看板原型】
注意:同环比计算规则、统计日期、数据更新日期、筛选条件规则、统计方式(PV/UV等);
注意:这个过程和数据指标口径的需求文档是相辅相成不断丰富的过程
4.基于2和3存在数据源缺失的需要新增前后端埋点数据源(代码埋点、可视化埋点、全埋点)
输出【埋点需求文档】:事件编号-业务/产品-指标名称-事件来源/埋点类型-属性名称(公共属性/业务属性/用户属性)-属性值类型-属性值示例-事件触发规则-上线时间-上线版本号-截图说明
4.1【公共属性】:字段英文名-字段中文名-字段类型-属性值示例
4.2【用户属性】:
4.3【业务事件和业务属性】:其中业务事件名称:事件命名由 4 部分组成:类型_流程_页面_功能;业务属性名例如:广告ID/文章ID等
5.ODS层/DWD层/DIM层/DWS层/ADS层数仓规划:
5.1根据业务过程的类型划分主题域
5.2明确建设内容:【业务总线数仓建设内容表】:数据域-业务过程-最细粒度(一条数据)-事实类型(事务表/累计快照/周期快照-所需维度勾选-度量值(金额求和/行数count等)
5.3指标拆分:【原子指标-派生指标-复合指标】:决定了DWD层和DWS层和ADS层
5.4维度表设计:【维度表设计文档】
5.5基于业务过程建设事实表:【本质:从一个完整的业务流的需求角度去设计】

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐