数据仓库从0到1之数仓建模理论

这篇具有很好参考价值的文章主要介绍了数据仓库从0到1之数仓建模理论。希望对大家有所帮助。如果存在错误或未考虑完全的地方,请大家不吝赐教,您也可以点击"举报违法"按钮提交疑问。

从ODS层到ADS层,数据是越来越少的,数据分析都是以大量的数据为基础,对数据进行汇总聚合运算,抽丝剥茧,越往后数据的汇总层度越高,最后得到汇总的指标。

数据仓库从0到1之数仓建模理论,数据仓库

数仓分层原因

  1. 将复杂问题简化,将复杂的任务分解成多层来完成,每一层只处理简单的任务,方便定位问题;
  2. 减少重复开发,规范数据分层,通过中间层数据,能够减少极大的重复计算,增加一次计算结果的复用性;
  3. 隔离原始数据,不论是数据的异常还是数据的敏感性,使真实数据与统计数据解耦开;

数仓主体就是DWD(data warehouse detail:数据明细层),DWS(data warehouse service:服务数据层),DWT(data warehouse topic:数据主题层)。其中DWS,DWT两层都是汇总数据,从DWD来。

各分层简介

ODS

存放原始数据,原始数据保持原状。原始数据一类是日志,一类是业务数据。业务数据从mysql导入进来,本身就是结构化的,以具体分隔符分割,可以直接记载到对应数据库。但是日志数据就不行,是一行一行的字符串,需要将字符串解析成可以导入hive的数据格式。

即ODS层主要是对日志进行解析,要考虑解析成多少张表,按照什么逻辑去解析?定下逻辑后,解析的SQL怎么写?

业务数据主要就是怎么建模?所谓的建模就是明确要建哪些表,明确表中有哪些字段,表与表之间有什么样的关联?建模有一些指导思想,比如维度建模,关系建模,数仓一般采用维度建模。

DWD

明细层是数仓中关键的一层,是数仓的地基。明细数据从ODS层来,明细数据就是最原始最详细的数据,即一行数据指代依次业务行为,比如说order_info,一行数据就是依次下订单行为,该行数据就是明细数据。

该层需要构建维度模型,一般采用雪花模型。

维度建模一般按照以下四个步骤:

选择业务过程→声明粒度→确认维度→确认事实

  1. 选择业务过程(有几张事实表)

在业务系统中,挑选我们感兴趣(后面会分析的)的业务线,比如下单业务,支付业务,退款业务,物流业务,一条业务线对应一张事实表。

如果是中小公司,尽量把所有业务过程都选择。

如果是大公司(1000多张表),选择和需求相关的业务线。

  1. 声明粒度

数据粒度指数据仓库的数据中保存数据的细化程度或综合程度的级别。

声明粒度意味着精确定义事实表中的一行数据表示什么,应该尽可能选择最小粒度,以此来应各种各样的需求。

典型的粒度声明如下:

订单事实表中一行数据表示的是一个订单中的一个商品项。

支付事实表中一行数据表示的是一个支付记录。

  1. 确定维度

维度的主要作用是描述业务是事实,主要表示的是“谁,何处,何时”等信息。

确定维度的原则是:后续需求中是否要分析相关维度的指标。例如,需要统计,什么时间下的订单多,哪个地区下的订单多,哪个用户下的订单多。需要确定的维度就包括:时间维度、地区维度、用户维度。

  1. 确定事实

此处的“事实”一词,指的是业务中的度量值(次数、个数、件数、金额,可以进行累加),例如订单金额、下单次数等。

在DWD层,以业务过程为建模驱动,基于每个具体业务过程的特点,构建最细粒度的明细层事实表。事实表可做适当的宽表化处理。

事实表和维度表的关联比较灵活,但是为了应对更复杂的业务需求,可以将能关联上的表尽量关联上。如何判断是否能够关联上呢?在业务表关系图中,只要两张表能通过中间表能够关联上,就说明能关联上。

(补充:申明粒度那有了订单详情为什么还要有订单信息?因为考虑性能,假设一个需求订单和订单详情都可完成,但是订单详情需要一定程度聚合才能得到订单,所以直接使用订单可以减少性能开销。)

时间 用户 地区 商品 优惠券 活动 编码 度量值

至此,数据仓库的维度建模已经完毕,DWD层是以业务过程为驱动。

DWS

数据汇总层:DWS,汇总层有些汇总的比较轻,比如按天汇总用户订单表即可得到一天用户下单数。即一行信息代表一个主题对象(用户)一天的汇总行为。

DWT

有些汇总程度比较大,比如按历史积累数据汇总用户订单表,即可得到用户历史下单记录数。即一行信息代表一个主题对象(用户)历史累计的行为汇总。

DWS和DWT都是建宽表,按照主题去建表。主题相当于观察问题的角度。对应着维度表。

宽表层

在维度表中,以事实表为核心,到了宽表层则以维度表为核心。

DWS层和DWT层统称宽表层,这两层的设计思想大致相同,通过以下案例进行阐述。

  1. 问题引出:两个需求,统计每个省份订单的个数、统计每个省份订单的总金额
  2. 处理办法:都是将省份表和订单表进行join,group by省份,然后计算。同样数据被计算了两次,实际上类似的场景还会更多。
    那怎么设计能避免重复计算呢?
    针对上述场景,可以设计一张地区宽表,其主键为地区ID,字段包含为:下单次数、下单金额、支付次数、支付金额等。上述所有指标都统一进行计算,并将结果保存在该宽表中,这样就能有效避免数据的重复计算。
  3. 总结:
  • 需要建哪些宽表:以维度为基准。
  • 宽表里面的字段:是站在不同维度的角度去看事实表,重点关注事实表聚合后的度量值。
  • DWS和DWT层的区别:DWS层存放的所有主题对象当天的汇总行为,例如每个地区当天的下单次数,下单金额等,DWT层存放的是所有主题对象的累积行为,例如每个地区最近7天(15天、30天、60天)的下单次数、下单金额等。

ADS

ADS层用于数仓后的应用比如报表、用户画像、机器学习等。通过ODS=>DWD=>DWT=>ADS得到应用需要的数据。

数仓维度建模

维度模型如图所示,主要应用于OLAP系统中,通常以某一个事实表为中心进行表的组织,主要面向业务,特征是可能存在数据的冗余,但是能方便的得到数据。

关系模型虽然冗余少,但是在大规模数据,跨表分析统计查询过程中,会造成多表关联,这会大大降低执行效率。所以通常我们采用维度模型建模,把相关各种表整理成两种:事实表和维度表两种。

数据仓库从0到1之数仓建模理论,数据仓库

维度表和事实表

维度表

维度表:一般是对事实的描述信息。每一张维表对应现实世界中的一个对象或者概念。 例如:用户、商品、日期、地区等。

维表的特征:

  • 维表的范围很宽(具有多个属性、列比较多)
  • 跟事实表相比,行数相对较小:通常< 10万条
  • 内容相对固定:编码表

例子:时间维度表:

日期ID day of week day of year 季度 节假日

事实表

事实表中的每行数据代表一个业务事件(下单、支付、退款、评价等)。“事实”这个术语表示的是业务事件的度量值(可统计次数、个数、金额等)**,例如,2020年5月21日,宋宋老师在京东花了250块钱买了一瓶海狗人参丸。维度表:时间、用户、商品、商家。事实表:250块钱、一瓶。

每一个事实表的行包括:具有可加性的数值型的度量值、与维表相连接的外键,通常具有两个和两个以上的外键

事实表的特征:

  • 非常的大
  • 内容相对的窄:列数较少(主要是外键id和度量值)
  • 经常发生变化,每天会新增加很多。

事务型事实表

每个事务或事件为单位,例如一个销售订单记录,一笔支付记录等,作为事实表里的一行数据。一旦事务被提交,事实表数据被插入,数据就不再进行更改,其更新方式为增量更新。

周期型快照事实表(全量表)

周期型快照事实表中不会保留所有数据只保留固定时间间隔的数据,例如每天或者每月的销售额,或每月的账户余额等。

例如购物车,有加减商品,随时都有可能变化,但是我们更关心每天结束时这里面有多少商品,方便我们后期统计分析。

比如加购物车、收藏夹表,数据亮大,既有更新又有新增,应该采用新增及变化策略。但是由于这两张表是周期性的快照事实表,所以我们采用全量表。

累积型快照事实表(周期型业务)

累计快照事实表用于跟踪业务事实的变化。例如,数据仓库中可能需要累积或者存储订单从下订单开始,到订单商品被打包、运输、和签收的各个业务阶段的时间点数据来跟踪订单声明周期的进展情况。当这个业务过程进行时,事实表的记录也要不断更新。

新增及变化表需要提取新增变化数据与原数据进行整合。

订单id 用户id 下单时间 打包时间 发货时间 签收时间 订单金额

拉链表

当表中的数据每日既有新增,也可能修改,但是修改的频率并不高,属于缓慢变化维度时,可以采用拉链表来存储用户维度数据,以解决数据重复存储。

拉链表简介

数据仓库从0到1之数仓建模理论,数据仓库

一行数据指代用户的一个状态,有一个开始时间和结束日期表示有效状态。

为什么要做拉链表

数据仓库从0到1之数仓建模理论,数据仓库

如何使用拉链表

数据仓库从0到1之数仓建模理论,数据仓库

拉链表形成过程

拉链表需要做一次初始化,将全量数据拉取到拉链表。

数据仓库从0到1之数仓建模理论,数据仓库

保证保证用户状态时间不重复。

拉链表制作过程图:

数据仓库从0到1之数仓建模理论,数据仓库

这里的临时表,是考虑避免在覆盖数据的时候元数据丢失,保证数据的安全性;hive 的insert overwrite会先往临时路径写数据,写完之后再修改临时路径名字,删除原来路径的数据,这也保证了数据的安全性。

原文链接:数据仓库从0到1之数仓建模理论 - 知乎 (zhihu.com)https://link.zhihu.com/?target=https%3A//www.everweekup.com/2021/06/30/%25E6%2595%25B0%25E6%258D%25AE%25E4%25BB%2593%25E5%25BA%2593%25E4%25B9%258B%25E5%25BB%25BA%25E6%25A8%25A1%25E7%2590%2586%25E8%25AE%25BA/侵权删!文章来源地址https://www.toymoban.com/news/detail-807580.html

到了这里,关于数据仓库从0到1之数仓建模理论的文章就介绍完了。如果您还想了解更多内容,请在右上角搜索TOY模板网以前的文章或继续浏览下面的相关文章,希望大家以后多多支持TOY模板网!

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处: 如若内容造成侵权/违法违规/事实不符,请点击违法举报进行投诉反馈,一经查实,立即删除!

领支付宝红包 赞助服务器费用

相关文章

  • 助力工业物联网,工业大数据之数仓维度层DWS层构建【十二】

    ODS层与DWD层的功能与区别是什么? ODS:原始数据层 存储格式:AVRO 数据内容:基本与原始数据是一致的 DWD:明细数据层 存储格式:Orc 数据内容:基于与ODS层是一致的 ODS层的需求是什么? 自动化建库建表 建表 表名 表的注释 表对应的HDFS地址 Schema文件的地址 DWD层的需求是什

    2024年02月08日
    浏览(36)
  • 数据仓库之建模理论以及仓库设计思想

    数据仓库是一个为数据分析而设计的企业级数据管理系统。数据仓库可集中、整合多个信息源的大量数据,借助数据仓库的分析能力,企业可从数据中获得宝贵的信息进而改进决策。同时,随着时间的推移,数据仓库中积累的大量历史数据对于数据科学家和业务分析师也是十

    2023年04月15日
    浏览(63)
  • 数据仓库(2)-认识数仓

    数据仓库 ,由数据仓库之父比尔·恩门(Bill Inmon)于1990年提出,主要功能仍是将组织透过资讯系统之联机事务处理(OLTP)经年累月所累积的大量资料,透过数据仓库理论所特有的资料储存架构,做有系统的分析整理,以利各种分析方法如联机分析处理(OLAP)、数据挖掘(Data Mini

    2024年01月21日
    浏览(34)
  • 数据仓库(数仓)介绍

    1 )数据仓库,英文名称为Data Warehouse,可简写为DW或DWH。数据仓库,是为企业所有级别的决策制定过程,提供所有类型数据支持的战略集合。它出于分析性报告和决策支持目的而创建。为需要业务智能的企业,提供指导业务流程改进、监视时间、成本、质量以及控制。 2 )数

    2024年02月06日
    浏览(43)
  • 离线数仓-数据仓库系统

    ODS层(Operational Data Store) :运营数据存储层,用于存储来自操作型系统的原始数据,是数据仓库中的第一层。 DWD层(Data Warehouse Detail) :数据仓库细节层,用于存储经过清洗和加工的详细数据,保留了原始数据的细节信息。 DWS层(Data Warehouse Summary) :数据仓库汇总层,用

    2024年04月11日
    浏览(43)
  • 数据仓库建设-数仓分层

    数据仓库能够帮助企业做出更好的决策,提高业务效率和效益;在数据仓库建设时,绕不开的话题就是数仓分层。 1. 降低数据开发成本 通用的业务逻辑加工好,后续的开发任务可以基于模型快速使用,数据需求的响应速度也会更快。 2. 降低任务运维成本 业务发展过程中,数

    2024年02月16日
    浏览(46)
  • 【数仓建设系列之一】什么是数据仓库?

    一、什么是数据仓库? 数据仓库(Data Warehouse,简称DW)简单来讲,它是一个存储和管理大量结构化和非结构化数据的存储集合,它以主题为向导,通过整合来自不同数据源下的数据(比如各业务数据,日志文件数据等),解决企业数据孤岛,为企业提供统一的数据视图。通过构建

    2024年02月12日
    浏览(36)
  • 数仓学习---15、数据仓库工作流调度

    工具部署链接 1.2.1 用户行为日志 1、启动日志采集通道,包括Kafka、Flume等 (1)启动Zookeeper (2)启动Kafka (3)启动Flume 2、修改日志模拟器配置文件 修改hadoop102和hadoop103两台节点中的/opt/module/applog/application.yml文件,修改mock.date参数如下。 3、执行日志生成脚本 4、观察HDFS上

    2024年02月15日
    浏览(41)
  • 数据仓库内容分享(十二):数仓和大数据的双向奔赴

    在 MapReduce 流行这些年之后,针对大数据集的 分布式批处理执行引擎 已经逐渐成熟。到现在(2017年)已经有比较成熟的基础设施可以在上千台机器上处理 PB 量级的数据。因此,针对这个量级的 基本数据处理问题 可以认为已经被解决,大家的注意力开始转到其他问题上: 完

    2024年02月22日
    浏览(43)
  • 最详细数据仓库项目实现:从0到1的电商数仓建设(数仓部分)

    数据仓库是一个为数据分析而设计的企业级数据管理系统 ,它是一个系统,不是一个框架。可以独立运行的,不需要你参与,只要运行起来就可以自己运行。 数据仓库不是为了存储(但是能存),而是为了统计分析 数据仓库可集中、整合多个信息源的大量数据,借助数据仓

    2024年03月23日
    浏览(41)

觉得文章有用就打赏一下文章作者

支付宝扫一扫打赏

博客赞助

微信扫一扫打赏

请作者喝杯咖啡吧~博客赞助

支付宝扫一扫领取红包,优惠每天领

二维码1

领取红包

二维码2

领红包