楼主: ada89k
2712 5

关于Hadoop的数据仓库的概念和Hive介绍 [推广有奖]

  • 3关注
  • 72粉丝

院士

99%

还不是VIP/贵宾

-

威望
2
论坛币
538792 个
通用积分
14.7458
学术水平
123 点
热心指数
149 点
信用等级
82 点
经验
46289 点
帖子
1667
精华
3
在线时间
2443 小时
注册时间
2017-2-7
最后登录
2024-4-22

+2 论坛币
k人 参与回答

经管之家送您一份

应届毕业生专属福利!

求职就业群
赵安豆老师微信:zhaoandou666

经管之家联合CDA

送您一个全额奖学金名额~ !

感谢您参与论坛问题回答

经管之家送您两个论坛币!

+2 论坛币

关于Hadoop的数据仓库的概念和Hive介绍


关于Hive它是基于Hadoop的数据仓库工具,下面就是关于Hadoop的数据仓库的概念和Hive的介绍。


HHive可对存储在HDFS上的文件中的数据集进行数据整理、特殊查询和分析处理,提供了类似于SQL语言的查询语言–HiveQL,可通过HQL语句实现简单的MR统计,Hive将HQL语句转换成MR任务进行执行。

数据仓库的概念


数据仓库(Data Warehouse)是一个面向主题的(Subject Oriented)、集成的(Integrated)、相对稳定的(Non-Volatile)、反应历史变化(Time Variant)的数据集合,用于支持管理决策。

数据仓库体系结构通常含四个层次:数据源、数据存储和管理、数据服务、数据应用。


数据源:是数据仓库的数据来源,含外部数据、现有业务系统和文档资料等;


数据集成:完成数据的抽取、清洗、转换和加载任务,数据源中的数据采用ETL(Extract-Transform-Load)工具以固定的周期加载到数据仓库中。


数据存储和管理:此层次主要涉及对数据的存储和管理,含数据仓库、数据集市、数据仓库检测、运行与维护工具和元数据管理等。

数据服务:为前端和应用提供数据服务,可直接从数据仓库中获取数据供前端应用使用,也可通过OLAP(OnLine Analytical Processing,联机分析处理)服务器为前端应用提供负责的数据服务。

数据应用:此层次直接面向用户,含数据查询工具、自由报表工具、数据分析工具、数据挖掘工具和各类应用系统。

Hive


Hive是建立在Hadoop之上的数据仓库,由Facebook开发,在某种程度上可以看成是用户编程接口,本身并不存储和处理数据,依赖于HDFS存储数据,依赖MR处理数据。有类SQL语言HiveQL,不完全支持SQL标准,如,不支持更新操作、索引和事务,其子查询和连接操作也存在很多限制。


Hive把HQL语句转换成MR任务后,采用批处理的方式对海量数据进行处理。数据仓库存储的是静态数据,很适合采用MR进行批处理。Hive还提供了一系列对数据进行提取、转换、加载的工具,可以存储、查询和分析存储在HDFS上的数据。

二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

关键词:Hadoop 数据仓库 Hive Had HIV Hadoop 数据仓库 Hive

沙发
942673 在职认证  发表于 2017-3-2 16:46:06 |只看作者 |坛友微信交流群
感谢楼主分享

使用道具

藤椅
acedownload 发表于 2017-4-18 15:45:11 |只看作者 |坛友微信交流群
谢谢楼主分享知识!

使用道具

板凳
walt_xu 发表于 2019-10-29 10:37:44 |只看作者 |坛友微信交流群
谢谢楼主分享!

使用道具

报纸
天蓝草绿 发表于 2019-12-24 15:39:16 |只看作者 |坛友微信交流群
谢谢楼主分享!
本文来自: 人大经济论坛 数据仓库技术 版,详细出处参考: https://bbs.pinggu.org/forum.php?mod=viewthread&tid=5361437&page=1&from^^uid=2830037

使用道具

地板
火狐2019226 在职认证  发表于 2020-6-26 12:37:47 |只看作者 |坛友微信交流群
提示: 作者被禁止或删除 内容自动屏蔽

使用道具

您需要登录后才可以回帖 登录 | 我要注册

本版微信群
加好友,备注cda
拉您进交流群

京ICP备16021002-2号 京B2-20170662号 京公网安备 11010802022788号 论坛法律顾问:王进律师 知识产权保护声明   免责及隐私声明

GMT+8, 2024-4-25 02:22