1. Hadoop

  2. Hive 数据仓库

  3. Spark

大数据的特点

大数据的特点可以用 5 个字来概括:大、多、值、快、信

特点

含义

关键数据 / 说明

数据体量大

全球 35ZB(2020 年);百度 74PB、8PB;阿里 60PB、7.2PB;腾讯 100PB、4PB

种类和来源多样化

种类:结构化、非结构化;来源:日志、音频、视频

低价值密度

客户量 1000 万,最有潜力的客户仅 10 位

速度快

数据增长速度快、处理速度也快、获取数据的速度快

数据的质量

数据的准确性、数据的可信赖度

大数据的应用场景

大数据已经渗透到各行各业,从功能维度看,主要集中在三大方向:精准营销、效率提升、决策支持。不同行业对这三个方向的侧重程度不同:

功能 \ 行业

金融

互联网

制造业

公共管理

交通与物流

精准营销

●●●

●●

效率提升

●●●

●●

●●●

●●●

●●●

决策支持

●●

●●

●●

●●●

●●

其中 越多表示该行业在这个功能方向上的应用越深入、越典型(● 与 ●●● 仅表示相对程度)。下面挑几个最典型的场景展开。

金融:让借贷更放心

以贷款业务为例。在放款之前,贷款借出方会先利用大数据对借款人进行贷前审核,以此保障贷后的还款率。

  • 借出方从各个渠道合法收集借款人的标签信息,如学历、职业、薪资状况、历史借款还款情况等。

  • 海量数据被放入反欺诈模型、还款能力模型、身份验证模型等数个模型中做训练,最终评估出是否通过本次贷款申请、贷款的额度、贷款人的还款意愿等信息。

  • 借款人数据收集得越多、标签维度越细、数据越真实,审核效果就越全面。

互联网广告:让广告营销更高效

广告是互联网行业最常见的变现手段之一。

  • 投放前期:通过大数据手段整合、分析大量数据,包括用户的浏览习惯、消费行为、浏览记录、对广告的点击量等,构建全面的用户画像,保证广告定向投放。

  • 投放中后期:通过实时数据反馈,结合用户所处地域、时间的变化,动态优化广告素材,让同一个用户在不同场景下享受不一样的广告服务。

新媒体:让新媒体更懂你

  • 短视频平台会通过大数据平台分析用户的喜好,根据用户的喜好给用户推荐小视频。

  • 头条类资讯平台会根据你的浏览历史,推荐你喜欢或者关注的内容。

大数据分析的业务步骤

一个完整的大数据分析项目,通常按以下流程推进:

步骤

做什么

常用工具 / 技术

1. 明确目的和思路

先想清楚要分析什么、解决什么问题,以及分析的思路和方法

2. 数据收集

从各业务系统、日志、外部渠道采集数据

Sqoop、Flume 等

3. 数据处理

对原始数据做提取、清洗、转换、加载(ETL)

Sqoop、Kettle、MapReduce 等

4. 数据分析

对清洗后的数据进行统计、建模、挖掘,得出结论

Hive、Spark、Flink 等

5. 数据可视化

把分析结果用图表等直观形式呈现出来

Superset、ECharts、BI 工具等

6. 报告撰写

结合业务背景解读数据结论,形成分析报告并给出建议

大数据职业规划

大数据方向目前的岗位需求主要集中在以下几类:

  • 大数据开发工程师

  • Hadoop 开发工程师

  • Spark 开发工程师

  • 实时计算开发工程师

  • 数据仓库工程师

  • ETL 开发工程师

  • BI 开发工程师

  • 数据挖掘工程师

  • 数据架构师

学习路线

按以下四个阶段循序渐进,是比较稳妥的大数据学习路径:

1:Linux 系统

大数据生态的组件几乎都部署运行在 Linux 上。先掌握常用命令、Shell 脚本,以及集群环境的搭建与运维。

2:编程语言

  • Java:大数据生态的主力开发语言(Hadoop、Flink 等都是 Java 系);

  • SQL:数据仓库与数据分析的基本功,Hive / Spark SQL 都靠它;

  • Scala:Spark 的原生语言,函数式编程风格;

  • Python:数据分析与数据挖掘方向的常用语言。

3:大数据框架

大数据生态非常庞大,按职能可以分为几类:

职能

代表组件

分布式存储

HDFS、HBase、Cassandra、Redis

资源调度

YARN、Mesos

计算引擎

MapReduce、Spark、Flink、Tez

数据仓库 / SQL 查询

Hive、Impala、Drill、Presto

消息队列

Kafka

数据采集 / 交换

Sqoop、Flume、Chukwa

任务调度 / 管理

Oozie、Azkaban、Ambari、Cloudera Manager

其他

ZooKeeper(协调)、Mahout(数据挖掘)、Hue / Zeppelin(交互分析)

核心框架:Hadoop、Hive、Spark、Flink、Kafka、HBase —— 这几个是必须吃透的。

4:项目实战

以一个典型的在线教育离线数据仓库项目为例,把前面学的技术串起来:

层次

内容

技术

数据源

电商、面授教育、在线教育等各业务线数据

数据采集

把业务库数据同步到大数据平台

Sqoop

数据存储

数仓分层:ODS → DW → App,落在 HDFS 上

HDFS、Hive

数据计算

离线批处理与任务调度

Hive、Oozie、Cloudera Manager

数据展示

分析结果落库并对外提供服务

SpringBoot、MySQL

可视化

营收、学员、课程等维度的报表大屏

BI 可视化报表