Hadoop
Hive 数据仓库
Spark
大数据的特点
大数据的特点可以用 5 个字来概括:大、多、值、快、信。
大数据的应用场景
大数据已经渗透到各行各业,从功能维度看,主要集中在三大方向:精准营销、效率提升、决策支持。不同行业对这三个方向的侧重程度不同:
其中 ● 越多表示该行业在这个功能方向上的应用越深入、越典型(● 与 ●●● 仅表示相对程度)。下面挑几个最典型的场景展开。
金融:让借贷更放心
以贷款业务为例。在放款之前,贷款借出方会先利用大数据对借款人进行贷前审核,以此保障贷后的还款率。
借出方从各个渠道合法收集借款人的标签信息,如学历、职业、薪资状况、历史借款还款情况等。
海量数据被放入反欺诈模型、还款能力模型、身份验证模型等数个模型中做训练,最终评估出是否通过本次贷款申请、贷款的额度、贷款人的还款意愿等信息。
借款人数据收集得越多、标签维度越细、数据越真实,审核效果就越全面。
互联网广告:让广告营销更高效
广告是互联网行业最常见的变现手段之一。
投放前期:通过大数据手段整合、分析大量数据,包括用户的浏览习惯、消费行为、浏览记录、对广告的点击量等,构建全面的用户画像,保证广告定向投放。
投放中后期:通过实时数据反馈,结合用户所处地域、时间的变化,动态优化广告素材,让同一个用户在不同场景下享受不一样的广告服务。
新媒体:让新媒体更懂你
短视频平台会通过大数据平台分析用户的喜好,根据用户的喜好给用户推荐小视频。
头条类资讯平台会根据你的浏览历史,推荐你喜欢或者关注的内容。
大数据分析的业务步骤
一个完整的大数据分析项目,通常按以下流程推进:
大数据职业规划
大数据方向目前的岗位需求主要集中在以下几类:
大数据开发工程师
Hadoop 开发工程师
Spark 开发工程师
实时计算开发工程师
数据仓库工程师
ETL 开发工程师
BI 开发工程师
数据挖掘工程师
数据架构师
学习路线
按以下四个阶段循序渐进,是比较稳妥的大数据学习路径:
1:Linux 系统
大数据生态的组件几乎都部署运行在 Linux 上。先掌握常用命令、Shell 脚本,以及集群环境的搭建与运维。
2:编程语言
Java:大数据生态的主力开发语言(Hadoop、Flink 等都是 Java 系);
SQL:数据仓库与数据分析的基本功,Hive / Spark SQL 都靠它;
Scala:Spark 的原生语言,函数式编程风格;
Python:数据分析与数据挖掘方向的常用语言。
3:大数据框架
大数据生态非常庞大,按职能可以分为几类:
核心框架:Hadoop、Hive、Spark、Flink、Kafka、HBase —— 这几个是必须吃透的。
4:项目实战
以一个典型的在线教育离线数据仓库项目为例,把前面学的技术串起来:
评论