如何自学成为数据分析师?
大数据时代的到来,意味着数据增长的速度急速攀升。一方面,互联网+的经济模式使得传统行业也迸发出了巨大的数据体量。另一方面,传统互联网企业如今也做的风生水起,产业链不断完善,譬如BAT巨擘,每天产生的数据量非常惊人。
在这样的背景下,数据分析师开始应运而生,并蓬勃发展,而数据分析师也成为当下炙手可热的职位。那究竟应该如何成为一名数据分析师呢。在我看来,数据分析师需要从统计学,分析技能以及业务常识三个方面进行入手学习,这里重点说一下后两者。
首先来说分析技能。
Excel作为经典的数据分析工具,是数据分析师必备的武器库。灵活的Excel有两大经典利器,透视表以及灵活的函数。而在函数中,尤为重要的便是Vlookup。这个函数是用于进行字段匹配的,在实际工作中应用非常广泛。
Excel常用于基本的数据描述,并且可以处理的样本量非常有限。而在大数据时代,为了解决海量数据的查询,SQL就应运而生了。SQL基本可以分为增删改查四大模块,其中具体的语法又有where,select等。
除了Excel以及SQL之外,数据挖掘的工具也是必不可少的。如果没有编程基础,可以学习SPSS。而如果有编程,建议学习Python以及R。
说完分析技能,我们再来说一下业务知识。
业务知识并不是简单就能学会的,本质上是需要在企业中摸爬滚打才能学会的。然而,好的书籍也可以让你对业务知识有一定的了解。推荐两本书:《增长黑客》以及《精益数据分析》。
如果有问题,欢迎评论,一同探讨。
2022-03-14 广告
一、基本原则
坚持科学论证。广泛听取不同领域专家的意见,向权威机构、权威人士咨询,求真务实,严谨认真,确保课程内容科学,符合大数据分析工作的需要。
坚持继承发展。继承已有经验和成功做法,有针对性地进行修订完善,确保课程调整的连续性,使课程体系充满活力。
依据职业要求。课程标准符合数据分析的工作要求,突出了大数据分析的优势,强调了数据分析工作的必备技能,适用不同专业的人员学习。
二、课程变化
按照大数据分析工作的不同场景和技术要求,调整了初、中、高级考试课程,其中初级4门课程、中级5门课程、高级4门课程(详见附件)。
强调了统计理论、计算机技术和行业案例应用三维一体的大数据分析人才培养理念。
三、考试变化
按照考试要求,初级考试题型定为单项选择题、多项选择题;中级考试题定为简答论述题、案例应用题;高级考试题定为行业案例分析题。取消了初、中、高级在线作业考核内容。加强了数据分析实践应用能力考核标准。
四、考试课程过渡
参加2017年11月考试的考生,还延续使用2016年考试大纲,完成后续考试工作。2017年11月之后报名的考生,依据《BDA数据分析师课程标准(2018年版)》学习备考。
《BDA数据分析师课程标准(2018年版)》是数据分析师考试考核的基本依据,是考试招生重要导向,要把课程标准与大数据分析人才培训有机结合起来,统筹兼顾,形成合力,发挥好课程标准在企业人才培养和选拔中的引导作用,强化考试内容与数据分析岗位的关联性,保证教、考、就业一致性,提升数据分析师与人工智能领域从业人员综合能力。
2018年1月8日
附件:BDA数据分析师课程标准(2018年版)
一、初级考试科目说明
序号
课程名称
选用教材
科目一
初级数据分析方法 《统计学(第六版)》ISBN:9787300203096
本课程培养学生应用数据分析方法分析和解决问题的实际能力。内容包括数据分析的基本问题、数据的整理、数据的描述分析、数据的推断分析、数据的相关分析、数据的回归分析等内容。通过系统地掌握各种数据分析方法,理解其中所包含的统计思想及不同特点、应用条件及适用场合。
科目二
Excel数据处理与分析 《Excel高级数据处理及分析》ISBN:9787121246692
本课程主要是从Excel数据分析角度讲解数据的输入与验证、编辑与格式化、公式和函数,数学和统计函数处理、日期与时间函数、文本函数、财务函数、查找与引用函数、工作表函数、数组公式的高级应用等对处理数据。数据的组织和管理、公式和函数的综合应用实例,数据透视表分析数据、导入和分析外部数据、数据可视化图表分析、宏与VBA程序入门、数据的保护与共享,Excel综合应用案例。
科目三
大数据技术概论 《大数据技术概论》ISBN:9787302450511
本课程包括大数据概论、大数据采集及预处理、大数据分析、大数据可视化、Hadoop概论、HDFS和Common概论、MapReduce概论、NoSQL技术介绍、Spark概论、云计算与大数据等。
科目四
R语言 《R语言实用教程》ISBN:9787302371175
本课程是R语言初级课程,内容包括R程序基础操作、数据集、数据管理、图形图表、常用函数、描述分析、相关分析、数据可视化等内容。
考试说明
· 理论综合试卷:由科目一初级数据分析方法、科目二大数据技术概论、科目三Excel数据处理与分析、科目四R语言共4部分构成。
· 题型题量:单项选择题(共60道),多项选择题(共20道),理论综合试卷各科合计题量共80道选择题。
· 考试方式:笔试,150分钟,各科目分别达到60分及格。
· 上机综合试卷:由科目一初级数据分析方法、科目二大数据技术概论、科目三Excel数据处理与分析、科目四R语言共4部分构成。
· 题型题量:综合案例应用题共5道题。
考试方式:· 上机操作,150分钟,总分达到60分及格。
· 实践应用考核:按要求提交一份数据分析报告。
· 考核方式:自主完成报告的撰写,在线提交,经专家指导和答辩60分及格。
二、中级考试科目说明
序号
课程名称
选用教材
科目一
中级数据分析方法 《调查数据分析》ISBN:9787500577690
本课程主要内容有实验设计、参数检验、多元回归分析、主成份分析/因子分析、感知图、聚类分析、判别分析与分类树、时间序列分析、及其他常用的数据挖掘方法和思想。
科目二
数据挖掘 《数据挖掘导论(完整版)》ISBN: 9787115241009
本课程主要内容包括数据、分类、关联分析、聚类和异常检测五个方面。通过基本概念、代表性算法引出高级概念和算法。由浅入深理解数据挖掘。
科目三
大数据技术原理与应用 《大数据技术原理与应用(第2版)》ISBN:9787115443304
本课程以分布式数据存储的概念、原理和技术为主,包括HDFS、HBase、NoSQL数据库、云数据库、MapReduce分布式编程框架、基于内存的分布式计算框架Spark、图计算、流计算、数据可视化等。
科目四
Python数据分析 《利用Python进行数据分析》ISBN: 9787111436737
本课程强调Python的数据处理与分析的能力学习,主要内容包括:Python的基础知识和基本概念,以及一些高级的主题,包括抽象、异常、魔法方法、属性、迭代器等。
科目五
SQL数据库应用与实践 《SQL初学者指南(第2版)》ISBN:9787115448651
本课程主要以数据库的查询、统计、归并等数据操作内容为主,重点放在Sql语法的各种操作,以常见的关系Sql数据库为主。
考试说明
· 理论综合试卷:由科目一中级数据分析方法、科目二数据挖掘、科目三大数据技术原理与应用,科目四Python数据分析、科目五SQL数据库应用与实践共5门课程构成。
· 题型题量:简答题(5道),论述题(5道)案例题(5道),理论综合试卷各科合计题量为15道。
· 考试方式:笔试,150分钟,各科目分别达到60分及格。
· 上机综合试卷:由科目一中级数据分析方法、科目二数据挖掘、科目三大数据技术原理与应用,科目四Python数据分析、科目五SQL数据库应用与实践共5门课程构成。
· 题型题量:案例应用题共5道题。
· 考试方式:上机操作,150分钟,总分达到60分及格。
· 实践应用考核:按要求提交一份数据分析报告。
· 考核方式:自主完成报告的撰写,并在线提交,经专家指导和答辩60分及格。
三、高级
基本技术怎么强调都不过分。这里的术更多是(计算机、统计知识), 多年做数据分析、数据挖掘的经历来看、以及业界朋友的交流来看,这点大家深有感触的。
数据库查询—SQL
数据分析师在计算机的层面的技能要求较低,主要是会SQL,因为这里解决一个数据提取的问题。有机会可以去逛逛一些专业的数据论坛,学习一些SQL技巧、新的函数,对你工作效率的提高是很有帮助的。
统计知识与数据挖掘
你要掌握基础的、成熟的数据建模方法、数据挖掘方法。例如:多元统计:回归分析、因子分析、离散等,数据挖掘中的:决策树、聚类、关联规则、神经网络等。但是还是应该关注一些博客、论坛中大家对于最新方法的介绍,或者是对老方法的新运用,不断更新自己知识,才能跟上时代,也许你工作中根本不会用到,但是未来呢?
行业知识
如果数据不结合具体的行业、业务知识,数据就是一堆数字,不代表任何东西。是冷冰冰,是不会产生任何价值的,数据驱动营销、提高科学决策一切都是空的。
一名数据分析师,一定要对所在行业知识、业务知识有深入的了解。例如:看到某个数据,你首先必须要知道,这个数据的统计口径是什么?是如何取出来的?这个数据在这个行业, 在相应的业务是在哪个环节是产生的?数值的代表业务发生了什么(背景是什么)?对于A部门来说,本月新会员有10万,10万好还是不好呢?先问问上面的这个问题:
对于A部门,
1、新会员的统计口径是什么。第一次在使用A部门的产品的会员?还是在站在公司角度上说,第一次在公司发展业务接触的会员?
2、是如何统计出来的。A:时间;是通过创建时间,还是业务完成时间。B:业务场景。是只要与业务发接触,例如下了单,还是要业务完成后,到成功支付。
3、这个数据是在哪个环节统计出来。在注册环节,在下单环节,在成功支付环节。
4、这个数据代表着什么。10万高吗?与历史相同比较?是否做了营销活动?这个行业处理行业生命同期哪个阶段?
在前面二点,更多要求你能按业务逻辑,来进行数据的提取(更多是写SQL代码从数据库取出数据)。后面二点,更重要是对业务了解,更行业知识了解,你才能进行相应的数据解读,才能让数据产生真正的价值,不是吗?
对于新进入数据行业或者刚进入数据行业的朋友来说:
行业知识都重要,也许你看到很多的数据行业的同仁,在微博或者写文章说,数据分析思想、行业知识、业务知识很重要。我非常同意。因为作为数据分析师,在发表任何观点的时候,都不要忘记你居于的背景是什么?
但大家一定不要忘记了一些基本的技术,不要把基础去忘记了,如果一名数据分析师不会写SQL,那麻烦就大了。哈哈。。你只有把数据先取对了,才能正确的分析,否则一切都是错误了,甚至会导致致命的结论。新同学,还是好好花时间把基础技能学好。因为基础技能你可以在短期内快速提高,但是在行业、业务知识的是一点一滴的积累起来的,有时候是急不来的,这更需要花时间慢慢去沉淀下来。
不要过于追求很高级、高深的统计方法,我提倡有空还是要多去学习基本的统计学知识,从而提高工作效率,达到事半功倍。以我经验来说,我负责任告诉新进的同学,永远不要忘记基本知识、基本技能的学习。
二、要有三心。
1、细心。
2、耐心。
3、静心。
数据分析师其实是一个细活,特别是在前文提到的例子中的前面二点。而且在数据分析过程中,是一个不断循环迭代的过程,所以一定在耐心,不怕麻烦,能静下心来不断去修改自己的分析思路。
三、形成自己结构化的思维。
数据分析师一定要严谨。而严谨一定要很强的结构化思维,如何提高结构化思维,也许只需要工作队中不断的实践。但是我推荐你用mindmanagement,首先把你的整个思路整理出来,然后根据分析不断深入、得到的信息不断增加的情况下去完善你的结构,慢慢你会形成一套自己的思想。当然有空的时候去看看《麦肯锡思维》、结构化逻辑思维训练的书也不错。在我以为多看看你身边更资深同事的报告,多问问他们是怎么去考虑这个问题的,别人的思想是怎么样的?他是怎么构建整个分析体系的。
四、业务、行业、商业知识。
当你掌握好前面的基本知识和一些技巧性东西的时候,你应该在业务、行业、商业知识的学习与积累上了。
这个放在最后,不是不重要,而且非常重要,如果前面三点是决定你能否进入这个行业,那么这则是你进入这个行业后,能否成功的最根本的因素。 数据与具体行业知识的关系,比作池塘中鱼与水的关系一点都不过分,数据(鱼)离开了行业、业务背景(水)是死的,是不可能是“活”。而没有“鱼”的水,更像是“死”水,你去根本不知道看什么(方向在哪)。
如何提高业务知识,特别是没有相关背景的同学。很简单,我总结了几点:
1、多向业务部门的同事请教,多沟通。多向他们请教,数据分析师与业务部门没有利益冲突,而更向是共生体,所以如果你态度好,相信业务部门的同事也很愿意把他们知道的告诉你。
2、永远不要忘记了google大神,定制一些行业的关键字,每天都先看看定制的邮件。
3、每天有空去浏览行业相关的网站。看看行业都发生了什么,主要竞争对手或者相关行业都发展什么大事,把这些大事与你公司的业务,数据结合起来。
4、有机会走向一线,多向一线的客户沟通,这才是最根本的。
标题写着告诫,其实谈不上,更多我自己的一些心得的总结。希望对新进的朋友有帮助,数据分析行业绝对是一个朝阳行业,特别是互联网的不断发展,一个不谈数据的公司根本不叫互联网公司,数据分析师已经成为一个互联网公司必备的职位了。
数据分析师中国统计网——一位资深数据分析师的分享
知道了这些后,希望成长为数据分析师,就需要着手训练自己的能力和洞察力。既然是数据分析师,那就分别从数据和分析两方面入手。
数据当然包含了数据收集、处理、可视化等内容,每个环节对于最后的结果都有关键性的影响。其中涉及的技术性内容只是一部分而已,更重要的是你要理解数据收集(是否存在采样偏差?如何纠正或者改进?)、处理(是否有漏洞或异常情况没有考虑?)背后的逻辑。
你要充分了解这些概念背后的逻辑、动机是什么,才能正确地根据自己的目的作出选择。
数据可视化更多的是一门艺术:如何把信息以最恰当的方式呈现给希望获得这些信息的人。首先,你要充分理解这些信息究竟是什么,有什么特点,你才能较为恰当的选择采用的可视化工具。
另外一部分就是分析。当然就是各种分析模型,还是需要了解这些模型背后的逻辑,要放到整个项目的上下文中去看,而不是单纯地在模型中看。
总而言之,理解数据以及其中的信息是非常重要的,这决定了你的分析和呈现的方法是否合适,决定了最后的结论是否可靠。
现在可以回答题主的问题了:成长为一个数据分析师,要注意理解你的知识,形成一个系统,而不是像机器人一样机械地胡乱套用模型。在这个理念下训练你的编程能力,了解你所分析对象的原理和尽可能多的细节。在这个基础上,才能谈数据分析。