你应该学习哪些工具呢,PythonRHive
看到楼里大家都是系统性地阐述,我这边直接讲工具,毕竟工欲善其事,必先利其器。
作为一名数据分析师,应该学习哪些工具呢?一、Excel工具说起用什么做数据分析,很多人的脑海中都会不约而同地想到Python、R、SQL、Hive等看似很难掌握的数据分析工具,它们就像数据分析路上的拦路虎一样,让人踟蹰不前。其实,在众多的数据分析工具中,Excel属于最常用、最基础、最易上手的一款数据分析工具。Excel的功能十分强大,它不仅提供了众多的数据处理功能,像Excel函数能够帮助我们做数据整理,数据透视表帮助我们快速、高效的做各种维度分析,形形色色的图表能帮我们形象地展示出数据背后隐藏的规律,同时Excel还有很专业的数据分析工具库,包括描述性统计分析、相关系数分析等。Excel对于转行数据分析的小白来说,应该是最友好的。大家都知道“转行”其实是一件很困难的事儿,但是你学会了Excel,是完全可以找到一份“数据”相关的工作的,只有踏进数据领域,你才有可能从事其它更多的数据岗位。二、BI工具BI工具是专门按照数据分析的流程进行设计的,也是专门用于数据分析的工具。仔细观察这些工具后,它们的基本流程是:【数据处理】-【数据清洗】-【数据建模】-【数据可视化】。关于BI工具,其实有很多你估计已经用到过,比如说Tableau、Power BI,还有帆软FineBI等。今天我们就分别带着大家来盘点一下,这三款工具。1、TableauTableau是一款交互式数据可视化软件,它的本质其实也是Excel的数据透视表和数据透视图。Tableau也是很好的延续了Excel,只需要简单地拖拽,就能很快地实现数据的分类汇总,然后拖拽实现各种图形的绘制,并且可以实现不同图表之间的联合。Tableau同时支持数百种数据连接器,包括在线分析处理(OLAP)和大数据(例如NoSQL,Hadoop)以及云数据,至少现在你能学到的数据库软件,Tableau基本都能够实现与其数据之间的互动。2、Power BIPower-BI是一款(BI)商业智能软件,于2014年发布,旨在为用户提供交互式的可视化和商业智能,简单的数据共享,数据评估和可扩展的仪表板等功能。。大家可能都知道,Power BI以前是一款Excel插件,依附于Excel,比如Power Query,PowerPrivot, Power View和Power Map等,这些插件让Excel如同装上了翅膀,瞬间高大上,慢慢地就发展成为现在的Power BI数据可视化工具。Power BI 简单且快速,能够从 Excel电子表格或本地数据库创建图表。同时Power BI也是可靠的、企业级的,可进行丰富的建模和实时分析,及自定义开发。因此它既是你的个人报表和可视化工具,还可用项目、部门或整个企业背后的分析和决策引擎。同时,无论你的数据是简单的 Excel电子表格,还是基于云和本地混合数据仓库的集合, Power BI都可以让你轻松地连接到数据源,直观看到或发现数据的价值,与任何所希望的人进行共享。3、FineReport帆软是业内做报表比较久的一家公司,使用类excel风格的界面,可添加图表和数据源,也可实现大屏效果。其实它的类Excel风格界面,应该是它区别于Tableau工具的一个很重要的点。FineReport 通过直接连接到各种数据库,就能方便快捷地自定义各种样式,从而制作周报、月报和季报、年报。用过FineReport 的朋友,还会有另外一种体会,它的图形效果比Tableau要酷炫的多,操作起来同样也是那样的方便。另外,FineReport 的个人版本是完全免费的,并且所有功能都是开放的,大家赶紧下去试试吧。4、FineBI关于FineBI,这是目前市面上应用最为广泛的自助式BI工具之一,类似于国外的Tableau等BI分析工具,但FineBI在协同配合,数据权限上,能更好的解决国内企业的情况。但严格定义来讲,它其实是一款自助式BI。支持Hadoop、GreenPlumn、Kylin、星环等大数据平台,支持SAP HANA、SAP BW、SSAS、EssBase等多维数据库,支持MongoDB、SQLite、Cassandra等NOSQL数据库,也支持传统的关系型数据库、程序数据源等。5、Python & R其实不管是Excel,还是介绍的三款BI工具,它们都是为了执行特定功能,而设计出来的。如果说某一天,既定功能不能很好,或者说不能满足你的需求,那么应该怎么办呢?这就需要我们了解,并学习一点编程语言了,最大的优势就在于:它非常强大和灵活。不管是R或者 Python,都有很多包供我们调用,同时也可以自定义函数,实现我们的某些需求。最后,分析工具放在后台了,大家私信“BI”就能获得!数据分析师的岗位划分可以大致分为四个级别,分别是助理级、初级、中级和高级。一名初级的数据分析师,只需要掌握常规的分析方法、熟悉提取数据的套路。如果想进一步提升,则需要一定的经验积累,需要具备领导跨部门完成项目的能力。想成为中高级别的数据分析师,则需要更高阶的技术能力和更丰富的经验积累,在公司具有一定的影响力。
钻研专业知识和技能
初级数据分析师想要提升自己,最基本的就是学习新技术,除了能够熟练使用Excel和PPT中常用的开发功能外,还需要掌握一门数据库语言,比如SQL、Python等。当然,由于互联网行业发展速度较快,数据分析师又属于新兴职位,这一职位的技术迭代速度同样快,此时若想要将数据分析师作为长远发展的职业,还需要具备较强的学习能力,紧跟技术领域的发展趋势,注重学习当下主流的算法技术。这样才能做到与时俱进,不会在工作几年后就被新的同事比下去。同时,由于数据分析知识的更迭速度比较快,还可以在专业领域与相关人士共同探讨学习,与其他人形成技术壁垒。重视项目经验积累
数据分析师虽然有较强的理论知识要求,但同时他也是技术岗位,实践和理论同样重要。因此,初级数据分析师想要提升自身价值,除了要通过用各种常用的提取数据方法及分析方法来完成工作之外,更重要的是记录在做项目时用哪些方法出了问题,以及这些问题最后是如何解决的。尤其是参与大型复杂项目时,机会难得,更应在项目完成后书写工作总结,不是为了给领导看,而是为了给自己积累经验。根据行业诉求,针对性提升
任何一个岗位将来能不能有好的发展,除了关注岗位本身的工作内容,关注公司的运营情况,还应关注行业动态,了解行业诉求,从而更好地提升自我,得以重用。在数字化转型大潮中,许多传统企业也慢慢意识到了数据分析师的重要性,因此,数据分析师在电商、金融等很多领域都被需要,但不同领域的数据分析技术侧重点是不同的,比如电商平台促销分析,核心技术是数据清洗、ABC分类法等;贷款风控分析,核心是用户行为路径分析、单变量分析、群组分析等,因此,要根据所在行业要求,有针对性地学习核心技术,进行精细化培养、提升。总之,数据分析师这种新兴岗位的从业者想要提升自身价值,专业技能的学习和工作经验的积累应该贯穿始终,同时辅以行业要求进行专门提升。
SPSS、SAS都是用于统计分析,围绕统计学知识的一些基本应用,包括描述统计,方差分析,因子分析,主成分分析,基本的回归,分布的检验等等。SPSS用于市场研究较多,SAS银行金融和医学统计较多,有一些难度。
R语言像是综合性较强的一类数据分析工具,集统计分析、数据挖掘,数据可视化。展开来,讲讲数据分析~这些数据分析工具的使用还是看需求,每个企业应用的选择和方式都不同。
数据分析的概念很广,站在IT的角度,实际应用中可以把数据分析工具分成两个维度:第一维度:数据存储层——数据报表层——数据分析层——数据展现层
第二维度:用户级——部门级——企业级——BI级
1、数据存储层
数据存储设计到数据库的概念和数据库语言,这方面不一定要深钻研,但至少要理解数据的存储方式,数据的基本结构和数据类型。SQL查询语言必不可少,精通最好。可从常用的selece查询,update修改,delete删除,insert插入的基本结构和读取入手。
Access2003、Access07等,这是最基本的个人数据库,经常用于个人或部分基本的数据存储;MySQL数据库,这个对于部门级或者互联网的数据库应用是必要的,这个时候关键掌握数据库的库结构和SQL语言的数据查询能力;
SQL Server2005或更高版本,对中小企业,一些大型企业也可以采用SQL Server数据库,其实这个时候本身除了数据存储,也包括了数据报表和数据分析了,甚至数据挖掘工具都在其中了;
DB2,Oracle数据库都是大型数据库,主要是企业级,特别是大型企业或者对数据海量存储需求的就是必须的了,一般大型数据库公司都提供非常好的数据整合应用平台;
BI级别,实际上这个不是数据库,而是建立在前面数据库基础上的,企业级应用的数据仓库。Data Warehouse,建立在DW机上的数据存储基本上都是商业智能平台,整合了各种数据分析,报表、分析和展现,BI级别的数据仓库结合BI产品也是近几年的大趋势。
2、报表/BI层
企业存储了数据需要读取,需要展现,报表工具是最普遍应用的工具,尤其是在国内。过去传统报表大多解决的是展现问题,如今像帆软报表FineReport也会和其他应用交叉,做数据分析报表,通过接口开放功能、填报、决策报表功能,能够做到打通数据的进出,涵盖了早期商业智能的功能。
Tableau、Qlikview、FineBI这类BI工具,可分在报表层也可分为数据展现层,涵盖了数据整合、数据分析和数据展现。FineBI和Tableau同属于近年来非常棒的软件,可作为可视化数据分析软件,可常用FineBI从数据库中取数进行报表和可视化分析。相对而言,可视化Tableau更优,但FineBI又有另一种身份——商业智能,所以在大数据处理方面的能力更胜一筹。
?随着IT行业的不断进步,我们进入了海量访问数据和购买数据自动积累的时代。这些海量数据包含对企业活动极为有用的知识。但是无论积累多少数据,如果不进行分析,就毫无意义。
当下越来越多的公司正在采用BI。BI被定义为对业务系统、采购历史等积累的大量企业内部数据进行系统化、系统化的积累、分类、搜索、分析、处理的概念和机制。但是如果没有专业的人员来进行相关工作许多公司无法利用这一数据宝库。数据的重要性数据平均的陷阱
正在求职的你如果遇见一下两家公司,除了以下条件之外没有其他因素基本相同,你会选择哪一家?A公司平均年龄30.8岁,平均年收入405,921元B公司平均年龄31.8岁,平均年收入311,860元大多数人会回答说A公司更好。员工很年轻,工资也很高。当然如果行业、地理条件等其他参数不同,B公司可能会更好。但是如果不知道这些事情,应该认为如果正常思考的话,A公司会更好。但是这是一个极端的例子,如果每个人的年龄和年收入如下呢?A公司有一名超高薪高级员工,其余均为新人。另一方面,B公司在新秀和职业中期的老将之间取得了很好的平衡。而且,以同样23岁的薪水来看,B公司的工资压倒性地高。由此课件听取数据分析结果并仅根据平均值做出判断是多么危险。中国的平均家庭年收入也是如此。沿海地区的一些富人可能正在提高他们的整体年收入,从而掩盖了内陆地区的实际情况。分析日志数据是完全一样的。即使平均购买数量是3,大多数人也只购买1,并且有些人似乎是一些供应商的人购买了数百个。因此在进行这样的分析时,首先需要创建直方图并检查整体分布,然后再决定要分析的数据范围。只接受平均值或采取对策是非常危险的,因此不仅在数据分析中而且在一般生活中都需要小心。辛普森悖论
有各种各样的分析,从基于平均值和偏差的分析到使用多变量分析和人工智能的分析。但是俗话说分析 以交叉表开始,以交叉表结束,交叉表是所有分析的基础。什么是 Paradox(悖论)?即被解释为常识的反面。说得更通俗一点,它的意思是一个无论你怎么想都不能令人满意的结论,即使它是基于一个似乎正确的假设的解释。比如著名的 阿喀琉斯与乌龟悖论,速度快的阿喀琉斯无法超越面前的乌龟。乌龟领先于阿喀琉斯。当阿基里斯到达乌龟所在的位置时,乌龟正在向前移动。当阿喀琉斯再次到达乌龟的位置时,乌龟已经向前移动了。阿喀琉斯永远追不上乌龟。尽管结论完全没有说服力,但很难正确反驳它,因为导致结论的论证过程本身似乎是正确的。辛普森悖论的主题是 EH 辛普森统计悖论,它指出群体中的相关性可能不同于子群体中的相关性。在问卷调查中,交叉制表(分层)有时会揭示出总体制表(GT)中看不到的趋势,但这是完全不同的事情,结果完全没有说服力。能否用比较通俗的话解释一下阿基琉斯追龟的原理?0 赞同 · 0 评论回答
什么是交叉制表
假设一家制造商开发了一款新产品。为了确认与现有产品的差异,抽取了 100 名产品使用者的人进行测试。现有产品和新产品测试结果。从这张表看 55%的患者评价现有产品为好,而新产品为 58%,增加了3个百分点。会不会觉得新产品开发成功了?这里不讨论这 3个百分点是否有显着差异,但如果产品规划师、开发人员或研究人员应该多分解一点,按性别看或者做更详细的分析。显示了男性和女性之间的差异。从这张表看新产品似乎对男性有效,但现有产品似乎对女性更好。如果继续按原样销售该产品,我们就会发布一款对女性不太有效的产品。如此一来就可以看到按属性进行细分分析的重要性,而不是根据整体汇总结果进行判断。到此为止交叉制表的想法很普通。现在开始悖。显示了年龄之间的差异。现在,看这张表,你发现了什么?测试是这次做的 100 个人每个人的结果。之前对男性和女性是否有效存在分歧。但是按年龄段来看,45% 的 20 多岁的人认为现有产品好,67% 的 30 多岁的人认为现有产品好。总的来说,新产品明显好,但从年龄组来看现有产品在这两种情况下都更好。这是什么意思?这只是人口中的相关性如何不同于人口子组中的相关性的一个示例。什么是数据分析?数据分析是对以某种目的表达的字符、符号、数值等进行集合,然后对其进行分类、整理、成型、选择后进行解释,从而找到有价值的意义。数据分析是有目的的。因此在开始分析时,需要对得到的结果是否是预期的结果做出正确的判断。为此需要了解三件事:对要分析的问题本身的理解
分析者除非对分析的原因和所涉及的问题有正确的认识,否则是没有意义的。例如数学家或统计学家有数据,将能够从某种方法或复杂的处理计算中得出一个合理的结果。但是如果一开始不知道数据的含义和背后的情况,就无法提出分析策略。没有反复试验,将永远不可能得到有用的结果。例如如何获取数据,如何预处理数据,以及要进行什么样的分析。不要忘记公司的负责人比任何优秀的外部分析师都更了解公司的问题,应该从梳理问题入手,站在顾问的角度进行数据分析。对分析方法的理解
分析师必须熟悉分析方法,有一套自己的瞬狙分析方法,并且能使用统计软件或数据挖掘软件(例如Python、R、SPSS等等),输入任何数据后只需点击一下即可获得合理的结果。如果没有正确理解分析方法,即使正在处理明显错误的数据或使用不合适的方法分析数据,也不会注意到错误。这里请处理即使不考虑后述的异常值和异常值的处理以及问卷数据与日志数据的分析条件的差异,也可能会出现严重的错误。判断分析结果的能力
在判断分析结果之前有必要假设得到结果时会采取什么样的行动。有得到预期结果的情况,也有得到意想不到的结果的情况。但是当出现意外结果时,确定要采取的措施变得非常重要。数据采集和处理的方法可能是错误的,或者分析方法可能是错误的。如果数据和方法都没有错,说明原来的假设是错误的,可能会被迫改变结果方向。当出乎意料的结果出现时,应该灵活地思考各种可能性。主要关注2点:
1是数据分析基础能力(取数&分析工具/分析理论)
能够熟练使用数据分析相关工具使用如excel,sql,spss,BI系统等工具
能够掌握分析理论,例如结构化分析,流程化分析,漏斗分析,统计学概念
2是数据分析应用能力(指标体系/业务知识/业务判断)
能够建立完整的指标体系评估一项或多项业务
能够掌握业务知识,深入理解行业和企业运营操作
能够基于数据建立科学化的业务判断,赋能业务运营
论文是分专业的,而且专业性还非常强。非同专业人员看不懂论文的数据分析很正常,即使是同专业人员,在下列情况下也会看不懂论文的数据分析:
1.论文属于“超前”领域,也就是超出了阅读者所学过和掌握的专业知识。这时,如果你想读懂,就得请教论文作者。
2.阅读者自己“学艺不精”,没有把本专业的知识学全、领悟透彻。这时,如果你幡然醒悟,想从事本专业,想读懂论文,你就得从头开始学习本专业的相关知识。
3.论文本身错了,但这种错误是学术领域或科技领域正常的错误。这时,你就应该理性地利用自己的专业知识,指出论文错误的地方,帮助作者纠正错误。
4.论文本身错了,而且这种错误是属于恶意编造数据,搞学术欺诈,或者为科技项目骗资金、骗钱。这时,你就应该利用自己的专业知识,进行有理有据的举报,让这种恶意虚假论文不要害人,不能骗到资金或钱。
获取数据的方法,需要看你的场景是怎样。例如:互联网公司的员工需要获取自己网上的用户行为数据,可以通过现有的数据工具,如百度统计、google统计等,在网页上加上对应的统计代码即可,也可以让公司的开发人员在页面上直接埋点,从而获取数据。做课题的学生需要获取数据,可以从网上已有的资源来获取,如我们以前做数学建模时就常常去中国统计年鉴获取数据,国家的各个部门在网上一般都有自己的统计年鉴,可以获取很多数据;对于一些特殊场景下的数据,若你需要样本,则可以做一些调查问卷,到线下去派发或者到网上问卷星等工具去派发。获取数据的方式还有很多,这里就不多说了。
至于如果做好数据分析,这是一个很大的课题。首先需要知道做数据分析的目的,目标分别是什么,如果这些都没有,做出的数据都是没有意义的。另外,你需要懂得如果去处理数据,会一些数据分析的工具,excel表格的使用是最基本的。更高级一些就是学会数据库、R语言、matlab、SPSS等等的数学工具。
作为一个数据分析师来回答一下:
我做这行两年多了,刚开始的时候用的多是MySQL数据库,当然,Oracle数据库也会用到,尤其是在金融行业或者国企都用Oracle,一般的公司使用MySQL数据库,可能是因为MySQL数据库免费吧。另外,在一家互联网公司,我遇到了mongodb,目前一些新兴的互联网公司使用nosql的也比较多,这个当时是现学现卖的。作为一个数据分析师,可能对数据库的使用一般是存取数据,至于更高级别的优化、事务之类的,一般是使用不到的,有专门的数据库人员,我们只要用好数据库就好。
说道数据分析或者数据挖掘,除了数据库来存取数据,我们还需要处理数据的工具,最趁手的当然是Python了。Python结合数据库是日常的code,Python也提供了齐备的工具,针对MySQL的有pymysql库,和oracle结合有cx_Oracle库,和mongodb结合有pymongo库,另外当然少不了我们的数据分析利器pandas库了,提供了read_sql函数,支持各种数据库,直接读取成DataFrame的数据格式,十分的方便。
总结一下就是:其实遇到的大多数都是MySQL,oracle也有,这两种都是sql语句,差别不大,只要掌握sql语句,这两个数据库问题都不大,mongodb是新兴的非关系数据库,语句也不是很复杂,之间上手工作也是无压力的。结合Python中的pandas使用,让你很溜的处理数据,数据分析也就得心应手了,小case了。
运用大数据分析招标,并治理招投标乱象确实会起到重要作用,但要说成功率99%,确实有点夸张。
招投标乱象突出问题是围标、串标、借用资质、暗定中标人等现象。
而形成这些现象的原因是多方面的,涉及到投标人、采购人、采购代理机构、评审专家以及监管部门等各部门、各环节。
大数据技术的运用,只能在其所实施的范围内,或者已进行分析监控的范围内有效果。目前,大数据技术还实现不了全过程、全部门的监管,当然也不可能实现所谓的成功率真高达99%的效果。
但是对其分析监控的范围,成功率应该还是很高的。
例如,将投标人的诚信记录纳入大数据分析监管范围,可以及时准确分析投标人是否存在不诚信现象,是否曾受到处罚。
但是大数据如果没有收集该投标人在境外投标信息,显然会出现分析不全面的情况。
面对多家企业的围标、串标行为,如果投标人采取异地、不同计算机由不同人员编制招标文件等方法,显然通过分析计算机mac地址、机器码、规律性报价等方法都将无效。
在全社会大数据体系仍不完善的前提下,想仅通过大数据工具治理招投标乱象是现实的,一些场外、线下、非数字化交易目前仍然无法实现有效监管分析。
因此,受限于大数据技术应用的范围、程度以及违法者不断提高的反侦手段提高,大数据治理招投标乱象仍只是一种辅助手段。
治理防范招投标乱象的根本,还是在于从体制、机制上完善法律法规,提高违法成本,落实采购人主体责任,对助推招投标乱象的各主体均要从重处理,不能留有执法空白。
