楼主: 胖胖小龟宝
35472 270

[学术动态] 大数据和统计学矛盾?   [推广有奖]

已卖:46份资源

大师

21%

还不是VIP/贵宾

-

TA的文库  其他...

龟宝的档案室

威望
3
论坛币
793115 个
通用积分
22228.9852
学术水平
2211 点
热心指数
2133 点
信用等级
1424 点
经验
987178 点
帖子
9996
精华
25
在线时间
4757 小时
注册时间
2012-7-27
最后登录
2020-12-21

楼主
胖胖小龟宝 发表于 2014-2-21 11:00:30 |AI写论文

+2 论坛币
k人 参与回答

经管之家送您一份

应届毕业生专属福利!

求职就业群
赵安豆老师微信:zhaoandou666

经管之家联合CDA

送您一个全额奖学金名额~ !

感谢您参与论坛问题回答

经管之家送您两个论坛币!

+2 论坛币
        通常,对于新的IT关键词必定会出现“反对派”。最近,“大数据”就成为被攻击的对象,诸如“大数据失败论”等论调也明显增加。
        业界对大数据抱着极大的期待,这一点从大量的大数据研讨会和展示会风潮就足以证明。这些年来,除了云计算浪潮,缺乏热烈话题的IT业界而言,大数据是期待已久的大型关键词,也许大数据会成为恢复业界活力的强心剂。
        与此同时,日本ZF提出新的IT战略--“将行政数据向民间开发,以便不断创造新商务”。也就是说,如何有效利用数据,推动商业成功,业已成为国家战略的一环。
        虽然笔者既不是强烈的赞成派也不是反对派,但通过以往的采访经验,对处理数据的难度有着清醒的认识。更何况涉及到大数据,其难度显而易见。
        笔者周边很多人对大数据也有着各种不同的看法,提出各种问题。当然这些对于IT业界的读者而言,都是理所当然的事情,笔者说这些也许是班门弄斧了。但是,正是这些众所周知的道理通常也是非常重要不可忽视的。因此,下面笔者将重新提出大数据的“陷阱”,探讨如何才能避免运用大数据的失败。


是否真正需要大量的数据
       首先,必须明确的一点是,是否真正需要大量的数据。
       在一次活动中,一位统计分析的专家在谈到大数据时说:“本来统计分析学是如何通过少量的取样,去了解事务整体的学问。例如,电视的收视率调查就是一个典型的事例,这类调查就是通过极少的样本,来掌握日本全国的收视状况。如果目的明确,并不需要大量的数据。”
       由于上述言论出自目前作为“数据科学家”备受瞩目的统计分析方面的专家之口,让笔者不禁大吃一惊。这就是说,只要有一定量的数据,无关数据数量,分析的结果并不会有很大的差别。如果果真如此,不禁让人产生怀疑,即到底大数据是为何而存在。
       听到上述观点,使人感到大数据所面临的矛盾的应当不仅仅是笔者一人。本以为通过大数据分析,满怀期待能够发现以往没有认识到的新的东西,但有时其结果不过是已有所知的事实而已。如果企业为系统开发投入数十亿日元,得出的不过是证明资深职员“经验”的结论,这也未免让人难以接受。
       正因为如此,就有必要重新考虑为何需要大数据这一问题。例如,企业需要明确通过将有交易往来的公司和社交媒体等本企业外的大量数据进行组合,是为达到何种目的等,即有必要事先制定大数据的目标。


数据的“质量”有无问题
       第二点是由谁来维护大量的数据,即数据的“质量”如何能够得到保障。
       笔者曾听说这样一件事。某企业的总经理每个月都会收到有交易往来的IT供应商的宣传(PR)杂志,但收件人的头衔不是“总经理”,而是他曾经兼任公司CIO时的头衔“常务董事”。虽然将头衔搞错,但还是都能收到,因此并没有太在意。但当这家IT供应商的总经理到公司进行礼节性拜访时,就提出了希望改一下头衔的想法。
       而这家IT供应商的新的卖点是大数据,公司的总经理当场表示回去马上会进行修改。起初以为这点事情对于运营大数据业务的IT供应商而言不过是举手之劳,一定会进行纠正。但是,等到下一个月他收到的的PR杂志时,发现收件人的头衔仍然是“常务董事”。这位总经理通过两本PR杂志感到仿佛看到了大数据的现状,因此他非常失望地说:“归根到底IT供应商并没有维护顾客数据库”。
       上述例子虽然是顾客数据,而不仅仅是顾客数据,说到大数据必然还需要处理很多各种各样的企业外部的数据。但是,这些数据是否是最新数据,其数据的精确度又如何等数据的“质量”就会非常重要。分析出处不明的数据将毫无意义。如果顾客数据不能随时进行维护,也就不会产生任何价值。不应当将当初以为是宝山的大数据,变成一座堆满垃圾的山。


是否忽视了现场职工的工作干劲
       第三点就是企业不仅应当努力培养数据科学家,同时也需要提升现场职员的分析数据的能力。如果在店头等现场直接接触顾客的员工变得“擅长数字”,他们也能够常常通过数据考虑事情并进行判断,这样的企业必定会强大起来。
       例如,有一家超市的店头销售员就从与顾客的对话中得到启发,通过购进新的商品或是改变商品陈列的方法,提升了销售额。又比如,在特快列车上负责销售的员工,发现似乎“可吸烟座位的咖啡畅销”,当他整理出不同列车的销售业绩,结果发现确实是如此。于是决定在吸烟车厢集中推销咖啡,结果咖啡的销售量明显增加。
       当然,通过现场增加的销售额,也许和利用大数据获得的销售数字相比很小,而且其分析能力也远远不及数据科学家。但是即便如此,如果通过将这种方式横向拓展到其他现场,积累的数字也会非常可观。同时,最为重要的是,这种方式能够提升现场员工的工作动力。
       实际上,某零售企业自从将其销售分析统一由总公司实施后,店头员工就失去干劲,甚至出现退职的员工。这说明只依靠上级的指令,则会降低现场的职业道德。因此,这家公司决定给予现场员工自由分析判断的职能,由此店头又重新恢复了活力。虽然大数据非常重要,但是如果将权限集中在某些部门,则会导致现场丧失工作干劲。
      
       以上三点实际上不仅仅对大数据而言非常重要,而且同时适用于整个信息系统。大数据是IT业界期待已久的关键词,为使其成长壮大,就需要脚踏实地的努力,而不应被其华丽的部分所束缚摆弄。正因为如此,笔者认为提出的上述三点需要重新铭记心中。
                                                                                                                                                        (日)ITpro   大山 繁树

        楼主是看了这文觉得有意义特地转给大家的。的确,统计学也许刚刚建立这么学科的目的就是从小样本去推断总体,当然,我始终忘不了老师的那句话(样本越多,你的推断相对越准确)。不知坛子里的同学有没有做过问卷调查,每次的问卷调查总是信心满满的设计,满心热情的投发,近乎绝望的收取和录入数据。所以楼主感觉无论是做论文还是工作上做分析,数据利用的前提条件无疑是数据是真实准确有效的。在这个大数据流行的当下,我仿佛看到了统计学的一个新的希望。我不敢说大量的数据能提高多大的统计意义,但相互验证也许是大数据给我们的最好途径。
       不知道大家对此是如何看法,欢迎一起讨论。






二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

关键词:大数据 统计学 数据科学家 大数据分析 数据科学 反对派 日本ZF 云计算 关键词 统计学

回帖推荐

Aljan 发表于152楼  查看完整内容

大数据时代里面有个论点:样本=总体,就是说在互联网时代,由于数据产生的便捷性和成本低,应该以考虑总体的大样本,而不是传统统计的小样本(因为样本是在总体不容易获得的情况下)。但我觉得统计学是方法,大数据是思维范式。

月メ嘚尐鱈ゝ 发表于128楼  查看完整内容

1.是否需要大量数据?当然需要,只有数据越多,才能整体进行分析,找出最能代表它特点的少量典型数据,现在技术这么多,爬到很多数据,然后进行有针对性的分析等等。 2.数据的质量?还是得从分析角度,可以从数据分析数据挖掘角度来解决吧? 3.是否忽视了现场职工的工作干劲?确实职场中职工的钻研精神少于在校学生,主要还是整个体制的问题吧,一时半会不可能改变中国企业职场的工作氛围

liaodandan 发表于82楼  查看完整内容

大数据,依目前来看,是一种更有效利用数据的说法,以前我们局限于抽样分析,也是条件所限。大数据应是技术的进步,也是思维的进步。我觉得大数据与统计学应该是分不开,所谓的大数据也必须辅之以统计分析才能得出相应的结论。只能说,大数据改变了很多意想不到的数据处理方式,也得到很多意想不到的结论。数据如果是客观的,配合数据行动当然是好的结果,也可能会是不那么好的结果吧。

zdx1022 发表于68楼  查看完整内容

楼主贴的文章很让我受启发,,,但是可能存在一个这样的问题,,,就是范围的界定,,,所谓的大数据具体是指什么范围的大数据呢?很明显,我的直观感觉,其很可能是那些很难收集到数据的大数据,譬如消费者的消费行为习惯,这些若是通过调查问卷,其质量可想而知,若是能够有电商的平台来收集,并进行大数据分析,可想而知,其效率相对于火车上可吸烟座位卖咖啡的效率更高。。还是看问题的范围界定。。不知道楼主怎么看呢?

花小草 发表于45楼  查看完整内容

不论是传统的统计分析也好,还是现在热炒的大数据也好,都是为实现某些确切的目标服务的。只不过对于前者,分析人员先有一个明确目标(例如,统计学教材里面的经典案例——收入与销量的关系),然后再去收集收据,这样收集的数据就必然在某些属性上具有局限性(收目标约束);而对于后者,人们是已经拥有了海量数据,然后产生想有效利用这些数据的想法,在一个相对模糊的目标下,通过“数据挖掘”的方式,获得一些结论(例如,尿布 ...

飞飞小雨 发表于39楼  查看完整内容

首先大数据的产生随随着互联网和各种数据记录设备的普及而造成的,将随时随地得记录人们的各种行为。毫无疑问,这些数据肯定是有用的,不管从抽样还是从整体的角度,它都为一些研究提供了很好地基础。然而,并不是所有的问题都需要依赖大数据去解决。像互联网、金融等行业,大数据的确是带来了新的机遇,即便是零售业这样的传统企业也很大程度上收到了影响。所以,我觉着统计与大数据并没有什么矛盾,只是适用范围不同罢了

alanjanie 发表于26楼  查看完整内容

大数据的大不仅仅是说数据的量很大,同时也是数据的类型要大。很多时候分析问题,受限于数据类型,再怎么在“量”上变大,可能得出的结论跟运用统计得出的结论差不多。而有时候把一些此前被忽略的数据添加进来,进行综合分析,可能会得到更全面更有效的结果

jinnwell 发表于21楼  查看完整内容

我个人觉得统计学研究和大数据研究,类似于农作物杂交技术和转基因技术之间的关系:目标相同,方法不同而已,而且各有各的优势和劣势。转基因技术作为新兴技术,其效果是显而易见的,但是同时所蕴含的风险也是巨大的,这也是为什么有很多人反对转基因。同样,对大数据研究来说,就像楼主转的帖子的帖主认为的那样,也有很多说不清道不明的缺陷。从宏观上来讲,这些新兴技术未来究竟对现代人类有正面还是负面的影响,只能由后人来评 ...

渔夫 发表于12楼  查看完整内容

这个观点简单地把大数据理解为大的数据,我认为这是不准确的。 大数据除了大,还有其他两个方面含义。 1. 大, 多大叫大数据呢? 至少需要一个标准,数据量超过计算机内存。也就是说,即使你执行抽样技术选取样本分析,你也需要技术来克服这个问题。 2.复杂,传统的数据库,sql,将数据格式好后存到数据库里,分析人员再调出来。而如今数据分布在不同数据库,比如亚马逊的销售记录,google 的搜索记录,医院的门诊数据,这些数 ...
已有 2 人评分经验 学术水平 热心指数 信用等级 收起 理由
lyngqng + 40 精彩帖子
weisong11 + 1 + 1 + 1 有启发

总评分: 经验 + 40  学术水平 + 1  热心指数 + 1  信用等级 + 1   查看全部评分

沙发
西门高 发表于 2014-2-21 11:42:13
看看

藤椅
清汀 发表于 2014-2-21 15:06:03

回帖奖励 +2

3ks                                       

板凳
sqy 发表于 2014-2-21 16:35:44
跟10年前热炒的数据挖掘概念一样,大数据有一定的价值,但也取代不了统计学!

报纸
rayzhangfy 发表于 2014-2-21 21:15:03
非常感谢
勤靡余劳,心有常闲

地板
平军 在职认证  学生认证  发表于 2014-2-21 23:16:42 来自手机
数据越多,奇怪的行为方式才生的结果被容纳的可能性越大,分析的难度越大,具有意义的结论越不容易得到。我自己的看法

7
hwy12345hit 发表于 2014-2-22 13:13:01
欢迎大家讨论,受益匪浅

8
yger 在职认证  发表于 2014-2-22 20:22:50
不错!

9
cherubiclee 发表于 2014-2-22 20:44:17
得出结论的成本不一样,取得样本越多成本越高

10
pmw12 发表于 2014-2-24 09:30:08
不错

您需要登录后才可以回帖 登录 | 我要注册

本版微信群
jg-xs1
拉您进交流群
GMT+8, 2025-12-25 20:42