当前位置:首页 > 足球比分 > 正文

2014大数据,那一年,数据正式成为新石油

摘要: 2014年,我还在用诺基亚刷微博,那时候4G刚商用没多久,朋友圈里晒的不是自拍就是美食,压根没人聊“数据隐私”这种话题,但如果你...

2014年,我还在用诺基亚刷微博,那时候4G刚商用没多久,朋友圈里晒的不是自拍就是美食,压根没人聊“数据隐私”这种话题,但如果你翻开那年的科技新闻,会发现一个词反复出现:大数据

那一年,大数据三个字从技术圈的小众话题,突然变成了政府报告、企业战略、街谈巷议的热词,2014年3月,“大数据”首次写入《政府工作报告》,这标志着它不再是极客的玩具,而是国家层面的基础设施,同年,马云在乌镇世界互联网大会上说了句当时被嘲笑、如今被反复引用的话:“人类正从IT时代走向DT时代。”DT,就是数据技术。

回头来看,2014年是大数据从“概念炒作”转向“实际落地”的分水岭,那一年,数据量算力算法三者恰好撞上了同一个爆发窗口。


h2: 2014年大数据有多“大”?

我们先看几个数字,2014年,全球数据总量达到4.4ZB(泽字节),什么概念?1ZB等于10亿TB,如果你把4.4ZB的数据刻成DVD,这些光盘摞起来的高度,是地球到月球距离的23倍。吓人吧?

当年有一张很流行的图,叫“互联网一分钟发生了什么”——每分钟,YouTube上传300小时视频,推特发出34.7万条推文,Instagram分享21.6万张照片,这些海量的碎片化信息,就是大数据的原材料。

但更关键的不是数据有多大,而是我们终于开始有能力处理它,2014年,Apache Hadoop已经迭代到2.x版本,Spark刚刚崭露头角,NoSQL数据库(比如MongoDB、Cassandra)开始被大公司广泛采用,存储成本从2004年的每GB几百美元,降到了2014年的每GB几分钱,算力不再是瓶颈。


h2: 那一年,大数据改变了什么?

h3: 1. 营销从“广撒网”变成“精确制导”

2014年,我在一家电商公司实习,听运营总监讲“用户画像”这个概念,他说:“以前我们在大街上发传单,现在我们在用户手机里发优惠券——而且只发给该发的人。”这就是大数据的核心应用:推荐系统。

传统营销模式 大数据营销模式
对所有用户群发广告 基于行为数据推荐商品
根据年龄段粗略划分 根据300+标签精准画像
转化率1%-3% 转化率提升至5%-15%
一周后出数据报告 实时反馈调整策略

亚马逊的“买了此商品的人也买了”,Netflix的“猜你喜欢”,都是2014年左右开始大规模优化的。推荐算法成了商业竞争的胜负手。

h3: 2. 医疗:数据救命的开始

2014年,Google Flu Trends(谷歌流感趋势)虽然因为预测偏差引发争议,但它打开了一个潘多拉魔盒:利用搜索数据预测疫情,同年,中国一些三甲医院开始试验电子病历结构化,肿瘤基因测序数据量暴增,一个晚期肺癌患者的基因数据,可能有几十GB,没有大数据技术,医生根本处理不了这些信息。

h3: 3. 交通:不再全是“老司机经验”

2014年5月,百度地图宣布用户数突破2亿,同年,高德地图被阿里巴巴全资收购,手机地图开始根据实时路况推荐路线,而不是像以前那样只靠GPS画条直线,这背后是浮动车数据(出租车、网约车的GPS轨迹)的实时分析,虽然那时候导航还会把你导到断头路上,但数据驱动的交通优化已经上路了。


h2: 2014年大数据的技术栈长什么样?

2014年,搞大数据的人最常挂在嘴边的是这几个东西:

2014大数据,那一年,数据正式成为新石油

  • Hadoop:分布式存储和计算的基础,那时候不懂HDFS(分布式文件系统)和MapReduce,你都不好意思说自己是大数据工程师。
  • Spark:比MapReduce快100倍的“新星”,2014年Spark刚火起来,在内存中处理数据,速度碾压传统方式,记得有篇文章标题是《Spark干掉Hadoop?》——虽然最后是共存。
  • Hive:把SQL翻译成MapReduce任务,让数据分析师不用写Java也能搞大数据。
  • Storm:实时流处理,2014年Twitter开源了Storm,用来处理秒级的实时数据(比如热门话题排行榜)。

我当年自学大数据,装一个Hadoop集群花了整整两天,那时候没有Docker,没有Kubernetes,配环境能配到怀疑人生。但这两年正是基础设施从混乱走向标准化的关键期


h2: 2014年大数据的“坑”与“黑暗面”

任何新技术在光鲜背后,都有不为人知的麻烦,2014年的大数据,远没有今天看起来那么完美。

h3: 数据孤岛 vs 数据打通

2014年,很多企业喊着“大数据转型”,实际上连内部数据都没打通,财务系统用的Oracle,销售系统用的Excel,客服系统用的自研软件——光是数据清洗就能逼疯一个团队。“数据质量极差”是那时候的常态,垃圾进,垃圾出。

h3: 隐私问题开始抬头

2014年,斯诺登事件余波未平,数据泄露事件开始频繁见报,那年美国Target超市因大数据分析系统被黑客入侵,7000万用户数据泄露。个人信息保护法连草案都没有,但舆论已经开始讨论“谁在用我的数据”。

现在回想,2014年我们踩过的坑,成了后来《数据安全法》《个人信息保护法》的重要实践基础


h2: 2014年大数据对今天的三大遗产

h3: 1. 数据是未来的“新能源”

这个观念在2014年被刻进骨子里,马云说“人类正从IT走向DT”,马化腾说“大数据是互联网时代的石油”,说的人多了,信的人也就多了。2014年的舆论造势,为后来AI、云计算、物联网的爆发铺好了认知地基

2014大数据,那一年,数据正式成为新石油

h3: 2. 开源生态的成型

2014年,Hadoop、Spark、Kafka、Storm等开源项目基本确定了大数据的标准化技术路线,这个生态后来催生了数据中台、实时数仓等概念,也养活了无数大数据工程师。

h3: 3. 跨界应用的想象力

2014年之前,大数据主要被互联网公司用,2014年之后,金融、医疗、制造、能源全部入局,我记得看过一个案例:养猪场用大数据分析母猪怀孕率,数据工程师开玩笑说“比算自己的工资还认真”,这种跨界想象力,就是从2014年开始蔓延的。


h2: 几张图看2014年大数据

上图是2014年网上流传很广的一张“大数据技术生态图”,虽然信息密集到让人头晕,但它直观地展示了当时大数据技术的碎片化程度——每个小方块代表一个工具,你想搞大数据,得先搞清楚几十个组件的分工。那是个工程师需要“全栈+大数据”的年代

上图:2014年某互联网公司的“大数据轮子图”,每个节点代表一个数据产品/工具,圆圈大小代表使用频率,可以看到Hadoop、Spark、Hive是绝对的核心。


最后说几句

2014年已经过去十年了,现在的小孩可能不知道什么叫“4G流量包”,就像我们忘了2014年前后,数据还是一个需要被小心翼翼对待的新鲜事物。

那一年,大数据没有解决所有问题,它带来了推荐、预测、精准营销,也带来了隐私泄露、信息茧房、算法偏见,但你不能否认:2014年,人类正式迈入了用数据思考、用数据决策、用数据创新的时代,它笨拙、混乱、充满试错,但它真实地改变了我们看世界的方式。

下次当你用手机导航避开拥堵,刷短视频被算法精准推送,或者体检报告里出现AI辅助诊断的标注时,不妨想一想——这些能力的种子,很多是在2014年埋下的。