【HENU-VU】NIT2202 大数据 Big data 期末复习总结
完整版有chang 私 Q 1942590243
Chapter 1 Understanding Big Data
数据集(datasets):相关联的数据(related data)的集合,共享同样的属性和偏好(attributes and properties)
数据解析(data analysis):检验数据的过程,目的是找到数据的事实、关系、模式(patterns)、视角(insights)、趋势(trend)。总目的是为了支持更好地决策(decision-making)。数据解析倾向于传统的人工分析
数据分析(data analytics):比数据解析更广,数据分析是一个准则,包含了整个数据生命周期的管理,包括收集、清晰、组织、储存、分析和管理数据。数据分析更偏向使用技术和自动化工具进行。
数据分析三个因素:面向商业的环境(business-oriented)、科学领域、基于服务的环境(service-based)

数据分析作用:能够科学地进行数据驱动的决策(data-driven decision-making),不仅仅是基于过往的经验和直觉。
右图展现了四种分析的价值和复杂度的关系。接下来分别对这四种分析进行介绍。
描述性分析(descriptive,发生了什么?):回答已经发生的事情。通过文本化数据来生成信息。
例子:过去12月的销售额总共有多少?
诊断性分析(diagnostic,为什么发生?):目的是确定过去发生的事情的原因,确定这个现象相关的信息。诊断分析比描述性分析更有价值,但需要更高级的技能。诊断分析通常需要从多个来源收集数据,并将其存储在一个适合执行深入和汇总分析(drill-down and roll-up)的结构中。
例子:为什么第二季度的销售额比第一季度销售额低?
预测性分析(predictive,未来会怎么发生?):确定未来可能发生的事件的结果,用来基于过去的事务生成未来的预测。预测性分析需要大量的数据集和不同的分析技术。
例子:如果一个顾客买了A和B,他有多大概率也会买C?
规定性分析(prescriptive,怎么做最好?):不仅在于哪种规定的选择是最好的,还在于为什么是最好的。规定性分析提供了可以推理的结果。规定性分析涉及使用业务规则和大量内部和外部数据来模拟结果并规定最佳行动方案。
例子:什么时候买这只股票最合适?
商业智能(Business Intelligence,BI):用来洞察企业的绩效
关键绩效指标(Key Performance Indicators,KPI):用于衡量特定业务环境中的成功
大数据的特性——5V

容量(volume):预期数据量是巨大的,并且还在不断增长。高数据量带来了独特的数据存储和处理需求
速度(velocity):数据可以快速到达
种类(Variety):多元结构和格式
真实(veracity):数据的质量或保真度
数据可以是数据集的信号或噪声的一部分。噪声是无法转换为信息的数据,没有价值。
价值(Value):定义数据的可用性,和veracity密切相关
多样的数据类型
结构化数据(structured):通常以表格形式存储,最经常存储在关联数据库(relational database),通常由enterprise resource planning(ERP)、customer relationship management(CRM)系统生成。
非结构化数据(unstructured):占所有数据的80%,增长速度大于结构化数据,这种数据是从自有的(self-contained)和不相关的(non-relational)文件中发出。可以用Binary Large Object(BLOB)存储。
半结构化数据(semi-structured):具有定义的结构和一致性级别(consistency),但不是关系型的。半结构化数据是分层的(hierarchical)或基于图(graph-based)的。存储在包含文本的文件中。比如:xml、json
元数据(metadata):提供一个数据集的特性和结构,一般都是激起自动生成并加入到数据中的,这跟踪对于大数据的处理、存储和分析至关重要,因为它在处理过程中提供了有关数据谱系及其来源的信息。
魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。
更多推荐


所有评论(0)