数据

数据

目录导航

计算机科学中的解释

基本介绍

数据数据(3)  数据:在计算机系统中,各种字母、数字符号的组合、语音、图形、图像等统称为数据,数据经过加工后就成为信息。

  在计算机科学中,数据是指所有能输入到计算机并被计算机程序处理的符号的介质的总称,是用于输入电子计算机进行处理,具有一定意义的数字、字母、符号和模拟量等的通称。是组成地理信息系统的最基本要素,种类很多。

按性质分为

  ①定位的,如各种坐标数据;②定性的,如表示事物属性的数据(居民地、河流、道路等);③定量的,反映事物数量特征的数据,如长度、面积、体积等几何量或重量、速度等物理量;④定时的,反映事物时间特性的数据,如年、月、日、时、分、秒等。

按表现形式分为

  ①数字数据,如各种统计或量测数据;②模拟数据,由连续函数组成,是指在某个区间连续变化的物理量,又可以分为图形数据(如点、线、面)、符号数据、文字数据和图像数据等,如声音的大小和温度的变化等。

按记录方式分为

  地图、表格、影像、磁带、纸带。按数字化方式分为矢量数据、格网数据等。在地理信息系统中,数据的选择、类型、数量、采集方法、详细程度、可信度等,取决于系统应用目标、功能、结构和数据处理、管理与分析的要求。

数据仓库

  目前,数据仓库一词尚没有一个统一的定义,著名的数据仓库专家w.h.inmon在其著作《building the data warehouse》一书中给予如下描述:数据仓库(data warehouse)是一个面向主题的(subject oriented)、集成的(integrate)、相对稳定的(non-volatile)、反映历史变化(time variant)的数据集合,用于支持管理决策。对于数据仓库的概念我们可以从两个层次予以理解,首先,数据仓库用于支持决策,面向分析型数据处理,它不同于企业现有的操作型数据库;其次,数据仓库是对多个异构的数据源有效集成,集成后按照主题进行了重组,并包含历史数据,而且存放在数据仓库中的数据一般不再修改。

数据仓库的特点

  数据数据根据数据仓库概念的含义,数据仓库拥有以下四个特点:

  1、面向主题。操作型数据库的数据组织面向事务处理任务,各个业务系统之间各自分离,而数据仓库中的数据是按照一定的主题域进行组织。主题是一个抽象的概念,是指用户使用数据仓库进行决策时所关心的重点方面,一个主题通常与多个操作型信息系统相关。

  2、集成的。面向事务处理的操作型数据库通常与某些特定的应用相关,数据库之间相互独立,并且往往是异构的。而数据仓库中的数据是在对原有分散的数据库数据抽取、清理的基础上经过系统加工、汇总和整理得到的,必须消除源数据中的不一致性,以保证数据仓库内的信息是关于整个企业的一致的全局信息。

  3、相对稳定的。操作型数据库中的数据通常实时更新,数据根据需要及时发生变化。数据仓库的数据主要供企业决策分析之用,所涉及的数据操作主要是数据查询,一旦某个数据进入数据仓库以后,一般情况下将被长期保留,也就是数据仓库中一般有大量的查询操作,但修改和删除操作很少,通常只需要定期的加载、刷新。

  4、反映历史变化。操作型数据库主要关心当前某一个时间段内的数据,而数据仓库中的数据通常包含历史信息,系统记录了企业从过去某一时点(如开始应用数据仓库的时点)到目前的各个阶段的信息,通过这些信息,可以对企业的发展历程和未来趋势做出定量分析和预测。

  企业数据仓库的建设,是以现有企业业务系统和大量业务数据的积累为基础。数据仓库不是静态的概念,只有把信息及时交给需要这些信息的使用者,供他们做出改善其业务经营的决策,信息才能发挥作用,信息才有意义。而把信息加以整理归纳和重组,并及时提供给相应的管理决策人员,是数据仓库的根本任务。因此,从产业界的角度看,数据仓库建设是一个工程,是一个过程。

  数据库是依照某种数据模型组织起来并存放二级存储器中的数据集合。这种数据集合具有如下特点:尽可能不重复,以最优方式为某个特定组织的多种应用服务,其数据结构独立于使用它的应用程序,对数据的增、删、改和检索由统一软件进行管理和控制。从发展的历史看,数据库是数据管理的高级阶段,它是由文件管理系统发展起来的。

数据仓库的层次

  数据库的基本结构分三个层次,反映了观察数据库的三种不同角度。

  (1)物理数据层。它是数据库的最内层,是物理存贮设备上实际存储的数据的集合。这些数据是原始数据,是用户加工的对象,由内部模式描述的指令操作处理的位串、字符和字组成。

  (2)概念数据层。它是数据库的中间一层,是数据库的整体逻辑表示。指出了每个数据的逻辑定义及数据间的逻辑联系,是存贮记录的集合。它所涉及的是数据库所有对象的逻辑关系,而不是它们的物理情况,是数据库管理员概念下的数据库。

  (3)逻辑数据层。它是用户所看到和使用的数据库,表示了一个或一些特定用户使用的数据集合,即逻辑记录的集合。

数据库的特点

  数据库不同层次之间的联系是通过映射进行转换的。数据库具有以下主要特点:

  (1)实现数据共享。数据共享包含所有用户可同时存取数据库中的数据,也包括用户可以用各种方式通过接口使用数据库,并提供数据共享。

  (2)减少数据的冗余度。同文件系统相比,由于数据库实现了数据共享,从而避免了用户各自建立应用文件。减少了大量重复数据,减少了数据冗余,维护了数据的一致性。

  (3)数据的独立性。数据的独立性包括数据库中数据库的逻辑结构和应用程序相互独立,也包括数据物理结构的变化不影响数据的逻辑结构。

  (4)数据实现集中控制。文件管理方式中,数据处于一种分散的状态,不同的用户或同一用户在不同处理中其文件之间毫无关系。利用数据库可对数据进行集中控制和管理,并通过数据模型表示各种数据的组织以及数据间的联系。

  (5)数据一致性和可维护性,以确保数据的安全性和可靠性。主要包括:①安全性控制:以防止数据丢失、错误更新和越权使用;②完整性控制:保证数据的正确性、有效性和相容性;③并发控制:使在同一时间周期内,允许对数据实现多路存取,又能防止用户之间的不正常交互作用;④故障的发现和恢复:由数据库管理系统提供一套方法,可及时发现故障和修复故障,从而防止数据被破坏。

数据的记录连接与价值转化

吃饭、睡觉、旅行、走路、购物,所有纯物理性的行为都成为可被记录数据的组成部分,这些看似与我们的生活、工作、赚钱等无关的行为,正成为新时期的价值瑰宝,谷歌、亚马逊、Facebook、百度、阿里巴巴等均陷在其中而不能自拔。

近期,腾讯、搜房、浪潮集团、易观等纷纷与统计局签署了大数据战略合作框架协议,再加上去年签署的11家公司,越来越多的互联网公司、传统企业数据正被纳入新构建的大数据“基地”当中。

不少人对大数据的概念有很大误解,甚至有不少公司搭上“大数据”的概念来玩资本运作。大数据并不仅仅是“大”,但它首先得“Bigger”,拥有足够量级的数据才能被称作大数据,所以你看到仅仅分析几百人的数据就说自己是大数据的公司基本上都是骗子。我不认为当前有多少公司量级的数据能够是“Bigger”的。对于用户级市场,至少该产品的用户量达到亿级,达到该产业用户量的前几名;对于企业级市场,也至少得拥有足够量级的企业用户,才算得上拥有大数据的基础,再加上用户使用各个产品的习惯大不相同,所以当前的大数据绝对是缺憾的,抽样数据并不准确不是么?多谈无益,故本文纯从数据来分析。

数据的记录

数字产品的出现(作者微信公众号:郭静的互联网圈),迅速让用户的个人信息能够被记录,电脑、智能手机、可穿戴设备、智能硬件、未来的智能电视等正成为数据记录的新工具,其中较为热门的是围绕医疗需求来建立相关的数据记录,睡眠、血压、体重等产品较多,虽然这些产品的用户量并不“多”,但是硬件厂商们依然乐此不彼的做着这一切。

要想让数据能够真正的发挥作用,首先这些数据肯定得被记录,必须有了记录才会有相关的模型分析,否则都是纸上谈兵。比如用户的睡眠时间、用户的出行时间、用户每天所摄入食物的卡路里、用户吃饭的消费金额等等,所有出现的物理性数据,只有被记录了这些数据才会有价值,没有记录,这些都是“废物”,没人会重视这些物理性动作的价值。

数据如何才能被记录?首先得有工具,拿医疗为例,我们在医院看病,医生会使用相关仪器记录用户的心跳周期;我们去餐厅吃饭,餐厅会记录每桌顾客的消费记录以及用户最爱点的菜品;我们在网上使用搜索引擎,搜索引擎会记录用户的搜索习惯。医疗器械、ERP系统、电脑等成为了数据记录的工具。

数据被记录是用户被动选择的结果,如果用户不去医院检查,那么数据就不会被记录,用户去了B餐厅而不是A餐厅消费,A餐厅也无法获取到用户的喜爱。所以,可穿戴设备、智能硬件等都试图让用户能够主动将自身的数据被记录,应该说这也是UGC模式的一种,用户自愿将自身的数据提供到平台上去,供平台进行分析。

被动和主动的区别是非常大的,被动就意味着有用户的数据会流失掉,当流失掉的这部分用户足够多以后,新的数据模型就无法完成。记录是数据的基础,接下来就是连接。

连接

用户不可能一直在某个餐厅消费,也不可能一直在某一个地方睡眠,至于可穿戴设备,用户也很难做到每天都按时去佩戴,让自身的数据可以记录。单个用户某一行为被不同商家记录,而这些商家记录的数据是分离的、独立的,无法形成连贯性,当这些被记录的数据到了一定时间滞后,肯定是面临被丢弃的命运。让数据能够同平台的相互连接,要比单个“独霸”有用的多。

另一方面,就是数据和用户的连接,如何让用户的数据能够被主动贡献出来,并通过互联网、移动互联网相互连接,形成数字存储而不是纸质记录,这是当前围绕数据进行创业者的思考。

跨界连接是最困难的,就像拼图一样,如何通过混乱的形体组合,形成有效的画面。比如餐饮和超市购物、搜索和社交、电商和社交等,这些数据得形成有效的连接。单一的从搜索行为就分析出用户的购物行为或者其他行为是有失偏颇的,搜索的需求太单一,并不能是用户整个的行为特征。只有综合用户搜索、购物、社交等多个使用行为,才能有效的分析出用户的某个行为特征。

有效的价值转化

从记录→连接→价值转化,这肯定是一个漫长的过程,要知道先祖们用了数千年的时间也仅将少量的数据形成转化并遗传下来。互联网、移动互联网在国内的发展还不足20年,而数据从被重视到被记录到被连接,就更是一个漫长的过程,目前市场上的智能手环、智能手表、无线路由器、盒子等产品虽然都不尽人意,但是其无一不在让数据变的有效的道路上奋斗着。

将用户的搜索数据记录并有效价值转化,最早的案例是谷歌当年预测流感病毒,当然,已有不少互联网公司都有将用户数据记录、连接并实现有效的价值转化。互联网公司离数字存储最近,占据着有利条件,能够更敏锐也是正常。

不过,仅仅有互联网的数据是不完全的,用户在线下的数据,用户在生活中的数据,在更多不使用互联网情况时使用的数据,我把它称之为物理数据,这部分数据是现实生活当中的数据,其价值要高于互联网络上的数据的,互联网公司们正在吸收着这些数据。

数据的有效转化,可以体现在几个方面,一是预防,针对企业级的。应该说每个行业都有泡沫的存在,就算没有泡沫,也会有倒闭的风险,通过对相关数据的分析,可以对未知的风险起到一定的预防措施,即使不能避免,至少能更大程度上的减少损失,并能够助力公司挺过这场风暴。

一是隐性价值,针对用户级的。比如时间成本,通过地图工具和当地公交系统对接,让用户实时了解公交车的到站时间,节约用户等待公交车的时间,海量用户的时间成本加起来,肯定是一笔不菲的价值。再比如健康预防,越来越多的慢性病开始向用户渗透,通过对相关数据记录、连接,让用户能够尽早预防慢性病的发生,比如肥胖的问题(健康产品的前提是有高质量的医疗体系在背后支撑)。

让所有可能有价值的数据都被记录、连接,再将这些数据分析之后,实现有效的价值转化,互联网公司、传统企业、统计机构、用户,所有人都是这场风暴的参与者。我们应该给予正在为这场大风暴做贡献的企业和创业团队,可能有人被“掉队”,也有人可能在这场风暴中崛起。[1]

相关百科
返回顶部
产品求购 求购