单选题 设有员工实体Employee(employeeID,name,sex,age,tel,departID),其中employeeID为员工号,name为员工姓名,sex为员工性别,age为员工年龄,tel为员工电话,记录该员工的手机号码、办公室电话等,departID为员工所在部门号,参照另一部门实体Department的主码departID。
Employee实体中存在派生属性______。Employee实体中还存在多值属性______。对属性departID的约束是______。
单选题
  • A.name,原因是会存在同名员工
  • B.age,原因是用属性birth替换age可计算age
  • C.tel,原因是员工有多个电话
  • D.departID,原因是实体Department已有departID
【正确答案】 B
【答案解析】
单选题
  • A.name,可以用employeeID区别
  • B.sex,可以不做任何处理
  • C.tel,可以将tel加上employeeID独立为一个实体
  • D.tel,可以强制只记录一个电话号码
【正确答案】 C
【答案解析】
单选题
  • A.Primary Key,NOT NULL
  • B.Primary Key
  • C.Foreign Key
  • D.Candidate Key
【正确答案】 C
【答案解析】[解析] 所谓派生属性,是表示其值可以从一个相关属性和属性集的值派生得到的属性,这个属性在实体中不是必须的。根据这个定义,age是一个派生属性,因为用属性birth(出生时间)替换age并可计算age。 多值属性是指可同时由多个值表示的属性。例如,包含关于雇员信息的数据库可能包含关于他们个人兴趣的数据。一个雇员可能有几个兴趣:运动、电影、投资、烹调,并且由于这些值的任何一个或所有这些值可能同时是雇员的兴趣,所以这些数据应作为数据类型列表合成到资源。对于多值属性的处理,一般是提升为单独的一个或多个实体。 因为departID为员工所在部门号,参照另一部门实体Department的主码departID,因此,在实体Employee中,departID为外键。
单选题 设关系模式R<U,F>,其中U={A,B,C,D,E},F={A→BC,C→D,BC→E,E→A},则分解ρ={R1(ABCE),R2(CD)}满足______。
  • A.具有无损连接性、保持函数依赖
  • B.不具有无损连接性、保持函数依赖
  • C.具有无损连接性、不保持函数依赖
  • D.不具有无损连接性、不保持函数依赖
【正确答案】 A
【答案解析】[解析] 我们首先看分解是否保持函数依赖。在F中有4个函数依赖。A→BC、BC→E和E→A在R1中得到了保持,C→D在R2中得到了保持,因此分解是保持函数依赖的。 接下来需要分析无损连接分解,在此之前先来学习一个判定定理: 设ρ={R1,R2}是R的一个分解,F是R上的FD集,那么分解ρ相对于F是无损分解的充分必要条件是(R1∩R2)→(R1-R2)或(R1∩R2)→(R2-R1)。 根据该定理判断是否无损连接就非常简单了。在本题中,R1∩R2={C},R1-R2=ABE,R2-R1=D,因为在F中有C→D成立,因此,分解是无损连接。
单选题 在关于数据挖掘的描述中,正确的是______。
  • A.数据挖掘可以支持人们进行决策
  • B.数据挖掘可以对任何数据进行
  • C.数据挖掘与机器学习是同一的
  • D.数据来源质量对数据挖掘结果的影响不大
【正确答案】 A
【答案解析】[解析] 数据挖掘就是应用一系列技术从大型数据库或数据仓库中提取人们感兴趣的信息和知识,这些知识或信息是隐含的,事先未知而潜在有用的,提取的知识表示为概念、规则、规律、模式等形式。也可以说,数据挖掘是一类深层次的数据分析。常见和应用最广泛的数据挖掘方法有: (1)决策树。决策树方法是利用信息论中的互信息(信息增益)寻找数据库中具有最大信息量的属性字段,建立决策树的一个节点,再根据该属性字段的不同取值建设树的分支;在每个分支子集中重复建立树的下层节点和分支的过程。国际上最早的、也是最有影响的决策树方法是Ouiulan研究的ID3方法。 (2)神经网络。神经网络方法是模拟人脑神经元结构,完成类似统计学中的判别、回归、聚类等功能,是一种非线性的模型。主要有3种神经网络模型:前馈式网络、反馈式网络和自组织网络。人工神经网络最大的长处是可以自动地从数据中学习,形成知识,这些知识有些是我们过去未曾发现的,因此具有较强的创新性。神经网络的知识体现在网络连接的权值上,神经网络的学习主要表现在神经网络权值的逐步计算上。 (3)遗传算法。遗传算法是模拟生物进化过程的算法,它由三个基本过程组成:繁殖(选择)、交叉(重组)、变异(突变)。采用遗传算法可以产生优良的后代,经过若干代的遗传,将得到满足要求的后代,即问题得解。 (4)关联规则挖掘算法。关联规则是描述数据之间存在关系的规则,形式为“A1A2...An≥B1B2...Bn”。一般分为两个步骤:求出大数据项集。用大数据项集产生关联规则。 不论采用哪种技术完成数据挖掘,从功能上都可以将数据挖掘的分析方法划分为4种,即关联分析(Associations)、序列模式分析(Sequential Patterns)、分类分析(Classifiers)和聚类分析(Clustering)。 (1)关联分析。关联分析的目的是挖掘出隐藏在数据间的相互关系。设R={A1,A2,…,AP}为{0,1}域上的属性集,r为R上的一个关系,关于r的关联规则表示为X→B,其中X∈R,B∈R,且X∩B=[*]。关联规则的矩阵形式为:矩阵r中,如果在行X的每一列为1,则行B中各列趋向于为1。在进行关联分析的同时还需要计算两个参数,最小置信度(Confidence)和最小支持度(Support)。前者用以过滤掉可能性过小的规则,后者则用来表示这种规则发生的概率,即可信度。 (2)序列模式分析。序列模式分析的目的也是挖掘出数据之间的联系,但它的侧重点在于分析数据间的前后关系(因果关系)。例如,将序列模式分析运用于商业,商家可以根据分析结果发现客户潜在的购物模式,发现顾客在购买一种商品的同时经常购买另一种商品的可能性。在进行序列模式分析时也应计算置信度和支持度。 (3)分类分析。分类分析时首先为每一个记录赋予一个标记(一组具有不同特征的类别),即按标记分类记录,然后检查这些标定的记录,描述出这些记录的特征。这些描述可能是显式的,如一组规则定义;也可能是隐式的,如一个数学模型或公式。 (4)聚类分析。聚类分析法是分类分析法的逆过程,它的输入集是一组未标定的记录,即输入的记录没有作任何处理。目的是根据一定的规则,合理地划分记录集合,并用显式或隐式的方法描述不同的类别。在实际应用的数据挖掘系统中,上述4种分析方法有着不同的适用范围,因此经常被综合运用。