大数据统计与分析 题库.docx

更新时间: 试题数量: 购买人数: 提供作者:

有效期: 个月

章节介绍: 共有个章节

收藏
搜索
题库预览
请说出使用python进行数据统计分析的5个优势。 (  )语法简单精练。对于初学者来说,比起java,c等编程语言,Python更容易上手,学习曲线平缓容易入门。 (  )有很强大的库。可以只使用Python这一种语言去构建以数据为中心的应用程序。 (  )功能强大。 Python是一门胶水语言,Python程序能够以多种方式轻易地与其他语言的组件“粘接”在一起。 (  )紧跟时代。 Python是编制大数据和人工智能应用程序的首选工具语言,大量的数据分析、数据挖掘和机器学习算法都已经从其他语言移植过来,或者直接在Fython中实现了其算法。 (  )大势所趋。 Python在2019年已经超越Java成为最流行的编程语言,中国很多省份已经将Python纳入初中学习内容。现在几乎所有的软件开发工具包都会提供Python接供用户调用。 四、程序设计题(  ) 样例第一题: 研究表明,有的职业会对人体血液等系统产生影响,本次收集到了职业人群的部分体检数据存放在Excel文件中,名为“physical.xls”。针对此次部分体检数据进行统计分析: (  )导入相应的模块: (  )获取数据:使用pandas库中读取的Excel文件数据的方法将“physical.xls”文件读入到DataFrame对象df中:显示数据的前5行:结果如图所示; (含图) (  )查看DF的数据类型、形状、结构信息、并统计各字段空缺值个数; (  )使用dropna方法删除全为空的列以及“身份证号”为空的数据; (  )使用聚合函数统计“淋巴细胞计数”以及“白细胞计数”的均值和标准差; (  )统计不同性别的白细胞计数均值 (含图) 样例第二题: 某公司人事工作人员为了对来聘人员信息进行分析,以聘用适合计算机岗位的人员,调用了计算机岗位来聘人员信息表(  ), 其部分数据如表所示,数据字段包括应聘人员的ID 、性别、相关经验、教育水平和工作次数等信息。 (含图) 经观察发现,数据存在缺失值等异常数据,因此需要对数据进行预处理,其主要步骤如下。 (  )读取来聘人员信息数据。 (  )将类别型数据中的缺失值填补为“未知”,将数值型缺失值填补为其对应特征的均值。 (  )将数值型异常数据替换为其对应特征的均值,将性别特征的异常值替换为“未知”。 (  )对所有的分类数据进行哑变量处理。 (含图) 样例第三题: 某加工厂采购了一批玻璃,玻璃的特性及元素成分存储于玻璃类别数据集 (  ) 中。数据集包括折射率、钠含量、镁含量、铝含量等9个输入特征和1个类别标签,类别 标签包括1、2、3、4(  ),数据集共192条数据。玻璃类别数据集的部分数据如表所示。 (含图) 为了实现根据玻璃的特征对玻璃进行类别判定,需要通过玻璃类别数据集构建分类模 型,具体步骤如下。 (  )加载玻璃类别数据集,划分训练集、测试集。 (  )对训练集、测试集进行标准差标准化,并分别输出标准化之后的训练集、测试集的方差和均值。 (  )使用支持向量机对玻璃类别数据集进行分类,输出分类模型评价报告。 (含图) 样例题第四题: 某珠宝店新增钻石回收业务,为了对客户提供的钻石更好地进行估价,该店铺收集了 行业内近期所售钻石的4C等级、尺寸和相应价格等数据,存为钻石价格数据集 (  ),包括克拉、切工等级、色泽、净度等9个特征。钻石价格数据集的特征说明如表所示。 (含图) 使用钻石价格数据集,构建回归模型预测回收的钻石价格,具体步骤如下。 (  )读取钻石价格数据集。 (  )经过观察数据发现,长度、宽度、高度特征存在0值,删除该3个特征中所有出现0值的行数据,并对其他数据进行重新索引。 (  )新增价格(  )特征,假定1美元等于6.50人民币。 (  )拆分特征数据和标签数据,特征数据为克拉、切工等级、色泽、净度、台宽比、 长度、宽度、高度,标签数据为价格(  )特征。 (  )划分训练集和测试集,并对训练集和测试集进行标准差标准化。 (  )构建 SVR 模型,并输出回归模型评价指标,查看模型效果。 (含图) (含图) (含图) 重点:实验课一道大题,上面4道题考一道大题,请认真复习,严禁作弊。