单选题 在使用 Jieba 分词时,以下哪种模式会将句子中所有可能成词的词语都扫描出来?( )
A、精确模式
B、全模式
C、搜索引擎模式
D、以上都不是
单选题 以下关于结构化数据处理的描述,错误的是( )
A、统计分析有助于选择合适的机器学习模型
B、处理重复值可以避免在分析过程中引入冗余信息
C、异常值处理对模型性能提升没有影响
D、数据清理和预处理能提高数据的可信度和可用性
单选题 以下关于词干提取和词形还原的说法,正确的是( )
A、词干提取和词形还原的结果一定是合法的单词
B、词干提取比词形还原更保守
C、词形还原会考虑词的上下文,而词干提取不会
D、两者都不会改变词的原始形式
单选题 以下哪种不是结构化数据处理中特征工程的操作?( )
A、特征选择
B、数据清理
C、数据转换
D、编码
单选题 在数据处理中,使用独热编码的主要作用不包括以下哪项?( )
A、处理分类变量
B、防止模型误解分类变量的数值大小关系
C、提高数据的准确性
D、保留不同类别信息
单选题 在处理缺失值时,如果数据在各个列中近似正态分布,以下哪种填补方法比较合理?( )
A、固定值填补法
B、众数填补法
C、平均值填补法
D、中值填补法
单选题 在文本数据向量化中,TF - IDF 模型的主要作用是( )
A、不考虑单词顺序,只统计词表中单词在句子中的出现次数
B、考虑单词之间的顺序,将句子转化为向量表示
C、解决词袋模型无法反应句子关键词的问题,根据词频和逆文本频率计算每个词的重要性
D、将词转换为其字典形式
单选题 以下哪个不是文本数据处理中常用的工具包?( )
A、NLTK
B、OpenCV
C、Jieba
D、Gensim