单选题

在大模型迁移精度调试过程中,超参数起到了重要的作用。以下关于超参数调优描述正确的是哪一项?

A、

优化器优先选择SGD优化器,可以减少计算量,降低训练对内存、通信等的压力

B、

前期使用较大学习率使模型快速收敛,例如le-3,随着训练送代次数增加,学习率呈线性下降

C、

为了保证平稳训练,batchsize应保证不变,避免数据波动对模型性能产生影响

D、

正确初始化权重可以帮助模型更快地收敛并提高性能。例如,通常使用小的高斯噪声或者使用T-fixup初始化

下载APP答题
由4l***y0提供 分享 举报 纠错

相关试题

单选题 在神经网络中引入非线性因素的是以下哪个选项?

A、

权重参数

B、

激活函数

C、

损失函数

D、

模型输入

单选题 关于Mindspeed描述错误的是以下哪一个选项?

A、

Mindspeed新增昇腾亲和的代码分支,根据异腾硬件架构开发新的亲和算子,替换掉代码中昇腾不亲和算子

B、

Mindspeed将部分小算子融合成大算子,其主要目的是减少算子的数量

C、

Mindspeed对计算通信并行进行了优化,在调度执行时将计算和通信划分为更细的力度,可以节省执行时间

D、

Mindspeed的选择性重计算策略是在前向传播过程中不保存部分计算结果,而在反向传瑞过程中重新计算,以牺性性能的方式装得更多的内存优化

单选题 以下关于多头注意力机制(MHA)及其优化描述正确的是哪个选项?

A、

Grouped-Query Attention:将MHA中的Query分成G个组,每组共享一个公共的QueryMulti-Query

B、

Attention:所有头之间共享同一份Query矩阵,每个头只单独保留了一份Kev和Value

C、

当Grouped-Query Attention中G=1时等价于Multi-Query Attention

D、

在计算速度上Grouped-Query Attention优于Multi-Query Attention

单选题 华为盘古大模型3.0是面向行业的大模型,以下哪一项不是华为定义的L0基础大模型?

A、

古视觉大模型

B、

盘古汽车大模型

C、

盘古预测大模型

D、

盘古科学计算大模型

单选题 MindFormers大模型套件有Parallel组件,支持并行时从多个维度进行存储优化,以下哪个选项是错误的是?

A、

网络复用

B、

内存复用

C、

重计算

D、

异构计算

单选题 在非长文本情况下,LLM推理的时候对硬件的哪项指标要求最高?

A、

峰值算力

B、

内存容量

C、

内存带宽

D、

节点互联带宽

单选题 stable Diffusion是深度学习文本到图像生成模型(基于扩散模型),以下哪个描述是错误的?

A、

Stable Difusion核心功能为仅根据文本提示作为输入来生成的图像(text2img)不支持对图像根据文字描述进行修改(即输入为文本+图像)

B、

Stable Diffusion是一个由多个组件和模型组成的系统,而非单一的模型

C、

图像解码器根据从图像信息创建器中获取的信息画出一幅画,整个过程只运行一次即可生成最终的像素图如

D、

Stable Diffusion通过去噪进行图像生成

单选题 [添加客服薇信:sun8335118享受华为认证HCIA/IP/IE和售前HCSA/SP/SE折扣价考试券,只限薇信交单选题1/255、流懂的来!

A、

[添加客服薇信:sun8335118】享受华为认证HCIA/IP/IE和售前HCSA/SP/SE折扣价考试券,只限薇信交流懂的来

B、

[添加客服薇信:sun8335118】享受华为认证HCIA/IP/IE和售前HCSA/SP/SE折扣价考试券,只限薇信交流懂的来

C、

[添加客服薇信:sun8335118】享受华为认证HCIA/IP/IE和售前HCSA/SP/SE折扣价考试券,只限薇信交流懂的来

D、

[添加客服薇信:sun8335118】享受华为认证HCIA/IP/IE和售前HCSA/SP/SE折扣价考试券,只限薇信交流懂的来