单选题 ClusterKit NCCL 350 GB/s(400G)如何解读?

A、 正常/最优
B、 不确定
C、 严重失败
D、 需 FEC
下载APP答题
由4l***tr提供 分享 举报 纠错

相关试题

单选题 为验证 DGX 系统是否正确安装,系统管理员应使用哪个命令收集系统配置和 诊断信息?

A、nvsm stress-test
B、nvsm get health
C、lspci | grep DPU
D、nvsm show health

单选题 你正在数据中心部署 NVIDIA DGX H100 系统。每个机架支持单机 10.2 kW 的 功耗。验证电力需求时,最关键的步骤是什么?

A、验证输入电压范围(200-240V AC)与数据中心供电基础设施兼容
B、验证供电系统支持 N+1 冗余并能满足峰值负载
C、确认 DGX H100 中的电源模块符合 80 PLUS Gold 或更高效率
D、确保每个机架至少有一条电路可提供 10.2 kW 功率

单选题 距离上次使用 ibdiagnet 检查 InfiniBand Fabric 已超过两周。今天运行该工具 时收到如下输出。 (表格:Summary 下的各 Stage 的 Warnings、Errors、Comment) 进一步分析错误时,首先应采取什么操作?

A、使用更多选项重新运行 ibdiagnet
B、检查 ibdiagnet2.pm 文件
C、重启主 SM
D、运行 ibstat

单选题 系统管理员需要安装 NVIDIA Container Toolkit。 应使用哪个工具?

A、nvidia integration kit
B、nvupdate
C、apt
D、docker cli

单选题 系统管理员发现 DGX H100 服务器发生故障。重启后,只有 BMC 可用。 造成这种现象的原因可能是什么?

A、网络接口卡服务停止
B、没有链路 / 连接
C、启动磁盘故障
D、多个 GPU 故障
E、超过两个电源故障

单选题 在一台 DGX 上,系统管理员需要监控 电源(PSU)、CPU 利用率、GPU 利用率、 RAID、内存利用率。应使用哪一个 NVIDIA 工具?

A、SMI
B、MOFED
C、DCGM
D、NVSM

单选题 系统管理员需要在 DPU 上为虚拟化环境配置两个虚拟功能(VF)。 应使用哪个命令?

A、echo 1 > /sys/class/net/<physical>/device/sriov_numvfs
B、echo 2 > /sys/class/net/<virtual>/device/sriov_numvfs
C、echo 2 > /sys/class/net/<physical>/device/sriov_numvms
D、echo 2 > /sys/class/net/<physical>/device/sriov_numvfs

单选题 你正在为基于 H100 的集群执行存储验证,目标是确保存储系统针对 AI 工作 负载进行了优化。你应该重点关注什么?

A、通过运行专为 AI 工作负载设计的应用级基准测试,验证高吞吐量和低延迟
B、检查存储系统是否配置了以冗余为主的 RAID 级别,即使这会牺牲性能
C、验证总存储容量并确认其与系统规格一致,而不运行性能基准测试
D、通过在节点之间传输随机文件并监控传输速度和错误率来测试存储性能