单选题 深度强化学习常用算法不包括()。

A、 DQN
B、 PPO
C、 GAN
D、 A3C
下载APP答题
由4l***ui提供 分享 举报 纠错

相关试题

单选题 自编码器中的解码器可以被用作生成器,这种应用方式与哪种生成模型有直接关系?

A、生成对抗网络(GAN);
B、变分自编码器(variational auto-encoder);
C、玻尔兹曼机;
D、马尔可夫链蒙特卡洛方法;

单选题 在强化学习中,智能体从游戏开始到结束的整个过程称为什么?

A、回合(episode);
B、奖励(reward);
C、回报(return);
D、损失(loss);

单选题 在元学习中,如何解决过拟合问题?

A、收集更多的训练数据;
B、收集更多的训练任务;
C、调整学习算法的参数;
D、增加验证集的样本;

单选题 在知识蒸馏中,教师网络输出的分布为什么需要通过调整温度参数T来使其变得平滑?

A、为了使教师网络的分类结果更加准确;
B、为了让学生网络更容易学习到类别之间的相似性;
C、为了减少教师网络的计算量;
D、为了使教师网络的输出更接近学生网络的输出;

单选题 领域泛化通常被分为哪两种情况?

A、训练数据包含多个领域,测试数据包含多个领域;
B、训练数据包含多个领域,测试数据包含单个领域;
C、训练数据包含单个领域,测试数据包含多个领域;
D、训练数据包含多个领域,测试数据包含单个领域,或训练数据包含单个领域,测试数据包含多个领域;

单选题 领域偏移问题主要指的是什么情况?

A、训练数据和测试数据的分布相同,但模型表现不佳;
B、训练数据和测试数据的分布不同,导致模型在测试数据上表现不好;
C、模型的输入和输出分布相同,但它们之间的关系发生变化;
D、模型的输出分布发生变化,但输入分布保持不变;

单选题 在终身学习过程中,模型在学会新任务后忘记之前任务的现象被称为什么?

A、灾难性遗忘;
B、多任务学习;
C、迁移学习;
D、持续学习;

单选题 在强化学习中,智能体与环境互动的过程中,奖励函数的输入通常是什么?

A、只有动作;
B、只有状态;
C、状态和动作;
D、状态、动作和轨迹;