你正在训练一个结合音频和视频数据的跨模态模型。你观察到该模型在训练数据上表现良好,但在未见过的数据上泛化能力差。以下哪种正则化技术最有可能在这种情况下提高泛化性能?
相关试题
单选题 你正在构建一个多模态生成式 AI模型,该模型以文本和图像作为输入来生成故事。文本编码器使用一个预训练的 BERT 模型,图像编码器使用一个预训练的 ResNet50模型。在训练期间,为了确保有效的多模态融合,将这两个编码器的特征空间对齐的最佳策略是什么?
单选题 你正在为一个新任务微调一个预训练的多模态模型。你的计算资源有限。以下哪种微调策略在仍然能够获得良好性能的同时,最为计算高效?
单选题 以下哪项不是训练多模态生成式 AI 模型时的常见挑战?
单选题 您正在使用文本和音频数据构建一个多模态情感分析模型。您观察到该模型在来自嘈杂环境的音频样本上的性能显著较差。以下哪种数据增强技术对提高模型对嘈杂音频的鲁棒性最为有效?
单选题 考虑以下使用 PyTorch 创建多模态数据集的代码片段。该数据集包含图像及其对应的文本描述。然而,在训练过程中,你观察到文本长度的数据分布存在显著不平衡。以下哪种技术最能解决这个问题?
单选题 你被要求构建一个可以从文本描述生成逼真图像,并且相反地从图像生成准确文本描述的系统。你决定使用 GAN(生成对抗网络)架构,但需要有效地处理这两种模态。对于这个双向多模态任务,哪种 GAN 变体最为合适?
单选题 你正在构建一个生成模型,该模型同时接收图像和文本输入来生成新图像。你使用了一个具有独立图像和文本编码器的变分自编码器(VAE)架构。训练后,你发现生成的图像受到图像输入的强烈影响,几乎未包含文本信息。以下哪种技术最有可能提高文本信息在生成图像中的融合程度?
单选题 在训练用于图像描述的多模态生成模型时,你发现模型生成的描述在语法上正确,但普遍且缺乏信息量。哪种技术最有可能提高生成描述的信息量和具体性?