在这些文献中,团队提出了多项创新的研究成果,涵盖了视频压缩、自然语言辅助手语识别、神经视频编解码器、图像编辑、文本到图像生成、Vision Transformers、掩码图像建模、序列到序列学习、开放词汇语义分割、流式视频架构、多平面图像、半监督动作识别、蒸馏模型、两阶段视频对象分割、布局生成、视频追踪、VR场景重建、人物模型等领域。
这些研究成果提出了一系列创新方法和技术,通过使用神经网络、Transformer模型、蒸馏技术等实现了在视频压缩、图像生成、语义分割、动作识别、VR场景重建等领域的优化和性能提升。这些方法不仅在实验中展现了卓越的性能,还提供了新的数据集和评估基准,促进了相关领域的研究和发展。今年的CVPR计算机视觉会议中,微软共发表了40份论文。其中一些论文包括:1)一项通用的多模态基础模型BEiT-3,在视觉和视觉语言任务方面都取得了优异的表现;2)关于掩码图像建模的研究,发现数据规模和训练时间对模型性能有重要影响;3)一种通过扩散网络生成3D数字身体化身的模型;4)从虚拟标记中估计3D人体网格的研究;5)一种用于3D线图绘制的库,通过引入线三角测量的结构先验来提高线重建的效果;6)使用混合姿势的外观建模方法来生成人脸的高保真可视化;7)一种跨语言手语检索方法,可以在手语视频和文本之间建立语义对齐;8)通过深度频率滤波技术来提高深度神经网络的泛化能力;9)一种用于线段检测和细化的方法,通过深度图像梯度来生成准确的线段;10)一种改进的DETR模型,通过混合匹配分支和一对多匹配分支的结合来提高准确性。这些研究涵盖了计算机视觉的多个领域,展示了微软在该领域的研究和创新能力。