近日,中国电信云计算研究院联合北京大学、天翼云公司在智能视频通信领域取得新进展,合作完成的学术论文《Beyond Faces: Toward Interactive Generative Video Coding via Hybrid Priors》被ACM International Conference on Multimedia(ACM MM 2026)主会录用。ACM MM 是国际多媒体领域顶级学术会议,也是中国计算机学会推荐的CCF A类会议。该工作主要由中国电信云计算研究院研究员常建慧与北京大学联合培养博士生周佳蕾完成,天翼云公司张皓烨、校利虎参与协同研究,法国CNRS高级研究员Giuseppe Valenzise与北京大学马思伟教授给予指导。
随着云视频会议和远程协作应用不断发展,如何在有限网络带宽下兼顾画面质量、传输效率与自然交互体验,成为云端实时音视频服务的重要技术需求。真实会议场景不仅包含面部说话,还会频繁出现手势表达、手部遮挡人脸以及手部进出画面等复杂交互。现有生成式人脸视频编码方法主要围绕面部运动建模,在处理复杂人手交互时容易出现手部缺失、重影和遮挡区域失真等问题。面向天翼云相关视频会议与智能媒体服务场景,研究团队进一步探索了复杂交互视频在极低码率下的高质量传输与生成重建问题。

基于混合先验的交互式生成视频编码框架
针对上述问题,研究团队提出基于混合先验的交互式生成视频编码框架,通过传输紧凑的人脸与手部语义结构信息,分别建模人脸和手部运动,并结合扩散生成先验,对手部新出现、复杂运动和严重遮挡区域进行高质量重建。同时,团队构建了面向手部活跃视频会议场景的测试基准。实验结果表明,该方法在极低码率条件下,能够更加准确、稳定地还原手势动作、人物面部及其遮挡关系,在整体画面质量和手部关键区域表现上均优于现有代表性方案,验证了该技术在低带宽交互式视频通信场景中的有效性和应用潜力。
本次论文入选ACM MM 2026主会,体现了中国电信云计算研究院在生成式视觉通信和智能视频编码方向的持续技术积累,也展现了研究院与北京大学联合培养、与天翼云协同创新的产学研合作成效。ACM MM是国际多媒体领域历史悠久、影响广泛的旗舰会议,长期汇聚图像视频、音频、多模态智能和媒体系统等方向的前沿研究成果;本届大会共收到7053篇论文投稿,主会录用率约20%。未来,团队将继续围绕生成式图像视频编码、语义通信和端云协同智能传输等方向开展研究,推动前沿算法、原型验证与天翼云实际业务场景进一步结合,为云网融合背景下的智能媒体服务提供技术支撑。
近日,中国电信云计算研究院联合北京大学、天翼云公司在智能视频通信领域取得新进展,合作完成的学术论文《Beyond Faces: Toward Interactive Generative Video Coding via Hybrid Priors》被ACM International Conference on Multimedia(ACM MM 2026)主会录用。ACM MM 是国际多媒体领域顶级学术会议,也是中国计算机学会推荐的CCF A类会议。该工作主要由中国电信云计算研究院研究员常建慧与北京大学联合培养博士生周佳蕾完成,天翼云公司张皓烨、校利虎参与协同研究,法国CNRS高级研究员Giuseppe Valenzise与北京大学马思伟教授给予指导。
随着云视频会议和远程协作应用不断发展,如何在有限网络带宽下兼顾画面质量、传输效率与自然交互体验,成为云端实时音视频服务的重要技术需求。真实会议场景不仅包含面部说话,还会频繁出现手势表达、手部遮挡人脸以及手部进出画面等复杂交互。现有生成式人脸视频编码方法主要围绕面部运动建模,在处理复杂人手交互时容易出现手部缺失、重影和遮挡区域失真等问题。面向天翼云相关视频会议与智能媒体服务场景,研究团队进一步探索了复杂交互视频在极低码率下的高质量传输与生成重建问题。

基于混合先验的交互式生成视频编码框架
针对上述问题,研究团队提出基于混合先验的交互式生成视频编码框架,通过传输紧凑的人脸与手部语义结构信息,分别建模人脸和手部运动,并结合扩散生成先验,对手部新出现、复杂运动和严重遮挡区域进行高质量重建。同时,团队构建了面向手部活跃视频会议场景的测试基准。实验结果表明,该方法在极低码率条件下,能够更加准确、稳定地还原手势动作、人物面部及其遮挡关系,在整体画面质量和手部关键区域表现上均优于现有代表性方案,验证了该技术在低带宽交互式视频通信场景中的有效性和应用潜力。
本次论文入选ACM MM 2026主会,体现了中国电信云计算研究院在生成式视觉通信和智能视频编码方向的持续技术积累,也展现了研究院与北京大学联合培养、与天翼云协同创新的产学研合作成效。ACM MM是国际多媒体领域历史悠久、影响广泛的旗舰会议,长期汇聚图像视频、音频、多模态智能和媒体系统等方向的前沿研究成果;本届大会共收到7053篇论文投稿,主会录用率约20%。未来,团队将继续围绕生成式图像视频编码、语义通信和端云协同智能传输等方向开展研究,推动前沿算法、原型验证与天翼云实际业务场景进一步结合,为云网融合背景下的智能媒体服务提供技术支撑。