2026年6月3日至7日,计算机视觉领域顶级国际会议IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026(CVPR 2026)在美国科罗拉多州丹佛市Colorado Convention Center举行。本届CVPR共收到16,092篇论文投稿,经严格同行评审后共有4,089篇论文进行展示,录取比例约四分之一;会议注册参会人数达12,200人,参会者来自84个国家和地区,是计算机视觉与人工智能领域规模最大、影响力最高的国际学术会议之一。
我院周俊伟教授课题组论文《Distributed Image Compression with Multimodal Side Information at Extremely Low Bitrates》入选CVPR 2026,并收录于会议论文集第33662—33671页。该论文第一作者为学院许国骏同学,研究方向为极低码率条件下的分布式图像压缩。论文官方展示页面已在CVPR 2026虚拟会议平台发布,页面包含论文、海报和讲解视频;项目主页同步公开了方法介绍、实验结果和代码入口。

论文官方展示页:CVPR 2026 Poster 39465 https://cvpr.thecvf.com/virtual/2026/poster/39465
项目主页:MDIC Project Page https://mommqq.github.io/MDIC-proj/
该论文面向多视角图像传输中的极低码率分布式图像压缩问题展开研究。针对低于0.1 bpp条件下目标图像信息严重受限、已有方法容易出现模糊和细节缺失等问题,课题组提出多模态分布式图像压缩框架MDIC,将文本语义信息和视觉边信息共同引入解码过程,通过文本到图像扩散模型补充全局语义,并利用特征掩码生成机制提取关键区域和对象级细节。实验结果表明,与先进的联合编码方法CAMSIC相比,MDIC在LPIPS、DISTS等感知质量指标上表现更优。根据论文实验曲线,在约0.05 bpp码率附近,MDIC相较CAMSIC在KITTI Stereo数据集上的LPIPS降低约50%,DISTS降低约55%;在Cityscapes数据集上,LPIPS降低约57%,DISTS降低约60%。这表明MDIC在极低码率场景下能够更好地恢复道路、车辆、建筑等场景结构,减少模糊和局部伪影,获得更符合人眼感知的重建结果。
本届CVPR参会高校和科研机构覆盖面广。国内方面,除我院团队外,北京大学、上海交通大学、浙江大学等高校均有计算机视觉相关团队参与论文展示和学术交流;国外方面,斯坦福大学、加州理工学院、芝加哥大学、卡内基梅隆大学、剑桥大学等高校也在会议中展示了相关研究成果。会议期间,许国骏同学重点与上海交通大学、北京大学等高校中从事图像压缩、学习式图像编码和多模态视觉重建方向的课题组成员进行了交流,围绕极低码率压缩、扩散模型重建稳定性、感知质量评价指标以及多视角边信息利用等问题展开讨论,进一步了解了国内外图像压缩方向的最新研究进展。会议期间,许国骏同学在CVPR 2026现场进行了海报展示,围绕MDIC的研究动机、方法框架、实验设置、评价指标和可视化结果向参会学者进行了介绍。现场交流中,来自上海交通大学、北京大学等高校从事图像压缩方向研究的课题组成员对该工作进行了讨论,重点关注多模态边信息在分布式图像压缩中的作用、感知质量指标与传统失真指标之间的权衡关系,以及该方法在真实多视角传输场景中的应用潜力。许国骏同学结合论文实验结果和项目页面中的可视化案例,对模型设计和实验结论进行了回应,并与相关高校同行就后续图像压缩与多模态生成式重建研究进行了交流。
本次论文入选CVPR 2026并在会议现场展示,体现了我院在图像压缩、智能媒体处理和多模态人工智能方向的研究进展,也展示了学院在计算机视觉前沿问题上的持续探索和科研积累。该工作聚焦极低码率视觉信息传输这一具有实际应用价值的研究问题,将分布式压缩、多模态理解和生成式重建相结合,为复杂场景下高质量图像重建提供了新的技术思路。
供稿:许国骏 审核:周俊伟、钟忺