Research

The Visual Computing Group (VCG) advances visual intelligence by enabling machines to perceive, understand, generate content, and interact with the physical world.

Research Areas

  • Machine Learning. Weakly supervised learning, few-shot learning, and time-series analysis.
  • 3D Reconstruction. Reconstruction, sparse-view reconstruction, and editing based on 3D Gaussian Splatting (3DGS).
  • Embodied Intelligence. Environmental perception, scene understanding, and autonomous interaction.
  • Computer Vision. Point-cloud semantic segmentation, image relighting, cross-modal person re-identification, and visual content generation.

Related work includes 2D and 3D digital-human editing, speech emotion transfer, scene generation, virtual reality engines, and digital ocean systems.

Publications

arXiv

  • [AR / ML / Time-Series Analysis] Xia, Y., Zhu, Z., Pang, B., Wang, S., & Li, S. TimeGazer: Temporal Modeling of Predictive Gaze Stabilization for AR Interaction. arXiv preprint arXiv:2510.01561, 2025. [Paper] [Project]

2026

  • [CV / 行人重识别] 郭子强, 刘子吟, 王少荣. 面向空中-地面行人重识别的多样提示交互网络. 中国多媒体大会(ChinaMM 2026). [Project]

    • [会议推荐]《模式识别与人工智能》
  • [3D Reconstruction / 3DGS] Wang, Z., Dai, J., Zhu, Q., Li, Y., Su, M., Zhu, F., Gai, M., Wang, S., Pan, C., Chen, Y., & Wang, G. ChronoGS: Disentangling Invariants and Changes in Multi-Period Scenes. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026, pp. 8298–8307. (CCF A) [Paper] [Project]

  • [ML / Few-Shot Segmentation] Lulu Jiang, Yaozheng Xia, and Shaorong Wang. Generalized few-shot semantic segmentation based on relevant intrinsic feature enhancement. In Proceedings of the 8th Chinese Conference on Pattern Recognition and Computer Vision (PRCV 2025). Singapore: Springer Nature Singapore, 2026, pp. 234–247. DOI: 10.1007/978-981-95-4987-0_17. (CCF C, acceptance rate: 29.58%) [Paper] [Project]

  • [3D Vision / Point-Cloud Semantic Segmentation] Wanlu Zheng and Shaorong Wang. GAPFormer: geometry-adaptive propagated transformer for point cloud representation. In Proceedings of the 8th Chinese Conference on Pattern Recognition and Computer Vision (PRCV 2025). Singapore: Springer Nature Singapore, 2026, pp. 336–350. DOI: 10.1007/978-981-95-5737-0_24. (CCF C, acceptance rate: 29.58%) [Paper] [Project]

  • [ML / Few-Shot Segmentation] Lulu Jiang, Yaozheng Xia, and Shaorong Wang. Generalized Few-Shot Semantic Segmentation via Contrastive Learning and Orthogonal Decoupling. Multimedia Systems, 32, 171 (2026). DOI: 10.1007/s00530-026-02227-8. (CCF C) [Paper] [Project]

    • [Recommended by] China Multimedia 2025 (ChinaMM 2025)
  • [CV / Salient Object Detection] Wang, Y., Zheng, W., Xia, Y., Wang, S. Asymmetric Dual-Stream Networks for Lightweight RGB-D Salient Object Detection. J. Shanghai Jiaotong Univ. (Sci.), 31, 898–908 (2026). DOI: 10.1007/s12204-024-2794-0. [Paper] [Project]

    • [会议论文] 王妍, 郑宛露, 夏垚铮, 王少荣. 非对称双流轻量级 RGB-D 显著性目标检测网络. 第 27 届全国计算机辅助设计与图形学学术会议(CCF CAD/CG 2024).
    • [会议推荐] 第 27 届全国计算机辅助设计与图形学学术会议(CCF CAD/CG 2024)
  • [跨模态学习 / 行人重识别] 郭子强, 肖璇, 陶浩然, 王少荣. 基于全局学习扩展的可见光-红外行人重识别. 浙江大学学报(工学版), 2026, 60(8): 1670–1677. DOI: 10.3785/j.issn.1008-973X.2026.08.006. [Paper] [Project]

    • [会议推荐] 中国多媒体大会(ChinaMM 2025)
  • [生成模型 / 人脸编辑] 梁汉亿, 李辉, 盖孟, 王少荣. DeltaAge:一种高保真人脸年龄编辑网络. 浙江大学学报(理学版), 2026, 53(2): 191–199. DOI: 10.3785/1008-9497.25126. [Paper] [Project]

    • [会议推荐] 第 28 届全国计算机辅助设计与图形学学术会议(CCF CAD/CG 2025)

2025

  • [生成模型 / 语音情感] 甄怡宁, 王春玲, 杨昊田, 王少荣. 基于分层解耦的无文本零样本语音情感迁移. 中国多媒体大会(ChinaMM 2025). [Project]

  • [3DV / 点云语义分割] 王仟, 杨昊田, 王少荣. HiDe-Mamba:基于状态空间模型的点云层次去噪网络. 第 17 届中国工业与应用数学学会几何设计与计算大会(GDC 2025). [Project]

  • [3DV / 点云语义分割] 王仟, 杨昊田, 王少荣. ADOT-Net:属性感知的动态八叉树网络. 第 28 届全国计算机辅助设计与图形学学术会议(CCF CAD/CG 2025). [Project]

  • [ML / 小样本分割] 刘胜男, 姜璐璐, 郑宛露, 王少荣, 汪国平. 基于互引导条件耦合的小样本语义分割[J]. 计算机辅助设计与图形学学报, 2025, 37(6): 973–982. DOI: 10.3724/SP.J.1089.2023-00457. [Paper] [Project]

  • [生成模型 / 人脸编辑] 夏垚铮, 郝蕾, 郑宛露, 潘成伟, 王少荣. 基于语义分离和特征融合的人脸编辑方法[J]. 计算机辅助设计与图形学学报, 2025, 37(3): 414–426. DOI: 10.3724/SP.J.1089.2024-00305. [Paper] [Project]

    • [会议推荐] 中国多媒体大会(ChinaMM 2024),最佳论文/学生论文候选
  • [CV / 行人重识别] 刘俊婧, 郑宛露, 郭子强, 王少荣. 多方引导前景增强的行人重识别方法. 浙江大学学报(工学版), 2025, 59(5): 929–937. DOI: 10.3785/j.issn.1008-973X.2025.05.006. [Paper] [Project]

    • [会议推荐] 第 16 届全国几何设计和计算学术会议(GDC 2024)

2024

  • [CV / 显著性检测] 王妍, 郑宛露, 潘成伟, 王少荣. 基于多层次感知的 RGB-D 显著性目标检测网络. 中国多媒体大会(ChinaMM 2024). [Project]

2021

  • [CG / 地形生成] 江西林, 王少荣, 李文玉, 汪国平. 以特征线和高程范围为约束的 DEM-cGAN 框架. 计算机辅助设计与图形学学报, 2021, 33(8): 1191–1201. DOI: 10.3724/SP.J.1089.2021.18656. [Paper] [Project]