Research

Visual Computing Group (VCG)

The Visual Computing Group investigates frontier problems in visual intelligence across machine learning, embodied intelligence and autonomous interaction, generative AI and digital humans, 3D vision, computer graphics, and virtual reality. Our work focuses on depth perception, semantic understanding, cross-modal content generation, and efficient interaction between intelligent agents and the physical world.

Recent Work

The group conducts research on 3D reconstruction and editing, including 3D Gaussian Splatting (3DGS), visual content generation and editing, point-cloud understanding, and few-shot learning.

Publications

arXiv

  • [AR / ML / Time-Series Analysis] Xia, Y., Zhu, Z., Pang, B., Wang, S., & Li, S. TimeGazer: Temporal Modeling of Predictive Gaze Stabilization for AR Interaction. arXiv preprint arXiv:2510.01561, 2025.

2026

  • [CV / 行人重识别] 郭子强, 刘子吟, 王少荣. 面向空中-地面行人重识别的多样提示交互网络. 中国多媒体大会(ChinaMM 2026).

    • 会议推荐:《模式识别与人工智能》
  • [3D Reconstruction / 3DGS] Wang, Z., Dai, J., Zhu, Q., Li, Y., Su, M., Zhu, F., Gai, M., Wang, S., Pan, C., Chen, Y., & Wang, G. ChronoGS: Disentangling Invariants and Changes in Multi-Period Scenes. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026, pp. 8298–8307. (CCF A)

  • [ML / Few-Shot Segmentation] Lulu Jiang, Yaozheng Xia, and Shaorong Wang. Generalized few-shot semantic segmentation based on relevant intrinsic feature enhancement. In Proceedings of the 8th Chinese Conference on Pattern Recognition and Computer Vision (PRCV 2025). Singapore: Springer Nature Singapore, 2026, pp. 234–247. DOI: 10.1007/978-981-95-4987-0_17. (CCF C, acceptance rate: 29.58%)

  • [3D Vision / Point-Cloud Semantic Segmentation] Wanlu Zheng and Shaorong Wang. GAPFormer: geometry-adaptive propagated transformer for point cloud representation. In Proceedings of the 8th Chinese Conference on Pattern Recognition and Computer Vision (PRCV 2025). Singapore: Springer Nature Singapore, 2026, pp. 336–350. DOI: 10.1007/978-981-95-5737-0_24. (CCF C, acceptance rate: 29.58%)

  • [ML / Few-Shot Segmentation] Lulu Jiang, Yaozheng Xia, and Shaorong Wang. Generalized Few-Shot Semantic Segmentation via Contrastive Learning and Orthogonal Decoupling. Multimedia Systems, 32, 171 (2026). DOI: 10.1007/s00530-026-02227-8. (CCF C)

    • Recommended by: China Multimedia 2025 (ChinaMM 2025)
  • [CV / Salient Object Detection] Wang, Y., Zheng, W., Xia, Y., Wang, S. Asymmetric Dual-Stream Networks for Lightweight RGB-D Salient Object Detection. J. Shanghai Jiaotong Univ. (Sci.), 31, 898–908 (2026). DOI: 10.1007/s12204-024-2794-0.

    • 会议论文: 王妍, 郑宛露, 夏垚铮, 王少荣. 非对称双流轻量级 RGB-D 显著性目标检测网络. 第 27 届全国计算机辅助设计与图形学学术会议(CCF CAD/CG 2024).
    • 会议推荐: 第 27 届全国计算机辅助设计与图形学学术会议(CCF CAD/CG 2024)
  • [跨模态学习 / 行人重识别] 郭子强, 肖璇, 陶浩然, 王少荣. 基于全局学习扩展的可见光-红外行人重识别. 浙江大学学报(工学版), 2026, 60(8): 1670–1677.

    • 会议推荐: 中国多媒体大会(ChinaMM 2025)
  • [生成模型 / 人脸编辑] 梁汉亿, 李辉, 盖孟, 王少荣. DeltaAge:一种高保真的人脸年龄编辑网络. 浙江大学学报(理学版), 2026, 53(2): 191–199. DOI: 10.3785/1008-9497.25126.

    • 会议推荐: 第 28 届全国计算机辅助设计与图形学学术会议(CCF CAD/CG 2025)

2025

  • [生成模型 / 语音情感] 甄怡宁, 王春玲, 杨昊田, 王少荣. 基于分层解耦的无文本零样本语音情感迁移. 中国多媒体大会(ChinaMM 2025).

  • [3DV / 点云语义分割] 王仟, 杨昊田, 王少荣. HiDe-Mamba:基于状态空间模型的点云层次去噪网络. 第 17 届中国工业与应用数学学会几何设计与计算大会(GDC 2025).

  • [3DV / 点云语义分割] 王仟, 杨昊田, 王少荣. ADOT-Net:属性感知的动态八叉树网络. 第 28 届全国计算机辅助设计与图形学学术会议(CCF CAD/CG 2025).

  • [ML / 小样本分割] 刘胜男, 姜璐璐, 郑宛露, 王少荣, 汪国平. 基于互引导条件耦合的小样本语义分割[J]. 计算机辅助设计与图形学学报, 2025, 37(6): 973–982. DOI: 10.3724/SP.J.1089.2023-00457.

  • [生成模型 / 人脸编辑] 夏垚铮, 郝蕾, 郑宛露, 潘成伟, 王少荣. 基于语义分离和特征融合的人脸编辑方法[J]. 计算机辅助设计与图形学学报, 2025, 37(3): 414–426. DOI: 10.3724/SP.J.1089.2024-00305.

    • 会议推荐: 中国多媒体大会(ChinaMM 2024),最佳论文/学生论文候选
  • [CV / 行人重识别] 刘俊婧, 郑宛露, 郭子强, 王少荣. 多方引导前景增强的行人重识别方法. 浙江大学学报(工学版), 2025, 59(5): 929–937. DOI: 10.3785/j.issn.1008-973X.2025.05.006.

    • 会议推荐: 第 16 届全国几何设计和计算学术会议(GDC 2024)

2024

  • [CV / 显著性检测] 王妍, 郑宛露, 潘成伟, 王少荣. 基于多层次感知的 RGB-D 显著性目标检测网络. 中国多媒体大会(ChinaMM 2024).