Research

基于语义分离和特征融合的人脸编辑方法

夏垚铮, 郝蕾, 郑宛露, 潘成伟, 王少荣

计算机辅助设计与图形学学报, 2025, 37(3): 414–426.

publications

主要贡献。 提出ISFL模型,在图像域实现人脸语义的局部分离和全局融合,用户可通过掩模单独编辑人脸不同语义的结构和外观,并支持基于优化和基于编码器两种细节优化方式。

研究概述

人脸图像编辑模型中语义属性间关联性强,编辑一种语义可能导致其他属性和非编辑区域的改动。本文提出ISFL模型,使用图像掩模将人脸语义分离并组织为层次化树状结构,通过局部编码器、语义融合器和全局生成器实现对图像语义的局部分离和全局融合,支持用户通过掩模单独编辑不同语义的结构和外观。

研究问题

现有人脸编辑方法缺乏对面部结构或外观的直接控制,语义属性间关联性强导致编辑一种属性时影响其他属性,且交互复杂耗时,不能满足易用性和即时性要求。

核心思路

核心思想是将人脸语义在图像域分离为结构特征(边缘、纹理)和外观特征(色调、色彩),分别编码后通过语义融合器基于MLP-Mixer机制融合,映射到StyleGAN2的W+潜在空间,实现精准的局部语义编辑。

关键组成

Local Encoder

局部编码器

包含结构编码器(基于FPN+ResNet提取多尺度结构特征)和外观编码器(浅层卷积+GAP提取独立于结构的外观特征),分别生成结构和外观向量。
Semantic Fuser

语义融合器

基于MLP-Mixer的SE-MLP模块,通过SemanMixer中的Modulation机制将外观特征融入结构特征,映射到StyleGAN2的W+潜在空间。
Detail Optimization

细节优化

提供基于优化(PTI+Gram矩阵损失,质量更高)和基于编码器(结构残差编码+门控融合,速度更快)两种方式优化生成图像细节。
Fig. 3 ISFL模型整体结构
Fig. 3 ISFL模型整体结构

ISFL模型由三部分组成:局部编码器分别提取结构和外观特征,语义融合器通过Modulation机制将外观融入结构并映射到W+空间,全局生成器使用预训练StyleGAN2生成图像。编码器学习的是相对于平均潜在向量的偏移量,加速训练收敛。

Fig. 5 SE-MLP模块结构
Fig. 5 SE-MLP模块结构

SE-MLP模块在MLP-Mixer基础上增加SemanMixer融合模块。SemanMixer将结构特征分为低分辨率和高分辨率两部分,仅将高分辨率部分输入Modulation融合模块与外观特征交互,低分辨率部分直接传递,确保全局结构语义和局部结构语义间的自然过渡。

Fig. 6 SemanMixer融合模块结构
Fig. 6 SemanMixer融合模块结构

Modulation机制将外观特征编码为风格编码,通过计算解调因子调制全连接层权重,实现外观对结构特征的注入。这种设计参考了StyleGAN2中的风格注入机制,但应用于MLP而非卷积层。

实验结果

IS (重构)
3.19 Inception Score
+0.18 vs pix2pixHD
基于优化方法
LPIPS (重构)
0.51 LPIPS (lower=better)
-0.01 vs pix2pixHD
基于优化方法
ID (重构)
0.26 ID距离 (lower=better)
-0.02 vs pix2pixHD
两种方法均最优
支持语义数
9类 语义类别
头发/眼/嘴/鼻/面/耳/颈/背景
可同时编辑多个语义
方法FID↓IS↑LPIPS↓ID↓
pix2pixHD0.843.010.520.28
DeepFaceEditing1.792.870.560.30
ISFL (编码器)0.852.790.520.26
ISFL (优化)1.093.190.510.26

在CelebAMask-HQ数据集上,ISFL在IS、LPIPS和ID指标中均达到最优,生成图像质量更高、感知更真实、身份特征保留更好。基于优化的方法生成质量更高,基于编码器的方法在1秒内完成编辑,速度可接受。

Fig. 10 图像重构结果可视化对比
Fig. 10 图像重构结果可视化对比
Fig. 12 外观样式混合结果
Fig. 12 外观样式混合结果

结论

本文提出基于语义分离和特征融合的人脸图像编辑模型ISFL,通过图像掩模在图像域分离人脸语义并组织为层次化结构,实现对特定语义结构和外观的独立编辑。基于MLP-Mixer的语义融合器和两种细节优化方法确保了生成图像的高质量。

核心结论。 将人脸语义在图像域分离为结构和外观特征,通过Modulation机制在融合阶段注入外观信息,是实现精准局部人脸编辑的有效途径。层次化的语义组织结构支持同时编辑多个语义属性。

BibTeX

@article{xia2024isfl,
  title={基于语义分离和特征融合的人脸编辑方法},
  author={夏垚铮 and 郝蕾 and 郑宛露 and 潘成伟 and 王少荣},
  journal={计算机辅助设计与图形学学报},
  volume={37},
  number={3},
  pages={414--426},
  year={2024},
  issn={1003-9775},
  doi={10.3724/SP.J.1089.2024-00305},
  url={https://www.jcad.cn/cn/article/doi/10.3724/SP.J.1089.2024-00305}
}