deepfacelab中文网

 找回密码
 立即注册(仅限QQ邮箱)
查看: 90|回复: 1

下一代DFL来了吗?- 2026 前沿换脸技术盘点

[复制链接]

8

主题

76

帖子

1053

积分

初级丹圣

Rank: 8Rank: 8

积分
1053
 楼主| 发表于 12 小时前 | 显示全部楼层 |阅读模式
星级打分
  • 1
  • 2
  • 3
  • 4
  • 5
平均分:NAN  参与人数:0  我的评分:未评
本帖最后由 ulu 于 2026-8-15 12:56 编辑

最近把几篇新的视频换脸论文、项目页和开源仓库集中翻了一遍,越看越觉得有必要放到 DFL 的实际流程里聊一聊。
论文里的脸越来越自然,论坛里真正能长期干活的主力却还是 DFL。
论文更关心公开测试集上的身份相似度、画质、表情和时序指标,实际炼丹还要看自己的 SRC、DST、显卡和镜头能不能稳定出片,出问题后有没有地方可以修。

问题也恰好出在这里:素材一旦缺少侧脸、仰俯角、极端表情或遮挡,DFL 就没有可靠证据可学;
模型可能硬套正脸纹理,也可能在边缘、牙齿、眼神和脸型上露馅。
它的上限高,却把大量压力交给了素材采集和训练。

先说明一下,这帖不做简单的 SOTA 排名,也不把项目页演示直接当实测。主要想讨论三个问题:

1. 新方法能否保住 DFL 通过专人训练得到的相似度,同时在缺素材、大角度和复杂表情下也保持稳定?
2. 它是真正的视频换脸器,还是图像换脸器加时序补丁,或者干脆是身份保持的视频生成器?
3. 论文、代码、权重、训练数据究竟开源到了哪一步,普通用户今天能不能跑?

先说个人结论:截至 2026 年 8 月,还没有一个公开框架能同时做到 DFL 级相似度、少素材也稳、大角度不崩、长视频不闪、消费卡能跑、训练链还完整。
七个项目各自补上了 3D 姿态、遮挡、视频时序、生成式大动作或关键帧身份锚定中的一部分,暂时还没有谁把这些能力完整交付出来。




一、先把七个模型放到正确的地图上



12-landscape-audited.png
技术路线地图


上图很重要,因为七个名字并不在同一条赛道。

CanonSwap 是专用换脸器:重点是把目标人物的动作与外观解耦,再注入源身份。
VFace 是时序增强插件:它不独立决定“换得像不像”,而是让底层扩散换脸器在视频里少闪烁。
DynamicFace、VividFace、DreamID-V 借助生成先验补足单张源图看不到的区域,缺素材时通常更稳定,
但也承担“合理生成不等于真实身份细节”的风险。
Stand-In 更接近身份保持视频生成,换脸只是其下游能力之一。
LivingSwap 走另一条更接近制作流程的路线:身份仍来自单张目标人物图,待换视频负责提供姿态、表情、光线和运动,换脸关键帧则作为长视频中的身份锚点。

因此,“输入一张照片、不训练、任何角度都能像本人”本身就是一个互相拉扯的目标。
单图只提供一个投影视角;
模型补出的另一侧脸来自通用人脸先验。
它可以很合理,也能通过身份特征保持大体相似,却不可能凭空知道那颗痣、耳廓轮廓或侧面骨相的真实样子。
要超过 DFL,正确方向不是把单图模型继续神化,而是允许多图、视频或专人微调,把真实证据喂进去。




二、DynamicFace:3D 条件拆得漂亮,但现在还不是可用工具



DynamicFace 是 ICCV 2025 的工作,目标同时覆盖图像和视频换脸。
它使用扩散模型,并把人脸条件细分为四种可组合的 3D 先验,试图让身份、姿态、表情和几何不再互相污染;
Face Former 负责高层身份注入,ReferenceNet 补充细节,视频部分再加入时序机制。

这套设计对 DFL 的短板很有针对性。
DFL 遇到源数据没覆盖的大角度,通常只能从自己学过的分布里外推;
DynamicFace 则先理解目标的三维姿态和表情,再让生成模型在这个约束下“画出”源身份。
对于张嘴、转头、遮挡或跨域素材,它理论上更稳,也不需要为每个人从头训练。

但不要把“3D 先验”误解成完成了该人物的高精度三维重建。
输入仍然可以只是一张源图,模型知道的是通用人脸结构和身份嵌入,不知道源人物不可见一侧的全部真实细节。
它改善的是生成结果的合理性与稳定性,不是信息论上的无中生有。

更现实的问题是:截至本文核验日,官方页面依然写着 “Our code is coming soon”
所以它目前最有价值的是架构参考,而不是替换 DFL 的下载即用方案。
从测试视频看表情的还原度还是很差的。
论文页面上的结果值得看,但无法在自有素材上独立复测,就不能把演示视频直接当作生产结论。


与 DFL 对照

身份信息, DFL 把一个人的大量素材压进专人模型,素材越全,人物特有的骨相和纹理越容易留下。
DynamicFace 用单张参考图提取高层身份和细节,再依靠通用扩散先验补足不可见区域。
它更抗缺角度,专人细节的证据量却远少于 DFL。

姿态与表情, DFL 从训练集学习角度到外观的映射,源脸集中缺少侧脸或夸张表情时容易外推失败。
DynamicFace 把 3D 几何、姿态和表情拆成细粒度条件,目标表演与源身份之间的耦合更弱,这正是它相对 DFL 最明确的结构优势。

时间维度, DFL 仍以对齐脸和逐帧输出为核心,稳定性来自专人模型、相邻帧相似输入以及后期处理。
DynamicFace 在网络中加入视频时序机制,理论上能直接约束前后帧,但代码未开放,长镜头、切镜和遮挡恢复的真实表现还无法复测。

训练与修正, DFL 每换一个身份都要训练,代价高,但 XSeg、遮罩、颜色与合成参数都能精修。
DynamicFace 目标是通用模型直接推理,省去专人训练,却没有公开一套同等级的人工修正工作流。

论文(ICCV 2025)
官方项目页与全部演示视频
官方长视频示例

02-dynamicface.png
DynamicFace 官方效果图


图源:DynamicFace 官方项目页,原图保留;用于论文技术评论与对照,版权归原作者。


个人判断:学术参考价值高,尤其值得看“可组合 3D 条件 + 多层身份注入”;当前开源成熟度不足,还不能作为现成替代品。




三、VividFace:真正把图像数据和视频数据放到一套训练里



VividFace 入选 NeurIPS 2025。
它的思路并不是简单把图像换脸逐帧跑一遍,而是用混合训练同时吸收高质量图像身份信息与视频运动信息。
底层建立在 Stable Diffusion 1.5 U-Net 上,又加入 VidFaceVAE、Face3DVAE、ArcFace/DINO 身份特征、
3D 重建条件和视频时序模块。

这条路线很有启发:图像数据通常清晰、身份细节丰富,视频数据虽然模糊和压缩更重,却包含连续姿态、表情和运动。
只用图像训练,视频容易闪;
只用视频训练,身份细节又不够。
混合训练等于让两类数据各自补短板。

它能缓解 DFL 对专人角度覆盖的依赖,但并没有把几千张同一人物的素材作为一个身份库输入。
公开推理仍是“一张源脸配一段目标视频”的范式。
换句话说,模型在预训练阶段见过大量人脸和动作,推理时却仍把某个具体人物压缩到有限的身份条件里;
这使它更泛化,也意味着它未必能吃尽你手上上万张专人素材的价值。

开源情况比 DynamicFace 好:官方仓库已发布推理代码与预训练权重,也放出了训练脚本。
但 README 明确说明训练数据集尚未公开,所以完整训练目前不能真正复现。
论文报告的训练规模约为 550 小时视频、512×512、16 张 NVIDIA A100,这不是普通个人用户从头训练的级别。
消费卡更适合尝试预训练推理,具体显存与速度仍需按实现、分辨率和片段长度实测。

与 DFL 对照

身份学习, DFL 的训练数据可以全部属于一个人,模型容量几乎都用来拟合该身份。
VividFace 的大规模训练服务于所有身份,推理时只读一张源脸。
它见过的动作分布宽得多,对某个具体人的记忆却浅得多。

素材利用, 给 DFL 增加一批清晰侧脸,训练会直接吸收这些样本。
VividFace 当前公开推理接口没有多图聚合器,多放几千张源图也不会自然转化成更完整的身份模型。
要利用这批数据,需另做多参考编码或专人适配,官方方案里没有现成入口。

难角度和遮挡, VividFace 用 3D 重建条件、遮挡增强和图像视频混合训练处理这些情况,遇到训练分布内的新角度通常比缺素材的 DFL 更稳。
生成出来的侧脸仍可能带有通用先验的平均化特征,不能替代真实侧脸素材。

视频一致性, DFL 没有把整段视频作为联合去噪对象。
VividFace 的视频 VAE 与时序注意力显式建模连续帧,减少皮肤、五官和边缘闪动。
代价是推理更重,完整预训练规模也远高于专人 DFL。

可修性, DFL 的失败帧能从遮罩、对齐、颜色和模型迭代多个位置介入。
VividFace 更像端到端研究代码,输出不理想时可调空间少,制作软件层仍未成熟。

官方代码、权重与示例
NeurIPS 2025 论文页

03-vividface.png
VividFace 官方视频效果帧


图源:VividFace 官方项目页演示视频截帧,左侧为目标,右侧为 VividFace 输出;查看原视频页面


个人判断:“高质量图像身份 + 视频运动联合训练”这条路很有参考价值;
它仍是通用预训练模型,不等同于 DFL 的专人深度记忆,完整训练也不是个人级工程。




四、CanonSwap:七个项目里最像“下一代专用换脸器”的一个



CanonSwap 是 ICCV 2025 工作。
它先用运动提取器把目标帧变换到统一的 canonical space(规范空间),尽量消除头部姿态带来的形变;
随后通过 Partial Identity Modulation 在受控面部区域注入源身份,最后把结果再映射回目标姿态。

这套方法的关键不在“生成得多会画”,而在先拆开运动与外观,再换身份
传统方法常见的问题是源身份注入过强会吃掉目标表情,注入太弱又残留目标身份;
在规范空间里操作,可以减少这两类信息的纠缠。
它还限制修改区域,有利于保留目标头发、背景、光照和非面部内容。

对 DFL 用户来说,CanonSwap 很值得关注。
它不需要逐人训练,源图要求低;
架构建立在 LivePortrait 一类轻量人脸重演思路上,推理负担通常比视频扩散小,也更贴近消费卡落地。
对于口型、眨眼和常规转头,它可能比逐帧扩散更稳定、更快。

它的边界同样明显:输入仍可只有单张源图,严重侧脸的真实细节依旧缺失;
规范空间和运动估计如果遇到极端俯仰、快速遮挡、手挡脸或大幅运动模糊,也可能发生形变。
它擅长的是“忠实保留目标运动”,不代表身份细节一定超过用海量专人素材训练好的 DFL。

与 DFL 对照

网络目标, DFL 通过自编码重建与身份交换学习专人外观,姿态和外观仍可能在潜空间里纠缠。
CanonSwap 先把目标运动映射到规范空间,再做局部身份调制,网络结构直接服务于“动作归目标、身份归源人物”。

训练方式, DFL 为每一对身份训练专用模型,前期慢,推理和迭代可控。
CanonSwap 用公开权重直接处理新身份,准备时间短,更适合大量不同人物或快速周转的任务。

源数据容量, DFL 能从海量同人素材持续获益。
CanonSwap 的官方范式是一张源图,推理接口没有把一万张脸训练成专人表示的过程;
它在少素材时更容易保持稳定,但没有吃满多素材优势。

目标表演, 规范空间让 CanonSwap 在口型、眨眼和头姿保持上更有结构保障。
DFL 如果素材足够也能很好地重现表演,但极端姿态取决于训练集有没有相似样本。

工程控制, DFL 的遮罩和合成链更成熟。
CanonSwap 负责生成脸的主干更先进,官方项目还没有提供与 DFL Merger 同级的逐镜头颜色、边缘和遮罩调节工具。

官方项目页、完整视频与对比
官方代码
论文
官方 YouTube 介绍视频

04-canonswap.png
CanonSwap 官方效果图


图源:CanonSwap 官方项目页,左侧为源身份与目标视频,右侧为换脸结果;项目页标注 CC BY-SA 4.0。


个人判断:如果只选一个近期项目作为 DFL 的工程替代路线参考,CanonSwap 算是比较务实的候选;
身份细节和难例修复仍没有吃到大量 SRC 的优势。




五、VFace:不是新的换脸底模,而是“让扩散视频少闪”的外挂



VFace 是 WACV 2026 的训练免费方法。
它可以插到基于扩散的图像换脸器上,官方首先适配的是 REFace。
其三块核心分别是:频域注意力插值,用于保留身份关键特征;
Target Structure Guidance,用目标帧结构约束生成;
以及光流引导的注意力时序平滑,把相邻帧对应区域连接起来。

它切中了逐帧扩散换脸最烦人的问题:单帧看都不错,播放起来眉毛、牙齿、皮肤纹理和脸形却不断轻微跳动。
VFace 不需要额外训练,也不要求为一段视频微调,因此适合做模块化组件。

不过,插件不能突破底模的身份上限。
如果底层 REFace 在某个角度本来就不像,VFace 主要能让这种结果“稳定地不像”,而不能自动达到 DFL 级相似度。
光流对快速运动、遮挡出现/消失和模糊也并非万能。

开源层面,官方代码已经可用,主仓库是 MIT,但依赖的模型与数据还有 OpenRAIL 和非商业研究限制,准备商用的人不能只看仓库顶层许可证。

与 DFL 对照

所处层级, DFL 是从脸集准备、模型训练到合成的完整框架。
VFace 只处理“扩散图像换脸器怎样连续跑视频”,必须依附 REFace 这类底模,无法单独完成身份交换。

身份相似度, DFL 的相似度上限由专人训练和素材决定。
VFace 用频域注意力尽量保住底模已有的身份特征,却不会凭空增加源人物信息;
底模在侧脸上认错,VFace 也没有额外的多图身份库来纠正。

时序, 这是 VFace 明显强于 DFL 原生网络结构的地方。
光流引导能把相邻帧的对应区域和注意力联系起来,专门压制逐帧扩散的闪烁。
快速遮挡、运动模糊和光流估计错误仍会传递到后续帧。

训练成本, DFL 要按身份训练。VFace 不做额外训练,也不做视频级微调,适合给已有扩散换脸器快速增加时序能力。

修正方式, DFL 出错时可以回到脸集、遮罩和合成阶段。
VFace 的主要控制点在底模参数、光流和注意力注入,普通制作用户能直接调的内容少得多。

官方代码与使用说明
论文

个人判断:VFace 很适合给扩散换脸器补时序,但不能单独当成 DFL 替代品。




六、DreamID-V:当前最值得实际试跑的视频扩散路线之一



DreamID-V 是 ECCV 2026 Oral,基于 Wan2.1 1.3B 视频 DiT。
它尝试弥合图像身份与视频运动之间的鸿沟,使用面向不同模态的条件注入、SyncID 流程、从合成到真实的课程学习,以及身份一致性强化学习。
它的官方仓库已经发布推理代码和权重,并提供 Faster、DWPose 等版本。

和 DFL 相比,它的优势很直观:不需要逐人训练,视频生成模型已经在预训练中学到大量头部旋转、身体运动、相机变化与场景规律,因此当源图没有侧脸时,
它能生成一个与身份条件相容的侧面,而不是硬把正脸纹理扭过去。
大动作、复杂背景和新场景是它的主场。

但这里必须区分“身份相似”和“身份信息完整”。
官方使用提示仍推荐一张 512×512 裁剪参考脸,命令行也是单参考图范式。
它比传统单图换脸更会补全,不代表补出的耳朵、侧颌线和细小纹理就是本人的真实信息。
这正是生成模型容易出现“很像,但带一点平均脸”的根源。

硬件方面,官方生态已经出现 16GB VRAM 的 ComfyUI 版本;
Faster 版以 832×480、16 步为示例,作者建议最高质量可用 1280×720。
请注意,这些是版本与示例信息,不等于所有 16GB 卡都能在任意长度、任意分辨率下顺畅运行。
8–12GB 往往要等社区量化、CPU offload、分块或降低分辨率。

与 DFL 对照

身份表示, DFL 把多角度专人资料写进网络参数。
DreamID-V 在推理时读取单张参考脸,把身份条件注入预训练视频 DiT。
前者信息密度高,后者换人快、泛化范围宽。

大姿态, DreamID-V 的视频生成先验已经学习大量人物动作和镜头变化,源图缺侧脸时也能生成连续侧面。
DFL 只能依赖源脸集覆盖。
DreamID-V 补出的结构可能很自然,却不保证是该人物真实的耳廓、颌线和侧面纹理。

目标保真, DFL 主要替换对齐脸区,目标视频的身体、镜头与背景基本不动。
DreamID-V 的生成范围和控制链更大,复杂动作更自然,也更容易在细节上改动目标内容。
严格影视替换需要逐项检查嘴型、手部遮挡和边缘。

时间与算力, DFL 把成本放在专人训练,训练完成后的帧推理相对稳定。
DreamID-V 省掉专人训练,却在每段视频扩散采样时持续付出高算力,分辨率和片段长度都会推高显存与时间。

返修, DFL 有成熟合成器。
DreamID-V 更接近生成管线,失败段通常要改控制条件、种子、姿态检测或整段重跑,局部确定性不如 DFL。

官方代码、权重、命令与演示
官方项目页
论文

05-dreamidv.jpg
DreamID-V 官方效果图


图源:DreamID-V 官方仓库。每组上排为目标视频,下排为换入参考身份后的结果,展示真人、动画、遮挡与大动作场景。


个人判断:DreamID-V 是今天可以下载试跑的前沿生成路线,更适合处理 DFL 的难角度和大动作,最高相似度并不是它最稳的部分。




七、Stand-In:适合“让这个人演一段新视频”,不等同于严格换脸



Stand-In 是 CVPR 2026 的轻量身份控制框架。
所谓轻量,是相对 Wan 基础模型只额外训练约 153M 参数,官方称约为底模参数量的 1%;
它可以与文本到视频、姿态控制、风格化、VACE 等组合,仓库也提供实验性 face swap 入口。

它最吸引人的地方,是把身份保持做成可插拔控制器。
未来的新换脸框架完全可以借鉴这种做法:不重训整个视频大模型,只训练身份适配层;
换一个人时再构建小型身份记忆或 LoRA,而不是从头训练一个巨型模型。

但从任务定义上看,Stand-In 更偏“身份视频生成”。
如果要求目标视频里的表演、嘴型、镜头运动、服装边缘、光影变化一帧不动,只替换面部身份,专用 swapper 更合适。
Stand-In 可能生成得很自然,却也更可能改变原视频内容。

硬件也不能被“1% 参数”误导:额外模块轻,不代表底座轻。
官方已支持 Wan2.1 14B 和 Wan2.2 A14B,运行的主要显存压力仍来自大型视频底模。
代码、权重、训练数据、预处理脚本和训练代码已经公开,换脸功能仍被官方标为实验性功能。

与 DFL 对照

任务定义, DFL 接收既有目标视频并尽量只换脸。
Stand-In 的主任务是让参考身份出现在新生成的视频里,face swap 只是实验性下游功能。
要求严格保留原镜头时,两者并不等价。

身份学习, DFL 每个身份都有独立模型。
Stand-In 把身份控制做成相对 Wan 底模很小的附加模块,切换人物快,也方便与姿态、风格和文本控制组合。

素材与泛化, DFL 能消化大量专人图片,但缺失姿态会拖累结果。
Stand-In 借助 14B 视频底模生成训练分布内的新动作和新场景,单张参考图仍限制人物特有细节。

目标运动, DFL 从目标帧直接取得表演,口型和节奏容易与原片一致。
Stand-In 依赖生成控制重建视频,更适合“让这个人做某件事”,不适合把原演员每个细微表演原样留下。

资源与工具, DFL 可以在较低显存上慢慢训练,也有完整 GUI 流程。
Stand-In 虽只增加约 153M 参数,仍要承载 Wan 14B 底模;
它的换脸入口和返修工具都处于实验阶段。

官方代码、模型和换脸入口
官方项目页与展示视频

06-standin.png
Stand-In 官方换脸演示帧


图源:Stand-In 官方项目页“Video Face Swapping”演示视频截帧;查看原视频页面


个人判断:它很适合研究身份控制,但任务定义和严格换脸有差别,不能按 DFL 平替理解。




八、LivingSwap:把单图换脸关键帧接进长视频生成



LivingSwap 是 CVPR 2026 工作,目标是电影级长视频换脸。
它的输入包括待换视频、编辑区域遮罩和一张目标人物身份图。
系统从待换视频中抽取关键帧,先用 InSwapper 等单帧换脸器生成换好身份的关键帧,再把完整待换视频与这些关键帧交给视频扩散模型,通过参考补全和时序拼接处理长镜头。
论文还提出 Face2Face 数据集和 CineFaceBench,用来覆盖复杂光照、妆容、半透明遮挡和电影镜头。

这里必须分清两种信息。
待换视频提供真实的姿态、表情、光线、背景和运动,目标人物身份仍主要来自单张图片。
换脸关键帧能够在不同时间点校正身份,却是单帧换脸器根据同一张身份图生成的结果,并不是目标人物的真实多角度素材。
LivingSwap 增强的是视频属性保留和长时序稳定性,不会凭空补充目标人物的真实侧脸证据。

论文以 81 帧片段处理长视频。
为保证实验可复现,作者采用固定间隔策略,约每 79 帧设置一次关键帧,并用 InSwapper 自动生成关键帧换脸结果;
实际制作也可以只精修少数失败关键帧,再让模型完成中间帧。
论文称这种流程能显著减少人工编辑量,但代码尚未公开,实际效率还不能独立复测。

遗憾的是,截至本文核验日,官方页面仍显示 Code (Coming Soon)
没有代码和权重,就无法判断它对显存、速度、分段边界与失败镜头的真实要求。
所以现阶段它是非常重要的架构方向,不是可立即部署的软件。

与 DFL 对照

身份输入, DFL 在训练前收集大量真实脸图,再把不同角度和外观固化进专人模型。
LivingSwap 的目标身份仍可只由一张图片提供;
待换视频和换脸关键帧能稳定传播这份身份条件,却不会增加目标人物真实的侧脸、耳廓或下颌信息。

素材门槛, DFL 需要数量较多、角度覆盖充分的源脸集。
LivingSwap 不要求目标人物视频,一张清晰身份图即可运行;
代价是侧脸等不可见细节仍由单帧换脸器和视频先验推测。
待换视频必须能够稳定检测和跟踪人脸,关键帧换得越准,最终身份通常越稳。

长视频, DFL 通常逐帧推理,再依靠模型稳定性和后期合成维持连续。
LivingSwap 按片段处理,并用首尾关键帧约束和时序拼接连接长镜头,论文目标直接包含长视频一致性。

人工参与, DFL 的人工时间分散在脸集清理、遮罩、训练观察和合成。
LivingSwap 的论文实验使用固定间隔自动选帧和自动单帧换脸,不要求逐段手工挑关键帧;
制作中可以人工重做少数失败锚点,减少逐帧修正。
实际节省多少时间仍需等代码开放后验证。

成熟度, DFL 已经形成完整社区工作流。
LivingSwap 目前只有论文、项目页和演示,官方代码仍标为 Coming Soon。
论文使用 14B 视频底模,并以 8 张 H200 训练约 14 天;
推理显存、速度、失败处理与分段接缝仍缺少公开实测。

官方项目页与电影级演示视频
论文
官方电影镜头示例之一

07-livingswap.png
LivingSwap 官方效果帧


图源:LivingSwap 官方电影镜头演示截帧。左侧为待换镜头和目标身份图,右侧为 LivingSwap 输出;查看原视频


个人判断:它最值得参考的是完整待换视频的属性保留、关键帧身份锚定和长视频拼接,不是多图身份学习。
它能让单图换脸在长镜头里更稳定,却不能替代 DFL 对真实多角度身份素材的学习;
目前没有开源,离成熟制作工作流还有距离。




九、横向对比:哪一个现在最接近可用?



如果按“今天能不能动手”排序,而不是按论文宣传排序:

1. CanonSwap:专用、轻量、目标保持明确,最适合拿来做 DFL 之后的新工程底座。
2. DreamID-V:官方推理和权重齐,生成能力强,适合处理大姿态与难运动,但对显存和速度要求更高。
3. VFace:作为时序插件很实用,价值取决于底层图像换脸器。
4. VividFace:推理已开源,有研究价值;完整训练因数据未公开而受限。
5. Stand-In:更适合身份保持视频生成;换脸是实验功能,14B 底座很重。
6. DynamicFace、LivingSwap:方向先进,但代码尚未公开,现阶段只能参考架构和官方演示。

这里没有给“画质、身份、时序”随意打五星,因为不同论文使用的数据集、裁剪、指标和对手并不完全一致。
论文所说的 SOTA,只表示在其设定下对所选基线取得当时最佳结果,不等于任何人的任意素材上都最强,更不等于工程成本最低。

顺带说一句 AHS、GHOST 2.0、InsightFace/InSwapper 一类工具:它们仍然有速度快、部署成熟、消费卡友好的价值,
也常被整合进 FaceFusion 等应用,但技术代际更接近单帧身份编码 + 生成/重演。
做批量预览和普通镜头很实用,目标若是用丰富专人素材追求 DFL 级身份细节,就不是本文所说的终局方案。




十、显存分级:不同显卡用户该看哪条路线



这张图是工程分级,不是厂商或论文的统一最低显存表。
视频长度、分辨率、精度、注意力实现、量化、CPU offload 和是否逐帧都会大幅改变结果。

6GB 档:DFL、轻量 GAN/重演和低分辨率专用模型仍有现实意义。
现代视频扩散可以靠极端卸载尝试,但时间成本和稳定性通常不划算。
8–12GB 档:优先 CanonSwap/LivePortrait 类专用架构;
图像扩散和部分视频模块可通过半精度、切片和短片段运行。
大型视频扩散不要只看“能启动”,还要看每秒耗时和长片段是否爆显存。
16GB 档:DreamID-V 1.3B Faster/社区 ComfyUI 生态已有明确入口,480P 短片段更现实;
高分辨率与长视频仍需分段。
24GB 档:更适合视频扩散推理、较少卸载和小型身份适配训练,但 Wan 14B 仍可能需要量化或 CPU offload。
32–48GB+ 档:14B 视频底模、高分辨率实验和更完整的微调开始变得合理;
从头预训练 VividFace、DreamID-V 级系统仍是多卡数据中心工作。




十一、围绕 DFL 短板的几个问答



Q1:生成模型已经会补侧脸,单张正脸是不是够了?

不够。
DynamicFace、VividFace 和 DreamID-V 已经能利用 3D 条件或视频生成先验,在源图没有侧脸时生成合理侧面。
它们解决了 DFL 把正脸纹理硬扭到侧面的失败,但补出来的是模型认为合理的这个人,不是被输入证实的真实侧脸。
耳廓、下颌转折、发际线、痣和局部不对称都可能被平均化。
普通镜头可以只用单图,追求专人级相似度仍要提供多角度资料。

Q2:手里有几千到一万张源脸,这七个模型能全部吃进去吗?

公开推理接口大多不能。
DynamicFace、VividFace、CanonSwap 和 DreamID-V 的典型输入仍是一张源图;
VFace 跟随底层图像换脸器;
Stand-In 也是参考身份控制。
它们的通用预训练见过海量人脸,不等于推理时会把同一个人的一万张图聚合成专人记忆。

LivingSwap 也不属于多图身份方案。
它输入一张目标人物身份图,再利用待换视频和由单帧换脸器生成的关键帧维持长视频稳定;
这些关键帧不会把新的真实侧脸信息交给模型。
就这七个项目的公开推理接口而言,目前没有一个能把数千张同人素材聚合成类似 DFL 的专人记忆。

Q3:既然扩散模型在缺素材时更稳定,为什么不针对每个人微调一个扩散模型?

技术上可行,成本和可控性是主要问题。
VividFace 完整训练使用约 550 小时视频和 16 张 A100,说明视频扩散底座不能按身份重训。
更实际的做法是冻结底模,只训练 LoRA、身份适配器或少量身份 token。
Stand-In 证明了只增加少量身份控制参数也能工作,但它依附的 Wan 14B 底座仍然很重。

专人微调还会遇到过拟合:训练图里某种发型、妆容、表情和光线可能跟身份绑定,输出变得很像训练集,却不肯服从目标视频。
DFL 也有类似问题,但它的任务范围窄、合成工具成熟,失败原因更容易定位。

Q4:哪几个模型已经明确解决了 DFL 的大姿态问题?

DynamicFace 用可组合 3D 人脸先验分离身份、几何、姿态和表情;
VividFace 用 3D 重建条件与遮挡增强;
CanonSwap 把目标运动映射到规范空间后再换身份;
DreamID-V 和 Stand-In 借助视频大模型的运动分布生成新角度;
LivingSwap 直接参考待换视频,并用换脸关键帧减少长视频中的身份漂移。

它们解决问题的方式不同。
3D 条件和规范空间更强调忠实跟随目标结构,视频扩散更擅长生成训练分布内的连续动作,LivingSwap 则重点保留待换视频的表情、光照和运动。
它对侧脸的改善主要来自视频先验和关键帧传播,不是读取了目标人物的真实侧脸。

Q5:视频闪烁方面,DFL 和新模型谁更强?

DFL 的稳定来自同一专人模型反复处理相近的连续帧,脸集和训练稳定时效果很好,但网络没有显式理解整段视频。
VividFace、DynamicFace 与 DreamID-V 原生处理多帧或视频潜空间,VFace 更直接用光流和注意力传播压制逐帧扩散闪烁,
LivingSwap 还处理长片段首尾衔接。

新模型也会产生另一种时序错误:身份在各帧都像,细纹、牙齿、遮挡边界或光照却缓慢漂移;
视频扩散按片段生成时,片段之间还可能跳变。
项目页的几秒演示无法替代长镜头测试。

Q6:哪个项目今天最可能直接替换 DFL?

没有一个能全面替换。
CanonSwap 最接近专用换脸器,推理更轻,目标表演保持也清楚,适合普通镜头和快速流程。
DreamID-V 对大动作和缺角度更有吸引力,但显存、速度与目标内容漂移的代价更高。
VFace 适合作为扩散换脸器的时序补丁。
VividFace 的训练路线完整,公开数据却不足以复现训练。
DynamicFace 和 LivingSwap 尚未开放代码。
Stand-In 的主任务又偏身份视频生成。

如果 DFL 已经在正脸和常规侧脸上达到很高相似度,最合理的比较方式是拿同一批困难镜头测试这些新模型,而不是整部片一次性换工具。
90° 侧脸、遮挡解除、低头张嘴、快速转身和长镜头最能看出差异。

Q7:少素材时,新模型能把 DFL 的差距补到什么程度?

它们能明显抬高下限。
DFL 缺姿态样本时可能直接变形,生成模型通常能给出完整、自然、可播放的脸。
相似度上限仍取决于源身份信息。
模型不知道的细节只能猜,猜得符合人脸统计,不等于猜得符合本人。

因此,少素材任务最容易看到新模型的优势;
素材已经覆盖年龄、妆容、左右侧脸和复杂表情时,DFL 的专人模型仍可能更像。
LivingSwap 能提高单图换脸在长视频中的连续性和属性保真,但不会利用额外的目标人物素材来抬高身份信息上限。

Q8:论文效果图看起来都很好,实际测试最该盯什么?

单帧截图先看脸型、眼距、鼻翼、嘴角、耳朵和皮肤纹理有没有被平均化。
播放视频再看牙齿、眼神、皱纹、遮挡边界和发际线是否闪动。
最后看目标保真:口型、表情强度、视线、头部姿态、光线和背景有没有被生成模型改掉。

相似度指标常用 ArcFace 一类识别特征,容易忽略局部身份细节;
时序指标也可能奖励平滑却模糊的结果。
统一源图、目标片段、裁剪、输出分辨率和后期锐化,再做盲测,结论才有参考价值。




十二、最终结论



生成模型当然值得做,而且已经成为解决大姿态、少素材和复杂运动的主力方向;
但“生成模型”不是“深度学习模型”的对立面,扩散、DiT、GAN 和 DFL 都属于深度学习,只是训练目标与推理方式不同。

如果追求当前可用:专用轻量路线优先看 CanonSwap,生成型实跑优先看 DreamID-V,视频稳定模块看 VFace
如果研究下一代架构:重点读 DynamicFace 的条件解耦、VividFace 的图像—视频混合训练、Stand-In 的轻量身份适配,
以及 LivingSwap 的视频参考和关键帧工作流


如果追求真正超过 DFL:不要再坚持单图输入。
单图换脸可以方便、可以自然、可以在指标上很强,却不可能包含一个人的全部侧脸、年龄和局部纹理信息。
允许多图/视频身份库,再让扩散只补未知区域,才有机会同时获得 DFL 的“像”、生成模型的“稳”和专业流程的“可修”。

上面主要是按公开资料做的框架分析,不敢拿项目页效果直接代替实测。
坛里如果有人已经跑过其中某个项目,欢迎补充显存、速度和失败镜头。
最好能用同一段素材对比,里面带 90° 侧脸、低头、张嘴、手遮挡、运动模糊和长镜头;
统一裁剪、统一输出分辨率以后,结果才比较有参考价值。




资料截止:2026-08-15。
开源状态与仓库内容可能后续变化,请以各项目官方页面为准。
本文依据公开论文、官方项目页和官方仓库整理;
未公开的显存与速度均只作工程判断,不冒充作者实测。
引用的官方图片和视频均在相邻位置保留原出处链接,版权归各原作者。
请仅在获得授权的素材上使用换脸技术,并对生成内容作清晰标识。

本文由 ChatGPT 5.6 Sol 撰写。

回复

使用道具 举报

4

主题

232

帖子

9402

积分

高级丹圣

Rank: 13Rank: 13Rank: 13Rank: 13

积分
9402

万事如意节日勋章开心娱乐节日勋章

发表于 7 小时前 | 显示全部楼层
有点东西,主要没关注过其他的
回复 支持 反对

使用道具 举报

QQ|Archiver|手机版|deepfacelab中文网 |网站地图

GMT+8, 2026-8-15 15:44 , Processed in 0.122576 second(s), 33 queries .

Powered by Discuz! X3.4

Copyright © 2001-2020, Tencent Cloud.

快速回复 返回顶部 返回列表