deepfacelab中文网

 找回密码
 立即注册(仅限QQ邮箱)
查看: 94|回复: 4

关于模型三维的分配 by B站菜级玩家

[复制链接]

16

主题

128

帖子

850

积分

高级丹师

Rank: 5Rank: 5

积分
850
 楼主| 发表于 昨天 23:53 | 显示全部楼层 |阅读模式
星级打分
  • 1
  • 2
  • 3
  • 4
  • 5
平均分:NAN  参与人数:0  我的评分:未评
本帖最后由 caiji132156 于 2026-7-24 02:05 编辑

首先是解码器的mask分支,32的维度已经是很大的了,根本用不上那么大的,原版ae重建的遮罩本来质量就是不行的

实际上作为经典的自编码器重建任务之一,SAEHD架构没有脱离AE的特性,AE的理论在DFL上面也通用:

以下是DFL中几个模型的基本架构图:
iperov:
QQ_1784822085927.png
QQ_1784822102279.png
中科大:
QQ_1784822117756.png
可以看到都是AE结构,就是中间有点不一样,各有各的功能(也就AMP有点意思)
DFL模型学习的过程实际上就是编码器提取特征存在inter里面然后解码器去尝试把code解码为图像,练的实际上就是解码器
ae要多大呢?512就行了,太大的隐空间没有用的。你的解码器根本用不到特别大的ae
编码器呢?64就够用了,能总结的特征不会很多的
要人脸清晰,就加大解码器维度,而不是加大ae维度。
根据依据有很多很多:
[Learnings from Scaling Visual Tokenizers] ICML Poster Learnings from Scaling Visual Tokenizers for Reconstruction and Generation  or arxiv.org/pdf/2501.09755
论文中  摘要  提到
QQ_1784823500864.png
扩大编码器规模没有收益,而扩大解码器规模能提升重建质量
[关于流形的研究,这个我觉得是比较重要的]  A Manifold Learning Perspective on Representation Learning: Learning Decoder and Representations without an Encoder or arxiv.org/pdf/2108.13910
QQ_1784823780545.png
在传统的自编码器中,解码器 [size=1.21em]gw(z)gw​(z) 的功能是从低维的隐空间映射回高维的原始数据空间。论文提出,这个映射的输出结果(所有可能生成的点)本身就构成了一个低维流形

那DFL里面实际上就是把图片压缩到一个很小的瓶颈里面去,迫使解码器从低维学习抽象语义,语义包含人脸姿态身份光影,学习如何将code翻译为高维数据,也就是清晰的图像。
论文里面还提到,提升编码器效率比提升解码器效率低特别多
实验数据的话,ice已经做过了,ice重建高清图像的原理就是把解码器加得很深很深而已
B站菜级玩家
回复

使用道具 举报

16

主题

128

帖子

850

积分

高级丹师

Rank: 5Rank: 5

积分
850
 楼主| 发表于 4 小时前 | 显示全部楼层
架构图是我自己画的,100%准确
B站菜级玩家
回复 支持 反对

使用道具 举报

6

主题

49

帖子

2636

积分

初级丹圣

Rank: 8Rank: 8

积分
2636

万事如意节日勋章

发表于 3 小时前 | 显示全部楼层
意思是同分辨率下,512-64-78(64X1.21)-32,这种4维就已经是极限了?
e_dims在源头位置,假如不够用,后面的2个再高,总不能靠猜来生成吧?这样哪怕出的结果再清晰估计也是糊的。
回复 支持 反对

使用道具 举报

16

主题

128

帖子

850

积分

高级丹师

Rank: 5Rank: 5

积分
850
 楼主| 发表于 3 小时前 | 显示全部楼层
haha1632 发表于 2026-7-24 01:21
意思是同分辨率下,512-64-78(64X1.21)-32,这种4维就已经是极限了?
e_dims在源头位置,假如不够用,后面 ...

其实被压缩到瓶颈的时候,也就是拓展为inter张量的时候,特征已经被展平了,是没有空间信息。code的内容很简单:某个部位是什么动作什么角度什么颜色。解码器本身就是在极度抽象的语义里面靠硬猜解码出来的,并且DFL又不是只能换脸。
鞋子训练图.jpg
B站菜级玩家
回复 支持 反对

使用道具 举报

16

主题

128

帖子

850

积分

高级丹师

Rank: 5Rank: 5

积分
850
 楼主| 发表于 3 小时前 | 显示全部楼层
haha1632 发表于 2026-7-24 01:21
意思是同分辨率下,512-64-78(64X1.21)-32,这种4维就已经是极限了?
e_dims在源头位置,假如不够用,后面 ...

编码器即使是调成为16的大小,也不会影响解码器换脸。
256 和 512 的编码器大小无差别
ae dims提升到1024甚至2048也和512的没差别,瓶颈在解码器上
也就是说,编码器有总结特征的能力就行了,细节什么的,有很严格的位置关系,但是这种位置关系在进入inter的时候就已经被完全展平了,模型实际上根本不怎么记住细节。而GAN能出细节的原因就是惩罚解码器去猜哪里有细节而已
B站菜级玩家
回复 支持 反对

使用道具 举报

QQ|Archiver|手机版|deepfacelab中文网 |网站地图

GMT+8, 2026-7-24 04:45 , Processed in 0.151809 second(s), 33 queries .

Powered by Discuz! X3.4

Copyright © 2001-2020, Tencent Cloud.

快速回复 返回顶部 返回列表