deepfacelab中文网

 找回密码
 立即注册(仅限QQ邮箱)
查看: 40|回复: 2

为什么没人把DFL的稠密卷积换成深度可分离卷积

[复制链接]

18

主题

173

帖子

1272

积分

初级丹圣

Rank: 8Rank: 8

积分
1272
 楼主| 发表于 昨天 22:05 | 显示全部楼层 |阅读模式
星级打分
  • 1
  • 2
  • 3
  • 4
  • 5
平均分:NAN  参与人数:0  我的评分:未评
本帖最后由 caiji132156 于 2026-9-13 22:32 编辑

质量下降0.1~3个百分点

推理、训练速度翻倍
例如res=256, ae=256, e=64, d=128, dm=32,df-ud
把编码器和解码器里所有的稠密 5×5 / 3×3 卷积换成深度可分离卷积(DW5×5 + PW1×1),参数量从 276,846,046 降到 179,239,854(−35.3%),训练速度约 2 倍
而推理速度,这里我导出为onnx通用算子,也就是dfm
在5070 laptop上面
稠密5*5CNN:20.87ms
深度可分离5*5:10.71ms
推理快了1.95×
如果加上bf16推理则是又快了2.53x,4.23ms
总体快了4.93x
这个思路可以用在DF、LIAE、AMP、MVE、MULAN
解码器越深,同参数提升越明显,质量下降基本上等于fp32切换到bf16的质量下降

image.png
B站菜级玩家
回复

使用道具 举报

18

主题

173

帖子

1272

积分

初级丹圣

Rank: 8Rank: 8

积分
1272
 楼主| 发表于 昨天 22:07 | 显示全部楼层
本帖最后由 caiji132156 于 2026-9-13 22:49 编辑

已更新到,此模型架构更适合移动端推理:
https://github.com/CaijiPlayer258/DeepFaceLab-PyTorch
B站菜级玩家
回复 支持 反对

使用道具 举报

9

主题

79

帖子

9145

积分

高级丹圣

Rank: 13Rank: 13Rank: 13Rank: 13

积分
9145
发表于 昨天 22:32 | 显示全部楼层
回复 支持 反对

使用道具 举报

QQ|Archiver|手机版|deepfacelab中文网 |网站地图

GMT+8, 2026-9-14 00:33 , Processed in 0.096268 second(s), 32 queries .

Powered by Discuz! X3.4

Copyright © 2001-2020, Tencent Cloud.

快速回复 返回顶部 返回列表