deepfacelab中文网

 找回密码
 立即注册(仅限QQ邮箱)
查看: 125|回复: 2

关于为什么Lr_dropout没有用 by B站菜级玩家

[复制链接]

42

主题

261

帖子

2048

积分

初级丹圣

Rank: 8Rank: 8

积分
2048
 楼主| 发表于 昨天 18:35 | 显示全部楼层 |阅读模式
星级打分
  • 1
  • 2
  • 3
  • 4
  • 5
平均分:NAN  参与人数:0  我的评分:未评
本帖最后由 day270010678 于 2026-9-3 18:48 编辑

https://dfldata.cc/forum.php?mod ... 1429&extra=page%3D1

屏幕截图 2026-09-03 182714.png

src 162 张 + dst 2069 张) 走项目 SAEHD 模型 / 损失 / 优化器代码从零训练 800 步(ae128/e48/d48、128res、AdaBelief 5e-5、同一初始化与数据序列)
他这个观点基本是准确的,

1、"lr_dropout 本身没用" → 数据支持。控制变量 C vs D(同 lr 恒定,只差 dropout):Δ=0.05,几乎零影响。固定 mask 既不帮也不拖累。
2、"真正起作用 / 拖累的是 lr 调度" → 数据支持,且更激进。B vs C(同 dropout,只差 wave):Δ=1.79,余弦震荡才是最大的拖累源。它把有效 lr 减半、每 500 步归零一次,800 步内模型根本没好好收敛。
3、"退火优于震荡" → 本实验部分支持。A(退火)2.33 显著优于 B(震荡)3.97;但 A 与 D(恒定)几乎无差,说明在短训练里退火和恒定没区别 ——真正拖累的是震荡本身,不是 "没退火"。


但是dropout 在恒定 lr 下几乎无影响,不是 "纯负收益"。
SAEHD 的 y 模式(dropout+wave 绑定)才是问题点:若从零训练,建议 lr_dropout=n(去掉 wave),或保留 y 但理解其 wave 会拖慢短期收敛(超长训练中震荡才有跳出局部最优的意义)。简单点说就是假如你开启了优化器,就不要开这个学习率了。不开更好


重点说明“上面的逻辑是建立在训练就开学习率的情况”,而实际上是都是分阶段训练的,所以究竟开不开学习率自己决定,我也没测试,但是我的观点还是假如开启了优化器就不要再开学习率了,一刀切。
回复

使用道具 举报

8

主题

87

帖子

1112

积分

初级丹圣

Rank: 8Rank: 8

积分
1112
发表于 昨天 19:45 | 显示全部楼层
所以固定 5e-5 一直跑吗,还是看 loss 手动调?
回复 支持 反对

使用道具 举报

17

主题

170

帖子

1221

积分

初级丹圣

Rank: 8Rank: 8

积分
1221
发表于 昨天 23:18 | 显示全部楼层
ulu 发表于 2026-9-3 19:45
所以固定 5e-5 一直跑吗,还是看 loss 手动调?

5e-5是iperov自己试出来的一个稳定值,ud后缀的模型收敛好
B站菜级玩家
回复 支持 反对

使用道具 举报

QQ|Archiver|手机版|deepfacelab中文网 |网站地图

GMT+8, 2026-9-4 17:49 , Processed in 0.092768 second(s), 33 queries .

Powered by Discuz! X3.4

Copyright © 2001-2020, Tencent Cloud.

快速回复 返回顶部 返回列表