RBDA:黎曼双层下降聚合
论文《Riemannian Bilevel Optimization with Gradient Aggregation》算法 1 的流程,右侧标注每个环节承担的卖点。
RBDA(算法 1):外层在 𝓜(实验中 Stiefel 流形)上沿超梯度更新,内层在 𝓝(实验中 SPD 流形)上跑聚合更新——前
K₁ 步用混合割线的 BB 步长,其余用常数比调度 pₖ,规则 (b) 允许提前停机;超梯度由整条内层轨迹的反向传播给出,
不出现 Hessian 或线性求解。虚线为数据流,实线为控制流。
记号
- x ∈ 𝓜,y ∈ 𝓝
- 上、下层变量;实验中 𝓜 = Stiefel(W),𝓝 = SPD(M),𝓝 要求 Hadamard(分析)
- f,F
- 下层与上层目标;φ(x) = F(x, y*(x)) 为值函数
- μ
- 聚合权重(实验:synthetic 0.1,nonlls 0.3,超清洗 0.5);μ=0 退化为普通下层更新
- pₖ = 1/(1+ρk)
- 常数比调度,上下两项共用同一乘子(ρ=0.01);diminishing 调度只是分析里的精确极限
- K,K₁,θ
- 内层预算、BB 阶段长度(实验取 K/2)、BB 步上限(黎曼路线 10,欧氏路线 1/L_E)
- s,η
- 内层基础步长与外层步长
- R,𝒢
- retraction(分析用指数映射)与黎曼梯度
- 规则 (b)
- 热启动协议的停机:阈值 = stop_rtol × 本次内层首步更新长度,每外层步重算