← 返回架构图
🌐

Distributed System

wan/distributed/fsdp.py · sequence_parallel.py · util.py
并行基础设施
采用双层并行策略:FSDP(Fully Sharded Data Parallel)对 T5/DiT 做参数分片以节省显存; Ulysses Sequence Parallel 将长序列 attention 分拆到多卡,线性降低注意力计算量。 8 GPU 配置下 ulysses_size=8,每卡处理 1/8 序列长度。
FSDP 分片策略
ShardingStrategyFULL_SHARD — 参数+梯度+优化器全分片
sync_module_statesT5 加载时设为 False 避免广播
MixedPrecisionbfloat16 参数 + float32 reduce
Ulysses SP 原理
all_gatherQKV 在序列维度 all_gather
local_attn每卡计算局部注意力
reduce_scatter输出在序列维度 reduce_scatter