arXiv Artificial Intelligence

Scaling Muon for Diffusion Transformers

Scaling Muon for Diffusion Transformers

Quick summary

arXiv:2608.20818v3 Announce Type: replace-cross Abstract: The matrix-aware optimizer Muon improves large model training by balancing updates across singular directions, yet its scaling behavior and end-to-end efficiency on large Diffusion Transformers (DiTs) remain unclear. We first establish Muon's scaling behavior on DiTs from 1.3B to 15B parameters, showing that its optimization and generative quality advantages over AdamW persist across model scales. However, at scale, the 5-step Newton--Schulz iteration (NS5) performed at every optimization step, together with full-momentum materializatio

Key takeaways

  • arXiv:2608.20818v3 Announce Type: replace-cross Abstract: The matrix-aware optimizer Muon improves large model training by balancing updates across singular directions, yet its scaling behavior and end-to-end efficiency on large Diffusion Transformers (DiTs) remain unclear.
  • We first establish Muon's scaling behavior on DiTs from 1.3B to 15B parameters, showing that its optimization and generative quality advantages over AdamW persist across model scales.
  • However, at scale, the 5-step Newton--Schulz iteration (NS5) performed at every optimization step, together with full-momentum materializatio

Why it matters

“Scaling Muon for Diffusion Transformers” should be evaluated beyond branding and benchmark scores. Its practical importance will emerge in task accuracy, latency, unit cost, safety and integration with real workflows.

Kaynak sitede devamını oku: arXiv Artificial Intelligence ↗