Optimizer 比較(SGD / Momentum / Adam)

細長い谷や鞍点を持つ損失曲面の上で、同じ初期位置から SGD・Momentum・Adam の3本の最適化軌跡を同時に走らせ、収束の速さ・振動・鞍点脱出の差を見ます。等高線上をボールが転がります。

0.060
0.90

キャンバスをクリックするか、出発点マーカーをドラッグすると出発点を変更できます。

SGD Momentum Adam 最小点
ステップ数
SGD 損失 L
Momentum 損失 L
Adam 損失 L
損失 L の推移(縦=損失・対数感覚 / 横=ステップ)
等高線とパラメータ空間の軌跡(θ₁ × θ₂)
ニューラルネットの学習は、損失 L(θ) を小さくするように勾配 g = ∇L を使ってパラメータ θ を少しずつ更新する最適化です。
一番素朴な SGDθ ← θ − η·gMomentum は過去の更新を慣性として足し込み谷で加速します。Adam は勾配の1次・2次モーメントから方向ごとに学習率を自動調整します。
細長い谷ではSGDが谷壁で振動しがち、鞍点では勾配がほぼ0になり停滞しがちです。同じ初期点から3本を走らせ、速さ・振動・鞍点脱出の違いを見比べましょう。

いま何が起きている?

ここがポイント