🥣 碗 → 容易
线性回归、逻辑回归——全部凸。任何优化器都行。
🐎 鞍点 → SGD 卡住
高维空间里鞍点比局部最小还多。Adam 用二阶信息能脱困。
🏞️ 峡谷 → 来回震荡
深度学习常见。Momentum 沿谷底加速,SGD 来回震。
🏜️ 平台 → 梯度消失
深网络早期常遇。残差连接 + LR warmup 才能爬出。
🗻 多峰 → 局部最小陷阱
不同初始化收敛到不同解。SGD 的噪声有时反而是优势。
📊 真实 LLM?
高维 loss 大部分是鞍点 + 平台,几乎没有"全局最优"概念——只是"足够好"。