这些曲线将线性代数转化为智能。

没有激活函数,深度网络就只是一个巨大的矩阵乘法。

σ(x)=1/(1+e⁻ˣ) 压缩到 (0,1);tanh(x) 以零为中心;ReLU=max(0,x) 将负值归零;Leaky ReLU、ELU 和 Maxout 保持温和的斜率,因此梯度永不消亡。
它们是神经网络能够识别面部、编写代码和驾驶汽车的原因。

最简单的非线性往往能开启最深刻的训练。
当一个新模型拒绝训练时,你会首先选择哪一个?@mathemetica
易酷
2026年8月21日 16:16 · 来自 yicool · 44 次查看
登录后参与讨论

回复

还没有回复,来说点什么吧