这些曲线将线性代数转化为智能。
没有激活函数,深度网络就只是一个巨大的矩阵乘法。
σ(x)=1/(1+e⁻ˣ) 压缩到 (0,1);tanh(x) 以零为中心;ReLU=max(0,x) 将负值归零;Leaky ReLU、ELU 和 Maxout 保持温和的斜率,因此梯度永不消亡。
它们是神经网络能够识别面部、编写代码和驾驶汽车的原因。
最简单的非线性往往能开启最深刻的训练。
当一个新模型拒绝训练时,你会首先选择哪一个?@mathemetica
没有激活函数,深度网络就只是一个巨大的矩阵乘法。
σ(x)=1/(1+e⁻ˣ) 压缩到 (0,1);tanh(x) 以零为中心;ReLU=max(0,x) 将负值归零;Leaky ReLU、ELU 和 Maxout 保持温和的斜率,因此梯度永不消亡。
它们是神经网络能够识别面部、编写代码和驾驶汽车的原因。
最简单的非线性往往能开启最深刻的训练。
当一个新模型拒绝训练时,你会首先选择哪一个?@mathemetica
回复
还没有回复,来说点什么吧