机器学习中常用函数的导数推导
本文将从最基础的初等函数出发,一路推导到 Transformer 核心组件 Attention 和残差网络的反向传播,力求做到每一步清晰可循,每一个结果都有工程注解。
基础初等函数
幂函数
\[f(x) = x^n \quad \Rightarrow \quad f'(x) = nx^{n-1}\]
证明(导数定义):
\[
\begin{aligned}
f'(x) &= \lim_{h\to 0}\frac{(x+h)^n - x^n}{h} \\
&= \lim_{h\to 0}\frac{x^n + nx^{n-1}h + \frac{n(n-1)}{2}x^{n-2}h^2 + \cdots + h^n - x^n}{h} \\
&= \lim_{h\to 0}\left(nx^{n-1} + \frac{n(n-1)}{2}x^{n-2}h + \cdots + h^{n-1}\right) \\
&= nx^{n-1}
\end{aligned}
\]
二项式展开中,除第一项外所有项都至少含一个因子 \(h\),因此极限后全部消失。当 \(n\) 为任意实数时,需用对数微分法证明,但结论相同。
工程意义
权重衰减(\(L_2\) 正则化)的梯度 \(\frac{\partial}{\partial w}(\frac{\lambda}{2}w^2)=\lambda w\) 就来源于此。