跳到主要内容

多元函数、偏导数与梯度

🌐 从一元推广到多元:方向导数描述"往哪走最快",梯度是函数值增长最陡的方向。

多元函数

定义

f:RnRf: \mathbb{R}^n \to \mathbb{R},将 nn 个输入映射为一个输出。

可视化:二元函数 f(x,y)f(x,y) 对应三维空间中的一张曲面。

极限与连续

多元极限要求从所有路径趋近时极限相同,比一元更严格。

lim(x,y)(a,b)f(x,y)=L\lim_{(x,y)\to(a,b)} f(x,y) = L


偏导数

定义

固定其他变量,对某一变量求导:

fx=limh0f(x+h,y)f(x,y)h\frac{\partial f}{\partial x} = \lim_{h\to 0} \frac{f(x+h, y) - f(x, y)}{h}

几何意义

fx\frac{\partial f}{\partial x}:沿 xx 轴方向切面的斜率。

高阶偏导数

2fxy=x(fy)\frac{\partial^2 f}{\partial x \partial y} = \frac{\partial}{\partial x}\left(\frac{\partial f}{\partial y}\right)

Clairaut 定理:若二阶混合偏导连续,则 2fxy=2fyx\frac{\partial^2 f}{\partial x \partial y} = \frac{\partial^2 f}{\partial y \partial x}


梯度

定义

f=(fx1, fx2, , fxn)\nabla f = \left(\frac{\partial f}{\partial x_1},\ \frac{\partial f}{\partial x_2},\ \ldots,\ \frac{\partial f}{\partial x_n}\right)

核心性质

  1. 梯度方向 = 函数值增长最快的方向
  2. 梯度大小 = 该方向上的变化率
  3. 梯度 ⊥ 等值线(二维)/ 等值面(三维)

方向导数

在单位向量 u^\hat{u} 方向上的变化率:

Du^f=fu^=fcosθD_{\hat{u}} f = \nabla f \cdot \hat{u} = |\nabla f| \cos\theta

θ=0\theta = 0(沿梯度方向)时取最大值 f|\nabla f|


全微分

定义

df=fxdx+fydydf = \frac{\partial f}{\partial x} dx + \frac{\partial f}{\partial y} dy

线性近似f(a+Δx,b+Δy)f(a,b)+dff(a+\Delta x, b+\Delta y) \approx f(a,b) + df

链式法则(多元)

z=f(x(t),y(t))z = f(x(t), y(t)),则:

dzdt=fxdxdt+fydydt\frac{dz}{dt} = \frac{\partial f}{\partial x}\cdot\frac{dx}{dt} + \frac{\partial f}{\partial y}\cdot\frac{dy}{dt}


极值与鞍点

必要条件

极值点处 f=0\nabla f = \mathbf{0}(驻点)。

Hessian 矩阵判别

H=(fxxfxyfxyfyy)H = \begin{pmatrix} f_{xx} & f_{xy} \\ f_{xy} & f_{yy} \end{pmatrix}

条件结论
detH>0\det H > 0fxx>0f_{xx} > 0极小值
detH>0\det H > 0fxx<0f_{xx} < 0极大值
detH<0\det H < 0鞍点
detH=0\det H = 0无法判断

梯度在机器学习中的应用

  • 梯度下降:沿 f-\nabla f 方向更新参数,最小化损失函数
  • 反向传播:链式法则的系统性应用
  • 梯度消失/爆炸:深层网络中梯度幂次累乘的问题

Manim 可视化思路

  • 梯度场动画:二维平面上显示 f\nabla f 向量场,叠加等高线
  • 梯度下降路径:在曲面上追踪最速下降轨迹
  • 偏导数切面:三维曲面沿 xxyy 方向切开的动画