跳转至

数学符号参考手册 —— 线性代数、微积分、集合、函数、概率统计速查

无论是阅读深度学习论文、复现经典算法,还是推导新的模型,数学符号都是绕不开的“第一道门槛”。然而,不同教材、不同论文的符号习惯往往各不相同,常常让人在 \mathbf{x}\boldsymbol{x}E[X]\mathbb{E}[X] 之间晕头转向。

本文整理了一份面向机器学习与深度学习的数学符号速查参考,涵盖集合、函数、线性代数、微积分、概率统计等常用领域。所有符号均采用 Obsidian 兼容的 MathJax 格式(毕竟Obsidian是我最喜欢的一款笔记软件),你可以直接复制到笔记中使用,无需额外配置。无论你是初学者还是需要快速查阅的老手,希望这份手册能成为你案头常备的“符号字典”。

数和数组

符号 含义
\(a\) 标量 (整数或实数)
\(e\) 欧拉数,数学常数,近似值为 2.71828
\(\pi\) 圆周率,数学常数,近似值为 3.14159
\(\infty\) 无穷大符号
\(1.234 \times 10^5\) 科学记数法,表示 123,400(也可写作 1.234E05)
\(<\) 小于号,例如 \(x < 10\) 表示 \(x\) 小于 10
\(\ll\) 远小于号
\(>\) 大于号,例如 \(x > 10\) 表示 \(x\) 大于 10
\(\gg\) 远大于号
\(\boldsymbol{a}\) 向量,或者 \(\mathbf{a}\) 这种数字斜体更明显
\(\mathbf{a} \cdot \mathbf{b}\) 向量 \(\mathbf{a}\)\(\mathbf{b}\) 的点积;若 \(\mathbf{a}, \mathbf{b}\)\(n \times 1\) 矩阵,也可写作 \(\mathbf{a}^T \mathbf{b}\)\(\mathbf{a} \cdot \mathbf{b} = \mathbf{a}^T \mathbf{b} = \sum_i a_i b_i = a_1 b_1 + a_2 b_2 + \dots + a_n b_n\)
\(\boldsymbol{A}\) 矩阵
\(\boldsymbol{A}_{m\times n}\) \(m \times n\) 矩阵
\(\boldsymbol{\mathsf{T}}\) 张量
\(\boldsymbol{I}_n\) \(n\)\(n\)列的单位矩阵
\(\boldsymbol{I}\) 维度蕴含于上下文的单位矩阵
\(\mathbf{0}\) 零矩阵
\(\boldsymbol{e}^{(i)}\) 标准基向量 \([0,\dots,0,1,0,\dots,0]\),其中索引 \(i\) 处值为 1
\(\text{diag}(\boldsymbol{a})\) 对角方阵,其中对角元素由 \(\boldsymbol{a}\) 给定
\(x_i\), \([\mathbf{x}]_i\) 向量\(\mathbf{x}\)\(i\)个元素
\(x_{ij}\), \([\mathbf{X}]_{ij}\) 矩阵\(\mathbf{X}\)\(i\)行第\(j\)列的元素
\(\mathsf{a}\) 标量随机变量
\(\boldsymbol{\mathsf{a}}\) 向量随机变量
\(\boldsymbol{\mathsf{A}}\) 矩阵随机变量
\(a_i\) 向量 \(\boldsymbol{a}\) 的第 \(i\) 个元素,其中索引从 1 开始
\(a_{-i}\) 除了第 \(i\) 个元素,\(\boldsymbol{a}\) 的所有元素
\(A_{i,j}\) 矩阵 \(\boldsymbol{A}\)\(i,j\) 元素
\(\boldsymbol{A}_{i, :}\) 矩阵 \(\boldsymbol{A}\) 的第 \(i\)
\(\boldsymbol{A}_{:, j}\) 矩阵 \(\boldsymbol{A}\) 的第 \(j\)
\((\boldsymbol{\mathsf{A}})_{i, j, k}\) 3维张量 \(\boldsymbol{\mathsf{A}}\)\((i, j, k)\) 元素
\(\boldsymbol{\mathsf{A}}_{:, :, i}\) 3维张量的 2 维切片
\(\mathsf{a}_i\) 随机向量 \(\boldsymbol{\mathsf{a}}\) 的第 \(i\) 个元素 - \(\mathsf{a}_i\):随机向量 \(\boldsymbol{\mathsf{a}}\) 的第 \(i\) 个元素
\(\mathbb{R}^n\) \(n\) 维实坐标空间,写作列向量 \(\mathbf{x} = \begin{bmatrix} x_1 \\ x_2 \\ \vdots \\ x_n \end{bmatrix}\)
\(\mathbf{x}^T\) \(n \times 1\) 矩阵(列向量)的转置,\(\mathbf{x}^T = \begin{bmatrix} x_1 & x_2 & \dots & x_n \end{bmatrix}\)
\(\| \mathbf{x} \|_p\) \(L^p\) 范数(向量 \(p\)-范数),\(\| \mathbf{x} \|_p = ({\vert x \vert}^p + \vert x_2 \vert^p + \dots + \vert x_n \vert^p)^{1/p}\)
\(\| \mathbf{x} \|_{\infty}\) \(L^{\infty}\) 范数(最大范数),即向量元素绝对值的最大值,\(\| \mathbf{x} \|_{\infty} = \max_i \vert x_i \vert\)
\(\| \mathbf{x} \|\) 向量范数,即 \(L^2\) 范数,\(\| \mathbf{x} \| = \| \mathbf{x} \|_2 = \sqrt{x_1^2 + x_2^2 + \dots + x_n^2}\)
\(\mathbf{A}^T\) 矩阵的转置,矩阵元素 \(\mathbf{A}_{i,j}\) 变为 \(\mathbf{A}^T_{j,i}\);例如 \(\begin{bmatrix} 1 & 2 \\ 3 & 4 \\ 5 & 6 \end{bmatrix}^T = \begin{bmatrix} 1 & 3 & 5 \\ 2 & 4 & 6 \end{bmatrix}\)
\(\mathbf{I}_n\) \(n \times n\) 单位矩阵,例如 \(\mathbf{I}_3 = \begin{bmatrix} 1 & 0 & 0 \\ 0 & 1 & 0 \\ 0 & 0 & 1 \end{bmatrix}\)
\(\mathbf{A}^{-1}\) 矩阵 \(\mathbf{A}\) 的逆矩阵,满足 \(\mathbf{A}\mathbf{A}^{-1} = \mathbf{A}^{-1}\mathbf{A} = \mathbf{I}\)
\(\operatorname{tr} \mathbf{A}\) 矩阵 \(\mathbf{A}\) 的迹(对角线元素之和),\(\operatorname{tr} \mathbf{A} = \sum_{i=1}^{n} \mathbf{A}_{i,i}\)
\(\det \mathbf{A}\) 矩阵 \(\mathbf{A}\) 的行列式
\(\operatorname{diag}(a_1, a_2, \dots, a_n)\) 对角矩阵,其对角元素为 \(a_1, a_2, \dots, a_n\),其余元素为零
\(\boldsymbol{A}^+\) \(\boldsymbol{A}\) 的 Moore‑Penrose 伪逆
\(\mathbf{A} \odot \mathbf{B}\) Hadamard 乘积(逐元素矩阵乘法)\(\boldsymbol{A}\)\(\boldsymbol{B}\) 的逐元素乘积(Hadamard 乘积)

集合和图

符号 含义
\(\mathcal{A}\) 集合
\(\mathbb{R}\) 实数集
\(\mathbb{Z}\) 整数集
\(\mathbb{N}\) 自然数集
\(\mathbb{N}^{+}\) 排除零的自然数集
\(\mathbb{R}^n\) \(n\)维实数向量集合
\(\mathbb{R}^{a\times b}\) 包含\(a\)行和\(b\)列的实数矩阵集合
\(\{0, 1\}\) 包含 0 和 1 的集合
\(\{0, 1, \dots, n \}\) 包含 \(0\)\(n\) 之间所有整数的集合
\([a, b]\) 包含 \(a\)\(b\) 的实数区间
\((a, b]\) 不包含 \(a\) 但包含 \(b\) 的实数区间
\(\in\) “属于”符号;例如 \(x\in A\) 表示“\(x\) 是集合 \(A\) 的元素”
\(\notin\) “不属于”符号
\(\emptyset\) 空集
\(\mathcal{A}\cup\mathcal{B}\) 集合\(\mathcal{A}\)\(\mathcal{B}\)的并集
\(\mathcal{A}\cap\mathcal{B}\) 集合\(\mathcal{A}\)\(\mathcal{B}\)的交集
\(\mathcal{A} \backslash \mathcal{B}\) 差集,即其元素包含于 \(\mathcal{A}\) 但不包含于 \(\mathcal{B}\)
\(A\subseteq B\) \(A\)\(B\) 的子集(即包含于 \(B\)
\(A\Delta B\) 集合 \(A\)\(B\) 的对称差
\(\mathcal{G}\)
\(Pa_\mathcal{G}(\mathsf{x}_i)\) \(\mathcal{G}\)\(\mathsf{x}_i\) 的父节点

微积分

符号 含义
\(\frac{dy}{dx}\) \(y\)关于\(x\)的导数,\(\frac{dy}{dy}\)是莱布尼茨记号,\(f'(x)\)是拉格朗日记号, \(d\),中文读作“滴”
\(\frac{\partial y}{\partial x}\) \(y\)关于\(x\)的偏导数
\(\nabla_{\mathbf{x}} y\) \(y\)关于\(\mathbf{x}\)的梯度
\(\nabla_{\boldsymbol{X}} y\) \(y\) 关于 \(\boldsymbol{X}\) 的矩阵导数
\(\nabla_{\boldsymbol{\mathsf{X}}} y\) \(y\) 关于 \(\boldsymbol{\mathsf{X}}\) 求导后的张量
\(\frac{\partial f}{\partial \boldsymbol{x}}\) \(f: \mathbb{R}^n \rightarrow \mathbb{R}^m\) 的雅可比矩阵 \(\boldsymbol{J} \in \mathbb{R}^{m\times n}\)
\(\nabla_{\boldsymbol{x}}^2 f(\boldsymbol{x})\)\(\boldsymbol{H}(f)(\boldsymbol{x})\) \(f\) 在点 \(\boldsymbol{x}\) 处的海森矩阵
\(\int f(x) dx\) \(f\) 的不定积分(\(F\) 的导数,其中 \(f:\mathbb{R}\to\mathbb{R}\)
\(\int_a^b f(x) dx\) \(f\) 在区间 \([a,b]\) 上的定积分(\(f:\mathbb{R}\to\mathbb{R}\)
\(\int f(\boldsymbol{x}) d\boldsymbol{x}\) \(\boldsymbol{x}\) 整个域上的定积分
\(\int_\mathcal{S} f(\boldsymbol{x}) d\boldsymbol{x}\) 集合 \(\mathcal{S}\) 上关于 \(\boldsymbol{x}\) 的定积分
\(\frac{\partial E}{\partial w_{j,k}}\)的数学含义是 保持其他所有权重(比如 \(w_{1,1}, w_{1,2}\) 等)一动不动,只看 \(w_{j,k}\) 这个权重发生微小变化时,误差 \(E\) 变了多少。\(\partial\)是偏微分符号,中文读作“偏”。
\(\lim_{x \to a} f(x)\) \(x\) 趋近于 \(a\)\(f(x)\) 的极限
\(\lim_{x \to a^-} f(x)\) \(x\) 从左侧趋近于 \(a\)\(f(x)\) 的极限
\(\lim_{x \to a^+} f(x)\) \(x\) 从右侧趋近于 \(a\)\(f(x)\) 的极限
\(\frac{df}{dx}\) \(f\) 的导数
\(\frac{d^n f}{dx^n}\) \(f\)\(n\) 阶导数
\(\frac{\partial f}{\partial x}\) 函数 \(f(x,y,\ldots)\) 关于标量变量 \(x\) 的偏导数
\(\nabla f\) 函数 \(f:\mathbb{R}^n \to \mathbb{R}\) 的梯度,\(\nabla f(x_1, x_2, \ldots, x_n) = \begin{bmatrix} \frac{\partial f}{\partial x_1} \\ \frac{\partial f}{\partial x_2} \\ \vdots \\ \frac{\partial f}{\partial x_n} \end{bmatrix}\)
\(\Delta f\) 函数 \(f:\mathbb{R}^n \to \mathbb{R}\) 的拉普拉斯算子,\(\Delta f = \sum_{i=1}^{n} \frac{\partial^2 f}{\partial x_i^2}\)
\(\mathbf{H} f\) 函数 \(f:\mathbb{R}^n \to \mathbb{R}\) 的海森矩阵,\(\mathbf{H} f = \begin{bmatrix} \frac{\partial^2 f}{\partial x_1^2} & \frac{\partial^2 f}{\partial x_1 \partial x_2} & \cdots & \frac{\partial^2 f}{\partial x_1 \partial x_n} \\ \frac{\partial^2 f}{\partial x_2 \partial x_1} & \frac{\partial^2 f}{\partial x_2^2} & \cdots & \frac{\partial^2 f}{\partial x_2 \partial x_n} \\ \vdots & \vdots & \ddots & \vdots \\ \frac{\partial^2 f}{\partial x_n \partial x_1} & \frac{\partial^2 f}{\partial x_n \partial x_2} & \cdots & \frac{\partial^2 f}{\partial x_n^2} \end{bmatrix}\)
\(\frac{\partial f_j}{\partial x_i}\) 分量函数 \(f_j\) 关于变量 \(x_i\) 的偏导数,其中 \(\mathbf{f}: \mathbb{R}^n \to \mathbb{R}^m\)
\(\mathbf{D} \mathbf{f}\) 函数 \(\mathbf{f}\) 的雅可比矩阵,\(\mathbf{D} \mathbf{f} = \begin{bmatrix} \frac{\partial f_1}{\partial x_1} & \cdots & \frac{\partial f_1}{\partial x_n} \\ \vdots & \ddots & \vdots \\ \frac{\partial f_m}{\partial x_1} & \cdots & \frac{\partial f_m}{\partial x_n} \end{bmatrix}\)

概率与统计

符号 含义
\(P(\mathsf{a})\) 离散变量上的概率分布
\(p(\mathsf{a})\) 连续变量(或变量类型未指定时)上的概率分布
\(z \sim P\) 随机变量\(z\)具有概率分布\(P\)
\(P(X \mid Y)\) \(X\mid Y\)的条件概率
\({E}_{x} [f(x)]\) 函数\(f\)\(x\)的数学期望。\(\mathbb{E}_{\mathsf{x}\sim P} [ f(x) ]\)\(\mathbb{E} f(x)\)\(f(x)\) 关于 \(P(\mathsf{x})\) 的期望
\(X \perp Y\) 随机变量\(X\)\(Y\)是独立的
\(X \perp Y \mid Z\) 随机变量\(X\)\(Y\)在给定随机变量\(Z\)的条件下是独立的
\(\mathrm{Var}(X)\) 随机变量\(X\)的方差。\(\mathrm{Var}(f(x))\)\(f(x)\) 在分布 \(P(\mathsf{x})\) 下的方差
\(\sigma_X\) 随机变量\(X\)的标准差
\(\mathrm{Cov}(X, Y)\) 随机变量\(X\)\(Y\)的协方差。\(\mathrm{Cov}(f(x),g(x))\)\(f(x)\)\(g(x)\) 在分布 \(P(\mathsf{x})\) 下的协方差
\(\rho(X, Y)\) 随机变量\(X\)\(Y\)的相关性
\(H(X)\) 随机变量\(X\)的香农熵
\(D_{\mathrm{KL}}(P\|Q)\) \(P\)\(Q\)的KL散度
\(\mathcal{N} ( \boldsymbol{x} ; \boldsymbol{\mu} , \boldsymbol{\Sigma})\) 均值为 \(\boldsymbol{\mu}\)、协方差为 \(\boldsymbol{\Sigma}\)\(\boldsymbol{x}\) 上的高斯分布
\(P(A \cap B)\) 事件 \(A\)\(B\) 同时发生的概率
\(P(A \cup B)\) 事件 \(A\)\(B\) 发生的概率
\(P(A \vert B)\) \(B\) 发生的条件下 \(A\) 发生的条件概率
\(E(X), \mu_X\) 随机变量 \(X\) 的期望值(均值)
\(E(X) = \sum_{i=1}^{\infty} p_i x_i\) 离散随机变量 \(X\)(取值为 \(x_1,x_2,\ldots\),概率为 \(p_1,p_2,\ldots\))的期望
\(E(X) = \int_{-\infty}^{\infty} x f(x) dx\) 连续随机变量(概率密度函数为 \(f(x)\))的期望
\(\bar{X}\) 数值数据 \(X_1,\ldots,X_n\) 的样本均值,\(\bar{X} = \frac{1}{n}\sum_{i=1}^{n} X_i\)
\(\operatorname{var}(X), \sigma_X^2\) 随机变量 \(X\) 的方差,\(\operatorname{var}(X) = E[(X-\mu_X)^2] = E(X^2) - [E(X)]^2\)
\(s_X^2\) 数值数据 \(X_1,\ldots,X_n\) 的样本方差,\(s_X^2 = \frac{1}{n}\sum_{i=1}^{n} (X_i - \bar{X})^2\)

函数和运算符

符号 含义
\(f: \mathcal{A} \rightarrow \mathcal{B}\) 定义域为 \(\mathcal{A}\)、值域为 \(\mathcal{B}\) 的函数 \(f\)
\(f \circ g(x)\) 函数 \(f\)\(g\) 的复合,另一个写法是 \(f[g(x)]\)
\(f(\boldsymbol{x} ; \boldsymbol{\theta})\) \(\boldsymbol{\theta}\) 参数化,关于 \(\boldsymbol{x}\) 的函数(有时简写为 \(f(\boldsymbol{x})\)
\(f(x)\) 函数
\(f^{-1}(x)\) 函数 \(f\) 的反函数,使得若 \(f(y)=x\),则 \(f^{-1}(x)=y\)
\(\log(x)\) 自然对数
\(\exp(x)\) 指数函数
\(\lvert x \rvert\) \(x\) 的绝对值;例如 \(\lvert -2 \rvert = 2\)
\(\log_b\) \(b\) 为底的对数
\(\sigma(x)\) Logistic sigmoid,\(\displaystyle \frac{1} {1 + \exp(-x)}\)
\(\zeta(x)\) Softplus,\(\log(1 + \exp(x))\)
\(\| \boldsymbol{x} \|_p\) \(\boldsymbol{x}\)\(L^p\) 范数
\(\| \boldsymbol{x} \|\) \(\boldsymbol{x}\)\(L^2\) 范数
\(x^+\) \(x\) 的正数部分,即 \(\max(0,x)\)
\(\mathbf{1}_{\text{condition}}\) 指示函数。如果条件为真则为 1,否则为 0
\(\mathbf{(\cdot)}^\top\) 向量或矩阵的转置
\(\mathbf{X}^{-1}\) 矩阵的逆
\(\odot\) 按元素相乘
\([\cdot, \cdot]\) 连结
\(\lvert \mathcal{X} \rvert\) 集合的基数(元素个数)
\(\langle \mathbf{x}, \mathbf{y} \rangle\) 向量\(\mathbf{x}\)\(\mathbf{y}\)的点积
\(\sum\) 连加
\(\prod\) 连乘,读作“派”(对应希腊字母 Π 的英文名称)
\(\stackrel{\mathrm{def}}{=}\) 定义
\(\mapsto\) 自变量到因变量的映射
\(n!\) \(n\) 的阶乘,其中 \(0! = 1\),且当 \(n>0\)\(n! = n(n-1)(n-2)\cdots 2\cdot 1\)
\(\binom{n}{k}\) 二项式系数(“\(n\)\(k\)”),\(\binom{n}{k} = \frac{n!}{k!(n-k)!}\)\(0 \le k \le n\)
\(\arg \max f(x)\) 使 \(f(x)\) 取得最大值的 \(x\)
\(\arg \min f(x)\) 使 \(f(x)\) 取得最小值的 \(x\)
\(\sum_{i=1}^{n} x_i\) 索引变量 \(x_i\) 的求和,定义为 \(\sum_{i=1}^{n} x_i = x_1 + x_2 + \dots + x_n\)
\(\prod_{i=1}^{n} x_i\) 索引变量 \(x_i\) 的求积,定义为 \(\prod_{i=1}^{n} x_i = x_1 \cdot x_2 \cdot \ldots \cdot x_n\)

数据集和分布

符号 含义
\(p_{\text{data}}\) 数据生成分布
\(\hat{p}_{\text{train}}\) 由训练集定义的经验分布
\(\mathcal{X}\) 训练样本的集合
\(\boldsymbol{x}^{(i)}\) 数据集的第 \(i\) 个样本(输入)
\(y^{(i)}\)\(\boldsymbol{y}^{(i)}\) 监督学习中与 \(\boldsymbol{x}^{(i)}\) 关联的目标
\(\boldsymbol{X}\) \(m \times n\) 的矩阵,其中行 \(\boldsymbol{X}_{i,:}\) 为输入样本 \(\boldsymbol{x}^{(i)}\) - \(\boldsymbol{X}\)\(m \times n\) 的矩阵,其中行 \(\boldsymbol{X}_{i,:}\) 为输入样本 \(\boldsymbol{x}^{(i)}\)

近似

符号 含义
\(\approx\) 近似相等,例如 \(e \approx 2.71828\) 是欧拉数的近似值
\(f(x) \sim g(x)\) 表示两个函数的比值趋近于 1:\(\lim_{x \to 0} \frac{f(x)}{g(x)} = 1\)(当 \(x\) 很小时),或 \(\lim_{x \to \infty} \frac{f(x)}{g(x)} = 1\)(当 \(x\) 很大时)
\(f(x) \propto g(x)\) 函数 \(f(x)\)\(g(x)\) 成正比
\(T(n) \in O(n^2)\) 大 O 记号,表示算法的时间复杂度渐近上界为 \(n^2\)(即算法具有 \(n^2\) 量级的时间复杂度)

逻辑

符号 含义
\(A \Rightarrow B\) 蕴含运算符;例如 “若 \(A\)\(B\)”(或 “\(B\) 仅当 \(A\)”)
\(A \Leftrightarrow B\) 等价运算符(当且仅当);例如 “\(A\) 当且仅当 \(B\)”,即 “若 \(A\)\(B\) 且若 \(B\)\(A\)
\(A \wedge B\) 逻辑合取(与);例如 “\(A\)\(B\)
\(A \vee B\) 逻辑(包含)析取(或);例如 “\(A\)\(B\)
\(\neg A\) 逻辑非(否定);例如 “非 \(A\)
\(\forall x \in \mathbb{R}, x > 1\) 全称量词(“对所有”);例如 “对所有实数 \(x\)\(x > 1\)
\(\exists x \in A, f(x)\) 存在量词(“存在”);例如 “集合 \(A\) 中存在某个元素使谓词 \(f(x)\) 成立”

常用希腊字母的读音

大写 小写 国际音标 注音 英文 中文注音
Α α /'æ,lfə/ alpha 阿尔法
Β β /'bi,tə/或/'beɪtə/ beta 贝塔
Γ γ /'gæ,mə/ gamma 伽马
Δ δ /'deltə/ delta 德尔塔
Ε ε /'epsɪlɒn/ epsilon 艾普斯龙
Ζ ζ /'zi,tə/ zeta 泽塔
Η η /'i,tə/ eta 艾塔
Θ θ /'θi,tə/ theta 西塔
Ι ι /'aɪəʊtə/ iota 约塔
Κ κ /'kæ,pə/ kappa 卡帕
λ /'læ,mdə/ lambda 兰姆达
Μ μ /mju,/ mu
Ν ν /nju,/ nu
Ξ ξ 希腊/ksi/ 或 英美/ˈzaɪ/或/ˈsaɪ/ xi 克西
Ο ο /əuˈmaikrən/ 或/ˈɑmɪˌkrɑn/ omicron 奥密克戎
π /paɪ/ pi
Ρ ρ /rəʊ/ rho
σ /'sɪɡmə/ sigma 斯格马
Τ τ /tɔ,/或/taʊ/ tau
Υ υ /ˈipsɪlon/或 /ˈʌpsɪlɒn/ upsilon 宇普斯龙
Φ φ /faɪ/ phi 法爱
Χ χ /kaɪ/ chi
Ψ ψ /psaɪ/ psi 普西
Ω ω /'əʊmɪɡə/ 或/oʊ'meɡə/ omega 欧米伽
Δ δ /'deltə/ delta 德尔塔
Π π /paɪ/ pi
Μ μ /mju,/ mu
Σ σ /'sɪɡmə/ sigma 斯格马

参考资料

评论