每年期末前一个月,总有学生抱着概率论课本找我,开口第一句就是“联合概率密度那道大题,我完全不知道从哪下手”。其实这很正常——联合概率密度不像一维随机变量那样套一个公式就能算,它把二重积分、积分区域、边缘化、条件概率、独立性判断全串在一起,哪一环断了,整道题就从第一行开始崩。坦白讲,我自己当年备考时也在联合密度上栽过跟头,后来把“定义—区域—积分”这条线理顺,才真正把这类题吃透。这篇内容想用期末备考的视角,把联合概率密度从定义到进阶题型的完整逻辑拆开讲一遍,覆盖求常数、边缘密度、条件密度、独立性判断、卷积和极值分布这些高频考点,适合正在复习概率论期末、对二维随机变量还不太有把握的同学,也适合想从原理层面搞懂卷积公式和 max/min 分布的人。
1. 为什么联合概率密度是期末卷里的分水岭
1.1 一张卷子里它动不动就是个15分大题
概率论与数理统计期末卷的大题结构往往很固定:前面几道是随机事件概率、一维随机变量分布,中间或压轴的位置大概率放一道二维随机变量的综合题,题干通常只给你一个联合密度表达式,然后一口气让你求待定常数、边缘密度、条件密度、判断独立性,有时候再加一问求某个事件的概率或 Z=X+Y 的分布。
这道题的分值一般在 10 到 20 分之间。因为它的考试目标不是“记不记得住公式”,而是“能不能把二维随机变量的结构完整地理清楚”。你想想,一道题同时涉及二重积分归一化、变上限积分、累次积分换序、条件密度定义域判断、独立性验证,如果前面某个概念理解不到位,后面就是连锁反应。所以它天然具备很高的区分度——学得扎实的同学能拿满分,靠考前突击背公式的同学常常在这里丢掉整道大题。很多老师喜欢把这题放在后半部分,也有一部分原因是想借此拉开分数差距。
从复习策略上看,联合概率密度是性价比极高的一块投入。考上概率论,单个知识点里很少有这么强的“串联性”。把这道题搞定,你等于同时复习了二重积分、分布函数、边缘分布、条件分布和随机变量函数的分布,等于用一道题的精力买断了整张试卷近三分之一的大题考点。
1.2 学不好联合密度,后面期望、协方差全跟着塌方
很多同学以为联合密度只是单独一章,跟后面的数字特征没什么关系,这是个很大的误解。二维随机变量的期望、方差、协方差和相关系数,全部要落到联合密度的计算上。协方差的定义是 Cov(X,Y) = E{[X − E(X)][Y − E(Y)]},也可以用 E(XY) − E(X)E(Y) 来算,而 E(XY) = ∫∫ xy f(x,y) dxdy,这个二重积分绕不开联合密度。
更麻烦的是,条件期望也依赖条件密度。有些学校在期末试卷里会出“求给定 X=x 时 Y 的条件期望 E(Y|X=x)”这种题,你不会算条件密度,这道题就直接没戏。包括后面数理统计里的极大似然估计,联合似然函数本质上就是 n 个样本的联合密度的乘积。所以说联合密度不是孤立考点,它是整门课的“基础设施”。
如果现在复习时间有限,我的建议是把联合密度这块放在最高优先级。它不像大数定律和中心极限定理那样偏向记忆和辨析,它更偏向计算和理解,短期内通过大量刷题提分的效果非常明显。你要做的第一件事,就是把二维分布函数和联合密度的定义彻底搞懂,而不是先急着背卷积公式。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 二维分布函数到联合密度:把定义吃透了,比背公式管用十倍
2.1 联合分布函数到底在算什么
二维连续型随机变量 (X,Y) 的联合分布函数定义为 F(x,y) = P(X ≤ x, Y ≤ y),几何意义是以点 (x,y) 为右上角、向左下无限延伸的矩形区域内的概率质量。如果联合密度存在,那么
F(x,y) = ∫{−∞}^{x} ∫^{y} f(u,v) dv du
这个定义看起来简单,但很多同学只背公式,不理解它意味着什么,所以一遇到“求分布函数表达式”就手忙脚乱。
联合分布函数要满足几个性质,期末经常会出选择或填空:
- 对 x 和 y 分别单调不减;
- 对 x 和 y 分别右连续;
- 0 ≤ F(x,y) ≤ 1;
- F(−∞, y) = 0,F(x, −∞) = 0,F(−∞, −∞) = 0,F(+∞, +∞) = 1;
- 对任意 a₁ ≤ a₂,b₁ ≤ b₂,有 F(a₂,b₂) − F(a₂,b₁) − F(a₁,b₂) + F(a₁,b₁) ≥ 0。
最后一个性质其实对应矩形概率的非负性:P(a₁ ≤ X ≤ a₂, b₁ ≤ Y ≤ b₂) = F(a₂,b₂) − F(a₂,b₁) − F(a₁,b₂) + F(a₁,b₁) ≥ 0。有些同学只记得前四个性质,其实这个矩形公式在判断题里经常出现,而且它也是从分布函数反推概率的钥匙。
如果你对分布函数的意义还模糊,可以想象你手里有一张地毯,总面积是一,F(x,y) 表示你从左上角开始铺地毯,铺到点 (x,y) 这里已经覆盖了多少面积。铺的面积从 0 慢慢涨到 1,这就是分布函数在二维上的直观画面。
2.2 密度函数的合法性检查:很多同学第一步就栽了
联合概率密度函数 f(x,y) 的合法性只有两个条件:
- f(x,y) ≥ 0,在它的定义域内非负;
- 在整个二维平面上的二重积分等于 1,即 ∫∫ f(x,y) dxdy = 1。
期末最简单也最常考的一问,就是给你一个带未知常数 c 的联合密度,让你把 c 求出来。做法是用第二个条件:把含 c 的表达式代进去,算全平面积分,令结果等于 1,解出 c。大多数情况下积分在非零区域做就可以,因为 f 在零区域没有贡献。
最容易出错的地方有两个。第一,积分区域看漏了。有些题给的密度只在一个很奇怪的区域非零,比如三角形或圆形,很多同学想当然地按矩形区域积分,或者干脆忘了乘区域指示,结果常数求错,后面全错。第二,把原点处的边界看得太重。积分是对区域面积的积分,边界线的面积是 0,所以 f(x,y)=... 里写 < 和 ≤ 不影响概率,不用纠结这个细节。比如 0<x<1 和 0≤x≤1 得到的概率相同。
提示:判断一个函数能不能作为联合密度,先看非负,再看归一化。两个条件缺一不可。有些题会故意给出一个在全平面上积分为 1 但在某些区域小于 0 的函数,它照样不是联合密度。
2.3 算概率的本质是二重积分切“曲面下的体积”
对于二维连续型随机变量,落在区域 D 内的概率是
P((X,Y) ∈ D) = ∬_D f(x,y) dxdy
一维时概率是曲线下的面积,二维时就是曲面下的体积。很多人不理解为什么二维概率要用二重积分,我常用一个类比:把总概率 1 想象成一块总质量为 1 的橡皮泥,它在不同位置的“厚薄”由联合密度 f(x,y) 描述,那么落在某个区域 D 内的概率,就是你把这块橡皮泥中恰好位于 D 里的那一块切下来称重,看它占总质量的多少。
期末卷子里常见的概率问题有 P(X < Y)、P(X + Y ≤ 1)、P(X ≤ a, Y ≤ b) 等。拿到这种题,第一件事不是套公式,而是画图:把联合密度的非零区域画出来,再把事件对应的区域画出来,二者的交集才是真正的积分区域。这一步做好了,后面的积分限才不会错。
我见过太多学生把“非零区域”和“事件区域”搞混,直接在联合密度的非零区域上积整个事件区域,或者在矩形区域上积分而忽略了密度本身只在某一部分非零。画图这个习惯看起来笨,但真的能救回大分。
3. 边缘密度、条件密度、独立性:考试最密的三个考点
3.1 边缘密度:把另一个变量“压扁”丢掉
边缘密度的思路其实很简单:不管 Y 取什么值,只看 X 的分布。公式是
f_X(x) = ∫_{−∞}^{+∞} f(x,y) dy
从分布函数的角度理解,F_X(x) = F(x, +∞) = ∫{−∞}^{x} [∫^{+∞} f(u,v) dv] du,求导就得到上面的式子。所以计算边缘密度时,把联合密度对另一个变量做无穷积分即可。
注意两个细节。第一,积分限要跟着联合密度的非零区域走,不是永远从 −∞ 到 +∞,而是要看该区域内 y 的实际取值范围。第二,算出来的边缘密度必须是一个只含 x 的函数,如果结果里还有 y,说明你积分没积干净。
以单位圆上的二维均匀分布为例:区域 x² + y² ≤ 1,密度 f(x,y) = 1/π。求边缘密度时固定 x,y 的上下限是 ±√(1−x²),于是 f_X(x) = ∫_{−√(1−x²)}^{√(1−x²)} (1/π) dy = 2√(1−x²)/π,其中 −1 ≤ x ≤ 1。这个结果不是均匀分布,而是中间高两边低,因为圆的中心在 x 轴上的投影会“堆”更多质量。这个例子可以帮你建立直觉:边缘密度不是把联合密度在 y 方向平均,而是把不同 y 处的概率全部累加过来,累加的结果可能改变形状。
3.2 条件密度:知道 X=x 后再猜 Y 的分布
条件密度公式是
f_{Y|X}(y|x) = f(x,y) / f_X(x),其中 f_X(x) > 0
直觉上可以这么看:你先固定 X=x,相当于在联合密度曲面 y 方向上切一刀,得到一个截面;但截面下方的面积不一定是 1,所以要除以 f_X(x),让它在 y 方向上的积分等于 1。这就是“归一化”的过程。
这里有个最常见的错误:很多同学把条件密度写成 f(x,y),忘了除以边缘密度,于是条件密度在 y 方向上的积分不是 1,整个条件概率就全错了。你算完条件密度后可以用 ∫ f_{Y|X}(y|x) dy = 1 来检验,如果不等于 1,肯定是忘了归一化。
条件概率的计算也要用到条件密度:P(a ≤ Y ≤ b | X = x) = ∫a^b f(y|x) dy。这里要注意的是,在连续型随机变量里,给定 X=x 这个事件的概率本身是 0,所以不能用普通的条件概率公式 P(A|B)=P(AB)/P(B) 去理解,而要把它理解成条件密度下的极限与积分。考试时你不需要写那么深的概念,但你要知道为什么条件密度能直接用。
3.3 独立性判断:先看定义域,再看乘积能否分离
二维连续型随机变量 X 与 Y 独立的充要条件是
F(x,y) = F_X(x) F_Y(y),或等价地 f(x,y) = f_X(x) f_Y(y)
在实际做题时,有一个快速判断的流程:
- 先看联合密度的定义域是不是矩形区域。所谓矩形区域,就是一个形如 a ≤ x ≤ b, c ≤ y ≤ d 的“正方形/矩形”区域,或者 x > a, y > b 这样的无限矩形。如果定义域本身带有约束关系,比如 0 ≤ x ≤ y ≤ 1,那么几乎可以立刻判定不独立,因为即使函数能分离成 g(x)h(y),定义域也不能分离成两个独立区间的乘积。
- 再看联合密度是否能写成 g(x) h(y) 的形式。如果定义域是矩形区域,且 f(x,y) 能分离成只含 x 的函数乘只含 y 的函数,那么独立。
这里要特别提防一个陷阱:f(x,y) = 2, 0 ≤ x ≤ y ≤ 1。这个密度是常数 2,当然能分离成 g(x)h(y)=1×2 这种形式,但定义域是三角形区域,不独立。很多同学只看到“常数”就写“独立”,大错特错。
反过来,如果定义域是矩形且函数不能分离成 g(x)h(y),那也不独立。比如 f(x,y) = x + y,0<x<1, 0<y<1,这个密度函数本身不能写成两个单变量函数的乘积,所以不独立。
3.4 一个练手范例:从 f=8xy 走完整套流程
我们来完整做一道非常经典的题目,它涵盖了边缘密度、条件密度和独立性判断,值得在考前自己默写一遍。
设 (X,Y) 的联合密度为
f(x,y) = 8xy,0 ≤ x ≤ y ≤ 1,其他区域为 0
先验证它是否归一化:
∫₀¹ ∫₀^y 8xy dx dy = ∫₀¹ [4x²y]_{0}^{y} dy = ∫₀¹ 4y³ dy = 1
求边缘密度。固定 x 时,因为 0 ≤ x ≤ y ≤ 1,所以 y 的取值范围是 [x, 1]:
f_X(x) = ∫_x¹ 8xy dy = 4x(1 − x²),0 ≤ x ≤ 1
固定 y 时,x 的取值范围是 [0, y]:
f_Y(y) = ∫_0^y 8xy dx = 4y³,0 ≤ y ≤ 1
再求条件密度。在 f_X(x) > 0 的范围内,即 0 < x < 1:
f_{Y|X}(y|x) = 8xy / [4x(1 − x²)] = 2y / (1 − x²),x ≤ y ≤ 1
在 f_Y(y) > 0 的范围内,即 0 < y < 1:
f_{X|Y}(x|y) = 8xy / (4y³) = 2x / y²,0 ≤ x ≤ y
判断独立性:f_X(x) f_Y(y) = 4x(1 − x²) · 4y³ = 16x y³ (1 − x²),它不等于 f(x,y) = 8xy,而且定义域也不是矩形区域,所以 X 与 Y 不独立。
这道题如果你能完全不看答案、每一步都清楚地写出为什么这样积分,说明这块已经掌握得差不多了。
4. 联合密度下的函数分布:卷积与极值,压轴题的两种套路
4.1 Z=X+Y 的卷积公式,以及积分限怎么定
联合密度最常见的进阶考法是求 Z = X + Y 的密度。分布函数法是最稳妥的思路:先求 F_Z(z) = P(X+Y ≤ z),再对 z 求导得到 f_Z(z)。
F_Z(z) = ∬_{x+y ≤ z} f(x,y) dxdy
对固定的 z,先对 y 积分,y 的上限是 z − x:
F_Z(z) = ∫{−∞}^{+∞} ∫^{z−x} f(x,y) dy dx
对 z 求导后得到:
f_Z(z) = ∫_{−∞}^{+∞} f(x, z−x) dx
当 X 与 Y 独立时,联合密度等于边缘密度乘积,于是:
f_Z(z) = ∫_{−∞}^{+∞} f_X(x) f_Y(z−x) dx
这就是卷积公式。看起来简单,但考试里真正的难点是积分的上下限,也就是 x 的取值范围。你要同时满足两个条件:x 在 f_X(x) 的非零范围内,且 z−x 在 f_Y(y) 的非零范围内。实际做题时,先在数轴上把这两个范围画出来,再取交集。
举个例子:X 和 Y 独立且都服从 U(0,1),即 f_X(x)=1, 0<x<1,f_Y(y)=1, 0<y<1。那么
f_Z(z) = ∫ f_X(x) f_Y(z−x) dx
约束条件是 0<x<1,且 0<z−x<1,即 z−1<x<z。
当 0<z<1 时,x 的范围是 (0,z),所以 f_Z(z) = z;当 1≤z<2 时,x 的范围是 (z−1,1),所以 f_Z(z) = 2−z。这就是经典的三角分布。如果你画一个 (x,y) 平面上的正方形,事件 x+y≤z 的面积分别随 z 线性增加和线性减少,也能直观理解这个结果。
4.2 max(X,Y) 和 min(X,Y) 的分布:先分布函数后求导
极值分布是另一类高频压轴题。求 M = max(X,Y) 和 T = min(X,Y) 时,思路都是先求分布函数,再求导。
对于最大值:
F_M(z) = P(max(X,Y) ≤ z) = P(X ≤ z, Y ≤ z)
如果 X、Y 独立,则:
F_M(z) = F_X(z) · F_Y(z)
对于最小值,用对立事件:
F_T(z) = P(min(X,Y) ≤ z) = 1 − P(min(X,Y) > z) = 1 − P(X > z, Y > z)
独立时:
F_T(z) = 1 − [1 − F_X(z)][1 − F_Y(z)]
很多同学容易把 max 和 min 的公式记混。记住一个直觉:max 要同时小于等于 z,所以两个变量都得落在 (−∞, z] 里,用分布函数相乘;min 要至少一个小于等于 z,所以直接用“1 − 两个都大于 z”。这样记就不太容易错。
带着直觉做一个具体题:X、Y 独立且都服从参数 λ=1 的指数分布,F(t) = 1 − e^{−t},t>0。
M = max(X,Y) 的分布函数:
F_M(z) = (1 − e^{−z})²,z>0
求导:
f_M(z) = 2e^{−z} − 2e^{−2z},z>0
T = min(X,Y) 的分布函数:
F_T(z) = 1 − e^{−2z},z>0
这说明 min(X,Y) 服从参数 λ=2 的指数分布,也就是指数分布的最小值仍然是指数分布。这在工程里很有意义:多个并联元件的寿命是最大值,多个串联元件的寿命是最小值。
4.3 进阶提示:雅可比变换与二维变量变换框架
很多教材在二维随机变量函数分布这一节还会讲一个更一般的方法,叫雅可比变换。如果做变换 U = g(X,Y),V = h(X,Y),逆变换为 X = x(U,V),Y = y(U,V),当逆变换可微且雅可比行列式不为零时,联合密度满足
f_{U,V}(u,v) = f_{X,Y}(x(u,v), y(u,v)) · |det J|
其中 J 是逆变换的雅可比行列式,即
|det J| = | ∂(x,y) / ∂(u,v) |
有的学校期末不直接考雅可比,但如果你会这个方法,前面这些卷积、极值都可以看成它的特例,而且遇到求 Z = XY、Z = X/Y 这类题时会从容很多。我的建议是,如果你的学校把“二维随机变量函数的分布”列为考点,那雅可比最好掌握;如果只是考 Z=X+Y 和 max/min,那先把卷积和极值练熟,有时间再看雅可比。
不过无论用哪种方法,最关键的能力还是判断支持区域。很多同学公式背得滚瓜烂熟,一到“新的随机变量定义域怎么由旧的定义域推出来”就懵了。这个只能靠画图和做题来练,没有任何捷径。
5. 期末真题拆解:4道题带你走完高频题型
5.1 题1:求待定常数与边缘密度
题目:设 (X,Y) 的联合密度为 f(x,y) = c x² y,0 < x < 1,0 < y < 2,其他为 0。求常数 c,并求边缘密度 f_X(x)、f_Y(y),判断 X 与 Y 是否独立。
先求 c。因为 0<x<1、0<y<2 是矩形区域,所以二重积分可以拆成两个定积分的乘积:
∫₀¹ ∫₀² c x² y dy dx = c [∫₀¹ x² dx] [∫₀² y dy] = c · (1/3) · 2 = 2c/3
令它等于 1,得 c = 3/2。
再算边缘密度:
f_X(x) = ∫₀² (3/2)x² y dy = (3/2)x² · 2 = 3x²,0 < x < 1
f_Y(y) = ∫₀¹ (3/2)x² y dx = (3/2)y · (1/3) = y/2,0 < y < 2
判断独立性:f_X(x) f_Y(y) = 3x² · (y/2) = (3/2)x² y,恰好等于联合密度 f(x,y)。同时定义域 0<x<1, 0<y<2 是矩形区域,所以 X 与 Y 独立。
这道题想强调一个细节:在矩形区域上,联合密度能分离成只含 x 的式子乘只含 y 的式子时,边缘密度的乘积会神奇地回到联合密度本身。很多同学考试时算完边缘密度忘了验证,其实这里验证非常快,而且是防止粗心的好习惯。
5.2 题2:三角形区域上的条件概率
题目:设 f(x,y) = 2,0 < y < x < 1,求 P(Y < 1/2 | X = 1/2)。
先求 f_X(x)。固定 x 时,y 的范围是 (0,x),所以
f_X(x) = ∫₀^x 2 dy = 2x,0 < x < 1
于是条件密度为:
f_{Y|X}(y|x) = 2 / (2x) = 1/x,0 < y < x
当 x = 1/2 时,y 的范围是 0 < y < 1/2,所以
f_{Y|X}(y|1/2) = 2,0 < y < 1/2
那么 P(Y < 1/2 | X = 1/2) = ∫₀^{1/2} 2 dy = 1。
很多同学看到答案是 1 会觉得不可思议,其实根据条件密度,在给定 X=1/2 后,Y 的取值被牢牢限制在 (0,1/2) 内,所以“Y 小于 1/2”就成了必然事件。这个题告诉我们一个教训:条件概率不一定总是中间值,它完全可能取 0 或 1,关键要看条件密度定义域的限制。
如果把问题改成 P(Y < 1/3 | X = 1/2),那结果就是 ∫₀^{1/3} 2 dy = 2/3。这里要特别注意积分的上限不超过 y 在条件密度中的最大允许范围,也就是 1/2。如果事件的上限超过了条件密度的定义域,那超过的部分对概率没有贡献。
5.3 题3:独立均匀变量求和的三角分布
题目:X 与 Y 独立且都服从 U(0,1),求 Z = X + Y 的密度,并求 P(Z > 1.5)。
上一节已经推导过,Z 的密度是一个三角分布:
f_Z(z) = z,0 < z < 1;f_Z(z) = 2 − z,1 ≤ z < 2
所以
P(Z > 1.5) = ∫{1.5}^{2} (2 − z) dz = [2z − z²/2]^{2} = 0.125
这道题在考场上非常经典,因为它考察的不只是卷积公式,还有分段讨论的能力。很多同学算出第一段 0<z<1 就结束了,忘了 1≤z<2 这一段。还有一种常见错误是积分限没取交集,直接把 x 的积分范围写成 (−∞, +∞),然后对除 x∈(0,1) 之外的部分也积分,导致结果出现负数或超过 1 的密度。
检验技巧:密度函数在 z 上的积分必须等于 1。对三角分布验证:
∫₀¹ z dz + ∫₁² (2−z) dz = 1/2 + 1/2 = 1
如果你算出来的分段密度积分不等于 1,那一定是分段或积分限出了问题。
5.4 题4:指数分布 max 与 min 混合
题目:X 与 Y 独立且都服从参数 λ=1 的指数分布。设 M = max(X,Y),T = min(X,Y)。求 M 的密度函数,计算 E(M),并判断 T 服从什么分布。
先求 F_M(z) = (1 − e^{−z})²,z>0,这是前面推导过的。求导得
f_M(z) = 2e^{−z} − 2e^{−2z},z>0
