第十三章

随机变量的数字特征

期望、方差与极限定理——概率论的核心计算

概率统计 约6% 重点章节
本章学习进度
0%

📋考纲要求

随机变量的数字特征是概率论的计算核心,是从"知道分布"到"提取关键信息"的桥梁。本章在上一章"分布"的基础上,引入刻画随机变量平均取值(期望)、离散程度(方差)、线性关联程度(协方差与相关系数)等数字特征,并进一步研究随机变量序列的极限行为——大数定律与中心极限定理。这些内容是数理统计的理论基石,也是考研概率统计部分计算量最大、最容易拿分也最容易失分的部分。

知识点考试要求考查层次
随机变量数学期望的概念理解数学期望的概念,掌握数学期望的性质理解/掌握
期望的计算(离散型、连续型)掌握离散型与连续型随机变量期望的计算掌握
随机变量函数的期望掌握一维、二维随机变量函数的数学期望掌握
方差的概念与计算理解方差的概念,掌握方差的计算公式与性质理解/掌握
常见分布的期望与方差掌握 0-1、二项、泊松、均匀、指数、正态等分布的期望与方差掌握
标准化随机变量理解标准化随机变量的概念理解
协方差与相关系数理解协方差与相关系数的概念、性质,掌握计算理解/掌握
不相关与独立的关系理解不相关与独立的关系,掌握判定理解
矩与协方差矩阵了解矩、协方差矩阵的概念了解
切比雪夫不等式掌握切比雪夫不等式及其应用掌握
大数定律了解切比雪夫大数定律、辛钦大数定律、伯努利大数定律了解
中心极限定理了解独立同分布的中心极限定理与棣莫弗-拉普拉斯定理了解
📌 命题趋势

随机变量的数字特征在考研数学一中约占 6% 的分值,是概率统计部分计算题的主要来源,每年几乎必考。考查重点集中在:期望与方差的计算(含随机变量函数的期望,必考点,填空/解答)、利用性质求 D(X±Y)、E(XY)(注意是否独立,否则需用协方差)、协方差与相关系数的计算与判定(高频解答题)、常见分布期望与方差的记忆与应用(选择题常考细节,如 E[X²]=DX+(EX)²)。切比雪夫不等式的"估算概率上界"、中心极限定理的"近似计算概率"是特色题型,需熟练。大数定律与中心极限定理的结论记忆、适用条件辨析是选择题的高频考点。

数学期望

数学期望(简称期望,记作 E(X)EX)是刻画随机变量取值中心(平均取值)的数字特征,是所有数字特征的基础。方差、协方差等都可以借助期望来定义。

一、离散型随机变量的期望

📖 定义:离散型随机变量的数学期望

设离散型随机变量 X 的分布律为 P{X = xk} = pkk = 1, 2, …)。若级数 Σk=1 |xk| pk 收敛(即绝对收敛),则称

E(X) = Σk=1 xk pk

为随机变量 X数学期望。若上述级数不绝对收敛,则称 X 的期望不存在。

期望的直观含义:它是随机变量取值以概率为权的加权平均,反映 X 取值的"中心位置"。

⚠️ 绝对收敛的条件

定义中要求绝对收敛(即 Σ|xk|pk < ∞)而非仅仅条件收敛。原因是:若仅条件收敛,级数的和会因项的排列顺序不同而改变,而期望作为描述客观平均值的量不应依赖排列顺序。考研中一般给定有限分布或常见分布,期望都存在,但理论辨析题可能考查此点。

二、连续型随机变量的期望

📖 定义:连续型随机变量的数学期望

设连续型随机变量 X 的概率密度为 f(x)。若广义积分 -∞+∞ |x| f(x) dx 收敛,则称

E(X) = ∫-∞+∞ x f(x) dx

X数学期望。它是离散型期望的"积分"类比:把概率 pk 换成概率元 f(x)dx,把求和换成积分。

三、数学期望的性质

定理:数学期望的性质

C 为常数,X, Y 为随机变量且期望存在,则:

① 常数的期望:E(C) = C

② 线性性质(提取常数):E(CX) = C·E(X)

③ 和的期望等于期望之和:E(X ± Y) = E(X) ± E(Y)。此性质不要求 X, Y 独立,可推广到有限个: E(Σ Xi) = Σ E(Xi)

④ 线性组合:E(aX + bY) = a·E(X) + b·E(Y)a, b 为常数,无需独立)。

⑤ 乘积的期望(需独立):XY 相互独立,则 E(XY) = E(X)·E(Y)。注意:此性质要求独立,是其必要条件之一(但非充要,存在不独立也满足 E(XY)=E(X)E(Y) 的情形,即"不相关")。

⚠️ 关键易错点

E(X+Y) = E(X)+E(Y) 恒成立(无需独立),但 E(XY) = E(X)E(Y) 必须独立才成立! 这是考研高频陷阱。计算 E(XY) 时,若题目未说明独立,必须用定义(二维联合分布律/密度积分)或 E(XY) = Cov(X,Y) + E(X)E(Y) 来求,切勿直接拆成乘积。只有"独立"或"已证不相关"时才可拆。

四、随机变量函数的期望

计算 Y = g(X) 的期望时,无需先求 Y 的分布,可直接利用 X 的分布对 g(X) 求期望,这大大简化了计算。

定理:随机变量函数的期望公式

(1) 一维离散型:X 为离散型,分布律 P{X=xk}=pk,则

E[g(X)] = Σk g(xk) pk

(2) 一维连续型:X 为连续型,密度为 f(x),则

E[g(X)] = ∫-∞+∞ g(x) f(x) dx

(3) 二维离散型:(X,Y) 的联合分布律为 pij,则

E[g(X,Y)] = ΣiΣj g(xi, yj) pij

(4) 二维连续型:(X,Y) 的联合密度为 f(x,y),则

E[g(X,Y)] = ∫∫ g(x,y) f(x,y) dx dy

特别地,取 g(X,Y)=XYE(XY),取 g(X)=X²E(X²)——这些是计算方差、协方差的核心。

💡 解题技巧

遇到求 E(X²)E(XY)E(eX) 等,优先用函数期望公式直接对原分布积分/求和,避免先求函数的分布再求期望的繁琐。例如已知 X~U(0,1)E(eX),直接 ∫₀¹ ex·1 dx = e-1,无需先求 Y=eX 的密度。

📊方差

方差(记作 D(X)Var(X)DX)是刻画随机变量取值相对于期望的离散程度的数字特征。方差越大,取值越分散;方差越小,取值越集中在期望附近。

一、方差的定义

📖 定义:方差与标准差

X 是一个随机变量,若 E{[X - E(X)]²} 存在,则称

D(X) = E{[X - E(X)]²} = E(X²) - [E(X)]²

X方差。称 σ(X) = √D(X)(或记 σX)为 X标准差或均方差。

方差表示 X 与其期望 E(X) 偏差平方的平均值,恒有 D(X) ≥ 0

二、方差的计算公式

D(X) = E(X²) - [E(X)]² 核心公式

这是考研最常用的方差计算公式,它把方差转化为两个期望的运算:E(X²)(用函数期望公式求)和 [E(X)]²。推导:

D(X) = E[(X-EX)²] = E[X² - 2X·EX + (EX)²] = E(X²) - 2(EX)(EX) + (EX)² = E(X²) - (EX)²

其中用到性质 E(2X·EX) = 2EX·E(X) = 2(EX)²(因为 EX 是常数),以及 E[(EX)²] = (EX)²

⚠️ 公式记忆要点

D(X) = E(X²) - (EX)²,注意是"平方的期望减期望的平方",符号相反。切勿写成 E(X²)-(EX)² 反了符号,或误记为 (EX)²-E(X²)(这样会得到负数,违反 D(X)≥0)。若计算结果为负,一定错了。

三、方差的性质

定理:方差的性质

C, a, b 为常数,X, Y 为随机变量,方差存在:

① 常数的方差为零:D(C) = 0

② 平方放大:D(CX) = C²·D(X)(注意是 不是 C)。

③ 平移不变:D(X + C) = D(X)(加减常数不改变离散程度)。

④ 线性变换:D(aX + b) = a²·D(X)

⑤ 和差的方差(需独立):X, Y 相互独立,则 D(X ± Y) = D(X) + D(Y)。注意:无论 X+Y 还是 X-Y,都是相加(独立时协方差为 0)。一般情形:

D(X ± Y) = D(X) + D(Y) ± 2Cov(X, Y)

⑥ 非负性:D(X) ≥ 0,且 D(X) = 0 ⟺ P{X = E(X)} = 1(即 X 以概率 1 为常数)。

⑦ 独立推广:X1,…,Xn 相互独立,则 D(Σ Xi) = Σ D(Xi)

❌ 高频错误

D(X-Y) 时,不是 D(X)-D(Y)!正确公式是 D(X-Y)=D(X)+D(Y)-2Cov(X,Y)。当 X,Y 独立时为 D(X)+D(Y)。原因是 (X-Y) 的方差展开含 -2Cov(X,Y),但 D(-Y)=D(Y),故独立时叠加为正。务必牢记:和与差的方差在独立时都是"相加"

四、标准化随机变量

📖 定义:标准化随机变量

设随机变量 X 的期望 E(X)=μ,方差 D(X)=σ²>0,称

X* = (X - μ) / σ = [X - E(X)] / √D(X)

X标准化随机变量。它满足:

E(X*) = 0, D(X*) = 1

标准化是消除量纲、统一尺度的常用手段。正态分布的标准化 Z=(X-μ)/σ~N(0,1) 即由此而来;切比雪夫不等式、中心极限定理中也用到标准化。

📚常见分布的期望与方差

常见分布的期望与方差是考研必须熟记的内容,它们是选择填空题的直接得分点,也是解答题的快捷工具。下表汇总了考研范围内的所有常见分布:

分布名称记号 / 分布律或密度期望 E(X)方差 D(X)
0-1 分布X ~ B(1, p),P{X=1}=ppp(1-p)
二项分布X ~ B(n, p)npnp(1-p)
泊松分布X ~ P(λ) / π(λ)λλ
几何分布X ~ Ge(p)1/p(1-p)/p²
均匀分布X ~ U(a, b)(a+b)/2(b-a)²/12
指数分布X ~ Exp(λ)1/λ1/λ²
正态分布X ~ N(μ, σ²)μσ²
💡 记忆技巧与重要结论

泊松分布的期望与方差相等且都等于参数 λ,这是泊松分布的标志性特征,常作为隐含条件命题。指数分布的方差是期望的平方(1/λ²),且具有无记忆性。均匀分布的期望是区间中点、方差为区间长度平方的 1/12。正态分布的两个参数恰好就是期望和方差。二项分布可看作 n 个独立 0-1 分布之和,故期望与方差都是单次的 n 倍。推导 E[X²] 的快捷公式:E(X²) = D(X) + [E(X)]²,由方差公式反推得到,在填空题中极为常用。

🔗协方差与相关系数

协方差与相关系数刻画两个随机变量之间的线性关联程度,是本章的重点与难点,几乎每年考研都会以解答题形式出现。

一、协方差

📖 定义:协方差

(X, Y) 是二维随机变量,若 E{[X-E(X)][Y-E(Y)]} 存在,则称

Cov(X, Y) = E{[X - E(X)][Y - E(Y)]}

XY协方差

计算公式(最常用):

Cov(X, Y) = E(XY) - E(X)·E(Y) 核心公式

X=Y 时,Cov(X,X) = D(X),即方差是协方差的特例。

定理:协方差的性质

① 对称性:Cov(X, Y) = Cov(Y, X)

② 双线性:Cov(aX, bY) = ab·Cov(X, Y)a, b 为常数)。

③ 可加性:Cov(X1+X2, Y) = Cov(X1, Y) + Cov(X2, Y)

④ 与常数:Cov(X, C) = 0(常数与任何随机变量协方差为 0)。

⑤ 独立必协方差为零:X, Y 独立,则 Cov(X, Y) = 0(反之不成立)。

⑥ 方差展开:D(X ± Y) = D(X) + D(Y) ± 2Cov(X, Y),这是计算和差方差的通用公式。

⑦ 柯西-施瓦茨不等式:[Cov(X,Y)]² ≤ D(X)·D(Y),等号成立当且仅当 X, Y 以概率 1 线性相关。

二、相关系数

📖 定义:相关系数

D(X)>0, D(Y)>0,称

ρXY = Cov(X, Y) / [σ(X)·σ(Y)] = Cov(X, Y) / √[D(X)·D(Y)]

XY相关系数(皮尔逊相关系数)。它是无量纲的量,消除了量纲和尺度的影响,纯粹刻画线性相关程度。

定理:相关系数的性质

① 有界性:XY| ≤ 1(由柯西-施瓦茨不等式保证)。

② 线性相关的充要条件:XY| = 1 ⟺ P{Y = aX + b} = 1a≠0)。具体地:

ρ = 1 ⟺ Y = aX + b 以概率 1 成立且 a > 0(完全正线性相关)
ρ = -1 ⟺ Y = aX + b 以概率 1 成立且 a < 0(完全负线性相关)

③ 符号意义:ρ > 0 表示正相关(X 增大 Y 倾向增大);ρ < 0 表示负相关;ρ = 0 表示不相关(无线性关系)。

④ 对线性变换不变(仅符号):a>0ρ(aX, Y) = ρ(X, Y)ρ(-X, Y) = -ρ(X, Y)

三、不相关与独立的关系

定理:不相关的等价条件

D(X)>0, D(Y)>0,下列五个命题等价(都称为"X 与 Y 不相关"):

Cov(X, Y) = 0

ρXY = 0

E(XY) = E(X)·E(Y)

D(X ± Y) = D(X) + D(Y)

注意:这四条只是"不相关"的不同表述,并不等价于"独立"

⚠️ "不相关"与"独立"的关系(高频考点)

独立 ⟹ 不相关(恒成立),但反之不成立! 即:独立一定不相关,但不相关不一定独立。原因:独立要求任何函数关系都分解(E[g(X)h(Y)]=E[g(X)]E[h(Y)] 对一切 g, h),而不相关只要求线性关系分解(E(XY)=E(X)E(Y)),后者条件弱得多。

仅一个重要例外:(X, Y) 服从二维正态分布时,"不相关"与"独立"等价。即对二维正态,ρ=0 ⟺ X,Y 独立。这是考研最常考的辨析点。

构造反例(说明不相关未必独立):设 X~N(0,1),令 Y=X²。则 E(XY)=E(X³)=0(奇函数对称区间),E(X)E(Y)=0·E(X²)=0,故 Cov(X,Y)=0(不相关);但 Y 完全由 X 决定,显然不独立。此例表明:不相关只排除"线性"关系,不排除"非线性"关系。

📌 解题主线

计算协方差/相关系数的标准流程:① 由联合分布求 E(X), E(Y), E(XY), E(X²), E(Y²)(用二维函数期望公式);② Cov(X,Y)=E(XY)-E(X)E(Y);③ D(X)=E(X²)-(EX)²D(Y)=E(Y²)-(EY)²;④ ρ=Cov/√(DX·DY)。若已知边缘分布与独立性,可直接用 E(XY)=E(X)E(Y) 快速求解。

📐矩与协方差矩阵

矩是数字特征的一般化概念,期望、方差、协方差都是特定矩的特例。协方差矩阵则是多维情形下数字特征的矩阵表示。

一、原点矩与中心矩

📖 定义:原点矩与中心矩

X 为随机变量,若 E(Xk) 存在(k 为正整数):

① k 阶原点矩:νk = E(Xk)。一阶原点矩即期望:ν1 = E(X)

② k 阶中心矩:μk = E{[X - E(X)]k}。一阶中心矩恒为 0:μ1=0;二阶中心矩即方差:μ2 = D(X)

③ 混合矩:对二维 (X,Y),称 E(XkYl)k+l 阶混合原点矩;称 E{[X-E(X)]k[Y-E(Y)]l}k+l 阶混合中心矩。k=l=1 的混合中心矩即协方差 Cov(X,Y)

二、协方差矩阵

📖 定义:协方差矩阵

设二维随机变量 (X, Y) 的二阶矩都存在,记

c11 = E{[X-E(X)]²} = D(X),c22 = E{[Y-E(Y)]²} = D(Y)
c12 = c21 = E{[X-E(X)][Y-E(Y)]} = Cov(X, Y)

称矩阵

Σ = [ c11 c12 ; c21 c22 ] = [ D(X) Cov(X,Y) ; Cov(Y,X) D(Y) ]

(X, Y)协方差矩阵。它是对称半正定矩阵c12=c21,且行列式 |Σ| = D(X)D(Y) - Cov²(X,Y) ≥ 0,即柯西-施瓦茨不等式)。该矩阵在多元统计分析与数理统计中有重要应用。考研仅要求了解概念。

⚖️大数定律

大数定律描述了大量随机现象的平均结果具有稳定性——当试验次数足够多时,随机变量的算术平均值会稳定于其期望。这是概率论作为"频率稳定性"理论基础的体现。

一、切比雪夫不等式

定理:切比雪夫不等式

设随机变量 X 的期望 E(X) 与方差 D(X) 都存在,则对任意 ε > 0,有

P{|X - E(X)| ≥ ε} ≤ D(X) / ε² 切比雪夫不等式

等价地(取对立事件):

P{|X - E(X)| < ε} ≥ 1 - D(X) / ε²

切比雪夫不等式给出了 X 偏离其期望 ε 之外的概率的上界估计,它不需要知道 X 的具体分布,只需期望与方差,是一个非常"粗略但普适"的估计。

💡 切比雪夫不等式的应用

典型用法:已知 E(X)D(X),估计 P{|X-E(X)|≥ε} 的上界或 P{|X-E(X)|<ε} 的下界。例如 X~B(100,0.2)EX=20, DX=16,则 P{|X-20|≥10} ≤ 16/100 = 0.16。注意切比雪夫给出的是保守的上界,通常远大于真实概率(可用中心极限定理得到更精确的近似)。

二、切比雪夫大数定律

定理:切比雪夫大数定律

X1, X2, …相互独立的随机变量序列,且 E(Xk) = μkD(Xk) ≤ C方差一致有界k=1,2,…,C 为常数),则对任意 ε>0,有

limn→∞ P{ | (1/n)Σk=1n Xk - (1/n)Σk=1n μk | < ε } = 1

即:独立随机变量的算术平均值依概率收敛于其期望的算术平均值。条件是"独立"且"方差一致有界"。

三、辛钦大数定律

定理:辛钦大数定律

X1, X2, …独立同分布的随机变量序列,且具有有限的数学期望 E(Xk) = μ不要求方差存在),则对任意 ε>0,有

limn→∞ P{ | (1/n)Σk=1n Xk - μ | < ε } = 1

即:独立同分布随机变量的算术平均值依概率收敛于共同的期望 μ辛钦大数定律是数理统计中"用样本均值估计总体均值"的理论依据

💡 辛钦大数定律的特点

辛钦大数定律只要求期望存在,不要求方差存在(相比切比雪夫大数定律少了"方差一致有界"的条件),但增加了"同分布"的要求。它是算术平均值稳定性的理论基础:当我们对同一量进行多次独立测量时,测量值的平均会稳定于真值。这也正是频率稳定性(伯努利大数定律)的一般情形——大数定律为"概率的频率定义"提供了严格的理论依据,是概率论公理化体系的基石之一。

四、伯努利大数定律

定理:伯努利大数定律

fn 是 n 重伯努利试验中事件 A 发生的次数,p 是每次试验中 A 发生的概率(0<p<1),则对任意 ε>0,有

limn→∞ P{ | fn/n - p | < ε } = 1

即:事件 A 发生的频率依概率收敛于概率 p。它是辛钦大数定律(取 Xk 为第 k 次试验的指示变量,E(Xk)=p)的特殊情形。

⚠️ 三大定律条件辨析(选择题易混点)

切比雪夫大数定律:要求独立、方差一致有界(可不同分布);辛钦大数定律:要求独立同分布、期望存在(不要求方差);伯努利大数定律:针对伯努利试验,频率收敛于概率。注意"依概率收敛"(记 XnP X)不同于"几乎处处收敛",大数定律给出的是依概率收敛。三者都是 n→∞ 时的极限结论。

🎯中心极限定理

中心极限定理(CLT)揭示了一个深刻事实:大量独立随机变量的和(在适当标准化下)的分布近似于正态分布,无论各随机变量本身服从何种分布。这正是正态分布在概率统计中地位特殊、应用广泛的根本原因。

一、林德伯格-列维中心极限定理(独立同分布)

定理:林德伯格-列维中心极限定理

X1, X2, …, Xn, …独立同分布的随机变量序列,且 E(Xk) = μD(Xk) = σ² > 0k=1,2,…),则对任意实数 x,有

limn→∞ P{ ( Σk=1n Xk - nμ ) / (σ√n) ≤ x } = Φ(x) 独立同分布 CLT

其中 Φ(x) 为标准正态分布的分布函数。结论的实用形式:当 n 较大时,和 Yn = Σ Xk 近似服从 N(nμ, nσ²),即

Σk=1n Xk ~ N(nμ, nσ²) (近似)

或等价地,算术平均 (1/n)Σ Xk ~ N(μ, σ²/n)(近似)。

二、棣莫弗-拉普拉斯中心极限定理

定理:棣莫弗-拉普拉斯中心极限定理

Yn 服从参数为 (n, p) 的二项分布 B(n, p)0<p<1n=1,2,…),则对任意实数 x,有

limn→∞ P{ ( Yn - np ) / √[np(1-p)] ≤ x } = Φ(x) 二项分布 CLT

它是林德伯格-列维定理的特例(取 Xk 为第 k 次伯努利试验的指示变量,则 Yn=Σ Xk~B(n,p)μ=p, σ²=p(1-p))。实用形式:当 n 较大时,

Yn ~ N(np, np(1-p)) (近似)

即二项分布在 n 较大时可用正态分布近似。计算概率时常用 Φ(-x) = 1 - Φ(x) 处理负值。

💡 中心极限定理的应用场景与解题步骤

典型应用:① 求独立同分布随机变量之和(或均值)落在某区间的概率;② 估算需要多少次试验才能以给定概率保证某事件("至少需要 n 多大"的反问题,常见于供电、保险、抽样等背景题)。解题标准步骤:① 设 Xk,写出 μ=E(X), σ²=D(X);② 构造和 Y=Σ Xk,算 E(Y)=nμ, D(Y)=nσ², σY=σ√n;③ 标准化 Z=(Y-nμ)/(σ√n)~N(0,1)(近似);④ 将所求概率转化为 Φ 的形式查表。对于二项分布,直接用 (Yn-np)/√(np(1-p)) 标准化。

📌 二项分布的两种近似

二项分布 B(n,p) 有两种常用近似:当 n 大、p 小(np 适中)时用泊松近似B(n,p)≈P(np));当 n 大且 p 不太极端时用正态近似(中心极限定理,B(n,p)≈N(np, np(1-p)))。考研中中心极限定理的正态近似是重点。计算时若涉及离散到连续的修正,可使用连续性修正P{Y≤k}≈Φ((k+0.5-np)/√(np(1-p)))),但多数真题按不修正处理,需依题意判断。

✏️典型例题

📝 例题1:期望与方差的计算
题目:设随机变量 X 的概率密度为

f(x) = { 2x,0 < x < 1;0,其他 }。

求:(1) E(X),D(X);(2) E(X²),E(1/X);(3) 设 Y = 3X + 2,求 E(Y),D(Y)。

解答:

先验证规范性:∫₀¹ 2x dx = [x²]₀¹ = 1 ✓

(1) 用定义求 E(X):

E(X) = ∫₀¹ x·2x dx = ∫₀¹ 2x² dx = [2x³/3]₀¹ = 2/3

用公式 D(X)=E(X²)-(EX)²,需先求 E(X²)

E(X²) = ∫₀¹ x²·2x dx = ∫₀¹ 2x³ dx = [2x⁴/4]₀¹ = 1/2

D(X) = 1/2 - (2/3)² = 1/2 - 4/9 = 9/18 - 8/18 = 1/18

(2) E(X²) 在上一步已求得:E(X²) = 1/2

用函数期望公式求 E(1/X):

E(1/X) = ∫₀¹ (1/x)·2x dx = ∫₀¹ 2 dx = 2

(3) 由期望与方差的线性性质(无需独立条件,因为是同一个随机变量的线性函数):

E(Y) = E(3X+2) = 3·E(X) + 2 = 3·(2/3) + 2 = 4

D(Y) = D(3X+2) = 3²·D(X) = 9·(1/18) = 1/2(加减常数不改变方差)。

小结:熟练运用 D(X)=E(X²)-(EX)² 与线性性质 E(aX+b)=aEX+bD(aX+b)=a²DX 是本题关键。

📝 例题2:协方差与相关系数的计算
题目:设 (X, Y) 的联合概率密度为

f(x, y) = { 2,0 < x < y < 1;0,其他 }。

求:(1) Cov(X, Y);(2) ρXY;(3) D(X+Y)。

解答:

先验证规范性:非零区域为 0<x<y<1(三角形),∫∫ 2 dxdy = ∫₀¹ ∫₀ʸ 2 dx dy = ∫₀¹ 2y dy = 1 ✓

求各阶矩(注意积分区域 0<x<y<1,即 x 从 0 到 y,y 从 0 到 1):

E(X) = ∫₀¹ ∫₀ʸ x·2 dx dy = ∫₀¹ [x²]₀ʸ dy = ∫₀¹ y² dy = 1/3

E(Y) = ∫₀¹ ∫₀ʸ y·2 dx dy = ∫₀¹ 2y·y dy = ∫₀¹ 2y² dy = 2/3

E(X²) = ∫₀¹ ∫₀ʸ x²·2 dx dy = ∫₀¹ (2/3)y³ dy = (2/3)·(1/4) = 1/6

D(X) = 1/6 - (1/3)² = 1/6 - 1/9 = 3/18 - 2/18 = 1/18

E(Y²) = ∫₀¹ ∫₀ʸ y²·2 dx dy = ∫₀¹ 2y²·y dy = ∫₀¹ 2y³ dy = 1/2

D(Y) = 1/2 - (2/3)² = 1/2 - 4/9 = 9/18 - 8/18 = 1/18

E(XY) = ∫₀¹ ∫₀ʸ xy·2 dx dy = ∫₀¹ 2y·[x²/2]₀ʸ dy = ∫₀¹ y³ dy = 1/4

(1) Cov(X, Y) = E(XY) - E(X)E(Y) = 1/4 - (1/3)(2/3) = 1/4 - 2/9 = 9/36 - 8/36 = 1/36

(2) ρXY = Cov(X,Y)/√[D(X)·D(Y)] = (1/36)/√[(1/18)(1/18)] = (1/36)/(1/18) = 1/2

(3) D(X+Y) = D(X) + D(Y) + 2Cov(X,Y) = 1/18 + 1/18 + 2·(1/36) = 2/18 + 2/36 = 1/9 + 1/18 = 2/18 + 1/18 = 3/18 = 1/6

注:本题 X、Y 非独立(因联合密度非矩形区域、且 Cov≠0),故 D(X+Y) 不能直接等于 D(X)+D(Y),必须加上 2Cov 项。

📝 例题3:切比雪夫不等式的应用
题目:设 X ~ B(100, 0.2)。

(1) 用切比雪夫不等式估计 P{|X - E(X)| ≥ 10} 的上界;

(2) 用中心极限定理计算该概率的近似值,并与 (1) 比较。(已知 Φ(2.5) = 0.9938)

解答:

先求期望与方差:对二项分布 B(n,p)E(X)=np=100×0.2=20D(X)=np(1-p)=100×0.2×0.8=16σ=√16=4

(1) 切比雪夫不等式(取 ε=10):

P{|X - 20| ≥ 10} ≤ D(X)/ε² = 16/100 = 0.16

(2) 中心极限定理:标准化 Z=(X-20)/4 ~ N(0,1)(近似):

P{|X-20| ≥ 10} = P{|(X-20)/4| ≥ 10/4} = P{|Z| ≥ 2.5}

= 2·P{Z ≥ 2.5} = 2[1 - Φ(2.5)] = 2(1 - 0.9938) = 2×0.0062 = 0.0124

比较:切比雪夫给出的上界 0.16 远大于中心极限定理的近似值 0.0124。这说明切比雪夫不等式是一个非常保守(粗糙)的估计,它不利用分布信息,只给出宽泛的上界;而中心极限定理利用了二项分布的结构,给出精确得多的近似。考研中两者各有所用:前者用于"只知道期望方差"的估计,后者用于"已知分布类型"的近似计算。

📝 例题4:中心极限定理的应用
题目:某系统由 100 个相互独立工作的元件组成,每个元件正常工作的概率为 0.9。用棣莫弗-拉普拉斯中心极限定理求该系统至少有 85 个元件正常工作的概率的近似值。(已知 Φ(5/3) ≈ 0.9522)
解答:

100 个元件中正常工作的元件数为 Y。每个元件是否正常工作是一次伯努利试验,故 Y ~ B(100, 0.9)

求期望与方差:E(Y) = np = 100×0.9 = 90D(Y) = np(1-p) = 100×0.9×0.1 = 9σ = √9 = 3

标准化(棣莫弗-拉普拉斯中心极限定理):Z = (Y - 90)/3 ~ N(0,1)(近似)。

计算概率:

P{Y ≥ 85} = P{(Y-90)/3 ≥ (85-90)/3} = P{Z ≥ -5/3}

利用 Φ(-x) = 1 - Φ(x),即 P{Z ≥ -5/3} = P{Z ≤ 5/3} = Φ(5/3)(标准正态对称性,P{Z≥-a}=Φ(a))。

P{Y ≥ 85} ≈ Φ(5/3) ≈ 0.9522

结论:该系统至少有 85 个元件正常工作的概率约为 0.9522(即约 95.22%)。

小结:此类"n 个独立伯努利之和"的问题,先识别为二项分布,再用 (Y-np)/√(np(1-p)) 标准化转化为标准正态,最后利用 Φ(-x)=1-Φ(x) 查表。若需"反求 n"(如供电量设计题),则令 Φ(临界值)≥给定概率 解不等式。

📝 自测练习
完成以下5道选择题,检验本章学习效果。每题作答后即时显示对错与解析。
1设 X ~ B(10, 0.4),则 E(X²) =
  • A 16
  • B 18.4
  • C 2.4
  • D 6.4
解析:二项分布 B(n,p) 的 E(X)=np=10×0.4=4,D(X)=np(1-p)=10×0.4×0.6=2.4。由反推公式 E(X²)=D(X)+(E(X))²=2.4+16=18.4。常见错误:把 E(X²) 误当作 D(X)=2.4 (选C),或误当作 (EX)²=16 (选A)。故选 B。
2设随机变量 X, Y 的相关系数为 ρXY,则下列结论正确的是:
  • AXY| = 1 ⟺ X 与 Y 相互独立
  • B 若 ρXY = 0,则 X 与 Y 相互独立
  • CXY| ≤ 1,且 |ρXY| = 1 ⟺ X 与 Y 以概率 1 线性相关
  • D ρXY > 0 表示 X 与 Y 相互独立
解析:相关系数 |ρ|≤1,|ρ|=1 当且仅当 X 与 Y 以概率 1 存在线性关系 Y=aX+b,故 C 正确。|ρ|=1 对应"完全线性相关"而非"独立",A 错;ρ=0 仅表示"不相关",不相关一般不蕴含独立(除非二维正态),B 错;ρ>0 表示正相关(非独立),D 错。故选 C。
3设 X ~ Exp(λ)(参数为 λ 的指数分布),则 E(X²) =
  • A 1/λ
  • B 1/λ²
  • C λ²
  • D 2/λ²
解析:指数分布 E(X)=1/λ,D(X)=1/λ²。由 E(X²)=D(X)+(E(X))²=1/λ²+(1/λ)²=1/λ²+1/λ²=2/λ²。常见错误:误以为 E(X²)=D(X)=1/λ² (选B)。故选 D。
4设随机变量 X 的期望 E(X)=μ,方差 D(X)=σ² 存在,则对任意 ε>0,切比雪夫不等式为:
  • A P{|X - μ| ≥ ε} ≤ σ²/ε²
  • B P{|X - μ| ≥ ε} ≤ σ²/ε
  • C P{|X - μ| ≥ ε} ≤ ε²/σ²
  • D P{|X - μ| ≥ ε} ≤ (σ²)²/ε²
解析:切比雪夫不等式为 P{|X-E(X)|≥ε}≤D(X)/ε²=σ²/ε²。注意分母是 ε²(不是 ε),分子是方差 σ²(不是标准差 σ,也不是方差平方)。故选 A。等价形式 P{|X-μ|<ε}≥1-σ²/ε²。
5设 X₁, X₂, …, X₅₀ 独立同分布,E(Xᵢ)=2,D(Xᵢ)=4。由中心极限定理,P{Σi=150 Xᵢ > 110} 的近似值为:(已知 Φ(0.707) ≈ 0.7602)
  • A 0.7602
  • B 0.5000
  • C 0.2398
  • D 0.1239
解析:设 Y=ΣXᵢ,E(Y)=50×2=100,D(Y)=50×4=200,σY=√200≈14.14。标准化 Z=(Y-100)/√200~N(0,1)(近似)。P{Y>110}=P{Z>(110-100)/√200}=P{Z>10/14.14}=P{Z>0.707}=1-Φ(0.707)≈1-0.7602=0.2398。故选 C。常见错误:误把 σY 当作 σ=2(漏乘√n),或忘记用 1-Φ。

📖 章节小结

  • 数学期望是刻画随机变量取值中心的数字特征。离散型 E(X)=Σxkpk,连续型 E(X)=∫xf(x)dx,均要求绝对收敛。核心性质:E(X±Y)=E(X)±E(Y) 无需独立,但 E(XY)=E(X)E(Y) 必须独立。随机变量函数的期望可直接用原分布计算(无需先求 Y 的分布),这是简化计算的关键。
  • 方差刻画离散程度,核心公式 D(X)=E(X²)-(E(X))²。性质:D(C)=0、D(CX)=C²DX、D(X+C)=DX、D(aX+b)=a²DX。和差方差通用公式 D(X±Y)=D(X)+D(Y)±2Cov(X,Y),独立时简化为 D(X±Y)=D(X)+D(Y)(注意 X-Y 也是相加!)。标准化变量 X*=(X-μ)/σ 满足 E=0, D=1。
  • 常见分布期望与方差必须熟记:0-1(分布)得 p, p(1-p);二项 B(n,p) 得 np, np(1-p);泊松 P(λ) 得 λ, λ(期望=方差是泊松的标志);几何 Ge(p) 得 1/p, (1-p)/p²;均匀 U(a,b) 得 (a+b)/2, (b-a)²/12;指数 Exp(λ) 得 1/λ, 1/λ²;正态 N(μ,σ²) 得 μ, σ²。快捷公式 E(X²)=D(X)+(E(X))² 常用于填空题。
  • 协方差 Cov(X,Y)=E(XY)-E(X)E(Y),刻画线性关联;相关系数 ρ=Cov/√(DX·DY) 是无量纲量,满足 |ρ|≤1|ρ|=1 ⟺ 以概率 1 线性相关。柯西-施瓦茨不等式 Cov²≤D(X)D(Y) 保证 |ρ|≤1。
  • "不相关"与"独立"是本章最重要的辨析独立 ⟹ 不相关恒成立,但反之不成立。不相关等价于 Cov=0、ρ=0、E(XY)=E(X)E(Y)、D(X±Y)=D(X)+D(Y)(四者等价)。唯一例外:二维正态分布下"不相关 ⟺ 独立"。反例:X~N(0,1), Y=X² 则不相关但不独立。
  • 矩与协方差矩阵:k 阶原点矩 νk=E(Xk)(ν₁=EX),k 阶中心矩 μk=E[(X-EX)k](μ₁=0, μ₂=DX)。协方差矩阵是对称半正定矩阵,考研仅要求了解。
  • 大数定律描述"平均值/频率的稳定性":切比雪夫不等式 P{|X-EX|≥ε}≤DX/ε²(不需分布,保守上界);切比雪夫大数定律(独立+方差一致有界)、辛钦大数定律(独立同分布+期望存在,不要求方差,是样本均值估计总体均值的理论依据)、伯努利大数定律(频率依概率收敛于概率,是频率定义概率的理论基础)。
  • 中心极限定理描述"和的分布趋于正态":林德伯格-列维(独立同分布,和 ΣXk~N(nμ,nσ²) 近似)、棣莫弗-拉普拉斯(二项 B(n,p)~N(np,np(1-p)) 近似)。解题步骤:设变量→求 nμ, nσ², σ√n→标准化为 N(0,1)→用 Φ(-x)=1-Φ(x) 查表。
  • 备考建议:本章重点训练四类题型——期望与方差计算(含函数期望,必考)、协方差与相关系数综合计算(高频解答题,注意 E(XY) 必须独立才能拆)、切比雪夫不等式估算概率上界、中心极限定理近似计算概率(含反求 n)。解题主线:能用性质先性质、不能用定义积分;独立性不明时一律用协方差通用公式;极限定理先标准化再查表。