Zum Inhalt springen

Benutzer:Stepri2005/Kurs:Stochastische Prozesse/Bedingte Erwartungswerte und Verteilungen

Aus Wikiversity

2.1 Einleitung

[Bearbeiten]

Problemstellung:

[Bearbeiten]

X,Y seien Zufallsgrößen über einem Wahrscheinlichkeitsraum (Ω,,P). Gesucht ist nach einer funktionalen Abhängigkeit zwischen X und Y. Kann man aus einem konkreten Messwert von X auf den zu erwartenden Wert von Y schließen?

Mathematische Formulierung:

[Bearbeiten]

Gesucht ist die Funktion g: mit

𝔼(Yg(X))2=inff:𝔼(Yf(X))2.

Zunächst wollen wir das Problem theoretisch untersuchen. Dies führt auf die Notwendigkeit, bedingte Verteilungen und bedingte Erwartungswerte zu betrachten (Kapitel 2.2 und 2.5). Danach behandeln wir die praktische Lösung des Problems (Kapitel 2.4).

Anmerkung:

[Bearbeiten]

Im folgenden setzen wir - ohne dies speziell zu erwähnen - stets die Existenz aller auftauchenden Erwartungswerte voraus.

2.2 Diskrete zufällige Größen

[Bearbeiten]

Es sei (X,Y) ein diskreter zufälliger Vektor über (Ω,,P) mit (endlichen oder abzählbar unendlichen) Wertebereichen X(Ω)={x1,x2,} bzw. Y(Ω)={y1,y2,}. Wir vereinbaren folgende Bezeichnungen:

(2.1) pkm=P(X=xk,Y=ym),
(2.2) pk=mpkm=P(X=xk),
(2.3) pm=kpkm=P(Y=ym).

Definition 2.1

[Bearbeiten]
Für ymY(Ω) bezeichne X|Y=ym die Zufallsgröße mit Wertebereich (X|Y=ym)(Ω)=X(Ω) und Verteilung
P((X|Y=ym)=xk)=P(X=xk|Y=ym)=pkmpm(xkX(Ω)).
Der Erwartungswert 𝔼(X|Y=ym) der Zufallsgröße X|Y=ym heißt bedingter Erwartungswert von X unter der Bedingung Y=ym. Die Funktion Ψ:Y(Ω),Ψ(y):=𝔼(X|Y=y) heißt bedingte Erwartungswertfunktion von X|Y.

Für ymY(Ω) erhält man

𝔼(X|Y=ym)=kxkP(X=xk|Y=ym)=kxkpkmpm.

Völlig analog führt man die Zufallsgröße Y|X=xk ein.

Definition 2.2

[Bearbeiten]
Für xkX(Ω) bezeichne Y|X=xk die Zufallsgröße mit Wertebereich (Y|X=xk)(Ω)=Y(Ω) und Verteilung
P((Y|X=xk)=ym)=P(Y=ym|X=xk)=pkmpk(ymY(Ω)).
Der Erwartungswert 𝔼(Y|X=xk) der Zufallsgröße Y|X=xk heißt bedingter Erwartungswert von Y unter der Bedingung X=xk. Die Funktion Φ:X(Ω),Φ(x):=𝔼(Y|X=x) heißt bedingte Erwartungswertfunktion von Y|X.

Für den bedingten Erwartungswert 𝔼(Y|X=xk) ergibt sich

𝔼(Y|X=xk)=kymP(Y=ym|X=xk)=kympkmpk.

Anmerkung:

[Bearbeiten]

Es wird stets vorausgesetzt pk>0,pm>0 (sonst können die bedingten Wahrscheinlichkeiten nicht gebildet werden). Da aber pkm=0 nicht ausgeschlossen ist, kann für einige k und m gelten P((Y|X=xk)=ym)=0=P((X|Y=ym)=xk).

Der bedingte Erwartungswert Φ(xk)=𝔼(Y|X=xk) ist eine Verfeinerung des Erwartungswertes 𝔼Y. Φ(X)=𝔼(Y|X) ist eine Zufallsgröße, die mit Wahrscheinlichkeit pk den Wert 𝔼(Y|X=xk) annimmt. Somit sollte der Erwartungswert von Φ(X) gleich dem Erwartungswert von Y sein. Analog ist Ψ(ym)=𝔼(X|Y=ym) eine Verfeinerung des Erwartungswertes 𝔼X. Die Zufallsgröße Ψ(Y)=𝔼(X|Y) nimmt mit Wahrscheinlichkeit pm den Wert 𝔼(X|Y=ym) an und es ist zu vermuten, dass gilt 𝔼Ψ(Y)=𝔼X.

Theorem 2.1

[Bearbeiten]
(2.4) 𝔼(𝔼(Y|X)=𝔼Y,𝔼(𝔼(X|Y)=𝔼X.

Beweis:

[Bearbeiten]
𝔼(𝔼(X|Y))=l𝔼(X|Y=yl)pl=lkxkpklplpl=kxklpkl=kxkpk=𝔼X,
𝔼(𝔼(Y|X))=k𝔼(Y|X=xk)pk=klylpklpkpk=lylkpkl=lylpl=𝔼Y.

q.e.d.

Die bedingten Erwartungswertfunktionen lösen die anfangs skizzierte Aufgabenstellung.

Theorem 2.2

[Bearbeiten]
Seien X,Y diskrete zufällige Größen über (Ω,,P). Für
Ψ:Y(Ω),Ψ(y):=𝔼(X|Y=y)
sowie
Φ:X(Ω),Φ(x):=𝔼(Y|X=x)
gelten die Beziehungen
𝔼(YΦ(X))2=infg:𝔼(Yg(X))2,
𝔼(XΨ(Y))2=infg:𝔼(Xg(Y))2.

Beweis:

[Bearbeiten]

Für eine beliebige Funktion g: gilt

(2.5) 𝔼(Yg(X))2=𝔼(YΦ(X)+Φ(X)g(X))2
(2.6) =𝔼(YΦ(X))2+𝔼(Φ(X)g(X))2+2𝔼(YΦ(X))(Φ(X)g(X)).

Der letzte Summand ist aber gleich Null, denn

(2.7) 𝔼(YΦ(X))(Φ(X)g(X))
(2.8) =lk(ylΦ(xk))(Φ(xk)g(xk))pklpkpk
(2.9) =k[(Φ(xk)g(xk))(lylpklpkΦ(xk)lpklpk)]pk
(2.10) =k[(Φ(xk)g(xk))(Φ(xk)Φ(xk)pkpk)]pk=0.

Der Ausdruck 𝔼(Yg(X))20 wird damit minimal für g(x)=Φ(x). Auf der Menge X(Ω) können wir natürlich g beliebig definieren. Analog wird 𝔼(Xg(Y))2 minimiert durch die Funktion g(y)=Ψ(y)=𝔼(X|Y=y).

q.e.d.

Definition 2.3

[Bearbeiten]
Die Funktion Ψ:Y(Ω),Ψ(y)=𝔼(X|Y=y) heißt Regressionsfunktion erster Art von X bezüglich Y.
Analog nennt man Φ:X(Ω),Φ(x)=𝔼(Y|X=x) Regressionsfunktion erster Art von Y bezüglich X.

2.3 Stetige zufällige Größen

[Bearbeiten]

Seien X,Y stetige Zufallsgrößen über einem Wahrscheinlichkeitsraum (Ω,,P) mit gemeinsamer Dichtefunktion f, d. h. f:2[0,) mit

P(X[a1,a2),Y[b1,b2))=a1a2b1b2f(x,y)dydx(a1<a2,b1<b2).

Die entsprechenden Randverteilungen von X und Y erhält man durch entsprechende Integration der Dichte f:

(2.11) fX(x)=f(x,y)dy(x),
(2.12) fY(y)=f(x,y)dx(y).

Wie in Kapitel 2.2 wollen wir auch in diesem Fall bedingte Verteilungen, bedingte Erwartungswerte und die entsprechenden Erwartungswertfunktionen bilden. Da aber für alle y P(Y=y)=0 gilt, existieren die bedingten Wahrscheinlichkeiten P(XA|Y=y) nicht. Allerdings können wir überprüfen, ob der Grenzwert

limh0P(XA|Y(y,y+h))

existiert. Diese Verteilung kann dann als Verteilung der Zufallsgröße X|Y=y interpretiert werden.

Wir nehmen an, dass fY (zumindest einseitig) stetig ist im Punkt y und dass gilt fY(y)>0. O. B. d. A. sei fY in y stetig von rechts. Dann existiert ein h>0 mit fY(u)>0 für u[y,y+h] und P(Y[y,y+h])>0. Für A gilt

(2.13) P(XA|Y[y,y+h))=P(xA,Y[y,y+h))P(Y[y,y+h))
(2.14) =Ayy+hf(u,v)dudvyy+hfY(v)dv=A1hyy+hf(u,v)dudv1hyy+hfY(v)dv

Dadurch erhalten wir

(2.15) limh0P(XA|Y[y,y+h))=A[limh01hyy+hf(u,v)dv]dulimh01hyy+hfY(v)dv
(2.16) =Af(u,y)dufY(y).

Für alle y mit fY(y)>0 sei g: gegeben durch g(x):=f(x,y)/fY(y). Die Funktion g ist eine Dichtefunktion, denn

g(x)dx=f(x,y)fY(y)dx=fY(y)fY(y)=1.

Definition 2.4

[Bearbeiten]
Für y mit fY(y)>0 sei X|Y=y die zufällige Größe mit der Dichtefunktion f(x,y)/fY(y). Die Zufallsgröße X|Y=y heißt bedingte zufällige Größe von X unter Y=y. 𝔼(X|Y=y) heißt bedingter Erwartungswert von X unter Y=y.

Für alle y mit fY(y)>0 gilt

𝔼(X|Y=y)=xf(x,y)fY(y)dx.

Analog erhalten wir für x mit fX(x)>0 die Beziehung

𝔼(Y|X=x)=yf(x,y)fX(x)dy.

Für stetige Zufallsgrößen gilt genau wie für diskrete, dass die bedingten Erwartungswerte die (theoretische) Lösung des Regressionsproblems darstellen (siehe Theorem 2.2).

Theorem 2.3

[Bearbeiten]
Seien X,Y stetige zufällige Größen über (Ω,,P). Wir setzen
Ψ:,Ψ(y):={𝔼(X|Y=y),fu¨r y mit fY(y)>0,0sonst
sowie
Φ:,Φ(x):={𝔼(Y|X=x),fu¨r x mit fX(x)>0,0,sonst.
Es gilt
𝔼(YΦ(X))2=infg:𝔼(Yg(X))2,
𝔼(XΨ(Y))2=infg:𝔼(Xg(Y))2.

Beweis:

[Bearbeiten]

Wie im diskreten Fall erhält man für eine beliebige messbare Funktion g:

(2.17) 𝔼(Yg(X))2=𝔼(YΦ(X)+Φ(X)g(X))2
(2.18) =𝔼(YΦ(X))2+𝔼(Φ(X)g(X))2+2𝔼(YΦ(X))(Φ(X)g(X)).

Analog zum Beweis von Theorem 2.2 zeigen wir, dass der letzte Summand verschwindet

(2.19) 𝔼(YΦ(X))(Φ(X)g(X))=(yΦ(x))(Φ(x)g(x))f(x,y)fX(x)fX(x)dxdy
(2.20) =[(Φ(x)g(x))(yf(x,y)fX(x)dyΦ(x)f(x,y)fX(x)dy)]fX(x)dx
(2.21) =[(Φ(x)g(x))(Φ(x)Φ(x)fX(x)fX(x))]fX(x)dx=0.

Der Ausdruck 𝔼(Yg(X))20 wird damit minimal für g(x)=Φ(x). Auf der Menge {x:fX(x)=0} setzt man die Funktion g o. B. d. A. gleich Null. Analog wird 𝔼(Xg(Y))2 minimiert durch die Funktion g(y)=Ψ(y)=𝔼(X|Y=y).

q.e.d.

Beispiel 2.2

[Bearbeiten]

Sei (X,Y) zufälliger Vektor mit X0,Y0 und Dichte

f(x,y)=apΓ(p)ype(a+x)y(x0,y0),

wobei a>0,p>0. Berechne die Regressionsfunktion Ψ(y)=𝔼(X|Y=y).

Lösung: Für y>0 gilt

fY(y)=0apΓ(p)ype(a+x)ydx=apΓ(p)yp1eay,

d. h. YGam(a,p). Somit ergibt sich für x0,y>0 als Dichte der Zufallsgröße X|Y=y der Ausdruck fX|Y=y(x)=yeyx, d. h. X|Y=yExp(y). Wir erhalten schließlich

Ψ(y)=𝔼(X|Y=y)=1y(y>0).

Es sei erwähnt, dass für x0 gilt

fX(x)=0apΓ(p)ype(a+x)ydy=pap(a+x)p+1.

Die Zufallsgröße X hat damit eine sog. Pareto-Verteilung, also

fX(x)=pap(a+x)p+1(x0).

Beispiel 2.3

[Bearbeiten]

(X,Y) habe die gemeinsame Dichtefunktion

f(x,y)=12πexp{x22xy+2y22}((x,y)2).

Berechne die Regressionsfunktionen Ψ(y)=𝔼(X|Y=y) sowie Φ(x)=𝔼(Y|X=x)!

Lösung: Wir erinnern noch einmal an die aus der Analysis bekannte Beziehung (3.2). Daraus folgt (nach einfacher Substitution), dass für alle a gilt

(2.22) 12πexp{(ua)2/2}du=1.

Für die Randdichte fY ergibt sich

(2.23) fY(y)=f(x,y)dx=12πexp{y22}12πexp{(xy)22}dx=12πexp{y22}.

Folglich gilt Y𝒩(0,1) und als Dichte der Zufallsgröße X|Y=y erhält man

fX|Y=y(x)=f(x,y)fY(y)=12πexp{(xy)22}.

Es gilt also X|Y=y𝒩(y,1) und damit

Ψ(y)=𝔼(X|Y=y)=y.

Analog berechnen wir die Randdichte fX:

(2.24) fX(x)=f(x,y)dy=12πexp{x24}exp{(x2y)2}dy
(2.25) =12πexp{x24}exp{u2}du=12πexp{x24}π
(2.26) =14πexp{x22},

woraus wir auf X𝒩(0,2) schließen. Es ergibt sich

fY|X=x(y)=f(x,y)fX(x)=1πexp{(x2y)2},

d. h. Y|X=x𝒩(x/2,1/2), was auf

Φ(x)=𝔼(Y|X=x)=x2

führt.

Beispiel 2.4

[Bearbeiten]

(X,Y) habe die gemeinsame Dichtefunktion

f(x,y)={y2exp{(1+x)y},wenn x>0,y>00,sonst.

Berechne die Erwartungswertfunktionen Ψ(y),Φ(x)!

2.4 Regressionsgerade

[Bearbeiten]

Definition 2.5

[Bearbeiten]
(X,Y) zufälliger Vektor. Die zufällige Größe αX+β heißt Regressionsgerade von Y bezüglich X, falls
𝔼(Y(αX+β))2=infa,b𝔼(Y(aX+b))2

Satz 2.1

[Bearbeiten]
β=𝔼Yα𝔼X,α=Cov(X,Y)Var(X)=𝔼(XY)𝔼X𝔼Y𝔼(X2)(𝔼X)2=ϱσ(Y)σ(X).

2.5 Allgemeine bedingte Erwartungswerte

[Bearbeiten]
„Es ist nöthig zu bemerken, daß die Unklarheit im Begriffe durch die Abstraktheit hervorgerufen wird, die bei der Anwendung auf wirkliche Messungen überflüssig wird.“
Nikolai Iwanowitsch Lobatschewski, 1835
Nikolai Lobatschewski

Im Kapitel 2.2 wurde der Begriff des bedingten Erwartungswerts an Hand des Spezialfalls diskreter Zufallsgrößen verdeutlicht. Wir haben festgestellt, dass alle für 𝔼(X|Y) wesentlichen Informationen über Y in der σ-Algebra σ(Y) stecken. Wir sagen, dass σ(Y) Träger der Information über Y ist. Wir wollen dies nun auf allgemeine Zufallsgrößen und σ-Algebren übertragen.

Definition 2.6

[Bearbeiten]
Seien Y,Y1,Y2 Zufallsgrößen über einem Wahrscheinlichkeitsraum [Ω,,P], ~ eine σ-Subalgebra von . Wir sagen, dass ~ die volle Information über Y enthält, falls gilt σ(Y)~. Wir sagen, Y2 enthält mehr Information als Y1, falls gilt σ(Y1)σ(Y2).

Anmerkung:

[Bearbeiten]

Ist Y eine ~-messbare Funktion, so enthält ~ die volle Information über Y. Wir entnehmen, dass σ(Y) die volle Information über den bedingten Erwartungswert 𝔼(X|σ(Y)) enthält. Dies und die oben aufgeführte Eigenschaft werden die definierenden Eigenschaften für allgemeine bedingte Erwartungswerte sein.

Definition 2.7

[Bearbeiten]
Sei [Ω,,P], ~ eine σ-Subalgebra von , X eine Zufallsgröße. Eine Zufallsgröße Z heißt bedingter Erwartungswert von X unter der σ-Algebra ~, falls
  1. σ(Z)~,
  2. 𝔼(X𝕀A)=𝔼(Z𝕀A)(A~).
Symbolisch schreiben wir: Z:=𝔼(X|~).

Bei diskreten Zufallsgrößen können wir explizit die bedingten Erwartungswerte berechnen. Allgemein ist dies schwierig oder unmöglich - Definition 2.7 ist alles andere als konstruktiv. Deshalb ist es wichtig, Rechenregeln für bedingte Erwartungswerte zu haben, die es einem ermöglichen, mit bedingten Erwartungswerten zu operieren, ohne ihre spezielle Form zu kennen. Wir werden die folgenden Eigenschaften nicht beweisen, sondern nur kommentieren.

Im folgenden sei [Ω,,P] ein Wahrscheinlichkeitsraum, ~ eine σ-Subalgebra von sowie X,X1,X2 Zufallsgrößen (also -messbare Funktionen).

Theorem 2.4 (Regel 0)

[Bearbeiten]
Ist 𝔼|X|<, so existiert 𝔼(X|~) und ist eindeutig in folgendem Sinne: Sind Z1,Z2 Zufallsgrößen mit den Eigenschaften 1. und 2. von Definition 2.7, so ist P-fast sicher Z1=Z2.

Theorem 2.5 (Regel 1)

[Bearbeiten]
Der bedingte Erwartungswert ist linear: Für alle a,b gilt P-f. s.
(2.27) 𝔼(aX1+bX2|~)=a𝔼(X1|~)+b𝔼(X2|~).

Theorem 2.6 (Regel 2)

[Bearbeiten]
(2.28) 𝔼(𝔼(X|~))=𝔼X.

Theorem 2.7 (Regel 3)

[Bearbeiten]
Sind σ(X) und ~ unabhängig, so gilt P-f. s.
(2.29) 𝔼(X|~))=𝔼X.

Theorem 2.8 (Regel 4)

[Bearbeiten]
Ist σ(X)~ (d. h. X ist sogar ~-messbar), so gilt P-f. s.
(2.30) 𝔼(X|~))=X.
Speziell ist also 𝔼(X1|X2)=X1, falls σ(X1)σ(X2).

Theorem 2.9 (Regel 5)

[Bearbeiten]
Ist σ(X1)~ (d. h. X1 ist sogar ~-messbar), so gilt für alle X2 P-f. s.
(2.31) 𝔼(X1X2|~))=X1𝔼(X2|~).

Theorem 2.10 (Regel 6)

[Bearbeiten]
Ist 1~ eine weitere σ-Subalgebra, so gilt P-f. s.
(2.32) 𝔼[𝔼(X|1)|~]=𝔼(X|~),
(2.33) 𝔼[𝔼(X|~)|1]=𝔼(X|~).

Theorem 2.11 (Regel 7)

[Bearbeiten]
Sind σ(X1) und ~ unabhängig und ist σ(X2)~, so gilt für eine beliebige Funktion h:2 (Existenz der Erwartungswerte vorausgesetzt) P-f. s.
(2.34) 𝔼(h(X1,X2)|~)=𝔼(𝔼X1h(X1,X2)|~),
wobei 𝔼X1h(X1,X2) den nur bezüglich X1 gebildeten Erwartungswert bezeichnet.

Anmerkung:

[Bearbeiten]

Beachte, dass 𝔼Xh(X,Y) eine Zufallsgröße ist und zwar gilt (𝔼Xh(X,Y))(ω)=𝔼Xh(X,Y(ω)). Wir wollen die Bildung 𝔼Xh(X,Y) etwas illustrieren. X habe die Dichtefunktion fX. Dann gilt

𝔼Xh(X,Y)=h(x,Y)fX(x)dx.

Ist beispielsweise h(x,y)=xy, erhält man 𝔼Xh(X,Y)=𝔼X(XY)=Y𝔼X. Ist h(x,y)=x+y, ergibt sich 𝔼Xh(X,Y)=𝔼X(X+Y)=𝔼X+Y.

Sei [Ω,,P] ein Wahrscheinlichkeitsraum, ~ eine σ-Subalgebra. Die Zufallsgröße 𝔼(X|~) sollte man stets als eine Verfeinerung oder ein Update der Information 𝔼X auffassen, wenn die Information ~ gegeben ist. Von allen Zufallsgrößen, die bereits ~-messbar sind, besitzt 𝔼(X|~) die folgende Minimalitätseigenschaft in Bezug auf die mittlere quadratische Abweichung.

Theorem 2.12

[Bearbeiten]
Sei [Ω,,P] ein Wahrscheinlichkeitsraum, ~ eine σ-Subalgebra. L2(~) bezeichne die Menge aller quadratisch integrierbaren ~-messbaren Zufallsgrößen. Für eine beliebige Zufallsgröße X mit 𝔼X2< gilt
(2.35) 𝔼[X𝔼(X|~)]2=minZL2(~)𝔼(XZ)2.

Definition 2.7

[Bearbeiten]
Sei [Ω,,P] ein Wahrscheinlichkeitsraum, X und Y Zufallsgrößen. Die Zufallsgröße 𝔼(X|σ(Y)) heißt bedingter Erwartungswert von X unter der Bedingung Y. Symbolisch schreibt man auch 𝔼(X|Y).

Wegen Theorem 2.12 ist 𝔼(X|Y) diejenige Funktion von Y, die im quadratischen Mittel der Zufallsgröße X am nächsten ist. Anwendung findet diese Aussage in der Statistik in der sog. Regressionsanalyse. Wir sagen auch, dass 𝔼(X|~) die beste Vorhersage von X bei gegebenem ~ ist.

Zum Schluss noch als technisches Hilfsmittel eine wichtige Ungleichung.

Theorem 2.13 (Jensensche Ungleichung)

[Bearbeiten]
Sei f: eine konvexe Funktion und X eine Zufallsgröße auf einem Wahrscheinlichkeitsraum [Ω,,P] mit 𝔼|X|< sowie 𝔼|f(X)|<. Es gilt
(2.36) f(𝔼X)𝔼f(X).
Für eine beliebige σ-Subalgebra ~ gilt
(2.37) f(𝔼X|~)𝔼[f(X)|~].