Zum Inhalt springen

Kurs:Analysis II/Kapitel IV: Partielle Differentiation für Funktionen mehrerer Veränderlicher/Taylorsche Formel im R^n und Extremwertaufgaben (§3)

Aus Wikiversity

Satz 1 (Taylorsche Formel in mehreren Variablen)

[Bearbeiten]
Seien die Dimensionen m,n und die offene Menge Ω im n gewählt. Es seien x und y zwei feste Punkte aus Ω, so dass die Verbindungsgerade σ(x,y) – auch Segment genannt – die Inklusion
σ(x,y):={z=x+t(yx)n|0t1}Ω
erfüllt.Weiter sei die reellwertige Funktion in der Klasse f(x)Cm(Ω) gegeben. Unter Verwendung der Differentiale aus §2 haben wir dann die Darstellung
(1) f(y)f(x)=k=1m11k!dkf(x,yx)+1m!dmf(z,yx)
mit einem Punkt zσ:=σ(x,y){x,y}.

Beweis

[Bearbeiten]

Wir betrachten die Funktion g(t):=f(x+t(yx)),t[0,1] der Klasse Cm([0,1]). Mit Hilfe der Kettenregel erhält man

(2) g(t)=α=1nfxα(x+t(yx))(yαxα)=(α=1n(yαxα)xα)f(x+t(yx)),

woraus sich wegen Formel (4) aus §2

(3) g(t)=df(x+t(yx),yx)

ergibt. Durch wiederholte Differentiation findet man

(4) g(k)(t)=(α=1n(yαxα)xα)kf(x+t(yx))=dkf(x+t(yx),yx)

für k=1,2,,m. Die eindimensionale Taylorsche Formel aus Satz 1 von §6 in Kapitel II liefert die Identität

(5) f(y)f(x)=g(1)g(0)=k=1m11k!g(k)(0)+1m!g(m)(θ)=k=1m11k!dkf(x,yx)+1m!dmf(z,yx).

Dabei wurde θ(0,1) gewählt und z:=x+θ(yx)σ(x,y) gesetzt.

q.e.d.

Definition 1

[Bearbeiten]
Sei auf der offenen Menge Ωn die Funktion f(x):Ω erklärt. Dann hat f ein absolutes oder auch globales Maximum bzw. Minimum im Punkt x=aΩ, wenn die Ungleichung
f(x)f(a) bzw. f(x)f(a) für alle xΩ
gilt.
Die Funktion f hat ein – schwaches – relatives oder auch lokales Maximum bzw. Minimum an der Stelle x=a, wenn es eine Kugel
Kε(a):={xn:|xa|<ε}Ω
vom hinreichend kleinen Radius ε>0 so gibt, dass die Ungleichung
f(x)f(a) bzw. f(x)f(a) für alle xKε(a)
erfüllt ist.
Die Funktion f hat ein striktes relatives oder auch lokales Maximum bzw. Minimum an der Stelle x=a, wenn es eine Kugel Kε(a)Ω vom Radius ε>0 so gibt, dass die Ungleichung
f(x)<f(a) bzw. f(x)>f(a) für alle xKε(a) mit xa
richtig ist.
Wir sprechen von einem Extremum, wenn wir sowohl ein Maximum als auch ein Minimum zulassen.

Satz 2 (Notwendige Bedingung erster Ordnung)

[Bearbeiten]
Die stetige Funktion f(x):Ω auf der offenen Menge Ωn besitze an der Stelle x=aΩ ein relatives Maximum oder Minimum – also ein Extremum. Außerdem existieren die ersten partiellen Ableitungen fxi(a) für i=1,2,,n. Dann gilt die Beziehung
(6) fxi(a)=0 für i=1,2,,n, das heißt f(a)=0.

Beweis

[Bearbeiten]

Da die offene Menge Ω den Punkt a enthält, gibt es eine Kugel Kρ(a)Ω von hinreichend großem Radius ρ>0. Wir betrachten nun die Funktion

φ(t):=f(a1,,ai1,t,ai+1,,an),t(aiρ,ai+ρ),

die an der Stelle t=ai ein Extremum hat. Weiter existiert φ(ai) und wie im Beweis des Rolleschen Satzes aus §3 in Kapitel II zeigen wir

0=φ(ai)=fxi(a) für i=1,,n.

q.e.d.

Definition 2

[Bearbeiten]
In der offenen Menge Ωn nennen wir aΩ einen kritischen Punkt der Funktion fC1(Ω), falls f(a)=0 erfüllt ist.

Satz 3 (Notwendige Bedingung zweiter Ordnung)

[Bearbeiten]
Die Funktion f(x):Ω auf der offenen Menge Ωn gehöre zur Klasse C2(Ω) und besitze an der Stelle x=aΩ ein relatives Minimum. Dann gilt
i,j=1nfxixj(a)ξiξj0 für alle ξ=(ξ1,,ξn)n.

Beweis

[Bearbeiten]

Es sei ξn beliebig gewählt. Dann liegt für ein hinreichend kleines t>0 die Strecke σ(a,a+tξ) in Ω. Die Taylorsche Formel liefert

f(a+tξ)f(a)=df(a,tξ)+12d2f(a+τξ,tξ)

mit einem geeigneten τ=τ(ξ)(0,t). Da an der Stelle x=a ein relatives Minimum vorliegt folgt df(a,tξ)=0. Ferner ist für alle hinreichend kleinen t>0 die Ungleichung f(a+tξ)f(a)0 erfüllt. Damit folgt

012d2f(a+τξ,tξ)=t22i,j=1nfxixj(a+τξ)ξiξj.

Für t0+ folgt τ0+ und wegen fC2(Ω) erhalten wir die Behauptung

i,j=1nfxixj(a)ξiξj0 für alle ξn.

Satz 4 (Hinreichende Bedingung zweiter Ordnung)

[Bearbeiten]
Sei die Funktion f=f(x):ΩC2(Ω) auf der offenen Menge Ωn gegeben. Weiter sei aΩ ein Punkt, welcher fxi(a)=0 für i=1,2,,n sowie
i,j=1nfxixj(a)ξiξj>0 für alle ξ=(ξ1,,ξn)n{0}
erfüllt. Dann besitzt f an der Stelle x=a ein striktes relatives Minimum.

Beweis

[Bearbeiten]

Nach Voraussetzung gilt

(7) i,j=1nfxixj(a)ξiξj>0 für alle ξS

auf der kompakten Einheitssphäre S:={ξn:|ξ|=1}. Nun ist die quadratische Form aus (7) als Funktion von ξ stetig auf S und nach Satz 8 aus §1 in Kapitel II gibt es eine Zahl α>0, so dass

(8) i,j=1nfxixj(a)ξiξjα für alle ξS

ausfällt. Wegen fC2(Ω) gibt es eine hinreichend kleine Zahl ε>0, so dass die Ungleichung

(9) i,j=1nfxixj(x)ξiξjα2>0 für alle ξS und alle xKε(a)

erfüllt ist. Somit folgt

(10) i,j=1nfxixj(x)ξiξjα2|ξ|2 für alle ξn und alle xKε(a)Ω.

Die Taylorsche Formel liefert für beliebiges yKε(a) die Identität

f(y)f(a)=df(a,ya)+12d2(z,ya),

wobei z auf der Verbindungsstrecke σ(a,y)Kε(a) liegt. Beachten wir df(a,ya)=0, so folgt mit (10) die Ungleichung

(11) f(y)f(a)=12d2(z,ya)=12i,j=1nfxixj(z)(yiai)(yjaj)α4|ya|2.

Wir erhalten

(12) f(y)>f(a) für alle ya mit |ya|ε.

Somit nimmt f im Punkt a ein striktes relatives Minimum an.

q.e.d.

Definition 3

[Bearbeiten]
Sei f=f(x):ΩC2(Ω) eine Funktion auf der offenen Menge Ωn und sei ein Punkt aΩ gewählt. Dann nennen wir
𝐇f(a):=(fxixj(a))i,j=1,,n=(fx1x1(a)fx1xn(a)fxnx1(a)fxnxn(a))
die Hessesche Matrix von f an der Stelle a. Ihr ist die Hessesche quadratische Form
q(ξ)=i,j=1nfxixj(a)ξiξj,ξ=(ξ1,,ξn)n
zugeordnet.

Definition 4

[Bearbeiten]
Wir nennen die quadratische Form q positiv-definit, falls q(ξ)>0 für alle ξn{0} gilt – und positiv-semidefinit, falls q(ξ)0 für alle ξn richtig ist.
Entsprechen heißt die quadratische Form q negativ-definit, falls q(ξ)<0 für alle ξn{0} gilt – und negativ-semidefinit, falls q(ξ)0 für alle ξn richtig ist.
Die quadratische Form q wird indefinit genannt, falls es Punkte ξ,ηn gibt, für die q(ξ)>0 bzw. q(η)<0 richtig ist.

Bemerkungen

[Bearbeiten]

1. Als notwendige Bedingung für ein relatives Minimum im Punkt a haben wir in Satz 3 hergeleitet, dass die Hessesche Form im kritischen Punkt a positiv-semidefinit sein muss.
2. Im Satz 4 haben wir gezeigt, dass eine hinreichende Bedingung für ein relatives Minimum eine positiv-definite Hessesche Form im kritischen Punkt a ist.
3. Durch den Übergang von f zu f erhalten wir Kriterien für relative Maxima von Funktionen.
4. Die Hessesche Form erlaubt nur die Kontrolle relativer aber nicht absoluter Extrema.
5. Die Voraussetzung

i,j=1nfxixj(a)ξiξj>0 für alle ξn{0}

in Satz 4 lässt sich nicht durch die schwächere Voraussetzung

i,j=1nfxixj(a)ξiξj0 für alle ξn

ersetzen. Hierzu betrachten wir die Funktion f(x)=x3,x, die eine solche schwächere Voraussetzung für a=0 erfüllt – dort jedoch kein relatives Minimum besitzt.
6. Andererseits ist die Behauptung in Satz 3 nicht durch die stärkere Aussage

i,j=1nfxixj(a)ξiξj>0 für alle ξn{0}

ersetzbar, wie man mit Hilfe der Funktion f(x)=x4,x an der Stelle a=0 einsehen kann.

Satz 5

[Bearbeiten]
Auf der offenen Menge Ωn sei die Funktion fC2(Ω) gegeben mit dem kritischen Punkt aΩ. Weiter sei die Hessesche Matrix 𝐇f(a) mit der zugeordneten quadratischen Form q(ξ) indefinit. Dann nimmt f im Punkt a weder ein lokales Maximum noch ein lokales Minimum an.

Beweis

[Bearbeiten]

Da q indefinit ist, können wir mit den Überlegungen des Beweises von Satz 4 in jeder Umgebung von a Punkte x+ und x mit der Eigenschaft f(x)<f(a)<f(x+) finden.

Bemerkungen

[Bearbeiten]

1. Die in Satz 5 betrachteten kritischen Punkte aΩ heißen Sattelpunkte.
2. Die Hessesche Matrix

𝐇f(a)=(fxixj(a))i,j=1,,n

ist genau dann positiv-definit bzw. positiv-semidefinit, falls ihre Hauptminoren

𝐒k=(fxixj(a))i,j=1,,k

für k=1,,n die Bedingungen det𝐒k>0 bzw. det𝐒k0 erfüllen. Dieses Kriterium von A. Hurwitz können wir mit der Hauptachsentransformation symmetrischer, reeller Matrizen sofort einsehen.
3. Als Spezialfall ergibt sich: Die Hessesche Matrix

𝐇f(a)=(fxx(a)fxy(a)fyx(a)fyy(a))

ist positiv-definit genau dann, wenn die Bedingung

(13) fxx(a)>0fxx(a)fyy(a)fxy2(a)>0

erfüllt ist.

Beispiel 1

[Bearbeiten]

Wir untersuchen nun Funktionen fj:2 für j=1,,4 mit ihren kritischen Punkten.

1. Die Funktion f1(x,y)=x2+y2 hat als einzigen kritischen Punkt den Nullpunkt als ein lokales Minimum, da aus (0,0)=f(x,y)=(2x,2y) dann (x,y)=(0,0) folgt und die Matrix

𝐇f(0,0)=(2002)

positiv-definit ist.
2. Die Funktion f2(x,y)=x2y2 hat im Nullpunkt als einzigen kritischen Punkt ein lokales Maximum. Aus f(x,y)=(0,0) folgt wegen f(x,y)=(2x,2y) die Bedingung (x,y)=(0,0). Außerdem ist die Matrix

𝐇f(0,0)=(2002)

negativ-definit.
3. Die Funktion f3(x,y)=x2y2 besitzt als einzigen kritischen Punkt im Nullpunkt einen Sattelpunkt. Aus der notwendigen Bedingung f(x,y)=(0,0) folgt (x,y)=(0,0) und die Matrix

𝐇f(0,0)=(2002)

ist indefinit.
4. Die Funktion f1(x,y)=x2+y4 erfüllt im Nullpunkt (x,y)=(0,0) die notwendige Bedingung f(x,y)=(0,0), jedoch ist die Hessesche Matrix

𝐇f(0,0)=(2002)

positiv-semidefinit. Obwohl über die Hessesche Matrix keine generellen Aussagen möglich sind, hat die Funktion f4 im Nullpunkt ein striktes lokales Minimum.

Definition 5

[Bearbeiten]
Sei A=(aij)i,j=1,2,,n eine reelle n×n-Matrix und λ eine reelle Zahl. Dann nennen wir λ einen Eigenwert der Matrix A, wenn es einen Vektor ξn{0} mit der Eigenschaft Aξ=λξ gibt. Der Vektor ξ=(ξ1,,ξn) heißt Eigenvektor zum Eigenwert λ.

Das Extremalverhalten der Funktion fC2(Ω) in kritischen Punkten wird besonders einfach überprüfbar, wenn man mittels Hauptachsentransformation dort die Hessesche quadratische Form in die Normalform

(14) q(ξ)=λ1ξ12++λnξn2,ξ=(ξ1,,ξn)n

überführt. Dabei sind λj für j=1,,n die Eigenwerte der Hesseschen Matrix. Den größten Eigenwert erhalten wir wie folgt durch ein Maximierungsverfahren:

Satz 6 (Existenz des größten Eigenwerts)

[Bearbeiten]
Jede reelle, symmetrische Matrix A=(aij)i,j=1,2,,n besitzt einen reellen Eigenwert λ, d. h. es gibt einen Vektor xn mit Ax=λx und |x|=1.

Beweis

[Bearbeiten]

Wir betrachten die Funktion

(15) g(x):=i,j=1naijxixji=1nxi2,x=(x1,,xn)K

auf der kompakten Kugelschale K:={xn:12|x|2}. Nun ist g(x) stetig auf K – und nimmt nach Satz 8 aus §1 in Kapitel II ihr Maximum in einem Punkt ξK an. Dabei kann |ξ|=1 gewählt werden, da die folgende Beziehung gilt:

g(x)=g(x|x|) für alle xK.

Nach obigem Satz 2 folgt

gxk(ξ)=0 für k=1,2,,n.

Wir berechnen zunächst

(16) g(x):=(i=1nxi2)(i,j=1naijxixj)xk(i=1nxi2)xk(i,j=1naijxixj)(i=1nxi2)2

für k=1,,n. Dann ermitteln wir

(17) (i=1nxi2)xk=2xk

sowie

(18) (i,j=1naijxixj)xk=i,j=1naijδikxj+i,j=1naijxiδjk=j=1nakjxj+i=1naikxi=2j=1nakjxj.

Dabei benutzen wir die Symmetriebedingung

aij=aji für i,j=1,,n

und verstehen unter

(19) δlm={1 falls l=m0 falls lm für 1m,ln

das Kronecker-Symbol. Somit ergibt sich

0=gxk(ξ)=2|ξ|2j=1nakjξj2ξki,j=1naijξiξj|ξ|4 für k=1,,n

Wegen |ξ|=1 folgt

(20) j=1nakjξj=g(ξ)ξk für k=1,2,,n

und schließlich Aξ=λξ mit |ξ|=1 und dem größten Eigenwert

(21) λ:=g(ξ)=max{g(x):xn mit |x|=1}.

q.e.d.

Bemerkungen

[Bearbeiten]

1. Indem wir das obige Maximierungsproblem

(22) g(x)Maximum,xK:={xK|x,ξ=0}

auf der Ebene senkrecht zum Eigenvektor ξ lösen, erhalten wir den nächst kleineren Eigenwert; dabei bezeichnet , das Skalarprodukt im n. Wir erhalten so für die Matrix A sukzessiv die Eigenwerte

(23) λ1λ2λn.

2. In der Linearen Algebra bestimmt man alle Eigenwerte einer Matrix A, wenn wir mit E die Einheitsmatrix benennen, als Nullstellen des charakteristischen Polynoms

(24) p(λ):=det(AλE),λ

über den Fundamentalsatz der Algebra. Letzteren hatten wir in §8 von Kapitel III mit einer Extremalmethode bewiesen.
3. Aus der Identität Aξ=λξ erhalten wir durch Skalarmultiplikation mit dem Einheitsvektor ξ und wegen der Symmetrie der Matrix A den reellen Charakter der Eigenwerte wie folgt:

(25) λ=Aξ,ξ=ξ,Aξ.