BCE Maths approfondies HEC/ESCP ECS 2012, épreuve 2Sujet et corrigé
Epreuve de maths approfondies - ECS 2012
Téléchargements
- Rapport du jury : non disponible
Description
Annale de maths approfondies BCE HEC/ESCP pour la filiere ECS, session 2012.
Ces sujets peuvent vous intéresser
Lecture du sujet en ligne
L'énoncé complet, avec les formules et les figures, sans ouvrir le PDF.Afficher ou masquer la section
Lecture du sujet en ligne
L'énoncé complet, avec les formules et les figures, sans ouvrir le PDF.
BANQUE COMMUNE D'EPREUVES
CONCOURS D'ADMISSION DE 2012
Conception : C.C.I.P.
OPTION SCIENTIFIQUE
Code épreuve : 283
MATHEMATIQUES II
Mercredi 9 mai 2012, de 8 h. à 12 h.
La présentation, la lisibilité, l'orthographe, la qualité de la rédaction, la clarté et la précision des raisonnements entreront pour une part importante dans l'appréciation des copies.
Les candidats sont invités à encadrer dans la mesure du possible les résultats de leurs calculs.
Ils ne doivent faire usage d'aucun document : l'utilisation de toute calculatrice et de tout matériel électronique est interdite. Seule l'utilisation d'une règle graduée est autorisée.
Si au cours de l'épreuve, un candidat repère ce qui lui semble être une erreur d'énoncé, il la signalera sur sa copie et poursuivra sa composition en expliquant les raisons des initiatives qu'il sera amené à prendre
Les candidats sont invités à encadrer dans la mesure du possible les résultats de leurs calculs.
Ils ne doivent faire usage d'aucun document : l'utilisation de toute calculatrice et de tout matériel électronique est interdite. Seule l'utilisation d'une règle graduée est autorisée.
Si au cours de l'épreuve, un candidat repère ce qui lui semble être une erreur d'énoncé, il la signalera sur sa copie et poursuivra sa composition en expliquant les raisons des initiatives qu'il sera amené à prendre
- Toutes les variables aléatoires qui interviennent dans ce problème sont réelles et définies sur un même espace probabilisé
(Ω, A, P) , oùP peut dépendre de paramètres réels inconnusa, b, σ etc ; elles admettent toutes une espérance et une variance : siJ désigne l'une de ces variables aléatoires, on noteE(J) son espérance etV(J) sa variance.
SiJ_1, J_2 etJ_1 + J_2 sont des variables aléatoires à densité, on admet alors l'existence de la covariance deJ_1 etJ_2 , notéeCov(J_1, J_2) , qui est définie par la formule :Cov(J_1, J_2) = 1/2(V(J_1 + J_2) − V(J_1) − V(J_2)) .
On admet que les covariances de variables aléatoires à densité vérifient les mêmes règles de calcul que celles des variables aléatoires discrètes. - Pour tout
(k, ℓ) de(ℕ^∗)^2 , on noteM_(k, ℓ)(ℝ) l'ensemble des matrices àk lignes etℓ colonnes à coefficients réels; on noteM_k(ℝ) l'ensemble des matrices carrées d'ordrek . - On note
^t Q la transposée d'une matriceQ . - Dans tout le problème,
n désigne un entier supérieur ou égal à 3 .
L'objet du problème est l'étude de quelques propriétés du modèle de régression linéaire élémentaire.
Partie I. Quelques résultats statistiques et algébriques
On considère une population d'individus statistiques dans laquelle on étudie deux caractères quantitatifs
X et
Y . On extrait de cette population, un échantillon de
n individus sélectionnés selon des valeurs choisies du caractère
X et numérotés de 1 à
n .
Pour touti de
[ [1, n] ] , les réels
x_i et
y_i sont les observations respectives de
X et de
Y pour l'individu
i de l'échantillon. On suppose que les réels
x_1, x_2, …, x_n ne sont pas tous égaux.
Soita et
b deux paramètres réels. On pose pour tout
i de
[ [1, n] ] : u_i = y_i − (ax_i + b). (∗
Pour tout
Soit
- On note
x¯ (resp.y¯ ) ets_x^2 (resp.s_y^2 ), la moyenne empirique et la variance empirique de la série statistique(x_i)_(1 ⩽ i ⩽ n)( resp.(y_i)_(1 ⩽ i ⩽ n)) ; on rappelle que :x¯ = 1/n∑_(i = 1)^n x_i ets_x^2 = 1/n∑_(i = 1)^n(x_i − x¯)^2 .
a) Montrer ques_x^2 > 0 .
b) Établir les formules :∑_(i = 1)^n(x_i − x¯)y_i = ∑_(i = 1)^n(x_i y_i) − nx¯y¯ et∑_(i = 1)^n(x_i − x¯)^2 = ∑_(i = 1)^n(x_i^2) − nx¯^2 .
c) On pose pour touti de[ [1, n] ] : α_i = ((x_i − x¯))/(ns_x^2) . Montrer que :∑_(i = 1)^n α_i = 0, ∑_(i = 1)^n α_i x_i = 1 et∑_(i = 1)^n α_i^2 = 1/(ns_x^2) . - On pose:
y = (y_1; ⋮; y_n) ∈ M_(n, 1)(ℝ), u = (u_1; ⋮; u_n) ∈ M_(n, 1)(ℝ), θ = (a/b) ∈ M_(2, 1)(ℝ) etM = (x_1, 1; ⋮, ⋮; x_n, 1) ∈ M_(n, 2)(ℝ) .
Les
n relations (*) s'écrivent sous la forme matricielle suivante :
y = Mθ + u .
a) Quel est le rang de la matriceM ?
b) Calculer la matrice^t MM et justifier son inversibilité.
3. L'espace vectorielℝ^n est muni de sa structure euclidienne canonique. Soit
F le sous-espace vectoriel engendré par les vecteurs
(x_1, x_2, …, x_n) et
(1, 1, …, 1) de
ℝ^n . On note
K la matrice du projecteur orthogonal de
ℝ^n sur
F dans la base canonique de
ℝ^n et
G = I − K , où
I désigne la matrice identité de
M_n(ℝ) .
a) On cherche les matricesθ = (a/b) de
M_(2, 1)(ℝ) qui minimisent
∑_(i = 1)^n u_i^2 = ∑_(i = 1)^n(y_i − (ax_i + b))^2 . Montrer que ce problème admet une unique solution
θ^ = ((a^)/(b^)) et qu'elle vérifie la relation :
^t MMθ^ = ^t My .
b) Montrer que :a^ = ∑_(i = 1)^n α_i y_i et
b^ = y¯ − a^x¯ .
c) ExprimerK en fonction de
M et
^t M .
d) Soitu^ la matrice-colonne de
M_(n, 1)(ℝ) de composantes
u^_1, u^_2, …, u^_n définie par
u^ = y − Mθ^ . Montrer que :
u^ = Gy = Gu .
e) En déduire les égalités :^t uˆuˆ = ∑_(i = 1)^n uˆ_i^2 = ^t yGy = ^t uGu .
a) Quel est le rang de la matrice
b) Calculer la matrice
3. L'espace vectoriel
a) On cherche les matrices
b) Montrer que :
c) Exprimer
d) Soit
e) En déduire les égalités :
Partie II. Le modèle de régression linéaire
Le contexte et les notations sont ceux de la partie I. Dans cette partie, on cherche à modéliser les fluctuations aléatoires du caractère
Y sur l'échantillon.
Les hypothèses du modèle de régression linéaire élémentaire sont les suivantes:
- les réels
a etb sont des paramètres inconnus ; - pour tout
i de[ [1, n] ] , la valeurx_i du caractèreX est connue et la valeury_i du caractèreY est la réalisation d'une variable aléatoireY_i ; - pour tout
i de[ [1, n] ], Y_i est la somme d'une composante déterministeax_i + b , fonction affine de la valeur choisiex_i , et d'une composante aléatoireU_i ; - les variables aléatoires
U_1, U_2, …, U_n sont mutuellement indépendantes, de même loi, possèdent une densité, et pour touti de[ [1, n] ] : E(U_i) = 0 etV(U_i) = σ^2 , où le paramètre inconnuσ est strictement positif.
Le modèle de régression linéaire s'écrit alors : pour touti de[ [1, n] ], Y_i = ax_i + b + U_i (1).
L'objectif consiste à estimer les paramètres inconnusa, b etσ^2 du modèle (1).
On pose pour toutn ⩾ 3 : Y¯_n = 1/n∑_(i = 1)^n Y_i etU¯_n = 1/n∑_(i = 1)^n U_i .
- On note
A_n etB_n les deux variables aléatoires définies par :A_n = ∑_(i = 1)^n α_i Y_i etB_n = Y¯_n − A_n x¯ , où le réelα_i a été défini dans la question 1.c).
a) Montrer queA_n etB_n sont des estimateurs sans biais dea etb respectivement.
b) Établir les formules suivantes:V(A_n) = (σ^2)/(ns_x^2) etV(B_n) = (1 + (x¯^2)/(s_x^2))(σ^2)/n .
c) CalculerCov(A_n, B_n) . - Dans cette question uniquement, l'entier
n n'est plus fixé. On suppose l'existence deλ = lim_(n → + ∞)1/n∑_(i = 1)^n x_i etμ^2 = lim_(n → + ∞)1/n∑_(i = 1)^n(x_i − x¯)^2, avec(λ, μ) ∈ ℝ × ℝ_+^∗ .
Montrer que les deux suites(A_n)_(n ⩾ 3) et(B_n)_(n ⩾ 3) convergent en probabilité versa etb respectivement.
6.a) On pose pour touti de[ [1, n] ] : Uˆ_i = Y_i − A_n x_i − B_n . CalculerE(Uˆ_i) .
b) Établir l'égalité :∑_(i = 1)^n Uˆ_i^2 = ∑_(i = 1)^n(U_i − U¯_n)^2 − ns_x^2(A_n − a)^2 .
c) CalculerE(∑_(i = 1)^n Uˆ_i^2) . En déduire un estimateur sans biais deσ^2 .
Partie III. Hypothèse de normalité et prévision
Le contexte et les notations de cette partie sont ceux des parties I et II. De plus, on suppose dans cette partie que pour tout i de
[ [1, n] ] , la variable aléatoire
U_i suit une loi normale
N(0, σ^2) .
On pose :Y = (Y_1; ⋮; Y_n) et
U = (U_1; ⋮; U_n) . Le modèle (1) de la partie II s'écrit alors matriciellement :
Y = Mθ + U .
SoitW_1, W_2, …, W_q(q ∈ ℕ^∗), q variables aléatoires réelles définies sur (
Ω, A, P ). On définit le vecteur aléatoire
(W_1, W_2, …, W_q) à valeurs dans
ℝ^q , en associant à tout
ω de
Ω le vecteur
(W_1(ω), W_2(ω), …, W_q(ω)) de
ℝ^q .
On dit que le vecteur aléatoire(W_1, W_2, …, W_q) est normal si pour tout
q -uplet
(ρ_1, ρ_2, …, ρ_q) de nombres réels, différent de
(0, 0, …, 0) , la variable aléatoire
∑_(i = 1)^q ρ_i W_i suit une loi normale de variance non nulle.
Dans le cas où le vecteur (W_1, W_2, …, W_q ) est normal, on admet que les variables aléatoires
W_1, W_2, …, W_q sont mutuellement indépendantes si et seulement si pour tout
(i, j) de
[ [1, q] ]^2 avec
i ≠ j, Cov(W_i, W_j) = 0 .
7.a) Montrer que le vecteur aléatoire(Y_1, Y_2, …, Y_n) est normal mais que le vecteur
(Y_1 − Y¯_n, Y_2 − Y¯_n, …, Y_n − Y_n^–) ne l'est pas.
b) Déterminer la loi de chacune des variables aléatoiresA_n et
B_n . Le vecteur aléatoire (
A_n, B_n ) est-il normal?
8. SoitS une matrice inversible de
M_n(ℝ) . On note
T la matrice-colonne des composantes du vecteur aléatoire
(T_1, T_2, …, T_n) telle que
T = SU .
a) Montrer que le vecteur(T_1, T_2, …, T_n) est normal.
b) On suppose que la matriceS est orthogonale. Montrer que
T_1, T_2, …, T_n sont mutuellement indépendantes.
9. SoitUˆ_1, Uˆ_2, …, Uˆ_n les variables aléatoires qui ont été définies dans la question 6.
On pose :
Soit
On dit que le vecteur aléatoire
Dans le cas où le vecteur (
7.a) Montrer que le vecteur aléatoire
b) Déterminer la loi de chacune des variables aléatoires
8. Soit
a) Montrer que le vecteur
b) On suppose que la matrice
9. Soit
On note
Uˆ la matrice-colonne de composantes
Uˆ_1, Uˆ_2, …, Uˆ_n définie par
Uˆ = Y − M((A_n)/(B_n)) .
a) Montrer queUˆ = GU , où la matrice
G a été définie dans la question 3 .
b) Justifier l'existence d'une matrice orthogonaleR de
M_n(ℝ) et d'une matrice diagonale
D de
M_n(ℝ) , telles que
G = RD^t R . Quels sont les éléments diagonaux de
D ?
c) SoitZ la matrice-colonne de composantes
Z_1, Z_2, …, Z_n définie par
Z = ^t RU . Quelle est la loi de
∑_(i = 1)^(n − 2)Z_i^2 ?
d) En déduire que la variable aléatoire∑_(i = 1)^n Uˆ_i^2 suit la loi
Γ(2σ^2, (n − 2)/2) .
e) Soitp un réel donné vérifiant
0 < p < 1 . Établir l'existence d'un réel
c_n ne dépendant pas des paramètres inconnus
a, b et
σ^2 , tel que
P([∑_(i = 1)^n Uˆ_i^2 ⩾ c_n σ^2]) = p .
a) Montrer que
b) Justifier l'existence d'une matrice orthogonale
c) Soit
d) En déduire que la variable aléatoire
e) Soit
Dans les questions 10 et 11 , on suppose qu'une (
n + 1 )-ième valeur de
X , notée
x_(n + 1) , est choisie mais que la valeur correspondante
y_(n + 1) de
Y est inconnue. On suppose que
y_(n + 1) est la réalisation d'une variable aléatoire
Y_(n + 1) qui vérifie
Y_(n + 1) = ax_(n + 1) + b + U_(n + 1) , où les variables aléatoires
U_1, U_2, …, U_(n + 1) sont mutuellement indépendantes et de même loi
N(0, σ^2) .
10. On pose pour toutn -uplet
r = (r_1, r_2, …, r_n) de
ℝ^n : Yˆ_(n + 1)^((r)) = ∑_(i = 1)^n r_i Y_i .
10. On pose pour tout
L'ensemble
{Yˆ_(n + 1)^((r)); r ∈ ℝ^n} est l'ensemble des "prédicteurs linéaires" de
Y_(n + 1) .
a) Soitg la fonction définie sur
ℝ^n à valeurs réelles, telle que pour tout
r = (r_1, r_2, …, r_n) de
ℝ^n ,
g(r_1, r_2, …, r_n) = ∑_(i = 1)^n r_i^2 . On rappelle que pour tout
i de
[ [1, n] ] : α_i = ((x_i − x¯))/(ns_x^2) .
Montrer que la fonctiong admet un minimum absolu sous les contraintes
∑_(i = 1)^n r_i = 1 et
∑_(i = 1)^n x_i r_i = x_(n + 1) , atteint en l'unique point
r^∗ = (r_1^∗, r_2^∗, …, r_n^∗) , où pour tout
i de
[ [1, n] ], r_i^∗ = 1/n + (x_(n + 1) − x¯)α_i .
b) Montrer que parmi les prédicteurs linéairesYˆ_(n + 1)^((r)) de
Y_(n + 1) , qui vérifient
E(Yˆ_(n + 1)^((r))) = E(Y_(n + 1)) pour tout
(a, b) de
ℝ^2, Yˆ_(n + 1)^((r^∗)) est celui qui a la plus petite variance.
Vérifier queYˆ_(n + 1)^((r^∗)) = A_n x_(n + 1) + B_n .
11.a) Déterminer la loi de la variable aléatoireY_(n + 1) − (A_n x_(n + 1) + B_n) .
b) On noteΦ la fonction de répartition de la loi
N(0, 1) . Soit
p un réel donné vérifiant
1/2 < p < 1 . Justifier l'existence d'un réel
d_n , que l'on exprimera à l'aide de
Φ^(− 1) , ne dépendant pas de
a, b et
σ^2 , tel que
P([|Y_(n + 1) − (A_n x_(n + 1) + B_n)| ⩽ d_n σ]) = p .
c) En déduire, à l'aide de la question 9.e), un intervalle dont les bornes ne dépendent que des(Y_i)_(1 ⩽ i ⩽ n) , des
(x_i)_(1 ⩽ i ⩽ n + 1) , de
c_n et
d_n , qui contienne
Y_(n + 1) avec une probabilité supérieure ou égale à
2p − 1 . S'agit-il d'un intervalle de confiance au sens usuel du terme?
a) Soit
Montrer que la fonction
b) Montrer que parmi les prédicteurs linéaires
Vérifier que
11.a) Déterminer la loi de la variable aléatoire
b) On note
c) En déduire, à l'aide de la question 9.e), un intervalle dont les bornes ne dépendent que des
Pas de description pour le moment