WikiPrépaLivrets

BCE Maths approfondies HEC/ESCP ECS 2012, épreuve 2Sujet et corrigé

Epreuve de maths approfondies - ECS 2012

Téléchargements

  • Rapport du jury : non disponible

Description

Annale de maths approfondies BCE HEC/ESCP pour la filiere ECS, session 2012.

Ces sujets peuvent vous intéresser

Lecture du sujet en ligne

L'énoncé complet, avec les formules et les figures, sans ouvrir le PDF.
Afficher ou masquer la section

BANQUE COMMUNE D'EPREUVES

CONCOURS D'ADMISSION DE 2012

Conception : C.C.I.P.

OPTION SCIENTIFIQUE

Code épreuve : 283

MATHEMATIQUES II

Mercredi 9 mai 2012, de 8 h. à 12 h.
La présentation, la lisibilité, l'orthographe, la qualité de la rédaction, la clarté et la précision des raisonnements entreront pour une part importante dans l'appréciation des copies.
Les candidats sont invités à encadrer dans la mesure du possible les résultats de leurs calculs.
Ils ne doivent faire usage d'aucun document : l'utilisation de toute calculatrice et de tout matériel électronique est interdite. Seule l'utilisation d'une règle graduée est autorisée.
Si au cours de l'épreuve, un candidat repère ce qui lui semble être une erreur d'énoncé, il la signalera sur sa copie et poursuivra sa composition en expliquant les raisons des initiatives qu'il sera amené à prendre
  • Toutes les variables aléatoires qui interviennent dans ce problème sont réelles et définies sur un même espace probabilisé (Ω, A, P), où P peut dépendre de paramètres réels inconnus a, b, σ etc ; elles admettent toutes une espérance et une variance : si J désigne l'une de ces variables aléatoires, on note E(J) son espérance et V(J) sa variance.
    Si J_1, J_2 et J_1 + J_2 sont des variables aléatoires à densité, on admet alors l'existence de la covariance de J_1 et J_2, notée Cov(J_1, J_2), qui est définie par la formule : Cov(J_1, J_2) = 1/2(V(J_1 + J_2) − V(J_1) − V(J_2)).
    On admet que les covariances de variables aléatoires à densité vérifient les mêmes règles de calcul que celles des variables aléatoires discrètes.
  • Pour tout (k, ℓ) de (ℕ^∗)^2, on note M_(k, ℓ)(ℝ) l'ensemble des matrices à k lignes et ℓ colonnes à coefficients réels; on note M_k(ℝ) l'ensemble des matrices carrées d'ordre k.
  • On note ^t Q la transposée d'une matrice Q.
  • Dans tout le problème, n désigne un entier supérieur ou égal à 3 .
L'objet du problème est l'étude de quelques propriétés du modèle de régression linéaire élémentaire.

Partie I. Quelques résultats statistiques et algébriques

On considère une population d'individus statistiques dans laquelle on étudie deux caractères quantitatifs X et Y. On extrait de cette population, un échantillon de n individus sélectionnés selon des valeurs choisies du caractère X et numérotés de 1 à n.
Pour tout i de [ [1, n] ], les réels x_i et y_i sont les observations respectives de X et de Y pour l'individu i de l'échantillon. On suppose que les réels x_1, x_2, …, x_n ne sont pas tous égaux.
Soit a et b deux paramètres réels. On pose pour tout i de [ [1, n] ] : u_i = y_i − (ax_i + b). (∗
  1. On note x¯ (resp. y¯ ) et s_x^2 (resp. s_y^2 ), la moyenne empirique et la variance empirique de la série statistique (x_i)_(1 ⩽ i ⩽ n)( resp. (y_i)_(1 ⩽ i ⩽ n)); on rappelle que : x¯ = 1/n∑_(i = 1)^n x_i et s_x^2 = 1/n∑_(i = 1)^n(x_i − x¯)^2.
    a) Montrer que s_x^2 > 0.
    b) Établir les formules : ∑_(i = 1)^n(x_i − x¯)y_i = ∑_(i = 1)^n(x_i y_i) − nx¯y¯ et ∑_(i = 1)^n(x_i − x¯)^2 = ∑_(i = 1)^n(x_i^2) − nx¯^2.
    c) On pose pour tout i de [ [1, n] ] : α_i = ((x_i − x¯))/(ns_x^2). Montrer que : ∑_(i = 1)^n α_i = 0, ∑_(i = 1)^n α_i x_i = 1 et ∑_(i = 1)^n α_i^2 = 1/(ns_x^2).
  2. On pose: y = (y_1; ⋮; y_n) ∈ M_(n, 1)(ℝ), u = (u_1; ⋮; u_n) ∈ M_(n, 1)(ℝ), θ = (a/b) ∈ M_(2, 1)(ℝ) et M = (x_1, 1; ⋮, ⋮; x_n, 1) ∈ M_(n, 2)(ℝ).
Les n relations (*) s'écrivent sous la forme matricielle suivante : y = Mθ + u.
a) Quel est le rang de la matrice M ?
b) Calculer la matrice ^t MM et justifier son inversibilité.
3. L'espace vectoriel ℝ^n est muni de sa structure euclidienne canonique. Soit F le sous-espace vectoriel engendré par les vecteurs (x_1, x_2, …, x_n) et (1, 1, …, 1) de ℝ^n. On note K la matrice du projecteur orthogonal de ℝ^n sur F dans la base canonique de ℝ^n et G = I − K, où I désigne la matrice identité de M_n(ℝ).
a) On cherche les matrices θ = (a/b) de M_(2, 1)(ℝ) qui minimisent ∑_(i = 1)^n u_i^2 = ∑_(i = 1)^n(y_i − (ax_i + b))^2. Montrer que ce problème admet une unique solution θ^ = ((a^)/(b^)) et qu'elle vérifie la relation : ^t MMθ^ = ^t My.
b) Montrer que : a^ = ∑_(i = 1)^n α_i y_i et b^ = y¯ − a^x¯.
c) Exprimer K en fonction de M et ^t M.
d) Soit u^ la matrice-colonne de M_(n, 1)(ℝ) de composantes u^_1, u^_2, …, u^_n définie par u^ = y − Mθ^. Montrer que : u^ = Gy = Gu.
e) En déduire les égalités : ^t uˆuˆ = ∑_(i = 1)^n uˆ_i^2 = ^t yGy = ^t uGu.

Partie II. Le modèle de régression linéaire

Le contexte et les notations sont ceux de la partie I. Dans cette partie, on cherche à modéliser les fluctuations aléatoires du caractère Y sur l'échantillon.
Les hypothèses du modèle de régression linéaire élémentaire sont les suivantes:
  • les réels a et b sont des paramètres inconnus ;
  • pour tout i de [ [1, n] ], la valeur x_i du caractère X est connue et la valeur y_i du caractère Y est la réalisation d'une variable aléatoire Y_i;
  • pour tout i de [ [1, n] ], Y_i est la somme d'une composante déterministe ax_i + b, fonction affine de la valeur choisie x_i, et d'une composante aléatoire U_i;
  • les variables aléatoires U_1, U_2, …, U_n sont mutuellement indépendantes, de même loi, possèdent une densité, et pour tout i de [ [1, n] ] : E(U_i) = 0 et V(U_i) = σ^2, où le paramètre inconnu σ est strictement positif.
    Le modèle de régression linéaire s'écrit alors : pour tout i de [ [1, n] ], Y_i = ax_i + b + U_i (1).
    L'objectif consiste à estimer les paramètres inconnus a, b et σ^2 du modèle (1).
    On pose pour tout n ⩾ 3 : Y¯_n = 1/n∑_(i = 1)^n Y_i et U¯_n = 1/n∑_(i = 1)^n U_i.
  1. On note A_n et B_n les deux variables aléatoires définies par : A_n = ∑_(i = 1)^n α_i Y_i et B_n = Y¯_n − A_n x¯, où le réel α_i a été défini dans la question 1.c).
    a) Montrer que A_n et B_n sont des estimateurs sans biais de a et b respectivement.
    b) Établir les formules suivantes: V(A_n) = (σ^2)/(ns_x^2) et V(B_n) = (1 + (x¯^2)/(s_x^2))(σ^2)/n.
    c) Calculer Cov(A_n, B_n).
  2. Dans cette question uniquement, l'entier n n'est plus fixé. On suppose l'existence de λ = lim_(n → + ∞)1/n∑_(i = 1)^n x_i et μ^2 = lim_(n → + ∞)1/n∑_(i = 1)^n(x_i − x¯)^2, avec(λ, μ) ∈ ℝ × ℝ_+^∗.
    Montrer que les deux suites (A_n)_(n ⩾ 3) et (B_n)_(n ⩾ 3) convergent en probabilité vers a et b respectivement.
    6.a) On pose pour tout i de [ [1, n] ] : Uˆ_i = Y_i − A_n x_i − B_n. Calculer E(Uˆ_i).
    b) Établir l'égalité : ∑_(i = 1)^n Uˆ_i^2 = ∑_(i = 1)^n(U_i − U¯_n)^2 − ns_x^2(A_n − a)^2.
    c) Calculer E(∑_(i = 1)^n Uˆ_i^2). En déduire un estimateur sans biais de σ^2.

Partie III. Hypothèse de normalité et prévision

Le contexte et les notations de cette partie sont ceux des parties I et II. De plus, on suppose dans cette partie que pour tout i de [ [1, n] ], la variable aléatoire U_i suit une loi normale N(0, σ^2).
On pose : Y = (Y_1; ⋮; Y_n) et U = (U_1; ⋮; U_n). Le modèle (1) de la partie II s'écrit alors matriciellement : Y = Mθ + U.
Soit W_1, W_2, …, W_q(q ∈ ℕ^∗), q variables aléatoires réelles définies sur ( Ω, A, P ). On définit le vecteur aléatoire (W_1, W_2, …, W_q) à valeurs dans ℝ^q, en associant à tout ω de Ω le vecteur (W_1(ω), W_2(ω), …, W_q(ω)) de ℝ^q.
On dit que le vecteur aléatoire (W_1, W_2, …, W_q) est normal si pour tout q-uplet (ρ_1, ρ_2, …, ρ_q) de nombres réels, différent de (0, 0, …, 0), la variable aléatoire ∑_(i = 1)^q ρ_i W_i suit une loi normale de variance non nulle.
Dans le cas où le vecteur ( W_1, W_2, …, W_q ) est normal, on admet que les variables aléatoires W_1, W_2, …, W_q sont mutuellement indépendantes si et seulement si pour tout (i, j) de [ [1, q] ]^2 avec i ≠ j, Cov(W_i, W_j) = 0.
7.a) Montrer que le vecteur aléatoire (Y_1, Y_2, …, Y_n) est normal mais que le vecteur (Y_1 − Y¯_n, Y_2 − Y¯_n, …, Y_n − Y_n^–) ne l'est pas.
b) Déterminer la loi de chacune des variables aléatoires A_n et B_n. Le vecteur aléatoire ( A_n, B_n ) est-il normal?
8. Soit S une matrice inversible de M_n(ℝ). On note T la matrice-colonne des composantes du vecteur aléatoire (T_1, T_2, …, T_n) telle que T = SU.
a) Montrer que le vecteur (T_1, T_2, …, T_n) est normal.
b) On suppose que la matrice S est orthogonale. Montrer que T_1, T_2, …, T_n sont mutuellement indépendantes.
9. Soit Uˆ_1, Uˆ_2, …, Uˆ_n les variables aléatoires qui ont été définies dans la question 6.
On note Uˆ la matrice-colonne de composantes Uˆ_1, Uˆ_2, …, Uˆ_n définie par Uˆ = Y − M((A_n)/(B_n)).
a) Montrer que Uˆ = GU, où la matrice G a été définie dans la question 3 .
b) Justifier l'existence d'une matrice orthogonale R de M_n(ℝ) et d'une matrice diagonale D de M_n(ℝ), telles que G = RD^t R. Quels sont les éléments diagonaux de D ?
c) Soit Z la matrice-colonne de composantes Z_1, Z_2, …, Z_n définie par Z = ^t RU. Quelle est la loi de ∑_(i = 1)^(n − 2)Z_i^2 ?
d) En déduire que la variable aléatoire ∑_(i = 1)^n Uˆ_i^2 suit la loi Γ(2σ^2, (n − 2)/2).
e) Soit p un réel donné vérifiant 0 < p < 1. Établir l'existence d'un réel c_n ne dépendant pas des paramètres inconnus a, b et σ^2, tel que P([∑_(i = 1)^n Uˆ_i^2 ⩾ c_n σ^2]) = p.
Dans les questions 10 et 11 , on suppose qu'une ( n + 1 )-ième valeur de X, notée x_(n + 1), est choisie mais que la valeur correspondante y_(n + 1) de Y est inconnue. On suppose que y_(n + 1) est la réalisation d'une variable aléatoire Y_(n + 1) qui vérifie Y_(n + 1) = ax_(n + 1) + b + U_(n + 1), où les variables aléatoires U_1, U_2, …, U_(n + 1) sont mutuellement indépendantes et de même loi N(0, σ^2).
10. On pose pour tout n-uplet r = (r_1, r_2, …, r_n) de ℝ^n : Yˆ_(n + 1)^((r)) = ∑_(i = 1)^n r_i Y_i.
L'ensemble {Yˆ_(n + 1)^((r)); r ∈ ℝ^n} est l'ensemble des "prédicteurs linéaires" de Y_(n + 1).
a) Soit g la fonction définie sur ℝ^n à valeurs réelles, telle que pour tout r = (r_1, r_2, …, r_n) de ℝ^n, g(r_1, r_2, …, r_n) = ∑_(i = 1)^n r_i^2. On rappelle que pour tout i de [ [1, n] ] : α_i = ((x_i − x¯))/(ns_x^2).
Montrer que la fonction g admet un minimum absolu sous les contraintes ∑_(i = 1)^n r_i = 1 et ∑_(i = 1)^n x_i r_i = x_(n + 1), atteint en l'unique point r^∗ = (r_1^∗, r_2^∗, …, r_n^∗), où pour tout i de [ [1, n] ], r_i^∗ = 1/n + (x_(n + 1) − x¯)α_i.
b) Montrer que parmi les prédicteurs linéaires Yˆ_(n + 1)^((r)) de Y_(n + 1), qui vérifient E(Yˆ_(n + 1)^((r))) = E(Y_(n + 1)) pour tout (a, b) de ℝ^2, Yˆ_(n + 1)^((r^∗)) est celui qui a la plus petite variance.
Vérifier que Yˆ_(n + 1)^((r^∗)) = A_n x_(n + 1) + B_n.
11.a) Déterminer la loi de la variable aléatoire Y_(n + 1) − (A_n x_(n + 1) + B_n).
b) On note Φ la fonction de répartition de la loi N(0, 1). Soit p un réel donné vérifiant 1/2 < p < 1. Justifier l'existence d'un réel d_n, que l'on exprimera à l'aide de Φ^(− 1), ne dépendant pas de a, b et σ^2, tel que P([|Y_(n + 1) − (A_n x_(n + 1) + B_n)| ⩽ d_n σ]) = p.
c) En déduire, à l'aide de la question 9.e), un intervalle dont les bornes ne dépendent que des (Y_i)_(1 ⩽ i ⩽ n), des (x_i)_(1 ⩽ i ⩽ n + 1), de c_n et d_n, qui contienne Y_(n + 1) avec une probabilité supérieure ou égale à 2p − 1. S'agit-il d'un intervalle de confiance au sens usuel du terme?

Pas de description pour le moment