WikiPrépaLivrets

Téléchargements

Présentation du sujet

Difficile
Analyse en composantes principales : orthodiagonalisation, rayon spectral et matrice de covariance
Afficher ou masquer la section

Le sujet introduit l'analyse en composantes principales à travers l'algèbre linéaire et les probabilités. La partie I reprend l'orthodiagonalisation des matrices symétriques réelles et le rayon spectral. La partie II étudie la matrice de covariance d'un vecteur aléatoire et ses propriétés. La partie III détaille, à partir de ces outils, une méthode d'extraction des premiers facteurs principaux d'une matrice de covariance.

  1. 1I. Généralités sur les matrices symétriques réellesOrthodiagonalisation, exemples numériques et rayon spectral d'une matrice symétrique.
  2. 2II. Matrice de covariancePropriétés de la matrice de covariance d'un vecteur aléatoire, changement de base et étude de la réciproque.
  3. 3III. Extraction des facteurs principauxOptimisation d'une fonctionnelle quadratique pour extraire les premiers facteurs principaux, puis étude d'un modèle à corrélation uniparamétrée.

Difficile. Sur 3454 copies corrigées, la moyenne n'est que de 26,2 % du barème pour un écart-type de 16,2 %, la meilleure copie n'atteignant que 90,3 % des points.

L'épreuve en chiffres

Moyenne 8,9 / 20 · écart-type 4,12 · 3 454 présents · où vous situez-vous ?
Afficher ou masquer la section
Moyenne
8,9/ 20
Écart-type
4,12
Présents
3 454
Coefficient
12
Durée
4 h
1er quartile
6
Médiane
8,6
3e quartile
12
moyenne 8,905101520
Deux tiers des copies environ (moyenne ± écart-type)

Votre note sur 20 à ce sujet, en conditions de concours.

Source : document officiel du concours, épreuve du 3 mai 2022. Notes publiées par le concours (après harmonisation le cas échéant). Courbe : estimation par une loi normale.

Ce qu'a observé le jury

4 erreurs relevées
Confusion entre transposée et inverse · Croyance erronée sur les matrices nilpotentes · Confusion entre supplémentaire et complémentaire
Afficher ou masquer la section

Le sujet se caractérise par une difficulté progressive et la quasi-absence de questions nécessitant une forte prise d'initiative. Le jury relève des faiblesses importantes sur des points de cours élémentaires, un maniement bancal des symboles logiques, des variables mal déclarées et de nombreuses fautes d'orthographe. La sélection des meilleurs candidats s'est faite sur la connaissance du cours et la qualité du raisonnement plus que sur le volume traité.

Les erreurs les plus sanctionnées

  1. 1
    Confusion entre transposée et inverseQ1

    De nombreux candidats confondent la transposée et l'inverse d'une matrice lors de la démonstration de l'orthodiagonalisation.

    « Les confusions entre la transposée »
  2. 2
    Croyance erronée sur les matrices nilpotentesQ9

    De nombreux candidats pensent à tort qu'une matrice nilpotente est diagonalisable, ce qui n'est vrai que pour la matrice nulle.

    « De nombreux candidats pensent qu’une matrice nilpotente est diagonalisable, ce qui n’est pourtant vrai que pour la matrice nulle. »
  3. 3
    Confusion entre supplémentaire et complémentaireQ25

    Le jury note de nombreuses confusions entre ces deux notions distinctes d'algèbre linéaire.

    « Le jury note de nombreuses confusions entre les notions de supplémentaire et de complémentaire en »
  4. 4
    Question 28 quasiment jamais résolueQ28

    Cette question, probablement la plus difficile du sujet, demande la mise en place d'une intersection d'événements peu maîtrisée par les candidats.

    « Moins de 1% des copies proposent une solution complète. »

Ce qui a été bien réussi

  • Parmi les copies obtenant plus de la moitié des points, environ 85 % de la note se répartit sur seulement 25 des 38 questions du sujet, signe que le soin apporté aux réponses prime sur la quantité traitée.
  • La question 2, sur la détermination d'un vecteur propre par observation directe de la matrice, est globalement réussie par les candidats.

Conseils du jury

  • Connaître précisément les énoncés du cours (théorème spectral, théorème des bornes atteintes) plutôt que de les appliquer approximativement.
  • Rédiger un texte structuré plutôt qu'un enchaînement de calculs ou de symboles logiques utilisés comme abréviations.
  • Toujours déclarer les variables utilisées (ensembles, indices) avant de les manipuler dans un raisonnement.
  • Bannir les mots comme « clairement » ou « trivialement » qui masquent souvent une étape non justifiée.

Synthèse rédigée par WikiPrépa à partir du rapport officiel du jury (à télécharger en PDF). Les citations sont extraites du rapport.

Ces sujets peuvent vous intéresser

Lecture du sujet en ligne

L'énoncé complet, avec les formules et les figures, sans ouvrir le PDF.
Afficher ou masquer la section

Notations

Dans tout le problème, n désigne un entier naturel supérieur ou égal à 2 .
On utilisera les notations matricielles classiques:
- M_(n, p)(ℝ) désigne l'ensemble des matrices à n lignes et p colonnes à coefficients réels et M_n(ℝ) l'ensemble des matrices carrées réelles à n lignes ;
- 0_n désigne la matrice de M_n(ℝ) dont tous les coefficients sont nuls;
- S_n(ℝ) désigne le sous-espace vectoriel de M_n(ℝ) formé par les matrices symétriques;
- diag(a_1, …, a_n) désigne la matrice diagonale dont les coefficients diagonaux sont a_1, …, a_n dans cet ordre ;
- A^⊤ désigne la transposée de la matrice A ;
- sp(A) désigne le spectre réel de la matrice A ,c'est-à-dire l'ensemble des valeurs propres réelles de A .
Les éléments de M_1(ℝ) sont assimilés à des réels.
Avec ces notations,le produit scalaire canonique de M_(n, 1)(ℝ) est donné par (U|V) = U^⊤V .
On note ‖U‖ la norme euclidienne canonique de U ∈ M_(n, 1)(ℝ) .
Les variables aléatoires considérées sont définies sur un espace probabilisé( Ω, B, ℙ ).On suppose que,pour tout p ∈ ]0, 1[ ,il existe une suite (X_n)_(n ∈ ℕ) de variables aléatoires de Bernoulli de paramètre p mutuellement indépendantes définies sur Ω .
Si X et Y sont deux variables aléatoires réelles discrètes définies sur Ω ,on note 𝔼(X), 𝕍(X) et cov(X, Y) respectivement l'espérance de X ,la variance de X et la covariance de X et Y ,lorsqu'elles sont définies.
On rappelle la formule
cov(X, Y) = 𝔼((X − 𝔼(X))(Y − 𝔼(Y))) = 𝔼(XY) − 𝔼(X)𝔼(Y).

Définition

Une matrice A de M_n(ℝ) est dite orthodiagonalisable s'il existe une matrice diagonale D et une matrice ortho- gonale P telles que A = PDP^⊤ .
Orthodiagonaliser A revient à déterminer un couple de telles matrices( D, P ).

I Généralités sur les matrices symétriques réelles

Q 1.Démontrer qu'une matrice A ∈ M_n(ℝ) est orthodiagonalisable si et seulement si elle est symétrique.

I.A-Un exemple dans M_3(ℝ)

On pose A_1 = (3, − 2, 4; − 2, 6, 2; 4, 2, 3) .
Q 2.En observant la première et la dernière colonne de A_1 ,déterminer un vecteur propre de A_1 et la valeur propre λ_1 associée.
Q 3.Déterminer le sous-espace propre de A_1 associé à la valeur propre λ_1 et en déduire le spectre de A_1 .
Q 4.Orthodiagonaliser A_1 .

I.B-Un exemple dans M_n(ℝ)

Q 5.Montrer que l'application φ : (P, Q) ↦ φ(P, Q) = ∫_0^1 P(t)Q(t)dt définit un produit scalaire sur ℝ_(n − 1)[X].
Q 6.Écrire la matrice H de ce produit scalaire dans la base canonique de ℝ_(n − 1)[X] ,c'est-à-dire la matrice de terme général h_(i, j) = φ(X^i, X^j) où les indices i et j varient entre 0 et n − 1 .
Q 7.Soit U ∈ M_(n, 1)(ℝ) .Exprimer le produit U^⊤HU à l'aide de φ et des coefficients de U .
Q 8.Montrer que H appartient à S_n(ℝ) et que ses valeurs propres sont strictement positives.

I.C - Rayon spectral

Pour toute matrice A ∈ M_n(ℝ) de spectre non vide, le rayon spectral de A, noté ρ(A), est défini par
ρ(A) = max_(λ ∈ sp(A))|λ|.
Q 9. Montrer que, si A est nilpotente, c'est-à-dire qu'il existe p ∈ ℕ^⋆ tel que A^p = 0_n, alors le rayon spectral de A est nul.
Q 10. On note C = {U ∈ M_(n, 1)(ℝ)|U^⊤U = 1}. Démontrer que C est une partie fermée de M_(n, 1)(ℝ).
Q 11. En déduire que l'application : U ↦ |U^⊤AU| admet un maximum sur C.
Q 12. Montrer que ρ(A) ⩽ max_(U ∈ C)|U^⊤AU|.

I.D - Rayon spectral d'une matrice symétrique

Soit A ∈ S_n(ℝ).
Q 13. Démontrer que ρ(A) = max_(U ∈ C)|U^⊤AU|.
On suppose de plus que les valeurs propres de A sont toutes positives.
Q 14. Montrer alors que ρ(A) = max_(U ∈ C)(U^⊤AU).
Q 15. Démontrer que l'application ρ définit une norme sur S_n(ℝ).

II Matrice de covariance

Dans la suite du problème, on considère n variables aléatoires discrètes Y_1, …, Y_n définies sur ( Ω, B, ℙ ) à valeurs réelles et on définit la fonction Y de Ω dans M_(n, 1)(ℝ) en posant
∀ω ∈ Ω, Y(ω) = (Y_1(ω); ⋮; Y_n(ω))
Un tel vecteur aléatoire est dit constant si la fonction Y est constante.
Si chacune des variables aléatoires discrètes Y_i admet une espérance finie, on définit le vecteur espérance de Y en posant
𝔼(Y) = (𝔼(Y_1); ⋮; 𝔼(Y_n)).
Si toutes les covariances existent, la matrice de covariance de Y est la matrice de M_n(ℝ), notée Σ_Y, de terme général σ_(i, j) = cov(Y_i, Y_j).
La variance totale de Y est définie par 𝕍_T(Y) = ∑_(i = 1)^n 𝕍(Y_i).
Dans la suite du problème, on suppose que 𝔼(Y) et Σ_Y sont bien définies.

II.A -

On admet que Y est une variable aléatoire discrète sur ( Ω, B, ℙ ) à valeurs dans M_(n, 1)(ℝ).
On admet aussi que (Y − 𝔼(Y))(Y − 𝔼(Y))^⊤ est une variable aléatoire discrète, à valeurs dans M_n(ℝ), dont l'espérance, par définition, est également calculée terme à terme.
Q 16. Vérifier que Σ_Y est une matrice symétrique, que
Σ_Y = 𝔼((Y − 𝔼(Y))(Y − 𝔼(Y))^⊤)
et que, si U est un vecteur constant dans M_(n, 1)(ℝ), alors
Σ_(Y + U) = Σ_Y.
Q 17. Soient p ∈ ℕ^∗ et M ∈ M_(p, n)(ℝ). On définit la variable aléatoire discrète Z = MY, à valeurs dans M_(p, 1)(ℝ). Justifier que Z admet une espérance et exprimer 𝔼(Z) en fonction de 𝔼(Y). Montrer que Z admet une matrice de covariance Σ_Z et que
Σ_Z = MΣ_Y M^⊤.

II.B - Propriété des valeurs propres

On note P la matrice de passage de la base canonique de M_(n, 1)(ℝ) à une base orthonormée formée de vecteurs propres de Σ_Y.
On définit la variable aléatoire discrète X = P^⊤Y = (X_1; ⋮; X_n).
Q 18. Démontrer que Σ_X est une matrice diagonale.
Q 19. En déduire que les valeurs propres de Σ_Y sont toutes positives.
Q 20. Démontrer que la variance totale de X est égale à celle de Y.

II. C - Étude de la réciproque

Soit D = diag(λ_1, …, λ_n) une matrice diagonale dont les coefficients diagonaux λ_i sont tous positifs.
Q 21. Démontrer l'existence d'une variable aléatoire discrète Z à valeurs dans M_(n, 1)(ℝ) telle que Σ_Z = D. Soit A ∈ S_n(ℝ) une matrice symétrique dont les valeurs propres sont positives.
Q 22. Démontrer l'existence d'une variable aléatoire discrète Y à valeurs dans M_(n, 1)(ℝ) telle que Σ_Y = A.
II.D - Soit U = (u_1; ⋮; u_n) dans M_(n, 1)(ℝ). On définit la variable aléatoire discrète X = U^⊤Y.
Q 23. Montrer que X admet une variance et que
𝕍(X) = U^⊤Σ_Y U.

II.E - Image de Σ_Y

L'objectif de cette sous-partie est de montrer que
ℙ(Y − 𝔼(Y) ∈ ImΣ_Y) = 1
On note r le rang de la matrice de covariance de Y.
Q 24. Traiter le cas où r = n.
On suppose maintenant r < n.
Q 25. Démontrer que le noyau et l'image de Σ_Y sont supplémentaires orthogonaux dans M_(n, 1)(ℝ). On note d = dimkerΣ_Y et on considère une base orthonormée (V_1, …, V_d) de ker Σ_Y.
Q 26. Démontrer que
∀j ∈ [ [1, d] ], 𝕍(V_j^⊤(Y − 𝔼(Y))) = 0
Q 27. En déduire que ℙ(V_j^⊤(Y − 𝔼(Y)) = 0) = 1.
Q 28. Conclure.

III Maximisation de la variance

Les notations sont celles de la partie II. On cherche un vecteur U unitaire tel que la variance de U^⊤Y soit maximale.
Comme en I.C, on note C = {U ∈ M_(n, 1)(ℝ)|U^⊤U = 1}.
On note q_Y l'application de C dans ℝ définie par q_Y(U) = 𝕍(U^⊤Y).
III.A - Un exemple dans M_(3, 1)(ℝ)
On pose A_2 = diag(9, 5, 4).
Q 29. Justifier l'existence d'un vecteur aléatoire dont A_2 est la matrice de covariance.
Q 30. Dans cette question uniquement, on suppose que Y une variable aléatoire à valeurs dans M_(3, 1)(ℝ) telle que Σ_Y = A_2. Déterminer le maximum de q_Y sur C.

III.B - Cas général

Q 31. Dans le cas général, démontrer que la fonction q_Y admet un maximum sur C. Préciser la valeur de ce maximum ainsi qu'un vecteur U_0 ∈ C tel que
max_(U ∈ C)𝕍(U^⊤Y) = 𝕍(U_0^⊤Y)

III.C - Étude d'un exemple

On suppose, dans cette sous-partie III.C uniquement, que Σ_Y vérifie
∀i ∈ [ [1, n] ], σ_(i, i) = σ^2 et ∀(i, j) ∈ [ [1, n] ]^2, i ≠ j ⟹ σ_(i, j) = σ^2 γ
où σ et γ sont deux réels strictement positifs.
On note J ∈ M_n(ℝ) la matrice dont tous les coefficients sont égaux à 1 .
Q 32. Démontrer que γ ⩽ 1 et exprimer Σ_Y en fonction de J.
Q 33. Déterminer les valeurs propres de J et la dimension de chaque sous-espace propre associé. Déterminer également un vecteur propre associé à sa valeur propre de module maximal.
Q 34. Préciser un vecteur U_0 unitaire tel que la variance de Z = U_0^⊤Y soit maximale.
Q 35. Calculer le pourcentage de la variance totale représenté par Z, c'est-à-dire le rapport (𝕍(Z))/(𝕍_T(Y)).
III. D - On suppose, dans cette dernière sous-partie, que Σ_Y présente n valeurs propres distinctes qu'on classe par ordre strictement décroissant λ_1 > ⋯ > λ_n.
On se munit d'un vecteur U_0 tel que 𝕍(U_0^⊤Y) = max_(U ∈ C)𝕍(U^⊤Y).
On note
C^′ = {U ∈ M_(n, 1)(ℝ)|U^⊤U = 1 et U_0^⊤U = 0}.
Q 36. Justifier que q_Y admet un maximum sur C^′.
Q 37. Déterminer la valeur de ce maximum et préciser un vecteur U_1 ∈ C^′ tel que
max_(U ∈ C^′)𝕍(U^⊤Y) = 𝕍(U_1^⊤Y).
Q 38. Calculer la covariance des variables aléatoires discrètes U_0^⊤Y et U_1^⊤Y (pour simplifier l'écriture, on pourra supposer Y centrée, c'est-à-dire 𝔼(Y) = 0 ).
Ces questions de maximisation de la variance sont à la base de la méthode statistique d'analyse en composantes principales. Il s'agit de déterminer, à partir d'un certain nombre de variables aléatoires, des combinaisons linéaires (composantes principales) concentrant le maximum d'information et décorrélées entre elles.

Questions fréquentes

4 questions
Sur quels chapitres porte le sujet de maths 1 PC Centrale 2022 ?
Afficher ou masquer la section

Sur quels chapitres porte le sujet de maths 1 PC Centrale 2022 ?

Le sujet porte sur l'analyse en composantes principales : orthodiagonalisation des matrices symétriques réelles, rayon spectral, et matrice de covariance d'un vecteur aléatoire en probabilités.

Quelles erreurs le jury a-t-il le plus relevées sur ce sujet de maths 1 PC Centrale 2022 ?

Le jury relève une confusion entre transposée et inverse d'une matrice, une croyance erronée sur les matrices nilpotentes, une confusion entre supplémentaire et complémentaire, et un maniement souvent bancal des symboles logiques.

Ce sujet de maths 1 PC Centrale 2022 est-il difficile ?

Oui, la moyenne n'est que de 26,2 % du barème sur 3454 copies corrigées, avec un écart-type de 16,2 %, et même la meilleure copie n'atteint que 90,3 % des points.

Faut-il connaître les probabilités pour ce sujet de Centrale PC 2022 ?

Oui, à partir de la question 16 le sujet introduit la matrice de covariance d'un vecteur aléatoire, mais le rapport souligne que l'essentiel du sujet reste centré sur l'algèbre bilinéaire et la réduction des matrices symétriques réelles.

Pas de description pour le moment