La présentation, la lisibilité, l'orthographe, la qualité de la rédaction, la clarté et la précision des raisonnements entreront pour une part importante dans l'appréciation des copies.
Les candidats sont invités à encadrer dans la mesure du possible les résultats de leurs calculs.
Aucun document n'est autorisé. L'utilisation de toute calculatrice et de tout matériel électronique est interdite. Seule l'utilisation d'une règle graduée est autorisée.
Si au cours de l'épreuve, un candidat repère ce qui lui semble être une erreur d'énoncé, il la signalera sur sa copie et poursuivra sa composition en expliquant les raisons des initiatives qu'il sera amené à prendre.
Dans ce problème, toutes les variables aléatoires sont supposées définies sur un même espace probabilisé ( Ω, A, ℙ ). Si X est une variable aléatoire, on note respectivement E(X) et Var(X) son espérance et sa variance, sous réserve d'existence.
Le but de ce problème est de mettre en évidence quelques résultats asymptotiques liés au modèle du collectionneur de vignettes. Dans chaque paquet de céréales se trouve une vignette et il y a en tout des vignettes de n types différents, où n est un entier supérieur ou égal à 1 . Chacun des n types de vignettes se retrouve avec la même fréquence dans les paquets de céréales. Une collection est alors complète lorsqu'elle comporte n vignettes de types différents.
On modélise le nombre total de paquets de céréales qu'il est nécessaire d'acheter pour obtenir la collection complète de n vignettes de types différents par la variable aléatoire notée C_n.
On pose par convention C_0 = 0 et pour tout i ∈ [ [1, n] ], on note C_i le nombre d'achats de paquets de céréales nécessaires pour obtenir i vignettes de types différents.
De même, pour tout i ∈ [ [1, n] ], on pose X_i = C_i − C_(i − 1), qui représente le nombre d'achats supplémentaires de paquets de céréales qu'il est nécessaire d'effectuer pour obtenir une nouvelle vignette d'un type différent des ( i − 1 ) vignettes de types différents déjà obtenues. Par convention, on pose X_1 = C_1 = 1.
On suppose que les variables aléatoires X_1, …, X_n sont mutuellement indépendantes. Enfin, on pose :
V_n = (C_n)/n − ln(n).
- Questions préliminaires -
(a) Montrer que :
C_n = X_1 + ⋯ + X_n = ∑_(i = 1)^n X_i.
(b) Justifier que pour tout i ∈ [ [1, n] ], la variable aléatoire X_i suit la loi géométrique G((n − i + 1)/n).
- Partie I -
Pour tout entier n ≥ 1, on pose :
H_n = ∑_(k = 1)^n 1/k, S_n = ∑_(k = 1)^n 1/(k^2)
Nous allons démontrer la convergence de la suite (S_n)_(n ≥ 1) et déterminer une valeur approchée de sa limite S.
2. (a) Montrer que pour tout entier k ≥ 2, on a l'encadrement :
1/k − 1/(k + 1) ≤ 1/(k^2) ≤ 1/(k − 1) − 1/k
(b) Montrer que pour tout entier n ≥ 2, on a :
3/2 − 1/(n + 1) ≤ S_n ≤ 2 − 1/n
(c) Montrer que la suite (S_n)_(n ≥ 1) est convergente et donner un encadrement de sa limite S.
(d) Montrer que pour tout entier n ≥ 1, on a l'encadrement :
1/(n + 1) ≤ S − S_n ≤ 1/n
(e) En déduire un programme Scilab qui permet d'obtenir une valeur approchée de S à 10^(− 7)-près.
3. Pour tout entier n ≥ 1, on pose u_n = H_n − ln(n).
(a) Montrer que pour tout entier n ≥ 1, on a l'encadrement :
1/(n + 1) ≤ ln((n + 1)/n) ≤ 1/n
(b) Montrer que pour tout entier n ≥ 1, on a : 0 ≤ u_n ≤ 1.
(c) Montrer que la suite (u_n)_(n ≥ 1) converge vers une certaine limite γ ∈ [0, 1].
4. Justifier l'existence de l'espérance de C_n et montrer que E(C_n) = nH_n.
5. Justifier l'existence de la variance de C_n et exprimer Var(C_n) en fonction de n, S_n et H_n.
6. (a) Montrer que pour tout réel a > 0, on a :
ℙ(|C_n − nH_n| ≥ an) ≤ S/(a^2)
(b) Montrer que pour tout réel c > 1, on a :
ℙ(|(C_n)/n − ln(n)| ≥ c) ≤ S/((c − 1)^2)
(c) Pour cette question, on suppose que n = 10^6.
On donne l'approximation ln(n) ≈ 13.816.
Montrer que :
ℙ((C_n)/n ∈ [7.81, 19.92]) ≥ 0.92.
- Partie II -
Soient T_1, …, T_n, n variables aléatoires mutuellement indépendantes de même loi exponentielle E(1). On pose:
M_n = max_(1 ≤ i ≤ n)T_i
Montrer que M_n suit la loi de densité f_n donnée par :
∀x ∈ ℝ, f_n(x) = {ne^(− x)(1 − e^(− x))^(n − 1), si x > 0; 0, si x ≤ 0
(a) Soit Z une variable aléatoire de loi exponentielle E(n + 1) et indépendante de M_n. On note g la densité de la loi de Z qui est nulle sur ] − ∞, 0 ] et continue sur ]0, + ∞[. Montrer que pour tout x > 0 et tout t ∈ ]0, x[, on a :
(b) Soit (Z_i)_(i ≥ 1) une suite de variables aléatoires mutuellement indépendantes telle que pour tout entier i ≥ 1, Z_i est de loi exponentielle E(i).
Montrer que pour tout entier n ≥ 1, la variable aléatoire ∑_(i = 1)^n Z_i suit la loi de densité f_n.
9. On définit la fonction f : ℝ → ℝ_+par :
∀x ∈ ℝ, f(x) = e^(− x)e^(− e^(− x))
Montrer que f est une densité de probabilité sur ℝ. La loi de densité f est appelée loi de Gumbel.
10. (a) Soit (Z_i)_(i ≥ 1) la suite de variables aléatoires introduite précédemment. On pose W_n = ∑_(i = 1)^n Z_i − ln(n).
Montrer que la fonction de répartition F_(W_n) de W_n est donnée par :
∀x ∈ ℝ, F_(W_n)(x) = {(1 − (e^(− x))/n)^n, si x > − ln(n); 0, si x ≤ − ln(n)
(b) Montrer que la suite de variables aléatoires (W_n)_(n ≥ 1) converge en loi vers une variable aléatoire de loi de Gumbel.
11. (a) On rappelle qu'en Scilab l'instruction grand( 1,1, 'geom', p ) permet la simulation d'une variable aléatoire suivant la loi géométrique de paramètre p.
Écrire une fonction d'en-tête function y = simulV(n) qui pour un entier n fourni en entrée, renvoie une simulation de la variable aléatoire V_n définie en introduction de ce problème.
(b) À la suite de la fonction simulV, écrire un programme Scilab qui construit un vecteur-ligne V contenant 1000 simulations indépendantes de la variable aléatoire V_n pour un certain entier n entré par l'utilisateur.
(c) On complète ce programme par le code suivant :
histplot(20,V)
function y=f(x)
y=exp(-x)*exp(-exp(-x))
endfunction
absc=linspace(-1,10,100)
fplot2d(absc,f)
On obtient les sorties graphiques suivantes en exécutant le programme pour n = 5, n = 10 puis n = 50 :
Que peut-on observer sur ces figures ? Quelle conjecture peut-on en déduire pour la suite (V_n)_(n ≥ 1) ?
12. Soit p ∈ ]0, 1 [ et soit U une variable aléatoire de loi exponentielle E(p). On pose α = − p/(ln(1 − p)).
Montrer que la variable aléatoire V = ⌊αU⌋ + 1 est de loi géométrique G(p).
On rappelle que ⌊t⌋ désigne la partie entière du réel t.
13. (a) Montrer que la variable aléatoire V − αU est à valeurs dans [0, 1]. En déduire que Var(V − αU) ≤ 1.
(b) Soit X et Y deux variables aléatoires admettant un moment d'ordre 2. Justifier l'existence de la covariance Cov(X, Y) puis montrer que :
Var(X + Y) ≤ 2(Var(X) + Var(Y))
On pourra calculer Var(X + Y) et Var(X − Y).
(c) En déduire que :
Var(V − U) ≤ 2 + 2((1 − α)^2)/(p^2)
Dans cette question, on suppose que n ≥ 2.
Soient Y_1, …, Y_n, n variables aléatoires mutuellement indépendantes telles que pour tout i ∈ [ [1, n] ], Y_i suit la loi exponentielle E((n − i + 1)/n).
On pose α_1 = 0, X_1^′ = 1 et pour tout i ∈ [ [2, n] ], α_i = − (n − i + 1)/n × 1/(ln((i − 1)/n)) et X_i^′ = ⌊α_i Y_i⌋ + 1.
De plus, on pose : W_n^′ = (Y_1 + ⋯ + Y_n)/n − ln(n) et V_n^′ = (X_1^′ + ⋯ + X_n^′)/n − ln(n).
(a) Montrer que :
peut être prolongée en une fonction continue sur le segment [0, 1].
ii. En déduire qu'il existe un réel A > 0 tel que:
lim_(n → ∞)1/n∑_(i = 2)^n(n/(n − i + 1))^2(1 − α_i)^2 = A.
(c) Montrer que la suite de variables aléatoires (V_n^′ − W_n^′)_(n ≥ 2) converge en probabilité vers 0 .
(d) Montrer que la suite de variables aléatoires (V_n^′)_(n ≥ 2) converge en loi vers une variable aléatoire de loi de Gumbel.
(e) On donne les valeurs numériques suivantes : e^(− e^(− x)) ≈ 0.96 si x = 3.20 et e^(− e^(− x)) ≈ 0.04 si x = − 1.17.
Lorsque n = 10^6, montrer que :
ℙ((C_n)/n ∈ [12.65, 17.02]) ≈ 0.92.
Comparer avec le résultat de la première partie et commenter.
- Partie III -
Dans cette partie, on suppose que n ≥ 2. On suppose de plus que les vignettes sont numérotées de 1 à n.
Pour tout i ∈ [ [1, n] ] et tout entier m ≥ 1, on note A_(i, m) la variable aléatoire donnant le nombre de vignettes numérotées i obtenues dans les m premiers paquets de céréales achetés.
15. (a) Justifier que pour tout i ∈ [ [1, n] ], la variable aléatoire A_(i, m) suit la loi binomiale B(m, 1/n).
(b) Calculer la covariance Cov(A_(1, m), m − A_(1, m)).
(c) À l'aide d'un raisonnement par l'absurde, en déduire que les variables aléatoires A_(1, m), …, A_(n, m) ne sont pas mutuellement indépendantes.
16. (a) Montrer que si (E_i)_(i ≥ 1) est une famille d'événements, alors pour tout entier r ≥ 1 :
ℙ(⋃_(i = 1)^r E_i) ≤ ∑_(i = 1)^r ℙ(E_i).
(b) Montrer que :
ℙ(C_n > m) ≤ n(1 − 1/n)^m ≤ ne^(− m/n).
(c) Soit c un réel strictement positif. Montrer qu'on a la majoration :
ℙ(C_n > cnln(n)) ≤ n^(1 − c).
(d) Montrer que pour tout réel x > − ln(n), on a :
ℙ(V_n > x) ≤ e^(− x)
Dans la suite de cette partie, on introduit un modèle légèrement différent : le nombre N de paquets achetés est décrit par une variable aléatoire N de loi de Poisson P(λ) avec λ > 0. On cherche à calculer la probabilité de compléter, à partir des N vignettes obtenues, la collection de vignettes. On suppose toujours que les vignettes sont numérotées de 1 à n. On note A˜_i la variable aléatoire donnant le nombre de vignettes numérotées i obtenues dans les N paquets de céréales achetés.
17. (a) Soit p ∈ ℕ^∗. Justifier que pour tout i ∈ [ [1, n] ], la loi conditionnelle du couple ( A˜_i, N ) conditionnée par l'événement [N = p] est la loi binomiale B(p, 1/n) et en déduire que la variable aléatoire A˜_i suit une loi de Poisson dont on déterminera le paramètre.
(b) Montrer que pour tout n-uplet (k_1, …, k_n) avec k_i ∈ ℕ et k_1 + ⋯ + k_n = p, on a:
(d) Montrer que les variables aléatoires A˜_1, …, A˜_n sont mutuellement indépendantes.
Commenter en comparant avec le résultat de la question 15.(c).
18. Soit D_n l'événement « à l'issue des N achats de paquets de céréales, la collection de vignettes est complète ». Montrer que :
ℙ(D_n) = (1 − e^(− λ/n))^n
On admet le résultat suivant : pour tout p ∈ ℕ^∗, on a ℙ_([N = p])(D_n) = ℙ(C_n ≤ p).
19. (a) Montrer que :
ℙ(D_n) = ∑_(p = 0)^∞ℙ(C_n ≤ p)ℙ(N = p)
(b) On suppose maintenant que λ > 1.
Soit a ∈ ]√λ, λ[. On pose k_1 = ⌊λ − a⌋ et k_2 = ⌊λ + a⌋ + 1.
Montrer que :
On pourra appliquer la question précédente avec λ = nln(n) + c_n n et a = n^(2/3).
(b) Retrouver alors la convergence en loi de la suite (V_n)_(n ≥ 1) vers une variable aléatoire de loi de Gumbel.