Feuille d'entraînement : Ondes acoustiques
8 questions · filière PT · durée estimée environ 34 min
Seulement 8 questions corrigées pour ces critères à ce jour.
Énoncés
Exercice 1Banque PT Physique A PT 2022, Q13· Application directe· Incontournable· ≈ 3 min
On mesure la longueur d'onde du signal , ainsi que la durée qui sépare la réception et l'émission de l'impulsion.
Exprimer la profondeur du lac en fonction de , et , puis calculer sa valeur.
Exercice 2Banque PT Modelisation PT 2026, Q45· Intermédiaire· ≈ 4 min
Rappeler le principe de l'algorithme des plus proches voisins en 5 à 10 lignes maximum.
Exercice 3Banque PT Modelisation PT 2026, Q46· Intermédiaire· ≈ 4 min
Expliquer comment choisir une valeur optimale en précisant les inconvénients de valeurs extrêmes.
Exercice 4Banque PT Modelisation PT 2026, Q47· Application directe· ≈ 3 min
Écrire une fonction
distance_euclidienne, qui renvoie la distance euclidienne entre deux points A et B du fichier de valeurs expérimentales dont les coordonnées sont stockées dans des tuples(freq_A, dB_A)et(freq_B, dB_B).Exercice 5Banque PT Physique A PT 2022, Q12· Application directe· ≈ 3 min
Déterminer la fréquence des signaux émis ; préciser le domaine correspondant.
Exercice 6Banque PT Modelisation PT 2026, Q48· Exigeant· ≈ 7 min
Écrire une fonction
plus_prochesqui reçoit en argument une listedistancesde nombres réels représentants la distance entre le point à classifier et chaque point de la base d'apprentissage et un entier strictement positif, et qui retourne les indices des plus petites distances de la listedistances. L'utilisation des fonctions de tri prédéfinies commesortedest interdit.Exercice 7Banque PT Modelisation PT 2026, Q49· Exigeant· ≈ 6 min
À partir de la matrice de confusion et de la représentation des prédictions (figure 11), expliquer si le modèle permet une bonne prédiction de l'origine du son. Calculer la précision globale et les précisions pour chacune des origines.
Exercice 8Banque PT Modelisation PT 2026, Q50· Intermédiaire· ≈ 4 min
Comment améliorer les performances de la classification par la méthode des plus proches voisins ?
Corrigés
Exercice 1Banque PT Physique A PT 2022, Q13
L'impulsion sonore émise par le sonar effectue un aller-retour entre la surface et le fond du lac, soit une distance parcourue :
d = 2HLa célérité c de l'onde sonore dans l'eau est reliée à sa longueur d'onde \lambda et à sa fréquence f par la relation de dispersion :
c = \lambda fPendant la durée \tau s'écoulant entre l'émission et la réception, l'onde se propage à la vitesse constante c, ce qui donne :
2H = c\,\tau = \lambda f \tauOn en déduit l'expression de la profondeur H du lac :
\boxed{H = \frac{\lambda f \tau}{2}}Application numérique : Avec \lambda = 3{,}75\text{ cm} = 3{,}75 \cdot 10^{-2}\text{ m}, f = 40\text{ kHz} = 40 \cdot 10^3\text{ Hz} (obtenu à la question précédente) et \tau = 40\text{ ms} = 40 \cdot 10^{-3}\text{ s} :
\begin{aligned} c &= 3{,}75 \cdot 10^{-2} \times 40 \cdot 10^3 = 1500\text{ m}\cdot\text{s}^{-1} \\ H &= \frac{1500 \times 40 \cdot 10^{-3}}{2} \end{aligned}\boxed{H = 30\text{ m}}Résultat
Exercice 2Banque PT Modelisation PT 2026, Q45
L'algorithme des k plus proches voisins est une méthode d'apprentissage supervisé utilisée pour la classification (ou la régression). Pour déterminer la classe d'une nouvelle donnée, son principe se décompose ainsi :
- On calcule la distance (le plus souvent la distance euclidienne) entre la donnée à classifier et chacun des points de la base d'apprentissage étiquetée ;
- On sélectionne les k points d'apprentissage dont la distance à la nouvelle observation est la plus faible ;
- On attribue à la nouvelle donnée la classe majoritaire parmi ces k voisins (vote à la majorité). En cas de problème de régression, on calcule la moyenne des valeurs associées à ces voisins.
Exercice 3Banque PT Modelisation PT 2026, Q46
Le choix de l'hyperparamètre k détermine le compromis biais-variance du classifieur :
- Inconvénients d'un k trop faible (k = 1 ou très petit) : le modèle est extrêmement sensible aux bruits de mesure et aux données aberrantes (outliers). Les frontières de décision deviennent très morcelées, ce qui conduit à un surapprentissage (forte variance, faible biais).
- Inconvénients d'un k trop grand (k \sim N, où N est le nombre total de données) : le voisinage englobe une trop grande proportion des données, gommant les caractéristiques locales. La prédiction tend systématiquement vers la classe majoritaire de la base d'apprentissage, conduisant à un sous-apprentissage (fort biais, faible variance).
Méthode de choix de la valeur optimale : Pour déterminer la valeur optimale de k, on utilise une méthode de validation croisée (ou l'évaluation des performances sur un jeu de validation distinct du jeu d'entraînement) :
- On évalue le taux d'erreur (ou la précision) pour différentes valeurs croissantes de k ;
- On retient le k qui minimise l'erreur de généralisation sur les données de validation.
Dans le cas d'une classification binaire (ici d'origine « Animale » ou « Anthropique »), on choisit préférentiellement une valeur de k impaire afin d'éviter les situations d'égalité lors du vote à la majorité.
Exercice 4Banque PT Modelisation PT 2026, Q47
Soient deux points A et B repérés par leurs coordonnées (f_A, \text{dB}_A) et (f_B, \text{dB}_B). La distance euclidienne canonique dans cet espace bidimensionnel s'écrit :
d(A, B) = \sqrt{(f_A - f_B)^2 + (\text{dB}_A - \text{dB}_B)^2}On peut donc implémenter la fonction
distance_euclidiennesous la forme suivante :def distance_euclidienne(A, B): freq_A, dB_A = A freq_B, dB_B = B return ((freq_A - freq_B)**2 + (dB_A - dB_B)**2)**0.5Exercice 5Banque PT Physique A PT 2022, Q12
D'après le panneau de réglage de l'oscilloscope, le sélecteur de balayage horizontal indique une sensibilité temporelle :
b = 5\ \mu\text{s}\cdot\text{div}^{-1}Sur l'écran, le signal comporte deux périodes complètes sur la largeur totale de 10\text{ divisions}. Une période s'étend donc sur :
N = 5{,}0\text{ div}La période T du signal acoustique est alors :
T = N \cdot b = 5{,}0 \times 5\ \mu\text{s} = 25\ \mu\text{s} = 25 \times 10^{-6}\text{ s}On en déduit la fréquence f des signaux émis :
\begin{aligned} f &= \frac{1}{T} = \frac{1}{25 \times 10^{-6}\text{ s}} = 4{,}0 \times 10^4\text{ Hz} = 40\text{ kHz} \end{aligned}\boxed{f = 40\text{ kHz}}La fréquence étant strictement supérieure à la limite supérieure de l'audition humaine (20\text{ kHz}), le signal appartient au domaine des ultrasons (ondes ultrasonores).
Résultat
Exercice 6Banque PT Modelisation PT 2026, Q48
Voici une implémentation en Python réalisant une recherche itérative des k plus proches voisins en complexité \mathcal{O}(k \cdot n) (où n est la taille de la liste
distances) sans recourir à des fonctions de tri prédéfinies :def plus_proches(distances, k): """ Retourne la liste des indices des k plus petites distances sans utiliser de fonction de tri prédéfinie. """ indices = [] n = len(distances) for _ in range(k): idx_min = None for i in range(n): if i not in indices: if idx_min is None or distances[i] < distances[idx_min]: idx_min = i indices.append(idx_min) return indicesExercice 7Banque PT Modelisation PT 2026, Q49
1. Analyse de la qualité des prédictions : D'après la matrice de confusion, sur un échantillon total de :
N_{\text{total}} = 52 + 13 + 22 + 48 = 135 \text{ sons}le modèle réalise 52 + 48 = 100 bonnes prédictions (éléments diagonaux) et 13 + 22 = 35 erreurs (éléments hors diagonale).
La figure 11 montre que les erreurs de classification (marquées par des croix) sont concentrées dans la zone intermédiaire (fréquences comprises entre 10^2\text{ Hz} et 2\cdot 10^3\text{ Hz} et niveaux sonores entre 150\text{ dB} et 190\text{ dB}). D'après la figure 10, il s'agit précisément de la région où les signatures spectrales des sources anthropiques (navires, opérations industrielles) et animales (dauphins, baleines) se chevauchent.
Le modèle offre ainsi des résultats encourageants (nettement supérieurs à une prédiction aléatoire à 50\,\%) mais reste perfectible, avec un taux d'erreur non négligeable d'environ 26\,\%.
2. Précision globale (ou taux d'exactitude / accuracy) : Elle correspond au rapport du nombre de prédictions correctes sur le nombre total d'enregistrements :
\text{Précision globale} = \frac{52 + 48}{135} = \frac{100}{135} = \frac{20}{27} \approx 0{,}741\boxed{\text{Précision globale} \approx 74\,\%}3. Précisions pour chacune des origines : Selon la convention standard des matrices de confusion (les lignes correspondent aux classes réelles et les colonnes aux classes prédites), on distingue deux interprétations courantes :
Au sens de la précision en apprentissage automatique (proportion de prédictions positives correctes pour chaque classe) :
Pour la première classe (colonne 1, ex. Animale) :
P_1 = \frac{52}{52 + 22} = \frac{52}{74} \approx 0{,}703 \quad\implies\quad \boxed{P_1 \approx 70\,\%}Pour la seconde classe (colonne 2, ex. Anthropique) :
P_2 = \frac{48}{48 + 13} = \frac{48}{61} \approx 0{,}787 \quad\implies\quad \boxed{P_2 \approx 79\,\%}
Au sens du taux de bon classement par origine (sensibilité ou rappel, par rapport aux classes réelles) :
Pour la première classe réelle (ligne 1) :
R_1 = \frac{52}{52 + 13} = \frac{52}{65} = 0{,}800 \quad\implies\quad \boxed{R_1 = 80\,\%}Pour la seconde classe réelle (ligne 2) :
R_2 = \frac{48}{48 + 22} = \frac{48}{70} \approx 0{,}686 \quad\implies\quad \boxed{R_2 \approx 69\,\%}
Résultat
Exercice 8Banque PT Modelisation PT 2026, Q50
Plusieurs pistes permettent d'améliorer significativement les performances du modèle :
Normalisation ou standardisation des descripteurs (étape primordiale) : La fréquence varie sur plusieurs ordres de grandeur (de 10^1 à plus de 10^4\text{ Hz}), tandis que le niveau sonore n'évolue qu'entre 120 et 250\text{ dB}. Sans mise à l'échelle, les écarts en fréquence dominent écrasantement le calcul de la distance euclidienne. Il convient donc :
- soit de passer la fréquence à l'échelle logarithmique (\log_{10}(f)), ce qui correspond à la représentation naturelle de la figure 10 ;
- soit d'appliquer une standardisation (centrage-réduction : \frac{X - \mu}{\sigma}) ou une normalisation Min-Max (mise à l'échelle sur [0, 1]) à chaque descripteur.
- Optimisation de l'hyperparamètre k : Sélectionner la valeur optimale de k par validation croisée (par exemple validation croisée à K plis) sur le jeu d'entraînement, afin de minimiser le taux d'erreur et d'assurer un bon compromis biais-variance.
- Pondération des votes selon la distance : Attribuer un poids proportionnel à l'inverse de la distance (w_i = 1/d_i) au vote de chaque voisin afin de donner plus d'importance aux exemples les plus proches du point à classifier.
Enrichissement des données et des descripteurs :
- Extraire des caractéristiques acoustiques supplémentaires à partir des signaux audio temporels (durée du signal, bande passante, centroïde spectral, coefficients MFCC) ;
- Augmenter le volume et la représentativité de la base d'apprentissage afin de mieux couvrir les zones de recouvrement entre bruits anthropiques et animaux.
Corrigés rédigés et vérifiés par WikiPrépa. Notre méthode
WikiPrépa · wikiprepa.fr/concours · Corrigés WikiPrépa · Questions : discord.gg/HjBymsrYuR