WikiPrépaLivrets

CCINP Informatique Commune TSI 2020Sujet, corrigé et rapport du jury

Pas encore noté
  • Manipulation de chaînes de caractères
  • Complexité et terminaison d'algorithmes
  • Algorithmes dichotomiques
  • Tri par insertion
  • Récursivité
  • Bases de données et requêtes SQL

Téléchargements

Présentation du sujet

Informatique commune TSI : autour du séquençage du génome
Afficher ou masquer la section

Le sujet, construit autour du séquençage du génome, comporte trois parties indépendantes. La première génère une séquence d'ADN, la seconde recherche un motif dans une séquence par plusieurs algorithmes (naïf, Knuth-Morris-Pratt, fonctions de hachage), la troisième exploite une base de données de bactéries phytopathogènes.

  1. 1Partie I : génération d'une séquence d'ADNpremière annéeManipulation de chaînes de caractères pour générer et manipuler une séquence.
  2. 2Partie II : recherche d'un motifdeuxième annéeComparaison de l'algorithme naïf, de l'algorithme de Knuth-Morris-Pratt, d'un algorithme sur liste et des fonctions de hachage (Karp-Rabin, évaluation de polynôme par la méthode de Horner).
  3. 3Partie III : Collection française de bactéries phytopathogènespremière annéeManipulation d'une base de données simple à l'aide de requêtes.

L'épreuve en chiffres

Moyenne 10,68 / 20 · écart-type 4,11 · 1 230 présents · où vous situez-vous ?
Afficher ou masquer la section
Moyenne
10,68/ 20
Écart-type
4,11
Présents
1 230
Coefficient
5
Durée
3 h
moyenne 10,6805101520
Deux tiers des copies environ (moyenne ± écart-type)

Votre note sur 20 à ce sujet, en conditions de concours.

Source : document officiel du concours, épreuve du 4 juillet 2020. Notes publiées par le concours (après harmonisation le cas échéant). Courbe : estimation par une loi normale.

Ce qu'a observé le jury

5 erreurs relevées
Notion de terminaison mal maîtrisée · Confusion chaîne de caractères / liste · Tri par insertion mal appliqué
Afficher ou masquer la section

Les correcteurs constatent une nette progression sur la qualité et le volume des réponses données, l'ensemble des questions du sujet étant souvent abordé. Ils regrettent toutefois que trop de candidats ne lisent pas le sujet avec attention et relèvent encore de nombreuses erreurs de syntaxe Python.

Les erreurs les plus sanctionnées

  1. 1
    Notion de terminaison mal maîtriséeQ4

    De nombreux candidats ne connaissent pas la notion de terminaison, et seule la moitié de ceux qui la connaissent réussissent à la justifier correctement.

  2. 2
    Confusion chaîne de caractères / listeQ10

    Trop de confusions entre chaîne de caractères et liste ; ce n'est pas au correcteur de choisir la bonne réponse.

  3. 3
    Tri par insertion mal appliquéQ14

    L'algorithme de tri par insertion est un tri sur place, il ne s'agit donc pas de créer une liste annexe pour récupérer des données triées.

  4. 4
    Complexité de la dichotomie non justifiéeQ16

    Certains candidats confondent la méthode dichotomique avec la recherche du zéro d'une fonction, et affirment qu'un algorithme est meilleur sans connaître sa complexité en log(n).

  5. 5
    Oubli du group byQ24

    Beaucoup de candidats ont oublié le group by dans la rédaction de la requête.

Ce qui a été bien réussi

  • Les bases de données étaient intentionnellement simples et ont permis à de nombreux candidats de gagner des points en faisant preuve de rigueur dans la syntaxe.
  • Les questions 8, 9, 12 et 15 ont été très bien ou bien traitées.
  • La question 22, très facile, a été réussie par la plupart des candidats.

Conseils du jury

  • Lire le sujet avec attention avant de répondre, en particulier pour la précision des entrées et sorties attendues.
  • Soigner l'indentation, la syntaxe des affectations et des tests, et ne pas confondre procédure et fonction.
  • Justifier précisément l'intérêt ou la complexité d'un algorithme plutôt que de se contenter d'une affirmation générale.

Synthèse rédigée par WikiPrépa à partir du rapport officiel du jury (à télécharger en PDF). Les citations sont extraites du rapport.

Ces sujets peuvent vous intéresser

Lecture du sujet en ligne

L'énoncé complet, avec les formules et les figures, sans ouvrir le PDF.
Afficher ou masquer la section

ÉPREUVE SPÉCIFIQUE - FILIÈRE TSI

INFORMATIQUE

Mercredi 6 mai : 8 h-11 h

N.B. : le candidat attachera la plus grande importance à la clarté, à la précision et à la concision de la rédaction. Si un candidat est amené à repérer ce qui peut lui sembler être une erreur d'énoncé, il le signalera sur sa copie et devra poursuivre sa composition en expliquant les raisons des initiatives qu'il a été amené à prendre.

RAPPEL DES CONSIGNES

  • Utiliser uniquement un stylo noir ou bleu foncé non effaçable pour la rédaction de votre composition ; d'autres couleurs, excepté le vert, peuvent être utilisées, mais exclusivement pour les schémas et la mise en évidence des résultats.
  • Ne pas utiliser de correcteur.
  • Écrire le mot FIN à la fin de votre composition.

Les calculatrices sont interdites

Le sujet est composé de trois parties, toutes indépendantes.

Seul le document réponse est à rendre.

Le sujet comporte :
  • le texte du sujet et une annexe, 7 pages,
  • le Document Réponse (DR) à rendre en fin d'épreuve, 12 pages.
Important : vous pouvez utiliser les fonctions des questions précédentes, même si vous ne les avez pas toutes démontrées.
Vous devez répondre directement sur le Document Réponse, soit à l'emplacement prévu pour la réponse lorsque celle-ci implique une rédaction, soit en complétant les différents programmes en langage Python.

Autour du séquençage du génome

Dans ce sujet, on s'intéresse à la recherche d'un motif dans une molécule d'ADN. Une molécule d'ADN est constituée de deux brins complémentaires, qui sont un long enchaînement de nucléotides de quatre types différents désignés par les lettres A, T, C et G . Les deux brins sont complémentaires : "en face" d'un 'A', il y a toujours un 'T' et "en face" d'un 'C', il y a toujours un ' G '. Pour simplifier le sujet, on va considérer qu'une molécule d'ADN est une chaîne de caractères sur l'alphabet {A, C, G, T} (on s'intéresse donc seulement à un des deux brins). On parlera de séquence d'ADN.

Partie I - Génération d'une séquence d'ADN

On considère la chaîne de caractère seq='ATCGTACGTACG'.
Q1. Que renvoie la commande seq [3] ? Que renvoie la commande seq [2:6] ?
Les fonctions que nous allons construire par la suite devront prendre en paramètre une chaîne de caractères ne contenant que des ' A ', ' C ', ' G ' et ' T ' (ceci correspond à une séquence d' ADN). Nous allons commencer par construire aléatoirement une séquence d'ADN.
Pour générer aléatoirement une séquence d'ADN composée de n caractères, on utilisera le principe suivant.
  1. On commence par créer une chaîne de caractères vide.
  2. Puis on tire aléatoirement n chiffres compris entre 1 et 4 et
  • si on obtient un 1, alors on ajoute un 'A' à notre chaîne de caractères;
  • si on obtient un 2, alors on ajoute un 'C' à notre chaîne de caractères;
  • si on obtient un 3, alors on ajoute un 'G' à notre chaîne de caractères;
  • si on obtient un 4, alors on ajoute un 'T' à notre chaîne de caractères.
  1. On renvoie la chaîne de caractères ainsi construite.
Q2. Écrire une fonction generation() qui prend en paramètre un entier n et qui renvoie une chaîne de caractères aléatoires de longueur n ne contenant que des 'A', 'C', 'G' et 'T'. On pourra utiliser les fonctions random() ou randint() détaillées en annexe.
Q3. Que fait la fonction mystere(seq) qui prend en argument une séquence d'ADN'seq' (une chaîne de caractères ne contenant que des 'A', 'C', 'G' et 'T')? Le code de la fonction mystere() se trouve dans le DR 3.
Q4. Quelle est la complexité de la fonction mystere()? Donner le nom de la variable permettant de montrer la terminaison de l'algorithme (on justifiera le raisonnement).

Partie II - Recherche d'un motif

Soit une chaîne de caractères S = 'ACTGGTCACT', on appelle sous-chaîne de caractères de S une suite de caractères incluse dans S . Par exemple, 'TGG' est une sous-chaîne de S mais 'TAG' n'est pas une sous-chaîne de S .
Il s'agit d'une problématique classique en informatique, qui répond aux besoins de nombreuses applications.
On trouve plus de 100 algorithmes différents pour cette même tâche, les plus célèbres datant des années 1970, mais plus de la moitié ont moins de 10 ans.
Dans cette partie, nous allons d'abord nous intéresser à l'algorithme naïf (sous-partie II.1), puis à deux autres algorithmes : l'algorithme de Knuth-Morris-Pratt (sous-partie II.2), et un algorithme utilisant une structure de liste (sous-partie II.3) et enfin, aux fonctions de hachage (sous-partie II.4).
Les différentes sous-parties sont indépendantes.

II. 1 - Algorithme naïf

Principe de l'algorithme naïf

On parcourt la chaîne. À chaque étape, on regarde si on a trouvé le bon motif. Si ce n'est pas le cas, on recommence avec l'élément suivant de la chaîne de caractères.
Cet algorithme a une complexité en O(nm) avec n, la taille de la chaîne de caractère et m, la taille du motif.
Q5. Écrire une fonction recherche() qui à une sous-chaîne de caractères M et une chaîne de caractères S renvoie -1 si M n'est pas dans S, et la position de la première lettre de la chaîne de caractères M si M est présente dans S.
Cet algorithme doit correspondre à l'algorithme naïf.
Q6. Combien faut-il d'opérations pour chercher un motif de 50 caractères dans une séquence d'ADN en utilisant l'algorithme naïf ? On supposera qu'une séquence d'ADN est composée de 3 ⋅ 10^9 caractères.
En combien de temps un ordinateur réalisant 10^(12) opérations par seconde fait-il ce calcul?
En génétique, on utilise des algorithmes de recherche pour identifier les similarités entre deux séquences d'ADN. Pour cela, on procède de la manière suivante :
  • découper la première séquence d'ADN en morceaux de taille 50;
  • rechercher chaque morceau dans la deuxième séquence d'ADN.
Q7. En utilisant les calculs précédents, combien de temps faut-il pour un ordinateur réalisant 10^(12) opérations par seconde pour comparer deux séquences d'ADN avec l'algorithme naïf? Vous semble-t-il intéressant d'utiliser l'algorithme de recherche naïf?

II. 2 - Algorithme de Knuth-Morris-Pratt (1970)

Lorsqu'un échec a lieu dans l'algorithme naïf, c'est-à-dire lorsqu'un caractère du motif est différent du caractère correspondant dans la séquence d'ADN, la recherche reprend à la position suivante en repartant au début du motif. Si le caractère qui a provoqué l'échec n'est pas au début du motif, cette recherche commence par comparer une partie du motif avec une partie de la séquence d'ADN qui a déjà été comparée avec le motif. L'idée de départ de l'algorithme de Knuth-Morris-Pratt est d'éviter ces comparaisons inutiles. Pour cela, une fonction annexe qui recherche le plus long préfixe d'un motif qui soit aussi un suffixe de ce motif est utilisée.
Avant d'étudier l'algorithme de Knuth-Morris-Pratt (sous-partie II.2.b) nous allons définir les notions de préfixe et suffixe (sous-partie II.2.a).

II.2.a Préfixe et suffixe

Un préfixe d'un motif M est un motif u, différent de M, qui est un début de M.
Par exemple, 'mo' et 'm' sont des préfixes de 'mot', mais 'o' n'est pas un préfixe de 'mot' .
Un suffixe d'un motif M est un motif u, différent de M, qui est une fin de M.
Par exemple, 'ot' et 't' sont des suffixes de 'mot', mais 'mot' n'est pas un suffixe de 'mot'.
Q8. Donner tous les préfixes et les suffixes du motif 'ACGTAC'.
Q9. Quel est le plus grand préfixe de 'ACGTAC' qui soit aussi un suffixe?
Quel est le plus grand préfixe de 'ACAACA' qui soit aussi un suffixe?

II.2.b Algorithme de Knuth-Morris-Pratt

Nous rappelons que l'algorithme de Knuth-Morris-Pratt (KMP) est une fonction de recherche qui utilise une fonction annexe prenant en argument une chaîne de caractères M dont on notera la longueur m.
Cette fonction annexe, appelée fonctionannexe(), doit permettre, pour chaque lettre à la position i , de trouver le plus grand sous-mot de M qui finit par la lettre M[i] (c'est donc le plus grand suffixe de M[ : i + 1] ) qui soit aussi un préfixe de M .
Le code de fonctionannexe() se trouve à la question Q11 du DR 6.
Q10. Quel est le type de la sortie de la fonction fonctionannexe()?
Q11. Une ou des erreurs de syntaxe s'est (se sont) glissée(s) dans la fonction fonctionannexe(). Identifier la ou les erreur(s) et corriger la fonction pour qu'il n'y ait plus de message d'erreur quand on compile la fonction.
Q12. Décrire l'exécution de la fonction fonctionannexe() lorsque M='ACAACA' en précisant sur le DR 6, pour les six premiers tours dans la boucle while, à la sortie de la boucle, le contenu des variables : i, j et F.
Q13. Expliquer et commenter les groupements de lignes de l'algorithme KMP donnés dans le DR 7.

II. 3 - Algorithme utilisant la structure de liste

Une autre possibilité pour chercher un motif dans une chaîne de caractères (ou séquence d'ADN) est de construire une liste contenant tous les sous-motifs de notre chaîne, triés par ordre alphabétique, puis de faire la recherche dans cette liste.
Par exemple, à la chaîne 'CATCG', on peut lui associer la liste :
['C','A','T','G','CA','AT','TC','CG','CAT','ATC','TCG','CATC','ATCG','CATCG'] que l'on peut ensuite trier pour obtenir la liste :
['A','AT','ATC','ATCG','C','CA','CAT','CATC','CATCG','CG','G','T','TC','TCG'].
La première étape de cette méthode est donc de trier une liste.
Q14. Écrire une fonction triinsertion() de tri par insertion d'une liste de nombres.
Q15. Comment peut-on adapter la fonction triinsertion() à une liste de chaîne de caractères?
Après avoir obtenu une liste triée, on peut faire une recherche dichotomique dans cette nouvelle liste.
Q16. Écrire une fonction recherchedichotomique() de recherche dichotomique dans une liste de nombres triés.
Quel est l'intérêt de ce type d'algorithme (on parlera de complexité)?

II. 4 - Fonction de hachage et évaluation de polynôme

II.4.a Fonction de hachage, algorithme de Karp-Rabin

Certains algorithmes, comme l'algorithme de Karp-Rabin (1987), utilisent une fonction de hachage h qui à un motif renvoie une valeur numérique.
Voici un exemple de fonction de hachage :
  • à chaque caractère de l'alphabet, on associe une valeur. Ici, on va associer à 'A' la valeur 0 , à 'C' la valeur 1, à 'G' la valeur 2 et à 'T' la valeur 3. Pour un motif de taille n, on obtient donc une suite de chiffre a_(n − 1)…a_1 a_0. Par exemple, à la chaîne 'TAGC', on lui associe la suite de chiffre 3021;
  • cette suite de chiffre est considérée comme l'écriture d'un entier en base b, où b est le nombre de caractères présents dans l'alphabet. On a donc ici b = 4;
  • on calcule ensuite cet entier en base 10 (on calcule donc a_(n − 1)b^(n − 1) + … + a_1 b^1 + a_0 b^0 );
  • puis on calcule le reste de la division euclidienne de ce nombre par 13.
Q17. On ne considère que des motifs de taille 3. Que renvoie la fonction de hachage avec les motifs 'CCC', 'ACG', 'GAG'? On détaillera les calculs.
Dans cette fonction de hachage, nous avons besoin de transformer un entier en base b en un entier en base 10 . On remarque que l'on peut éventuellement faire ce calcul en évaluant un polynôme.

II.4.b Évaluation de polynôme, Algorithme de Hörner

Dans cette sous-partie, nous allons nous intéresser à l'évaluation d'un polynôme et de son coût lorsque l'on compte les multiplications, les additions et les affectations comme des opérations unitaires.
Soit P = ∑_(k = 0)^n a_k X^k un polynôme, il sera représenté par la liste [a_n, …, a_0].
Q18. Écrire une fonction eval() ayant pour paramètre un polynôme P (donc une liste de nombres [a_n, …, a_0] ) et un nombre b. Cette fonction doit renvoyer la valeur de P en b, c'est-à-dire calculant :
P(b) = ∑_(k = 0)^n a_k b^k
En admettant que le calcul de b^k utilise k − 1 multiplications, on trouve une complexité quadratique. On peut être plus astucieux en utilisant l'algorithme de Hörner qui se base sur l'égalité suivante :
P(X) = ((…((a_n X + a_(n − 1))X + a_(n − 2))X + …)X + a_1)X + a_0.
Plus précisément, pour évaluer P en b, on commence par calculer a_n × b + a_(n − 1), puis on multiplie le résultat par b et on ajoute a_(n − 2), etc. On trouvera alors une complexité linéaire.
Q19. Écrire une fonction itérative hornerit() ayant pour paramètres un polynôme P, sous forme de liste, ainsi qu'un réel b, et renvoyant P(b) en utilisant l'algorithme de Hörner.
Q20. Compléter la fonction hornerrec() pour avoir une fonction récursive qui évalue un polynôme en utilisant l'algorithme de Hörner.

Partie III - Collection Française de Bactéries Phytopathogènes

La Collection Française de Bactéries Phytopathogènes (CFBP) possède deux bases de données :
  • l'une, appelée Echantillon, qui permet de stocker les différents échantillons d'ADN;
  • l'autre, appelée Sequence, qui permet de mémoriser quelle personne est responsable de l'obtention de la séquence (i.e. de l'extraction d'un gène particulier dans les différents échantillons d'ADN).
    Des extraits des tables Echantillon et Sequence sont données par les tableaux 1 et 2.
Echantillon
ADN Genre Espèce Sous-espèce
309 Pseudomonas syringae morsprunorum
…
3589 Pseudomonas syringae vignae
…
Tableau 1 - Table recensant toutes les séquences d'ADN dont dispose la CFBP
Sequence
Code Date ADN Gène Protocole Employé
A ^′ 01 − 03 − 2018^′ 309 gyrB Spilker Dupont
B ^′ 01 − 03 − 2018^′ 2028 recA Cesbron and Manceau Martin
… … … … … …
AGZ ^′ 10 − 03 − 2018^′ 2028 leuS Deletoile Martin
… … … … … …
Tableau 2 - Table recensant tous les travaux réalisés à la CFBP en mars 2018
Q21. Définir le but et le résultat de la requête(1), écrite en SQL :
SELECT count(*) FROM Sequence WHERE Date='01-03-2018'
Q22. Écrire en SQL la requête(2), donnée en algèbre relationnel :
π_(ADN)(σ_(Gène) = 'leus' (Sequence)).
Q23. Écrire en SQL la requête(3) qui permet d'obtenir la liste des espèces étudiées par M. Martin le 10 mars 2018.
Q24. Écrire en SQL la requête(4) permettant d'obtenir le nombre d'échantillons prélevés par chaque employé.

ANNEXE - Librairie numpy

random() : génère un nombre pseudo-aléatoire compris entre 0 et 1 .
randint(a, b) : génère un entier aléatoire tel que a ≤ randint(a, b) < b.

FIN


J. 201173

Autour du séquençage du génome

Document Réponse

Q1

seq='ATCGTACGTACG'
seq[3]
Que renvoie cette commande Python?
seq='ATCGTACGTACG'
seq[2:6]
Que renvoie cette commande Python?

NE RIEN ÉCRIRE DANS CE CADRE

Q2

1 def generation(n):
2 seq =
Q3
def mystere(seq):
    $a, b, c, d=0,0,0,0$
    i = len(seq)-1
    while $\mathrm{i}>=0$ :
        if seq[i]=='A':
            a += 1
            i -= 1
        elif seq[i]=='C':
            b += 1
            i -= 1
        elif seq[i]=='G':
            C $+=1$
            i -= 1
        else:
            d += 1
            i -= 1
    return $\left[a_{*} 100 / l e n(s e q), b_{*} 100 / l e n(s e q), c_{*} 100 / l e n(s e q), d_{*} 100 / l e n(s e q)\right]$
Réponse :

Q4

Q4
Complexité
Terminaison : nom de la variable :
justification :



Q5

1 def recherche(M,T):

Q6

Nombre d'opérations pour chercher un motif de 50 caractères :
Temps mis par l'ordinateur :

Q7

Temps pour comparer deux séquences d'ADN :
Est-ce intéressant d'utiliser cette méthode?


J. 201173

Q8

Préfixes de 'ACGTAC' :
Suffixes de 'ACGTAC' :

Q9

Plus grand préfixe de 'ACGTAC' qui soit aussi un suffixe :
Plus grand préfixe de 'ACAACA' qui soit aussi un suffixe :

Q10

Type de la variable en sortie :

Q11

Corriger la fonction suivante pour qu'il n'y ait plus de message d'erreur quand on compile la fonction.
def fonctionannexe(M):
    F=[0]
    i=1
    j=0
    while i <m :
        if M[i]=M[j] :
            F.append(j+1)
            i=i+1
            j=j+1
        else
            if j>0 :
                j=F[j-1]
            else:
                F.append(0)
                i=i+1
    return F

Q12

Initialisation : i = 1; j = 0; F = [0]
Fin du premier passage dans la boucle while : i = …; j = …; F = ………….. . …;
Fin du deuxième passage dans la boucle while : i = …; j = …; F = ………….. ;
Fin du troisième passage dans la boucle while : i = …; j = …; F = ………..….. ;
Fin du quatrième passage dans la boucle while : i = …; j = …; F = ………….. ;
Fin du cinquième passage dans la boucle while : i = …; j = …; F = …………. …;
Fin du sixième passage dans la boucle while : i = …; j = …; F = ………….. ;
Algorithme KMP :
def KMP(M,T):
    F=fonctionannexe(M)
    i=0
    j=0
    while i < len(T) :
        if T[i]==M[j]:
            if j==len(M)-1:
                return(i-j)
            else:
                i=i+1
                j=j+1
        else:
            if j > 0:
                j=F[j-1]
            else:
                i=i+1
    return -1
Explication de la ligne 2 :

Explication des lignes 3 et 4 :

Quelles lignes correspondent au cas où on a trouvé le mot?
Que fait le programme dans ce cas ?

Quelles lignes correspondent au cas où on a trouvé deux lettres identiques?

Que fait le programme dans ce cas?

Quelles lignes correspondent au cas où on a trouvé deux lettres différentes?

Que fait le programme dans ce cas ?

Q14
1 def triinsertion(L):
Q15





J. 201173
Q16
1 def recherchedichotomique(a,L):
Intérêt de ce type d'algorithme :

h('CCC') :

h('ACG') :

h('GAG') :
Q18
1 def eval(P,b):
1 def hornerit(P, b):
Q20
1 def hornerrec(P,b):
2 if
if
return
3
4 else:
5
6
s = P[len(P) − 1]
s1 = P[0:len(P)-1]
7
return

Q21

But de la requête(1) :
Requête(2) =
Q23
Requête(3) =
Q24
Requête(4) =

Questions fréquentes

3 questions
Sur quels chapitres porte l'épreuve d'informatique commune TSI 2020 ?
Afficher ou masquer la section

Sur quels chapitres porte l'épreuve d'informatique commune TSI 2020 ?

Elle porte sur la manipulation de chaînes de caractères, la complexité et la terminaison d'algorithmes, la recherche de motifs (algorithme naïf, Knuth-Morris-Pratt, hachage), le tri par insertion, la récursivité et les bases de données.

Quelles erreurs le jury a-t-il le plus relevées à l'informatique commune TSI 2020 ?

Une notion de terminaison mal maîtrisée, des confusions entre chaîne de caractères et liste, un tri par insertion mal appliqué et de nombreuses erreurs de syntaxe Python comme l'oubli des deux-points après if.

Le sujet d'informatique commune TSI 2020 est-il faisable en première année ?

Une partie du sujet mobilise des notions de première année comme la manipulation de chaînes de caractères et les bases de données, mais il recourt aussi au tri et à la récursivité, vus en deuxième année.

Pas de description pour le moment