| UNIVERSITE D’ORLEANS | Année 2024-2025 | |
|---|---|---|
| M2 MAS | Estimation fonctionnelle |
Vous disposez de 2 heures. Les exercices peuvent être faits dans le désordre. vous pouvez vous servir des résultats donnés dans les énoncés des questions précédentes même si vous ne les avez pas démontrés. Tous les documents de cours et de travaux dirigés sont autorisés. Le barême est donné à titre indicatif.
Vous déposerez tout votre dossier de travail, contenant en particulier le .Rmd et le .html, sur CELENE.
Commencez par charger la librairie sm et sourcer les commandes contenues dans les fichiers npfda.R.
Merci de lire très attentivement le sujet afin de ne pas perdre de temps.
Un vieux pirate s’apprête à prendre sa retraite et souhaite que son trésor, amassé au cours de toute sa vie, revienne à sa descendance. Fatigué par les querelles incessantes que se livrent ses deux fils pour savoir qui d’entre eux est le plus grand pirate, il n’arrive pas à savoir comment il doit répartir son héritage. C’est alors qu’il a une idée…
Il convoque séparément chacun d’entre eux et leur donne une partie des données recueillies au cours du temps lors de l’expédition au cours de laquelle le trésor a été caché :
le fils aîné reçoît des relevés de longitude et de profondeur.
le fils cadet reçoît des relevés de latitude et de profondeur.
Il indique enfin à chacun d’entre eux, avec un petit sourire en coin, “une croix marque l’emplacement du trésor” et “en suivant mes pas vous trouverez le code (à 7 caractères) qui vous permettra d’ouvrir le coffre”.
Commencez par charger l’espace de travail PIRATES.RData.
Il contient 4 variables:
t : instants de mesure
x : coordonnées de latitude (relatives)
y : coordonnées de longitude (relatives)
p: coordonnées de profondeur du fond marin (altitude du sol pour les valeurs positives)
On étudie tout d’abord les données communes aux deux fils afin de mieux comprendre ce qu’elles contiennent.
Quelle est la nature des données? Quelle est la taille de l’échantillon? Discuter en quelques lignes l’intérêt d’une approche non-paramétrique à ce moment de l’étude. (0.75 pt)
Donner l’expression de l’estimateur à noyau de la densité. Démontrez que si le noyau K est une densité, alors cela est également vrai pour l’estimateur. (1 pt)
Représenter dans un même graphique les estimateurs à noyau de la fonction de régression de la variable p sur la variable t en utilisant successivement comme paramètre de lissage les valeur 0.002, 0.02, 2 et celui fourni par validation croisée (on utilisera les options nbins=0). Commentez l’effet du paramètre de lissage au travers des graphiques obtenus. (1.25 pt)
Estimer la profondeur pour \(t_0=3.23032\). Que remarquez-vous concernant le signe du résultat ? Qu’est-ce que cela signifie? (0.5 pt)
On n’utilisera dans cette partie que les variables t, y, et p dont dispose le fils aîné. Soucieux de parvenir au trésor avant son cadet, il tente de voir ce qu’il peut retirer des données dont il dispose…
Représenter le nuage de points correspondant aux relevés de longitude (en fonction du temps). Commenter le résultat obtenu. (0.5 pt)
Estimer non-paramétriquement la fonction de régression \(y = r_Y(t)+ \epsilon\) en chacun des instants de mesure. Enregistrer les résultats obtenus sous le nom \(y_e\). (1 pt)
BONUS Proposer une modélisation paramétrique de la fonction \(r_Y\) et la représenter sur le nuage de points de la question précédente (Indication: on pourra faire une régression linéaire de y sur sin(t)). On pourra enregistrer les valeurs ajustées sous le nom \(y_ep\). Commenter le résultat obtenu en comparant graphiquement \(y_ep\) et \(y\). (1 pt)
On n’utilisera dans cette partie que les variables t ,x, et p dont dispose le fils cadet. Soucieux de parvenir au trésor avant son aîné, il tente de voir ce qu’il peut retirer des données dont il dispose…
Représenter le nuage de points correspondant aux relevés de latitude (en fonction du temps). Commenter le résultat obtenu. (0.5 pt)
Estimer non-paramétriquement la fonction de régression \(x = r_X(t)+\epsilon\) en chacun des instants de mesure et les enregistrer sous le nom \(x_e\). (1 pt)
BONUS Etant passionné de trigonométrie, le fils cadet se dit que \(r_X(t)\) peut être modélisé comme une combinaison linéaire de cos(t) et cos(t/2). Proposer, à partir de cette remarque, une modélisation paramétrique de la fonction \(r_X\) et la représenter sur le nuage de points de la question précédente (Indication: on pourra faire une régression linéaire de x sur cos(t) et cos(t/2)). On pourra enregistrer les valeurs ajustées sous le nom \(x_ep\). Commenter le résultat obtenu en comparant graphiquement \(x_ep\) et \(x\). (1 pt)
Les deux frères ne parvenant pas à trouver séparément l’emplacement du trésor, ils décident finalement de mettre de côté leur rivalité pour le rechercher ensemble en mettant en commun ce qu’ils ont pu retirer des données en leur possession.
Représenter le nuage de points correspondant aux couples (latitude,longitude). Commenter le résultat obtenu. Permet-il de donner l’emplacement du trésor? Quel est le code du coffre? (0.5 pt)
Faire de même avec les données (\(x_e\),\(y_e\)) obtenues en estimant \(r_X\) et \(r_Y\) par chacun des fils. Commenter le résultat obtenu. Permet-il de donner l’emplacement du trésor? Quel est le code du coffre? (0.75 pt)
BONUS Ajouter au graphique précédent celui que l’on obtient à partir des modélisations paramétriques proposées en A.3 et B.3. Commenter le résultat obtenu. (0.5 pt)
BONUS On peut montrer, à l’aide des questions A.3 et B.3, que le trésor a été caché à l’instant \(t =\pi\) ou \(t=3\times \pi\). En déduire une nouvelle estimation de l’emplacement du trésor à l’aide des modélisations proposées en A.3 et B.3. (0.5 pt)
Afin de savoir comment naviguer jusqu’à l’emplacement du trésor, les deux frères mettent en commun leurs données pour tenter de reconstruire la carte de la profondeur en fonction de la longitude et de la latitude : \(p = r_{XY}(x,y) + \epsilon\). Estimer non-paramétriquement \(r_{XY}\) sur la zone \([-2; 4] \times [-0.8, 0.8]\) avec des mailles de 0.03 × 0.008 (on pensera à utiliser les options eval.grid=TRUE eval.points=cbind(seq(-2,4,0.03),seq(-0.8,0.8,0.008)), structure.2d=‘separate’ et nbins=0). Enregistrer les valeurs estimées sous le nom RXY puis taper la commande image(RXY>0,col=c(‘blue’,‘brown’)). Commenter le résultat obtenu. (0.75 pt)
Donner une estimation de la profondeur à laquelle est enfoui le trésor. On pensera à utiliser les options eval.points=cbind(xe,ye), eval.grid=FALSE, structure.2d=‘separate’ et nbins=0 et la valeur estimée correspondant à ind_c renvoyé par Find_cross. Les deux frères doivent-ils emporter leur scaphandre? Aviez-vous besoin d’estimer \(r_{XY}\) pour le savoir? (1 pt)
Les ossements d’un canidé ayant vécu il y a de nombreuses années ont été découvert à Jussac. Ne parvenant pas à déterminer si ces os correspondent à un chien ou bien à unloup, des scientifiques souhaitent comparer les mensurations du crâne de l’animal découvert avec celles de différents chiens et loups (échantillon d’apprentissage). Ils espèrent ainsi parvenir à déterminer si les os trouvés à Jussac sont ceux d’un chien ou d’un loup.
Commencez par charger l’espace de travail Jussac.RData.
Il contient 8 variables :
– Type : Type de canidé (Chien ou Loup)
– LCB : longueur condylo-basale
– LMS : longueur de la mâchoire supérieure
– LBM : largeur bi-maxilaire
– LP : longueur de la carnassière supérieure
– LM : longueur de la première molaire supérieure
– LAM : largeur de la première molaire supérieure
– Jussac : valeurs des six variables ci-dessus pour le specimen de Jussac
Le dataframe Quant contient uniquement les variables quantitatives.
Décrire la nature des données, la taille de l’échantillon et le type de problème considéré. (0.75 pt)
Donnez la définition du classifieur de Bayes. Peut-on l’utiliser directement ici ? Expliquez comment estimer les probabilités conditionnelles \(\pi_y(x)\) et ainsi proposer une estimation non paramétrique du classifieur de Bayes. (0.75 pt)
Utiliser une des fonctions vues en cours pour déterminer laquelle des variables quantitatives est la plus pertinente pour discriminer entre chiens et loups. (1.5 pt)
Quel couple de variables quantitatives permet d’obtenir la meilleure discrimination? Indication: on pourra utiliser la fonction combn. Quel pourcentage d’erreur de classification gagne-t-on en ajoutant une deuxième variable? (1.5 pt)
A l’aide de ce que vous avez fait précédemment, attribuer une classe aux ossements de Jussac. Quelle est la probabilité que cela soit un chien conditionnellement aux valeurs recueillies? Commenter le résultat obtenu. (1 pt)
Cet exercice est consacré à l’étude du jeu de données Wine. Vous disposez pour cela de deux fichiers Wine.RData(contenant les données) et Wine.txt (contenant la documentation). On utilisera la fonction funopare.kernel.cv.
Lire le fichier Wine.txt puis donner la taille de l’échantillon, décrire la nature des variables dont vous disposez et indiquez l’objectif de l’étude. Tracer l’ensemble des courbes spectrométriques sur un même graphique. (1 pt)
Comparer dans un premier temps les résultats obtenus (valeurs du critère de validation croisée et graphe taux d’alcool estimés versus taux d’alcool réels) une semi-métrique basée sur les dérivées d’ordre 0 à 4 (on prendra comme paramètres pour les splines 17 noeuds et l’intervalle [0;1]). (1.5 pt)
Comparer ensuite les résultats obtenus (valeurs du critère de validation croisée et graphe taux d’alcool estimés versus taux d’alcool réels) une semi-métrique basée sur l’ACP pour un nombre de composantes de 1 à 5. (1.5 pt)
En déduire, parmi les semi-métriques considérées aux questions précédentes, celle que vous retiendriez. Justifiez votre réponse. (0.5 pt)