Séminaire d'analyse des données
- Code de l'UE EFASM403
-
Horaire
45Quadri 2
- Crédits ECTS 10
-
Langue d'enseignement
Français
- Professeur
À l’issue du séminaire, l’étudiant sera capable de :
porter un regard critique sur un résultat scientifique et identifier les éléments qui conditionnent sa crédibilité ;
distinguer un résultat statistique d’une preuve scientifique solide ;
identifier les principales sources de fragilité d’une analyse : données, mesure, échantillon, spécification, identification et inférence ;
comprendre qu’un résultat empirique peut dépendre de choix méthodologiques plausibles et apprendre à en évaluer la sensibilité ;
distinguer corrélation, association et interprétation causale ;
apprécier la robustesse, la reproductibilité et la traçabilité d’une analyse ;
confronter un résultat publié aux données et aux procédures qui l’ont produit ;
formuler une conclusion scientifique nuancée, précisant ce que les résultats permettent d’affirmer, ce qu’ils ne permettent pas d’affirmer et avec quel niveau de confiance ;
documenter et justifier les choix effectués au cours d’une analyse empirique.
L’objectif final n’est donc pas seulement de savoir reproduire des résultats, mais de développer une capacité autonome à évaluer la qualité d’une preuve empirique.
Le séminaire vise avant tout à développer le sens critique scientifique des étudiants face aux résultats empiriques en sciences économiques et sociales.
Un résultat publié, même largement cité ou statistiquement significatif, n’est pas automatiquement un résultat robuste. Il peut dépendre de la qualité des données, de leur traitement, de la construction des variables, du choix de l’échantillon, de la spécification du modèle ou encore des hypothèses nécessaires à une interprétation causale.
À travers la réplication d’études scientifiques, les étudiants apprennent donc à remonter du résultat présenté dans un article vers les choix qui ont permis de le produire. La réplication est utilisée comme un outil d’analyse critique : elle permet d’interroger la solidité d’un résultat, d’en tester la sensibilité et d’identifier précisément ses limites. La réplication peut être vue comme un audit du processus allant des données aux résultats.
Le séminaire vise ainsi à développer un réflexe essentiel en sciences : ne pas simplement accepter ou rejeter un résultat, mais évaluer les raisons pour lesquelles on peut lui accorder plus ou moins de confiance.
Le contenu s’organise autour des principaux éléments qui permettent d’évaluer de manière critique une analyse scientifique :
reproductibilité et réplication en sciences sociales ;
qualité, provenance et comparabilité des données ;
choix de mesure et construction des variables ;
valeurs manquantes, valeurs extrêmes et sélection de l’échantillon ;
rôle des choix méthodologiques dans la production des résultats ;
multiplicité des spécifications empiriques plausibles ;
identification, endogénéité et interprétation causale ;
incertitude statistique et choix des méthodes d’inférence ;
robustesse et sensibilité des résultats ;
placebos, falsifications et autres éléments de validation ;
transparence, traçabilité et reproductibilité ;
lecture critique d’un article scientifique ;
formulation et communication des limites d’un résultat.
Une même question scientifique peut conduire à plusieurs résultats selon des choix méthodologiques pourtant défendables, en outre la causalité repose sur des hypothèses qui ne peuvent généralement pas être validées par une seule régression.
Peut-on faire confiance à un résultat scientifique ?
Réplication, reproductibilité et démarche scientifique
Les données ne sont jamais neutres
Mesurer : définitions, conventions et choix de variables
Comment les choix méthodologiques façonnent les résultats
Corrélation, causalité et identification
Un résultat est-il robuste ?
Tester les alternatives plausibles
Transparence, traçabilité et reproductibilité
Lire et auditer un article scientifique
De la significativité statistique au niveau de confiance
Ce que l’on peut dire — et ce que l’on ne peut pas dire
Les exercices sont conçus comme des mises en situation de raisonnement scientifique.
À partir d’articles et de résultats empiriques, les étudiants sont notamment amenés à :
identifier les hypothèses implicites derrière une conclusion ;
retrouver l’origine d’un chiffre ou d’un résultat ;
vérifier si une table ou une figure peut effectivement être reproduite ;
comparer plusieurs constructions plausibles d’une variable ;
examiner comment un résultat évolue lorsque l’échantillon ou la spécification change ;
proposer des explications à une divergence entre leurs résultats et ceux d’un article ;
identifier les menaces à l’identification causale ;
concevoir des tests susceptibles d’augmenter ou de diminuer la confiance dans un résultat ;
distinguer une vraie vérification de robustesse d’une recherche opportuniste de significativité ;
rédiger une conclusion explicitant le niveau de confiance accordé au résultat.
L’objectif n’est pas de « trouver le bon modèle », mais de comprendre pourquoi un résultat paraît solide ou fragile.
Le séminaire privilégie une pédagogie par investigation.
Les étudiants partent d’un article scientifique et sont progressivement amenés à interroger sa construction : que mesure réellement la variable ? D’où viennent les données ? Quelles observations ont été retenues ? Pourquoi cette spécification ? Quelle hypothèse permet de passer d’une corrélation à une interprétation causale ? Le résultat persiste-t-il lorsqu’on modifie raisonnablement certains choix ?
La réplication et l’analyse de données constituent donc des outils au service du raisonnement critique.
Le travail s’effectue par étapes, avec des livrables intermédiaires et des échanges avec l’enseignant. Les étudiants doivent expliquer et défendre leurs décisions, identifier les ambiguïtés de l’article étudié et proposer des solutions documentées.
Une attention particulière est portée à la traçabilité du raisonnement. Le journal de tâches ne documente pas uniquement ce qui a été fait : il conserve également la trace des erreurs, corrections, arbitrages et apprentissages intervenus au cours du projet.
L’évaluation porte principalement sur la qualité du raisonnement critique, la capacité à justifier les choix méthodologiques et la transparence de la démarche.
Sont notamment évaluées :
la compréhension de la question scientifique et des hypothèses de l’étude ;
la capacité à identifier les forces et les fragilités de l’analyse ;
la qualité de l’examen critique des données, des variables et de la stratégie empirique ;
la capacité à reproduire et confronter les résultats publiés ;
la pertinence des tests de robustesse proposés et leur justification ;
la distinction entre résultats robustes, résultats fragiles et résultats non conclusifs ;
la capacité à discuter les limites liées aux données, à la mesure et à l’identification ;
la traçabilité et la reproductibilité de la démarche ;
la capacité à défendre oralement les choix réalisés ;
la qualité de la conclusion scientifique.
Les supports comprennent :
des articles scientifiques servant de cas d’étude et de réplication ;
des lectures consacrées aux enjeux de reproductibilité et de réplication scientifique ;
les diapositives et ressources méthodologiques du séminaire ;
une grille structurée d’évaluation de la confiance dans un résultat ;
des consignes relatives à la traçabilité et à la reproductibilité ;
les données et codes disponibles pour les travaux étudiés ;
Gretl comme outil de mise en œuvre des analyses nécessaires à l’examen critique des résultats.
| Formation | Programme d’études | Bloc | Crédits | Obligatoire |
|---|---|---|---|---|
| Master 120 en sciences de gestion (horaire décalé) | Finalité spécialisée | 1 | 10 | Oui |
| Master 120 en sciences économiques, orientation générale (horaire décalé) | Finalité spécialisée | 1 | 10 | Oui |