Quel apport des méthodes de Machine Learning pour l’estimation des scores de propension : illustration sur un cas d’étude.
Objectifs
Estimer les effets d’un traitement dans des études observationnelles nécessite de traiter les facteurs de confusion et de modéliser correctement les mécanismes causaux. L’estimation traditionnelle du score de propension repose sur la régression logistique, qui peut être moins performante lorsque l’attribution du traitement dépend d’interactions complexes ou de relations d’ordre supérieur entre les covariables. Les modèles de machine learning (ML) peuvent en principe mieux capturer ces schémas non linéaires, améliorant potentiellement l’équilibre des covariables. Nous avons utilisé une méthodologie combinant des approches d’inférence causale et un appariement par score de propension (PS) basé sur l’apprentissage automatique afin d’évaluer l’impact de la voie d’administration — Voie A versus Voie B — sur la persistance au traitement.
Conclusion
L’intégration de l’inférence causale avec l’appariement par score de propension basé sur des modèles de ML offre un cadre robuste pour évaluer les effets des traitements dans les données de vie réelle. Dans le contexte de notre analyse, les modèles ML plus complexes avaient tendance à produire des scores de propension moins stables, probablement en raison d’un surapprentissage, d’une prévalence limitée de la voie de traitement A, et d’un chevauchement réduit des scores de propension, ce qui se traduisait par des valeurs ASAM plus élevées et un nombre de paires appariées réduit dans les cohortes de petite taille. La régression logistique a permis d’obtenir un meilleur équilibre des covariables au sein des différentes populations. Ces résultats soulignent la nécessité d’une sélection rigoureuse des modèles et suggèrent que les stratégies hybrides pourraient améliorer les performances et la fiabilité de l’appariement, bien que leur applicabilité reste dépendante du contexte et doit être confirmée par de futures études à plus grande échelle.
