Stratégie doctorale : experts, transfert et validation externe

Tous les tests sont rétrospectifs. Les modèles produisent un classement de priorité ; ils ne remplacent pas la confirmation terrain.

1. Quatre domaines réels, quatre distributions

Domaine Exemples étiquetés Fuites Non-fuites Prévalence
Fez 5200 99 5101 1.904%
Mohamadia 19904 83 19821 0.417%
Wessex 3812 2689 1123 70.540%
Yorkshire exploitable 72 41 31 56.9%

Yorkshire contient 1 148 loggers et 2 296 lignes acoustiques (Lvl/Spr). Après suppression de cinq doublons, les 81 visites uniques donnent 47 fuites et 34 non-fuites. Neuf visites sans mesure acoustique antérieure sont exclues : le test externe conserve 72 visites, 41 fuites et 66 loggers. Chaque visite utilise uniquement la dernière mesure disponible avant sa date ; l'ancienneté médiane est 0 jour(s) et le maximum 12 jours.

Les prévalences sont incompatibles : Wessex et Yorkshire sont des listes déjà présélectionnées, tandis que le Maroc couvre des grilles campagne-appareil beaucoup plus larges. Une accuracy globale mélangée n'aurait donc aucun sens.

2. Experts séparés

Balanced Random Forest utilise toutes les variables autorisées propres à chaque capteur. La PR-AUC aléatoire vaut la prévalence de chaque domaine.

Expert Campagne Appareil Temps
Fez 0.171 0.140 0.208
Mohamadia 0.251 0.241 0.257
Wessex 0.795 0.792 0.808

Les experts marocains dépassent nettement leur référence aléatoire. L'expert Wessex est stable, mais son avantage au-dessus de sa référence de 0.705 reste modeste. Ces résultats justifient un expert par système, pas un score brut universel.

3. Transfert strict entre villes et capteurs

Chaque ligne entraîne le modèle uniquement sur le domaine source et teste le domaine colonne, jamais vu. Seuls quatre champs comparables sont utilisés : rang du bruit, rang de la dispersion et mois en sinus/cosinus.

Entraînement Fez Mohamadia Wessex Yorkshire
Fez 0.035 0.747 0.596
Mohamadia 0.065 0.734 0.586
Wessex 0.033 0.004 0.619
Yorkshire 0.019 0.003 0.720

Une PR-AUC proche de la prévalence de la cible correspond au hasard. Le transfert Wessex → Mohamadia est pratiquement aléatoire ; le transfert vers Fez conserve seulement un faible signal. Les capteurs et les politiques de sélection ne décrivent donc pas la même population.

4. Contrôle par matériau plastique

Le propriétaire des données confirme que les conduites de Fez et Mohamadia sont en plastique. Ce champ réel est ajouté comme métadonnée constante aux lignes marocaines. Il ne peut pas séparer les fuites des non-fuites à l'intérieur du Maroc ; il sert ici à sélectionner uniquement les conduites Wessex Polyethylene, PVC et Plastic/Polythene.

Le sous-ensemble Wessex plastique contient 942 cas : 616 fuites et 326 non-fuites.

Wessex seul → Maroc jamais vu

Cible Tout Wessex Wessex plastique Fuites top 20% Rappel top 20%
Fez 0.033 0.057 45/1040 45.5%
Mohamadia 0.004 0.010 43/3981 51.8%

Maroc + Wessex plastique pendant l'entraînement

Cible Validation Maroc seul + tout plastique + plastique équilibré
Fez campaign 0.123 0.065 0.066
Fez device 0.122 0.070 0.079
Fez temporal 0.144 0.101 0.078
Mohamadia campaign 0.129 0.007 0.006
Mohamadia device 0.162 0.085 0.110
Mohamadia temporal 0.195 0.006 0.006

Le matériau comparable ne suffit pas à garantir le transfert : la sélection Wessex reste très différente de la grille marocaine. On ne conserve l'ajout plastique que s'il améliore de façon cohérente campagne, appareil et futur.

5. Yorkshire comme validation externe indépendante

Yorkshire n'entre jamais dans l'entraînement. Le test mesure uniquement la capacité d'un modèle appris ailleurs à classer ses 72 visites acoustiquement exploitables.

Source PR-AUC ROC-AUC Fuites dans top 20% Rappel Précision
Wessex 0.619 0.566 11/15 26.8% 73.3%
Fez 0.596 0.514 8/15 19.5% 53.3%
Mohamadia 0.586 0.471 9/15 22.0% 60.0%

La référence aléatoire Yorkshire est 0.569 en PR-AUC et environ 56.9% de précision. Un score supérieur montre un signal transférable, mais 72 visites acoustiquement exploitables restent trop peu nombreuses pour conclure à une production inter-réseaux.

6. Pourquoi la fusion naïve échoue

Le premier contrôle ajoute toutes les lignes Wessex au modèle marocain. La PR-AUC diminue dans les trois validations :

Validation Maroc Maroc seul Maroc + tout Wessex
campaign 0.093 0.015
device 0.122 0.030
temporal 0.027 0.008

Le second contrôle traite Wessex, Fez et Mohamadia comme une seule ville. Le top 20% est calculé séparément dans chaque cible marocaine :

Validation Cible PR-AUC Fuites top 20% Rappel top 20%
campaign Fez 0.039 30/1040 30.3%
campaign Mohamadia 0.009 31/3981 37.3%
device Fez 0.037 28/1040 28.3%
device Mohamadia 0.031 65/3981 78.3%
temporal Fez 0.034 33/1040 33.3%
temporal Mohamadia 0.004 12/3981 14.5%

Un résultat élevé sur les appareils mais faible sur les campagnes ou le futur signifie que le modèle reconnaît le contexte d'une campagne, pas une signature de fuite généralisable. Le test temporel est la barrière décisive.

7. Cas d'étude Wessex et contribution doctorale

La recherche bibliographique menée jusqu'au 25 juillet 2026 n'a trouvé aucun article, mémoire, thèse, notebook ou dépôt public déclarant explicitement utiliser ce classeur Wessex. Des expérimentations industrielles liées au challenge existent, mais aucun protocole scientifique public et vérifiable n'a été retrouvé.

Cela ne prouve pas une absence absolue d'utilisation privée. La formulation défendable est : « aucun usage scientifique publié n'a été identifié dans la recherche documentée ».

La contribution proposée est donc :

  1. trois experts reproductibles adaptés aux capteurs ;
  2. une validation externe Yorkshire sans réentraînement ;
  3. une matrice de transfert inter-ville/inter-capteur ;
  4. une démonstration mesurée du transfert négatif par fusion naïve ;
  5. une première étude publique et reproductible du classeur Wessex, sous réserve d'une dernière vérification bibliographique avant soumission.

Décision

Architecture retenue pour la thèse : experts séparés + protocole commun d'évaluation + transfert contrôlé. Yorkshire et Wessex servent de domaines externes ; ils ne sont pas transformés artificiellement en données marocaines. Une validation prospective sur de nouvelles campagnes reste nécessaire avant toute décision automatique fuite/non-fuite.