Dossier doctoral complet — détection acoustique des fuites
Document de départ pour une doctorante non spécialiste. Il distingue les faits vérifiés, les résultats rétrospectifs, les limites et le travail encore nécessaire. Aucun résultat présenté ici n'autorise la suppression automatique d'une visite terrain.
1. Décision principale
Oui : la recherche peut commencer avec Wessex comme cas d'étude principal, car ce jeu contient beaucoup plus de confirmations fuite/non-fuite et davantage de contexte sur les conduites. Le Maroc reste la finalité scientifique et opérationnelle : Fez et Mohamadia servent déjà à tester le transfert, puis deviendront le terrain principal lorsque de nouvelles confirmations indépendantes seront disponibles.
Le positionnement défendable est :
Apprentissage et validation de modèles acoustiques de priorisation des fuites sur données réelles Wessex, puis étude du transfert et de l'adaptation aux réseaux marocains de Fez et Mohamadia.
Ce n'est pas encore un système qui « confirme une fuite ». Il classe les alertes afin d'aider les techniciens à décider où aller en premier.
2. Le problème en langage simple
- Un logger écoute la conduite pendant la nuit.
- Il produit quelques résumés acoustiques et un avertissement.
- Le modèle apprend à relier ces informations aux résultats des inspecteurs.
- Pour une nouvelle alerte, il donne un niveau de priorité.
- Le technicien vérifie sur place et confirme la fuite avant réparation.
La question doctorale n'est donc pas seulement « quelle accuracy ? », mais :
Combien de vraies fuites peut-on placer en haut de la liste sans envoyer les techniciens vers trop de fausses alertes, et ce résultat reste-t-il valable sur de nouveaux appareils, de nouvelles campagnes, de nouvelles dates et un autre pays ?
3. Ce qui a été construit depuis le début
| Étape | Résultat vérifié | Leçon |
|---|---|---|
| Audit Fez | 443 appareils, 262 910 mesures acoustiques, 344 visites terrain | Beaucoup de mesures ne signifie pas beaucoup de fuites étiquetées |
| Correction des étiquettes | BRT est une fuite ; 105 fuites sur les 344 visites historiques |
La définition métier de la cible change tout |
| Benchmark historique | 320 visites exploitables, 99 fuites, PR-AUC ≈ 0.47 | Bon classement parmi des visites déjà suspectes, pas preuve réseau |
| Grille complète Fez | 5 200 appareils-campagnes, 99 fuites | Le vrai problème est beaucoup plus rare |
| Ajout Mohamadia | 19 904 appareils-campagnes, 83 fuites | Total marocain : 25 104 cas et 182 fuites |
| Modèles experts | Un expert SePem pour Fez, un expert SEWERIN pour Mohamadia | Les capteurs ne doivent pas être confondus |
| Données synthétiques/SMOTE | Aucun gain robuste sous validation campagne/appareil/temps | Les fausses données ne remplacent pas de nouvelles confirmations |
| Wessex | 230 326 mesures et 3 812 résultats propres | Cas principal beaucoup mieux étiqueté mais fortement présélectionné |
| Yorkshire | 72 visites acoustiquement exploitables, 41 fuites | Petit contrôle externe indépendant |
| Hong Kong | 160 signaux bruts équilibrés ; 31 loggers indépendants dans l'expert comparable | Le son brut contient du signal, mais le corpus reste trop petit |
| Fusion internationale | La concaténation directe dégrade le Maroc | Davantage de lignes peut créer du transfert négatif |
| Scores externes | Quelques gains isolés, aucune amélioration stable | Conserver comme axe expérimental, pas comme modèle final |
4. Jeu Wessex : inventaire complet
| Indicateur | Valeur |
|---|---|
| Lignes acoustiques publiées | 230,326 |
| Loggers uniques | 1,944 |
| Projets/techniciens de déploiement | 13 |
| Période des mesures | 21/07/2016 – 14/09/2019 |
| Cas avec étiquette propre | 3,812 |
| Fuites | 2,689 |
| Non-fuites | 1,123 |
| Prévalence parmi les cas étiquetés | 70.5% |
| Loggers dans les cas étiquetés | 1,192 |
| Campagnes dans les cas étiquetés | 12 |
Wessex Water est une entreprise de distribution d'eau, pas une ville. Les loggers Gutermann Zonescan 820 étaient déplacés quotidiennement dans des zones où une fuite était déjà soupçonnée (« Lift and Shift »). C'est pourquoi 70,5 % des cas étiquetés sont des fuites : ce jeu représente une sélection d'inspections suspectes, pas la prévalence de tout le réseau.
Étiquettes Wessex retenues
- fuite :
Leak located,Very small leak,Leak found,Small Leak; - non-fuite :
No leak Found; - exclus : cellule vide, zéro, réparation récente, travaux incomplets et fuite attribuée à un autre logger.
Le champ Result vient de l'interprétation de l'inspecteur. Le document officiel avertit qu'il reste opinionnel et peut dépendre de la compétence de l'inspecteur.
5. Variables Wessex
| Groupe | Champs | Utilisation actuelle |
|---|---|---|
| Acoustique | leakScore, dbMin, Spread |
Oui |
| Temps | date/mois de mesure | Oui |
| Conduite | âge | Oui |
| Environnement | distances rivière, route, rail, carrefour, bois, chemin, vanne | Oui |
| Matériau | fonte, polyéthylène, PVC, etc. | Audit et sous-ensemble plastique |
| Diamètre/unités | diamètre en mm ou pouces | À normaliser avant modèle |
| Bedrock, zone, DMA | catégories géologiques et réseau | Pas encore intégrées |
| Distance grand usager | nouveau fichier joint par Lookup |
Ablation testée ci-dessous |
| Résultat inspecteur | vérité terrain | Étiquette seulement |
| Jobs, réparation, économie d'eau | informations postérieures | Interdites comme entrées |
Important : Wessex n'exporte pas la fréquence acoustique
Spread est la différence entre le bruit minimum et le niveau de bruit le plus souvent observé. « Le plus souvent » décrit un mode statistique, pas une fréquence sonore en hertz. leakScore est un algorithme fournisseur dont la formule n'est pas publiée.
6. Matériaux les plus représentés dans les cas étiquetés
| Matériau | Cas | Fuites | Non-fuites | Taux observé |
|---|---|---|---|---|
| Cast Iron | 2078 | 1503 | 575 | 72.3% |
| Polyethylene | 522 | 331 | 191 | 63.4% |
| PVC | 413 | 281 | 132 | 68.0% |
| Asbestos Cement | 367 | 266 | 101 | 72.5% |
| Ductile Iron | 216 | 152 | 64 | 70.4% |
| Spun Iron | 86 | 64 | 22 | 74.4% |
| Protectaline | 63 | 45 | 18 | 71.4% |
| Galvernised Iron | 22 | 17 | 5 | 77.3% |
Les conduites marocaines étant confirmées comme plastiques, le sous-ensemble Wessex comparable contient 942 cas, 616 fuites et 326 non-fuites. Cela améliore légèrement le transfert Wessex seul, mais l'ajout de ces lignes dans l'entraînement marocain dégrade les validations.
Profil descriptif fuite/non-fuite
| Classe | LeakScore médian | dbMin médian | Spread médian | Âge conduite médian | Distance grand usager médiane |
|---|---|---|---|---|---|
| Non-fuite | 35.0 | 20.5 | 2.5 | 58.1 | 2325.5 |
| Fuite | 46.0 | 22.5 | 2.0 | 65.1 | 2348.2 |
| Bande LeakScore | Cas | Fuites | Non-fuites | Taux de fuite observé |
|---|---|---|---|---|
| ≤20 | 791 | 484 | 307 | 61.2% |
| 21–40 | 980 | 631 | 349 | 64.4% |
| 41–60 | 1039 | 756 | 283 | 72.8% |
| 61–80 | 624 | 507 | 117 | 81.2% |
| >80 | 378 | 311 | 67 | 82.3% |
| Année | Cas étiquetés | Fuites | Non-fuites | Taux observé |
|---|---|---|---|---|
| 2017 | 832 | 583 | 249 | 70.1% |
| 2018 | 2503 | 1742 | 761 | 69.6% |
| 2019 | 477 | 364 | 113 | 76.3% |
- 806 loggers apparaissent plusieurs fois dans les cas étiquetés ;
- 535 loggers ont eu au moins une fuite et une non-fuite selon les dates ;
- les statistiques descriptives montrent des associations, pas une causalité ni une performance sur un réseau non sélectionné.
7. Modèles Wessex testés
- neuf familles conventionnelles ont été comparées sur exactement les mêmes plis ;
- candidat principal actuel : Random Forest standard ;
- référence de stabilité : Balanced Random Forest ;
- objectif : fuite/non-fuite parmi les inspections Wessex présélectionnées ;
- entrées : uniquement les données disponibles avant la visite ;
- validations :
campaign: campagne entière jamais vue ;device: logger entier jamais vu ;temporal: dates futures jamais vues ;- seuil binaire présenté : 0,5, fixé avant lecture des résultats ;
- métrique principale : PR-AUC, car l'accuracy seule est trompeuse.
Benchmark complet
| Modèle | PR campagne | PR appareil | PR futur | Accuracy moyenne | Minimum accuracy équilibrée | Rappel futur | Spécificité future | Brier moyen |
|---|---|---|---|---|---|---|---|---|
| Random Forest | 0.796 | 0.793 | 0.824 | 70.2% | 56.1% | 88.4% | 24.2% | 0.201 |
| Balanced Random Forest | 0.796 | 0.794 | 0.816 | 58.7% | 55.8% | 60.7% | 50.8% | 0.233 |
| Régression logistique L1 | 0.791 | 0.795 | 0.807 | 58.5% | 56.8% | 57.1% | 56.5% | 0.240 |
| Extra Trees | 0.794 | 0.797 | 0.805 | 62.7% | 55.4% | 66.4% | 44.4% | 0.224 |
| Régression logistique L2 | 0.790 | 0.794 | 0.805 | 57.7% | 54.7% | 54.5% | 54.8% | 0.241 |
| CatBoost | 0.789 | 0.785 | 0.800 | 62.2% | 54.4% | 70.8% | 37.9% | 0.224 |
| HistGradient | 0.796 | 0.789 | 0.798 | 61.3% | 57.2% | 68.5% | 46.0% | 0.228 |
| XGBoost | 0.791 | 0.792 | 0.795 | 59.3% | 55.8% | 59.2% | 52.4% | 0.233 |
| SVM RBF | 0.783 | 0.787 | 0.794 | 72.5% | 50.6% | 99.0% | 4.0% | 0.196 |
Random Forest est le meilleur candidat pratique : PR-AUC future 0,824, PR-AUC moyenne 0,804, accuracy moyenne 70,2 % et meilleur Brier moyen 0,201 parmi les modèles utiles. Balanced Random Forest garde le meilleur minimum PR-AUC (0,794 contre 0,793), soit seulement 0,001 d'écart.
Le SVM affiche jusqu'à 75,9 % d'accuracy future, mais reconnaît seulement 4,0 % des non-fuites : il répond presque toujours « fuite ». Ce n'est pas une amélioration opérationnelle.
Random Forest reconnaît encore seulement 24 à 28 % des non-fuites. Il devient donc le candidat principal pour le classement et la calibration, pas encore un détecteur autonome oui/non.
8. Référence Balanced Random Forest et accuracy demandée
| Validation | Version | Cas test | Fuites | Accuracy | Accuracy équilibrée | Précision fuite | Rappel fuite | Spécificité | PR-AUC | ROC-AUC |
|---|---|---|---|---|---|---|---|---|---|---|
| campaign | référence | 3812 | 2689 | 59.3% | 59.1% | 77.5% | 59.5% | 58.8% | 0.795 | 0.631 |
| campaign | +distance grand usager | 3812 | 2689 | 58.9% | 59.0% | 77.5% | 58.9% | 59.1% | 0.796 | 0.630 |
| device | référence | 3812 | 2689 | 58.6% | 58.6% | 77.2% | 58.6% | 58.5% | 0.792 | 0.631 |
| device | +distance grand usager | 3812 | 2689 | 58.8% | 59.0% | 77.6% | 58.4% | 59.6% | 0.794 | 0.635 |
| temporal | référence | 511 | 387 | 59.7% | 56.4% | 79.7% | 62.8% | 50.0% | 0.808 | 0.597 |
| temporal | +distance grand usager | 511 | 387 | 58.3% | 55.8% | 79.4% | 60.7% | 50.8% | 0.816 | 0.608 |
Matrices d'erreurs au seuil 0,5
| Validation | Version | Fuites trouvées | Fausses alertes | Fuites ratées | Non-fuites reconnues |
|---|---|---|---|---|---|
| campaign | référence | 1599 | 463 | 1090 | 660 |
| campaign | +distance grand usager | 1583 | 459 | 1106 | 664 |
| device | référence | 1576 | 466 | 1113 | 657 |
| device | +distance grand usager | 1571 | 454 | 1118 | 669 |
| temporal | référence | 243 | 62 | 144 | 62 |
| temporal | +distance grand usager | 235 | 61 | 152 | 63 |
Comment annoncer cette référence
Il ne faut pas dire « le modèle a 80 % d'accuracy ». La formulation exacte est :
L'expert Wessex obtient une PR-AUC de 0.792 à 0.808 selon la validation, contre une référence aléatoire proche de 0,705. Au seuil exploratoire de 0,5, son accuracy varie de 58.6% à 59.7%, mais cette valeur dépend fortement de la forte proportion de fuites dans les inspections sélectionnées.
Une règle qui répond toujours « fuite » obtiendrait déjà environ 70,5 % d'accuracy. L'accuracy équilibrée, la précision, le rappel, la PR-AUC et la validation future doivent donc être présentés ensemble.
La formulation mise à jour pour le meilleur candidat est :
Random Forest atteint 68,9 % d'accuracy sur campagnes inconnues, 68,9 % sur loggers inconnus et 72,8 % sur données futures. Sa PR-AUC vaut respectivement 0,796, 0,793 et 0,824. Il retrouve 86 à 88 % des fuites, mais seulement 24 à 28 % des non-fuites : une calibration et un seuil opérationnel restent nécessaires.
9. Nouveau fichier « distance au grand usager »
- 232 362 lignes uniques ;
- correspondance
Lookuppour 100 % des 230 326 lignes Wessex ; - 95 valeurs manquantes parmi les 3 812 cas étiquetés ;
- information disponible avant l'inspection, donc sans fuite de cible.
| Validation | Référence PR-AUC | + distance grand usager | Écart |
|---|---|---|---|
| campaign | 0.795 | 0.796 | +0.001 |
| device | 0.792 | 0.794 | +0.002 |
| temporal | 0.808 | 0.816 | +0.008 |
La PR-AUC progresse dans les trois validations (+0,001, +0,002 et +0,008), mais l'accuracy au seuil 0,5 baisse dans deux tests sur trois. La distance au grand usager reste donc une caractéristique auxiliaire prometteuse, pas une amélioration définitivement acquise.
10. Fichier de réparations
| Indicateur | Valeur |
|---|---|
| Jobs documentés | 8,540 |
| Références uniques | 8,540 |
| Références retrouvées dans le fichier principal | 8 504 |
| Période | 01/08/2016 – 10/10/2019 |
Ce fichier est précieux pour contrôler les confirmations, analyser les matériaux et localiser les réparations. Il ne doit pas entrer dans le modèle, car la fuite a déjà été trouvée : l'utiliser donnerait artificiellement la réponse.
11. État des données marocaines
| Domaine | Cas appareils-campagnes | Fuites | Non-fuites | Prévalence |
|---|---|---|---|---|
| Fez / SePem | 5,200 | 99 | 5101 | 1.9% |
| Mohamadia / SEWERIN | 19,904 | 83 | 19821 | 0.4% |
| Total | 25,104 | 182 | 24922 | 0.7% |
Fez possède Minimal, Frequency, Spread et leurs historiques. Mohamadia possède bruit, fréquence et variation. Les deux villes ont des conduites plastiques. Elles n'utilisent cependant pas les mêmes capteurs ni les mêmes unités.
Experts marocains actuels
| Ville | Validation | PR-AUC | Précision top 20/campagne | Rappel top 20/campagne |
|---|---|---|---|---|
| Fez | campaign | 0.171 | 8.8% | 76.8% |
| Fez | device | 0.140 | 8.1% | 70.7% |
| Fez | temporal | 0.208 | 11.2% | 82.9% |
| Mohamadia | campaign | 0.251 | 25.7% | 43.4% |
| Mohamadia | device | 0.241 | 19.3% | 32.5% |
| Mohamadia | temporal | 0.257 | 22.5% | 36.0% |
Pour rappel, répondre toujours « non-fuite » donnerait environ 98,1 % d'accuracy à Fez et 99,6 % à Mohamadia, mais ne détecterait aucune fuite. C'est pourquoi ces valeurs ne prouvent rien.
12. Cas Sidi Ahmed Chaoui
- 47 appareils ;
- 41 670 mesures acoustiques ;
- 1 037 événements exploitables ;
- 30 fuites exploitables dans le benchmark complet ;
- PR-AUC locale du prototype : 0,181 contre 0,029 au hasard ;
- meilleur classement comparatif observé : TabPFN, PR-AUC 0,267 ;
- 33 fuites confirmées dans les statistiques de visites de zone.
Sidi est utile comme sous-étude locale, mais trop petit pour entraîner seul un détecteur fiable. Voir le dossier Sidi détaillé.
13. Ce que les données internationales ont apporté au Maroc
Transfert direct
- Wessex complet → Fez : PR-AUC 0,033 ;
- Wessex complet → Mohamadia : 0,004, presque aléatoire ;
- Wessex plastique → Fez : 0,057 ;
- Wessex plastique → Mohamadia : 0,010 ;
- Wessex → Yorkshire : 0,619 contre 0,569 au hasard, avec 11 fuites trouvées dans les 15 premières visites.
Scores internationaux ajoutés aux experts marocains
| Ville | Validation | Maroc seul | Meilleure stratégie | Meilleur PR-AUC | Écart |
|---|---|---|---|---|---|
| Fez | campaign | 0.171 | +score_wessex_plastique | 0.179 | +0.008 |
| Fez | device | 0.140 | maroc_seul | 0.140 | +0.000 |
| Fez | temporal | 0.208 | +scores_internationaux | 0.236 | +0.028 |
| Mohamadia | campaign | 0.251 | maroc_seul | 0.251 | +0.000 |
| Mohamadia | device | 0.241 | +scores_internationaux | 0.246 | +0.005 |
| Mohamadia | temporal | 0.257 | +score_wessex_plastique | 0.261 | +0.004 |
Quelques tests s'améliorent, mais aucune stratégie extérieure ne dépasse la stabilité minimale du modèle marocain seul. Le résultat négatif est scientifiquement important : il mesure le domain shift au lieu de le cacher.
13 bis. Ce que Hong Kong ajoute
Hong Kong apporte ce qui manque aux autres jeux : de vrais fichiers audio bruts avec des classes fuite/non-fuite. Le téléchargement contient 160 enregistrements : 60 loggers acoustiques, 80 hydrophones et 20 accéléromètres. Le premier test utilise uniquement les loggers, qui sont les plus proches des appareils marocains.
Après retrait d'un doublon, les 59 fichiers correspondent à seulement 31 appareils indépendants. Tous les fichiers d'un même appareil ont été gardés dans le même pli de validation. Le meilleur Random Forest, utilisant 14 résumés calculés depuis le son, a correctement classé 25 appareils sur 31, soit 80.6% d'exactitude. Il retrouve 77.3% des fuites et atteint une PR-AUC de 0.962. Cette PR-AUC n'est pas une accuracy : elle mesure la qualité du classement.
Le score Hong Kong fondé sur trois caractéristiques comparables améliore 5/6 validations Fez/Mohamadia, mais sa variation moyenne est de -0.02 point de PR-AUC, donc pratiquement nulle. Une baisse importante sur la validation « appareils inconnus » de Mohamadia annule les petits gains ailleurs.
Décision : Hong Kong renforce la preuve scientifique que le son contient une signature de fuite et permet d'étudier l'intérêt du signal brut. Il n'est pas fusionné au modèle marocain principal, car il ne produit pas encore un gain stable hors domaine. Voir l'expérience complète.
14. Expériences abandonnées ou non retenues
| Idée | Résultat | Décision |
|---|---|---|
| Mélanger toutes les lignes Wessex et Maroc | Forte baisse au Maroc | Rejet |
| Mélanger seulement Wessex plastique | Baisse campagne/appareil/temps | Rejet |
| SMOTE/Borderline-SMOTE | Gains non robustes ou calibration dégradée | Ablation seulement |
| GAN/CTGAN/TVAE/TabDDPM | Trop peu de positifs et données résumées | Rejet comme première stratégie |
| Données synthétiques de démonstration | Pipeline fonctionne mais aucune preuve réelle | Démonstration uniquement |
| Modèle universel brut Fez + Mohamadia | Experts capteur supérieurs dans 6/6 tests | Rejet |
| Remplacement du technicien | Vérité terrain et généralisation insuffisantes | Interdit actuellement |
15. Limites scientifiques
- Les alertes inspectées ne sont pas un échantillon aléatoire du réseau.
- Les fuites physiques indépendantes peuvent être comptées plusieurs fois.
- Les labels reposent parfois sur une interprétation humaine.
- Wessex est très fortement présélectionné.
- Le Maroc possède peu de fuites confirmées par rapport au nombre de non-fuites.
- Les capteurs ont des échelles et résumés différents.
- Aucun audio brut commun n'est disponible ; la fréquence manque dans Wessex.
- Les probabilités du Random Forest ne sont pas encore calibrées prospectivement.
- Les seuils opérationnels doivent être fixés avant une nouvelle campagne, puis gelés.
- Aucun résultat externe ne remplace une validation future marocaine.
- Hong Kong ne contient que 31 loggers indépendants dans le test comparable et aucun logger observé avant puis après réparation.
16. Sujet doctoral proposé
Titre principal
Détection et priorisation des fuites d'eau à partir de résumés acoustiques rares : apprentissage sur un réseau réel britannique et transfert sous changement de domaine vers les réseaux marocains.
Variante plus courte
Détection acoustique des fuites sous rareté des labels et transfert inter-réseaux : de Wessex au Maroc.
Questions de recherche
- Quels résumés acoustiques et contextuels séparent le mieux fuite et non-fuite à Wessex ?
- Les performances restent-elles stables sur de nouveaux loggers, campagnes et dates ?
- Quelle part du signal se transfère vers Yorkshire, Fez et Mohamadia ?
- Comment mesurer et réduire le transfert négatif entre capteurs ?
- La calibration et l'abstention permettent-elles une aide sûre au technicien ?
- Combien de confirmations marocaines sont nécessaires pour adapter le modèle ?
- Les caractéristiques calculées depuis le son brut Hong Kong apportent-elles plus que les trois résumés exportés au Maroc ?
Hypothèses
- H1 : un expert propre au capteur est plus stable qu'un modèle universel.
- H2 : les métadonnées physiques réduisent certains faux positifs, mais ne remplacent pas l'acoustique.
- H3 : le transfert par score ou représentation est plus sûr que la concaténation brute.
- H4 : une politique à trois sorties — priorité haute, incertain, priorité basse — est plus réaliste qu'un oui/non automatique.
17. Méthodologie proposée
Phase A — Wessex, étude principale actuelle
- Audit des labels, doublons, dates et informations postérieures.
- Baselines réalisées : régression logistique, SVM, Random Forest, Extra Trees, HistGradient, Balanced Random Forest, CatBoost et XGBoost.
- Ajout progressif des groupes de variables : acoustique, conduite, GIS, grand usager.
- Validation groupée par logger et campagne, puis validation temporelle.
- Calibration des scores et seuil d'abstention.
- Explicabilité : importance des variables et profils de faux positifs.
Phase B — validation externe
- Yorkshire comme petit contrôle indépendant.
- Comparaison Wessex complet contre Wessex plastique.
- Mesure explicite du transfert négatif.
Phase C — adaptation marocaine
- Experts séparés SePem et SEWERIN.
- Variables communes normalisées en rangs, jamais valeurs brutes mélangées.
- Scores Wessex comme caractéristiques auxiliaires seulement.
- Calibration exclusivement sur données marocaines.
- Test final sur de nouvelles campagnes jamais utilisées.
18. Données marocaines à collecter
Minimum à chaque inspection
- identifiant appareil, campagne et zone ;
- raison de la sélection du technicien ;
- signal avant visite et historique ;
- fuite, non-fuite ou incertain ;
- type physique, position et taille de fuite ;
- date de réparation et contrôle après réparation ;
- matériau, diamètre, âge, pression, profondeur et distance logger–fuite ;
- perturbations : vanne, pompe, trafic, fontaine, grand consommateur.
Volume indicatif
- classement solide parmi les alarmes : 150 à 200 fuites indépendantes ;
- détection réseau plus ambitieuse : 200 à 500 fuites indépendantes ;
- ajouter des non-fuites provenant aussi de faibles alarmes et d'audits aléatoires ;
- réserver une ville ou une période entière comme test final.
19. Contributions potentielles
- Première étude scientifique publique et reproductible du classeur Wessex identifiée dans la recherche menée jusqu'au 25 juillet 2026.
- Validation honnête par campagne, appareil et temps.
- Comparaison de quatre systèmes acoustiques réels : Gutermann, SePem, SEWERIN et signaux bruts Hong Kong.
- Analyse du transfert négatif entre pays et capteurs.
- Protocole de passage d'un jeu présélectionné riche vers un réseau marocain très déséquilibré.
- Aide opérationnelle explicable avec abstention, sans prétendre remplacer le technicien.
La formulation prudente pour le point 1 est : « aucun usage scientifique publié n'a été identifié dans la recherche documentée », et non « personne ne l'a jamais utilisé ».
20. Livrables du doctorat
- corpus Wessex audité et dictionnaire des variables ;
- protocole reproductible de construction des labels ;
- benchmarks et prédictions hors pli ;
- modèle Wessex documenté ;
- étude Yorkshire externe ;
- expert audio Hong Kong et analyse de son transfert ;
- experts marocains Fez/Mohamadia ;
- rapport de transfert inter-réseaux ;
- fiche de modèle, limites et règles d'usage terrain ;
- protocole prospectif marocain ;
- articles sur validation réelle, domain shift et adaptation avec peu de labels.
21. Conclusion finale
Wessex est actuellement le meilleur socle pour démarrer le dossier doctoral parce qu'il offre 3 812 inspections clairement exploitables. Hong Kong ajoute 160 signaux bruts équilibrés et démontre, sur un petit groupe de 31 loggers indépendants, que l'audio contient une information exploitable. Le jeu marocain contient 25 104 cas appareils-campagnes, dont 182 fuites. Ensemble, ces jeux permettent d'étudier la détection, la qualité du classement et surtout les limites du transfert entre réseaux.
Le Maroc ne doit pas être repoussé hors de la recherche : il constitue la partie la plus originale et la plus difficile. Les résultats déjà obtenus montrent que les modèles britanniques ne se transfèrent pas automatiquement. Cette difficulté devient précisément la contribution doctorale : comprendre, mesurer et corriger le passage de Wessex vers Fez et Mohamadia, puis prouver le modèle sur de nouvelles campagnes marocaines.