Données acoustiques de Hong Kong
Conclusion simple. Le jeu Hong Kong confirme qu'un signal sonore brut contient une information utile, mais il est trop petit pour devenir seul un détecteur de production. Le meilleur essai atteint 80,6 % d'exactitude et 96,2 % de PR-AUC sur des enregistreurs jamais vus. Son score améliore 5 validations marocaines sur 6, avec une variation moyenne de -0,02 point de PR-AUC. Il reste donc une expérience de transfert, pas une preuve qu'il remplace les techniciens.
Ce qui a été téléchargé
| Capteur | Fuite | Non-fuite | Total |
|---|---|---|---|
| Enregistreurs de bruit | 30 | 30 | 60 |
| Hydrophones | 40 | 40 | 80 |
| Accéléromètres MEMS | 10 | 10 | 20 |
| Total | 80 | 80 | 160 |
Le premier modèle utilise les enregistreurs de bruit, le capteur le plus proche de ceux du Maroc et de Wessex. Après suppression d'un doublon exact, il reste 59 fichiers, mais seulement 31 enregistreurs indépendants. Les millions de points audio ne sont donc pas des millions de fuites différentes.
Test honnête
Les fichiers d'un même enregistreur restent toujours dans le même pli de validation. Le modèle est ainsi évalué sur des appareils qu'il n'a jamais vus. La fréquence d'échantillonnage et la durée ne sont pas données au modèle, car elles pourraient révéler artificiellement la classe.
Deux entrées ont été comparées :
- 3 caractéristiques comparables : niveau sonore, fréquence dominante et dispersion, convertis en rangs pour réduire les différences d'échelle ;
- signal acoustique complet : 14 résumés calculés depuis le WAV (énergie, bandes fréquentielles, centroïde spectral, largeur de bande, aplatissement, variation et impulsivité).
Résultats Hong Kong
| Caractéristiques | Modèle | PR-AUC appareils | Exactitude | Rappel fuites | Exactitude équilibrée |
|---|---|---|---|---|---|
| signal acoustique complet | random_forest | 96,2 % | 80,6 % | 77,3 % | 83,1 % |
| signal acoustique complet | logistic_l2 | 96,1 % | 77,4 % | 72,7 % | 80,8 % |
| signal acoustique complet | balanced_rf | 96,1 % | 80,6 % | 77,3 % | 83,1 % |
| 3 caractéristiques comparables | logistic_l2 | 94,6 % | 74,2 % | 72,7 % | 75,3 % |
| signal acoustique complet | extra_trees | 94,0 % | 71,0 % | 63,6 % | 76,3 % |
| 3 caractéristiques comparables | svm_rbf | 94,0 % | 74,2 % | 72,7 % | 75,3 % |
| 3 caractéristiques comparables | extra_trees | 93,9 % | 77,4 % | 72,7 % | 80,8 % |
| 3 caractéristiques comparables | random_forest | 93,6 % | 74,2 % | 72,7 % | 75,3 % |
| 3 caractéristiques comparables | balanced_rf | 92,7 % | 71,0 % | 68,2 % | 73,0 % |
| signal acoustique complet | svm_rbf | 92,7 % | 71,0 % | 72,7 % | 69,7 % |
Le meilleur résultat observé est random_forest avec signal acoustique complet. La référence PR-AUC au niveau appareil est déjà élevée (71,0 %), car la majorité des appareils uniques sont des cas de fuite. Il faut donc regarder ensemble PR-AUC, exactitude équilibrée et rappel, pas retenir un seul pourcentage. Ici, 80,6 % d'exactitude signifie 25 appareils correctement classés sur 31 : 17 fuites sur 22 et 8 non-fuites sur 9.
Est-ce que Hong Kong améliore Fez et Mohamadia ?
Le modèle transférable est entraîné uniquement sur les trois rangs communs. Son score devient ensuite une caractéristique supplémentaire du modèle marocain ; aucune étiquette marocaine n'est utilisée pour entraîner le modèle Hong Kong.
| Ville | Validation | Stratégie | PR-AUC | Précision top 20 | Rappel top 20 |
|---|---|---|---|---|---|
| Fez | campaign | Maroc seul | 16,7 % | 8,4 % | 72,7 % |
| Fez | campaign | Maroc + score Hong Kong | 16,9 % | 9,0 % | 77,8 % |
| Fez | device | Maroc seul | 13,1 % | 8,5 % | 73,7 % |
| Fez | device | Maroc + score Hong Kong | 14,6 % | 8,5 % | 73,7 % |
| Fez | temporal | Maroc seul | 24,3 % | 10,8 % | 80,0 % |
| Fez | temporal | Maroc + score Hong Kong | 25,4 % | 11,2 % | 82,9 % |
| Mohamadia | campaign | Maroc seul | 23,8 % | 23,6 % | 39,8 % |
| Mohamadia | campaign | Maroc + score Hong Kong | 24,1 % | 21,4 % | 36,1 % |
| Mohamadia | device | Maroc seul | 24,2 % | 23,6 % | 39,8 % |
| Mohamadia | device | Maroc + score Hong Kong | 20,4 % | 21,4 % | 36,1 % |
| Mohamadia | temporal | Maroc seul | 24,6 % | 22,5 % | 36,0 % |
| Mohamadia | temporal | Maroc + score Hong Kong | 25,2 % | 20,0 % | 32,0 % |
Sur les six validations, le score Hong Kong améliore 5/6 résultats. La variation moyenne est -0,02 point de PR-AUC, donc pratiquement nulle. Une amélioration isolée n'est pas suffisante : nous ne conserverons ce score dans le modèle principal que s'il améliore plusieurs validations, notamment la validation temporelle, sans diminuer les autres.
Limites
- Seulement 31 appareils indépendants pour le sous-ensemble le plus compatible.
- Aucun appareil n'apparaît avec les deux états fuite puis après réparation : l'effet propre à l'appareil peut rester confondu avec l'étiquette.
- Le Maroc exporte des résumés propriétaires ; Hong Kong fournit le son brut. Les trois variables sont conceptuellement proches, mais pas identiques physiquement.
- Les hydrophones et MEMS sont gardés pour une future étude spécifique. Les mélanger maintenant aux enregistreurs de bruit créerait un raccourci par type de capteur.
Décision doctorale
Hong Kong est utile comme preuve indépendante que les caractéristiques acoustiques transportent du signal, comme jeu de comparaison et comme futur jeu de représentation audio. Il ne doit pas être fusionné naïvement avec les lignes marocaines. Pour améliorer réellement un détecteur marocain, l'étape décisive reste d'obtenir les WAV ou des résumés calculés avec exactement la même formule autour des fuites confirmées et après réparation.