Transfert international vers les modèles marocains
Expérience rétrospective sans fuite de labels. Wessex et Yorkshire produisent uniquement des scores acoustiques auxiliaires ; aucune étiquette marocaine ne leur est fournie.
Question
Peut-on utiliser les données internationales sans mélanger leurs milliers de lignes présélectionnées avec les campagnes marocaines ?
Le modèle principal reste un expert marocain Balanced Random Forest utilisant toutes les variables disponibles pour son capteur, notamment la fréquence et l'historique. Les modèles externes voient seulement quatre informations compatibles : rang du bruit, rang du spread et mois.
Sources externes
| Source | Cas étiquetés | Fuites | Non-fuites |
|---|---|---|---|
| Wessex complet | 3812 | 2689 | 1123 |
| Wessex plastique | 942 | 616 | 326 |
| Yorkshire exploitable | 72 | 41 | 31 |
Ce que reçoit l'expert marocain
maroc_seul: référence actuelle, aucune aide extérieure ;+score_wessex: ajoute le classement produit par tout Wessex ;+score_wessex_plastique: utilise uniquement les conduites Wessex comparables ;+scores_internationaux: combine Wessex plastique et Yorkshire.
Les scores externes sont convertis en rangs dans chaque campagne. Ils ne prétendent donc pas que les probabilités anglaises — avec une prévalence très différente — sont des probabilités marocaines.
Résultats complets
| Ville | Validation | Stratégie | PR-AUC | Précision@20 | Rappel@20 | F1 |
|---|---|---|---|---|---|---|
| Fez | campaign | maroc_seul | 0.171 | 0.088 | 76.8% | 0.248 |
| Fez | campaign | +score_wessex | 0.173 | 0.087 | 75.8% | 0.254 |
| Fez | campaign | +score_wessex_plastique | 0.179 | 0.087 | 75.8% | 0.257 |
| Fez | campaign | +scores_internationaux | 0.165 | 0.090 | 77.8% | 0.262 |
| Fez | device | maroc_seul | 0.140 | 0.081 | 70.7% | 0.219 |
| Fez | device | +score_wessex | 0.127 | 0.085 | 73.7% | 0.217 |
| Fez | device | +score_wessex_plastique | 0.132 | 0.085 | 73.7% | 0.212 |
| Fez | device | +scores_internationaux | 0.130 | 0.084 | 72.7% | 0.232 |
| Fez | temporal | maroc_seul | 0.208 | 0.112 | 82.9% | 0.325 |
| Fez | temporal | +score_wessex | 0.201 | 0.112 | 82.9% | 0.300 |
| Fez | temporal | +score_wessex_plastique | 0.196 | 0.112 | 82.9% | 0.311 |
| Fez | temporal | +scores_internationaux | 0.236 | 0.112 | 82.9% | 0.304 |
| Mohamadia | campaign | maroc_seul | 0.251 | 0.257 | 43.4% | 0.341 |
| Mohamadia | campaign | +score_wessex | 0.227 | 0.243 | 41.0% | 0.338 |
| Mohamadia | campaign | +score_wessex_plastique | 0.228 | 0.236 | 39.8% | 0.321 |
| Mohamadia | campaign | +scores_internationaux | 0.227 | 0.214 | 36.1% | 0.311 |
| Mohamadia | device | maroc_seul | 0.241 | 0.193 | 32.5% | 0.298 |
| Mohamadia | device | +score_wessex | 0.238 | 0.229 | 38.6% | 0.323 |
| Mohamadia | device | +score_wessex_plastique | 0.219 | 0.207 | 34.9% | 0.308 |
| Mohamadia | device | +scores_internationaux | 0.246 | 0.214 | 36.1% | 0.311 |
| Mohamadia | temporal | maroc_seul | 0.257 | 0.225 | 36.0% | 0.333 |
| Mohamadia | temporal | +score_wessex | 0.216 | 0.225 | 36.0% | 0.338 |
| Mohamadia | temporal | +score_wessex_plastique | 0.261 | 0.225 | 36.0% | 0.338 |
| Mohamadia | temporal | +scores_internationaux | 0.221 | 0.175 | 28.0% | 0.343 |
Télécharger les résultats complets au format CSV.
Meilleur résultat de chaque test
| Ville | Validation | Maroc seul | Meilleure stratégie | Meilleur PR-AUC | Écart |
|---|---|---|---|---|---|
| Fez | campaign | 0.171 | +score_wessex_plastique | 0.179 | +0.008 |
| Fez | device | 0.140 | maroc_seul | 0.140 | +0.000 |
| Fez | temporal | 0.208 | +scores_internationaux | 0.236 | +0.028 |
| Mohamadia | campaign | 0.251 | maroc_seul | 0.251 | +0.000 |
| Mohamadia | device | 0.241 | +scores_internationaux | 0.246 | +0.005 |
| Mohamadia | temporal | 0.257 | +score_wessex_plastique | 0.261 | +0.004 |
Lecture non technique
Une amélioration signifie que l'avis du modèle international aide l'expert marocain à placer davantage de vraies fuites en haut de la liste. Une baisse signifie que cet avis crée du bruit. Le test temporel — apprentissage ancien, prédiction future — est le contrôle le plus proche d'une utilisation réelle.
Pour Fez, la stratégie la plus stable est maroc_seul (minimum 0.140, référence locale 0.140). Pour Mohamadia, la stratégie la plus stable est maroc_seul (minimum 0.241, référence locale 0.241).
Décision scientifique
Un score externe n'est retenu que s'il améliore la stabilité minimale et ne s'effondre pas sur les campagnes futures. Sinon, le résultat négatif reste utile pour la thèse : il démontre expérimentalement que davantage de données étrangères ne signifie pas automatiquement davantage d'information transférable.
Le système demeure marocain : entraînement final, calibration, seuils et validation sont décidés uniquement avec Fez et Mohamadia. Les données internationales servent de connaissance auxiliaire contrôlée.