AWS AI Practitioner - IA Responsable et Éthique
🎯 Objectifs
Ce module couvre le domaine IA Responsable et Éthique (26% de l'examen). Tu vas :
- ✅ Comprendre les sources de biais dans les modèles AI/ML
- ✅ Apprendre les stratégies pour réduire ou éliminer le biais
- ✅ Maîtriser les principes de transparence et d'explicabilité
- ✅ Étudier la gouvernance et la conformité légale (GDPR, etc.)
- ✅ Connaître les considérations éthiques de l'IA en entreprise
📋 Prérequis
- Avoir complété les modules AWS AI Practitioner - Guide Complet et Fondamentaux
- Compréhension générale des droits des données et privacy
- Pas besoin d'expertise technique avancée
🚨 Le Biais en IA : Pourquoi c'est grave ?
Définition simple
Le biais en IA = Quand un modèle traite certains groupes de personnes différemment ou injustement.
Exemples réels de biais disastreux
Recrutement (Amazon) - Amazon a développé un algorithme pour filtrer les CV. Problème : il discriminait les femmes parce que la plupart des candidats dans les données historiques étaient des hommes.
Prêts bancaires - Un modèle peut refuser un prêt à certains groupes démographiques, même si leurs critères de remboursement sont identiques.
Justice pénale - Un système de notation utilisé aux USA pour décider qui libérer a présenté un biais racial (faux positifs 2x plus élevés pour les Noirs).
Santé - Un algorithme de diagnostic a moins bien détecté les maladies chez les femmes parce que la plupart des données d'entraînement provenaient d'hommes.
Pourquoi ça arrive ?
Les modèles apprennent à partir de données historiques. Si ces données reflètent des discriminations passées, le modèle les reproduit.
🔍 Sources de Biais
1️⃣ Biais dans les Données d'Entraînement
Sous-représentation
Problème : Certains groupes sont peu représentés dans les données d'entraînement.
Exemple : Entraîner un algorithme de reconnaissance faciale avec 95% de visages blancs → performance mauvaise sur les autres ethnies.
Solution :
- Collecter plus de données des groupes sous-représentés
- Utiliser le rééquilibrage (sursampling/undersampling)
- Utiliser des données synthétiques pour les groupes minoritaires
Données historiques biaisées
Problème : Les données passées reflètent les injustices historiques.
Exemple : Si historiquement, les femmes recevaient moins de crédits, un modèle apprendra cette discrimination.
Solution :
- Auditez les données pour identifier les biais connus
- Corrigez les données ou pondérez les exemples différemment
- Documentez explicitement les biais connus
2️⃣ Biais de Représentation (Feature Bias)
Problème : Les variables choisies pour entraîner capturent accidentellement l'ethnicité, le sexe, ou d'autres caractéristiques protégées.
Exemple : Un modèle utilise le code postal. Or, le code postal corrèle fortement avec l'ethnicité et le revenu → biais indirect.
Solution :
- Audit des features - vérifier les corrélations cachées
- Supprimer les features problématiques
- Utiliser des técnicas comme la débiasification
3️⃣ Biais d'Agrégation
Problème : Un modèle global fonctionne bien en moyenne mais très mal pour des sous-groupes.
Exemple : Un modèle de prix immobilier fonctionne bien nationalement, mais sous-estime systématiquement les prix dans certains quartiers.
Solution :
- Évaluer la performance par sous-groupe (not just global accuracy)
- Créer des modèles séparés par groupe si nécessaire
✅ Stratégies pour Réduire le Biais
Avant l'Entraînement
1. Audit des données
- Analyser la distribution des données par groupe démographique
- Identifier les sous-représentations
- Documenter les biais connus
2. Rééquilibrage
- Sursampling : dupliquer les minorités
- Undersampling : réduire les majorités
- Poids : donner plus de poids aux minorités pendant l'entraînement
3. Enrichissement des données
- Collecter plus de données pour les groupes sous-représentés
- Utiliser le data augmentation (images synthétiques, etc.)
Pendant l'Entraînement
1. Métriques débiaisées
- Ne pas juste regarder l'accuracy globale
- Mesurer la performance par sous-groupe (precision, recall par groupe)
- Identifier les disparités
2. Régularisation contre le biais
- Ajouter des pénalités pour mauvaise performance sur les minorités
- Objectifs multi-objectifs (maximiser accuracy ET l'équité)
Après l'Entraînement
1. Audit et Test
- Tester sur des cas adversariaux (chercher les cas où le modèle échoue)
- Fairness metrics : mesurer l'équité du modèle
2. Monitoring en production
- Surveiller la performance par groupe
- Alertes si le biais augmente
💡 Métriques d'Équité
Parité Démographique
Même taux de prédiction positive pour tous les groupes.
Formule : $P(\hat{Y} = 1 | A = 0) = P(\hat{Y} = 1 | A = 1)$
Où $A$ est l'attribut protégé (race, sexe, etc.)
Cas d'usage : Recrutement (même % d'acceptation par genre)
Égalité des Faux Positifs
Les groupes ne devraient pas avoir des taux de faux positifs significativement différents.
Cas d'usage : Justice pénale (même probabilité d'être faussement condamné)
Égalité des Faux Négatifs
Idem pour les faux négatifs.
Cas d'usage : Diagnostic médical (même taux de faux négatifs par ethnies)
Calibration
Pour chaque groupe, si le modèle prédit probabilité = 50%, il devrait être correct ~50% du temps.
Cas d'usage : Systèmes de score de crédit
🔓 Transparence et Explicabilité
Pourquoi c'est important ?
Si un modèle refuse un prêt, l'emprunteur a le droit légal (GDPR) de connaître pourquoi. Il faut pouvoir expliquer la décision.
Types d'Explicabilité
1. Explicabilité Globale (Model-Level)
Comprendre comment le modèle fonctionne globalement.
Exemples :
- "Le modèle utilise principalement : âge, revenu, score de crédit"
- "Plus la corrélation avec X, plus la probabilité de Y"
Techniques :
- Importance des features
- Partial Dependence Plots
- SHAP (SHapley Additive exPlanations)
2. Explicabilité Locale (Instance-Level)
Comprendre pourquoi le modèle a pris cette décision pour ce client spécifique.
Exemples :
- "Ce client a été refusé parce que son ratio dette/revenu est trop élevé"
- "Cette image est classée comme spam à cause de ces pixels rouges"
Techniques :
- LIME (Local Interpretable Model-agnostic Explanations)
- SHAP values
- Attention maps (pour réseaux de neurones)
Outils AWS pour l'Explicabilité
Amazon SageMaker Explainability :
- SHAP values intégrés
- Feature importance rapide
- Dashboards visuels
📋 Conformité et Gouvernance
GDPR - Règlement Général sur la Protection des Données
Droit à l'Explication
Article 22 - "Les personnes ont le droit de ne pas être soumises à une décision ... basée uniquement sur le traitement automatisé".
Implication pour l'IA :
- Si une IA refusera un crédit → tu dois expliquer
- Décisions critiques (embauche, crédit, santé) → explicabilité obligatoire
Droit à l'Oubli
Les individus peuvent demander la suppression de leurs données.
Implication : Le modèle doit être capable d'être retrainé sans ces données.
Data Minimization
Collecter seulement les données nécessaires.
Implication pour l'IA : Pas de données démographiques si non nécessaire (réduit aussi le biais).
Autres Régulations
USA - AI Bill of Rights - Non-binding mais influence la policy
EU - AI Act - Classification par risque :
- Risque non-admissible (ex: manipulation mentale) → Interdit
- Risque élevé (ex: recrutement, justice) → Très régulé
- Risque moyen (ex: recommandations) → Transparent
- Risque faible → Peu de restrictions
🏛️ Gouvernance de l'IA en Entreprise
Composants d'une bonne gouvernance
1. Documentation
- Documenter les données (data sheets)
- Documenter les modèles (model cards)
- Documenter les risques identifiés
2. Processus de Review
- Avant déploiement : audit du modèle et des données
- Après déploiement : monitoring continu
- Re-review si changement majeur
3. Ownership et Accountability
- Qui est responsable ? (pas "l'IA a décidé")
- Processus d'appel ou de recours
- Responsabilité légale claire
4. Monitoring en Production
- Alertes si performance par groupe change
- Alertes si nouveau type de biais détecté
- Logs des décisions pour audit
📊 Tableau Synthétique : Biais et Solutions
| Problème | Source | Symptôme | Solution |
|---|---|---|---|
| Sous-représentation | Données | Mauvaise performance sur minorités | Rééquilibrage, collecter plus de données |
| Données historiques biaisées | Données | Reproduit les discriminations | Audit + correction des données |
| Features biaisées | Sélection des features | Biais indirect via corrélation | Audit des corrélations, supprimer features |
| Manque de transparence | Modèle | Impossible d'expliquer les décisions | SHAP, LIME, SageMaker Explainability |
| Non-conformité GDPR | Gouvernance | Droit à l'explication non respecté | Documentation + explicabilité obligatoire |
📚 Concepts clés pour l'examen
| Concept | À retenir |
|---|---|
| Biais de représentation | Sous-rep. → mauvaise perf sur minorités |
| Données historiques | Passé injuste → modèle injuste |
| Parité démographique | Même taux de prédiction positive |
| SHAP / LIME | Expliquer les décisions du modèle |
| GDPR Article 22 | Droit à l'explication des décisions auto |
| Gouvernance | Monitoring, audit, accountability |
📝 Questions type de l'examen
Q1 : Un modèle de recrutement refuse 10% des candidats hommes mais 30% des candidate femmes. Quel problème ?
- A) Underfitting
- B) Biais de parité démographique
- C) Overfitting
- D) Données insuffisantes
- Réponse : B - Les taux sont différents par genre
Q2 : Pour expliquer pourquoi un prêt a été refusé (GDPR Article 22), quel outil utiliser ?
- A) SageMaker Training
- B) Amazon Personalize
- C) SageMaker Explainability (SHAP)
- D) Bedrock
- Réponse : C - SHAP pour l'explicabilité des décisions
Q3 : Comment réduire le biais quand une classe représente 95% des données ?
- A) Utiliser la régularisation L2
- B) Augmenter la taille du modèle
- C) Rééquilibrer en undersampli la classe majorit. ou oversample la minorité
- D) Utiliser plus de CPU/GPU
- Réponse : C - Rééquilibrage des données
🚀 Prochaines étapes
Après maîtriser ce domaine, continue avec :