R2D2 - Détection robuste et fiable des deepfakes
Coordinateur : Jan Butora CRIStAL
Équipe : SIGMA du Groupe Thématique : DatInG.
Durée : 48 mois
Résumé :
Les progrès récents en matière d’intelligence artificielle générative, en particulier les modèles basés sur la diffusion et les pipelines texte-image, ont rendu facile la production d’images photoréalistes pratiquement impossibles à distinguer des photographies authentiques. Si cette avancée technologique offre des possibilités créatives sans précédents, elle porte également atteinte à l’intégrité de l’imagerie numérique et favorise toute une série d’utilisations malveillantes : usurpation d’identité, exploitation des enfants, fraude à l’assurance et manipulation du discours public pendant les élections. Les réponses réglementaires actuelles reposent en grande partie sur le tatouage numérique actif ou les signatures cryptographiques. Cependant, ces mécanismes sont inefficaces contre les acteurs non conformes et nécessitent souvent une connaissance approfondie du système de tatouage numérique.
Le projet R2D2 propose un cadre de vérification indépendant et post-distribution qui complète les mesures de protection actives existantes. S’appuyant sur des détecteurs de pointe, notamment des réseaux neuronaux convolutifs et des transformateurs de vision, R2D2 comblera trois lacunes fondamentales de la détection actuelle des deepfakes : (1) l’absence de garanties statistiques prouvables sur l’erreur de prédiction, (2) la robustesse limitée dans la localisation des manipulations générées par l’IA dans le cadre d’opérations de post-traitement courantes, et (3) la généralisation peu fiable au contenu hors distribution.
À cette fin, R2D2 va : (i) développer des pipelines de détection interprétables dotés de limites de confiance rigoureuse ; (ii) créer des algorithmes de localisation avancés capables de repérer les retouches basées sur l’IA, même après une compression ou un redimensionnement agressifs ; et (iii) concevoir un cadre décisionnel robuste qui s’abstient explicitement en cas d’entrées incertaines ou inconnues.
Abstract :
Recent advances in generative artificial intelligence-particularly diffusion-based models, and text-to-image pipelines-have made it trivial to produce photorealistic images that are virtually indistinguishable from genuine photographs. This technological leap, while enabling unprecedented creative possibilities, simultaneously erodes the integrity of digital imagery and fuels a spectrum of malicious uses : identity fraud, child exploitation, insurance deception, and the manipulation of public discourse during elections. Current regulatory responses largely rely on active watermarking or cryptographic signatures. However, these mechanisms are ineffective against non-compliant actors and often require proprietary knowledge of the watermarking scheme.
The R2D2 project proposes an independent, post-distribution verification framework that complements existing active safeguards. Leveraging state-of-the-art end-to-end learning detectors-including Convolutional Neural Networks and Vision Transformers-R2D2 will address three fundamental shortcomings of current deepfake detection : (1) the absence of provable statistical guarantees on prediction error, (2) limited robustness in localizing AI-generated manipulations under common post-processing operations, and (3) unreliable generalization to out-of-distribution content.
To this end, R2D2 will : (i) develop interpretable detection pipelines equipped with rigorous confidence bounds ; (ii) create advanced localization algorithms capable of pinpointing AI-based inpainting even after aggressive compression or resizing ; and (iii) design a robust decision framework that explicitly abstains when encountering uncertain or unfamiliar inputs.