DEEP-PRIVACY

DEEP-PRIVACY - Apprentissage distribué, personnalisé, préservant la privacité pour le traitement de la parole

Coordinateur : Emmanuel Vincent, Centre de Recherche Inria de Nancy - Grand Est

Partenaires : Marc Tommasi, Université de Lille, Aurélien Bellet, Inria de Lille, Pascal Denis, Inria de Lille, Jan Ramon, Inria de Lille, Brij Srivastava, Université de Lille, Rishabh Gupta, Inria de Lille, CRIStAL

Équipe : MAGNET du Groupe Thématique : DatInG

Dates : 2019 - 2023

Résumé :

La reconnaissance vocale est maintenant utilisée dans de nombreuses applications, dont les assistants virtuels qui collectent, traitent et stockent des données vocales personnelles sur des serveurs centralisés, ce qui soulève de sérieuses préoccupations concernant la privacité. Des approches à base de reconnaissance vocale embarquée ont récemment été proposées pour traiter ces aspects de privacité, mais seulement pendant la phase de reconnaissance de la parole. Dans ce cas, comme tous les traitements sont effectués sur le terminal de l’utilisateur, les données vocales restent privées. Cependant, il y a encore besoin d’améliorer davantage la technologie de reconnaissance vocale car ses performances restent limitées dans des conditions défavorables (e.g., environnements bruyants, parole réverbérée, accents forts, etc). Cela ne peut être obtenu qu’à partir de grands corpus de parole représentatifs de conditions d’utilisation réelles et variées. Pour cela, il est nécessaire de partager des données vocales tout en gardant l’identité du locuteur privée. Les améliorations sont alors bénéfiques pour tous les utilisateurs. Il est également évident que l’utilisateur doit avoir le contrôle sur ses données, afin de ne pas transmettre de données dont les contenus linguistiques sont critiques.

Dans ce contexte, DEEP-PRIVACY propose un nouveau paradigme basé sur une approche distribuée, personnalisée et préservant la privacité pour le traitement de la parole, en mettant l’accent sur les algorithmes d’apprentissage pour la reconnaissance de la parole. Pour ce faire, nous proposons une approche hybride : le terminal de chaque utilisateur ne partage pas ses données vocales brutes et exécute des calculs privés localement, alors que certains calculs inter-utilisateurs sont réalisés sur un serveur (ou un réseau peer-to-peer). Pour satisfaire aux exigences de privacité, les informations communiquées au serveur ne doivent pas exposer d’informations sensibles. Le projet aborde les défis ci-dessus d’un point de vue théorique, méthodologique et empirique à travers deux objectifs scientifiques majeurs.

Le premier objectif concerne l’apprentissage de représentations du signal vocal préservant la privacité, c’est-à-dire qui démêlent les caractéristiques susceptibles d’exposer des informations privées (à conserver sur le terminal) de celles générique utiles à la tâche concernée (qui satisfont des aspects de privacité, et peuvent être partagées). Pour la reconnaissance de la parole, cela correspond respectivement à des informations de locuteur (à protéger) et à des informations linguistiques (à partager) portées par la parole. Pour atteindre cet objectif, nous explorerons plusieurs directions, toutes basées sur des approches d’apprentissage profond et outre les mesures classiques de reconnaissance de parole du locuteur, nous utiliserons également des notions formelles de privacité pour évaluer leur performance.

Le deuxième objectif concerne les algorithmes distribués et la personnalisation, grâce à la conception d’algorithmes distribués efficaces fonctionnant dans un environnement où les données utilisateur sensibles sont conservées sur le terminal, avec des composants globaux fonctionnant sur des serveurs et des composants personnalisés fonctionnant sur des terminaux personnels. Les données transférées aux serveurs devraient contenir des informations utiles pour l’apprentissage et la mise à jour des composants globaux (modèles acoustiques), tout en préservant la privacité. Nous étudierons le type de données à échanger (e.g., gradients, modèles partiels...) et étudierons les informations de locuteur restant présentes dans ces données. De plus, les composants personnalisés permettent d’introduire des transformations spécifiques aux locuteurs et d’adapter certains paramètres du modèle au locuteur. Enfin, nous considérerons un contexte peer-to-peer, comme une alternative aux serveurs, pour le partage de données et l’apprentissage de modèles.

Abstract :

Speech recognition is now used in many applications, such as virtual assistants which collect, process and store personal speech data in centralized servers, raising serious concerns regarding the privacy of their users. Embedded speech recognition frameworks have recently been introduced to address privacy issues during the recognition phase : in this case, a (pre-trained) speech recognition model is shipped to the user’s device so that the processing can be done locally without the user sharing its data. However, speech recognition technology still has limited performance in adverse conditions (e.g., noisy environments, reverberated speech, strong accents, etc) and there is a need for performance improvement. This can only be achieved using large speech corpora that are representative of the actual users and of the various usage conditions. There is therefore a strong need to share speech data for improved training that is beneficial to all users, while keeping the speaker identity and voice characteristics private. It is also becoming clear that the user should have better control over its data, so that he/she can decide not to transmit data whose semantic content is sensitive.

In this context, DEEP-PRIVACY proposes a new paradigm based on a distributed, personalized, and privacy-preserving approach for speech processing, with a focus on machine learning algorithms for speech recognition. To this end, we propose to rely on a hybrid approach : the device of each user does not share its raw speech data and runs some private computations locally, while some cross-user computations are done by communicating through a server (or a peer-to-peer network). To satisfy privacy requirements at the acoustic level, the information communicated to the server should not expose sensitive speaker information.
The project addresses the above challenges from the theoretical, methodological and empirical standpoints through two major scientific objectives.

The first objective is to learn privacy-preserving representations of the speech signal that disentangle the features that expose private information (to be kept on the user’s device) and generic features useful for the task of interest (which satisfy some notion of privacy and can thus be shared with servers). For speech recognition, these representations correspond respectively to speaker-specific information (to be protected) and phonetic / linguistic information (to be shared) carried by the speech signals. We will explore several directions, all based on deep learning approaches, and, besides traditional speech and speaker recognition measures, we will also use some formal notion of privacy to assess their performance.

The second objective concerns distributed algorithms and personalization, through the design of efficient distributed algorithms which operate under the setting where sensitive user data is kept on-device, with global components running on servers and personalized components running on personal devices.
The personalized components allow for better speaker-adapted processing and recognition.
Data transferred to servers should contain useful information for learning / updating global components (here speech recognition models), while preserving user privacy. We will study the convergence guarantees of distributed training algorithms and investigate how much speaker information is carried out by the information exchanged during training. Moreover, personalized components allow for introducing speaker-specific transforms and adapting some model parameters to the speaker. We will also consider a peer-to-peer framework, as an alternative to servers, for data sharing and model training.