FAQ sur l’anonymisation

Studio d’anonymisation

TTN propose une solution d’anonymisation pour protéger les données personnelles et confidentielles dans les documents avant leur traduction. Normalement, il est interdit de traduire des textes sensibles (comme des dossiers médicaux ou des décisions juridiques) à l’aide d’une mémoire de traduction, car celle-ci stockerait des données personnelles qui pourraient être accessibles à d’autres personnes. Si ces données étaient compromises (par exemple piratées), elles pourraient être reconstituées et diffusées. Pour l’éviter, TTN a développé un studio d’anonymisation qui remplace les noms, les numéros et autres détails d’identification par des données factices ou des espaces réservés. Ce processus permet de supprimer ou d’obscurcir les informations personnelles tout en conservant la structure du document intacte. Il est important de noter que les données originales ne sont pas perdues – elles peuvent être reconstituées ultérieurement à l’aide d’un fichier de correspondance clé-valeur sécurisé qui relie chaque espace réservé à la valeur originale. Cela signifie que le personnel autorisé peut rétablir les vrais noms ou numéros après la traduction, garantissant ainsi l’exactitude sans jamais exposer les données sensibles au cours du processus de traduction.

Quels sont les projets de traduction qui nécessitent généralement une anonymisation ?

L’anonymisation est cruciale pour tout projet de traduction impliquant des informations personnelles identifiables ou sensibles. Les clients des secteurs très réglementés demandent souvent ce service. Par exemple, les documents médicaux (dossiers de patients, rapports de laboratoire, données d’essais cliniques) et les textes juridiques (décisions de justice, contrats contenant des données personnelles) doivent souvent être rendus anonymes avant d’être traduits. Les institutions telles que les hôpitaux, les cliniques, les tribunaux et les agences gouvernementales doivent respecter des règles de confidentialité strictes et les lois de protection des données (par exemple, le RGPD en Europe). En rendant ces textes anonymes, ces organisations s’assurent de rester en conformité avec les réglementations en matière de protection de la vie privée tout en obtenant la traduction du contenu. En bref, tout document contenant des noms, des numéros de sécurité sociale ou d’identification de patients, des adresses, des données financières ou d’autres données privées est un candidat à l’anonymisation afin de protéger la vie privée des individus au cours du processus de traduction. La solution d’anonymisation de TTN est conçue pour répondre à ces besoins et permet aux traducteurs de travailler sur le contenu sans jamais voir de données personnelles réelles.

Comment fonctionne le processus d’anonymisation de TTN ?

Le studio d’anonymisation de TTN utilise un traitement linguistique avancé pour identifier et masquer les informations confidentielles avant la traduction. Le système analyse le texte source à la recherche d’identifiants personnels (noms de personnes, noms de sociétés, adresses, coordonnées, numéros de patients, dates de naissance, etc.) puis les remplace par un espace réservé neutre ou une valeur fictive. Par exemple, un nom comme « John Smith » peut être remplacé par « Personne A », ou un numéro d’identification spécifique peut être remplacé par un numéro fictif aléatoire du même format. Ces substitutions conservent la même catégorie et le même format que les données d’origine (afin que le texte se lise naturellement et reste cohérent pour la traduction). L’essentiel est qu’il ne reste aucune donnée personnelle réelle dans le texte ; elles ont toutes été remplacées par des substituts fictifs.

Une fois ce remplacement effectué, TTN TMS génère un fichier de mappage clé-valeur (parfois appelé clé de réidentification). Ce fichier stocke en toute sécurité chaque élément sensible original ainsi que son espace réservé correspondant. Le texte anonymisé peut ensuite être envoyé en toute sécurité à la traduction (ou être traité par des systèmes de mémoire de traduction) sans que la vie privée ne soit compromise. Une fois la traduction terminée, les espaces réservés dans le texte traduit peuvent être désanonymisés ; TTN TMS utilise le fichier de mappage pour remplacer les espaces réservés fictifs par les noms, les numéros et les détails d’origine. Ce processus permet d’obtenir un document final traduit dans lequel toutes les informations originales sont rétablies aux bons endroits, mais seulement après que le travail de traduction a été achevé. Tout au long du processus, les traducteurs et les moteurs de traduction automatique traitent exclusivement des données anonymes, ce qui réduit considérablement le risque de fuite d’informations confidentielles.

Quelles sont les méthodes d’anonymisation proposées par TTN TMS ?

TTN TMS offre trois options flexibles pour effectuer l’anonymisation du texte, répondant à différentes exigences de sécurité :

  • IA basée sur le cloud (ChatGPT) : Le texte peut être anonymisé à l’aide de la dernière version d’une IA telle que ChatGPT d’OpenAI. Dans ce mode, le contenu est envoyé à un service d’IA dans le cloud qui renvoie une version anonymisée du texte avec le fichier de correspondance des clés. Bien que cette méthode s’appuie sur une IA puissante pour une anonymisation de haute qualité, elle implique le transfert du texte vers des serveurs externes (souvent aux États-Unis). Important : de nombreuses agences et institutions fédérales suisses n’autorisent pas ce mode, car l’envoi de données confidentielles vers un cloud basé aux États-Unis pourrait violer la souveraineté des données (en raison de lois telles que le CLOUD Act américain). En d’autres termes, même si les données sont anonymisées en transit, le simple fait de transmettre un texte sensible à un service de cloud américain est considéré comme un risque pour la sécurité par les régulateurs suisses.
  • Superordinateur suisse « Alps » (modèle national suisse d’IA) : Le système de TTN peut s’interfacer avec l’infrastructure de supercalcul de la Suisse, ce qui constitue une alternative aux services de cloud étrangers. Le superordinateur national suisse, « Alps », a été utilisé pour former le grand modèle d’IA public du pays (connu sous le nom de « Apertus » – l’un des LLM open source les plus multilingues au monde). Grâce à cette interface, l’anonymisation peut être réalisée à l’aide d’un modèle d’IA hébergé en Suisse. Cette approche permet de conserver toutes les données dans la juridiction suisse, évitant ainsi une exposition au CLOUD Act américain. Le modèle suisse est très performant (il prend en charge plus de 1 800 langues), ce qui signifie qu’il peut identifier et remplacer avec précision des termes sensibles dans une grande variété de langues. L’utilisation d’Alps pour l’anonymisation garantit que les données sont traitées sur des serveurs nationaux sécurisés avec des contrôles stricts de la confidentialité. Il s’agit d’une solution intermédiaire idéale pour ceux qui souhaitent bénéficier de la puissance de l’anonymisation pilotée par l’IA sans confier leurs données à des fournisseurs de services de cloud étrangers.
  • Modèle sur site (Apertus 8B) : Apertus 8B, la version à 8 milliards de paramètres du LLM suisse open source, est installé sur une machine dédiée dans la ferme de serveurs de TTN. L’anonymisation s’effectue ainsi entièrement derrière le pare-feu : le texte ne quitte pas le réseau interne, rien n’est envoyé sur l’internet et aucun coût par requête n’est généré, puisque le traitement s’effectue sur notre propre matériel. Bien qu’un modèle local puisse être légèrement moins puissant qu’un grand système d’IA dans le nuage, il identifie les données personnelles de manière fiable et garantit une confidentialité totale des contenus. Sur demande, la même solution est installée chez le client, sur son propre matériel – elle est entièrement autonome et ne nécessite aucune connexion vers l’extérieur. Cette variante est choisie par les organisations qui traitent des données particulièrement sensibles, par exemple dans le domaine de la défense, pour des projets classifiés ou dans des entreprises soumises à des règles strictes en matière de conservation des données. Lorsque l’outil d’anonymisation est exploité derrière le pare-feu, le mandant peut être certain qu’aucun tiers non autorisé n’a accès aux contenus.

Chacune de ces méthodes produit un texte anonymisé ainsi qu’un fichier clé correspondant. Les clients peuvent choisir le mode qui correspond le mieux à leurs exigences de sécurité et à leurs obligations de conformité. TTN TMS est conçu comme une plateforme flexible, permettant d’adapter l’approche de l’anonymisation au fil du temps, en fonction de l’évolution des besoins opérationnels ou réglementaires.

L’anonymisation permet-elle d’utiliser en toute sécurité les outils de mémoire de traduction ?

Oui. L’anonymisation permet d’utiliser en toute sécurité les mémoires de traduction (TM) pour les textes confidentiels. Les logiciels de mémoire de traduction stockent des phrases ou des segments de textes sources avec leurs traductions dans une base de données en vue d’une réutilisation ultérieure. Si les documents sensibles bruts sont traités directement dans une TM, toutes les données personnelles contenues dans ces documents seront également stockées, ce qui soulève d’importantes questions en matière de respect de la vie privée. Lorsque le texte est anonymisé à l’avance, la TM ne stocke que les caractères génériques masqués et leurs équivalents traduits, plutôt que les données personnelles originales. Cette approche permet de conserver les avantages de productivité de la mémoire de traduction sans exposer d’informations privées. L’anonymisation des données est donc considérée comme une pratique exemplaire recommandée pour les flux de travail de traduction automatique et de TM conformes au RGPD, car elle garantit que les mémoires de traduction ne contiennent que des données anonymisées ou pseudonymisées et ne permettent pas l’identification des personnes.

Grâce à l’anonymisation, les traducteurs peuvent exploiter en toute confiance les correspondances et les répétitions de la mémoire de traduction dans le cadre de projets sensibles, sans porter atteinte à la confidentialité. Cette fonction est extrêmement utile dans des domaines tels que la médecine et le droit, où les documents ont tendance à contenir beaucoup de contenu répétitif. Par exemple, les rapports médicaux réutilisent souvent des phrases, des terminologies et des textes standardisés. Avec une mémoire de traduction, ces segments répétés n’ont besoin d’être traduits qu’une seule fois, et la mémoire de traduction les remplit ensuite automatiquement dans les documents ultérieurs. Des études ont montré que l’utilisation d’une mémoire de traduction peut réduire le temps de traduction d’environ 50 % en moyenne, en particulier pour les textes comportant de nombreuses répétitions (tels que les manuels techniques ou les documents juridiques). Dans le domaine médical, il n’est pas rare de réaliser des économies de temps et d’argent de plus de 50 % grâce à des taux de répétition élevés.

En résumé : l’anonymisation permet d’utiliser en toute sécurité des mémoires de traduction et d’autres outils de traduction par l’IA sur des données sensibles. Elle atténue le risque de fuite d’informations confidentielles tout en préservant les gains d’efficacité associés à la réutilisation de la mémoire de traduction. Cette approche permet une traduction plus rapide et plus cohérente grâce à la réutilisation des traductions existantes, tout en garantissant la protection des noms des patients, des coordonnées des clients et d’autres données privées tout au long du processus.