arrow_back Retour au lab
AI Privacy

Privacy Filter

Empêcher qu'un assistant IA envoie le contenu de ses propres mails dans le cloud. Un classifieur PII en local s'intercale entre Claude Code et l'API, masque les noms, emails, téléphones avant l'envoi.

play_circle

Video a venir

De quoi il s'agit

OpenAI a publié `openai/privacy-filter`, un classifieur de tokens à 1.5 milliards de paramètres sous Apache 2.0 qui détecte les données personnelles dans un texte. Le modèle tourne en local. Le lab le branche entre Claude Code et l'API Anthropic, via mitmproxy.

La zone protégée

Quand un agent fouille des mails, des fiches CRM ou la mémoire long terme, le volume de données personnelles qui remonte est imprévisible : signatures, copies cachées, pièces jointes, threads voisins. Le filtre porte sur ce contenu découvert en cours de route. La requête initiale de l'utilisateur part telle quelle. Avant d'arriver chez Anthropic, chaque entité (personne, email, téléphone, adresse, IBAN, SIRET) est remplacée par un placeholder stable. Marc Dupont reste PERSON_001 sur toute la session : Claude raisonne sur l'identité opaque sans perdre le fil.

L'architecture

Un service FastAPI charge le modèle une fois et expose `POST /filter`. Un mitmproxy intercepte les requêtes vers `api.anthropic.com/v1/messages` avec deux addons en cascade : le premier réécrit, le second capture pour l'UI temps réel du sniffer Claude Analysis. Un wrapper `k --anon --sniff --tools` lance les trois services en une commande.

Résultats mesurés et angles morts

Sur une session réelle de recherche de mails : 9 appels filtrés, 235 entités masquées, 0 nom ni adresse partis chez Anthropic. Le français business est très bien couvert malgré la note principalement anglais du model card. En revanche, un prénom tapé en minuscules au fil de l'eau (`je suis fabien`) échappe au modèle. Et les clés API au format `sk-ant-api03-XXXXXXX` ne sont pas reconnues comme secrets.

Les limites

La brique sémantique couvre la base : noms, contacts, comptes, adresses. Elle ne suffit pas seule comme couche de conformité. Il faut y empiler une regex sur les patterns syntaxiques fixes, un dictionnaire métier sur les noms d'entreprises, et un humain dans la boucle sur les contenus sensibles.

Stack

Python FastAPI mitmproxy Transformers OpenAI Privacy Filter