Le blog SmartiaDéveloppement

Protéger ses données quand un assistant IA lit vos fichiers

Un assistant branché sur vos fichiers voit tout ce que voit son utilisateur. Ce qu’il faut vérifier dans le contrat, les droits et le paramétrage.

Données

Dans un cabinet de courtage de dix personnes, la gestionnaire de portefeuille active un assistant sur le serveur de fichiers partagé pour retrouver plus vite les conditions d’un contrat. Trois jours plus tard, une question posée en réunion produit une réponse exacte, tirée d’un dossier de ressources humaines que personne n’avait pensé à protéger. L’assistant n’a rien forcé : il a lu ce que le compte de la gestionnaire avait le droit de lire. Protéger ses données, quand on branche une intelligence artificielle sur ses fichiers, commence donc rarement par un choix d’outil, et presque toujours par un inventaire des droits d’accès.

Cette inquiétude n’est pas marginale. Parmi les entreprises françaises de dix salariés ou plus qui n’utilisent aucune technologie d’intelligence artificielle, 38 pour cent citent les préoccupations liées à la protection des données personnelles et autant l’incertitude juridique, d’après l’enquête TIC-entreprises 2025 de l’Insee. Ces deux freins se traitent, mais ils ne se traitent pas en lisant une page commerciale.

La CNIL publie des fiches pratiques gratuites, à lire avant de brancher un assistant sur vos fichiers. CNIL
Page des fiches pratiques sur l’intelligence artificielle publiées par la CNIL.

La CNIL publie des fiches pratiques gratuites, à lire avant de brancher un assistant sur vos fichiers.

La sécurité des données dans Copilot

En lançant la lecture, vous autorisez le lecteur YouTube et sa connexion à Google, avec ses traitements et éventuels traceurs. Gérer mes choix

Un assistant ne crée pas de droits, il les révèle

Le point le plus mal compris est aussi le plus simple. Les grandes suites professionnelles appliquent le modèle d’autorisations existant. Microsoft l’écrit noir sur blanc dans sa documentation : Copilot respecte votre modèle d’identité et vos autorisations, hérite de vos étiquettes de confidentialité et applique vos stratégies de rétention, comme le détaille la page sur la protection des données d’entreprise.

C’est une bonne nouvelle et un piège. Bonne nouvelle, parce que l’assistant ne contourne pas la sécurité en place. Piège, parce que dans beaucoup de PME, la sécurité en place consiste en un dossier partagé où tout le monde a accès à tout, hérité de l’époque où il fallait bien que chacun puisse travailler. Tant que personne ne cherchait, le problème restait théorique. Un assistant, lui, cherche très bien.

L’inventaire à faire tient en deux colonnes. D’un côté, les répertoires qui contiennent des données personnelles ou confidentielles : paie, dossiers médicaux, contentieux, contrats fournisseurs, pièces d’identité. De l’autre, la liste des comptes qui y accèdent réellement aujourd’hui. L’écart entre les deux est votre risque, et il existait déjà avant l’assistant.

Ce qu’il faut vérifier dans le contrat du fournisseur

Quatre questions suffisent à écarter la majorité des mauvaises surprises, et chacune a une réponse écrite quelque part.

Vos contenus servent-ils à entraîner les modèles. Les conditions commerciales d’Anthropic posent la règle en une phrase, « Anthropic may not train models on Customer Content from Services », consultables dans ses conditions commerciales. OpenAI indique de son côté que les données envoyées à son interface de programmation ne servent pas à entraîner ses modèles sauf activation explicite de votre part, dans sa documentation sur vos données. Microsoft affirme que les invites, les réponses et les données accessibles via Microsoft Graph ne sont pas utilisées pour entraîner les modèles de base.

Combien de temps vos contenus sont-ils conservés. OpenAI décrit une rétention des journaux de surveillance des abus pouvant aller jusqu’à trente jours, avec une option de rétention nulle pour les clients qui y sont éligibles. Cette durée doit figurer dans votre registre de traitements.

Où sont hébergées les données. OpenAI propose une infrastructure européenne. Microsoft rappelle que la limite de données de l’Union européenne s’applique à Copilot, mais aussi qu’elle ne couvre pas les requêtes de recherche web et que les modèles Anthropic en sont actuellement exclus. Cette nuance, écrite en note de bas de page, change la réponse que vous donnerez à un client qui vous interroge.

Le fournisseur agit-il comme sous-traitant au sens du règlement général sur la protection des données. Microsoft le précise explicitement dans son addendum. À défaut de contrat de sous-traitance, vous n’avez pas de base pour confier des données personnelles.

Faut-il une analyse d’impact avant de déployer

La question revient dans chaque projet, et la réponse est plus nuancée qu’un oui ou un non. La CNIL rappelle qu’une analyse d’impact relative à la protection des données est obligatoire dès qu’un traitement est susceptible d’engendrer un risque élevé pour les droits et libertés des personnes, et que le recours à une solution technologique innovante compte parmi les neuf critères d’appréciation, deux critères réunis faisant présumer l’obligation. Sa fiche Réaliser une analyse d’impact si nécessaire précise que l’analyse est présumée nécessaire pour les modèles de fondation et les systèmes d’usage général, dont les usages ne peuvent pas être identifiés de façon exhaustive.

Pour un cabinet comptable qui branche un assistant sur des liasses fiscales, la question ne se pose donc guère. Pour une agence immobilière qui l’utilise à rédiger des annonces à partir de fiches de biens, sans donnée personnelle, elle se pose beaucoup moins. Entre les deux, écrivez la finalité du traitement avant d’arbitrer : la CNIL insiste sur cette finalité déterminée, explicite et compréhensible dès la définition du projet, dans ses recommandations sur le développement des systèmes d’IA.

Les deux risques techniques que personne ne vous explique

L’OWASP publie un classement des risques propres aux applications fondées sur des modèles de langage. Deux entrées concernent directement une PME qui branche un assistant sur ses fichiers, d’après le OWASP Top 10 for LLM Applications 2025.

L’injection de consigne occupe la première place. Le principe est contre-intuitif : un document que l’assistant lit peut contenir des instructions rédigées pour lui, et il peut les suivre. Une facture reçue par courriel, un curriculum vitae déposé par un candidat, une page web consultée pendant une recherche : tous sont des entrées potentielles. La parade tient moins à un réglage qu’à une règle d’organisation, celle de ne jamais laisser un assistant déclencher une action irréversible à partir d’un contenu venu de l’extérieur.

L’agentivité excessive occupe la sixième place. Elle décrit un assistant à qui l’on a donné trop de fonctions, trop de permissions ou trop d’autonomie. Un assistant qui lit vos fichiers est utile. Le même assistant autorisé à envoyer des courriels au nom du cabinet, à modifier des fiches clients et à valider des règlements cumule trois pouvoirs que vous ne confieriez pas à un stagiaire de première semaine.

L’ANSSI a publié en avril 2024 un guide de trente-cinq recommandations de sécurité pour un système d’IA générative, qui couvre l’ensemble du cycle de vie et s’adresse aussi bien aux administrateurs qu’aux responsables de la sécurité. Il est téléchargeable sur la plateforme MesServicesCyber.

Le paramétrage qui évite la plupart des incidents

Cinq décisions, prises une fois, couvrent l’essentiel dans une entreprise de moins de cinquante personnes.

Restreindre le périmètre de lecture. Créez un espace dédié contenant uniquement les documents que l’assistant doit consulter, plutôt que de l’ouvrir sur l’ensemble du serveur. C’est moins élégant qu’une indexation globale, et bien plus facile à expliquer à un client.

Séparer la lecture de l’écriture. Un assistant qui propose un brouillon et un humain qui valide, ce n’est pas de la méfiance, c’est une répartition des responsabilités.

Écrire une règle sur les données interdites. Deux lignes affichées près du poste de travail suffisent : pas de pièce d’identité, pas de donnée de santé, pas de relevé bancaire dans un outil qui n’a pas été validé pour cela.

Journaliser et relire. Regardez une fois par mois ce qui a été demandé. Cette relecture apprend plus sur les usages réels que n’importe quelle enquête interne.

Nommer un responsable. Une personne, avec un nom, qui décide des accès et répond aux questions. Sans elle, les cinq points précédents s’effacent en deux mois.

Ce que le règlement européen sur l’IA change pour vous

Le calendrier d’application est étalé. Les interdictions et l’obligation de maîtrise de l’IA s’appliquent depuis février 2025, et les exigences relatives aux systèmes à haut risque ont été repoussées à décembre 2027 pour les usages de l’annexe III et à août 2028 pour l’annexe I, selon le calendrier de mise en œuvre du règlement.

Pour une PME qui utilise un assistant bureautique, l’essentiel se joue donc ailleurs : dans le règlement général sur la protection des données, qui s’applique déjà, et dans vos engagements contractuels envers vos clients. Le règlement sur l’IA devient déterminant dès que l’outil sert au recrutement, à l’évaluation des salariés ou à l’octroi d’un crédit, trois usages listés en annexe III. Si l’un de ces sujets est sur votre table, le cadrage mérite d’être fait avant le choix de l’outil, et c’est précisément l’objet d’un diagnostic. Vous pouvez en discuter via la page Contact.

Ce que vous pouvez faire cette semaine

Ouvrez votre serveur de fichiers partagé et listez les cinq répertoires les plus sensibles. Pour chacun, vérifiez qui y a réellement accès aujourd’hui, pas qui devrait y avoir accès. Retirez les accès que plus personne ne justifie. Cette heure de ménage protège vos données que vous branchiez un assistant ou non, et elle conditionne tout ce que vous pourrez faire ensuite.

Smartia met l’IA en place
dans votre entreprise et votre quotidien

Prendre rendez-vous