Assistant virtuel: avis sur l’explicabilité
Publio – Assistant intelligent du portail de l’Office des publications de l’Union européenne (portail de l’OP)
Dernière mise à jour: 11.3.2026
Contenu de la page
- Transparence concernant l’intelligence artificielle (IA) – principes généraux
- Une IA digne de confiance et explicable
- IA et responsabilité
- À propos de Publio
- Termes et définitions
- Qu’est-ce que Publio?
- Quel type de données Publio utilise-t-il?
- Comment Publio fonctionne-t-il?
- Comment Publio analyse-t-il la question et propose-t-il des résultats?
- Avis des utilisateurs
- Traitement des données privées
- Limites actuelles
Publio, l’assistant virtuel du portail de l’Office des publications de l’Union européenne (portail de l’OP), est un outil d’intelligence artificielle (IA) qui interagit avec les personnes physiques et effectue des recherches à l’aide de mots-clés reposant sur des informations accessibles au public sur le portail de l’OP.
Le présent avis sur l’explicabilité renseigne les utilisateurs sur le cadre réglementaire relatif à l’intelligence artificielle et les principes régissant le fonctionnement de Publio dans ce contexte. L’Office des publications de l’Union européenne est attaché à la transparence et à une IA digne de confiance et explicable.
Transparence concernant l’intelligence artificielle (IA) – principes généraux
La transparence et l’ouverture des actions des institutions de l’Union sont essentielles à la bonne gouvernance et à la participation de la société civile, comme le prévoit l’article 15 du traité sur le fonctionnement de l’Union européenne (TFUE), qui dispose:
«1. Afin de promouvoir une bonne gouvernance, et d’assurer la participation de la société civile, les institutions, organes et organismes de l’Union œuvrent dans le plus grand respect possible du principe d’ouverture.»
La charte des droits fondamentaux de l’Union européenne énonce, à son article 41 (droit à une bonne administration), l’obligation pour l’administration de motiver ses décisions.
Un groupe d’experts de haut niveau sur l’intelligence artificielle, mis en place par la Commission européenne, a élaboré en 2019 des «Lignes directrices en matière d'éthique pour une IA digne de confiance» (annexe 1), qui font figurer la transparence parmi les sept exigences (annexe 2) auxquelles les systèmes d’IA devraient se conformer. Ces lignes directrices disposent en outre que la transparence est une composante du principe d’explicabilité, qui exige que les ensembles de données et les processus techniques concernés soient transparents, et que les capacités et la finalité des systèmes d’IA soient communiquées ouvertement. Les ensembles de données et les processus techniques doivent donc être documentés, traçables, explicables et interprétables.
Les principes susmentionnés doivent être appliqués à la mise au point, au déploiement et à l’utilisation de solutions et d’outils fondés sur l’IA par les institutions, organes et organismes de l’UE.
Sur la base de ces principes généraux, les personnes qui interagissent avec un système d’IA doivent être informées d’emblée que tel est le cas. Elles peuvent ainsi choisir en connaissance de cause de poursuivre l’interaction ou de se désengager de l’outil.
Conformément aux règles de transparence, les utilisateurs doivent également recevoir les informations nécessaires pour pouvoir interpréter les résultats du système et les utiliser de manière appropriée.
Une IA digne de confiance et explicable
Une IA digne de confiance et explicable constitue un objectif clé pour l’UE. À cet effet, l’UE a mis en place un cadre réglementaire pour l’IA. Le règlement (UE) 2024/1689 du 13 juin 2024 (ci-après le «règlement sur l’IA») (annexe 3) prévoit deux grands types d’engagements pour les fournisseurs de solutions et d’outils fondés sur l’IA: la transparence et la fourniture d’informations.
Les utilisateurs de systèmes d’IA ont le droit de recevoir des informations. Ce droit est assorti d’obligations, telles que celles d’utiliser le système conformément à la notice d'utilisation et de surveiller le fonctionnement de l’outil d’IA concerné. Le respect de ces règles garantit la responsabilité de tous les acteurs concernés.
Le règlement sur l’IA dispose à l’article 50 (Obligations de transparence pour certains systèmes d’IA) que «1. Les fournisseurs veillent à ce que les systèmes d’IA destinés à interagir avec des personnes physiques soient conçus et développés de manière que les personnes physiques concernées soient informées qu’elles interagissent avec un système d’IA, sauf si cela ressort clairement du point de vue d’une personne physique normalement informée et raisonnablement attentive et avisée, compte tenu des circonstances et du contexte d’utilisation».
Le règlement sur l’IA suit une approche fondée sur les risques et établit une distinction entre les systèmes d’IA à haut risque et les autres systèmes d’IA.
Publio, l’assistant virtuel du portail de l’OP, interagit avec les personnes physiques et effectue des recherches à l’aide de mots-clés reposant sur des informations accessibles au public sur le portail de l’OP. Ces informations sont publiées sur la base du principe de transparence qui sous-tend l’ensemble des politiques et de la législation de l’UE. L’assistant virtuel ne génère pas de nouveaux contenus, ni ne manipule ou n’influence les choix des utilisateurs; il se limite à proposer des options de filtrage possibles pour les recherches des utilisateurs. Publio n’est donc pas considéré comme un système à haut risque au sens du règlement sur l’IA.
Le règlement sur l’IA dispose que la conception et le fonctionnement des systèmes d’IA doivent tenir compte des risques spécifiques que ces systèmes pourraient présenter, tels que 1) la manipulation par des techniques subliminales, c’est-à-dire des techniques au-dessous du seuil de conscience des utilisateurs, ou 2) l’exploitation de groupes vulnérables susceptible de causer des préjudices psychologiques ou physiques. Des obligations de transparence plus strictes s’appliqueront aux systèmes qui i) interagissent avec les humains, ii) sont utilisés pour détecter des émotions ou déterminer l’association avec des catégories (sociales) sur la base de données biométriques, ou iii) génèrent ou manipulent des contenus (hypertrucages [deep fakes]). Si Publio interagit avec les personnes physiques, il n’est pas conçu pour détecter des émotions dans le but de manipuler les personnes et ne contient pas non plus d’éléments susceptibles de conduire par inadvertance à un tel résultat. Publio ne répond donc pas aux critères susmentionnés.
À propos de Publio
Termes et définitions
| Terme | Définition |
|---|---|
| Tables d’autorité | Les tables d’autorité (également appelées Named Authority Lists — NAL) sont utilisées pour harmoniser et normaliser les codes et les libellés associés utilisés dans différents environnements (plateformes, systèmes et applications web) et pour faciliter les échanges de données entre les institutions de l’UE, par exemple dans le cadre du processus décisionnel. Il peut s’agir de listes codifiées de langues, de pays, de personnes morales, etc. |
| Agent conversationnel | Un agent conversationnel ou «chatbot» est un système d’IA conçu pour simuler la conversation humaine et interagir avec les utilisateurs par du contenu textuel ou vocal. Il utilise des techniques de traitement du langage naturel pour comprendre les entrées des utilisateurs et y répondre, fournir une assistance et des informations automatisées ou exécuter des tâches spécifiques sur la base de règles ou d’algorithmes prédéfinis. Les agents conversationnels sont couramment utilisés dans diverses applications, telles que les services à la clientèle, les assistants virtuels et les plateformes de messagerie en ligne, afin de faciliter la communication et de fournir des réponses instantanées aux demandes des utilisateurs. |
| IA conversationnelle | L’IA conversationnelle est une forme d’intelligence artificielle qui facilite une conversation de type humain en temps réel entre un humain et un ordinateur. |
| Flux de conversation | Le terme «flux de conversation» fait référence à la progression harmonieuse et logique d’une conversation (parcours de l'utilisateur) entre l'agent conversationnel et l’utilisateur. Il renvoie à la manière dont un agent conversationnel comprend l’intention de l’utilisateur, apporte des réponses appropriées et mène la conversation afin d’atteindre les objectifs ou la finalité déclarés de l’utilisateur. |
| Entité | Utilisé dans ce contexte, le terme «entité» désigne une information qui peut être extraite de l’entrée de l’utilisateur et qui est pertinente par rapport à l’objectif de celui-ci, c’est-à-dire qu’elle permet de comprendre cet objectif. Ces informations seront identifiées et stockées pour extraire exactement les informations recherchées par l’utilisateur. Un exemple d’entité peut être l’auteur d’un article spécifique. |
| EU Vocabularies ou EuroVoc | EuroVoc (EU Vocabularies) est un ensemble spécifique de tables d’autorité multilingues et pluridisciplinaires gérées par l’Office des publications et couvrant les activités de l’UE. Il contient des termes dans les 24 langues officielles de l’UE, ainsi que dans trois langues de pays candidats à l’adhésion à l’UE: albanais, macédonien et serbe. |
| Intention | Utilisée dans ce contexte, l’«intention» fait référence à l’objectif que l’utilisateur a en tête lorsqu’il saisit ou énonce à haute voix une question ou un commentaire (requête). Une intention représente une idée ou un concept qui peut être contenu(e) dans un message (énoncé) adressé par l’utilisateur. Il peut s’agir par exemple d'un utilisateur qui souhaite rechercher un sujet, une publication ou une personne spécifique. |
| Modèle de langage | Un modèle de langage est un type de programme d’IA conçu pour analyser et comprendre le langage naturel. Il utilise des techniques statistiques et probabilistes pour prédire les mots ou expressions susceptibles d’arriver dans la suite d'une phrase ou d'une séquence de texte donnée. En d’autres termes, un modèle de langage est un outil qui peut être utilisé pour générer ou compléter des phrases en fonction du contexte et du contenu de l’entrée. |
| Compréhension linguistique (CLU) | Un service d’IA conversationnelle en nuage qui utilise une compréhension avancée du langage naturel pour déterminer les intentions des utilisateurs, prédire la signification globale et extraire des informations structurées du texte conversationnel. |
| Grand modèle de langage (GML) | Un grand modèle de langage (GML) est un type avancé d’intelligence artificielle entraîné sur de nombreuses données textuelles afin de comprendre et de générer du langage humain. Les GML utilisent des techniques d’apprentissage profond pour analyser le contexte, saisir les nuances de sens et identifier des schémas dans le langage, ce qui leur permet de traiter des phrases complexes et d’apporter des réponses cohérentes et adaptées au contexte. |
| Apprentissage automatique | L’apprentissage automatique est un type d’IA qui permet à des applications logicielles d’«apprendre» de pratiques et d’avis antérieurs et de gagner ainsi en précision pour prédire des résultats sans être explicitement programmées à cet effet. |
| Traitement du langage naturel | Le traitement du langage naturel est un domaine de l’IA qui permet aux ordinateurs d’analyser et de comprendre le langage humain, tant à l’écrit qu’à l’oral. |
| Parcours de recherche | Le parcours de recherche fait référence à la séquence d’interactions par laquelle passe un utilisateur lorsqu’il recherche des informations. Il s’agit du processus consistant à guider l’utilisateur au moyen d’une série de questions et de réponses afin de déterminer son intention de recherche et d'y répondre. Pour un agent conversationnel, le parcours de recherche consiste à comprendre la requête de l’utilisateur, à extraire des informations pertinentes d’une base de données ou de connaissances et à présenter les informations à l’utilisateur d’une manière facile à comprendre et adaptée à ses besoins. |
| Parcours de l'utilisateur | L’expérience d’une personne au cours d’une session d’utilisation d’un site web ou d’une application, consistant en la série d’actions réalisées pour atteindre un objectif particulier sur ce site ou cette application. |
| Énoncé | Entrée de l’utilisateur qui peut être tout message saisi ou parlé lors d’une conversation. Un énoncé peut consister en un seul mot ou en plusieurs mots, comme une question ou une expression. |
Qu’est-ce que Publio?
Publio, l’assistant virtuel du portail de l’Office des publications (portail de l’OP), est un outil d’IA qui interagit avec les personnes physiques et effectue des recherches à l’aide de mots-clés reposant sur des informations accessibles au public sur le portail de l’OP. Publio associe des techniques d’IA conversationnelle telles que le traitement du langage naturel et l’apprentissage automatique avec des systèmes interactifs de reconnaissance vocale et de recherche traditionnelle, afin d’aider les utilisateurs à trouver des publications et des actes législatifs de l’UE, ainsi que des personnes de contact dans les institutions européennes.
L’assistant virtuel permet spécifiquement des conversations parlées ou saisies entre les utilisateurs finaux et le portail de l’OP. Il est actuellement disponible en anglais, français et espagnol. Tout en étant utilisable par tous, l’assistant virtuel offre également une solution adaptée aux besoins des personnes ayant des difficultés de lecture, améliorant ainsi l’accessibilité. Il permet en outre une recherche conversationnelle, une nouvelle méthode de recherche qui permet aux utilisateurs de parler avec des phrases complètes — comme ils le feraient dans une conversation normale — à un assistant vocal alimenté par l’IA qui fournit les réponses. L’échange entre l’utilisateur et l’assistant virtuel prend la forme d’une conversation.
Quel type de données Publio utilise-t-il?
Publio utilise les informations accessibles au public sur le portail de l’OP. Ces informations sont publiées sur la base du principe de transparence applicable à l’ensemble des politiques et de la législation de l’UE. Sur la base de ce corpus, Publio utilise les classifications et les catégories disponibles sur le portail de l’OP, telles que les domaines EuroVoc, les auteurs ou le format, afin de guider et d’affiner la conversation et d’aider l’utilisateur à effectuer des recherches dans les trois principales collections du portail de l’OP: les publications de l’UE, le droit de l’UE et l’annuaire officiel de l’UE (EU Whoiswho).
Publio utilise un modèle de langage existant pour comprendre les questions posées par les utilisateurs et guider ceux-ci tout au long de leur parcours de recherche. Sur la base des avis des utilisateurs, le modèle de langage de Publio est constamment amélioré et entraîné pour répondre aux attentes des utilisateurs et s’adapter à la diversité de leurs entrées dans les trois langues prises en charge.
Cet entraînement couvre de nombreuses composantes du système qui sous-tend Publio:
- une série prédéfinie d’énoncés associés à différentes formes d’intention possibles pour permettre à Publio de saisir d’abord l’objectif final de l’utilisateur puis de guider celui-ci étape par étape vers la réalisation de cet objectif;
- une série prédéfinie de questions fixes que Publio «comprend» et pour lesquelles il peut fournir une réponse prédéfinie aux utilisateurs. Exemple: «comment puis-je commander des publications?»;
- des entités acquises par l’apprentissage automatique peuvent être identifiées par Publio et utilisées dans ses processus en arrière-plan pour détecter des paramètres de recherche et fournir des résultats de recherche plus précis ou des options permettant d’affiner davantage la recherche. Ces entités sont fondées sur la classification et les catégories de données existantes, telles que les thésaurus EuroVoc ou d’autres tables d’autorité gérées par EuroVoc: auteurs, formats, langues, organes (organisations) de l’UE, rôles fonctionnels dans le service public de l’UE, etc. Sur cette base, Publio peut par exemple comprendre, à partir de la requête de l’utilisateur, que ce dernier recherche une publication sur un sujet spécifique ou d’un auteur spécifique.
Comment Publio fonctionne-t-il?
Publio utilise la compréhension du langage conversationnel (CLU) (annexe 4) en combinaison avec un système d’extraction des entités fondé sur un grand modèle de langage (GML) pour traiter l’entrée de l'utilisateur (un énoncé écrit ou oral) avec précision et efficacité.
Le service de CLU fournit un premier aperçu de l’intention de l’utilisateur et des entités auxquelles il s’intéresse et, pour les requêtes plus complexes, la composante GML affine la reconnaissance de l’entité, garantissant de meilleurs résultats pour les phrases nuancées ou les demandes complexes. Sur la base de l’intention et des entités reconnues, Publio lance un flux de conversation personnalisé visant à aider les utilisateurs à atteindre le résultat visé en quelques étapes simples.
À l’heure actuelle, Publio met en œuvre 4 principaux flux de conversation:
- Recherche de documents pour aider les utilisateurs à rechercher des publications ou des documents juridiques de l’UE
- Recherche de personnes pour aider les utilisateurs à rechercher des fonctionnaires des institutions de l’UE
- Recherche d’organisations pour aider les utilisateurs à rechercher des organes de l’UE (organisations)
- Question et réponse pour fournir une réponse prédéfinie aux questions fréquentes.
Si un flux de recherche est reconnu, l’assistant virtuel guidera l’utilisateur dans la recherche d’un document, d’une personne ou d’une organisation pertinent(e) en lui posant des questions simples et, en fonction de sa réponse, proposera des options de filtrage.
Pour le flux de questions-réponses, le personnel de l’Office des publications tient à jour une liste de questions fréquemment posées et leurs réponses prédéfinies. Si l’intention de questions-réponses est reconnue et qu’il existe un degré élevé de similitude entre la question spécifique de l’utilisateur et l’une des questions enregistrées dans le système, une réponse appropriée sera directement renvoyée à l’utilisateur. Par exemple:
- si l’intention de questions-réponses est reconnue avec une requête telle que «Je souhaite télécharger un fichier», l’assistant répondra par «Pour télécharger un document, veuillez vous rendre sur la page présentant la publication en détail et cliquer sur le bouton ‘Téléchargement et langues’»;
- si l’intention de questions-réponses est reconnue avec une requête telle que «Où puis-je trouver des documents pour les enfants», l’assistant répondra «Les publications pour enfants sont disponibles dans le coin des enfants».
Les utilisateurs peuvent poser les questions par écrit ou oralement. L'agent conversationnel capture l’entrée audio (les questions posées oralement par l’utilisateur) et l’envoie à un moteur de reconnaissance vocale qui la convertit en texte. L’entrée audio est traitée par le service de reconnaissance vocale Microsoft Azure (annexe 5). Publio affiche ensuite les mots issus de l’entrée audio interprétés par le moteur de reconnaissance vocale, avant d’afficher la réponse par écrit et à l’oral à l’aide d’une voix de synthèse. Cet échange est instantané (il se produit instantanément) et éphémère (il ne laisse aucune trace).
Comment Publio analyse-t-il la question et propose-t-il des résultats?
Publio n’utilise pas de GML ni aucune autre technologie d’IA générative pour générer les réponses fournies aux utilisateurs. Tous les messages de Publio reposent sur des modèles prédéfinis. Publio utilise un modèle de langage d’apprentissage automatique qui est entraîné (modèle de langage entraîné) pour apprendre à reconnaître les entrées des utilisateurs et à y répondre. Ce modèle est chargé de traiter le message ou la requête de l’utilisateur, d’identifier l’intention du message et d’apporter une réponse appropriée. Le processus d’entraînement de Publio consiste à fournir au modèle d’apprentissage automatique un grand nombre de données étiquetées, qui comprennent des exemples d’entrées des utilisateurs, ainsi que leurs intentions et les réponses plausibles correspondantes.
Publio utilise le traitement du langage naturel, le modèle de langage entraîné et un GML pour comprendre l’intention de l’utilisateur et extraire de la question de l’utilisateur les entités reconnues (par exemple: terme de recherche, objet, auteur, date du document et format du document). Publio utilise ces entités pour effectuer la recherche et afficher les résultats.
Si les résultats de la recherche sont trop vastes, Publio poursuit la conversation en posant des questions supplémentaires à l’utilisateur, afin d’affiner les résultats de la recherche à l’aide de filtres appliqués à d’autres entités.
Les questions formulées par Publio se limitent à identifier l’intention de l’utilisateur, à en saisir la finalité et à formuler la requête de recherche appropriée au corpus de contenu publié sur le portail de l’OP. Les résultats proposés par Publio proviennent entièrement de ce corpus.
Avis des utilisateurs
À tout moment de la conversation, l’utilisateur final peut fournir un avis positif, neutre ou négatif sur son expérience de l’utilisation de Publio. Il peut s’agir d’un avis manuel introduit par l’utilisateur à tout moment ou en réponse à une fenêtre contextuelle automatique qui s’affiche après quelques secondes d’inactivité. En outre, les questions qui ne sont pas correctement «comprises» par Publio sont automatiquement enregistrées et traitées périodiquement par une équipe de l’Office des publications. Les avis des utilisateurs et l’analyse des questions qui ne sont pas correctement «comprises» par Publio sont utilisés pour réentraîner le modèle de langage en vue d’améliorer en permanence les services fournis aux utilisateurs finaux.
Traitement des données privées
Les données disponibles sur le portail de l’OP sont traitées conformément au règlement général de l’UE sur la protection des données (RGPD) et au règlement relatif au traitement des données à caractère personnel par les institutions, organes et organismes de l’UE (annexe 6).
Publio ne stocke, ne conserve ou n’archive aucun élément, que ce soit l’entrée de l’utilisateur ou les éléments fournis au moyen des réponses de Publio.
Les avis recueillis sont anonymisés de sorte qu'il est impossible de les relier à l’utilisateur auprès duquel ils ont été recueillis.
Aucune donnée à caractère personnel n’est utilisée de quelque manière que ce soit pour la prise de décision, le traçage ou le profilage automatisés. Lorsqu’on utilise des grands modèles de langage (GML) pour extraire des entités, les seules données échangées entre Publio et le GML sont la question de l’utilisateur et le résultat préliminaire d’extraction de l’entité généré par CLU. Aucune donnée à caractère personnel de l'utilisateur n’est partagée ou transmise.
Tous les services utilisés par Publio sont hébergés dans des centres de données européens et toutes les données sont traitées conformément à la réglementation de l’UE en matière de protection des données.
Limites actuelles
- Transcription vocale des noms: si la plupart des noms sont «compris» et transcrits correctement, l’extraction du nom repose sur l’apprentissage automatique et n’est pas exacte à 100 %. En raison des limites liées à CLU, certains noms ne sont pas correctement extraits, même après avoir entraîné le modèle avec les exemples spécifiques de l’ensemble de données.
- Dates en français et en espagnol: la «compréhension» des dates est moins précise en espagnol et en français dans des contextes plus complexes. Par exemple, l’année sera reconnue en espagnol en utilisant «entre 2016 y 2017» sans contexte supplémentaire, alors qu’elle ne sera pas reconnue avec «entre el año 2019 y 2020».
- La reconnaissance vocale ne fonctionne que dans une seule langue à la fois.
- Elle n’a pas de mode orthographique, ce qui signifie qu’elle ne dispose pas d'une fonctionnalité qui permettrait aux utilisateurs d’épeler des mots lettre par lettre afin de garantir une transcription exacte.
- La reconnaissance de l’entité du nom ne fonctionne pas bien dans des expressions plus vastes lorsqu’elle est associée à «Mme»/«Mlle».
Office des publications de l’Union européenne, 16 mai 2023.
1 Disponible à l’adresse: https://digital-strategy.ec.europa.eu/fr/library/ethics-guidelines-trustworthy-ai
2 Les sept exigences auxquelles une IA digne de confiance doit satisfaire sont les suivantes: 1) action humaine et contrôle humain; 2) robustesse technique et sécurité; 3) respect de la vie privée et bonne gouvernance des données; 4) transparence; 5) diversité, non-discrimination et équité; 6) bien-être sociétal et environnemental; 7) responsabilité.
Règlement du Parlement européen et du Conseil établissant des règles harmonisées concernant l’intelligence artificielle (règlement sur l’intelligence artificielle) et modifiant certains actes législatifs de l’Union. L’acte adopté et signé est disponible ici.
4 https://language.cognitive.azure.com/clu/projects/
5 https://query.prod.cms.rt.microsoft.com/cms/api/am/binary/RE5cCGB.
6 Règlement (UE) 2016/679, JO L 119 du 4.5.2016, p. 1, et règlement (UE) 2018/1725, JO L 295 du 21.11.2018, p. 39.