
Le Professeur Peter Gilles, linguiste à l’Université du Luxembourg, travaille depuis des années à rendre la Chambre des députés plus accessible à la population diversifiée du pays.
Bien que le français soit l’une des langues administratives officielles, mais aussi la langue utilisée dans tous les textes juridiques officiels, la plupart des débats à la Chambre se déroulent en luxembourgeois. "Si l’on considère que seulement 50 % de la population comprend le luxembourgeois, il existe manifestement un besoin de rendre ces décisions publiques, ces organisations et ces institutions accessibles à l’ensemble de la population", a déclaré Gilles lors d’un entretien avec RTL Today.
Ce n’est qu’il y a une dizaine d’années que les possibilités ont fortement évolué avec le développement des algorithmes de "deep learning". Grâce à ces avancées, le professeur, dont le parcours universitaire est ancré dans la recherche en linguistique informatique, a finalement trouvé en 2022 un moyen de concrétiser ses objectifs.
"J’ai trouvé la possibilité de collaborer avec la Chambre afin de poursuivre le développement [du deep learning pour le luxembourgeois]", explique-t-il. "C’est particulièrement important pour une langue peu répandue. Toutes les petites langues ne sont pas oubliées, mais il est beaucoup plus difficile de développer des systèmes pour elles."
Lors d’un entretien avec RTL Today, le doctorant Nils Rehlinger a expliqué : "Google Translate peut traduire à partir du luxembourgeois, mais aussi en luxembourgeois. En ce qui concerne la qualité, si on la compare à celle obtenue pour des langues plus répandues comme l’allemand, le français ou l’anglais, elle reste encore en retrait. Nous essayons d’améliorer cela."
Une initiative ambitieuse en plusieurs étapes de l’Université du Luxembourg, financée et développée en collaboration avec la Chambre des députés, a été lancée en 2022. "Nous avons tout d’abord développé notre système LuxASR afin de transcrire des discours en luxembourgeois", explique Peter Gilles. Cette technologie est déjà utilisée dans le cadre du fonctionnement interne de la Chambre ainsi que pour la transcription de réunions.
L’entraînement d’un grand modèle de langage (Large Language Model) en luxembourgeois s’effectue de la même manière que pour toute autre langue : à partir d’une grande quantité de textes destinés à des tâches de traitement automatique du langage naturel. LuxASR est principalement entraîné à partir de discours prononcés à la Chambre, ainsi que de données provenant de RTL, des communes et de la radio 100,7. Mais toutes ces données ne suffisent pas encore à construire un modèle réellement performant.
"Nous ne créons pas les modèles à partir de zéro, car cela nécessiterait d’énormes ressources", explique Nils Rehlinger. "[À la place], nous faisons traduire les données par des modèles plus grands et plus performants, puis nous les transmettons à notre modèle afin que celui-ci, plus petit, puisse encore s’améliorer un peu." Après des années d’entraînement et environ 50 modèles développés et améliorés au fil des ans, LuxASR est désormais prêt à être mis en production.
Le président de la Chambre, Claude Wiseler, nous a donné d'autres aperçus de l’introduction de cette nouvelle technologie.
"Nous l’utilisons à des fins internes, afin de simplifier et de structurer notre travail, pour transcrire ce qui est dit à la Chambre", a-t-il expliqué, faisant ainsi référence à l’obligation constitutionnelle de consigner chaque mot prononcé lors des séances publiques. Les discussions et débats parlementaires accessibles au public sont consignés manuellement depuis le XIXᵉ siècle. Une pratique qui est désormais complétée par l’intelligence artificielle. Lors des réunions des commissions, la transcription par IA est également utilisée pour prendre des notes ou résumer les discussions. Dans ce cas, les transcriptions générées par l’IA font ensuite l’objet d’une vérification grammaticale et qualitative.
La technologie étant déjà prête, la prochaine étape est presque achevée : convertir en temps réel des dialogues en luxembourgeois en texte luxembourgeois. "La mise en ligne des sous-titres nous aidera sur deux plans : tout d’abord, bien sûr, pour les personnes qui ont des difficultés auditives, et ensuite parce que beaucoup de gens regardent la télévision sans le son, par exemple dans le bus, dans le train ou sur leur téléphone. Ils pourront ainsi lire les sous-titres sans avoir à écouter", explique Claude Wiseler. Un autre avantage des sous-titres audio et textuels en luxembourgeois est qu’ils peuvent également aider les personnes qui possèdent déjà quelques connaissances en luxembourgeois, mais qui ne le parlent pas encore couramment. "Lire est plus facile qu’écouter. Les personnes ayant un niveau faible en luxembourgeois peuvent donc mieux suivre lorsqu’elles disposent de sous-titres", ajoute le président de la Chambre.
L’objectif ultime est encore plus ambitieux : LuxMT, un modèle actuellement en cours de développement, devrait permettre de transcrire, documenter et traduire automatiquement les débats parlementaires en luxembourgeois, avec des sous-titres multilingues en temps réel en français, allemand, portugais et anglais..
Aussi performant qu’un modèle puisse être, lorsqu’il s’agit d’un sujet aussi important qu’un débat parlementaire, un risque subsiste toujours. Dans le cas de LuxMT, la question est de savoir où placer le seuil de tolérance au risque. "Quelle que soit l’utilisation que nous faisons de l’IA pour les transcriptions ou les traductions, il faut procéder à une évaluation des risques", explique Nils Rehlinger. "Quel est le niveau de risque lié aux erreurs ? Ont-elles des conséquences importantes ou de petites erreurs sont-elles acceptables ?"
"Lorsqu’on se trouve dans un domaine où le risque est élevé, par exemple en médecine ou dans le domaine juridique, un être humain doit bien entendu être impliqué dans le processus." Pour LuxMT, ce sont avant tout la rapidité et la quantité de contenu à traiter qui rendent l’utilisation de l’IA pertinente, mais l’équipe reconnaît également ses limites. "Aucun modèle, pas même le meilleur en anglais, n’est fiable à 100 %", souligne le professeur Gilles. "La Chambre est un sujet sensible. En temps réel, des malentendus peuvent rapidement survenir, car il n’est pas possible de les corriger immédiatement. C’est diffusé à la télévision, c’est déjà dans le monde entier."
Des difficultés supplémentaires se posent avec certains mots et certaines expressions spécifiques qu’une machine peut ne pas connaître. "Et cela restera ainsi, en particulier pour les expressions idiomatiques, les noms, les noms de marques ou les institutions qui sont très spécifiques à un pays", ajoute-t-il. "Je pense que seuls des humains peuvent résoudre cela."
Nils Rehlinger explique que les prochaines étapes consisteront à collaborer avec des traducteurs professionnels : "Pour nous, il s’agit vraiment de nous concentrer sur le langage propre au Parlement luxembourgeois, notamment sur la terminologie et les termes juridiques, afin de spécialiser de manière ciblée le modèle pour ce cas d’usage."
Une solution possible pourrait consister à recourir à une traduction légèrement différée, dans laquelle une personne interviendrait comme instance de contrôle afin de vérifier et d’améliorer les résultats. Une autre approche consiste à adopter un principe auquel la société s’est désormais habituée : comprendre que les sous-titres en temps réel répondent avant tout à un objectif pratique et ne prétendent pas atteindre la perfection.
Ayant grandi au Luxembourg et appris dès son plus jeune âge à apprécier la diversité des origines linguistiques de ses camarades, Nils Rehlinger se considère comme un défenseur du multilinguisme. Il voit dans ce projet une véritable occasion d’améliorer l’accessibilité dans le pays. "La question du multilinguisme au Luxembourg oppose souvent ceux qui défendent le luxembourgeois à ceux qui défendent le multilinguisme", explique-t-il. "Je trouve un peu étrange qu’il semble si difficile de faire les deux à la fois. Le multilinguisme est un élément essentiel de ce qui rend le Luxembourg si particulier."
Peter Gilles ajoute que le trilinguisme du pays et sa dimension internationale soulignent encore davantage la nécessité d’une meilleure accessibilité.
"Ce n’est que grâce à la flexibilité que nous pouvons, en tant que nation luxembourgeoise, définir une coexistence fonctionnelle et vivante avec nos nombreuses langues", affirme-t-il.
Pour Claude Wiseler, la perspective de disposer de traductions en temps réel au Parlement constitue une évolution à la fois passionnante et encourageante. "Lorsqu’on vit dans un pays, on devrait avoir accès à ce qui s’y passe", explique-t-il. "Même si les résidents n’ont pas le droit de vote ou ne souhaitent pas voter, ils sont malgré tout concernés. Et lorsqu’on est concerné, on a le droit de comprendre ce qui se passe."
Un autre aspect lui tient particulièrement à cœur : l’intégration. "Nous voulons que les gens s’intègrent au Luxembourg, qu’ils s’y sentent chez eux et qu’à un moment donné de leur vie, ils acquièrent la nationalité luxembourgeoise, qu’ils s’intéressent à ce qui se passe ici et à la politique", explique le président de la Chambre. "Je trouve important de leur donner au moins la possibilité de comprendre."
Même si les possibilités ne cessent de s’élargir, la prochaine étape pour la Chambre est clairement définie. "Ce que nous essayons de mettre en place au Parlement, c’est un outil d’IA capable de générer des sous-titres en luxembourgeois pour les débats", explique Claude Wiseler. "Nous sommes pratiquement prêts à le mettre en œuvre. L’étape suivante consistera à disposer de traductions automatiques en français et en anglais, afin de pouvoir regarder sur YouTube les séances de la Chambre avec des sous-titres."
Parallèlement aux travaux de l’université, d’autres développements se poursuivent. Un chatbot auquel il sera possible de poser des questions en luxembourgeois est en cours de développement. Une application pour smartphone, capable de convertir des messages vocaux luxembourgeois en texte, est déjà disponible sur Android et iOS. Une version web existe également.
Vers fin 2026 ou début 2027, l’équipe prévoit de mener une enquête afin d’évaluer la qualité des traductions réalisées par l’IA. Les résultats devraient permettre d’améliorer encore les systèmes.