Google Pixel 11 : l’IA traduit désormais la langue des signes en texte en temps réel

deepmind pixel 11 langue signes

Google franchit une étape majeure dans le domaine de l’accessibilité numérique grâce aux travaux de son laboratoire DeepMind. À l’occasion du lancement des Google Pixel 11 et 11 Pro Fold, le constructeur intègre un modèle d’intelligence artificielle inédit capable de convertir directement la langue des signes en texte. Cette innovation offre aux personnes sourdes et malentendantes un moyen de communication quotidien inédit et particulièrement naturel.

Pixel 11 : une intégration fluide dans Gboard et Transcription instantanée

Le nouveau modèle, désigné sous le sigle SL2T (Sign-Language-to-Text), s’intègre au sein du clavier virtuel Gboard et de l’outil Transcription instantanée (Live Transcribe). Désormais, l’utilisateur gesticule simplement face à l’objectif de son smartphone au lieu de taper ses messages au clavier. De plus, ce dispositif simplifie la navigation sur le Web, la rédaction d’e-mails et les échanges interactifs avec l’assistant Gemini. En conséquence, les personnes sourdes profitent des mêmes avantages ergonomiques que les personnes entendantes avec le traitement de la parole.

Un entraînement massif axé sur la langue des signes américaine

Les ingénieurs de DeepMind ont entraîné le modèle SL2T sur une banque de données impressionnante réunissant plus de 100 000 heures de séquences vidéo multilingues. Environ 25% de ces fichiers concernent la langue des signes américaine (ASL). Par conséquent, l’outil propose uniquement la retranscription de l’ASL vers l’anglais à son lancement. Cependant, l’entreprise américaine prévoit de déployer ultérieurement cette technologie sur d’autres smartphones et d’ajouter de nombreuses langues. On compte en effet plus de 70 millions de personnes sourdes pratiquant environ 200 langues des signes différentes sur la planète.

Une architecture technique qui préserve la vie privée des utilisateurs

Google adopte une stratégie d’analyse spécifique afin de protéger scrupuleusement la confidentialité. Concrètement, un premier modèle situé localement sur le smartphone transforme la séquence d’images en un réseau de coordonnées géométriques. L’appareil transmet uniquement ce squelette vectoriel aux serveurs distants, évitant ainsi le transfert de la vidéo brute. Par ailleurs, le système SL2T traduit directement ces repères en texte sans passer par l’étape intermédiaire des gloses. Cette conversion directe préserve les expressions du visage et les dimensions spatiales tout en offrant une meilleure précision.

Expertise et passion pour les smartphones sur Droidsoft.fr. Suivez Arielle pour obtenir les dernières actualités, tests, et analyses détaillées sur les nouveautés smartphone Android. Restez informé avec ses revues exhaustives et découvrez les tendances du moment dans l'univers des mobiles Android.