Passer au playerPasser au contenu principal
  • il y a 7 semaines
Florent Van Calster, le PDG de Whispeak, était l'invité de François Sorel dans Tech & Co, la quotidienne, ce jeudi 25 juin. Il s'est penché sur le lancement d'une technologie capable de démasquer les voix deepfakes, de détecter l’IA vocale, sur BFM Business. Retrouvez l'émission du lundi au jeudi et réécoutez la en podcast.

Catégorie

📺
TV
Transcription
00:00Tech & Co, la quotidienne, l'invité.
00:04On va découvrir WeSpeak avec son PDG, Florent Van Kallster est avec nous.
00:09Bonsoir Florent.
00:10Bonsoir.
00:11Merci d'être avec nous.
00:12Alors vous êtes, je le disais, le patron de WeSpeak,
00:14qui est une sorte, j'ai envie de dire, pour qu'on comprenne bien un peu,
00:17un face ID de la voix.
00:20En gros, vous arrivez à vérifier une voix,
00:25et à savoir que c'est ma voix, véritablement.
00:27Et là où vous faites fort, d'après ce que j'ai compris,
00:29c'est que, non seulement vous pouvez savoir si c'est ma voix,
00:32mais vous pouvez détecter aussi que c'est une imitation de l'IA de ma voix.
00:37Exactement.
00:38En fait, nous chez WeSpeak, on est le spécialiste de l'identité vocale.
00:41Alors qu'est-ce qu'il y a derrière ce terme un peu galvaudé d'identité vocale ?
00:44Deux piliers.
00:45Premier pilier, une technologie propriétaire à la pointe de l'état de l'art
00:48qui va vous permettre de reconnaître qui parle.
00:50Et ça, c'est la biométrie vocale.
00:52Les usages sont nombreux, c'est reconnaître le client qui appelle le centre d'appel,
00:55vérifier qu'une commande vocale faite dans la voiture est faite par la bonne personne,
00:58et non pas les enfants à l'arrière qui jouent avec le régulateur de vitesse,
01:01ou encore dans les enquêtes, exploiter les écoutes téléphoniques,
01:04ou ce genre de choses-là.
01:05Donc, premier pilier, biométrie vocale, reconnaître qui parle.
01:08Deuxième pilier, l'identité vocale, c'est maintenant,
01:10avec l'ère de l'IA, l'IA générative, tout ce que ça comprend,
01:14notamment les risques quand on parle d'identité,
01:16on va être en mesure, nous, de détecter si la voix est authentique
01:19ou si elle était générée ou modifiée par l'intelligence artificielle.
01:23On ne fait pas juste détecter ça, on fait ça très bien,
01:25on est les meilleurs mondiaux sur le sujet.
01:27On a gagné le concours notamment de l'AMIA,
01:29de l'association militaire d'IA de défense sur le sujet,
01:31avec moins d'un pour cent d'erreurs,
01:32et les deuxièmes de ce concours-là étaient ni plus ni moins
01:35qu'une boîte de la BITD française avec plus de 9% d'erreurs.
01:38Ah oui, donc un gros gap quand même.
01:39Exact, on est très fiers de ça, je suis très fiers des équipes là-dessus.
01:42Donc 99% de réussite si on part dans l'autre sens.
01:44C'est ça, 99% de réussite sur ce dataset,
01:47sur ce jeu de données spécifique.
01:48Et ensuite, si on parle de différents éditeurs,
01:51vous avez sûrement entendu parler d'Eleven Labs,
01:52mais là on sait détecter 100% de leurs détecteurs à date.
01:56Le but c'est qu'on soit capable d'être à 100%
01:58sur la quasi-totalité des...
02:00Eleven Labs, rappelons-le,
02:02qui arrive à numériser des voix.
02:04C'est-à-dire que par exemple, moi je parle 10 secondes
02:05dans une IA d'Eleven Labs,
02:07et après, elle peut me faire dire n'importe quoi
02:11avec mon timbre de voix, mon intonation, etc.
02:14C'est de mieux en mieux fait, d'accord ?
02:17On se casse de plus en plus le nez,
02:19c'est-à-dire que même si on fait attention,
02:22parfois on a du mal à se rendre compte
02:24que c'est des intonations liées à une IA,
02:27mais vous, vous allez détecter quoi qu'il arrive ?
02:29Quoi qu'il arrive, c'est-à-dire qu'on ne va pas se focaliser
02:32uniquement sur le timbre et autres,
02:33ça détecte tout ça ensemble d'artefacts.
02:34Vous allez analyser le spectre, c'est quoi ?
02:36C'est dans les fréquences de la voix ?
02:38C'est tout un tas de choses,
02:39ça va de la fréquence au timbre jusqu'à les poses
02:41qu'il pourrait y avoir, un bon métallique,
02:43c'est vraiment très large,
02:44il y a plusieurs centaines de facteurs
02:45qui vont s'analyser d'un fichier audio.
02:47Ça, c'est votre petite recette secrète ?
02:48Exactement, la fameuse secret sauce.
02:50La secret sauce.
02:52Parlons de votre premier pilier qui est très intéressant,
02:55qui est un peu, je vous disais, la biométrie vocale.
02:59C'est intéressant parce qu'aujourd'hui,
03:01la biométrie, c'est l'empreinte digitale,
03:04ça va être l'iris, par exemple.
03:06Est-ce que demain, on pourrait imaginer que, pour payer,
03:09pour rentrer chez moi, grâce à l'une de vos solutions,
03:14on ait une certitude que c'est moi qui donne l'ordre
03:18parce que c'est ma voix ?
03:19Absolument, et ce n'est pas la science-fiction,
03:21c'est déjà le cas aujourd'hui.
03:23On est en train d'expérimenter chez différents constructeurs
03:25automobiles et fournisseurs d'automobiles,
03:27ceux qui ont l'usage-là,
03:29commander le véhicule à la voix.
03:30Par exemple, je ne sais pas moi,
03:32ouvre la porte, ça va marcher parce que c'est moi qui le dis.
03:36Parce que c'est vous qui le dis.
03:37Si c'est vous qui le dis, ça ne va pas ouvrir la porte.
03:39Exactement, même si j'essaie de vous imiter,
03:40et on saura dire, par exemple,
03:42si vous dites autre chose qu'ouvrez la porte,
03:44on saura dire que c'est vous,
03:44mais que vous n'avez pas dit d'ouvrir la porte.
03:47Donc vraiment, on saura détecter qui parle
03:50au-delà de ce qui est dit.
03:51Nous, ce n'est pas tant notre métier,
03:52notre métier, c'est vraiment reconnaître qui parle
03:53et est-ce que la voix est authentique ?
03:55Donc là, on a parlé de l'automobile.
03:57Le plus gros usage qu'on a,
03:58c'est surtout la relation de client.
03:59Aujourd'hui, quand on appelle sa banque,
04:01son opérateur téléphonique,
04:03parce qu'on a un problème souvent urgent,
04:05on va passer la première minute de l'appel
04:07à prouver qui on est.
04:08Dire bonjour, Florent, qu'est-ce qui se passe ?
04:10Et votre numéro de téléphone,
04:11votre adresse mail, votre adresse postale, etc.
04:14Exactement.
04:14Donc là, on perd une minute de l'appel.
04:16On n'a pas vraiment de sécurité
04:17parce que ces infos-là,
04:18c'est du niveau ingénierie sociale basique pour un hacker.
04:21Après, il y a la double authentification aujourd'hui.
04:23Sur les centres d'appel,
04:24ça reste assez rare quand même pour l'instant.
04:25Voilà, sur les banques, oui.
04:26Alors que là, la situation avec la biométrie vocale
04:28où il speak, c'est
04:29« Bonjour, c'est Florent, j'ai oublié ma carte
04:31ou j'ai perdu ma carte, aidez-moi. »
04:33On prend ce que vous venez de dire,
04:34on le compare à la signature vocale
04:35liée au numéro de téléphone appelant
04:37et la seconde où vous avez fini de parler,
04:39l'agent sait qui vous êtes de façon biométrique
04:40et pourquoi vous appelez.
04:42On amène de la sécurité,
04:43on enlève toute la phase d'authentification explicite
04:45qui fait gagner du temps à tout le monde
04:46et on améliore l'expérience client.
04:48Aucune friction pour prouver qu'il y en est,
04:49on traite directement l'objet de l'appel.
04:50Avec un taux de réussite
04:51ou une marge d'erreur de combien ?
04:53On a une idée là ou pas ?
04:54Là, on est de l'ordre de 0,1% d'erreur,
04:58donc c'est-à-dire 99% de stabilité.
04:59Est-ce que c'est acceptable
05:01pour, par exemple, une banque
05:02d'avoir ce 0,1% d'erreur ?
05:03Bien sûr, et dans tous les cas,
05:04n'oublions pas qu'on est en multifacteur aussi.
05:06Il n'y a pas que la voix.
05:07Il y a aussi le numéro de téléphone
05:08qui fait office de facteur de possession
05:11et cette performance-là,
05:13c'est tout à fait au niveau
05:15des capteurs faciaux, digitaux, iris.
05:18Même l'ADN n'est pas à 100%.
05:20Ça n'existe pas, une biométrie à 100%.
05:21Donc c'est tout à fait acceptable.
05:23Et on est d'ailleurs au niveau
05:24des standards FIDO.
05:25FIDO dit que pour moins de 0,1%
05:27de faux positifs,
05:28il faut moins de 5% de faux négatifs.
05:31Donc on est tout à fait dans cette norme-là.
05:35Vous pensez que ça va arriver
05:36dans le grand public ?
05:37Est-ce que demain,
05:37on pourra s'authentifier avec la voix ?
05:40Vous parliez de la voiture,
05:41vous faites des tests,
05:41mais c'est que des tests
05:43ou ça va bientôt arriver sur des véhicules ?
05:45C'est déjà sur des démo-cars
05:46qui sont en train d'être montrés
05:47à des constructeurs.
05:49Le choix maintenant
05:50est d'aller dans les mains
05:50des constructeurs,
05:51savoir est-ce qu'ils veulent
05:52équiper leur véhicule de ça.
05:53Je n'ai aucun doute là-dessus.
05:54On est déjà en train de déployer
05:56un décent d'appel.
05:56On n'aurait plus besoin de clés ?
05:57Plus besoin de clés,
05:58plus besoin de téléphone,
05:59avec différents modèles
06:00d'authentification et d'identification.
06:01Mais si je suis enroué,
06:02je ne sais pas moi,
06:03si je pars ma voix,
06:03pour une raison,
06:04pour une autre,
06:04ça peut arriver.
06:05Mais ça marche.
06:06Ça marche quand même.
06:06Ça marche jusqu'à un certain degré
06:08pour être totalement transparent.
06:09Forcément,
06:10si vous avez une extinction de voix,
06:11Mais si j'ai le nez bougé
06:12parce qu'il y a une allergie ou quoi,
06:13ça va marcher quand même ?
06:14Ça marche.
06:14En fait,
06:14ce qu'il faut retenir,
06:15c'est qu'on analyse
06:15plus de 180 facteurs d'une voix
06:18qu'on sait caractériser
06:19et quand on est malade,
06:20il y en a peut-être une dizaine
06:22qui vont changer.
06:23À l'orénu,
06:23on va beaucoup les entendre.
06:24Mais malgré tout,
06:25l'algorithme va se retrouver
06:27dans les bonnes comparaisons finalement.
06:33C'est ça.
06:33Encore une fois,
06:34jusqu'à un certain degré.
06:35Forcément,
06:36si on ne comprend pas ce que vous dites,
06:38si on ne vous entend pas vraiment,
06:40on ne saura pas vous reconnaître.
06:41En gros,
06:41pas de voix,
06:41pas de chocolat.
06:42Pas mal.
06:44Vous la tenez bien.
06:45C'est pas mal.
06:46Quels sont les autres usages ?
06:47Peut-être revenons aux fake news
06:48parce que c'est vrai
06:49qu'aujourd'hui,
06:50sur les réseaux,
06:50on voit énormément de fausses vidéos.
06:53qui ne sont pas indiquées
06:54comme étant fausses vidéos.
06:56Finalement,
06:57à partir du moment
06:58où il y a du son,
06:59là,
06:59vous pouvez rentrer en jeu.
07:00Exactement.
07:01Parce que si on a
07:03une fausse voix,
07:04enfin une voix qui est générée
07:05par l'IA,
07:05on peut imaginer que la vidéo
07:06sera générée aussi par l'IA.
07:08Absolument.
07:09Donc si on se concentre
07:09uniquement sur la voix,
07:10nous,
07:11on saura détecter que
07:12c'est généré ou modifié
07:13par l'intelligence artificielle.
07:15Là,
07:15on parle de fake news
07:16et il y a d'autres boîtes françaises
07:16qui font ça très bien.
07:17La détection multimodale de deepfake,
07:19je pense à Label4EI
07:20ou d'autres boîtes françaises
07:20qui font ça très bien.
07:21Nous,
07:22on se focalise uniquement
07:22sur la voix
07:23et ce n'est pas uniquement
07:23les fake news,
07:24c'est aussi les appels
07:25qu'on reçoit constamment
07:27des gens qui essaient
07:28de vous vendre
07:28des fermetures,
07:29des vols électriques
07:30ou de l'énergie
07:30ou ce genre de choses-là.
07:32Souvent,
07:32en prise de contact,
07:33c'est un serveur vocal interactif,
07:34on saurait le détecter.
07:35Mais surtout,
07:36les fraudes,
07:37les gens qui se font passer
07:37pour vos proches
07:38à l'autre bout de la France
07:39en situation d'urgence
07:40qui ont besoin de 500 euros
07:41pour se sortir de la mouise,
07:43ils utilisent
07:43la voix de vos proches
07:44pour ne pas passer pour eux
07:45via du deepfake.
07:46Ça,
07:46ça existe déjà ?
07:47Ça existe déjà,
07:48ce n'est plus une fiction,
07:49ça a été forcément,
07:50ça a vu le jour aux Etats-Unis,
07:51ça a pris son essor
07:52un peu partout
07:52et maintenant,
07:53on commence à avoir
07:53des attaques en France
07:54et on est déjà en train
07:55de discuter avec pas mal
07:56d'opérateurs français,
07:57notamment un,
07:58Bouygues Télécom,
07:59avec qui on est présenté
07:59à Vivatech la semaine dernière.
08:01On a réussi à intégrer
08:02en cœur de réseau
08:03notre détection
08:03de voix de synthèse
08:04pour que demain,
08:05Bouygues puisse dire
08:05à ses clients,
08:06attention,
08:07vous parlez à une voix de synthèse,
08:13l'arrivée en masse de l'IA,
08:15forcément,
08:15on aura ça,
08:16c'est-à-dire qu'on aura
08:17un petit disclaimer
08:18en disant attention,
08:19l'appel qui va être généré,
08:20que vous allez recevoir
08:21est généré par une IA,
08:22c'est obligé.
08:23Et c'est même,
08:23ça va devenir une obligation,
08:25je pense,
08:25pour les fournisseurs téléphoniques.
08:26Dernier exemple
08:27qui avait fait,
08:29on va dire,
08:30la une de l'actualité
08:31de la tech,
08:32il y a quelques mois
08:33ou quelques années de cela,
08:34c'était lors de cette visio,
08:37ce directeur financier
08:38qui s'était fait berner
08:39par un faux patron
08:39qui était généré
08:41justement par l'IA,
08:42croyant que
08:43il devait signer,
08:45je ne sais pas moi,
08:45quel virement
08:47vers quel compte
08:48un peu bizarre
08:49et il s'est fait avoir
08:50et le virement a été fait
08:52et ça a été catastrophique
08:53bien évidemment.
08:54Là aussi,
08:55vous pouvez rentrer
08:55dans ce jeu-là.
08:56Absolument,
08:56la fameuse fraude au président,
08:58elle est de plus en plus élaborée,
08:59avant c'était juste
08:59un coup de fil
09:00sans forcément imiter la voix,
09:01on crée la situation d'urgence,
09:03parfois ça passait,
09:04maintenant c'est beaucoup
09:04plus sophistiqué,
09:06sophistiqué pour celui
09:07qui reçoit l'appel
09:07et l'attaque,
09:08mais d'un point de vue attaquant,
09:10comme vous l'avez dit tout à l'heure,
09:11il faut moins de 10 secondes
09:11de la voix cible
09:12pour limiter
09:13et après,
09:13elle peut faire dire
09:14n'importe quoi dans un appel.
09:15Donc en effet,
09:16on peut intervenir là-dessus
09:17sur la téléphonie de l'entreprise
09:18ou via l'opérateur,
09:20directement détecter,
09:20la voix est synthétique,
09:22nous on peut même
09:22aller plus loin,
09:23la voix est un deepfake
09:24et la voix n'est pas
09:26celle du prétendu
09:27directeur financier.
09:28Florent,
09:28dans notre métier,
09:29dans notre secteur,
09:31le journalisme,
09:32les médias,
09:32ça a du sens aussi
09:33ce que vous faites ?
09:34Absolument,
09:34c'est-à-dire que je pense,
09:35je suis sûr que vous êtes
09:36vous aussi exposé
09:37à des sources
09:38ou des faits
09:38que vous souhaitez relayer,
09:40souvent sous forme de contenu,
09:41que ce soit des fichiers audio
09:42ou des vidéos,
09:43il y a forcément
09:43un intérêt pour vous
09:44de pouvoir vous assurer
09:46que l'information
09:46que vous allez
09:47et que vous apprêtez
09:48à relayer,
09:48elle est authentique.
09:50Donc que ce soit
09:51de détecter l'image,
09:52la vidéo ou l'audio,
09:53il y a forcément
09:54un intérêt pour vous.
09:55Très intéressant,
09:56ça s'appelle
09:57WeSpeak,
09:57W-H-I-S-P-E-A-K.
10:00Merci beaucoup Florent.
10:01Merci à vous.
10:01Florent Van Kalster,
10:03dont vous en êtes le PDG.
Commentaires

Recommandations