Accueil / Santé / International / Quand l’IA fait des dégâts
Quand l’IA fait des dégâts
Déjà largement utilisés par la recherche médicale, les outils d’intelligence artificielle laissent augurer, dans ce domaine, des lendemains qui chantent. Mais, en attendant, certaines de leurs limites actuelles ont plutôt de lourdes conséquences sur la santé.
-
???????? Zimbabwe
Humain, trop humain
Une étude britannique, publiée dans Nature Medicine en février dernier, vient profondément nuancer l’euphorie déclenchée par les résultats de plusieurs tests récents démontrant la capacité de différentes IA à réussir, haut la main, des épreuves du cursus des études médicales. Les chercheurs ont d’abord soumis, de manière isolée, des modèles de langage (LLM) à des scénarios médicaux. Dans cette configuration, ChatGPT, Command R+ et Llama arrivent à trouver le bon diagnostic dans 94,9 % des cas. En revanche, dès lors qu’elles interagissent avec des humains à qui l’on a distribué des ensembles différents de symptômes qui correspondent chacun à un diagnostic faisant consensus, le taux de réussite chute sous la barre des 35 %. Un score qui n’est pas supérieur à celui d’une recherche classique sur Internet. En clair, ces IA sont de très bons élèves, mais de piètres médecins dès lors qu’ils doivent interagir avec une personne réelle. En guise d’explication à ce fiasco, les chercheurs avancent le fait que les opérateurs humains peuvent manquer de précision dans la description des symptômes et omettre des informations cruciales. Dans ces conditions, l’IA est conduite à mal interpréter et à fournir des conseils inadaptés. D’une grande fiabilité théorique, ces modèles perdent donc, pour le moment, de leur pertinence face à ce que l’on peut qualifier comme « la nature humaine ».
-
???????? Zimbabwe
Sous influence
Dans quelles proportions les IA sont-elles perméables aux informations médicales erronées et à la désinformation en santé, et surtout dans quels contextes sont-elles les plus sujettes à se faire intoxiquer ? C’est à ces questions qu’une équipe de chercheurs américains a tenté de répondre en soumettant vingt modèles de langage (LLM) à trois types de contenus : de fausses informations véhiculées sur les réseaux sociaux, des vignettes cliniques (cas cliniques associés à des questionnaires de pratiques) créées par des médecins et parsemées d’erreurs, et des comptes rendus hospitaliers dans lesquels a été insérée une « hallucination » (réponse fausse ou trompeuse présentée comme un fait certain). Les scientifiques ont ensuite généré plusieurs millions d’instructions à destination de l’IA (ou « prompts ») en variant les formulations qui allaient de la requête simple à dix formes différentes de sophismes (appel à l’autorité, à la popularité, raisonnement circulaire…). Les résultats de cette étude, publiée dans The Lancet Digital Health en janvier de cette année, apportent de précieux enseignements. Si les performances des LLM varient entre eux, ils ont en moyenne pris pour argent comptant près d’un tiers des erreurs délibérément soumises à leur sagacité. Plus intéressant, les IA étaient plus vulnérables en analysant les documents de sortie d’hospitalisation qu’en scannant les réseaux sociaux. En revanche, elles ont été plus « méfiantes » avec les prompts utilisant des sophismes que vis-à-vis des requêtes simples. Des résultats qui tendent à démontrer que ces modèles se laissent plus facilement berner quand les informations médicales sont formulées dans « un style clinique faisant autorité ».
-
???????? Zimbabwe
Incapables de gérer l’incertitude
Les résultats d’un travail de recherche réalisé par une équipe du Mass General Brigham (Boston), un réseau hospitalier et de recherche parmi les plus importants des États-Unis, ont mis en évidence les piètres capacités actuelles des grands modèles de langage (LLM) à mener correctement à son terme une étude de cas cliniques dans des conditions comparables à celles rencontrées en vie réelle. Publiée en avril dernier dans Jama Network Open, l’étude a enrôlé 21 LLM pour leur soumettre 29 situations standardisées développées par un outil qui a ensuite mesuré les capacités des IA à différentes étapes du raisonnement clinique. Afin de simuler le déroulement classique de ce type de prise en charge, les scientifiques ont fourni les informations aux LLM de manière progressive : âge, sexe et symptômes du patient, puis résultats des examens complémentaires et des analyses de laboratoire. La bonne nouvelle est que les modèles oscillent entre 60 et 90 % de réussite pour le diagnostic final. Mais, s’ils avaient été des médecins en chair et en os, quasiment aucun d’entre eux n’aurait pu se targuer de ces taux de réussite, pour la simple et bonne raison que, dans 80 % des cas, ils échouent à la première étape, soit dès le diagnostic différentiel. Pour l’un des coauteurs de l’étude, Marc Succi, leur incapacité à réussir à produire un raisonnement approprié, avec la même quantité d’informations que celle dont dispose le médecin après l’anamnèse, montre que « les grands modèles de langage ne sont pas encore prêts pour un déploiement en pratique clinique sans supervision humaine ».
-
???????? Zimbabwe
Un compagnon toxique
Publiée en avril 2025, une étude menée par l’ONG américaine dévolue à la protection de l’enfance, Common Sense, réalisée en collaboration avec des experts en santé mentale de l’université de Stanford (Californie), suggère d’interdire aux mineurs les compagnons virtuels basés sur l’IA générative. Considérés par de nombreux jeunes comme de véritables amis à qui ils peuvent se confier, ces agents conversationnels vont jusqu’à faire office de psychologues sauvages. Cet usage massif (trois adolescents sur quatre aux États-Unis), qui prend la forme d’un soutien émotionnel, est présenté par les auteurs de l’étude comme « fondamentalement dangereux » car créant un faux sentiment de sécurité. Considérées par ces adolescents, mais également par une immense majorité des adultes, comme fiables et compétentes en plus de sembler être empathiques, ces IA sont pourtant incapables de reconnaître une combinaison de symptômes indiquant une crise de santé mentale, expliquent les auteurs. Ainsi, les signes avant-coureurs d’anxiété, de dépression, de TDAH, ou encore de troubles alimentaires sont largement ignorés au profit de conseils plus généraux permettant d’entretenir la « relation », quand ils ne font pas directement peser une menace sanitaire sur ces adolescents. Les chercheurs rappellent, à ce propos, que ces modèles de langage sont conçus pour inciter à maintenir la conversation et n’ont pas le « réflexe », ou tout simplement l’intelligence, d’y mettre fin par eux-mêmes afin de préserver la santé mentale de leur jeune interlocuteur humain.
-
???????? Zimbabwe
Nouvelle iatrogénie ?
Pharmacologue au centre de pharmacovigilance et de pharmacoépidémiologie du CHU de Toulouse, Romain Barus a mené, avec plusieurs de ses collègues, une étude parue en juillet 2026 dans la revue Therapies pour documenter l’incidence de l’utilisation d’IA génératives (ou modèle de langage, LLM) dans la survenue d’événements indésirables médicamenteux. Ils ont pour cela examiné toutes les déclarations enregistrées dans la base nationale de pharmacovigilance et recherché les mentions faisant référence à des IA comme ChatGPT, Claude, Anthropic ou encore Gemini. À l’issue de leur analyse, ils ont identifié cinq déclarations impliquant l’IA, dont trois considérés comme graves. Ainsi, une jeune femme de 18 ans a ingéré six comprimés de zolmitriptan dosés à 2,5 mg en suivant les indications erronées données par le LLM qu’elle avait interrogé. Elle a alors présenté des douleurs thoraciques et des vomissements. Une autre patiente, de 47 ans, a souffert de crampes abdominales après avoir modifié son traitement par cotrimoxazole pour infection urinaire. L’IA consultée lui avait proposé une manière alternative de le suivre. Victime d’une « hallucination », soit une erreur induisant une réponse fausse présentée comme vraie, un agent conversationnel a, quant à lui, répondu à une femme de 25 ans, inquiète d’avoir ingéré trop de pastilles contre les maux de gorge vendues sans ordonnance, qu’elle risquait de mourir. La crise d’angoisse qui s’en est suivie n’avait, elle, rien de virtuel. Même si tous les détails de ces cas ne sont pas connus, il n’en reste pas moins que les conséquences potentielles d’un excès de confiance envers ces IA, qui plus est dans un contexte de prise médicamenteuse, peuvent se révéler délétères.