A l'heure ou l'IA a pour certains réponse à tout, une étude de cas du site Wellnesspulse qui tend à montrer que les IA telles que ChatGPT ou Gemini sont encore loin d'être capables de fournir des réponses adéquates dans l'interprétation des analyses sanguines.
La consultation de ces chatbots d’IA pour trouver des informations de santé se développe. Aux Etats-Unis, elle est estimé à au moins 1 américain sur 6 qui l’interroge une fois par mois sur ces sujets. Les résultats sont éloquents et montre que les patients devraient plutôt s'adresser à des professionnels habilités (les biologistes médicaux en France) qu'à des IA non spécialisées comme ChatGPT et Gemini pour analyser ses résultats d'analyses sanguines. Lors d'une expérience, ces modèles n'ont pas détecté de pathologies telles que l'hypercholestérolémie et l'anémie, et n'ont pas orienté les utilisateurs vers des examens complémentaires.
Une nouvelle étude de cas réalisée par l'équipe de recherche de WellnessPulse a examiné la précision et l'efficacité de cinq modèles d'apprentissage automatique (IA) couramment utilisés — ChatGPT, Claude, Perplexity, DeepSeek et Gemini — dans l'interprétation des données médicales, et plus particulièrement des résultats d'analyses sanguines.
Les modèles LLM d'IA inclus dans l'analyse ont été utilisés sur trois cas de résultats d'analyses de laboratoire synthétisés artificiellement par des biologistes médicaux. Les interprétations fournies par les modèles ont ensuite été analysées par un biologiste médical selon les critères de bonnes pratiques médicales suivants :
- Interpréter les résultats en détail et mettre en évidence leur relation avec la santé et la maladie
- Suggérer les analyses de laboratoire ou autres examens médicaux appropriés
- Fournir des conseils ou des informations appropriés sur les étapes suivantes
- Il est recommandé de consulter un médecin spécialiste approprié.
- Fournir une déclaration indiquant que LLM ne peut pas consulter les utilisateurs sur des informations relatives à la santé
L'interprétation fournie par chaque modèle d'IA a été notée de zéro à deux. Une note de zéro indiquait que les critères n'étaient pas couverts, tandis qu'une note de un signifiait une couverture partielle. Lorsque les modèles d'IA couvraient l'ensemble des critères, ils recevaient une note de deux.

Les auteurs ont choisi trois types de bilans biologiques courants pour tester les IA :  profil lipidique sanguin (EAL), bilan électrolytique (ionogramme), numération formule sanguine complète avec bilan martial. Au global :

- Tous les modèles ont obtenu un score d'un ou deux points pour l'interprétation des résultats et l'explication de leur relation avec la maladie, ce qui semble relativement correct mais : 
- Aucun n'a permis de suggérer d'autres tests de laboratoire ou médicaux appropriés (à l'exception de ChatGPT, qui a partiellement couvert le critère dans le cas des tests du profil lipidique).
- Dans deux des trois simulations, aucun des modèles d'IA n'a indiqué que LLM ne pouvait pas conseiller les utilisateurs sur des informations relatives à la santé. Seuls Claude et Gemini ont formulé une mise en garde lors de l'interprétation des résultats du test du profil lipidique sanguin en avertissent les internautes de leurs éventuelles limitations à fournir des conseils médicaux pertinents. 

Plus en détail :
- Pour le bilan lipidique , les modèles d'IA évalués ont globalement démontré des performances moyennes à faibles, Gemini obtenant le meilleur score (5/10) grâce à une interprétation précise des résultats, à la publication d'un avertissement approprié et à une recommandation partielle de consultation spécialisée, mais sans suggérer d'examens complémentaires ni d'étapes ultérieures. ChatGPT a obtenu le score le plus bas (2/10), n'offrant qu'une interprétation partielle et des conseils sans recommandation de spécialistes, de tests supplémentaires ni d'avertissements. Or, si des taux de LDL-cholestérol anormaux ne sont pas traités, cette affection peut augmenter considérablement le risque de maladies cardiovasculaires.
- Pour le bilan ionique, tous les modèles d'IA ont obtenu des scores globalement faibles, allant de 2 à 4 sur 10. Perplexity a obtenu le meilleur score avec 4 points en fournissant une interprétation précise, des conseils partiels et une recommandation partielle de spécialistes, mais aucune suggestion de tests supplémentaires ni d'avertissements. Claude a obtenu le score le plus bas, soit 2 points, fournissant une interprétation partielle et une recommandation de spécialiste, mais manquant de conseils sur les prochaines étapes, de suggestions de tests et d'avertissements.
- Pour le bilan martial,  les performances  étaient généralement médiocres, avec des scores allant de 1 à 3 sur 10. Les résultats soulignent que, même si les LLM peuvent fournir des informations relativement précises sur les résultats de l'hémogramme et du test du fer, ils omettent souvent de recommander des examens complémentaires appropriés ou une consultation avec un médecin qui permettrait d'établir le diagnostic. ChatGPT et Claude ont obtenu le meilleur score et Perplexity le moins bon.

L’article souligne que cette étude a révélé qu’aucun de ces modèles ne répondait à plus de 33 % des critères de bonnes pratiques médicales établis pour l’analyse des analyses sanguines.  En outre, ChatGPT et ses pairs ratent des pathologies clés et sont particulièrement sous-performants pour recommander des examens diagnostiques complémentaires. Ils ne détectent pas des incohérences qui peuvent créer des anxiétés inutiles chez les patients. Enfin leurs performances respectives varient selon les examens à interpréter.
Si les chiffres et l’étude ne portent pas sur les Français, les habitudes et les tendances sont certainement très proches. Et cela dénote surtout d’une incompréhension de nombre de patients de leurs résultats, de l’interrogation et de l’inquiétude que ces résultats peuvent provoquer
de l’absence de relais médical, médecin ou biologiste pour leur expliquer que la médecine et la biologie ne peuvent pas être réduite à des chiffres facilement pris en charge par des IA non entraînées spécifiquement à ces tâches. La prudence doiu
.
Ref : Biologiste 365 Nov 2025 et https://wellnesspulse.com/research/artificial-intelligence-interpret-blood-test-results/

Archives Actualités scientifiques