Le cofondateur d’Anthropic, Dario Amodei, écrivait dans un essai en 2024 que la biologie était le domaine où l’intelligence artificielle (IA) pouvait le plus apporter. Il prédisait que l’IA générative permettrait aux chercheurs d’accomplir en 5 à 10 ans ce qu’ils auraient pu faire en 50 à 100 ans sans IA. La publication, en preprint, cette semaine, des premiers résultats obtenus par le laboratoire de biologie moléculaire d’Anthropic laisse entrevoir que cette prédiction pourrait effectivement se réveler exacte.
Anthropic a ainsi mis à contribution près d’un millier d’agents Claude pour explorer à très grande échelle des séquences génétiques à la recherche de systèmes biologiques encore inconnus. En examinant plus de 200 000 transcriptases inverses (RT), les agents ont identifié plusieurs milliers de systèmes candidats, parmi lesquels une famille jusqu’alors non caractérisée de transcriptases inverses associées à des séquences répétées. Baptisé ART (array-associated reverse transcriptases), ce système présente certaines caractéristiques évoquant celles des systèmes CRISPR déjà largement utilisés comme ciseaux moléculaires en biologie moléculaire. Sa fonction reste cependant inconnue.
La démarche illustre avant tout une nouvelle manière de faire de la recherche en massifiant le recueil et l'analyse de données. Les 950 agents Claude ont travaillé en parallèle pendant 21 heures. Ils ont analysé plus de 200 000 transcriptases inverses, identifié environ 3 500 systèmes candidats, puis retenu une vingtaine d’entre eux jugés particulièrement intéressants pour une analyse approfondie. À une échelle encore plus large, l’analyse s’inscrivait dans l’exploration d’une base comprenant environ 1,9 milliard de clusters de protéines. L’objectif était de repérer, parmi cette masse considérable de données génomiques, des organisations moléculaires atypiques susceptibles de correspondre à des systèmes biologiques encore inconnus.
L’intérêt de cette approche réside dans la puissance de calcul, bien sûr, mais aussi dans la possibilité de multiplier les hypothèses et de laisser les agents décider eux-mêmes quelles pistes méritent d’être approfondies. Sur son site, Anthropic explique avoir fourni à Claude une seule instruction initiale : explorer une vaste base de données de séquences d’ADN à la recherche de nouvelles transcriptases inverses. Les agents ont ensuite parcouru les données, étudié les différentes familles de protéines et utilisé leurs propres critères pour sélectionner les candidats jugés les plus intéressants.
Les enseignements tirés de cette analyse sont ensuite réinjectés dans les instructions données à Claude, afin de lui permettre de reproduire progressivement la manière dont les chercheurs évaluent la pertinence scientifique. Pour chaque candidat, Claude pouvait analyser la littérature disponible, comparer les séquences avec des systèmes déjà connus, examiner les régions génomiques voisines et proposer une hypothèse de fonction. La plupart des candidats étaient ensuite éliminés ; seuls ceux considérés comme suffisamment intéressants étaient proposés pour une validation expérimentale, humaine cette fois-ci.
C’est au cours de cette exploration que l’IA a identifié une famille inhabituelle de transcriptases inverses. En examinant l’ADN situé à proximité, elle a repéré une longue série de séquences répétées régulièrement espacées. Cette organisation évoquait celle des réseaux de répétitions associés aux systèmes CRISPR qui a été reperé par l'une des IA par son côté atypique et récurrent.
Les analyses ont conduit à retenir un système composé de trois éléments : une transcriptase inverse, un gène partenaire et une série de séquences d’ADN répétées, constituées d’unités d’environ 200 nucléotides. Les premières expériences réalisées en laboratoire indiquent que ces répétitions sont fortement exprimées et apparaissent sous forme d’unités distinctes au cours de l’infection de Staphylococcus par des phages. Elles semblent notamment donner naissance à un répertoire de petits ARN distincts. C’est précisément cette organisation qui attire l’attention. Les systèmes CRISPR-Cas reposent eux aussi sur des séquences répétées et des ARN guides permettant de cibler des séquences génétiques spécifiques.
Mais la ressemblance structurelle ne permet pas de conclure à une fonction comparable. Anthropic reconnaît elle-même que la fonction d’ART reste inconnue. Le système constitue pour l’instant avant tout une organisation biologique inhabituelle dont les propriétés moléculaires et la fonction doivent encore être caractérisées expérimentalement.
L’intérêt de l’expérience dépasse ainsi probablement le seul système ART. Elle montre comment un modèle d’IA peut être utilisé pour effectuer une étape particulièrement chronophage de la recherche biologique : le « genome mining », qui consiste à parcourir d’immenses bases de données de séquences à la recherche de protéines ou de systèmes encore mal caractérisés. On ne trouve plus ce qu'on cherche mais on essaie de comprendre à quoi correspond ce qu'on a trouvé.
JIM.fr 25/09/26 (Publication en Préprint)
