Reconstituer qui a transmis quoi grâce aux génomes

La capacité à séquencer rapidement des agents infectieux transforme la pratique épidémiologique. À partir d’ADN ou d’ARN viraux isolés chez des malades, on construit des arbres phylogénétiques censés rendre visibles les liens entre cas. Mais peut-on, de façon fiable, remonter la chaîne: qui a infecté qui ? La question n’est pas seulement technique; elle est au cœur d’une controverse ouverte entre ceux qui plaident pour une utilisation extensive des génomes comme preuve et ceux qui avertissent contre des inférences trop précises.

Pourquoi l’approche semble séduisante

Plusieurs arguments expliquent l’enthousiasme autour de la génomique pour reconstituer les transmissions. D’abord, la séquence porte une trace héritée: à chaque réplication, des mutations peuvent apparaître et laisser des différences observables entre souches. Quand deux échantillons sont quasi identiques, il est tentant de les lier épidémiologiquement; quand ils sont éloignés dans l’arbre, on peut suspecter des chaînes indépendantes.

Ensuite, la génomique fournit un signal indépendant des déclarations de cas et des souvenirs humains, souvent incomplets. Dans des contextes où le traçage de contacts est défaillant, les génomes peuvent révéler des transmissions cachées ou des introductions multiples d’un même agent dans une population.

Enfin, des méthodes statistiques formalisées existent pour combiner séquences, dates d’échantillonnage et métadonnées, et produire des « arbres de transmission » probables. Pour les équipes de réponse, ces outils offrent une carte potentielle des voies de propagation à une résolution spatiale et temporelle difficile à atteindre autrement.

Limites biologiques et techniques

L’optique se complique quand on considère la biologie fondamentale des agents infectieux et les étapes du laboratoire. La plupart des virus et bactéries mutent à des rythmes modestes: entre deux infections successives la différence génétique peut être nulle ou minime. Cela signifie qu’une identité ou quasi-identité de séquences n’établit pas une preuve formelle de transmission directe.

À l’inverse, la diversité intra-hôte — la présence, chez un même individu, d’une population de variants — peut brouiller les signaux. Le choix de rapporter une séquence consensus masque les variants minoritaires susceptibles d’être transmise. Recombinaisons, homoplasies (mêmes mutations apparues indépendamment) ou erreurs de séquençage introduisent encore des ambiguïtés.

Sur le plan technique, les pipelines analytiques ne sont pas neutres: filtrage des positions variables, choix des sites phylogénétiques, traitement des régions à forte variabilité, tout cela influence l’arbre final. Des écarts entre laboratoires dans les protocoles de séquençage et d’assemblage peuvent produire des différences qui ressemblent à de la variation biologique alors qu’elles sont artefactuelles.

Biais d’échantillonnage et interprétations erronées

L’un des points centraux de la controverse tient au fait que nous n’observons qu’un fragment de la réalité. Les échantillons séquencés représentent souvent une fraction des cas réels, et cette fraction est rarement aléatoire. Les laboratoires peuvent privilégier les cas sévères, ceux des institutions particulières, ou les premiers cas d’une zone. Ces lacunes créent des arbres incomplets où des chaînes entières manquent, et où des liens apparents sont en réalité médiés par des cas non échantillonnés.

De là naissent des interprétations trop hâtives: attribuer une infection à une personne identifiée sur la foi d’une proximité génétique sans tenir compte de l’existence possible d’intermédiaires non observés est une erreur fréquente. Le risque n’est pas seulement scientifique; il est social et juridique. Des conclusions de traçage peuvent être utilisées dans des contextes d’enquête ou de stigmatisation, alors que l’incertitude n’a pas été correctement communiquée.

Les partisans d’une utilisation large reconnaissent ces biais mais estiment qu’ils peuvent être quantifiés et partiellement corrigés par des modèles intégrant l’incertitude. Les critiques répondent que la correction dépend de suppositions elles-mêmes souvent non vérifiables: taux de détection, homogénéité de l’échantillonnage, et absence de transmission environnementale ou asymptomatique systématique.

Comment avancer sans illusion

La controverse ne se réduira pas à un vain affrontement entre optimistes et sceptiques; elle appelle des règles de bonne pratique et une culture scientifique prudente. Plusieurs pistes semblent consensuelles entre spécialistes sérieux:

  • Ne pas traiter un arbre phylogénétique comme un enregistrement direct des transmissions: il s’agit d’une reconstruction probabiliste, à interpréter conjointement avec les données épidémiologiques classiques.

  • Quantifier et communiquer l’incertitude. Les inférences devraient être accompagnées d’intervalles de crédibilité et de scénarios alternatifs, et non présentées comme des certitudes judiciaires.

  • Améliorer la résolution par des approches complémentaires: séquençage profond pour capturer la diversité intra-hôte, meilleure couverture d’échantillonnage, et métadonnées complètes (dates, lieux, contacts) pour nourrir les modèles.

  • Mettre en place des normes méthodologiques et des validations inter-laboratoires pour réduire les artefacts techniques et rendre les analyses comparables.

  • Réfléchir aux implications éthiques et légales: qui peut accéder aux données, comment protéger l’anonymat, et comment éviter que des inférences incertaines ne soient utilisées pour blâmer des individus.

La génomique épidémique a renouvelé profondément la boîte à outils des épidémiologistes. Mais son pouvoir explicatif a des limites ancrées dans la biologie et dans la pratique des données. Reconnaître ces limites, quantifier les incertitudes et articuler clairement ce que l’on sait et ce que l’on suppose, voilà le travail nécessaire pour que les arbres génomiques éclairent utilement les chaînes de transmission sans s’ériger en verdicts définitifs.

← tous les articles