L'apprentissage automatique est un outil utile pour l'analyse de la blockchain, s'il est utilisé de manière responsable. Les outils automatisés sont capables de parcourir rapidement d'énormes ensembles de données directement issues de la blockchain et de trouver des schémas qu'un analyste pourrait manquer, à supposer même qu'il parvienne à examiner manuellement un tel volume d'informations. Utilisé judicieusement, l'apprentissage automatique joue un rôle auxiliaire important dans le travail sur les données de la blockchain.
Cependant, chaque fournisseur de telles solutions analytiques se heurte à une question de principe: où se situe la limite de l'usage admissible de l'apprentissage automatique? Si les résultats du ML sont automatiquement pris pour une vérité établie, cela peut réduire la valeur de toute l'analyse de la blockchain. Par exemple, un modèle prédictif peut supposer à tort que plusieurs adresses de cryptomonnaies appartiennent à une même organisation et, ainsi, injecter des données erronées dans le système.
Néanmoins, l'apprentissage automatique possède un sérieux potentiel pour aider à la collecte et à l'analyse d'informations. Si les résultats obtenus au moyen du ML sont clairement signalés comme des estimations probabilistes nécessitant une vérification supplémentaire, ils peuvent servir à orienter l'analyse sans en fausser les résultats.
Où l'apprentissage automatique est appliqué dans le travail analytique
L'apprentissage automatique n'est pas utilisé pour déterminer les segments de portefeuilles de cryptomonnaies. Toutefois, il peut être appliqué de manière sélective dans d'autres axes importants et significatifs du travail analytique.
Comme l'explique une étude consacrée à l'ontologie de l'analyse de la blockchain, le concept que l'on appelle habituellement «cluster» comprend en réalité trois affirmations analytiques distinctes. La première est structurelle: quelles adresses sont contrôlées par une même clé. La deuxième est attributive: à quelle organisation ou personne précise appartient une adresse donnée. La troisième est opérationnelle: quelles relations existent entre cette organisation ou personne et une adresse concrète.
Les segments de portefeuilles relèvent de la catégorie structurelle. Ce sont des affirmations analytiques de premier niveau qui doivent être déterministes, reproductibles et vérifiables, et disposer en outre d'un modèle d'erreurs possibles compréhensible à l'avance. C'est ce que l'on peut appeler la norme de fiabilité structurelle.
Les modèles prédictifs ne doivent pas être utilisés pour déterminer les segments de portefeuilles, car l'apprentissage automatique n'est pas en mesure de satisfaire à cette norme de fiabilité structurelle. Et la question ici n'est pas la précision de ces modèles. Même un modèle prédictif parfaitement précis ne satisferait toujours pas à cette norme. Sa logique de prise de décision se forme à partir des données, elle n'est pas déduite de règles concrètes qui peuvent être vérifiées et reproduites. Si les données d'entraînement changent, les règles selon lesquelles le modèle fonctionne peuvent changer aussi, ce qui signifie que ses conclusions peuvent changer également.
À la place, l'apprentissage automatique peut être utilisé comme l'un des nombreux outils pour former des conclusions analytiques de deuxième niveau. Parmi elles: la recherche d'objets potentiellement significatifs pour une enquête ultérieure, la classification de catégories fondée sur des preuves, la détection d'anomalies et la reconnaissance de schémas. De tels signaux peuvent être utiles pour orienter une enquête et déterminer quelles données nécessitent une vérification supplémentaire.
L'intelligence artificielle et l'apprentissage automatique peuvent aussi être utilisés pour renforcer les outils de détection et de répression des schémas frauduleux. De tels systèmes sont capables d'apprendre en continu à partir de données provenant d'internet, de conversations dans les chats et de l'activité sur la blockchain afin de détecter des schémas de fraude nouveaux et en évolution.
Pourquoi cela importe devant un tribunal: la norme Daubert
Dans une affaire pénale américaine, la défense a contesté une méthodologie d'analyse de la blockchain, en faisant valoir qu'elle était insuffisante et comportait des défauts substantiels. Le tribunal a cependant conclu que l'approche utilisée pour former des groupes d'adresses liées était bien fondée. La possibilité pour le tribunal d'examiner la méthodologie de construction de ces groupes et de s'assurer que la logique de l'analyse était suffisamment transparente pour une vérification indépendante a joué un rôle important dans cette conclusion.
Ainsi, la décision de justice a confirmé une méthodologie précise, fondée sur des règles déterministes et reproductibles assorties de mécanismes documentés de protection contre les erreurs. Elle ne signifiait pas que l'analyse de la blockchain, en tant que catégorie entière de méthodes, est automatiquement considérée comme fiable.
Une approche reposant en grande partie sur l'apprentissage automatique peut se heurter à de sérieuses difficultés lors de la vérification au regard de la norme Daubert. Si le fournisseur d'un système analytique n'est pas en mesure d'expliquer comment un groupe d'adresses a été formé, quelles preuves étayent l'étiquette qui lui a été attribuée ou pourquoi le modèle est parvenu à une conclusion précise, une telle méthodologie peut ne pas résister à l'examen lors d'une audience au titre de la Règle 702 des Règles fédérales de la preuve des États-Unis. Les conséquences peuvent en être graves pour les enquêtes, les poursuites pénales et les programmes de conformité des entreprises.
Conséquences pratiques
Des segments de portefeuilles formés de manière erronée peuvent influer sur des décisions dont dépendent des personnes réelles et de véritables enquêtes.
Pour les forces de l'ordre, un segment erroné peut engager une enquête sur une fausse piste. Par exemple, les enquêteurs peuvent passer des mois sur un suspect en se fondant sur un lien entre portefeuilles qui n'existe pas réellement, ou adresser des demandes judiciaires aux mauvaises plateformes d'échange de cryptomonnaies. Dans certains cas, des perquisitions erronées peuvent même être menées sur la base de preuves insuffisantes. Dans des enquêtes complexes couvrant plusieurs juridictions, un seul signal initial erroné peut suffire à ralentir sérieusement une enquête ou à la conduire dans une impasse.
Pour les spécialistes de la conformité, les conséquences peuvent être tout aussi graves. Une fausse correspondance reliant le portefeuille d'un client à une organisation ou une personne sous sanctions peut entraîner la fermeture du compte, le gel des fonds et l'envoi aux régulateurs d'une déclaration d'activité suspecte. En conséquence, un client peut perdre l'accès aux services financiers à cause d'un lien qui, en réalité, n'a jamais existé.
Pour les procureurs, un segment de portefeuilles qui ne résiste pas à un examen minutieux peut détruire toute l'affaire. Les avocats de la défense examineront la méthodologie sur la base de laquelle chaque lien allégué entre des adresses de cryptomonnaies a été établi.
Les affaires construites sur des résultats inexpliqués de l'apprentissage automatique peuvent être classées ou créer un précédent judiciaire qui, par la suite, jette le doute sur d'autres affaires pénales fondées sur des preuves de la blockchain.
