Analyse comportementale des utilisateurs DeFi par clustering

Segmentation comportementale de 6,9 millions d'adresses Ethereum à partir de 22,7 millions de transactions on-chain couvrant 11 protocoles DeFi (Uniswap, Aave, Curve, Maker...). Quatre profils d'utilisateurs identifiés par K-means optimisé, publiés en open source avec dataset, modèles, démo en ligne et une étude complète de 56 pages.

  • Blockchain
  • DeFi
  • Data Engineering
  • Machine Learning
  • Clustering
  • Docker
  • LLM
  • CI/CD
  • Data Visualization
  • Generative AI

Par Marius Ayrault · 22/03/2025 · 3 min lire

mriusero/defi-user-behavior-clusteringDiscover how users interact with DeFi platforms through open-source data analytics. By aggregating user behavior and transaction patterns, we reveal insightful trends and provide actionable recommendations.Python20

Projet open source de bout en bout : dataset, modèles et démo en ligne publiés sur Hugging Face, avec une étude complète de 56 pages téléchargeable.

Le sujet

Comprendre comment les utilisateurs interagissent réellement avec la finance décentralisée : qui sont les profils types, comment se répartissent les usages entre échanges, prêt et stablecoins, et quelles dynamiques émergent sur deux ans d’activité du réseau Ethereum. L’étude teste quatre hypothèses (incitations économiques, substitution à la finance traditionnelle, complexité perçue, effets de réseau) contre les données on-chain.

Les données

  • 11 protocoles couvrant les grandes familles DeFi : DEX (Uniswap, Curve, Balancer), prêt (Aave, Maker), stablecoins (Tether, USDC, Dai), yield farming (Yearn, Harvest) et NFT (NFTfi).
  • 22 682 739 transactions uniques et 6 876 845 adresses collectées sur la blockchain Ethereum, de janvier 2023 à décembre 2024, enrichies de 177 955 heures de données de marché.
  • Stockage en Parquet et Arrow, dataset publié et documenté sur Hugging Face.

La méthode

  • Feature engineering : 62 variables par adresse (volumes, fréquences, diversité des protocoles, exposition, comportement temporel), agrégées depuis les transactions et les données de marché puis standardisées.
  • Réduction de dimension : PCA ramenant 62 variables à 28 composantes en conservant la quasi-totalité de la variance.
  • Clustering : K-means retenu après confrontation avec HDBSCAN, nombre de clusters choisi par méthode du coude et hyperparamètres optimisés via Optuna sur une fonction objectif multi-métriques.
  • Validation : silhouette de 0,76 et Davies-Bouldin de 0,36 sur le modèle final, avec analyses de sensibilité sur la standardisation et les valeurs extrêmes.

Les résultats

La segmentation fait émerger quatre profils comportementaux nets parmi les 6,9 millions d’adresses :

  • Petits porteurs (29 %) : volumes et fréquences faibles, activité limitée, exposition minimale au marché.
  • Investisseurs actifs (41 %) : le cœur de l’écosystème, activité soutenue et interactions diversifiées entre échanges et prêts, exposition modérée.
  • Whales (2,3 %) : volumes et fréquences élevés, 88,7 % d’interactions sur les protocoles de prêt, valeurs transférées les plus importantes et gestion du risque la plus stricte.
  • Explorateurs (28 %) : activité modérée mais grande diversité d’interactions et d’actifs, influence limitée sur le marché.

Synthèse des quatre profils d’utilisateurs DeFi, petits porteurs, investisseurs actifs, whales et explorateurs, avec leur part d’adresses et leur signature comportementale

Au-delà des profils, l’étude quantifie des dynamiques structurantes : les stablecoins sont la porte d’entrée de la DeFi (91 % des usages, loin devant les DEX à 7 %), l’adoption décroît avec le niveau d’abstraction des protocoles, et les effets de réseau se mesurent des deux côtés (5 % d’utilisateurs supplémentaires entraînent environ 1,85 % de frais de transaction en plus).

Le reporting génératif

Pour toute adresse Ethereum du périmètre, l’application génère un rapport de performance individualisé : 19 métriques comportementales (ROI, efficacité des frais, timing, exposition au risque…) normalisées puis classées en rang global et en rang intra-cluster, visualisées en radars comparatifs. Un LLM (Llama 3.3 70B servi par Groq) transforme ces rangs en analyse rédigée des forces, faiblesses et recommandations, via un prompt structuré qui contraint le format et ancre la génération dans les métriques calculées.

La démo en ligne

L’ensemble de l’analyse est explorable dans l’application publiée sur Hugging Face, de la collecte des données au rapport de performance par adresse.

L’étude complète

La démarche est documentée dans une étude de recherche de 56 pages : revue de littérature, hypothèses, protocole de validation, limites méthodologiques et implications pratiques pour les acteurs de la DeFi.

Télécharger l'étude (PDF, 56 pages)