Tous les compteurs de pas ne se valent pas — voici quel algorithme de wearable fonctionne vraiment
Une étude de validation rigoureuse en conditions de vie réelle révèle des écarts d'exactitude dramatiques entre six algorithmes populaires de comptage de pas, l'un d'eux, porté au poignet, égalant les dispositifs de référence portés à la cuisse.
Résumé
Des chercheurs du NCI et de Cal Poly ont filmé 20 adultes au cours de 35 séances d'observation en conditions réelles, puis ont comparé six algorithmes de comptage de pas basés sur des capteurs à une vérité terrain établie par codage vidéo. L'activPAL porté à la cuisse et l'ActiGraph porté au poignet utilisant l'algorithme open source « stepcount » se sont révélés les plus précis, tous deux statistiquement équivalents à l'observation directe avec un seuil d'erreur de 15 %. Les autres algorithmes pour le poignet affichaient des performances allant de médiocres à désastreuses — l'algorithme SDT présentait une erreur absolue moyenne en pourcentage de 231 %, le rendant quasiment inutilisable. La précision était optimale lors de la marche ou de la course en ligne droite, mais chutait nettement pour des activités telles que le vélo, la poussée d'une poussette ou la préparation des repas. Ces résultats sont importants car le nombre de pas figure de plus en plus dans les recherches sur la longévité et les recommandations de santé publique, et le choix d'un mauvais algorithme pourrait fausser fondamentalement les associations établies avec la santé.
Résumé détaillé
Le nombre de pas quotidiens est devenu l'un des indicateurs les plus utilisés de l'activité physique dans la recherche épidémiologique et le suivi de santé grand public, de nombreuses grandes études de cohorte ayant établi un lien entre un nombre de pas élevé et une réduction du risque de maladies cardiovasculaires, de troubles métaboliques, de cancer et de mortalité toutes causes confondues. Pourtant, la précision des algorithmes qui convertissent les signaux bruts d'un accéléromètre au poignet en nombre de pas a rarement été rigoureusement testée par rapport à un véritable étalon-or dans des conditions naturalistes de vie quotidienne. Cette étude comble directement cette lacune.
L'équipe de recherche a recruté 20 adultes (âge moyen 36,1 ± 14,7 ans ; 50 % de femmes) à San Luis Obispo, CA, entre juillet 2019 et mars 2020. Chaque participant portait simultanément un activPAL3 fixé à la cuisse et un ActiGraph GT3X+ au poignet pendant sept jours. Un sous-groupe a effectué deux séances distinctes de trois heures au cours desquelles il a été filmé en continu avec une caméra GoPro Hero 5. Cinq annotateurs formés ont analysé les images pour en extraire la posture, le type d'activité, l'intensité et le nombre de pas — avec une fiabilité inter-évaluateurs supérieure à un ICC de 0,9 dans toutes les catégories. Cela a permis d'obtenir 35 séances d'observation appariées auprès des 20 participants.
Six méthodes de comptage de pas ont été évaluées : l'algorithme propriétaire VANE/CREA de l'activPAL, ainsi que cinq méthodes appliquées aux données de l'ActiGraph — le logiciel propriétaire ActiLife et quatre algorithmes open source (Oak, SDT, Verisense et stepcount). Parmi toutes les méthodes basées sur le poignet, l'algorithme « stepcount » d'OxWearables — un modèle hybride combinant apprentissage automatique et détection de pics, entraîné sur des données annotées de vie quotidienne — a obtenu des performances nettement supérieures à celles de ses concurrents. Son erreur absolue en pourcentage moyenne (MAPE) n'était que de 17,1 % par rapport à l'observation directe, contre 40,5 % pour ActiLife, 41,7 % pour Verisense, 62,4 % pour Oak et un score alarmant de 231,5 % pour SDT. L'activPAL et stepcount se sont tous deux révélés statistiquement équivalents à l'observation directe au seuil d'équivalence de 15 % (test unilatéral double, p < 0,05), tandis qu'aucun autre algorithme au poignet n'a atteint ce niveau.
La variance expliquée (R² marginal) variait de 0,64 (SDT) à 0,90 (Oak) au niveau des séances, bien qu'un R² élevé n'indique pas nécessairement un faible biais — une distinction méthodologique essentielle. Sur l'ensemble de la période de port de sept jours, l'activPAL et stepcount ont produit des estimations très concordantes (R² = 0,87, MAPE = 12,8 %), ce qui suggère que ces deux approches sont interchangeables pour la recherche sur le nombre de pas à l'échelle des populations et pourraient permettre de regrouper des données issues d'études ayant utilisé des emplacements de capteurs différents.
La stratification par type d'activité a révélé un schéma cohérent : tous les algorithmes ont obtenu leurs meilleures performances lors de la marche ou de la course soutenue (le cas d'usage prévu), mais la précision s'est dégradée de façon notable — et variable — lors du vélo, de la marche modifiée (par exemple, porter des charges, monter des escaliers) et de mouvements mixtes tels que pousser une poussette, préparer des repas ou travailler sur ordinateur. L'algorithme VANE de l'activPAL a notamment classifié à tort le cyclisme comme de la marche à l'échelle des époques, bien que son logiciel de synthèse journalière ait corrigé cette erreur. Le suréchantillonnage catastrophique du SDT semble être dû à des faux positifs lors de mouvements des membres supérieurs sans déplacement, une vulnérabilité connue des algorithmes à seuil basés sur le poignet.
Pour la communauté de recherche sur la longévité, les implications sont significatives. Les études ayant utilisé SDT, Oak ou ActiLife pour quantifier le nombre de pas quotidiens ont peut-être considérablement mal mesuré l'exposition, ce qui pourrait atténuer ou déformer les relations dose-réponse entre le nombre de pas et les résultats de santé. Les chercheurs qui conçoivent de nouvelles études sur les dispositifs portables ou qui réanalysent des jeux de données existants devraient sérieusement envisager d'utiliser l'algorithme stepcount ou, lorsque l'emplacement du dispositif le permet, l'activPAL comme méthode de comptage de pas privilégiée.
Principales conclusions
- The 'stepcount' wrist algorithm had the lowest error among all wrist methods: MAPE of 17.1% vs direct observation, compared to 40.5% (ActiLife), 41.7% (Verisense), 62.4% (Oak), and 231.5% (SDT)
- Both activPAL (thigh) and stepcount (wrist) were statistically equivalent to direct observation at the 15% equivalence threshold (two one-sided tests, p < 0.05); no other wrist algorithm met even this threshold
- Over 7 days of free-living wear, activPAL and stepcount agreed closely with each other: R² = 0.87, MAPE = 12.8%
- Session-level R² ranged from 0.64 (SDT) to 0.90 (Oak), but high R² did not indicate low bias — Oak had 62.4% MAPE despite the highest R²
- Accuracy was highest during walking/running for all algorithms and lowest during biking, modified walking (stair climbing, load-carrying), and mixed movements like stroller-pushing or food prep
- The activPAL's epoch-level data misclassified cycling pedaling as steps (due to VANE algorithm behavior), though the daily summary CREA algorithm corrected this exclusion
- 20 adults completed 35 valid 3-hour video-recorded sessions; inter-rater reliability for step counting exceeded ICC 0.9 in 20% of dual-coded videos
Méthodologie
Vingt adultes (50 % de femmes, âge moyen 36,1 ± 14,7 ans) ont porté simultanément un activPAL3 placé sur la cuisse et un ActiGraph GT3X+ au poignet pendant sept jours ; un sous-groupe a réalisé deux sessions de vie libre de 3 heures enregistrées par GoPro, produisant 35 périodes d'observation. Cinq codeurs entraînés ont annoté les séquences vidéo pour la posture, le type d'activité et le nombre de pas (ICC > 0,9), constituant ainsi le critère de référence. Six algorithmes (activPAL VANE/CREA, ActiLife, Oak, SDT, Verisense, stepcount) ont été évalués à l'aide de modèles linéaires à effets mixtes, du MAPE, du RMSE et de tests d'équivalence bilatéraux aux seuils de 10 % et 15 %, ainsi que de graphiques de Bland-Altman pour l'évaluation visuelle du biais.
Limites de l'étude
L'échantillon était restreint (n=20) et relativement jeune (âge moyen 36 ans), recruté dans une seule zone géographique, ce qui limite la généralisabilité aux adultes plus âgés ou aux personnes présentant des anomalies de la démarche. Les sessions d'observation directe ne duraient que trois heures chacune et étaient planifiées en partie selon les préférences des participants, ce qui peut ne pas refléter pleinement la diversité des activités quotidiennes. L'étude n'incluait pas de dispositifs connectés grand public (par exemple, Apple Watch, Fitbit) ni de placements au niveau de la cheville ou de la hanche, et les auteurs, affiliés au NCI et à Cal Poly, ne déclarent aucun conflit d'intérêts.
Ce résumé vous a plu ?
Recevez les dernières recherches sur la longévité dans votre boîte de réception chaque semaine.
Saisissez votre e-mail pour vous abonner :
