Exercise & FitnessArtículo de investigaciónAcceso abierto

No todos los contadores de pasos son iguales: cuál algoritmo de wearable funciona realmente

Un riguroso estudio de validación en condiciones reales revela importantes brechas de precisión entre seis populares algoritmos de conteo de pasos, con un algoritmo de muñeca que iguala a los dispositivos de referencia en el muslo.

martes, 21 de julio de 2026 6 visualizaciones
Publicado en Med Sci Sports Exerc
A person's wrist wearing a fitness tracker alongside a thigh-worn white sensor patch, walking on a sidewalk in daylight, with a GoPro camera visible in background being held by a researcher

Resumen

Investigadores del NCI y Cal Poly filmaron a 20 adultos durante 35 sesiones de observación en entornos reales y compararon seis algoritmos de conteo de pasos basados en dispositivos con una referencia de verdad obtenida mediante análisis de vídeo. El activPAL, colocado en el muslo, y el ActiGraph, en la muñeca, ejecutando el algoritmo de código abierto 'stepcount', fueron los más precisos; ambos estadísticamente equivalentes a la observación directa con un umbral de error del 15%. Otros algoritmos para muñeca mostraron resultados que iban de mediocres a desastrosamente imprecisos: el algoritmo SDT registró un error porcentual absoluto medio del 231%, lo que lo hace prácticamente inútil. La precisión fue mayor durante la caminata recta o la carrera, pero cayó drásticamente en actividades como montar en bicicleta, empujar un cochecito de bebé o preparar alimentos. Estos hallazgos son relevantes porque el conteo de pasos aparece cada vez con mayor frecuencia en investigaciones sobre longevidad y en guías de salud pública, y elegir el algoritmo equivocado podría distorsionar fundamentalmente las asociaciones de salud identificadas.

Resumen detallado

Los recuentos diarios de pasos se han convertido en uno de los indicadores más utilizados de actividad física en la investigación epidemiológica y el seguimiento de salud para el consumidor, con múltiples estudios de cohortes de gran tamaño que vinculan un mayor número de pasos con un menor riesgo de enfermedades cardiovasculares, trastornos metabólicos, cáncer y mortalidad por todas las causas. Sin embargo, la precisión de los algoritmos que convierten las señales brutas de los acelerómetros de muñeca en recuentos de pasos rara vez se ha evaluado de forma rigurosa frente a un verdadero estándar de referencia en condiciones naturalistas de vida libre. Este estudio aborda directamente esa brecha.

El equipo de investigación reclutó a 20 adultos (edad media 36,1 ± 14,7 años; 50% mujeres) en San Luis Obispo, CA, entre julio de 2019 y marzo de 2020. Cada participante llevó simultáneamente un activPAL3 en el muslo y un ActiGraph GT3X+ en la muñeca durante siete días. Un subgrupo completó dos sesiones separadas de tres horas en las que fueron filmados de forma continua con una cámara GoPro Hero 5. Cinco codificadores entrenados anotaron las grabaciones en cuanto a postura, tipo de actividad, intensidad y recuentos de pasos, con una fiabilidad entre evaluadores que superó un ICC de 0,9 en todas las categorías. Esto generó 35 sesiones de observación emparejadas en 20 participantes.

Se evaluaron seis métodos de recuento de pasos: el algoritmo propietario VANE/CREA del activPAL, más cinco métodos aplicados a los datos del ActiGraph: el propietario ActiLife y cuatro algoritmos de código abierto (Oak, SDT, Verisense y stepcount). Entre todos los métodos basados en la muñeca, el algoritmo «stepcount» de OxWearables —un modelo híbrido de aprendizaje automático más detección de picos, entrenado con datos anotados de vida libre— obtuvo resultados notablemente mejores que sus competidores. Su error porcentual absoluto medio (MAPE) fue de apenas un 17,1% en comparación con la observación directa, frente al 40,5% de ActiLife, el 41,7% de Verisense, el 62,4% de Oak y un sorprendente 231,5% de SDT. Tanto el activPAL como stepcount fueron estadísticamente equivalentes a la observación directa con el umbral de equivalencia del 15% (prueba de dos lados unilaterales, p < 0,05), mientras que ningún otro algoritmo de muñeca alcanzó siquiera ese nivel del 15%.

La varianza explicada (R² marginal) osciló entre 0,64 (SDT) y 0,90 (Oak) a nivel de sesión, aunque un R² elevado no indica necesariamente un sesgo bajo, una distinción metodológica fundamental. A lo largo del período completo de uso de siete días, el activPAL y stepcount produjeron estimaciones altamente concordantes (R² = 0,87, MAPE = 12,8%), lo que sugiere que ambos enfoques son intercambiables para la investigación del recuento de pasos a nivel poblacional y podrían permitir la agrupación de datos procedentes de estudios que utilizaron distintas ubicaciones del dispositivo.

La estratificación por tipo de actividad reveló un patrón consistente: todos los algoritmos funcionaron mejor durante la caminata o la carrera sostenidas (el caso de uso previsto), pero la precisión se deterioró de forma sustancial —y variable— durante el ciclismo, la caminata modificada (por ejemplo, cargando objetos o subiendo escaleras) y movimientos mixtos como empujar un cochecito de bebé, preparar alimentos o trabajar con el ordenador. El algoritmo VANE del activPAL clasificó erróneamente el ciclismo como pasos a nivel de época de manera notable, aunque el software de resumen diario corrigió este error. El sobrerrecuento catastrófico de SDT parece estar impulsado por falsos positivos durante movimientos de extremidades superiores no locomotores, una vulnerabilidad conocida de los algoritmos de muñeca basados en umbrales.

Para la comunidad investigadora en longevidad, las implicaciones son significativas. Los estudios que han utilizado SDT, Oak o ActiLife para cuantificar los pasos diarios pueden haber medido de forma sustancialmente incorrecta la exposición, lo que podría atenuar o distorsionar las relaciones dosis-respuesta entre los pasos y los resultados de salud. Los investigadores que diseñen nuevos estudios con dispositivos portátiles o que reanalicen conjuntos de datos existentes deberían considerar seriamente el algoritmo stepcount o, cuando la ubicación del dispositivo lo permita, el activPAL como método preferido de recuento de pasos.

Hallazgos clave

  • The 'stepcount' wrist algorithm had the lowest error among all wrist methods: MAPE of 17.1% vs direct observation, compared to 40.5% (ActiLife), 41.7% (Verisense), 62.4% (Oak), and 231.5% (SDT)
  • Both activPAL (thigh) and stepcount (wrist) were statistically equivalent to direct observation at the 15% equivalence threshold (two one-sided tests, p < 0.05); no other wrist algorithm met even this threshold
  • Over 7 days of free-living wear, activPAL and stepcount agreed closely with each other: R² = 0.87, MAPE = 12.8%
  • Session-level R² ranged from 0.64 (SDT) to 0.90 (Oak), but high R² did not indicate low bias — Oak had 62.4% MAPE despite the highest R²
  • Accuracy was highest during walking/running for all algorithms and lowest during biking, modified walking (stair climbing, load-carrying), and mixed movements like stroller-pushing or food prep
  • The activPAL's epoch-level data misclassified cycling pedaling as steps (due to VANE algorithm behavior), though the daily summary CREA algorithm corrected this exclusion
  • 20 adults completed 35 valid 3-hour video-recorded sessions; inter-rater reliability for step counting exceeded ICC 0.9 in 20% of dual-coded videos

Metodología

Veinte adultos (50% mujeres, edad media 36,1 ± 14,7 años) llevaron simultáneamente un activPAL3 en el muslo y un ActiGraph GT3X+ en la muñeca durante siete días; un subconjunto completó dos sesiones de vida libre de 3 horas grabadas con GoPro, lo que generó 35 períodos de observación. Cinco codificadores entrenados anotaron el material de vídeo en cuanto a postura, tipo de actividad y recuentos de pasos (ICC > 0,9), sirviendo como criterio de referencia estándar. Seis algoritmos (activPAL VANE/CREA, ActiLife, Oak, SDT, Verisense, stepcount) fueron evaluados mediante modelos lineales de efectos mixtos, MAPE, RMSE y pruebas de equivalencia de dos unilaterales con umbrales del 10% y el 15%, junto con gráficos de Bland-Altman para la evaluación visual del sesgo.

Limitaciones del estudio

La muestra fue pequeña (n=20) y relativamente joven (edad media de 36 años), reclutada en una única área geográfica, lo que limita la generalización de los resultados a adultos mayores o personas con alteraciones de la marcha. Las sesiones de observación directa tuvieron una duración de solo tres horas cada una y se programaron en parte según la preferencia de los participantes, lo que puede no reflejar plenamente la diversidad de las actividades cotidianas. El estudio no incluyó dispositivos vestibles de consumo (p. ej., Apple Watch, Fitbit) ni colocaciones en el tobillo o la cadera, y los autores, afiliados al NCI y a Cal Poly, no declaran ningún conflicto de intereses.

¿Te ha gustado este resumen?

Recibe la última investigación sobre longevidad en tu bandeja de entrada cada semana.

Introduce tu correo electrónico para suscribirte: