← El blog de Greg / Ciencia del entrenamiento
Tus sensores son excelentes. Tus puntuaciones no valen nada.
A menudo se acusa a los relojes inteligentes de ser imprecisos. Es falso, y de hecho es al revés: los sensores se han vuelto excelentes. El problema está en otra parte, y resulta más incómodo. Entre la señal que capta tu muñeca y el número con el que decides la sesión de mañana hay cuatro capas de interpretación — y en cada una se evapora un poco más de validez científica.
La paradoja: nunca se midió tanto, nunca se supo tan poco
Strava declara más de 180 millones de usuarios en más de 185 países, 14 000 millones de kudos intercambiados solo en 2025, una ruta creada cada 19 segundos. El entrenamiento de resistencia nunca había generado tantos datos. Y sin embargo, en la misma encuesta, el 46 % de las personas consultadas dice que usaría de buen grado una IA como entrenador.
Traducción: la gente tiene los números y busca a alguien que le diga qué hacer con ellos. No es un problema de cantidad de datos. Es un problema de conclusión.
Para entender por qué, hay que dejar de hablar de «la fiabilidad de los relojes» como si fuera un bloque. Un reloj no produce un número: apila cuatro, uno encima de otro. Y no son ni de lejos igual de sólidos.
Capa 1 — la frecuencia cardíaca: excelente, sin discusión
Un estudio de validación publicado en Sensors comparó la medición óptica en la muñeca con un electrocardiograma de referencia durante el sueño. Resultado para la frecuencia cardíaca: un coeficiente de correlación intraclase de 1,00 (IC 95 %: 0,99–1,00), con un sesgo inferior al 0,4 %.
Es un instrumento de laboratorio en tu muñeca. Cuando tu reloj marca 52 pulsaciones por minuto, son 52. Hay que decirlo, porque lo que viene después es menos halagador y sería deshonesto dar a entender que todo es para tirar.
Capa 2 — la variabilidad cardíaca: buena, pero ya al límite
Mismo estudio, misma noche, mismo sensor — salvo que ya no medimos un ritmo, sino la variación de ese ritmo. El sesgo sube al 2–3,5 %, los límites de concordancia al 6–6,5 %.
Parece poco. No lo es. Los propios autores lo subrayan: ese margen de error se acerca o supera el cambio más pequeño realmente significativo para un deportista. Dicho de otro modo: la variación diaria que tu aplicación interpreta como señal de fatiga puede ser perfectamente el ruido de la propia medición.
Segunda reserva, igual de importante: ese estudio incluye seis participantes y quince noches. Es una validación seria, no una prueba a gran escala. Cuando un fabricante escribe «validado científicamente», a menudo se refiere a este tipo de trabajo.
Capa 3 — las fases del sueño: la mitad del camino, como mucho
Aquí dejamos la medición y entramos en la interpretación. Saber si estás en sueño ligero, profundo o REM no se lee en un pulso: se deduce, mediante un algoritmo.
Un estudio multicéntrico publicado en JMIR mHealth and uHealth hizo la prueba con rigor: 11 dispositivos de seguimiento del sueño de consumo, 3890 horas de sueño registradas, comparadas con 543 horas de polisomnografía — la prueba de referencia en laboratorio. Total: 349 114 épocas analizadas una a una.
El mejor aparato alcanza una puntuación F1 macro de 0,69. El peor: 0,26. Ninguno de los once supera el 0,70.
Para situarlo: en una clasificación de cuatro estados, un F1 de 0,26 no está muy lejos de lo que lograría una moneda ligeramente trucada. Y sobre ese número deciden millones de personas, al despertar, si han «recuperado lo suficiente» para hacer su sesión de umbral.
Capa 3 bis — la VO2max: entre un 13 y un 16 % de error
La misma historia con la estimación del consumo máximo de oxígeno. Una validación del Apple Watch Series 7 publicada en JMIR Biomedical Engineering mide un error porcentual absoluto medio del 15,79 % (RMSE 8,85 ml/kg/min) frente a una prueba de esfuerzo en laboratorio. Un segundo estudio, en PLOS ONE, encuentra un 13,31 % de error medio, con una clara tendencia a subestimar.
No todas las marcas son iguales — un Garmin Forerunner 920XT se midió con un 7,3 % de error en un protocolo comparable. Pero el orden de magnitud se mantiene, y la razón es estructural: estos algoritmos están anclados en medias poblacionales. Subestiman a los muy entrenados y sobrestiman a los sedentarios. Útil para seguir una tendencia a lo largo de un año. Inservible para calibrar una sesión un martes por la tarde.
Capa 4 — las puntuaciones de decisión: donde se rompe de verdad
Última capa: los números que pretenden decirte qué hacer. Ahí ya no es una cuestión de precisión. Es una cuestión de existencia.
La razón entre carga aguda y carga crónica (ACWR) es probablemente la métrica más extendida del deporte conectado: la idea de que la relación entre tu carga de los últimos 7 días y la de los últimos 28 predice tu riesgo de lesión, con una «zona dulce» de la que no conviene salir. En 2020, Impellizzeri y sus colegas publicaron en el International Journal of Sports Physiology and Performance una demolición metódica: acoplamiento matemático entre numerador y denominador, artefactos estadísticos, correlaciones espurias. Su conclusión no deja lugar a dudas: no existe ninguna prueba que respalde el uso del ACWR en un sistema de gestión de la carga, ni para recomendar un entrenamiento destinado a reducir el riesgo de lesión.
Los mismos autores llegaron a pedir al British Journal of Sports Medicine la retractación de la figura fundacional de esa «zona dulce». Sigue presente en decenas de aplicaciones.
El entrenamiento guiado por la variabilidad cardíaca corre una suerte parecida, más matizada pero igual de instructiva. Un metaanálisis publicado en Applied Sciences comparó el entrenamiento guiado por VFC con un plan predefinido clásico. Veredicto: ninguna ventaja significativa en la capacidad aeróbica máxima ni en el rendimiento de resistencia. El único efecto sólido (SMD = 0,50) recae sobre los propios índices vagales. En claro: entrenar según la VFC mejora sobre todo… la VFC.
Por qué existen igualmente estas puntuaciones
No hay ninguna conspiración detrás. Una puntuación compuesta es un producto excelente: cabe en un círculo de color, se compara entre amigos, da un motivo para abrir la aplicación cada mañana. Un intervalo de confianza, no.
El problema no es que un fabricante simplifique. Es que la simplificación se presenta como una conclusión cuando solo es una hipótesis — y llega despojada del contexto que le daría sentido: tu objetivo, tu semana, tu historial de lesiones, lo que tienes previsto el sábado, el hecho de que dormiste en el sofá de tu suegra.
Mientras tanto, el problema de fondo no se ha movido. El metaanálisis de referencia sobre lesiones en la carrera a pie registra 17,8 lesiones por cada 1000 horas de carrera en principiantes, frente a 7,7 en corredores habituales. Diez años y miles de millones de datos después, esa cifra no ha bajado.
Lo que haría falta en su lugar
No más mediciones. Una capa que razone.
- Volver a bajar a la señal. Una buena decisión de entrenamiento se toma con la frecuencia cardíaca, la duración, el ritmo, la carga real y tus sensaciones — no con una puntuación que lo mezcla todo y luego lo aplasta en un porcentaje.
- Una regla vale más que un número. «Llevas tres noches cortas seguidas y mañana tienes una sesión de umbral» es accionable. «Recuperación: 42 %» no lo es.
- Asumir la incertidumbre en voz alta. Un sistema honesto dice cuándo no sabe. Los estudios citados no dicen «estos datos son inútiles»: dicen «este es el margen de error». Ocultar ese margen: ahí está la mentira.
- El contexto antes que la métrica. Tu carrera dentro de once semanas, tu rodilla izquierda, tus tres sesiones semanales: nada de eso está en un sensor, y es justo lo que determina la decisión correcta.
Es exactamente la apuesta que hacemos con Greg: no añadir una puntuación más al panel, sino construir la capa que lee tus datos brutos, conoce tu objetivo y tu historial, y te dice qué implica para tu sesión de mañana — diciéndote también cuándo no lo sabe.
Fuentes
Todos los estudios citados son de acceso público. Si solo abres uno, que sea el segundo: la tabla de los 11 dispositivos habla por sí sola.
- Bellenger CR, Miller DJ, Halson SL, Roach GD, Sargent C. Wrist-Based Photoplethysmography Assessment of Heart Rate and Heart Rate Variability: Validation of WHOOP. Sensors. 2021;21(10):3571. doi.org/10.3390/s21103571
- Lee T, Cho Y, Cha KS, et al. Accuracy of 11 Wearable, Nearable, and Airable Consumer Sleep Trackers: Prospective Multicenter Validation Study. JMIR mHealth and uHealth. 2023;11:e50983. doi.org/10.2196/50983
- Assessing the Accuracy of Smartwatch-Based Estimation of Maximum Oxygen Uptake Using the Apple Watch Series 7: Validation Study. JMIR Biomedical Engineering. 2024;1:e59459. biomedeng.jmir.org
- Investigating the accuracy of Apple Watch VO2 max measurements: A validation study. PLOS ONE. 2025. doi.org/10.1371/journal.pone.0323741
- Impellizzeri FM, Tenan MS, Kempton T, Novak A, Coutts AJ. Acute:Chronic Workload Ratio: Conceptual Issues and Fundamental Pitfalls. International Journal of Sports Physiology and Performance. 2020;15(6):907-913. doi.org/10.1123/ijspp.2019-0864
- Effectiveness of Training Prescription Guided by Heart Rate Variability Versus Predefined Training for Physiological and Aerobic Performance Improvements: A Systematic Review and Meta-Analysis. Applied Sciences. 2020;10(23):8532. doi.org/10.3390/app10238532
- Videbaek S, Bueno AM, Nielsen RO, Rasmussen S. Incidence of Running-Related Injuries Per 1000 h of running in Different Types of Runners: A Systematic Review and Meta-Analysis. Sports Medicine. 2015;45(7):1017-1026. doi.org/10.1007/s40279-015-0333-8
- Strava. 12th Annual Year in Sport Trend Report, 2025. press.strava.com
Preguntas frecuentes
¿Es fiable mi reloj, sí o no?
Para la frecuencia cardíaca, sí: una validación frente a ECG da un coeficiente de correlación intraclase de 1,00. Para las puntuaciones compuestas que deriva de ella (sueño, recuperación, VO2max) es mucho más débil — hasta 0,26 de F1 en las fases del sueño. La medición es buena; la interpretación, mucho menos.
¿Sirve de algo la puntuación de sueño de mi reloj?
Para seguir una tendencia a lo largo de varias semanas, sí. Para decidir si haces tu sesión de umbral esta mañana, no: de 11 dispositivos probados frente a polisomnografía, el mejor alcanza 0,69 de F1 macro y el peor 0,26. La duración total del sueño es bastante más fiable que el reparto por fases.
¿Es correcta la VO2max que muestra mi reloj?
Se equivoca de media entre un 13 y un 16 % en Apple Watch según dos estudios independientes, con tendencia a subestimar a las personas entrenadas. Algunos modelos lo hacen mejor (7,3 % medidos en un Garmin Forerunner 920XT). Sirve para ver progresos en un año, no para calibrar una sesión.
¿Hay que guiar el entrenamiento con la variabilidad cardíaca (VFC)?
Un metaanálisis publicado en Applied Sciences no encuentra ninguna ventaja significativa del entrenamiento guiado por VFC sobre la capacidad aeróbica o el rendimiento, frente a un plan predefinido clásico. La VFC sigue siendo una señal interesante, pero no sustituye a una planificación.
¿Predice lesiones el ACWR (razón entre carga aguda y crónica)?
No. La revisión de referencia de Impellizzeri y sus colegas (2020) concluye que no existe prueba alguna que respalde su uso para reducir el riesgo de lesión: acoplamiento matemático, artefactos estadísticos y correlaciones espurias. Los autores llegaron a pedir la retractación de la figura de la «zona dulce».
«No voy a decirte que dejes de mirar tus números — sería absurdo, son buenos. Te digo que no les pidas lo que no saben. Tu reloj sabe que tu corazón latió a 52. No sabe que tu carrera es dentro de once semanas, que tu rodilla izquierda protestó el martes y que entrenas tres veces por semana, no seis. Eso es cosa mía. Y cuando no lo sé, te lo digo.»
Entender el coaching deportivo con IA →
Sigue leyendo
Preparación física esquí: la matriz y los 53 estudios detrás
23 subdimensiones de esquí, 18 cualidades físicas, 100 variables, 24 salvaguardas. Lo que hay debajo del programa Winter Season — y lo que la investigación no dice.
Leer el artículo →Carrera cancelada: el Plan B que salva tu temporada
Tu carrera se cae. Lo que hagas en los siete días siguientes decide el resto de tu temporada.
Leer el artículo →UpGreg en el Global Tech Summit de Lausana
UpGreg estará en el Global Tech Summit de Lausana el 1 de septiembre. Ven a conocer nuestro entrenador deportivo IA.
Leer el artículo →