准备度分数,其实只是在描述今天
Garmin 的训练准备度(Training Readiness)、WHOOP 的恢复分、COROS 的恢复指标,长得都像“预测”:一个百分数,早上出现,告诉你今天适合练多狠。但翻开公开的说明就会发现,它们回答的是“你现在的状态怎么样”。以 Garmin 为例,公开说明列出的输入包括睡眠评分、HRV 状态、剩余恢复时间、近期训练负荷、睡眠历史和压力历史,各项权重不公开,2025 年 5 月还调整过一次权重。第三方评测也指出,这个分数看不到肌肉酸痛和精神疲劳,并且没有公开发表过与实验室恢复指标对照的独立验证,所以更适合看自己的趋势,而不是当绝对值。
“预测下一次训练”则是另一个问题:给定你过去几个月的全部训练与身体反应,如果周四安排 8 组 400 米,你的心率、配速、主观感受和第二天的恢复大概会是什么样。前者是读体温计,后者更像预报天气。贝博体育观察到,行业里前一件事已经很普遍,后一件事还处在早期。
公开资料里的“预测”,各自走到哪一步
下面这张表只放我们查到、能确认来源类别的内容,没有内部数字。
| 方向 | 公开可见的进展(2025—2026) | 我们的读法 |
|---|---|---|
| 运动员数字孪生 | 体育科学领域已有综述,讨论用传感器数据构建“数字替身”辅助负荷管理与伤病预防;美国夏洛特大学 2025 年初也发布过面向运动员训练的人体数字孪生项目介绍 | 多为框架与愿景,公开介绍里对局限着墨很少 |
| 伤病风险预测 | 急慢性负荷比(ACWR)本身在学界有争议,有人认为方法存在缺陷;2026 年仍有研究把它与时序神经网络结合,在足球运动员数据上做风险预测 | 结论主要来自职业团队球类数据,不能直接搬到业余跑者 |
| 手表恢复与准备度 | Garmin、WHOOP、COROS、Polar 都有各自的评分,COROS 2026 年 6 月的更新还加入了心率恢复 | 描述当下为主,算法细节多不公开 |
| 大模型教练 | WHOOP 2023 年推出基于 OpenAI 的对话教练;Google 2025 年 8 月发布 Fitbit 个人健康教练,10 月起对美国的 Premium 用户开放公开预览 | 擅长解释和对话,长期预测能力缺少公开验证 |
顺带一提,Google 发表过一项个人健康大模型(PH-LLM)研究,输入是最长 30 天的日聚合传感器数据,评估了睡眠与健身建议的质量,也尝试预测用户自评的睡眠质量。论文自己承认存在“编造”和错误引用用户数据的情况,也没有验证对行为改变的真实效果。这正说明:读懂三十天数据,和预测三个月后的你,不是同一件事。
长期运动员模型到底需要什么
我们把它拆成四类输入,缺哪一类,预测的可信度就掉一截。
- 足够长的负荷史:不是最近七天,而是至少覆盖一两个完整的训练周期,包括增量周、减量周和比赛前后。只有一个月历史时,模型只能学到“你最近很规律”。
- 成对的反应数据:同样一次训练,当时的强度、天气、睡眠,加上第二天的心率恢复和主观疲劳。只有输入没有反应,就像只记菜谱不记味道。
- 自我报告:腿沉、心情差、工作太累这类信息,穿戴设备测不到(Garmin 的说明里也承认这一点),需要用户给一句话或一个滑块。
- 背景事件:比赛、出差、换鞋、换设备。它们不是噪声,而是解释曲线突变的原因。
我们的判断是:数据的“厚度”比模型的“深度”更早成为瓶颈。一个个人历史只有六周的用户,用再新的网络也预测不出他的赛前减量反应。
曲线断了怎么办:断训、伤病、生病和换设备
这是长期模型最容易出丑的地方。示意场景:某跑者(模拟数据,非真实用户)过去 12 周每周跑 40 公里左右,随后因为感冒完全停了 9 天,恢复时按“旧水平”被安排了一次 12 公里节奏跑,体验很糟。问题出在把“停了 9 天”当成“没有数据”,而不是“一个有信息的事件”。
我们倾向的处理方式是分开对待:
- 短期断训(一周内):保留原有能力估计,但把近期负荷归零,让模型意识到“体能基本还在,耐受度暂时下降”。
- 生病或受伤:标记为事件,暂时不用这期间的心率去校正个人基线,因为病中静息心率和 HRV 都不再代表平时的你;复训阶段用更保守的起点,并鼓励用户补一句症状。
- 长期断训(数周以上):旧历史仍有参考价值,但权重要明显降低,让新数据尽快接管。
- 换设备:不同手表的光电传感器和算法有差异,同一个人的静息心率可能整体偏移几个点。模型应把设备切换记成分界点,先并行记录一段时间,再决定新旧数据能否拼接。这一点和多传感器融合直接相关,可以参考我们对可穿戴融合的观察。
这里必须承认,伤病的原因常常在数据之外。ACWR 之类的负荷指标在学界都还有争议,谁也不该宣称“模型能预测你会不会受伤”。合理的说法只是“最近的负荷变化比你平时的习惯更陡,建议留意”。
不确定性,要说给用户听
预测最怕的不是错,而是错得很自信。“明天你的 5 公里配速是 5:12”给人的是一个承诺;“明天大概率在 5:05 到 5:25 之间,天气偏热的话往慢的一端靠”给人的是一个范围加一个原因。
我们认为一个预测至少要带三样东西:区间而不是单点;依据,比如“依据最近 6 次同类训练”;以及置信度,历史太短或刚换设备时明确写出“这次预测把握较低”。当把握低到一定程度,宁可退回“先按保守强度试一次,之后我再校准”。
这与贝博体育对自适应训练的思路是一致的:计划要随状态改变,但每次改变都要讲得出理由。用户看到“为什么”,才有机会纠正模型,比如告诉它“那天其实是因为没吃早饭”。
贝博体育观察:现在做不到什么
我们的判断可以概括为三点。
第一,预测式训练是方向,但眼下最有价值的是“更好的描述加诚实的区间”,而不是神奇的准确率。公开资料中,我们没有查到可以让个人跑者信赖的、跨数月并经过独立验证的训练结果预测研究,所以不会在这里引用任何准确率数字。
第二,做不到的事情很具体:预测受伤、预测比赛成绩、预测心理状态;在个人历史不足时给出精确的单点结论;在缺少睡眠和自我报告时判断疲劳原因。
第三,有一件事现在就能做:把断层、换设备、生病记录成事件,让用户看到模型用了哪些历史、忽略了哪些。