客厅里的那段深蹲视频
先设想一个示意场景:一位用户晚上在客厅,用手机对着自己做深蹲,想看动作有没有问题。画面里有他自己、沙发、电视,有时还有路过的家人。
这段视频有两种去向。第一种,手机直接在本地跑姿态模型,算出关节点和动作评估,视频不出手机;第二种,把整段视频上传到服务器,由云端的大模型分析后再返回结果。两种做法用户看到的报告可能几乎一样,但隐私含义完全不同:后一种意味着一段有人脸、有居家环境的视频,离开了用户的设备。
“要不要全部上传”不该是一个一刀切的问题,我们更愿意先问:这一步一定要在云上做吗?
三档数据:留在本机、经同意上传、需要云端
按能否本地完成、对隐私的敏感程度和用户是否愿意,我们把数据粗分为三档。下面是设计思路,具体产品实现以实际发布为准。
| 档位 | 典型数据 | 默认处理 | 为什么 |
|---|---|---|---|
| 留在本机 | 原始训练视频、逐帧姿态点、传感器原始信号 | 本地分析,分析完可选择即时删除视频 | 体积大、含人脸与居家环境,多数分析手机端即可完成 |
| 经同意后同步 | 训练摘要(时长、负荷、配速区间)、动作评估结论、训练档案 | 加密后同步,用于换设备与长期趋势 | 换手机后记录不丢失,需要跨设备保存 |
| 需要云端 | 大规模模型的更新、复杂的长期个性化推理、需要更大算力的分析 | 仅上传完成任务所需的最小信息,并说明用途 | 端侧算力和电量有限,某些任务确实放不下 |
这张表里的重点是:上传的是“结论和摘要”,而不是“原始素材”。一节训练的负荷、配速区间、动作评估结果,对长期趋势分析已经足够,未必需要把每一帧画面都送上去。
端侧处理:能做什么,做不到什么
端侧处理指的是在手机、手表这类设备上直接运行模型。好处很直接:数据不离开设备,延迟低,没网也能用。
它的限制同样真实。手机的算力、内存和电量有限,运行大型模型会发热、掉帧、耗电,旧手机尤其明显。设备差异带来的性能问题,可以参考旧手机能不能运行动作分析一文。为此常见的取舍包括:
- 用更小、经过压缩的模型,代价是精度可能略降;
- 降低视频分辨率或帧率,代价是细节减少;
- 只在关键片段运行分析,而不是整段连续处理。
我们对这些取舍的态度是:宁可结论保守一点、把握程度标低一点,也不为了追求精度而把原始视频送出去。当端侧结果不够确定,可以让用户自己选择是否允许上传一小段做进一步分析,而不是默认上传。
联邦学习:不是一句“数据不出本地”就完事
联邦学习是让模型在多台设备上各自训练,只把“模型更新”而不是原始数据汇总起来,常被视为保护隐私的一种方向。听起来很理想,但公开研究也提醒了它的边界。
一是更新本身也可能泄露信息。有研究讨论了在可穿戴健康设备的联邦人体活动识别中,攻击者可能从模型更新里推断出用户的私有信息,成员推断等攻击有可能成功,因此联邦学习通常还要配合加密聚合、差分隐私等手段。
二是成本。2026 年发表在 Frontiers in Big Data 上的一项研究讨论了在可穿戴健康设备上做联邦学习时的能耗与准确性取舍:本地训练和传输更新都耗电,对电池有限的小设备并不友好。
所以在贝博体育AI的设计里,联邦学习更像是一个“可以考虑、需要用户同意、并且要评估代价”的选项,而不是默认开启的万能方案。它适合用来改进通用模型,例如动作识别在不同体型、不同光线下的表现,而不是拿来做每个用户的个性化结论,后者依然主要在本地完成。
哪些数据必须上云,哪些不必
把上面的分析落到具体清单,会得到一个比较清楚的答案。
不必上云:
- 原始训练视频与逐帧关节点:本地分析后即可丢弃;
- 传感器的原始高频信号:本地提取特征后只保留摘要;
- 单次训练的即时提醒,比如“心率偏高,建议降速”,本地计算就能完成。
通常需要同步(经用户同意):
- 训练摘要与历史:换手机后记录要能找回,这部分的同步方式可以参考历史数据同步与本地缓存;
- 训练档案:目标、项目、设备、训练频率,用来让建议延续;
- 用户主动提交的反馈或申诉材料。
可能需要云端:
- 需要较大模型才能完成的分析,比如把几周的训练历史综合成一份阶段性总结;
- 模型本身的更新与分发;
- 用户明确选择“让云端进一步分析”的那段视频。
需要强调的是,“需要云端”不等于“必须存原始数据”。很多云端任务,只需要经过脱敏和摘要处理的信息即可。
用户可控项
无论技术怎么设计,最终应该有一些让用户自己做主的开关。我们设想的可控项包括:
- 是否允许摄像头分析,并选择分析后是否保留视频;
- 是否同步训练摘要到云端,随时可关闭;
- 是否参与改进模型(例如联邦学习或匿名化的样本贡献),默认不勾选;
- 位置轨迹的记录精度与保存时长,比如只保留路线摘要,不保留每个坐标点;
- 导出与删除:可以导出自己的训练记录,也可以申请删除云端的数据;
- 各类权限(摄像头、蓝牙、定位)可以分开授予,也可以随时收回,收回后功能会相应降级而不是整体失效。
这些开关是不是足够细、默认值是不是对用户友好,往往比“采用了什么高级技术”更影响实际的隐私体验。
合规怎么看,以及我们不说的话
运动数据里有不少内容通常被认为比较敏感,比如与身体状况相关的心率与健康信息、人脸与身体画面、行踪轨迹等。处理这类信息,需遵守适用的个人信息保护相关规定。至于具体到某个场景是否满足哪条要求,需要结合实际业务和专业意见判断,这里不做法律结论,也不把它写成一句“我们完全合规”。
我们能做的是在设计上遵循几个朴素的原则:只收集完成功能所需的最小数据;对不同用途分别说明;能在本地做的先在本地做;让用户看得见、关得掉、删得了。
一点观察
隐私和体验之间确实存在拉扯:全部上云,分析可以更强、更省手机资源;全部留在本机,最保护隐私,但受设备能力限制。没有哪个方案对所有人都是最优。
贝博体育AI选择的是一个偏保守的中间位置:原始素材默认留在本机,上传摘要经同意,云端只做本地做不了的事,并且让用户在任何时候都能收回。这条路线会牺牲一部分“一步到位”的便利,但它换来的是:用户知道自己的数据去了哪里,也知道怎么让它停下。
数据分工与模型分工是互相配合的,理解目标、分析动作、排出计划的多个模型如何各取所需,可以参考多模型协作的分工与交接。