每次都从零开始的教练

设想一位跑者(示意场景,非真实用户)在 8 月初对聊天式AI教练说:“我右膝外侧有点疼,最近别安排下坡。”教练给了几条合理建议。三周后他再打开对话窗口,问“这周怎么练”,得到的是一份含下坡冲刺的计划。教练没有错,它只是不记得。

这是一次性聊天教练的常态:模型本身没有跨对话的状态,除非用户每次把背景重新贴一遍。2023 年 WHOOP 推出基于 OpenAI 的对话教练时,卖点是能结合会员的目标和生物数据回答问题;2025 年 8 月 Google 预览的 Fitbit 个人健康教练,官方介绍里则提到会记住用户偏好,并允许用户对上一次训练给出反馈,再把它带进后续训练。可见“带一点记忆的教练”已经是产品方向,但公开介绍里,记忆具体存什么、存多久、用户能改什么,说得都很有限。

训练Agent和聊天教练,差在哪

我们把差别归结为四个动作,而不是“更聪明”:

  • 记得住:目标、限制和偏好跨对话保留,不需要用户每次重述。
  • 能行动:不只是回答,还会根据数据主动调整下周计划、提醒缺失的记录。
  • 会核对:用新数据检验旧记忆,比如“你上月说膝盖疼,最近三次下坡训练没有你的反馈,现在还需要避开吗?”
  • 可追溯:给出建议时说明用了哪条记忆,这与贝博体育对可解释AI教练的思考一脉相承。

其中“会核对”最容易被忽略。记忆不是仓库,更像一本要定期校对的笔记。

该记什么:四类信息

  1. 目标与时间线:三个月后想跑半程马拉松、最近想减脂、赛事日期。这决定训练的方向,也最稳定。
  2. 伤病与身体限制:旧伤、术后恢复、被医生要求避免的动作。这类信息价值最高,也最需要标注来源和时间。
  3. 偏好与现实约束:早上练还是晚上练、每周能练几天、家里只有哑铃、讨厌跑台。
  4. 对训练的真实反馈:这次“很轻松”还是“撑不下来”,哪些课表做完后腿很沉。它是运动数据之外最重要的信号,穿戴设备测不出肌肉酸痛和心情,只有用户能告诉模型。

第四类还有个价值:它能帮助校准数据。手表说恢复良好,用户却说“腿很沉”,这个矛盾本身就是训练决策里最值得记住的线索。

什么不该记,或者不该长期记

我们的原则是“记训练需要的,不记无关的”。

  • 与训练无关的隐私细节:家庭、工作单位、健康之外的私人对话。用户随口提起,并不等于同意长期保存。
  • 一时的情绪和状态:“今天心情很差不想练”是当天的信息,不该固化成“这个人容易放弃”这样的标签。
  • 未经确认的推断:模型根据数据猜测“你可能睡眠不好”,在用户确认之前,只能是临时判断,不能写成事实。
  • 原始视频与敏感健康数据:能在本地处理就不上传,更不该因为“方便记忆”而长期留存。这部分可参考运动数据是否上传云端的讨论

怎么忘:过期、衰减和被覆盖

人会忘,是机制而不是缺陷。训练记忆需要三种遗忘:

过期:状态类记忆带有效期。“右膝不舒服”默认几周后回来核对,而不是永久生效。衰减:老的反馈权重逐步降低,让近期数据占主导。覆盖:新信息与旧记忆冲突时,以用户确认的新内容为准,并保留一条修改记录。

学术界也在关注这件事。2026 年 arXiv 上能看到面向个性化健康场景的智能体记忆评测(如 MedMemoryBench),以及专门考察长期记忆里“召回与遗忘”的基准。我们只确认了这些工作的主题,没有引用其中的具体结果;能说的是,“忘掉过时的内容”已经和“记住重要的内容”被当作同等重要的评测目标。

让用户看见,并且改得动

记忆最应该避免的,是“黑箱”。做法上我们倾向这样:

示意界面文字:教练记住了 5 条信息。1. 目标:秋季半程马拉松(来源:你在设置里填写)。2. 右膝外侧不适(来源:8 月 3 日对话;建议 3 周后复查,是否仍需避开下坡?)。3. 工作日早上 6 点前无法训练(来源:你的说明)。……每一条都可编辑、暂停使用或删除。

一个可参考的对照是,ChatGPT 的“保存的记忆”允许用户逐条查看、编辑、删除,并可整体关闭;但公开说明同时指出,它另有依据历史对话的隐性参考,没有逐条列表,而且删除某次对话并不一定删掉由它生成的记忆。这提醒我们:“能删”要落实到每一处存放的地方,否则用户看到的控制权只是表面。

错误记忆的代价

代价是不对称的。少记一条,教练多问一句,损失很小;记错一条,后果会随着每次计划生成被放大。

  • 把“暂时膝盖疼”记成“不能跑坡”,计划长期偏保守,用户觉得自己没进步。
  • 把“一次发烧后心率高”当作个人新基线,后续所有疲劳判断都会偏。
  • 把模型自己的猜测写进记忆,再拿它当事实引用,就形成了自我循环。Google 的个人健康大模型研究曾坦承存在编造并错误引用用户数据的情形,这也是必须让记忆可核对的原因。

所以我们主张:涉及伤病和身体限制的记忆,默认要用户确认;置信度低时,教练先问,不直接写。

贝博体育观察:这件事目前做到哪里

我们的判断是,长期记忆会成为AI教练的基础设施,但它的价值不在“记得多”,而在“记得准、忘得对、可被修正”。这和预测式训练的观察相互依赖:预测靠长期历史,历史里混进错误记忆,预测就会跟着偏。

现在做不到的事情也很明确:公开资料里,我们没有查到经过独立验证、证明“带长期记忆的AI教练能提高训练效果或降低受伤率”的研究,所以不做这样的说法;也无法在不了解用户具体伤情的情况下,判断某段记忆是否还该继续生效。这类判断始终应回到用户本人、医生或专业教练。训练提示不替代医生或专业教练的意见。