随着《全民健身条例》等政策法规相继出台,我国全民健身工作正式步入重要发展时期。体育健身知识是推动全民健身从粗放式体育锻炼向科学运动转变的关键智力支撑
[1]。当前,体育健身知识普及存在的主要问题是健身知识科普内容质量参差不齐和健身知识体系尚不完善
[2]。特别是在自媒体内容日益多样化的背景下,体育健身知识的传播体现出开放性、交互性、个性化的特点,由于自媒体制作成本门槛相对较低,自媒体传播主体日趋增多,运动健康宣教内容的质量也因此存在差异。与此同时,我国各类媒体对健身知识的传播起步相对较晚,并且有关体育健身的知识体系也不完善,体育健身指导服务的面向对象定位模糊,都会在一定程度上影响科学健身知识的普及
[3]。因此,亟待构建体育健身知识智能问答系统,通过多层次多学科知识的融合,形成体育健身知识体系。
大语言模型(简称 LLM)为体育健身知识问答系统的构建带来了全新的应用方向。例如:Merilehto
[4]通过某体育俱乐部的数据库分析了大语言模型在将PDF中的半结构化数据处理为结构化数据的有效性;张旭峰
[5]揭示了大语言模型在优化健康管理策略、辅助比赛决策及促进文化传播方面的作用;徐凯等学者
[6]探讨了大语言模型辅助制定运动处方的可行性,为运动处方制定提供了新的思路和方法,以推动运动处方制定的科学化和智能化。由于在体育健身时运用的知识具有情境性与推理性,所以通用大语言模型还无法完全涵盖体育健身知识,并且在垂直领域知识问答场景中的回答可能出现准确性和可靠性不足的问题。现有的人工智能技术在体育健身知识的适配精确度、反应的时效性、确保运动安全性方面仍然存在一定的问题,特别是在学习复杂运动技能时会出现幻觉,如在学习羽毛球“前臂内旋挥拍”技能时会出现错误内容
[7]。而面向垂直领域知识问答场景的大语言模型可为体育健身行业数字化转型提供新的技术路径。近年来,我国一些高校和企业在这方面有所突破。例如,上海体育大学于2024年6月发布了中国首个人工智能体育行业大模型,但其训练成本高、能耗大。同年,北京体育大学也构建了全国首个体育训练康复大模型,使用了60亿例体育专家数据,响应速度与反馈准确度均得到提升,但由于该模型不能实现问答实时优化,在交互自然度、个性化适配等方面存在不足。在2025年3月,某企业发布了运动健康垂直领域知识的专属模型(Kinetic),该模型对用户数据进行加密脱敏,降低了用户数据泄露的风险,但没有设置个人专属知识库。对于上述欠缺,有学者提出了一些从通用大模型到垂直领域知识大模型的解决方案。一是关于基座模型的选择与优化。例如:有研究者
[8]认为,有效解决幻觉,应优先选择在通用任务中表现优异且参数量适配的模型。二是关于领域知识的外部注入。例如:有研究者
[9]认为,检索增强生成技术(RAG)能在不改变模型的基础上结合行业数据、知识库等解决幻觉问题;还有研究者
[10]认为,通过检索增强生成技术可以不进行重新训练就能直接访问最新信息,生成可靠的、基于检索的输出,因此,检索增强生成技术在那些需要不断更新知识的知识密集型问答场景或特定领域应用时尤为有效。三是关于人类偏好对齐与强化学习。例如,有研究者
[11]通过将人工标注的优质回答作为奖励信号,并根据近端策略优化算法限制策略更新幅度,避免了生成偏离专业知识的内容。
基于以上,本研究针对全民健身背景下体育健身知识质量参差不齐、扩散精准度不足的痛点,围绕当前大语言模型在体育健身垂直领域知识问答场景中存在的专业知识薄弱、响应时间延迟、生成内容易偏离规范的应用局限,提出专属知识库支撑→高效检索赋能→强化学习优化的递进式技术路径。具体如下:首先系统构建体育健身领域专属知识库(Fitness-KB),填补通用模型在运动损伤康复、专项训练等细分场景的知识空白;其次依托色度(Chroma)向量数据库与软件(LangChain)建立高效的语义匹配机制,解决传统问答系统检索慢、匹配准确度低的技术瓶颈;最后通过人类反馈强化学习(RLHF)与近端策略优化(PPO)的双策略协同,在确保知识专业性的基础上,提升问答系统回答内容与用户个性化需求的适配度。以下将进行验证分析和技术应用价值的讨论,为体育健身知识智能问答系统的研发提供技术框架与理论参考。