Sports Governance and Sports Industry

Construction of an Intelligent Question Answering System for Sports and Fitness Knowledge

  • SONG Wei ,
  • LI Danyang ,
  • CAI Binyao ,
  • MAO Yuhui
Expand
  • Wuhan Sports University, Wuhan, Hubei 430079, China

Received date: 2025-06-06

  Online published: 2026-07-29

Abstract

To address the problems of general large language models existing in the generation of sports and fitness knowledge, such as low domain adaptation accuracy and poor timeliness of rule-based responses, this paper constructs an accurate knowledge response and intelligent generation mechanism for the sports and fitness domain. A specialized knowledge base for sports and fitness is built. By leveraging the Chroma vector database and the BGE embedding model, and integrating the LangChain framework with aquantized casual language model (DeepSeek-R1-Distill), millisecond-level semantic retrieval and efficient inference are achieved. To enhance the professionalism of generated content and its alignment with user preferences, a dual-strategy optimization framework combining reinforcement learning from human feedback and proximal policy optimization (RLHF+PPO) is designed. A joint loss function is employed to dynamically balance knowledge accuracy and user preference alignment. Experimental results demonstrate that the proposed system achieves a retrieval accuracy of 91.3% and a generation accuracy of 86.7%, with the preference score increasing to 4.23 and the BLEU-4 metric improving to 78.6%. The system is capable of generating professional fitness recommendations that incorporate personalized parameters and risk warnings. The proposed approach provides a practical paradigm for deploying quantizedmodels in vertical sports and fitness domains and offers a reusable quantization-based technical pathway for the deep integration of sports science and technology and artificial intelligence, promoting more precise content generation by intelligent question-answering systems for sports and fitness

Cite this article

SONG Wei , LI Danyang , CAI Binyao , MAO Yuhui . Construction of an Intelligent Question Answering System for Sports and Fitness Knowledge[J]. Journal of Capital University of Physical Education and Sports, 2026 , 38(3) : 339 -352 . DOI: 10.14036/j.cnki.cn11-4513.2026.03.010

随着《全民健身条例》等政策法规相继出台,我国全民健身工作正式步入重要发展时期。体育健身知识是推动全民健身从粗放式体育锻炼向科学运动转变的关键智力支撑[1]。当前,体育健身知识普及存在的主要问题是健身知识科普内容质量参差不齐和健身知识体系尚不完善[2]。特别是在自媒体内容日益多样化的背景下,体育健身知识的传播体现出开放性、交互性、个性化的特点,由于自媒体制作成本门槛相对较低,自媒体传播主体日趋增多,运动健康宣教内容的质量也因此存在差异。与此同时,我国各类媒体对健身知识的传播起步相对较晚,并且有关体育健身的知识体系也不完善,体育健身指导服务的面向对象定位模糊,都会在一定程度上影响科学健身知识的普及[3]。因此,亟待构建体育健身知识智能问答系统,通过多层次多学科知识的融合,形成体育健身知识体系。
大语言模型(简称 LLM)为体育健身知识问答系统的构建带来了全新的应用方向。例如:Merilehto[4]通过某体育俱乐部的数据库分析了大语言模型在将PDF中的半结构化数据处理为结构化数据的有效性;张旭峰[5]揭示了大语言模型在优化健康管理策略、辅助比赛决策及促进文化传播方面的作用;徐凯等学者[6]探讨了大语言模型辅助制定运动处方的可行性,为运动处方制定提供了新的思路和方法,以推动运动处方制定的科学化和智能化。由于在体育健身时运用的知识具有情境性与推理性,所以通用大语言模型还无法完全涵盖体育健身知识,并且在垂直领域知识问答场景中的回答可能出现准确性和可靠性不足的问题。现有的人工智能技术在体育健身知识的适配精确度、反应的时效性、确保运动安全性方面仍然存在一定的问题,特别是在学习复杂运动技能时会出现幻觉,如在学习羽毛球“前臂内旋挥拍”技能时会出现错误内容[7]。而面向垂直领域知识问答场景的大语言模型可为体育健身行业数字化转型提供新的技术路径。近年来,我国一些高校和企业在这方面有所突破。例如,上海体育大学于2024年6月发布了中国首个人工智能体育行业大模型,但其训练成本高、能耗大。同年,北京体育大学也构建了全国首个体育训练康复大模型,使用了60亿例体育专家数据,响应速度与反馈准确度均得到提升,但由于该模型不能实现问答实时优化,在交互自然度、个性化适配等方面存在不足。在2025年3月,某企业发布了运动健康垂直领域知识的专属模型(Kinetic),该模型对用户数据进行加密脱敏,降低了用户数据泄露的风险,但没有设置个人专属知识库。对于上述欠缺,有学者提出了一些从通用大模型到垂直领域知识大模型的解决方案。一是关于基座模型的选择与优化。例如:有研究者[8]认为,有效解决幻觉,应优先选择在通用任务中表现优异且参数量适配的模型。二是关于领域知识的外部注入。例如:有研究者[9]认为,检索增强生成技术(RAG)能在不改变模型的基础上结合行业数据、知识库等解决幻觉问题;还有研究者[10]认为,通过检索增强生成技术可以不进行重新训练就能直接访问最新信息,生成可靠的、基于检索的输出,因此,检索增强生成技术在那些需要不断更新知识的知识密集型问答场景或特定领域应用时尤为有效。三是关于人类偏好对齐与强化学习。例如,有研究者[11]通过将人工标注的优质回答作为奖励信号,并根据近端策略优化算法限制策略更新幅度,避免了生成偏离专业知识的内容。
基于以上,本研究针对全民健身背景下体育健身知识质量参差不齐、扩散精准度不足的痛点,围绕当前大语言模型在体育健身垂直领域知识问答场景中存在的专业知识薄弱、响应时间延迟、生成内容易偏离规范的应用局限,提出专属知识库支撑→高效检索赋能→强化学习优化的递进式技术路径。具体如下:首先系统构建体育健身领域专属知识库(Fitness-KB),填补通用模型在运动损伤康复、专项训练等细分场景的知识空白;其次依托色度(Chroma)向量数据库与软件(LangChain)建立高效的语义匹配机制,解决传统问答系统检索慢、匹配准确度低的技术瓶颈;最后通过人类反馈强化学习(RLHF)与近端策略优化(PPO)的双策略协同,在确保知识专业性的基础上,提升问答系统回答内容与用户个性化需求的适配度。以下将进行验证分析和技术应用价值的讨论,为体育健身知识智能问答系统的研发提供技术框架与理论参考。

1 研究过程与研究方法

1.1 知识获取

数据采集层以构建体育健身领域专属知识库为核心,采集并存储该领域非结构化数据,通过集成多源数据覆盖全部问答场景,并与知识库词典序核心要素(见表1)直接对应,同时建立动态维护机制以确保知识的时效性。例如:实例词典序包含硬拉、蛋白质等;实体词典序涵盖动作、营养、时间参数等类别;关系词典序设定了“要求于”“适配于”等关联逻辑;事件词典序包含动作执行、营养补充等场景。所有词典序要素均随数据更新进行实时校准。
表1 体育健身领域专属知识库(Fitness-KB)部分词典序可视化示例
该模块对接3类数据源并同步实现动态更新:1)实时数据,主要是通过软件(LangChain)的系统接口和协议(MQTT)接入智能健身设备(如心率监测仪、力量训练器械)及健身App,采集动作“拉”、蛋白质摄入记录等动态信息,实现数据实时同步,当动作错误率≥30%或用户高频次反馈同一疑问达到50条时,自动触发对应知识块增量更新;2)历史数据,主要是参考各年度《中国全民健身发展报告》、弹力带康复临床案例、专项训练方案、肌酸分析实例等,为词典序构建提供实例支撑,每季度根据《运动医学杂志》等期刊的相近研究补充新实例与关系词;3)规范文档,主要是从国家体育总局、美国国家体能协会等方面获取如《全民健身指南》、运动员技术等级标准、体能测试评估标准等相关文件,确保动作、营养类标准的专业性,每月同步修订规范文档的内容,如果出现新型器械、技术或公共场景则于72 h内完成专项知识录入。
数据预处理遵循解析、清洗、分割的流程:先提取文本(txt)、PDF文件等对象;其次使用正规表达式去除控制字符、无效链接等噪声;最后以长度300个字符、重叠50个字符的参数切分长文本,以句号、换行符等确保语义完整,以备后续进行上下文检索。更新数据同样经此流程处理后,输入模型微调标注规则,同步修正词典序关联逻辑,新增知识需要经过BGE模型语义校验与专业人员进行人工审核,且支持版本控制,以确保准确性。

1.2 知识抽取

构建体育健身方面的知识库要明确知识类型与知识间的相互关系,笔者以《全民健身指南》等政府文件为依据,结合多学科专业知识将体育健身方面的知识库划分为4个,各个知识库围绕词典序要素形成互补。例如:健身知识库聚焦拉、抛等动作类实例;膳食营养知识库侧重蛋白质等营养类实例;康复训练知识库涵盖弹力带等器械类实例;有氧运动知识库包含慢跑等运动项目类实例。
使用“BIOES”标注体系[B (begin)表示实体的开头, I (inside)表示实体的中间, O (outside) 表示命名实体外部, E(end) 表示实体的尾部, S (sin-gle) 表示该词是一个实体]对原始语料库进行人工标注,围绕实例、实体、事件设计三元组规则。例如,将“拉时腰背挺直(实例为拉;实体为动作;逻辑关系为要求于;事件为做动作)”标注为“拉B-动作”“腰背挺直B-要求”,将“减重蛋白质1.2~1.6 g/kg(实例为蛋白质;实体为营养;逻辑关系为适配于;事件为营养补充)”标注为“蛋白质B-营养”“1.2~1.6 g/kg B-剂量”。
基于预定义规则,将标注语料库输入模型(BiLSTM-CRF)进行训练,同时结合色度(Chroma)向量数据库与嵌入伺服(BGE-small-zh-v1.5),将标注语料库编码为768维的向量进行存储,通过迭代模型分析拉与腰背挺直、减重与蛋白质剂量等向量之间的逻辑关系,实现结构化数据的高效抽取,为后续模块化提供支撑。

1.3 向量数据库配置

色度(Chroma)向量数据库是一个开源的人工智能向量数据库,其作用是供开发者更便捷地构建大语言模型,可将知识、事实、技能等方面的文档整合到大语言模型中(如图1所示)。与其他复杂的数据库系统不同,色度(Chroma)向量数据库是基于向量检索实现的,其架构设计巧妙,无需开发者进行复杂的配置,也不需要大量的基础设施支撑,这一特性使其特别适合小型项目或中型项目[12]。该向量数据库具有诸如嵌入、存储保护、查询、过滤等多种实用的功能。这些功能与 LangChain等框架能实现良好的集成,可以进一步拓展其应用场景。
图1 色度(Chroma)向量数据库技术流程
该数据库支持余弦相似度检索,默认返回Top-3相关文档,经测试在内存占用(12 GB)和检索延迟(平均12 ms /次)上满足实时问答需要,用户可依托本地网管理数据库,降低了用户数据泄露的风险,增强了数据的安全性。

1.4 增强问答系统的整体框架

该系统以3层架构和闭环优化为设计思路,可以实现用户提问、检索模块、生成模块3个层面的解耦与协同。其中:用户提问交互层面接入多种终端设备,主要实现接受用户问题、展示生成答案以及反馈信息的功能,数据层存储非结构化数据、用户交互数据及奖励模型参数,并支持实时更新与安全管理;检索模块由检索增强生成技术模块组成,通过软件(LangChain)实现知识搜索,即产生色度(Chromas)向量数据库和提示词,最后生成优化模块,再通过深度搜索(DeepSeek-R1-Distill)模型生成答案,同时在人类反馈强化学习与近端策略优化条件下完成内容的正确性和安全性的检查,如图2~4所示。
图2 增强问答系统整体框架
图3 增强问答系统参数设置界面
图4 增强问答系统知识交互界面

1.5 软件(LangChain)

该软件(LangChain)是一个开源的框架,由Harrison Chase于2022年10月创建,可使用Python语言或JavaScript技术开发软件。Kurniawan等研究者[13]认为,软件(LangChain)框架的宗旨是攻克大语言模型在应用过程中所面临的工程化难关,以便开发者能更加高效地将大语言模型的功能与外部资源、数据及业务相融合,迅速构建智能化系统。最初,软件(LangChain)框架仅支持语言生成技术(ChatGPT)和大语言模型(LLAMA)的接入。随着版本升级,便能接入大语言模型的应用程序接口,可支持国内大语言模型的接入。检索增强生成技术堆栈溢出攻击的进展极大地影响了检索增强生成技术的应用。随着语言生成技术(ChatGPT)的出现,这类软件(LangChain)能提供与检索增强生成技术相关的应用程序接口,并在大语言模型应用领域具有了不可或缺的作用。窦凤岐等[14]研究者认为检索增强生成技术的时效性优势使其在处理时效性较强的问题时更为可靠。通过与外部知识库的连接,检索增强生成技术可以确保模型能获取最新的信息,并及时匹配当前的事件和知识。因此,检索增强生成技术在那些不断更新知识的知识密集型场景或特定领域应用时尤为有效。运用软件(LangChain)中的Java组件和BLAST工具,开发者可以迅速构建基于检索增强生成技术的问答系统,具体的工作流程如图5所示。
图5 基于软件(LangChain)的检索增强生成技术开发问答系统的工作流程

1.6 深度搜索(Deepseek-R1)大模型

深度搜索(DeepSeek-R1)[15] 大模型是一种基于强化学习的开源推理模型,相关研究还探讨了其蒸馏版本在不同任务中的迁移应用。该模型在代码优化、自然语言推理等任务上表现较好。其无需依赖监督微调(SFT)或人工标注数据,完全通过强化学习完成。该模型在数学模型构建、代码优化和自然语言推理任务上具有独特优势,其推理能力甚至超越了开放式人工智能(OpenAI)的正式版。同时,该模型还具有成本低、效率高、多语言支持等优势,可广泛应用于教育辅导、金融分析、产业智能化升级等方面。Transformer架构的出现则为大语言模型的升级提供了必要的技术支撑。该架构由编码器和解码器2个部分组成[16]。深度搜索(Deepseek-R1)大模型仅基于解码器(Decoder-
Only)架构,通过自回归过程实现从左到右的序列预测,其核心优势是通过掩码自注意力动态聚焦已生成内容的上下文,天然适配文本挖掘、对话交互等开放式任务场景。该大模型的输出在所有方面都优于非推理式的大语言模型[17]。深度搜索(DeepSeek-R1-14B)模型在所有评估指标上都超过了模型(QwQ-32B-Preview),而深度搜索大模型(DeepSeek-R1-32B和DeepSeek-R1-70B)在多数基准测试中都显著超过了模型(o1-mini)。这些结果说明蒸馏版本的强大潜力。此外,笔者还发现,将强化学习应用于这些蒸馏后的模型会进一步产生显著的效应。在强化学习训练中,在性能上与模型(QwQ-32B-Preview)相当。

1.7 强化学习优化策略

已有研究使用的强化学习优化策略有架构创新、上下文长度优化、模型微调、训练策略最优化等[18]。强化学习[19]在语料库训练过程中形成了策略评估与策略更新的迭代机制,根据奖励信号调整模型策略。模型基于奖励信号输出数值,近端策略优化算法可进一步对策略参数进行更新,这属于动态训练优化策略,并非固定的架构或微调参数设置。其中,为了使大语言模型的行为更符合人类的期望,人类反馈强化学习是强化学习的一种特定应用,专门用于通过人类反馈优化模型性能[20](如图6所示)。有研究者[21]认为人类反馈强化学习需要有符合人类偏好的数据,用于训练大语言模型,从而将人类偏好转换为数字信号,即大语言模型接收一段文本序列并输出标量,以该数值预测用户对该文本的关注度。基于上述模型的数字信号, 有研究者[22]使用强化学习中的近端策略优化算法优化模型学习过程,通过约束策略的变化幅度平衡检索内容和生成内容。经过多次不断地生成文本序列、计算数字信号、更新策略,直到模型测算结果达到预期,最终实现大语言模型与人类的偏好对齐。
图6 人类反馈强化学习流程

2 检索增强生成技术与人类反馈强化学习-近端策略优化结合的生成模型优化方法

2.1 提问的交互设计

用户交互模块作为用户与问答系统沟通的桥梁,主要处理接收到的用户信息和问答系统的反馈。具体包括登录交互和问答交互,可以降低用户操作的繁琐程度。在进行知识预处理与分块时,设定知识库文件名扩展(txt/pdf/docx),首先通过指令格式解析提取文本内容,使用正规表达式清除噪声(如控制字符、URL地址),得到纯净文本T=t1, t1, …, tn,进一步通过递归算法将长文本切分为固定长度的组块Ch=[C1, C2, …,Cn],其中:Ch表示由递归算法生成的文本分块集合;C1表示第1个文本块,C2表示第2个文本块,依此类推,Cn表示第 n 个文本块, n表示分块总数。各文本块均为按照设定块长度 L和重叠长度O划分得到的文本片段。其中分块长度(L))为300字符,重叠长度(O)为50字符,可以确保上下文连续性。递归算法通过字段分隔符(如句号、换行符)切分文本,形式化定义递归函数为C=R(T,S,L,O),其中:C为分块结果,R( )表示递归函数,T为待分块文本,S表示分隔符集合(如{。,!,?,\n}),L表示块长度,O表示重叠长度。
对于长文本,根据语义进行分隔,通过递归算法切分,确保每个文本块包含完整的语义基元,重复部分保留跨块上下文信息,增强后续检索时的上下文关联度。
最后,确定问答系统提示词,并设计 “知识引导+角色定位” 型提示词框架,通过设定问答系统的角色,动态调整、生成及优化引导语句模板。如果用户对“分步骤阐述”类型的回答给予较高评价,问答系统将在后续提示词中强化这一[表达]式,以形成“提示词设计-回答生成-反馈评价-提示词优化”的闭环调整机制。结合检索结果的上下文,引导模型生成符合体育健身知识需求的专业回答。示例如下。
提问:
你是专业的体育健身顾问,需要基于以下知识回答问题:
{检索到的知识上下文}
{用户提问}
回答要求:语言通俗,包含具体数据(如重量、次数),加入安全建议(如动作注意事项)。

2.2 检索的设计

大语言模型在实际应用时可能会出现专业知识缺乏、信息不准确、生成虚假内容等诸多问题,检索增强生成 [23]技术能在不改变大语言模型的基础上,结合行业数据、知识库等解决这些问题。其中,最重要的是构建向量数据库,通过预训练模型将文本编码为d维向量v=E(C) 。其中:C表示经过文本切分后得到的文本块(Chunk);E表示嵌入模型(Embedding Model)的编码函数;v表示文本块C经过编码后生成的d维向量,d为向量维度。存储于Chroma向量数据库中。向量余弦相似度计算公式如下。
$\operatorname{sim}\left(\boldsymbol{v}_{i}, \boldsymbol{v}_{j}\right)=\frac{\boldsymbol{v}_{i} \cdot \boldsymbol{v}_{j}}{\left\|\boldsymbol{v}_{i}\right\|\left\|\boldsymbol{v}_{j}\right\|}$
式中:simvi,vj)为向量余弦相似度; vi,vj表示文本的d维向量,·表示点积,||vi||和||vj||分别表示向量vivj的欧几里得维数。
余弦相似度以向量夹角表示语义相关性,取值范围为[-1],值越大表示语义越相近,是通过向量检索评价文本相关性的主要指标。
最后是检索-生成联合建模,用户提出的问题Q首先通过模型检索向量q[q=E(Q) ],其中,Q表示用户输入的问题;E表示嵌入模型的编码函数;q表示问题Q经编码后得到的查询向量,用于在向量数据库中进行相似度检索。从向量数据库检索得到上下文C={Cha,Chb,Chc},式中:C表示上下文,Cha表示组块a, Chb表示组块b,Chc表示组块c。提示词设定为P=系统提示+C+Q,输入大语言模型生成回答为A,条件生成概率计算公式如下。
$p(A \mid P)=\sum_{t=1}^{n} p\left(a_{t} \mid a_{<t}, P ; \theta\right)$
式中:p(A|P)表示样本索引,P表示给定提示词 生成回答A的概率,at表示生成的第t个词元,a< t表示前t-1个词元,θ表示生成模型的参数,式中逗号表示多个输入条件共同作用,分号用于区分输入条件与模型参数。
当前词元基于自回归模型生成机制的生成概率取决于历史生成的词元和输入的提示词,并且通过链式法则降低了联合概率,实现了上下文相关的序列生成。

2.3 优化生成内容的方案设计

笔者设计了人类反馈强化学习的偏好查询优化方法。

2.3.1 数据收集与奖励构建

首先,主要收集单轮问答数据D[D=(Qi,Ai,ri)Ni=1 ,其中, i表示样本索引,Qi表示第i个用户的问题,Ai表示对应的模型回答,ri∈[0,5]为用户评分,N表示样本总数]。为了抑制异常值的影响,对批次奖励进行标准差评分标准化处理, 其核心步骤是计算批次奖励的均值和标准差,对当前批次的所有样本的评分求和后取平均,公式为线性代数中的标量均值运算。
$\mu=\frac{1}{m} \sum_{i=1}^{m} r_{i}$
式中:i表示样本索引;μ为批次奖励均值;m为批次大小;ri为第i个样本的原始评分,计算批次奖励均值作为中心化基准,用于后续标准化时的中心化处理(ri-μ),消除不同批次奖励的均值差异。
其次,计算批次奖励的标准差,以衡量奖励分布的离散程度。
$\sigma=\sqrt{\frac{1}{m} \sum_{i=1}^{m}\left(r_{i}-\mu\right)^{2}}$
式中:σ为批次奖励的标准差,评估奖励分布的离散程度;(ri)通过计算标准差,可以进一步标准化奖励值,每个样本评分与批次均值的偏差,体现该评分偏离平均水平的程度,可以使不同批次的奖励具有可比性,从而提高模型训练的稳定性。
最后,通过标准差评分标准化将奖励转换为均值为0、标准差为1的标准正态分布数据,公式如下。
$r_{\mathrm{n}}=\frac{r_{i}-\mu}{\sigma+10^{-9}}$
式中:rn为标准化后的奖励,10为防止分母为零的极小常数,ri将奖励转换为以均值为原点的相对值。除以σ将奖励转化为标准差为1的分布,最终rn为近似标准正态分布N(0,1)。通过标准差评分标准化,避免极端评分对梯度的过度影响,提升模型训练稳定性。

2.3.2 定义策略模型

使用量化因果关系的语言模型(DeepSeek-R1-Distill)作为安全策略模型πθ(A|Q),该模型是基于另一模型( Transformer)的架构设计的,根据小规模数据集优化了模型参数与计算效率,适配体育健身知识的高效学习。输入“问题-回答”对应X=[Q,A],输出词元序列生成概率公式如下。
$ \pi_{\theta}(A \mid Q)=\prod_{t=1}^{n} \operatorname{Softmax}\left(f_{\theta}\left(X_{<t}\right)\right)$
式中:πθ(A|Q)为策略模型的条件生成概率; fθ为模型的前向传播函数;X<t为前t-1个输入词元的嵌入表示,通过Softmax函数将模型归一化后得到各词元的生成概率。模型采取全参数微调策略,直接优化生成模型的所有可训练参数。量化因果关系的语言模型(DeepSeek-R1-Distill)的模块(Transformer)通过自注意力机制分析问题与回答之间的语义依赖,例如,在生成“增肌期蛋白质摄入建议”时,模型会关联问题中的“增肌期”与知识库中对应的营养推荐区间。

2.3.3 构建奖励加权交叉熵损失函数

目标是最大化奖励加权的期望对数概率,将其等价于最小化损失函数,公式如下。
$ L_{\mathrm{RLHF}}(\theta)=-[ E_{(Q, A, r) \sim D}\left[r_{\mathrm{n}} \cdot \log \pi_{\theta}(A \mid D)\right]$
式中:LRLHF(θ)为人类反馈强化学习的损失函数;|E表示期望运算;D表示单轮问答数据集;(QAr)~D表示从数据集D中采样得到一个问答样本,其中,Q表示用户的问题,A表示模型的回答,r表示该样本的原始评分,rn为标准化后的奖励,πθ(A|D) 表示参数为 θ的策略模型在给定问题D条件下生成回答A的概率。经过对数运算,通过奖励加权可以增大高评分样本的梯度贡献,引导模型优先优化人类偏好的回答,对数项将生成概率转换为可微分的损失函数。
对于批次数据Db,损失函数可表示为下式。
$ L_{\mathrm{RLHR}}=\frac{1}{b} \sum_{i=1}^{b}\left(-\frac{1}{n_{i}} \sum_{t=1}^{n i} \log p\left(\mathrm{x}_{t}^{(i)} \mid \mathrm{x}_{4}^{(i)}, \theta\right)\right) \cdot r_{\mathrm{ni}}$
式中:b为批次大小;ni为第i个样本的词元数量;x(i)t为第i个样本的第t个词元对批次内每个样本的词元级交叉熵损失加权平均;rni为奖励权重,可以确保高评分样本对损失函数的影响更大,实现偏好对齐优化;p表示模型预测的条件概率分布;θ表示语言模型的可训练参数集合,包括Transformer网络中的权重参数和偏置参数。
在进行人类反馈强化学习偏好优化之后,适配近端策略优化技术进行梯度优化首先要做的是梯度范数裁剪,为避免策略更新幅度过大,应用近端策略优化的梯度裁剪技术限制梯度范数不超过阈值c( c=1.0),公式如下。
$ \tilde{g}=\frac{g}{\max (1,\|g\| / c)}$
式中:为裁剪后的梯度;g为原始梯度;||g||为梯度的L2范数;c为裁剪阈值。当梯度范数超过阈值时,按比例缩放梯度,确保参数更新步长在信任区域内,避免策略剧烈变化导致的模型训练不稳定,符合近端策略优化的近端优化思想。
之后采用优化算法,使用优化编译器(Adam W)更新策略参数,结合权重衰减提升泛化能力,更新规则如下。
$ \theta_{t+1}=\theta_{t}-\alpha \cdot A\left(g, \theta_{t}\right)$
式中:θt为更新后的参数模型;α为学习率(设为le-5); A为权重减少的优化编译器(Adam W),通过自适应学习调整和动量收敛[性]加速,权重减少在梯度更新时添加惩罚参数,防止过拟合,使梯度裁剪后的更新确保策略更新的稳定性和泛化。

2.4 拟合模型的损失函数

监督学习能够确保模型具有基本的问答内容生成能力,但是对用户深层偏好的预测相对有限;如果仅依赖人类反馈强化学习损失函数进行优化,则可能导致模型过度追踪奖励信号,进而影响语义稳定性。拟合模型的损失函数是平衡知识准确性与用户偏好的关键创新点,通过融合监督学习信号与偏好信号,可在一定程度上解决传统方法中语义偏移和偏好失衡的问题。最终损失函数由监督学习交叉熵损失函数与奖励加权损失函数共同构成,用于在语义稳定性与用户偏好之间实现平衡。形式化为如下公式。
$ L=L_{\mathrm{CE}}+\lambda \cdot L_{\mathrm{RLHF}}$
式中:LCE为监督学习交叉熵损失函数, LRLHF为奖励项加权交叉熵损失函数,λ=0.8为奖励信号的权重超参数。在平衡监督学习信号与强化学习信号基础上生成的损失函数用于维持模型的基本的语言生成能力,奖励项加权用于引导模型生成更符合人类偏好的输出;训练时将λ=0.8 作为奖励信号的权重超参数,以实现两类优化信号的有效融合。

3 结果

3.1 评价指标

本研究依据技术架构特性、领域知识需求及用户目标实现,确定将偏好得分(PS)、语义相似度(BL-4)、生成准确率(GA)、检索准确率(RA)作为关键评价指标。其中:偏好得分是用户体验层的关键指标,通过标准差评分标准化处理用户评分,将人类主观偏好转化为可量化的数值信号,精准分析人工智能系统回答的实用性、易懂性等隐性需求,避免技术指标在人机交互维度出现评估盲区;BLEU-4使用自然语言处理方面的经典语义评估框架,通过n元模型匹配度与惩罚因子,系统地衡量生成文本与专家答案在词汇结构、语句规范上的一致性,既满足体育知识结构化表达的规范性要求,又为跨模型对比提供可复现的客观标准;生成准确率则从专业知识正确性角度出发,通过关键信息匹配度评估模型输出的内容可靠性,有效规避体育场景中因数据错误导致的应用风险;检索准确率聚焦检索增强生成技术的底层表达式的精准性,通过计算正确检索问题的比例,量化系统从向量数据库中获取精准领域知识的效能。以上4项指标形成技术层、应用层、体验层的立体化评估指标体系,检索准确率与生成准确率确保知识检索生成的准确性,偏好得分控制满足用户需求的实用性导向,BLEU-4确保专业表达的规范性,共同满足用户对 安全、可靠、科学、规范、便捷、实用的体育健身知识的多重需求。
1)偏好得分(Ps)。该指标数值越趋近5,表明用户对回答的实用性、易懂性等隐性需求的综合体验越好。
标准化评分公式(标准差评分)如下。
$r_{n o i}=\frac{r_{\mathrm{oi}}-\mu}{\delta+10^{-9}}$
偏好得分计算公式如下。
$P_{\mathrm{s}}=\frac{1}{M} \sum_{i=1}^{M} r_{n o i}$
式(12)中:roi为第i条回答的原始评分;μ为评分均值; δ为标准差; 10-9防止分母为零。公式(12)运算后,通过公式(13)计算均值,得到偏好得分。公式(13)中的M 表示总评分数量。
2)语义相似度(BL-4)。该指标通过计算1~4元词的匹配度,结合惩罚因子,衡量生成回答与专家答案的语义相似度。数值越高(最高100%)表明生成内容在词汇和语句结构上与专业答案越一致。
$B_{\mathrm{L}-4}=B_{\mathrm{p}} \cdot \exp \left(\sum_{n-1}^{4} w_{n} \log \left(p_{n}\right)\right)$
$B_{\mathrm{p}}=\left\{\begin{array}{ll} 1, & \text { 若 } c>r \\ \exp \left(1-\frac{r}{c}\right), & \text { 若 } c \leqslant r \end{array}\right.$
式(14)中:pnn元语法精度)表示在生成文本与参考文本中连续n个词(n-gram)的匹配比例,由生成文本中参与文本匹配的n元词组数量与生成文本中n元词组的总数量相除得出;Bp表示惩罚因子,用于处理生成文本过短的问题,分为公式(15)的2种情况,其中,c表示文本长度,r表示参考文本(专家答案)的有效长度; wn表示各n元语法的权重(本研究中采用均匀权重,即w1=w2=w3=w4=0.25)。
3)生成准确率(GA)。该指标评估模型生成内容的专业准确性。
$G_{\mathrm{A}}=\frac{N_{\text {key }}}{N_{\text {total }}} \times 100 \%$
式中:Nkey表示生成回答中关键信息正确的问题数量;Ntotal表示总测试问题数量。
4)检索准确率(RA)。该指标通过计算正确检索的问题占比,衡量模型从向量数据库中获取相关知识的能力。
$R_{\mathrm{A}}=\frac{N_{\text {correct }}}{N_{\text {total }}} \times 100 \%$
式中:Ncorrect表示检索结果中包含问题对应准确知识的问题数量;Ntotal表示总测试问题数量。

3.2 对比实验

在本研究构建的体育健身知识问答系统中,超参数的优化直接影响模型对体育健身领域知识的处理能力与生成结果。根据文本分块策略,该问答系统的分块长度(300字符)与重复长度(50字符)是基于体育知识的语义完整性需求设定的。经实验验证,该配置使检索准确率相较无重复分块提高12.3%。训练批次多少的选择结合了体育领域数据稀疏的特点。在人类反馈强化学习/近端策略优化训练时,较少批次(常规区间为 4~16)可更精准地分析用户反馈中的个性化偏好,减少批次过多导致的梯度噪声。通过对比实验发现,批次为8时,偏好得分的标准差相较批次为16时减少37%。学习率与梯度裁剪阈值的组合优化主要依据量化因果关系的语言模型(DeepSeek-R1-Distill)的参数特性进行。在优化编译器(AdamW)中,1e-5的学习率处于领域模型微调的常规有效区间(1e-6~1e-4),经过5轮交叉验证,该数值在生成准确率与收敛速度之间实现了平衡,相较学习率为 1e-4 时的生成准确率提高4.2%,且未出现过拟合。奖励权重λ的确定是因为 知识准确性 与 用户偏好需要平衡。在拟合模型损失函数中,λ 用于调节监督学习损失函数与人类反馈强化学习奖励项加权损失函数的贡献度。通过网格搜索法在 λ处于0.5~0.9 的范围内选取候选值,并以语义相似度(BL-4)等指标综合比较设置为不同参数时的模型表现,以语义相似度(BL-4)指标为例,当 λ为0.8 时,模型在运动营养搭配等专业场景的语义相似度(BL-4)值达到78.6%,相较λ为0.5时提高了15.2%,且未因过度强化偏好导致知识偏差。综上可知,超参数的最终取值均通过在体育知识特性约束下的多轮控制变量实验确定,以检索准确率、生成准确率、偏好得分等指标为主,可确保系统在体育健身专业知识处理与用户体验上实现最优平衡,相关方法可为同类垂直领域知识问答场景模型的参数最优化提供参考。
色度(Chroma)向量数据库支持毫秒级快速搜索,可以使搜索生成准确率达到91.3%,突破了传统知识库需要大体量数据积累的技术局限。在优化层,运用人类反馈强化学习和近端策略优化双策略改善模型在体育健身知识领域的适用性。其中:人类反馈强化学习通过标准差评分标准化处理将用户偏好得分由3.21分提高至4.23分,解决了传统检索增强生成技术重检索、轻体验的问题;近端策略优化则通过梯度范数裁剪调节参数更新的范围,增强复杂任务下的策略稳定性。此外,设计监督学习与强化学习融合的拟合模型损失函数,通过λ为0.8时的权重配置平衡问答系统的文本基本生成能力与偏好优化信号,在确保生成准确率达到86.7%的同时,将语义相似度(BL-4)指标提高至78.6%。见表2
表2 各模型评价对比

3.3 典型案例验证与系统性能分析

3.3.1 单一模块基准案例:增肌期蛋白质摄入方案优化

以体育健身领域高频查询问题——增肌期如何安排蛋白质摄入作为单一模块(膳食摄取)基准案例,对比4类模型响应函数的差异以验证问答系统在单一知识维度的精准度(见表3)。
表3 各模型对增肌期蛋白质摄入问题的回答内容对比
表3显示:1)通用大语言模型生成“每日1.2 g/kg体重”的建议,该数值低于运动营养学的专业标准(1.6~2.2 g/kg体重),且未包含餐次、摄入时机等实用场景,无法满足用户实施需求;2)规则引擎机械地引用《增肌指南》中的“1.6 g/kg体重,分3餐”的固定规则,仅能涵盖正常体重人群,对体重超过80 kg需要增加至2.0 g/kg体重的个性化建议缺乏适配能力,呈现明显的规则刚性缺陷;3)基础检索模型通过检索生成了补充“1.5 g/kg体重”的鸡胸肉、蛋白粉等食材的建议,但是遗漏了“训练后30 min内摄入40 g蛋白质以促进肌肉形成”的关键时间窗口期,同时未提示“单次摄入超过60 g易降低吸收效率”的有效边界,说明存在仅依赖检索而缺乏优化策略的局限性;4)目标模型依托色度(Chroma)向量数据库在体育健身领域专属知识库的膳食子库进行精准检索,结合量化因果关系的语言模型(DeepSeek-R1-Distill)的高效推理,生成“1.8~2.2 g/kg体重”的区间,并且进一步细化为早餐、练后、午餐、加餐、晚餐 5个餐次,明确制定了“练后30 min内50 g乳清蛋白+30 g快碳”的场景化方案,且作出“过量摄入可能加重肠胃与肾脏负担”的风险提示,实现了专业标准、个性化参数与安全风险提示的全面涵盖。

3.3.2 跨模块复杂推理案例:腰椎间盘突出症患者综合康复计划制定

以45岁、体重为75 kg的腰椎间盘突出症康复期患者如何制定包含“低强度有氧训练+核心力量+康复拉伸”并搭配抗炎膳食的周训练计划作为跨模块案例,主要验证问答系统整合体育健身领域专属知识库关于康复训练、健身训练、膳食营养摄取的三大模块知识的能力。各模型响应效果如下:1)通用大语言模型仅生成“每日10 min腰背拉伸+每周3次平板支撑”的碎片化建议,既未明确低强度有氧训练的具体类型,也未考虑患者腰椎承压特点,平板支撑30 s的时长存在安全隐患,无法形成完整训练方案;2)规则引擎输出了“按照康复指南进行腰背训练,每日摄入钙1000 mg”的建议,割裂了腰背训练与营养的关联逻辑,既无训练强度随着康复阶段变化的递进设计,也未建立膳食与腰背训练的协同关系;3)基础检索模型虽然补充了“选择游泳作为低强度有氧训练方式”,但未关联康复期前2周需要降低核心力量训练强度的阶段适配要求,且抗炎膳食仅提及“增加ω-3脂肪酸摄入”,缺乏具体食材与量化标准,方案操作性不足。
相比之下,目标模型体现出显著的跨模块整合优势。一方面,训练端精准整合“每周3次20 min游泳+2次核心力量训练+每日康复拉伸”的框架,其中,游泳作为低强度有氧运动可在一定程度上降低腰椎垂直承压风险,核心力量训练与康复期运动强度需求相匹配,康复拉伸则有助于针对性地放松腰背肌群,从而较为全面地兼顾训练安全与康复需求;另一方面,膳食端明确制定了“每日200 g三文鱼+50 g亚麻籽”的量化方案,二者均富含ω-3脂肪酸成分,可协同发挥抗炎促恢复作用。该模型形成了训练与膳食的跨模块协同逻辑,所生成方案的科学性与实用性远超其他模型。
值得注意的是,目标模型在细节上仍可以继续优化,具体体现为未明确“核心力量训练强度随康复拉伸周次变化的调整比例”,虽然不影响整体方案的可行性,但是该细节如果补充完善,可进一步增强方案对康复阶段变化的适配度,以更好地贴合患者的动态康复需求。
对于各模型在跨模块案例中的表现差异,主要从知识准确性、跨模块协同性、步骤连贯性、风险提示完整性4个维度以5分制进行评分(分数越高表示性能越优),相关结果如图7所示。图7显示,目标模型在4类模型中整体表现最优,仅跨模块协同性与步骤连贯性维度的评分略低于其在单一模块案例中的对应表现。其中:跨模块协同性维度的表现缘于色度(Chroma)向量数据库默认的Top-3检索策略优先匹配了单一模块高相似度文档,导致跨模块关联知识检索权重不足;步骤连贯性维度则需要进一步强化模型(DeepSeek-R1-Distill)在多步骤推理任务中的复杂逻辑链路控制构建能力,后续可通过检索策略优化与推理引导进一步增强目标模型的整体性能优势。
图7 各模型在腰椎间盘突出患者综合康复计划查询中的性能对比

3.3.3 特殊人群查询案例:2型糖尿病患者增肌的营养搭配方案

以“50岁、体重80 kg的2型糖尿病患者在增肌期如何搭配碳水化合物与蛋白质”作为特殊人群案例,验证目标模型对非常规用户需求的响应能力,重点考察方案对糖尿病患者血糖管理与增肌需求的双重适配性。各模型的响应效果显示:1)通用大语言模型仅生成“每日1.8 g/kg蛋白质+适量碳水化合物”的常规建议,未关注糖尿病患者的关键需求——既未提及“优先选择低血糖指数食材”以规避血糖波动的关键要求,也未提示“蛋白质摄入需结合肾功能监测”的饮食安全要点,方案缺乏对特殊人群生理特性的针对性考量;2)规则引擎则生成了“增肌期碳水化合物占比50%”的建议,未适配糖尿病患者宜分次摄入碳水化合物以平稳餐后血糖的特殊需求,同时割裂了营养搭配与血糖管理的关联逻辑,无法满足增肌与控糖兼顾的综合需求;3)基础检索模型虽然在蛋白质摄入上补充了“1.6~1.8 g/kg区间”的细节,却未明确“每餐碳水化合物不超过50 g”的量化控制标准,且抗炎膳食建议仅停留于增加ω-3脂肪酸摄入的概念层面,未提供具体食材清单,导致方案的实操性不足。
相比之下,目标模型显著提升了对特殊人群体育健身需求的适配度,针对性地纳入“选择低血糖指数碳水化合物”与“蛋白质分次摄入”的优化内容。其中:低血糖指数碳水化合物可有效降低碳水化合物消化吸收速度,避免餐后血糖骤升,契合糖尿病患者血糖管理的关键需求;蛋白质分次摄入则能在满足增肌所需氨基酸供给的同时,减轻单次大量摄入蛋白质对肾脏产生的代谢负担,兼顾了安全性与营养的有效性。这一设计弥补了通用大语言模型的缺陷,突破了规则引擎的机械性局限,克服了基础检索模型的实操性不足,使方案更贴合2型糖尿病患者增肌不升糖的关键需求。
为了进一步强化目标模型在特殊人群中的适用优势,可以从知识支撑与模型优化两方面改进。一方面,体育健身领域专属知识库的膳食子库当前的知识覆盖面可向特殊人群延伸,现有子库的知识文件数量相较健身子库、康复训练子库、有氧运动模块少,且标注内容侧重于常规体检健康的人群,后续可补充针对糖尿病患者等特殊人群的专项知识子模块,为模型提供更精准的知识支撑;另一方面,通过人类反馈,强化学习过程可优化样本构成,当前反馈的样本未明确纳入特殊人群和专业人士的意见,导致模型优先对齐常规体检健康的人群的需求偏好,后续可增加特殊人群的反馈与营养师的建议,减少知识库偏见对模型响应的影响,进一步增强目标模型对非常规的体育健身需求的适配优势。

4 伦理边界与策略选择

体育健身知识问答系统的伦理构建需要深度嵌入现有技术框架,以“不增加量化运行负担、不脱离领域知识基底”为原则,围绕敏感信息安全与推荐内容合规两大主要边界设计系统运行策略。在敏感信息管理方面,依据色度(Chroma)向量数据库支持用户本地管理数据的特性,进一步细化数据安全管控流程。具体来说,采集包括运动损伤史、2型糖尿病血糖数据、肾功能监测指标等用户敏感信息前需要明确告知用户信息用途与使用范围,仅获取生成个性化建议必需的内容,传输时采用安全套接层[协议]/传输层安全协议保障数据安全,存储时对具体病史细节、身份证号等关键敏感字段进行隐藏处理,仅保留腰椎间盘突出症康复期、血糖控制稳定等标签化信息,用于内容适配,同时应分级设置本地数据访问权限。例如,普通用户仅可查看自身数据及系统生成的建议,管理员需要经过多因子认证并留存操作日志才能进行数据维护,第三方调用数据需要获得用户书面授权且限定使用场景,全程追溯操作记录,避免敏感信息滥用或泄露。
在推荐内容安全性与适当管控方面,以体育健身领域专属知识库中已标注的动作关键词、营养指标等专家级知识为基础,在检索增强生成环节增设安全优先级筛选规则,优先匹配包含“动作注意事项”“适用人群限制”的文档,如硬拉的相关知识应包含“腰要挺、避免弯腰负重”的提示,剔除“伤病期高强度康复训练”“过量摄入蛋白质”等有害内容。此外,可将普通用户的评分、康复医师的评估和运动营养师的评估共同纳入人类反馈强化学习的评价维度,将“符合运动医学指南”“无健康风险”设为权重大的奖励项,生成建议时强制附加具体风险提示,如“体重为70 kg的腰椎康复期用户单次平板支撑不超15 s”“增肌期蛋白质过量可能加重肾脏负担”,以提升系统输出内容的安全性和适当性,适配体育健身体系对伦理合规的要求。

5 展望

本研究围绕体育健身知识问答系统的关键技术模块与应用展开分析,通过多技术协同突破垂直领域知识问答系统构建的关键难题,形成量化可复用技术方案,为相关研究与应用提供参考。首先,笔者根据体育知识语义完整性需求,基于检索增强生成技术与人类反馈强化学习-近端策略优化结合的生成模型优化方法,设计了递归字符拆分器与动态字段分隔符策略,可以将长文本切分为含300字符50重叠字符的语义基元,同时结合色度(Chroma)向量数据库与嵌入模型(BGE)构建高效检索机制,能实现每轮查询平均12 ms级知识匹配,消除了通用大语言模型语义断层弊端,最终使检索准确率提高至91.3%,显著优于通用规则引擎(FitQA)的84.7%。其次,该系统优化层运用人类反馈强化学习构建用户偏好对齐机制,通过标准差评分标准化处理用户评分,将偏好得分从基础模型的3.21分提高至4.23分,通过近端策略优化的裁剪技术(阈值1.0)限制策略更新幅度,避免过拟合导致的生成偏差,提升了该方法在运动损伤康复建议、个性化训练计划等场景中的适用性,两者协同使生成准确率达到86.7%,相较基础检索增强生成模型提高8.4百分点。最后,笔者设计了监督学习与强化学习融合的损失函数,通过0.8的权重λ平衡问答系统的基础生成能力与偏好优化,保持领域知识准确性的同时提升语义匹配度,使语义相似度(BL-4)指标从基线模型的65.7%提高至78.6%,生成内容在语句结构和语义上更贴近专家答案,且能精准输出包含个性化参数与风险提示的专业建议,有效解决了通用大语言模型在体育领域知识生成不准确、重检索轻体验等问题。
笔者提出的搜索-生成-优化技术路线具有跨知识领域适配性,其中,色度(Chroma)向量数据库与软件(LangChain)可直接复用,仅需替换领域专属知识库与嵌入模型(如医疗场景用BioBERT、金融场景用FinBERT)即可迁移应用,而量化因果关系的语言模型(DeepSeek-R1-Distill)经过微调后能适配不同领域知识问答需求,人类反馈强化学习+近端策略优化框架通过调整奖励评估维度可匹配各领域知识安全合规要求,该迁移特性可避免基础架构重复开发,为医疗、金融等对效率与合规性要求高的领域知识生成提供大模型应用参考,推动大语言模型从通用场景向专业垂直领域知识问答场景应用。
从整体方案而言,笔者围绕体育健身知识问答系统的主要需求,构建了基于大语言模型与体育健身领域专属知识库的量化技术体系。具体包括:通过整合多源动态数据(智能健身设备实时数据规范文档等)构建体育健身领域专属知识库,填补了通用大模型在运动损伤康复等细分场景知识的空白;依托检索增强生成技术+人类反馈强化学习-近端策略优化形成交互知识检索内容生成的架构,既解决了通用大模型在体育健身领域知识生成的低效问题,又通过对体育领域知识的精准表述与动态生成能力显著提高了体育健身知识的生成效率。
本研究的实践意义与战略意义体现在3个方面:一是实现有限资源条件下的在线体育服务的快速供给,为体育健身服务与人工智能的深度融合提供可复用的技术路径;二是为智慧体育建设提供技术支撑,促进体育健身知识服务向精准化、智能化、普惠化转型;三是通过人工智能技术创新与知识扩散的双向赋能,为健康中国、体育强国战略实施提供数字化支撑,使全社会可以共享体育健身的科学知识,对促进全民健康、增强国民体质具有重要的理论意义与实践意义。
[1]
张新苗, 陈日生. 基于体育强国背景下科学健身知识与方法的普及与推广研究[C]// 中国体育科学学会体育社会科学分会. 2023年体育社会科学分会年会论文集. 北京: 首都体育学院, 2023:865-866.

[2]
邵梦霓, 张阳, 游永豪, 等. 健康中国背景下安徽省老年人群科学健身知识普及策略研究[J]. 安徽师范大学学报(自然科学版), 2024, 47(3):280.

[3]
谢一博, 梁智杰, 张正萌. 人工智能技术在科学健身知识与方法普及与推广中的应用研究——以ChatGPT为例[C]// 中国体育科学学会体育社会科学分会. 2023年体育社会科学分会年会论文集. 郑州: 河南大学武术学院, 2023:475-478.

[4]
Merilehto J. From PDFs to structured data: Utilizing LLM analysis in sports database management[Z/OL].(2024-10-23)[2026-04-18]. https://arxiv.org/abs/2410.17619.

[5]
张旭峰. 大语言模型在体育教育及社会体育中的创新应用探索[C] // 国际班迪联合会(FIB),国际体能协会(ISCA),中国班迪协会(CBF). 第五届国际体育科学大会论文集(下). 北京: 国家开放大学实验学院, 2024:218-221.

[6]
徐凯, 赵亚楠, 戴剑松, 等. 大语言模型辅助制定运动处方的可行性研究[C] // 中国体育科学学会体质与健康分会. 2024年全国运动增强体质与健康学术会议论文摘要集. 南京: 南京体育学院运动健康学院,南京师范大学体育学院, 国家体育总局体育科学研究所,2024:107-108.

[7]
Qiu Y. The impact of LLM hallucinations on motor skill learning: A case study in badminton[J]. IEEE Access, 2024, 12:139669-139682.

DOI

[8]
Qi G, Nguyen C T. Mixed preference optimization: Reinforcement learning withdata selection and better reference model[Z/OL]. (2024-03-28)[2026-04-18]. https://arxiv.org/abs/2403.19443.

[9]
Xu R, Shi W, Zhuang Y, et al. Collab-RAG: Boosting retrieval-augmented generation for complex question answering via white-Box and black-box LLM collaboration[Z/OL]. (2025-04-07)[2026-04-18]. https://arxiv.org/abs/2504.04915.

[10]
刘洋. “大模型+RAG”技术在档案工作中的应用探析[J]. 中国档案, 2025(3):64.

[11]
Lin J, Ma Z, Gomez R, et al. A review on interactive reinforcement learning from human social feedback[J]. IEEE Access, 2020, 8:120757-120765.

DOI

[12]
Pokhrel S, Bina K C, Shah P B. A Practical application of retrieval-augmented generation for website-based chatbots: Combining web scraping, vectorization, and semantic search[J]. Journal of Trends in Computer Science and Smart Technology, 2025, 6(4):424.

DOI

[13]
Kurniawan D, Triloka J. Penerapan teknologi langchain dan LLM pada sistem question answering berbasis chatbot telegram: Literature review[G]// Institut Informatika dan Bisnis Darmajaya. Seminar Nasional Hasional Hasil Penelitian dan Pengabdian Masyarakat. [S.I.]:[s.n.] 2025(1):95-104.

[14]
窦凤岐, 胡珊, 李佳隆, 等. 基于LangChain的RAG问答系统设计与实现——以C语言课程问答系统为例[J]. 信息与电脑(理论版), 2024, 36(6):101.

[15]
李全兴, 吴国林. 论人工智能的理解——以DeepSeek-R1等新兴人工智能为例[J]. 华南理工大学学报(社会科学版), 2025, 27(2):9.

[16]
Ren T, Li R, Zhao M M, et al. Separate source channel coding is still what you need: An LLM-based rethinking[J]. ZTE Communications, 2025, 23(1):30-44.

[17]
Deepseek A, Guo D, Yang D, et al. DeepSeek-R1:Incentivizing reasoning capability in LLMs via reinforcement learning[Z/OL]. (2025-01-22)[2026-04-18]. https://arxiv.org/abs/2501.12948.

[18]
Pternea M, Singh P, Chakraborty A, et al. The RL/LLM taxonomy tree: Reviewing synergies between reinforcement learning and large language models[J]. Journal of Artificial Intelligence Research, 2024, 80:1525-1573.

DOI

[19]
Yu Q, Zhang Z, Zhu R, et al. DAPO: An open-source LLM reinforcement learning system at scale[Z/OL]. (2025-03-18)[2026-04-18]. https://arxiv.org/abs/2503.14476.

[20]
Xu B, Zubiaga A. Understanding the effects of RLHF on the quality and detectability of LLM-generated texts[EB/OL]. (2025-03-23)[2026-04-18]. https://arxiv.org/abs/2503.17965.

[21]
Wu Z Q, Hu Y S, Shi W J, et al. Fine-grained human feedback gives better rewards for language model training[J]. Advances in Neural Information Processing Systems, 2023, 36:59008-59022.

[22]
Zheng R, Dou S, Gao S, et al. Secrets of RLHF in large language models part I: PPO[Z/OL]. (2023-07-11)[2026-04-18]. https://arxiv.org/abs/2307.04964.

[23]
CRUD-RAG: A comprehensive chinese benchmark for retrieval-Augmented generation of large language models[J]. ACM Transactions on Information Systems, 2025, 43(2):1-32.

Outlines

/