提升大语言模型回答准确性的有效方法
金融文档RAG系统优化指南:有效提升检索与回答准确性 RAG(检索增强生成) 大语言模型(LLM)的回复准确程度,高度依赖于输入信息的质量——尤其在应用检索增强生成(RAG)技术时。RAG通过筛选最相关的文本片段来强化LLM的查询基础。尽管近年来LLM的答复水平大幅进步,用户偶尔仍会遇到错误或不相关
金融文档RAG系统优化指南:有效提升检索与回答准确性
RAG(检索增强生成)

大语言模型(LLM)的回复准确程度,高度依赖于输入信息的质量——尤其在应用检索增强生成(RAG)技术时。RAG通过筛选最相关的文本片段来强化LLM的查询基础。尽管近年来LLM的答复水平大幅进步,用户偶尔仍会遇到错误或不相关的输出。通常,问题根源并不在LLM本身,而是RAG在文本片段检索环节出现了偏差。因此,精细化RAG流程成为提升LLM性能的关键所在。本文首先分析RAG操作链条的局限,随后给出优化文本检索效率的可行方案,包括先进分块技术、查询扩展、元数据标注、重新排序算法以及嵌入算法微调。实施这些策略后,检索精准度可显著提高,LLM在处理和回应问题时的整体表现与可信度也会随之增强。
当前RAG流程的缺陷与不足
RAG目前和大模型Agent相同,是LLM最热门的应用方向之一。然而主流RAG架构在处理知识密集及特定领域问答时,依然存在多处短板。
均匀切分问答的局限:RAG流程通常将文档均匀分割,这种切割方式完全忽略文档结构与内容。虽然操作简单,但易造成关键信息遗失。举例来说,若答案分散在数个语义不相似的段落中,传统RAG难以精确抓取相关片段。
余弦相似度的不足:RAG的核心机制之一依赖余弦相似度进行语义搜索,但该方法并非完美——有时会检索到完全不相关甚至相反的信息。这反映了模型对语言细微差异的敏感度较低,意外结果时有出现。最相似的文本块并不一定最相关,然而许多RAG流程默认如此。此外,标准嵌入算法往往缺少领域特定知识,会忽略专业术语或短语的细微差别。
多文档问答任务的短板:当知识库仅有单一长文本(如一本书或一篇文章)时,基础分块策略加上相似性搜索或许可行。但实际场景中我们更常面对结构复杂的多文档,例如带有标题和表格的文件。若所有文本块被同等对待、一股脑存入同一向量数据库,重要信息容易丢失。例如文档集可能是不同公司的财务报告,或跨年度的报表。文本块位置不同,可能完全不含公司信息或特定年份指标,最终输出不准确或过时的内容。
基于问题相似检索的局限:传统检索算法缺乏处理多文档高级问答所需的细腻推理能力。它们通常仅基于原始问题进行相似性搜索,无法像人类那样进行逐步逻辑推导。财务分析师在计算某个指标时,会通过多步骤逻辑推理确定计算方式及信息在文档中的位置。这种复杂性无法单靠问题相似性搜索捕捉。查询本身可能未提供足够信息引导模型找到最相关文本块,需要更多上下文与逻辑推理。
如何在金融领域提升RAG效果
如何处理文档分块
分块技术对检索过程至关重要——它直接决定算法返回的上下文内容与质量。分块不当,会造成信息过多或不足。大多数RAG流程使用固定大小分块,难以适应不同查询需求。理想的分块策略应根据知识库中的文档特性和模型预期处理的查询长度来定制。
递归分块是一种更灵活的策略,它利用标点等语言特征动态调整分块。该方法能保持块大小大致均匀,同时通过额外参数确保文本不被胡乱切割——例如避免在句子中间断开。借助Spacy和NLTK等Python库,我们可以采用更高级的句子分割技术,这些技术利用NLP更好地理解文档上下文。
处理财务报告时,文档通常篇幅长、结构复杂且带有表格。类似的文档(如10-K报告)往往有固定格式,可通过标题和副标题标识结构。考虑到财务报告特殊性,采用基于元素的分块方法能进一步提升检索准确性。有篇论文探讨了Unstructured中的策略:遇到标题元素就新起一个块;遇到表格元素也新起块,同时保留整个表格。这样每个上下文都能提供恰当信息量,有效解答用户疑问。
如何做查询扩展
查询扩展(或查询转换)指对输入RAG的问题进行改造,而非死板地仅用用户原始问题搜索信息块。这是因为用户的问题有时信息不足,无法明确指引算法在文档中寻找上下文——特别在使用余弦相似性搜索时。有时仅凭用户问题反而可能误导算法,搜到错误信息块。处理更复杂的问题和文档时,需要更多逻辑推理步骤来确定搜索方向,标准RAG在这方面明显力不从心。
为模拟人类分析师在检索时可能采用的逻辑,可使用假设文档嵌入(HyDE)技术。与仅用原始问题进行相似性搜索不同,HyDE 利用LLM生成一个假设性文档,然后结合原始问题和该假设答案共同搜索。该技术已被证明能超越传统检索器,且无需定制嵌入算法。不过,它有时也会因依赖另一个LLM提供额外上下文而得出错误结果。
元数据标注与索引优化
在与大量文档交互时,传统检索算法可能错过元数据中的重要数据点。如前所述,与多个文档互动时,标准RAG容易混淆不同文档的区块。一个办法是为每个文档建立独立向量数据库,但在大规模场景下不现实——尤其当用户需要在多个文档间切换或同时与多个文档互动时。元数据标注是一种有效补救方法,能帮助跨越这一障碍,进一步提升检索精度。
进行元数据标注时,应结合分块策略一同考虑。例如,若根据文档元素分块,可向标注中加入每个元素的详细信息。例如,表格被单独作为一个区块,元数据可注明其类型(如损益表、现金流量表等)。此外,为提供更多上下文,通常还会在元数据标注中添加摘要和关键词。
重排序策略
使用传统RAG时,可设定算法返回的文档或数据块数量,从而决定给查询提供多少上下文。通常最靠前的1到2个数据块会被纳入上下文,它们基于余弦相似度或k-最近邻搜索得到。这种方法能找出最相似的数据块,却未必是最相关的上下文。
重新排序策略将数据块的相关性置于相似度之上。简单流程:先用余弦相似度等方法找出最相似的10个数据块,然后由另一个独立算法根据相关性重新排序,最后选择排在最前面的一两个作为输入查询的上下文。
微调嵌入算法
嵌入算法负责将文本转化为数学表示,是RAG流程中的关键环节。通过利用领域特定知识优化嵌入算法,可提升在特定领域内的检索效率。嵌入表示还可以是动态的,能根据上下文微妙变化调整词义。例如,OpenAI提供的嵌入表示就能依据上下文变化做相应调整。不过,要做领域特定的模型微调,就需要包含查询、文本语料以及领域相关文档的综合数据集。
如何测评RAG系统
评价RAG系统性能时,主要关注两件事:模型检索相关上下文的准确性,以及根据上下文回答问题的能力。如果拥有金融分析师提供的上下文和答案作为真实基准,将模型输出与这些真实答案进行对比,称为结构化评估。
若没有真实答案作为基准,则称为非结构化评估。虽然结构化评估在确定模型精确度方面更可靠,但非结构化评估也能帮助评价块和答案的质量——尤其是在实际情况下大多数场景无法获得真实答案。
检索质量
在结构化数据中,评估检索质量的主要方法是查看页面级别和段落级别的准确度。我们持有完整文档和分析师引用的部分,将该部分内容与检索算法返回的数据块进行对比。若引用的上下文与检索的上下文在同一页面,则准确度很高;段落级别的准确度逻辑类似。
在非结构化数据中,依据RAGAS框架定义的上下文相关性来评价检索到的数据块。该指标要求LLM统计上下文中与问题回答相关的句子数量。上下文中提取出的相关句子数与总句子数的比例,即为上下文相关性得分。该机制旨在减少重复信息的权重,同时奖励那些大多数句子都能提供有用信息来回答问题的数据块。
大语言模型回答的准确性
在结构化评估中,通过比较模型生成的答案与数据集中的真实答案来评估准确性。常用的标准评价指标包括BLEU、Rouge-L得分和余弦相似度。但这些指标并不擅长比较两个不同答案的语义内容,有时可能产生误导。因此,我们还采用一种特定的LLM评估方法——通过特定提示让模型(如GPT-4)自行评估候选答案相对于真实答案的准确性。
我们还可以用非结构化方法来评估生成器的答案质量与检索上下文之间的关系。RAGAS框架提供的答案忠实度指标可衡量模型答案与上下文的契合程度,通过计算答案中由上下文支持的陈述数与答案中总句子数的比值得到。该得分也可用来评估模型在没有真实答案作为参考时是否会虚构信息。高得分说明生成的答案几乎完全基于上下文——即模型没有添加任何文档之外的额外信息。
参考论文:arXiv论文:2404.07221
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:提升大语言模型回答准确性的有效方法要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印
星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证
PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E
东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。
- 日榜
- 周榜
- 月榜
热点快看
