RAG技术困境:单纯依赖向量嵌入为何不可靠
向量嵌入在RAG系统中不可靠,无法准确衡量内容相似度,导致国王与王后相似度高于国王与统治者。实际应用中,即使检索大量文本片段,基础测试正确率也低于50%。大型语言模型也无法完全解决,成本高、速度慢。出路是将向量嵌入作为基于同义词搜索的优化工具。
今天来聊聊向量嵌入在RAG系统中的表现——这个话题可能有点技术向,但我会尽量讲得通俗一些。RAG系统的核心任务,说起来很简单:找到和用户查询最相似的存储信息。但问题就出在这里——向量相似度搜索偏偏就做不到这一点,这也是为什么很多人在实际部署RAG时会碰一鼻子灰。

选错了工具
RAG在生产环境中频频翻车,根源就在于用向量嵌入来衡量信息相似度——这工具从一开始就选错了。不妨先看一个例子。假设有三个词:
King(国王)
Queen(王后)
Ruler(统治者)
“国王”和“统治者”很可能指的是同一个人,算得上同义词;而“国王”和“王后”显然不是一回事。按相似度来衡量,“国王/统治者”得分应该很高,“国王/王后”则基本为零。换句话说,如果用户查的是“国王”,那么提到“王后”的内容应该不相关,提到“统治者”的内容才可能相关。但向量嵌入给出的结果恰恰相反——它认为“王后”和“国王”的关联度比“统治者”更高。以下是OpenAI的ADA-002嵌入模型给出的相似度得分:
King(国王)
Queen(王后):92%
Ruler(统治者):83%
这意味着,搜索“国王”时,系统会优先展示关于“王后”的内容,而非更相关的“统治者”。你说这合理吗?
向量嵌入在处理“谁、什么、何时、何地、如何”这类问题时并不适用
向量嵌入的问题远不止出现在“国王”这类人物词汇上。再来看看涉及其他事物的例子。
假设用户查询的是猫的特性。按理说,提到狗的文本相似度应该为零,而关于猫科动物的文本得分应该极高。但向量嵌入又一次给出了令人失望的结果:
猫(Cat)
狗(Dog):86%
猫科动物(Feline):85%
虽然只差了1%,但这依然意味着讨论狗的内容会排在讨论猫科动物的内容前面——这显然说不过去,因为狗和猫毫不相干,而猫科动物则是直接相关。
即便是处理绝对同义词,向量嵌入也会犯同样的错误。举个例子,“The Big Apple”是纽约市的别称。假设有位叫苏珊的博主,家住新泽西,平时记录的都是家乡的餐馆、博物馆。但有一篇帖子提到她在“The Big Apple”举行了婚礼。当访客问Chatbot“苏珊去过纽约吗?”时,问题就暴露了:关于新泽西的大量内容会排在提到婚礼的那篇帖子前面。为什么呢?因为在向量嵌入看来,“新泽西”比“The Big Apple”更接近“纽约”:
纽约(New York)
新泽西(New Jersey):90%
The Big Apple:89%
如果新泽西的帖子足够多,“The Big Apple”很可能被淹没在数百个候选结果中。这说明,向量嵌入在处理地点信息时同样不靠谱。
再来看行为操作:
bake a cake
bake a pie: 93%
make a chocolate cake: 92%
搜索“烘焙蛋糕”时,讨论“烘焙派”的内容(得分93%)会排在前面,而“制作巧克力蛋糕”(得分92%)——后者明明更相关——却被挤到后面。
这些例子说明一个道理:向量相似度并不是衡量内容相同度的可靠方法。它既不适合处理人物、事物、地点,也不适合处理行为操作。换句话说,向量嵌入在回答关于“谁、什么、何时、何地、如何”这类问题时,本质上就站不住脚。而这几乎涵盖了人们可能提出的所有问题类型。
RAG 爱好者未曾透露的真相
你可能会觉得这些例子是特意挑选的,或者百分比分数没那么重要。那我们来看看RAG的误导性描述和实际运作之间的差距。
教科书式的描述是这样的:把数百万个文本片段的向量嵌入存进向量数据库,拿到用户查询的向量嵌入后,用余弦相似度算法找出最匹配的前三个片段,连同查询一起发给大语言模型(LLM)。这套方案被标榜为“快速、精确、可扩展”。
而实际先进的做法是:把几千份文档的向量加载到向量数据库中,检索出近50,000个字符的文本片段,和用户查询一起发给LLM,结果得到一个可靠性堪忧的Chatbot(比如F1得分不到50)。
以2024年9月发布的OP-RAG[1]为例。这篇论文来自Nvidia的三位研究者,出身不可谓不权威。下图展示了他们在EN.QA数据集上的评估结果。这个数据集里前两个问题是:
《行尸走肉》第八季的最后一集何时播出?
希腊神话中的春之女神是谁?
答案都很简短,不需要复杂解释,而数据集本身只占整个维基百科语料库的3.8%。即便资源雄厚、数据规模适中、答案简短,研究者们通过一种新的RAG方法,发送48K文本片段并连同查询,才打破了之前的最佳水平,实现了47.25的F1得分——如果发送更少的内容,得分还会更低。
这些Nvidia的研究者难道不知道他们本可以存储25倍以上的向量,并且总能从前三个匹配中找到答案吗?当然不是。但现实中的RAG根本不是那回事。2024年11月发布的LongRAG[2]同样印证了这一点。
更大型的 LLMs 也救不了场
来看2024年10月Databricks[3]的研究成果。
要想正确率超过80%,RAG得向OpenAI的o1模型发送64K字符的文本片段。其他模型,包括GPT-4o、GPT-4 Turbo和Claude-3.5 Sonnet,没有一个达标。但o1模型的结果也问题重重。
首先,它的信息幻觉率居高不下。
其次,即便是处理简短内容,o1的速度也慢得让人无法接受。处理64K文本简直慢到令人抓狂。
再者,运行o1的成本也是一笔不小的开销。
更糟糕的是,业界传言称新一批模型在性能上并未带来明显提升——Anthropic甚至无限期推迟了新模型的发布。即便大模型能解决问题,它们也是又慢又贵。说白了,对于实际应用来说,它们太慢、太贵了。企业会愿意为一个Chatbot支付比真人更高的费用?尤其是这个机器人在回答每个问题前都要花近一分钟,还经常给出不可靠的答案。
这就是RAG的现状。这就是依赖向量嵌入的代价。
别责怪自己,问题出在它们身上
我之所以写这篇文章,是因为我发现论坛上有很多数据科学家和程序员在自我怀疑,觉得自己操作不当。总有人热心地提出一堆方案:重排序、改写查询、用BM25算法、构建知识图谱……希望能撞大运找到解决之道。
但问题在于,成千上万的人学到的东西根本就是错的。以下内容摘自一本2024年10月更新的书,作者是一家培训过40万人的公司的联合创始人:
RAG最适合处理那些数据量庞大、无法一次性装进LLM上下文窗口,且需要快速响应和低延迟的场景。…
现在,RAG系统已经有了一套标准的架构,已经在众多流行框架中得到应用,开发者无需再从头开始。…
数据转换成向量嵌入后,向量数据库就能迅速找到相似项,因为相似项在向量空间中以相近的向量形式存在,我们称之为vector store(即存储向量)。语义搜索在vector stores中进行,它通过比较用户查询的嵌入向量与存储数据的嵌入向量来理解用户查询的意义。这样,无论用户查询中使用了哪些关键词,或是搜索的数据类型如何,都能确保搜索结果的相关性和准确性。
但数学原理告诉我们,向量嵌入技术并不是通过比较相似度的百分比来定位信息。它们根本无法理解用户查询的真实意图。即便是最简单的查询,它们也无法保证搜索结果的相关性,更别提“无论用户查询中使用了哪些关键词,或是搜索的数据类型如何”。
正如OP-RAG论文所展示的,即便通过向量搜索能检索到400个数据块,大语言模型在最基础的测试中也有超过一半的概率找不到相关信息。但教科书上却告诉数据科学家:“在实际操作中,我们可以将整个网站或课程内容上传到Deep Lake [向量数据库]中,以便在成千上万的文档中搜索……为了生成回答,我们会提取与用户问题最匹配的前k个(比如前3个)数据块,整理成提示词,然后以temperature参数为0的模式发送给模型。” 这种说法,和实际情况差了十万八千里。
通往百分百精确回答的道路
那么,出路在哪里?核心思路其实很简单:不再单纯依赖向量嵌入技术。
但这并不意味着向量嵌入就毫无价值了。绝对不是!它们在自然语言处理(NLP)领域依然扮演着重要角色。比如,处理多义词就是它的强项。拿“glasses”来说,它既可以指“玻璃杯”,也可以指“眼镜”。如果有人问“朱莉娅·罗伯茨戴的是哪种眼镜?”,向量嵌入可以确保和眼镜相关的信息排在饮酒玻璃杯的前面——这正是语义处理能力的体现。
ChatGPT的出现,在数据科学界引发了一个不太乐观的变化。像synonyms(同义词)、hyponyms(下位词)、hypernyms(上位词)、holonyms(整体词)这些重要的NLP工具,被边缘化了,大家的注意力更多转向了Chatbot的查询。大语言模型确实简化了NLP的某些方面,但代价是把一些有价值的技术也一并丢弃了。
LLMs和向量嵌入技术是NLP的关键组件,但它们不是完整的解决方案。举个例子,很多公司发现,当Chatbot无法展示访客所需的产品清单时,访客往往会直接离开。于是他们尝试用基于同义词的搜索来替代传统的关键字搜索。基于同义词的搜索确实能找到关键字搜索遗漏的产品,但代价也显而易见——由于一词多义,不相关的信息常常会覆盖掉用户真正想要的内容。比如一个想买玻璃杯的访客,看到的却是一堆眼镜。
面对这种情况,我们不必全盘否定。向量嵌入技术恰好可以在这里发挥作用。我们不该完全依赖它,而是把它当作搜索结果的优化工具:在基于同义词的搜索基础上,利用向量嵌入将最相关的结果推到前列。这才是正确的打开方式。
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:RAG技术困境:单纯依赖向量嵌入为何不可靠要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印
星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证
PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E
东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。
- 日榜
- 周榜
- 月榜
热点快看
