换个角度想
向量数据库像按位置找邻居的地图:每段内容按「意思」被安放在一个坐标上,含义越近住得越近。找资料不是对名字,而是看谁住在问题旁边。
术语 · 数据与存储
Vector Database
保存向量表示并进行相似度检索,常用于语义搜索和知识库问答。
按意思找,不按字面找
向量数据库像按位置找邻居的地图:每段内容按「意思」被安放在一个坐标上,含义越近住得越近。找资料不是对名字,而是看谁住在问题旁边。
《幼猫喂养指南》→ 嵌入模型
[0.82, -0.15, …] · 语义变成坐标
「幼猫」指向这篇指南
「喂养」指向这篇指南
指南安放在坐标 A
相近内容就住在它附近
搜「小猫吃什么」→ 拆词:小猫 / 吃 / 什么
去找含这些字的文档
「小猫吃什么」→ 同一个模型转向量
落在地图上,看看谁住得近
内容转成向量
知识库问答里「先查资料」那一步,查的往往就是向量数据库。
用户不必猜文档的准确用词,描述意思就能搜到。
「相关推荐」「查重」这类找相近而非找相同的任务。
知识库里明明有《差旅报销标准》,用户搜「出差住宿能报多少」却搜不到。传统关键词搜索缺了什么?
缺语义:关键词搜索只认字面,「住宿能报多少」和「差旅报销标准」没有共同词就匹配不上。把文档转成向量后按语义检索,问题和文档在含义上离得近,就能召回。
向量检索找的是「最像的」,不是「对的」:库里没有答案时,它照样返回几条最接近的。给 RAG 用时要设相似度门槛,不够像就承认查不到。