向量数据库能够通过向量搜索(Vector Search),实现更为高效、准确的执行和结果输出。当前主流的数据库检索采用关键词搜索(Keyword Search)的方式,将搜索关键词与数据库中的值进行匹配,根据词汇相似性、单词出现的频率,得到输出结果。关键词检索的缺点在于,其对于语义相同、表达方式不同的文本理解能力较差,且不具备多模态或多语言的检索能力。向量搜索利用神经网络模型,将对象(如文本和图像)和查询表示为高维向量,采用 K 近邻法(KNN,K-Nearest Neighbor)或近似临近算法(ANN,Approximate Nearing Neighbor),计算目标对象与数据库中向量嵌入的距离(通常采用余弦距离、欧氏距离等方法)以表示两者的相似度,并按照向量的相似度进行排序,返回结果。同关键词搜索相比,向量搜索能够实现对语义更为精准的理解,在多模态、不同语言等环境下能够输出更为准确的结果。例如:英文的 Capital 可以指“资本”或者“首都”,“从中国去美国”和“从美国去中国”存在方向,传统的数据库不能很好地解决这些问题。