2026-09-050

向量数据库

向量相似度计算方式

  • 余弦相似度计算:衡量两个向量的方向角,忽略长度。
    • 这是最常用的方法,尤其适合文本场景
  • 欧式距离:衡量两点之间的直线距离,距离越小越相似
    • 适合场景:图像检索、地理位置相关应用
  • 点积:点积是向量相乘求和,结合了方向和长度信息
    • 适合场景:推荐系统(向量已归一化时等价于余弦相似度)

索引

  • ivf (倒排文件索引)
    • IVF 执行步骤:
      • 训练阶段:用 K-Means 将所有向量聚成 N 个簇,记录每个簇的中心
      • 查询阶段:先找出距离最近的几个簇的中心,再只在这些簇内做精确搜索

image.png

  • hnsw 多图层检索(类似于redis中的跳表)
    • HNSW 核心思路:
      • 构建多层图结构,顶层稀疏,底层密集
      • 查询时从顶层入口开始,做"跳格游戏":每层贪心地往更近的节点跳,再下探到下一层
      • 大幅减少需要比较的节点数,时间复杂度近似 O(log n)

image.png

参考菜鸟教程

本文作者:曹子昂

本文链接:

版权声明:本博客所有文章除特别声明外,均采用 BY-NC-SA 许可协议。转载请注明出处!