Amazon S3 Vectors加入元数据预过滤:新桶默认启用,已有索引可先逐查询比较

10-01 4阅读

2026 年 9 月 30 日,AWS 宣布 Amazon S3 Vectors 支持元数据预过滤,在相似度搜索之前先应用元数据条件,并新增用于路径、网址等字符串的前缀匹配运算符 $startsWith。此次变化主要影响带有筛选条件的向量查询。

Amazon S3 Vectors加入元数据预过滤:新桶默认启用,已有索引可先逐查询比较

配图为 AI 生成的概念示意图,非真实产品界面、设备照片或性能测试结果。

新建与已有索引分开处理

公告说明,新向量桶中的索引默认使用预过滤;已有索引可以通过 UpdateIndexMode 原地更新,也可先通过 QueryVectors 的逐查询参数进行比较。发布时 AWS 仍在部署这项变化,计划随后几天完成,因此不能把公告日期当作每个环境的实际启用时间。

AWS 将收益描述为在筛选条件较严格时,最多返回五倍的匹配向量。这个上限不表示每次搜索都改善五倍,也不等于最终生成答案正确率提高五倍。功能在支持 S3 Vectors 的商业区域及中国区域提供,预过滤本身不额外收费。

比较实验先固定问题与筛选条件

以下是本文的检索验收建议。为每个问题保存同一查询向量、同一元数据条件、同一返回条数,再比较两种过滤方式。人工标出应该能被检索到的材料,分别看是否漏掉、排在什么位置,以及是否混入不符合条件的内容。

例如知识库只允许查询某个产品版本的说明,不能因为结果数量增加就判定改善。新增结果需要确实属于目标版本,并对当前问题有用。若原始资料的版本标签错误,改变过滤顺序也不能自动修正元数据。

把空结果和弱相关结果单独记下来

样本中应包括条件很宽、条件很窄、没有匹配资料这几种情况。对于本来就没有资料的问题,正确行为可能是返回空结果并提示缺少证据,而不是为了凑足数量放宽条件。评估记录要保留筛选表达式,方便重现异常。

前缀匹配也需要用真实值测试。路径有没有末尾分隔符,网址是否含协议和大小写差异,都应由数据约定明确。先准备几条容易混淆的样例,检查匹配边界,再把规则应用到大量内容;不要把字符串前缀当成权限规则本身。

已有索引的采用决策可以分两步:先做逐查询对照,再决定是否整体切换。最终报告同时展示相关性、筛选正确性、延迟与费用观察,才有足够信息判断这项更新是否改善了自己的检索链路。

来源与核验

AWS官方更新(2026-09-30)。本文于北京时间 2026 年 10 月 1 日核验,功能状态以官方后续更新为准。

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。