━━━━━ 正文从此处全选复制 ━━━━━

FutureX · Database

本期要点

· Snowflake Horizon Catalog 接入 Iceberg REST Scan Plan API,外部引擎首次能查带行过滤/列脱敏策略的 Iceberg 表(厂商口径)

· DBtune 4.0 把 Postgres 自治调优从参数扩到索引与 autovacuum,客户案例查询均耗时 75.9ms 降到 7ms(厂商口径)

· LanceDB v0.40.0 稳定版上线(基于 Lance 13.0.0),次日 beta 即带破坏性变更

· DuckDB 官方演示几百 KB 的纯视图库文件,当作整个数据湖的共享目录

· Databricks 的 Workday Data Connect 联邦连接器进入公开 Beta,零拷贝查 HR 与财务数据

· LlamaIndex 工程负责人称 grep 与 embeddings 之争的决定因素是数据规模

▎ 版本与产品发布

LanceDB 推出 v0.40.0 稳定版,v0.41.0-beta.0 紧接着引入破坏性变更 · vector

LanceDB 发布了 v0.40.0 稳定版。该版本采用 Lance 13.0.0 格式,代码维护在 release/v0.40 分支,Java 包的坐标是 com.lancedb:lancedb-core:0.40.0。同一天,v0.41.0-beta.0 也已出现,其中有两项破坏性变更:所有 SDK 都不再接受零向量搜索探针(zero vector search probes),list_databases 则改为返回迭代器。使用 LanceDB 的团队在升级到这个 beta 之前,应当先检查代码中是否调用了这两处。[1]

其他版本动态:ClickHouse 在同一天放出三个维护版本,分别是 v26.8.20.9-lts、v26.7.24.8-stable 和 v26.3.44.2-lts。素材中没有发布说明,这里只作为补丁线的记录。Materialize 发布了 v26.45.0 和 v26.45.1。YugabyteDB 更新了多个构建,覆盖 2.31.0.0、2026.1.3.0 与 2025.2.8.0 三条版本线,内容以 backport 和 YSQL 修复为主。Chroma 的主干则出现了 1.5.10.dev313 开发构建。

▎ 数据库 × AI

DBtune 4.0 把 Postgres 的自治调优范围扩大到索引和 autovacuum · ai-native ⚠️ 厂商口径

DBtune 4.0 在原有的服务器参数调优之外,新增了索引优化和 autovacuum 监控两项能力。它会根据负载给索引机会排出先后,并列明每项的预期收益、成本和 DDL;对出现膨胀的索引,以及重复、过时的旧索引,也会加以标注;autovacuum 落后时,它还能诊断背后的原因。调优结果既可以自动应用,也可以先交给用户审批。厂商披露的案例来自客户 Midwest Tape:在 AWS RDS PostgreSQL 上获得 10.8 倍的提升,平均查询耗时由 75.9ms 降到 7ms。这是单个客户的自报数据。该公司于 2020 年从斯坦福大学与隆德大学孵化而出,并在 2023 年 7 月完成 240 万美元的种子轮融资。它走的路线是用 ML/agent 取代 DBA 的手工调参,与近期 Percona、阿里云等对「agent 时代数据库」的讨论属于同一方向。[2]

LlamaIndex 工程负责人认为,用 grep 还是用 embeddings 取决于数据规模 · agent

LlamaIndex 的工程负责人 George He 在 AI Engineer 播客上表示,两派争论的前提本身就不成立,正确的做法是让 agent 同时具备 grep、文件名/元数据过滤和语义检索三种手段。在他看来,Claude Code 放弃向量库而直接遍历文件系统,是由代码库自身的特点决定的:规模较小,有 import 和测试等可循的线索,而且原本就存放在本地磁盘上。企业数据的情况不同,其中混有 PDF、PPT 和图片,还要处理权限与同步问题,靠本地遍历很难做到。他还指出,长上下文并不能取代检索,因为把海量 token 送入模型的成本很高。这只是个人观点,并非基准测试的结论,但它恰好反映了向量库厂商眼下的定位:不再宣称能替代一切,而是主攻大规模、非结构化、带权限要求的数据。[3]

▎ 湖仓 · 开放表格式 · HTAP

Snowflake Horizon Catalog 支持 Iceberg REST Scan Plan API,受策略保护的表可由外部引擎读写 · lakehouse ⚠️ 厂商口径

Snowflake 宣称,Horizon Catalog 是业界第一个能对 Snowflake 托管和非托管的 Iceberg 表都实施细粒度访问控制的 catalog。过去,外部引擎只要查询设有行访问或列脱敏策略的表,就会直接报错。现在的流程是:catalog 先根据用户身份评估策略,再生成经过授权的 scan plan,引擎只能拿到允许访问的数据切片。Snowflake 表示,Spark、Trino、PyIceberg、Flink、DuckDB 等引擎只要实现了 Scan Plan API 就能使用,不必各自安装专属的安全插件。Scan Plan 规范本身只涉及读取;Snowflake 说它还把受策略保护的表的写入也纳入了治理,这一部分超出规范,属于厂商的扩展。「第一个」是其自称,尚未经过第三方核实。此事发生在 10 月 3 日 Iceberg REST Catalog 合入 read-restrictions 之后,是开放表格式从「能够互通」走向「互通时策略不丢失」的一个具体落地。[4]

Databricks 的 Workday Data Connect 联邦连接器进入公开 Beta · lakehouse

Databricks 借助 Lakehouse Federation,以零拷贝的方式把 Workday 的 HR 与财务数据接入 Unity Catalog。用户可以在 Databricks SQL、AI/BI、notebook 和 Genie 中,把这些数据与其他企业数据联合查询。Databricks 说,自己是 Workday Data Cloud 上首批提供原生联邦连接器的数据与 AI 平台之一。配置工作由 Workday 管理员和 Databricks 管理员共同完成,该连接器目前仍处于 Beta 阶段。它的意义在于,联邦查询的对接对象不再局限于数据库,而开始延伸到 SaaS 业务系统,权限则依然统一由 Unity Catalog 管理。[5]

▎ 技术 · 架构 · 性能基准

DuckDB 官方介绍:只存视图、不存数据的库文件可以充当数据湖目录 · olap

DuckDB 的博客介绍了 view-only 的用法。库文件里只保存指向对象存储中 Parquet 文件的视图定义,因此体积只有几百 KB,也不会随数据量变大。文中的示例使用荷兰铁路的开放数据,即约 38 万行的 train_services.parquet。把库文件上传到 s3:// 或 https:// 地址后,其他人以只读方式 attach,就可以直接查询。视图中的 join、过滤和列名能够充当面向使用者的语义层,而底层数据保持不动。这延续了「DuckDB 无须自己存数据」的思路,也与上月 AWS 收购 DuckLabs 团队、Aurora 内嵌 DuckDB 来查询 Iceberg 的方向一致:DuckDB 正越来越像数据湖的轻量查询入口。[6]

Neon 的 Lakebase Search 增加 lakebase_tokenizer,同义词和停用词可通过 SQL 表管理 · oltp

原生 Postgres 的同义词与停用词词典需要读取数据库服务器上的文本文件,而托管服务的用户接触不到服务器,只能使用内置词表。lakebase_tokenizer 扩展则把这些配置放进 SQL 表,用户通过 INSERT 就能定义,配置还会进入 GIN 与 lakebase_bm25 索引。由于 Neon 的数据库支持 branch,tokenizer 的配置会随分支一起复制,所以新的同义词表可以先在分支上试用。文章的要点是:BM25 只能给已有的 token 打分,能搜到什么取决于分词这一步,例如「k8s」与「kubernetes」能否对上。这是 9 月底 Lakebase Search 上线之后的补充,算是一项小功能。[7]

Nebius 公开 Managed PostgreSQL 的架构,基于 Kubernetes 和 CloudNativePG · oltp

Nebius 的托管 Postgres 服务自 2025 年 GA 以来,已运行数百个生产集群,数据量达数十 TiB。服务建立在 Kubernetes 和 CloudNativePG(CNPG)之上,后者是由 EnterpriseDB 主导的开源 operator。每个云项目都有一个独立的 Kubernetes 集群,每个 Postgres 实例则独占一个计算节点。设计目标包括:在严格同步复制下做到零数据丢失,以及 PITR、自动 failover 和物理备份。云厂商转而采用 CNPG 作为托管服务的底座,从侧面说明这个 operator 已经相当成熟。[8]

学界 · 研究前沿

· Disk-Resident Graph ANN Search: An Experimental Evaluation(arXiv 2603.01779,v2):论文把磁盘驻留的图 ANN 系统划分为存储策略、磁盘布局、缓存管理、查询执行和更新机制五个组件,据此建立统一的分类并开展对比实验。内存装不下数据时,要评估向量索引如何取舍,这项工作可以作参考。[9]

· Diff-SQL: SQL Efficiency Optimization via Patch Generation and Constraint Alignment(arXiv 2610.06857):该工作要把慢查询改写成语义等价的快查询,做法是先生成补丁,再做约束对齐,属于 DB×LLM 的查询优化方向。[10]

· Cost-Effective Numerical QA over Semi-Structured Table(arXiv 2610.07749):论文针对带有层级版式的半结构化表格做数值问答,讨论的是如何在结构化、解析和规划三个步骤上控制成本。[11]

▎ 云厂商 · 生态 · 监管

Elastic 被 Gartner 评为企业 AI 搜索魔力象限的领导者 · vector ⚠️ 单方口径

Elastic 通过 Business Wire 宣布,自己进入了 Gartner 企业 AI 搜索魔力象限的 Leader 档。素材里只有标题,没有排名的细节。这是分析机构的评级经厂商转述而来,不能当作产品能力的证据。上个月,这家公司刚刚主推 Serverless 向量库,以及对标 ClickHouse 的指标引擎。[12]

Databricks Apps 的 on-behalf-of-user 授权正式可用 · lakehouse

Databricks 宣布,Databricks Apps 的 on-behalf-of-user 授权已经 GA。该授权让应用以终端用户的身份访问数据,使应用一侧同样受用户自身数据权限的约束。素材里只有标题,细节没有展开。[13]

另有一则:MotherDuck 在近两天里经 TipRanks 转述了自己的定位,一是面向「超出 Postgres 分析能力」的团队,二是面向嵌入式分析的隔离计算模型。素材里只有标题,并无新的发布。

文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。

FutureX · 记录未来如何发生

素材来源多方媒体/网络新闻