数据库行业日报

本期要点

· Snowflake Horizon Catalog 接入 Iceberg REST Scan Plan API,外部引擎首次能查带行过滤/列脱敏策略的 Iceberg 表(厂商口径)

· DBtune 4.0 把 Postgres 自治调优从参数扩到索引与 autovacuum,客户案例查询均耗时 75.9ms 降到 7ms(厂商口径)

· LanceDB v0.40.0 稳定版上线(基于 Lance 13.0.0),次日 beta 即带破坏性变更

· DuckDB 官方演示几百 KB 的纯视图库文件,当作整个数据湖的共享目录

· Databricks 的 Workday Data Connect 联邦连接器进入公开 Beta,零拷贝查 HR 与财务数据

· LlamaIndex 工程负责人称 grep 与 embeddings 之争的决定因素是数据规模

版本与产品发布

LanceDB v0.40.0 稳定版发布,v0.41.0-beta.0 随即带来破坏性变更 · vector

LanceDB 的 v0.40.0 稳定版基于 Lance 13.0.0 格式,维护在 release/v0.40 分支,Java 包坐标为 com.lancedb:lancedb-core:0.40.0。同日出现的 v0.41.0-beta.0 含两项破坏性变更:各 SDK 统一拒绝零向量搜索探针(zero vector search probes),list_databases 改为返回迭代器。依赖 LanceDB 的团队升级 beta 前要检查这两处调用。[1]

其他版本动态:ClickHouse 同日放出三个维护版,v26.8.20.9-lts、v26.7.24.8-stable、v26.3.44.2-lts,素材无发布说明,仅作补丁线记录;Materialize 发布 v26.45.0 与 v26.45.1;YugabyteDB 多个构建更新,涉及 2.31.0.0、2026.1.3.0 与 2025.2.8.0 三条线,以 backport 和 YSQL 修复为主;Chroma 主干出现 1.5.10.dev313 开发构建。

数据库 × AI

DBtune 4.0:Postgres 自治调优扩到索引与 autovacuum · ai-native ⚠️ 厂商口径

DBtune 4.0 在原有服务器参数调优之外,加入索引优化与 autovacuum 监控。它按负载给索引机会排序,列出预期收益、成本和 DDL,也标出膨胀或重复、过时的旧索引,并能诊断 autovacuum 落后的原因。调优结果可自动应用,也可先由用户审批。披露的案例是客户 Midwest Tape 在 AWS RDS PostgreSQL 上取得 10.8 倍提升,平均查询耗时从 75.9ms 降到 7ms。这是单一客户的自报数据。该公司 2020 年从斯坦福与隆德大学孵化,2023 年 7 月完成 240 万美元种子轮。它代表的路线是用 ML/agent 替代 DBA 手工调参,和近期 Percona、阿里云等对「agent 时代数据库」的讨论同属一个方向。[2]

LlamaIndex 工程负责人:grep 还是 embeddings,由规模决定 · agent

LlamaIndex 工程负责人 George He 在 AI Engineer 播客上称,两派之争的前提是错的,应给 agent 同时配 grep、文件名/元数据过滤和语义检索。他认为 Claude Code 弃用向量库、直接遍历文件系统,靠的是代码库的特点:规模小、有 import 和测试等线索、本就在本地磁盘。企业数据则混着 PDF、PPT、图片,还要处理权限和同步,难以靠本地遍历完成。长上下文也不能免除检索,因为把海量 token 送进模型的成本很高。这是个人观点,不是基准结论,但它正好说明向量库厂商目前的定位:不再主打替代一切,而是面向大规模、非结构化、有权限要求的数据。[3]

湖仓 · 开放表格式 · HTAP

Snowflake Horizon Catalog 支持 Iceberg REST Scan Plan API,策略保护的表可被外部引擎读写 · lakehouse ⚠️ 厂商口径

Snowflake 称 Horizon Catalog 是业界首个对 Snowflake 托管与非托管 Iceberg 表都提供细粒度访问控制的 catalog。此前外部引擎查询带行访问/列脱敏策略的表会直接报错。现在 catalog 先按用户身份评估策略,生成授权后的 scan plan,引擎只拿到被允许的数据切片。Snowflake 称 Spark、Trino、PyIceberg、Flink、DuckDB 等只要实现 Scan Plan API 即可使用,无需各装引擎专属的安全插件。Scan Plan 规范本身只管读,Snowflake 称自己把受策略保护的表的写入也纳入治理,这部分超出规范,是厂商扩展。「首个」是自称,未经第三方核实。这条接在 10 月 3 日 Iceberg REST Catalog 合入 read-restrictions 之后,是开放表格式从「能互通」转向「互通时策略不丢」的具体落地。[4]

Databricks:Workday Data Connect 联邦连接器公开 Beta · lakehouse

Databricks 通过 Lakehouse Federation 把 Workday HR 与财务数据以零拷贝方式接入 Unity Catalog,可在 Databricks SQL、AI/BI、notebook 和 Genie 中与其他企业数据联合查询。它称自己是 Workday Data Cloud 首批提供原生联邦连接器的数据与 AI 平台之一。配置由 Workday 管理员和 Databricks 管理员协作完成,目前仍是 Beta。意义在于联邦查询不再只对接数据库,开始对接 SaaS 业务系统,权限仍由 Unity Catalog 统一管理。[5]

技术 · 架构 · 性能基准

DuckDB 官方:只存视图、不存数据的库文件可充当数据湖目录 · olap

DuckDB 博客介绍 view-only 用法:库文件里只放指向对象存储 Parquet 的视图定义,文件只有几百 KB,不随数据量增长。示例是荷兰铁路开放数据,约 38 万行的 train_services.parquet。上传到 s3:// 或 https:// 后,别人以只读方式 attach 就能直接查询。视图里的 join、过滤和列名可以充当面向消费者的语义层,数据不动。它延续了「DuckDB 不需要自己存数据」的思路,也与上月 AWS 收购 DuckLabs 团队、Aurora 内嵌 DuckDB 查询 Iceberg 的方向一致:DuckDB 越来越像数据湖的轻量查询入口。[6]

Neon 的 Lakebase Search 新增 lakebase_tokenizer:同义词与停用词改用 SQL 表管理 · oltp

原生 Postgres 的同义词和停用词词典要读数据库服务器上的文本文件,托管服务用户碰不到服务器,只能用内置词表。lakebase_tokenizer 扩展把这些配置放进 SQL 表,用 INSERT 即可定义,并进入 GIN 与 lakebase_bm25 索引。因为 Neon 的数据库可 branch,tokenizer 配置会随分支复制,新同义词表可以先在分支上试。文章要点是 BM25 只能给已有 token 打分,分词步骤决定了能搜到什么,比如「k8s」与「kubernetes」。这是 9 月底 Lakebase Search 上线后的补充,属小功能。[7]

Nebius 披露 Managed PostgreSQL 架构:Kubernetes + CloudNativePG · oltp

Nebius 的托管 Postgres 自 2025 年 GA 以来已有数百个生产集群、数十 TiB 数据。它基于 Kubernetes 和 EnterpriseDB 主导的开源 operator CloudNativePG(CNPG)。每个云项目一个独立的 Kubernetes 集群,每个 Postgres 实例独占一个计算节点。目标包括严格同步复制下的零数据丢失、PITR、自动 failover 和物理备份。云厂商转向 CNPG 做托管底座,从侧面说明这个 operator 已经成熟。[8]

学界 · 研究前沿

· Disk-Resident Graph ANN Search: An Experimental Evaluation(arXiv 2603.01779,v2):把磁盘驻留图 ANN 系统拆成存储策略、磁盘布局、缓存管理、查询执行、更新机制五个组件,建立统一分类并做对比实验,适合评估内存放不下时的向量索引取舍。[9]

· Diff-SQL: SQL Efficiency Optimization via Patch Generation and Constraint Alignment(arXiv 2610.06857):做慢查询到语义等价快查询的改写,思路是生成补丁并做约束对齐,属于 DB×LLM 的查询优化方向。[10]

· Cost-Effective Numerical QA over Semi-Structured Table(arXiv 2610.07749):面向带层级版式的半结构化表格数值问答,主题是结构化、解析与规划三步的成本控制。[11]

云厂商 · 生态 · 监管

Elastic 入选 Gartner 企业 AI 搜索魔力象限领导者 · vector ⚠️ 单方口径

Elastic 通过 Business Wire 宣布入选 Gartner 企业 AI 搜索魔力象限的 Leader。素材只有标题,没有排名细节,属分析机构评级与厂商转述,不构成产品能力证据。这家公司上月刚主打 Serverless 向量库和对标 ClickHouse 的指标引擎。[12]

Databricks Apps 的 on-behalf-of-user 授权 GA · lakehouse

Databricks 宣布 Databricks Apps 支持以终端用户身份访问数据的 on-behalf-of-user 授权正式可用,让应用侧也遵守用户自己的数据权限。素材仅有标题,细节未展开。[13]

另:MotherDuck 近两日经 TipRanks 转述其定位,包括面向「超出 Postgres 分析能力」的团队,以及面向嵌入式分析的隔离计算模型;素材只有标题,无新发布。

来源链接

[1] 〔来源〕LanceDB | 2026-10-07 18:49(v0.40.0)、22:47(v0.41.0-beta.0) https://github.com/lancedb/lancedb/releases/tag/v0.40.0 https://github.com/lancedb/lancedb/releases/tag/v0.41.0-beta.0

[2] 〔来源〕Blocks & Files | 2026-10-07 21:36 https://www.blocksandfiles.com/data-management/2026/10/07/dbtune-autonomous-optimization-blows-postgresql-bottlenecks-away/5301616

[3] 〔来源〕BigGo Finance | 2026-10-07 11:08 https://finance.biggo.com/news/33ce87ac312c9466 https://finance.biggo.com/podcast/33ce87ac312c9466

[4] 〔来源〕Snowflake | 2026-10-07 07:25 https://www.snowflake.com/en/blog/engineering/unified-governance-iceberg-rest-catalog/

[5] 〔来源〕Databricks | 2026-10-08 07:46 https://www.databricks.com/blog/announcing-workday-data-connect-federation-unity-catalog

[6] 〔来源〕DuckDB | 2026-10-07 08:00 https://duckdb.org/2026/10/07/view-only-mode.html

[7] 〔来源〕Neon | 2026-10-07 20:00 https://neon.com/blog/bm25-is-only-as-good-as-your-tokens

[8] 〔来源〕Nebius | 2026-10-08 03:43 https://nebius.com/blog/posts/managed-postgresql-for-ai-workloads

[9] 〔来源〕arXiv https://arxiv.org/abs/2603.01779

[10] 〔来源〕arXiv https://arxiv.org/abs/2610.06857

[11] 〔来源〕arXiv https://arxiv.org/abs/2610.07749

[12] 〔来源〕Business Wire | 2026-10-08 00:18 https://www.businesswire.com/news/home/20261007553151/en/Elastic-Recognized-as-a-Leader-in-the-Gartner-Magic-Quadrant-for-Enterprise-AI-Search

[13] 〔来源〕Databricks | 2026-10-08 01:20 https://www.databricks.com/blog/now-ga-building-permission-aware-databricks-apps-behalf-user-authorization