数据库行业日报
本期要点
· Snowflake Horizon Catalog 接入 Iceberg REST Scan Plan API,外部引擎首次能查带行过滤/列脱敏策略的 Iceberg 表(厂商口径)
· DBtune 4.0 把 Postgres 自治调优从参数扩到索引与 autovacuum,客户案例查询均耗时 75.9ms 降到 7ms(厂商口径)
· LanceDB v0.40.0 稳定版上线(基于 Lance 13.0.0),次日 beta 即带破坏性变更
· DuckDB 官方演示几百 KB 的纯视图库文件,当作整个数据湖的共享目录
· Databricks 的 Workday Data Connect 联邦连接器进入公开 Beta,零拷贝查 HR 与财务数据
· LlamaIndex 工程负责人称 grep 与 embeddings 之争的决定因素是数据规模
版本与产品发布
LanceDB v0.40.0 稳定版发布,v0.41.0-beta.0 随即带来破坏性变更 · vector
LanceDB 的 v0.40.0 稳定版基于 Lance 13.0.0 格式,维护在 release/v0.40 分支,Java 包坐标为 com.lancedb:lancedb-core:0.40.0。同日出现的 v0.41.0-beta.0 含两项破坏性变更:各 SDK 统一拒绝零向量搜索探针(zero vector search probes),list_databases 改为返回迭代器。依赖 LanceDB 的团队升级 beta 前要检查这两处调用。[1]
其他版本动态:ClickHouse 同日放出三个维护版,v26.8.20.9-lts、v26.7.24.8-stable、v26.3.44.2-lts,素材无发布说明,仅作补丁线记录;Materialize 发布 v26.45.0 与 v26.45.1;YugabyteDB 多个构建更新,涉及 2.31.0.0、2026.1.3.0 与 2025.2.8.0 三条线,以 backport 和 YSQL 修复为主;Chroma 主干出现 1.5.10.dev313 开发构建。
数据库 × AI
DBtune 4.0:Postgres 自治调优扩到索引与 autovacuum · ai-native ⚠️ 厂商口径
DBtune 4.0 在原有服务器参数调优之外,加入索引优化与 autovacuum 监控。它按负载给索引机会排序,列出预期收益、成本和 DDL,也标出膨胀或重复、过时的旧索引,并能诊断 autovacuum 落后的原因。调优结果可自动应用,也可先由用户审批。披露的案例是客户 Midwest Tape 在 AWS RDS PostgreSQL 上取得 10.8 倍提升,平均查询耗时从 75.9ms 降到 7ms。这是单一客户的自报数据。该公司 2020 年从斯坦福与隆德大学孵化,2023 年 7 月完成 240 万美元种子轮。它代表的路线是用 ML/agent 替代 DBA 手工调参,和近期 Percona、阿里云等对「agent 时代数据库」的讨论同属一个方向。[2]
LlamaIndex 工程负责人:grep 还是 embeddings,由规模决定 · agent
LlamaIndex 工程负责人 George He 在 AI Engineer 播客上称,两派之争的前提是错的,应给 agent 同时配 grep、文件名/元数据过滤和语义检索。他认为 Claude Code 弃用向量库、直接遍历文件系统,靠的是代码库的特点:规模小、有 import 和测试等线索、本就在本地磁盘。企业数据则混着 PDF、PPT、图片,还要处理权限和同步,难以靠本地遍历完成。长上下文也不能免除检索,因为把海量 token 送进模型的成本很高。这是个人观点,不是基准结论,但它正好说明向量库厂商目前的定位:不再主打替代一切,而是面向大规模、非结构化、有权限要求的数据。[3]
湖仓 · 开放表格式 · HTAP
Snowflake Horizon Catalog 支持 Iceberg REST Scan Plan API,策略保护的表可被外部引擎读写 · lakehouse ⚠️ 厂商口径
Snowflake 称 Horizon Catalog 是业界首个对 Snowflake 托管与非托管 Iceberg 表都提供细粒度访问控制的 catalog。此前外部引擎查询带行访问/列脱敏策略的表会直接报错。现在 catalog 先按用户身份评估策略,生成授权后的 scan plan,引擎只拿到被允许的数据切片。Snowflake 称 Spark、Trino、PyIceberg、Flink、DuckDB 等只要实现 Scan Plan API 即可使用,无需各装引擎专属的安全插件。Scan Plan 规范本身只管读,Snowflake 称自己把受策略保护的表的写入也纳入治理,这部分超出规范,是厂商扩展。「首个」是自称,未经第三方核实。这条接在 10 月 3 日 Iceberg REST Catalog 合入 read-restrictions 之后,是开放表格式从「能互通」转向「互通时策略不丢」的具体落地。[4]
Databricks:Workday Data Connect 联邦连接器公开 Beta · lakehouse
Databricks 通过 Lakehouse Federation 把 Workday HR 与财务数据以零拷贝方式接入 Unity Catalog,可在 Databricks SQL、AI/BI、notebook 和 Genie 中与其他企业数据联合查询。它称自己是 Workday Data Cloud 首批提供原生联邦连接器的数据与 AI 平台之一。配置由 Workday 管理员和 Databricks 管理员协作完成,目前仍是 Beta。意义在于联邦查询不再只对接数据库,开始对接 SaaS 业务系统,权限仍由 Unity Catalog 统一管理。[5]
技术 · 架构 · 性能基准
DuckDB 官方:只存视图、不存数据的库文件可充当数据湖目录 · olap
DuckDB 博客介绍 view-only 用法:库文件里只放指向对象存储 Parquet 的视图定义,文件只有几百 KB,不随数据量增长。示例是荷兰铁路开放数据,约 38 万行的 train_services.parquet。上传到 s3:// 或 https:// 后,别人以只读方式 attach 就能直接查询。视图里的 join、过滤和列名可以充当面向消费者的语义层,数据不动。它延续了「DuckDB 不需要自己存数据」的思路,也与上月 AWS 收购 DuckLabs 团队、Aurora 内嵌 DuckDB 查询 Iceberg 的方向一致:DuckDB 越来越像数据湖的轻量查询入口。[6]
Neon 的 Lakebase Search 新增 lakebase_tokenizer:同义词与停用词改用 SQL 表管理 · oltp
原生 Postgres 的同义词和停用词词典要读数据库服务器上的文本文件,托管服务用户碰不到服务器,只能用内置词表。lakebase_tokenizer 扩展把这些配置放进 SQL 表,用 INSERT 即可定义,并进入 GIN 与 lakebase_bm25 索引。因为 Neon 的数据库可 branch,tokenizer 配置会随分支复制,新同义词表可以先在分支上试。文章要点是 BM25 只能给已有 token 打分,分词步骤决定了能搜到什么,比如「k8s」与「kubernetes」。这是 9 月底 Lakebase Search 上线后的补充,属小功能。[7]
Nebius 披露 Managed PostgreSQL 架构:Kubernetes + CloudNativePG · oltp
Nebius 的托管 Postgres 自 2025 年 GA 以来已有数百个生产集群、数十 TiB 数据。它基于 Kubernetes 和 EnterpriseDB 主导的开源 operator CloudNativePG(CNPG)。每个云项目一个独立的 Kubernetes 集群,每个 Postgres 实例独占一个计算节点。目标包括严格同步复制下的零数据丢失、PITR、自动 failover 和物理备份。云厂商转向 CNPG 做托管底座,从侧面说明这个 operator 已经成熟。[8]
学界 · 研究前沿
· Disk-Resident Graph ANN Search: An Experimental Evaluation(arXiv 2603.01779,v2):把磁盘驻留图 ANN 系统拆成存储策略、磁盘布局、缓存管理、查询执行、更新机制五个组件,建立统一分类并做对比实验,适合评估内存放不下时的向量索引取舍。[9]
· Diff-SQL: SQL Efficiency Optimization via Patch Generation and Constraint Alignment(arXiv 2610.06857):做慢查询到语义等价快查询的改写,思路是生成补丁并做约束对齐,属于 DB×LLM 的查询优化方向。[10]
· Cost-Effective Numerical QA over Semi-Structured Table(arXiv 2610.07749):面向带层级版式的半结构化表格数值问答,主题是结构化、解析与规划三步的成本控制。[11]
云厂商 · 生态 · 监管
Elastic 入选 Gartner 企业 AI 搜索魔力象限领导者 · vector ⚠️ 单方口径
Elastic 通过 Business Wire 宣布入选 Gartner 企业 AI 搜索魔力象限的 Leader。素材只有标题,没有排名细节,属分析机构评级与厂商转述,不构成产品能力证据。这家公司上月刚主打 Serverless 向量库和对标 ClickHouse 的指标引擎。[12]
Databricks Apps 的 on-behalf-of-user 授权 GA · lakehouse
Databricks 宣布 Databricks Apps 支持以终端用户身份访问数据的 on-behalf-of-user 授权正式可用,让应用侧也遵守用户自己的数据权限。素材仅有标题,细节未展开。[13]
另:MotherDuck 近两日经 TipRanks 转述其定位,包括面向「超出 Postgres 分析能力」的团队,以及面向嵌入式分析的隔离计算模型;素材只有标题,无新发布。