━━━━━ 正文从此处全选复制 ━━━━━
FutureX · 记录未来如何发生
数据库行业 · 第 26 期 · 2026.08.21
本期要点
· Delta Lake 4.4.0 发布,支持 Spark 4.2
· Harper 5.2 发布,主张单一运行时替代多组件数据栈
· AlloyDB ScaNN 四级索引进入预览,支持百亿级向量
· EDB 为 WarehousePG 推容灾,两天缩至 16 分钟
· Databricks 详解 OpenAI 数据平台,月省 40万美元
· Graphwise 获控股投资,押注 agent 语义层市场
▎ 版本与产品发布
Delta Lake 4.4.0 发布,接入 Spark 4.2 与 Unity Catalog Delta Table API · lakehouse
Delta Lake 迎来 4.4.0 版本,同步支持 Apache Spark 4.2(向下兼容 4.1/4.0.1),并扩展与 UC Delta Table API 的集成,新增 identity column 与 generated column 支持。Delta UniForm 的 delta-iceberg 模块继续保持 Delta 与 Apache Iceberg 元数据同步,使 Iceberg 读取器可直接查询 Delta 表而无需复制数据——开放表格式互通仍是 Databricks 生态的核心叙事。Kernel 化的 delta-flink 连接器同步升级至支持 Flink 2.3.0,流批一体覆盖面进一步扩大。[1]
Harper 5.2 发布,反对"数据库+缓存+任务队列"多系统拼装 · oltp ⚠️ 厂商基准口径
数据库厂商 Harper(原 HarperDB)发布 5.2 版本,从三方面提升性能:基于无锁原子版本槽的单 worker 记录缓存、把写入提交调度移出应用线程、以及缩短查询路径的规划器优化。Harper 主张将应用代码与数据放进同一运行时,反对当下"Postgres+Redis+Serverless 函数+实时推送"式多组件拼装——其基准将自身与 Neon Postgres+Upstash Redis+Vercel Functions+Ably 组成的对照栈相比,宣称在个性化实时数据负载下性能显著领先(厂商自测,未经第三方复核)。这一立场与本期 HN 热议的"PostgreSQL for Everything"(见技术章)遥相呼应,折射出后端架构简化正成为一股潮流。[2]
EDB 为 WarehousePG 推出 PB 级容灾方案,恢复窗口压至 16 分钟 · oltp ⚠️ 厂商案例口径
EDB(EnterpriseDB)宣布 WarehousePG 容灾能力正式可用,作为 EDB Postgres AI 分析底座的关键补齐:企业可在本地、云端或混合环境保留一份实时同步的恢复集群,自行决定何时切换。据 EDB 披露,一家银行客户在数百 TB、7×24 分析管线场景下,原有逻辑备份/恢复流程耗时约两天,切换后恢复时间缩至16 分钟(厂商披露的单一案例,未注明是否为典型值)。随着 AI agent 与分析师日益依赖实时数仓做决策,PB 级容灾正从"尽力而为"变为可测试、可交付的能力指标。[3]
其他版本动态:ClickHouse 同期发布 v26.3.20.7-lts、v25.8.31.9-lts、v26.6.3.62-stable、v26.5.7.64-stable、v26.7.4.58-stable 等多个 LTS/稳定分支补丁;YugabyteDB 密集推送 2025.2、2026.1、2024.2 系列 backport(含 CVE-2025-8715、Go 依赖升级等安全修复);Redpanda 发布 v25.3.17、v26.1.17 及多个 rc 版本;Materialize 更新至 v26.38.0/v26.38.1;Weaviate v1.38.11 修复异步复制问题;TiDB、LanceDB 亦有例行小版本迭代。[4]
▎ 数据库 × AI
Google Cloud AlloyDB ScaNN 四级索引进入预览,单集群支持超百亿向量 · vector ⚠️ 厂商基准口径
AlloyDB(Google Cloud 的 PostgreSQL 兼容托管数据库)为内置向量索引 ScaNN 新增四级树结构预览,将检索复杂度从三级树的 O(N^1/3) 降至 O(N^1/4),官方称足以支撑百亿级向量规模。为控制召回率损失,新结构叠加 Top-K branch、SOAR、centroid adjustment 等辅助方法;针对建索引阶段的内存瓶颈,还引入平衡树结构与压缩采样集应对采样超出内存的场景。Google 披露的内部测试显示,百亿向量规模下 p95 延迟 ≤51 毫秒、召回率 95%。此举延续了云厂商把向量检索直接塞进关系型内核、而非另起专用向量库的路线,AlloyDB 借此在 AI 负载竞争中同时对齐 pgvector 系与专用向量库两端。[5]
Databricks 披露支撑 ChatGPT 的数据平台细节,月省存储成本 40万美元 · ai-native ⚠️ 厂商案例口径
OpenAI 自 2024 年起在 Azure 与 AWS 双云上以 Databricks 为数据底座,用量数据落入由 Unity Catalog 统一治理的 Delta 表,覆盖产品分析、财务、安全与信任团队等多条线。安全团队用其做跨云基础设施、日志的威胁检测,并让 Codex agent 通过 SQL API 查询受治理的安全数据完成"AI 辅助调查";市场团队以 Bronze-Silver-Gold 分层架构支撑10 亿周活规模的运营,消除约 40 万美元/月的存储成本,业务人员还可免写 SQL 构建人群包。Databricks 称双方工程团队实质"贴身"协作,OpenAI 的负载反过来影响 Photon、Lakehouse 存储调优等平台能力的迭代方向——这是 Databricks 目前对外展示的最大规模部署案例之一。[6]
Neon AI Gateway 接入 Databricks Foundation Model APIs,开源权重模型提速有因可循 · ai-native ⚠️ 厂商口径
被 Databricks 收购后,Neon(基于 Lakebase Postgres)的 AI Gateway 现直接调用 Databricks Foundation Model APIs 承载开源权重模型,复用其连续批处理(continuous batching)、KV-cache 分页、TensorRT-LLM 定制内核与 prompt caching 等既有推理工程积累。Databricks 披露,其 prompt caching 在 gpt-oss 批推理场景下曾使单副本输入 token 吞吐提升 2.5 倍、P50 延迟降低 3 倍(约 30% 缓存命中率下)。该栈还承载多个 MoE 模型,小批量场景下仅加载激活专家即可达到远超同尺寸稠密模型的吞吐——对以多轮工具调用为主的 coding agent 场景尤其对症,因为系统提示词与工具 schema 每轮都会重复发送。[7]
▎ 湖仓 · 开放表格式 · HTAP
Google Cloud Lakehouse 运行时目录支持 Hive Metastore 迁移,元数据"搬家不搬数据" · lakehouse
Google Cloud 为 Lakehouse 运行时目录新增对遗留 Hive Metastore 的迁移支持,同时兼容 Iceberg REST Catalog 与 Hive Catalog,允许企业把 Hive/Parquet 旧表与新的开放表格式 Iceberg 表统一注册管理,且指向 Google Cloud Storage 中的既有数据、无需重写或复制。Google 指出,Hive Metastore 常用 MySQL/PostgreSQL 作后端,在大规模 Spark 分区拉取时 CPU 利用率可能被打满,触发查询延迟或 OOM;新目录整合 Knowledge Catalog 与 Cloud IAM,把安全治理策略统一到跨引擎(Managed Spark、BigQuery、Iceberg REST 生态)的单一控制面。这呼应了开放表格式之争的另一条主线:比起争夺 Iceberg/Delta 的格式话语权,云厂商更迫切要解决的是十年积压的 Hadoop 时代元数据债务。[8]
▎ 技术 · 架构 · 性能基准
HN 高热议"PostgreSQL for Everything":一个数据库真能包打天下? · oltp
Fractional CTO Raphael Bauer 撰文回顾其自 2003 年起用 PostgreSQL 承载全文检索、时间序列(TimescaleDB 插件)等各类负载的经历,主张 Postgres 的优势来自"够老所以够稳"、可扩展的插件生态、以及本地部署低门槛三点,反对为不同职能各自引入专用系统。该文在 Hacker News 收获 427 赞、256 条评论,是本期讨论热度最高的技术话题;与同日发布的 Harper 5.2(见版本一章)形成呼应——一个主张"Postgres 插件化包打天下",一个主张"单一运行时收编数据库/缓存/任务队列",路径不同却共同指向同一诉求:减少后端系统数量、缩短数据路径。[9]
DuckDB v2.0 替换 PostgreSQL 派生解析器,换用可运行时扩展的 PEG 语法 · olap
DuckDB 团队详解 v2.0 的核心内核变更:自 2018 年首个 commit 起沿用至今的 PostgreSQL 派生解析器被整体替换为基于 PEG(Parsing Expression Grammar)的新实现。团队强调这不改变 DuckDB 自身的 SQL 方言(内部称 DuckSQL),只是替换解析器实现与文法本身——旧的 Postgres 派生文法难以演进、不便按需扩展语法糖(如 GROUP BY ALL),PEG 文法则允许运行时按需扩展。这是 DuckDB v2.0 发布后官方博客系列的又一篇内核拆解(此前已披露异步 I/O 架构等改动),体现其"大版本配套多篇内核细节文章"的一贯风格。[10]
复盘:Oracle 收购 Sun 如何意外成就了 PostgreSQL 的开源霸权 · oltp
The Register 与多家媒体回顾一段行业往事:2010 年 Oracle 收购 Sun Microsystems 后,MySQL 前途未卜的不确定性客观上把大批开发者与企业推向了彼时尚属小众的 PostgreSQL,为其此后十余年成长为最受欢迎的开源数据库埋下伏笔。Postgres 项目元老在采访中承认,这段"意外助攻"是 Postgres 生态崛起的关键节点之一——与本期"PostgreSQL for Everything"的热议放在一起看,颇有历史照进现实的意味。[11]
学界 · 研究前沿
· SINDI(arXiv 2509.08395):面向稀疏向量最大内积搜索(MIPS)的高效索引,主打多路检索场景下的稀疏向量匹配效率。[12]
· MERIT(arXiv 2607.29173):为基于图的近似最近邻(ANN)索引提供高效原地删除机制,解决动态数据集下图索引"只增不减"的老问题。[13]
· PLASMA(arXiv 2508.15436):GPU 上的图式 ANNS 基准测试平台,揭示内存布局对检索性能的显著影响,为向量检索工程优化提供量化依据。[14]
▎ 融资 · 并购 · 商业化
Graphwise|控股投资|金额未披露 · agent
图数据库厂商 Graphwise(开源产品 GraphDB 的开发方)宣布获欧洲私募股权机构 Oakley Capital 控股投资,具体金额未披露;Oakley 从 Integral Capital Group、PortoLion、Carpathian Partners 及欧洲复兴开发银行组成的原股东团手中收购多数股权。这家保加利亚公司计划借此加速全球化拓展并寻求战略并购。Graphwise 的定位是为 AI agent 提供"语义层":GraphDB 以知识图谱编码实体关系、层级与元数据,结合 GraphRAG 让大模型检索时锚定可验证的企业事实以缓解幻觉,主打金融、医疗等强监管、高审计要求的行业——这也是本期继 AlloyDB 向量检索、Databricks/OpenAI 案例之后,又一条指向"agent 需要专属数据基建"的信号。[15]
▎ 云厂商 · 生态 · 监管
Cloudera 发布 Anywhere Cloud,押注 agentic AI 时代的混合数据平台 · cloud ⚠️ 厂商发布口径
Cloudera 推出 Anywhere Cloud,定位为可独立部署、也可与既有大型数据湖协同的多云/混合基础设施平台,核心卖点是让企业在不搬迁敏感数据的前提下,直接对自有数据估计(data estate)跑 agentic AI 工作负载,并由内置的 agent copilot 自动化工作流。Cloudera 将其瞄准的问题描述为:企业在把 AI 项目推向生产时普遍受困于基础设施碎片化、升级周期长、以及数据存放地合规要求趋严——这与近期数据主权、监管趋紧的行业背景相呼应。作为经历过 Hadoop 时代起落的老牌厂商,此番转型是其向 agentic AI 基建靠拢的又一步。[16]
来源链接
[1] 〔来源〕Delta Lake | 2026-08-20 https://github.com/delta-io/delta/releases/tag/v4.4.0
[2] 〔来源〕infoq.com | 约08-19 https://www.infoq.com/news/2026/08/harper-vercel-benchmark/
[3] 〔来源〕PR Newswire | 2026-08-20 https://www.prnewswire.com/news-releases/edb-brings-postgres-proven-disaster-recovery-to-petabyte-scale-warehousepg-where-downtime-is-not-possible-302855918.html
[4] 〔7 方报道〕YugabyteDB;ClickHouse;Weaviate;Materialize;Redpanda;等 7 家 | 08-19~08-20 https://github.com/yugabyte/yugabyte-db/releases/tag/2025.2.7.0-b11 https://github.com/yugabyte/yugabyte-db/releases/tag/2025.2.6.0-b104
[5] 〔来源〕IT Brief UK | 约08-20 https://itbrief.co.uk/story/google-cloud-adds-four-level-alloydb-scann-preview
[6] 〔来源〕Databricks | 约08-20 https://www.databricks.com/customers/openai
[7] 〔来源〕Neon | 约08-20 https://neon.com/blog/open-weight-models-are-fast-on-neon-ai-gateway
[8] 〔来源〕IT Brief UK | 约08-19 https://itbrief.co.uk/story/google-cloud-adds-hive-metastore-migration-to-lakehouse
[9] 〔来源〕raphaelbauer.com:443 | 约08-19 https://www.raphaelbauer.com:443/posts/postgresql-everything/
[10] 〔来源〕DuckDB | 2026-08-20 https://duckdb.org/2026/08/20/duckdb-20-peg-parser.html
[11] 〔2 方报道〕The Register;streamlinefeed.co.ke | 约08-19 https://www.theregister.com/databases/2026/08/19/postgres-pioneer-credits-oracle-with-helping-his-database-take-over-the-world/5289087 https://streamlinefeed.co.ke/news/how-oracles-2010-sun-microsystems-acquisition-crowned-postgresql-the-open-source-database-king
[12] 〔来源〕arXiv https://arxiv.org/abs/2509.08395
[13] 〔来源〕arXiv https://arxiv.org/abs/2607.29173
[14] 〔来源〕arXiv https://arxiv.org/abs/2508.15436
[15] 〔来源〕SiliconANGLE | 2026-08-19 https://siliconangle.com/2026/08/19/graphwise-aims-to-become-the-semantic-layer-for-ai-agents-after-securing-major-investment-from-oakley-capital/
[16] 〔来源〕Techzine Global | 2026-08-19 https://www.techzine.eu/news/analytics/143722/cloudera-launches-anywhere-cloud-for-ai-on-company-owned-data/
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻