━━━━━ 正文从此处全选复制 ━━━━━
FutureX · Database
本期要点
· PostgreSQL 19 撤回 SQL/PGQ 图查询支持,社区忧留后患
· Weaviate RC 版功能冻结,新增 RQ-4 量化与可删向量索引
· Keewano 获1200万美元融资,发布 AI agent 原生数据库
· LanceDB v0.39.0-beta.9 两项破坏性更新同日上线
· Zilliz 预览 Vector Lakebase,向量数据接入 S3 数据湖
· Imply Lumi Loglake 正式 GA,安全日志数据湖秒级可搜
▎ 版本与产品发布
PostgreSQL 19 撤回 SQL/PGQ 图查询支持 · oltp
原本打算跟着 v19 一起落地的 SQL/PGQ(也就是2023年被纳入 SQL 标准的那套图查询语法,全称 SQL Property Graph Queries)现在被 PostgreSQL 的开发者们撤下来了,原因是里面还有一些 bug 没解决干净;至于 v19 的第四个 beta,则定在了9月24日发布,但正式版什么时候出,目前谁也说不准。这个消息其实跟9月初那波"PG19 会带上 SQL/PGQ、9到10月转正式版"的报道正好唱反调。资深贡献者 Tom Lane 在邮件列表里说得挺直接:要是真在 v19 里把图查询发出去,"肯定会冒出一堆发布后才被发现的 bug,而且非得拖到 v20 才能修"。EDB 那边,软件工程高级副总裁 Tom Kincaid 也证实了这事——PGQ 确定进不了 PostgreSQL 19,用他的话说,"社区想先把更多问题理顺再说"。倒是有一样东西在同期确认会留在 v19 里,就是 REPACK 命令新加的 CONCURRENTLY 选项:以前用 VACUUM FULL 回收表空间的时候,得从头到尾锁住整张表不让别人动,这也是运维半夜被告警吵醒的常见原因之一;新选项则只在最后切换表或索引文件的那一刻短暂上锁,其他时间该读读该写写,不影响业务。[1]
其他版本动态:ClickHouse 一周之内一口气放出了六个 LTS 和 stable 补丁版本 [2];TiDB 更新到了 v8.5.4 [3];YugabyteDB 那边好几条补丁分支都在密集推进 [4];RisingWave 出到 v3.0.4 [5];Apache Doris 也发了个补丁版 4.1.4 [6]。
▎ 数据库 × AI
Weaviate v1.40.0-rc.0 功能冻结 · vector
这是 v1.40.0 迎来的第一个 release candidate,也就是说功能已经定死、beta 测试也跑完了,接下来的 RC 版只管修 bug,等最后一个 RC 通过就直接转正式版。这次主要动了三处:一是 Alter Schema,现在可以直接删掉某个向量索引而不用把整个 collection 重建一遍;二是加进了一条结合 MUVERA(一种把多向量嵌入压缩成定长表示、从而加速检索的算法)的 HFresh 检索路径;三是标量量化里多了个 RQ-4 档位,在原有的量化梯度基础上给出更狠的压缩比,好让向量索引少占点内存。[7]
LanceDB v0.39.0-beta.9 两项破坏性更新 · vector
这版上线了持久化的 OAuth 令牌缓存和会话管理 API——以前每次建连接都得重新走一遍鉴权流程,现在不用了;remote 模式这边也新增了物化视图(materialized view)API,可以让托管服务端提前把视图结果算好、缓存起来,省掉重复查询的开销。这两处改动都被标成了 Breaking Changes,升级的话客户端的连接代码和视图管理代码都得跟着调整。beta.9 延续的是这个系列从 beta.7、beta.8 一路走来的密集迭代节奏,同一批还顺带修了 rustls 依赖版本冲突、以及 Node 端 optimize 清理时时间戳会丢失的问题。[8]
Keewano 融资1200万美元,发布 AI agent 原生数据库 · agent ⚠️ 厂商口径
总部在特拉维夫的创业公司 Keewano(法定主体叫 Sandstorm Ltd.)刚拿到1200万美元融资,投资方里有 Hetz Ventures,还有 a16z 旗下的 Speedrun;同时他们也把自家产品 KeewanoDB 发布了出来,这是一款走"事件式"路线的数据库——围绕客户、设备、交易这些实体,把相关事件按发生的先后顺序组织起来,这样 agent 想查一个实体的完整历史,既不用先把数据拍平成表,也不用干等新一轮 ETL 抽取跑完。联合创始人兼 CEO Mark Kardashov 提到,团队之前在给游戏行业搭 agent 的过程中发现,传统的表结构数据库根本不是为 agent 那种长序列行为推理设计的——用他的话讲,"我们没有 ETL,没有 pipeline,也没有 lake"。从架构上看,这是一套跑在 Docker/Kubernetes 之上的分布式多分片系统,靠的是 CPU 向量化指令而不是 GPU,每条事件在 SSD 上大概只占4字节;公司方面宣称能在半秒之内查完约2.5亿条事件,还说客户从 Snowflake、BigQuery 迁过来之后 token 成本能降低大约84%——不过这两个数字都是厂商自己给的口径,还没经过第三方核实。KeewanoDB 支持 Parquet 和 Apache Iceberg 格式,也能通过 Kafka 接入事件流,它的定位是跟 Snowflake 这类现有分析库并存,而不是取而代之,计费方式是按活跃实体数算,不是按事件数。[9]
Zilliz 预览 Vector Lakebase,向量数据接入 S3 · vector
向量数据库厂商 Zilliz 从今年5月起就开放了 Vector Lakebase 的公有云预览,思路是把向量数据直接放进 Amazon S3 这类对象存储里,这跟 Databricks 今年2月 GA 的 Lakebase Postgres 那条路线(详见本文"湖仓"一章)算是不谋而合。这套服务底子是今年7月发布的 Milvus 3.0,它原生就支持数据湖存储,检索索引直接建在湖上的文件之上,不用另外存一份副本;不过访问云对象存储天然要比本地磁盘慢,所以 Zilliz 又加了个 Loon 存储引擎,专门优化 S3 上的数据布局,好让单次查询少读点数据。[10]
更多动态:Weaviate 同期还发了三个补丁版本,v1.39.5、v1.38.15、v1.37.17,里面包含了 node 级查询准入控制之类的改动 [11];Milvus 的主库和 pkg 库也一起同步升级到了 2.6.24 [12];LanceDB 这边 beta.8、beta.7 也相继上线,分别带来了 blob v2、CRUD 路由等改动 [13]。
▎ 湖仓 · 开放表格式 · HTAP
"Lakebase"概念扩散:Databricks 领跑,两家已落地 · lakehouse
继2020年末火起来的"数据湖仓"(lakehouse,说的是数据湖和数仓的融合)之后,行业里又开始流行一个新词——"lakebase",意思是把数据库和数据湖再组合一遍,正逐渐成为厂商们新一轮的叙事重点。Databricks 今年2月抢先把 Lakebase Postgres 做到了 GA:这是一款基于 PostgreSQL 的事务型数据库,数据不放在传统磁盘上,而是存进成本更低的云对象存储和开放文件格式里,这样一来操作型数据和分析型数据就能在同一个 Databricks 环境里共处了。这套技术其实是从 Databricks 2025年收购的 Neon 那儿来的:计算和存储被拆开,无状态的引擎可以秒级启动、随时扩容缩容、闲下来就把计算停掉,而且还能几乎瞬间复制出一整个数据库的工作副本。行业分析人士指出,lakebase 最核心的卖点,就是消除掉事务系统和分析仓库之间长期存在的那套 ETL 管道负担。[14]
Imply Lumi Loglake 正式 GA · lakehouse
Druid 的母公司 Imply 宣布,它家的日志数据湖产品 Lumi Loglake 已经可以正式使用了——安全日志放在数据湖里就能直接检索,不用再迁移到独立的日志系统去,这样安全运维团队既能享受湖仓那种低成本存储,又能保住实时可检索的能力,两头都不耽误。[15]
Singdata 湖仓 SaaS 覆盖8大云、3种 CPU 架构 · lakehouse
Singdata 宣布,他们那套全托管的湖仓 SaaS 服务如今已经覆盖了全球8家云厂商、3种 CPU 架构,主打的卖点是让客户想换云厂商就能换,不被单独哪一家云锁死,也就是他们说的"多云数据自由"。[16]
Snowflake 推出 Zero-Copy Interactive · lakehouse
这项新功能是给已有的表提供低延迟的交互式分析能力,卖点是不用额外复制一份数据,就能拿到接近实时的查询体验,跟湖仓一体那套"消除数据搬运"的行业说法算是一脉相承。[17]
▎ 技术 · 架构 · 性能基准
独立开发者6天搭出"每租户一库"架构 · oltp
做分析类聊天产品 LuBot 的独立开发者 Lubo Bali,一个人就把整套系统搭了起来:借助 Neon 的可编程分支能力,每来一个付费客户,下单那一刻就自动给他开一个独立隔离的 Postgres 库,不再走传统那种"大家共用一张表、靠行级权限做隔离"的多租户方案。整套东西6天就搞定了,而按他自己估计,要是走传统 Postgres 多租户基建的老路,怎么也得花上"一个季度"。架构上分工挺清楚:Supabase 管理层这块,Neon 管租户数据层这块,所有数据库操作都统一从一个函数走,应用代码本身根本不用碰连接串,也不用管该选哪个分支。计费的关键在于 Neon 那套 serverless 计算模型:每个租户实例最低只占0.25 CU,突发的时候上限也就4 CU,闲置满300秒就自动挂起、之后只按存储收费——原本一个闲置租户一个月大概要花20美元,这么一来几乎就等于白送了。生产环境走的是 Neon 的 PgBouncer 事务级连接池,单个库最多能接1万个客户端连接。[18]
Show HN:eterDB 给 Postgres 加事务级"撤销" · oltp
这条 HN 帖子拿到了46个赞、20条评论。eterDB 是一个 Postgres 分支,它想解决的是点对点恢复(PITR)不够用的那个场景:PITR 靠的是基础备份加上归档 WAL 重放,能把整张被误删的表找回来没问题,但要是只想撤销"一笔坏事务"、又不想动到之后四十分钟里其他正常的订单和支付记录,PITR 就无能为力了。eterDB 的做法是在存储层追踪行版本和读依赖,这样就能只回滚那笔坏事务牵涉到的行——顺带把后面那些读过这个坏值、又把自己的结论写进去的事务也一起滚回去,其余数据完全不受影响,就算是被误删的列和它的历史值也能找回来。引擎本体和 eter CLI 工具都用 Apache 2.0 协议开源了出来。[19]
用 Postgres 自建持久化工作流,不依赖外部编排器 · oltp
InfoQ 上有篇技术文章在讨论,能不能只靠 PostgreSQL 原生的事务和锁机制来实现持久化工作流编排,从而甩掉像 Temporal 这样独立的编排系统——这也算是呼应了最近"数据库把越来越多传统中间件的活儿都揽进来自己干"这股架构趋势。[20]
学界 · 研究前沿
· COMPASS: Steering Distributed Vector Search with Scientific Knowledge Graphs(arXiv 2609.13452):向量数据库一般靠哈希把数据切成分布式的分片,这篇论文提出改用科学知识图谱来指导分片的方式,从而把检索质量提上去。[21]
· Fast Label-Filtering Approximate Nearest Neighbor Search via Progressive Label Set Stratification(arXiv 2609.15058):针对多租户场景里常见的"先按标签过滤、再做检索"这种需求,论文提出了一套渐进式的标签集分层方法,能让带标签过滤的 ANN 检索跑得更快。[22]
· EvoOntology: A Self-Evolving Ontology Layer for Data Agents(arXiv 2609.15779):面对那些靠自然语言指令来处理表格等各种异构数据的"数据 agent",这篇论文提出了一个能随任务不断自我演化的本体层。[23]
· The Stochastic Deputy: Structural Tenant Isolation for Tool-Using LLM Agents(arXiv 2609.14780):多租户的工具系统通常靠校验调用方带来的租户 ID 来做隔离,这篇论文指出这套办法在结构上存在漏洞,并针对会调用工具的 LLM agent 提出了更牢靠的隔离方案。[24]
▎ 融资 · 并购 · 商业化
第三方估算:Weaviate 2024年 ARR 约1230万美元 · vector ⚠️ 第三方估算
数据平台 GetLatka 给出了个估算,说向量数据库厂商 Weaviate 2024年的 ARR 大概在1230万美元左右,不过这个数字 Weaviate 官方并没有确认过,可以拿来当作同类 AI 原生数据基建公司商业化规模的一个参考量级看看。[25]
▎ 云厂商 · 生态 · 监管
Cloudera 获 IDC MarketScape"领导者"评级 · cloud
在 IDC MarketScape 发布的《2026年全球数据智能平台软件》评估报告里,Cloudera 被列进了"领导者"(Leader)象限。[26]
电科金仓入选首批国家新兴产业示范基地
国产数据库厂商电科金仓(也就是人大金仓)进了首批国家新兴产业发展示范基地创建对象的公示名单,这对国产数据库厂商来说算是拿到了一份产业政策层面的认可。[27]
沙特 SDAIA:逾500个政府系统已接入国家数据湖 · cloud
沙特数据与人工智能局(SDAIA)在利雅得的生物科技峰会上透露,目前已经有超过500个政府系统接入了他们的国家数据湖(National Data Lake)。[28]
文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻