FutureX · Database

本周要点

· 阿里云称 RDS PostgreSQL 新增实例约 80% 由 Agent 创建,Google 同周推出面向 agent 的隔离节点

· ClickHouse 引入前 Snowflake CFO,Elastic 与 Snowflake 同周从两侧进入实时分析

· 全文检索回到库内:PlanetScale Tin GA,SereneDB 把倒排索引放到 S3 上

· Pinterest 量化后服务成本降 20%-30%,向量检索的成本仍取决于内存

▎ agent 成为 Postgres 的主要调用方,厂商的做法从接入转向隔离和治理

阿里云数据库负责人在云栖大会上称,过去一年 RDS PostgreSQL 新增实例环比增长 400%+,其中约 80% 由 Agent 创建、约 50% 的输入输出流量由 Agent 驱动。这组数字是阿里云自报,没有第三方数据。同一天,Google Cloud 预览了 AlloyDB 的「agent 节点」:数秒内拉起只读节点,直接从 Colossus 存储读生产数据,计算、网络和存储路径都与主集群分开,用完计算缩到零、按秒计费。

两件事对得上:阿里云描述的是 agent 已经成为 Postgres 的主要调用方,Google 处理的是 agent 突发查询挤占线上交易的问题。AlloyDB 的做法和传统 read replica 不同,节点不需要预先配置,按需创建、用完即弃。9 月 20 日那期列出的是「agent 该配什么库」的三种互斥答案,这一周厂商讨论的重心换成了怎样把 agent 负载和生产库隔开。

治理层也在往前走。Databricks Genie One MCP 转为 GA,任何 agent 客户端都能通过 MCP 调用它,业务语义由 Genie Ontology 统一提供,想解决的是多个 agent 各自理解口径、答案互相矛盾的问题。Neon 这周给 Functions 补上了自定义域名、定时触发和文件上传触发,并披露并入的 Electric 团队将负责 realtime 同步,不过后者还只是路线图,没有时间表。

Lakebase 这条线又多了一家:阿里云发布 ApsaraLakebase,以对象存储作为单一数据源,支持 Lance、Iceberg、Paimon,称为昆仑万维支撑了 300 万+ 个 Agent 工作空间。随同发布的 Agent Context 宣称 token 效率提升 3 倍以上,也是厂商口径。

来源:搜狐网(云栖报道)、Techgenyz、Databricks、Neon

▎ ClickHouse 为上市做准备,竞争对手从搜索和数仓两侧同时逼近

ClickHouse 任命 Michael Scarpelli 为独立董事兼审计委员会主席。他曾先后带领 Snowflake、ServiceNow 和 Data Domain 完成 IPO。公司同时披露:年化收入突破 3.5 亿美元(2025 年底约 2 亿美元)、客户 4000 余家,今年早些时候完成的 D 轮估值 150 亿美元。这些都是公司自报的 ARR 口径,不是审计后的收入。

竞争在同一周变得具体。Elastic 在投资者电话会上介绍了它的指标平台:在 Elasticsearch 里加了专门的 column store,宣称比 ClickHouse 快 8 倍、比 Prometheus/Mimir 快 30 倍,并称基准和代码已在 GitHub 开源。这个数字是 Elastic 自己测的,还没有第三方复现。它的切入点是高基数指标,也就是 ClickHouse 系在可观测性领域的核心场景。

Snowflake 则从数仓一侧补齐 Interactive Analytics:新增 Terraform 资源(预览),dbt-fusion v2.0.0 原生支持 interactive_table 物化(beta),并针对子串 LIKE 这类无法做分区剪枝的谓词减少无效扫描。这几项都是在补低延迟交互查询的工具链,对标的正是实时分析引擎。同周 Apache Druid 38.0.0-rc1、Doris 4.1.4.1-rc01 也进入候选版阶段。

来源:citybiz、Yahoo Finance、TradingView、Snowflake

▎ 全文检索和分析的边界从两头被打穿

PlanetScale 发布的 Tin 以 GA 状态向其全部 Postgres 与 Neki 数据库开放,针对的是 Postgres 现有文本检索方案在并发更新、复杂过滤和事务可见性上的短板。它的基准数据是厂商自测的。Tiger Data 同周为 Google Cloud 的 PostgreSQL 服务加上了原生全文检索。两家云 Postgres 厂商都在把「另接一套搜索引擎」的需求收回到库内。

SereneDB 走的是另一条路。它开源的 Krummelanke(Apache 2.0)直接在 S3 上建倒排索引,不再像 Lucene 系那样先把数据复制到本地闪存。「纳秒级搜索」「全球最快」都是它的自述。反过来,Elastic 把列存塞进搜索引擎去跑指标。一边是数据库在补搜索,一边是搜索引擎在做分析,这周两个方向同时出现了。

来源:PlanetScale、HPCwire、Blocks & Files、TradingView

▎ 向量检索已成标配,账单仍由压缩和内存决定

The Next Platform 的判断是,Postgres、ClickHouse、MongoDB 等主流引擎都已把 ANN 做成内建类型,但成本仍由每个向量占多少字节、压得多狠、HNSW 图能否常驻内存决定。Pinterest 同周公开的 Manas 数据正好给这条规律提供了一份生产侧样本:1 亿条数据的离线测试中,HNSW 基线 121 GB,加标量量化后降到 50 GB,召回率只从 93.72% 降到 92.92%;乘积量化能压到 32 GB,但召回率跌到 77.25%。上线后生产服务成本降 20%-30%。这是 Pinterest 自家的工程数据。

独立向量库这周的动作也落在这两点上。Pinecone 开源了量化基准 VQ-Bench,并把 BYOC 扩展到 AWS / Azure / GCP:数据面留在客户自己的云账号里,Toyota Motor North America 是首批生产用户。这对 Pinecone 属于补课,Weaviate、Qdrant、Milvus 本来就能自托管。

来源:The Next Platform、InfoQ-CN、Blocks & Files、Unite.AI

▎ 短讯

OceanBase:9 月 23 日报道的「Data Agent 榜单登顶」,这周查明是 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 推出的 DAB 基准。准确率 90.62% 来自 OceanBase 自己的提交,方案基于 GLM-5.2,衡量的是「模型 + agent + 数据系统」的组合,不是数据库引擎本身。

dbt v2 首次内置 DuckDB 适配器,经 ADBC 接入 Rust Fusion 引擎,并支持 DuckLake 和 Iceberg catalog。

SurrealDB 完成 2300 万美元 A 轮融资,同时发布 3.0;领投方与新特性尚未核实。星环科技 9 月 21 日在港股挂牌,招股书称其 GPU 原生数据库在 150GB TPC-DS 上较 CPU 提速 26 倍,为公司自测。

上期看点回看

· 已发生|PostgreSQL 19 Beta 4 于 9 月 24 日如期发布。官方称 RC 计划在 10 月上旬,GA 也可能在 10 月。

· 有进展|Apache Iceberg 1.12.0 已从 rc0 推进到 rc2,正式版还没发。

· 待到期|Iceberg 正式特性清单是否包含 Read Restrictions,要等正式版发布才能判断。

· 未见更新|Weaviate 本周只发了 v1.39.6、v1.39.7 两个补丁,v1.40.0 仍停在 rc 阶段,RQ-4 量化与可删向量索引还不能用于生产。

· 待到期|Rubrik Iceberg Protection 9 月内 GA 与目录覆盖范围:本周语料里没有相关消息,9 月尚未结束。

· 待到期|DuckDB v2.0 正式版:10 月下半月。

下周看点

· PostgreSQL 19 RC 是否在 10 月上旬发布,同时看能否定下 GA 日期。

· Apache Iceberg 1.12.0-rc2 投票是否通过,以及正式版是否带 Read Restrictions。

· 是否有第三方用 Elastic 开源的基准复现「比 ClickHouse 快 8 倍」,或者 ClickHouse 方面给出回应数据。

· Weaviate v1.40.0 由 rc 转为正式版(上期看点,未到期)。

· Rubrik Iceberg Protection:9 月内 GA,目录覆盖是否超出 Glue 与 S3 Tables(上期看点,未到期)。

· DuckDB v2.0 正式版:10 月下半月(上期看点,未到期)。

FutureX · 记录未来如何发生

素材来源多方媒体/网络新闻