━━━━━ 正文从此处全选复制 ━━━━━
FutureX · Database
本期要点
· ClickHouse 董事会迎来前 Snowflake CFO
· PlanetScale 发布 Tin,Postgres 全文检索 GA
· SurrealDB 完成 2300万美元 A轮,发布 3.0
· 星环科技港交所挂牌,GPU数据库称提速 26倍
· Databricks Genie One MCP 转正式GA
· 向量检索定型为数据类型,成本定律未变
▎ 版本与产品发布
PlanetScale 推出 Tin,让 Postgres 也能做好全文检索 · oltp ⚠️ 厂商基准
Tin(全称 Text INdex)已经以 GA 版本面向所有 Postgres 与 Neki 数据库用户开放,目标是解决现有三套 Postgres 文本检索方案在并发更新、复杂过滤和事务可见性上存在的不足。为验证效果,PlanetScale 使用了 Wikipedia 全量数据、2.3TB 的 Reddit 评论,以及包含 85GB、1.5亿份文档的 Stack Exchange 语料库来做基准测试,测试环境限定在 8 vCPU、32GB 内存的容器中,重点考察连接查询、复合 WHERE 条件以及实时更新的可见性表现;不过这些测试方法和结果都是厂商自行完成并对外公布的,尚未经第三方核实。这篇发布文章在 HN 上获得了 228 个赞和 98 条评论,可见社区对 Postgres 全文检索能力的需求一直很旺盛。[1]
Weaviate 发布 v1.39.6,修复 LSM 存储与 HNSW ACORN 索引问题 · vector
这是一个纯补丁版本,没有引入破坏性变更或新特性。重点集中在优化 LSM 存储层的性能,并修复了 HNSW ACORN、HFresh 索引方面的若干问题。此外,团队把 WEAVIATE_LICENSE 环境变量替换成了 LICENSE_KEY(以及 LICENSE_KEY_FILE)的校验方式,这属于对许可证管理机制的一次收敛调整。[2]
dbt v2 正式内置 DuckDB,并随 Rust Fusion 引擎一同发布 · olap
dbt v2 是第一个把 DuckDB 适配器直接内置进来的 dbt 版本,它运行在全新的 Rust Fusion 引擎之上。此前 dbt-duckdb 一直是一个独立维护的 Python 包,已经积累了 1.4k 个 GitHub star,社区也长期呼吁官方能把它正式收编。到了 v2 版本,这个适配器改为通过 ADBC 驱动接入 Rust monorepo,用户装好 dbt 之后驱动会自动下载并缓存,同时还新增了对 DuckLake、Iceberg catalog 的支持,使得用户可以直接用 DuckDB 来查询 dbt 的 Parquet 元数据。dbt 2.0.0 已经在 9 月 14 日正式发布,团队也借此机会把 CLI 的品牌名从原来的 Fusion/dbt-core 改成了 dbt(专有版)和 dbt-oss(开源版)两个名字。[3]
Tiger Data 为 Google Cloud 的 PostgreSQL 服务加入原生全文检索 · oltp
Tiger Data(也就是 TimescaleDB 的母公司)把全文检索能力原生集成进了 Google Cloud 旗下的 PostgreSQL 服务,用户从此不必再额外接入外部搜索引擎、也省去了相应的运维负担。这一动作与 PlanetScale 的 Tin 几乎同时出现,说明两家云端 Postgres 厂商不约而同地把补齐文本检索这块长期存在的短板作为了发力点。[4]
其他版本动态:ClickHouse 发布 v26.9.2.8-stable、v26.9.1.1629-stable 两个补丁版本 [5];YugabyteDB 推送 2.31.0.0 系列补丁,含 FIPS 版 otel collector 与索引 backfill 修复 [6];RisingWave 发布 v3.1.0 [7];TiDB 同期连发 v8.5.2 至 v8.5.7 六个补丁版本 [8]。
▎ 数据库 × AI
独立向量数据库时代落幕,检索能力已变成数据类型,但成本规律没有改变 · vector
据 The Next Platform 分析,独立向量数据库这一品类基本上已经走到了尽头:Postgres、Elasticsearch、OpenSearch、ClickHouse、MongoDB、Redis 这些主流数据库引擎,如今都已经把近似最近邻检索(ANN)做成了内置的列类型,因此"是否需要单独部署一个向量数据库"这个问题实际上已经有了自然的答案。具体来看,pgvector 从 2023 年 8 月的 0.5.0 版本起就支持了 HNSW,MongoDB Atlas Vector Search 在 2023 年底实现了 GA,而 ClickHouse 的 HNSW 向量索引也在 25.8 版本中转为正式功能——HNSW 几乎已经成为整个行业公认的底层算法,原因在于它是目前唯一能在不重建索引的情况下依然拿到 95% 以上召回率的方案。文章同时强调,架构上的这种收敛并没有改变背后的成本结构:账单最终仍取决于每个向量占用多少字节、压缩策略有多激进,以及向量在什么时候会被挤出内存。HNSW 构建的图必须常驻内存才能保证低延迟,一旦溢出到磁盘,延迟就会被页错误主导,这一点跟究竟选用哪家厂商的向量库并没有关系。[9]
Databricks 的 Genie One MCP 服务转为正式 GA · agent
Genie One MCP 服务器现已面向全体 Databricks 用户开放,任何 AI agent(包括 Claude、ChatGPT、Cursor 等客户端在内)都可以通过 MCP 协议,把 Genie One 当成一个对等的 agent 来调用,从而统一获得结构化与非结构化数据的问答结果、查询结果以及可视化呈现,这背后依靠的是 Genie Ontology 所提供的治理化业务语义。该服务如今已经纳入 Unity Gateway,作为一项托管的 MCP Service 来运行,具备集中治理、细粒度的策略控制以及全链路审计能力,目的是解决多个 agent 各自理解业务语义、导致答案互相矛盾这一"agent 蔓延"的问题。[10]
Snowflake 推出面向 AI agent 的 Agent Observability 功能 · agent
这项新功能面向在 Snowflake 上构建的 AI agent,从性能、质量和成本三个维度提供可观测能力,延续了 Snowflake 把可观测性产品线向 agent 工作负载方向延伸的思路。[11]
Pinecone 开源向量量化基准框架 VQ-Bench · vector
VQ-Bench 针对乘积量化、标量量化等向量压缩方法提供了一套标准化的评测体系,便于社区在压缩率与召回率之间做出可以互相比较的权衡分析,这也呼应了向量检索行业当下对"内存和压缩即等于成本"这一共识的关注。[12]
MotherDuck 上线 AI 文本分类功能 · ai-native ⚠️ 厂商口径
MotherDuck 为其托管的 DuckDB 服务新增了一项 AI 文本分类能力,号称成本低、速度快,用户可以直接在 SQL 语句内对文本列进行分类打标,这是把大模型能力下沉到查询引擎内部的又一个例子;不过具体的性能和成本数字目前尚未经过第三方验证。[13]
▎ 技术 · 架构 · 性能基准
Neon Functions 补上了自定义域名和定时触发能力 · cloud
就在 9 月 18 日 Neon 宣布其后端(涵盖 Postgres、存储和 Auth)面向 agent 场景全面 GA 之后,本周 Neon Functions 又新增了三项能力:一是支持自定义域名(此前用户只能使用形如 br-xxx-api.compute... 这样的默认调用地址);二是可以按 schedule 进行定时执行(此前仅支持 HTTP 方式触发);三是新增了文件上传后自动触发 Postgres 任务的事件驱动模式。这三项功能共同指向同一个方向,就是让 Postgres 变成一个可以被 agent 或应用事件直接驱动的无服务器后端。[14]
性能 · 基准
· NVIDIA 宣称新一代 Vera CPU 在数据库基准测试中,用更少的核心数就跑出了比 Intel Xeon 6 快 48% 的查询性能⚠️ 厂商基准,但测试方和具体口径均未披露,也没有经过第三方审计。[15]
· Phoronix 的独立测试表明,Linux 内核方面的改进让 AMD EPYC 服务器在 2026 年整体性能的几何平均值提升了约 8%,这对数据库等 IO 和计算密集型负载也会带来连带的增益。[16]
· 由 MLCommons 提交的 MLPerf Inference v6.1 结果显示,单加速器的性能相比上一代提升了 5.7 倍,这次评测首次纳入了 512 GPU 规模集群以及 Vera Rubin 架构的同行评审结果,反映出 AI 负载对存储和数据管道的压力还在持续上升。[17]
学界 · 研究前沿
· Graph Memory for LLM Agents: At What Cost?(arXiv 2609.23315):这篇论文系统对比了多款图数据库引擎在 agent 记忆场景下的查询、写入与更新性能,检验了"处理连接型数据就必须使用图数据库"这一常见假设是否真的成立。[18]
· Which Part of the Context Layer Does the Work?(arXiv 2609.22259):作者拆解了 Text-to-SQL agent 所依赖的上下文层,试图分离出哪些部分真正贡献了准确率的提升,哪些部分只是起到检索脚手架的作用。[19]
· Exploiting Residual Reachability for Cross-Model Migration of Graph-Based Indexes(arXiv 2609.23036):论文提出了一种在不同模型之间迁移图式 ANN 索引的方法,由此降低模型更新后重新构建向量索引所需的成本。[20]
· Efficient Dense Vector Search within Knowledge Graph Content Embeddings(arXiv 2609.24236):这项研究针对知识图谱内容嵌入场景优化了稠密向量检索,服务于由图谱驱动的检索增强类应用。[21]
▎ 融资 · 并购 · 商业化
SurrealDB|A轮|2300万美元 · oltp
多模型数据库厂商 SurrealDB 宣布完成 2300万美元 的 A 轮融资,并同步推出了 3.0 版本。由于原文全文抓取失败,领投方以及 3.0 版本的具体新特性目前都无法核实,本条内容仅根据摘要标题写成。[22]
星环科技完成港交所挂牌,GPU原生数据库对标"中国版Databricks" · ai-native ⚠️ 招股书口径
星环科技(06727.HK / 688031.SH)在 9 月 21 日登陆港交所主板,上市首日就被纳入了港交所通。公司 2025 年的收入同比增长了 20.6%,达到 4.47亿元,归母净亏损同比收窄了约 28.6%;到 2026 年上半年,主营收入为 1.74亿元,同比增长 14.1%,净亏损进一步收窄约 21%。据弗若斯特沙利文的数据,按 2025 年收入计算,公司在中国 AI 基础设施软件市场排名第五,是其中规模最大的独立厂商。公司的第二增长曲线是今年 7 月在 WAIC 上首次亮相的 GPU 原生认知数据库,招股书披露该产品在 150GB TPC-DS 基准测试中比 CPU 实例提速 26 倍,投资回报率达到 5.9 倍——不过这些数据来自公司招股书的自我测试,尚未经过第三方审计。公司表示 2026 年将聚焦于打造标杆客户,到 2027 年再考虑规模化放量。[23]
▎ 云厂商 · 生态 · 监管
前 Snowflake CFO Scarpelli 出任 ClickHouse 董事 · cloud
Michael Scarpelli 此前先后担任过 Snowflake、ServiceNow、Data Domain 三家公司的 CFO,并带领这三家公司都完成了 IPO,如今他以独立董事的身份加入 ClickHouse 董事会,并出任审计委员会主席。据 ClickHouse 官方披露,公司的年化收入已经突破了 3.5亿美元(相比 2025 年底约 2亿美元的水平有了大幅增长),客户数量超过 4000 家,其中包括 DoorDash、Ramp、Meta、Tesla、Cisco、Visa 等知名企业。今年早些时候,公司还以 150亿美元的估值完成了 D 轮融资,参投方包括 J.P. Morgan Private Capital、BDT & MSD Partners、Craft Ventures、20VC 等机构;目前员工人数已接近 800 人,业务覆盖 27 个国家,公司计划到今年年底把员工规模扩大到 1000 人,其中超过一半的收入来自美国以外的市场。CEO Aaron Katz 表示,引入 Scarpelli 的目的是在保持开发者优先这一心智的同时,搭建起一套面向企业级客户的商业化体系,市场则普遍解读为 ClickHouse 正在为未来可能的 IPO 做铺垫。[24]
Percona 新增对 CloudNativePG 的支持 · cloud
Percona 为旗下的 PostgreSQL on Kubernetes 方案新增了对 CloudNativePG 算子的支持,这样一来,用户在 K8s 上部署 PostgreSQL 时就多了一种算子可选,该支持与公司原有的 Percona Operator for PostgreSQL 并行提供。[25]
国产数据库动向:达梦聚焦一体机,OceanBase 展示 AI 实践
在业内普遍认为行业正进入洗牌周期的背景下,达梦数据把 AI 与软硬一体机确定为自己的主攻方向;与此同时,OceanBase 披露了其与蚂蚁"灵光"应用在数据架构层面的合作细节,并称自己在一份国际"Data Agent"榜单上登顶——不过该榜单的来源与评测方法都没有公开,这一说法仅供参考(相关的市占率进展此前已有报道)。整体来看,国产数据库市场围绕 AI 化的竞争仍在持续升温,一体机路线(以达梦为代表)和云原生分布式路线(以 OceanBase 为代表)这两条叙事正在同步推进。[26]
文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻