FutureX · Database

本周要点

· DuckDB 切出 v2.0-alpha 分支进入功能冻结,10 月下半月发正式版

· Snowflake 上季产品营收同比 +37%,全年指引随 AI 负载上调

· MongoDB 营收增速回升至 30%,为 FY2024 以来首次

· Snowflake 把 Read Restrictions 并入 Iceberg REST Catalog 规范

· MLPerf Storage v3.0 首次加测向量库与 KV Cache 两类场景

· AWS 实测 StarRocks 在 Graviton4 上性价比较 x86 省 34%–52%

DuckDB:被 AWS 收编的同一周,v2.0 进入功能冻结 · analytics

上周的主线(AWS 收购 DuckDB 核心团队 DuckLabs)本周落到了两处具体动作。技术侧,DuckDB 从主分支切出 v2.0-cyanoptera,标志进入功能冻结,命令行与 Python 等客户端已放出 alpha,正式版预计 10 月下半月发布;核心的 quack 协议同步从 0.x 升到 1.0,httpfs、ducklake、iceberg、spatial 等扩展一并进入 alpha。这意味着 8 月末"预览"阶段披露的可联网架构路线已进入收尾期,而非仍在探索。

战略侧,AWS 副总裁 Andy Warfield 向 The Register 解释了收购逻辑:DuckDB 本身不产生 IP 收益(维持开源与 MIT 协议),价值在于它正成为连接 Redshift、BigQuery、Fabric 等异构工具的"结缔组织层"——用 attach/connect 等 SQL 动词直连远程端点,小数据集本地跑、大数据集转交中心化引擎,他把它称作"数据的 SDK"。DuckDB Foundation 的治理结构预计随收购扩大贡献者范围,ClickHouse Labs 研究副总裁、CMU 教授 Andy Pavlo 也对交易给出正面评价。

把两条线并看:嵌入式 OLAP 在这一周完成了从"轻量单机引擎"到"跨引擎连接层"的定位切换,且已有超大云厂商为这一叙事背书。下周看点:v2.0 alpha 阶段的扩展兼容性反馈,以及 quack 1.0 的客户端-服务端吞吐是否有第三方实测。来源:DuckDB;The Register

分析型引擎:性价比战场从 SIMD 转向内存带宽与索引形态 · analytics

本周最硬的一组数字来自 AWS 对 StarRocks 存算分离架构的 arm64/x86 对比测试:在 TPC-H/TPC-DS SF1000 上,Graviton4(m8g)价格性能指数最优,同规格下比 x86 省 34%–52%,查询总耗时 149s vs 194s。测试用的是 StarRocks 官方 3.5.19 arm64 构建、尚未启用 SVE2 优化,作者据此推断此类扫描/聚合负载主要受内存带宽而非 SIMD 宽度制约。需注意该测试由 AWS 自身发布,非独立第三方。

索引形态上,可观测性数据库 GuanceDB 发布 3.1,把倒排索引与全文检索铺到所有字段类型(按字段类型与查询习惯选择性建立)。其对 Bloom 过滤器局限的拆解值得一读:块级"可能命中"判断无法定位到行,多条件低命中查询与 NOT/!=/NOT IN 等负向查询下常退化为接近全量扫描;倒排索引则让执行器直接拿到 posting list 做行级归并求交。官方称可把千亿级可观测数据的查询体验带到秒级,属厂商口径。

其余增量偏工程化:MotherDuck 上线 Read Scaling 按需分配只读计算节点缓解高并发排队(未披露扩容倍数与延迟数据);Polars 发布 2.0.0-rc.1,最大破坏性变更是把 SQL 接口默认执行引擎切到流式引擎,超内存数据集在 SQL 路径下默认可用,并复用 Iceberg sink 原生元数据提升写入性能。ClickHouse 本周只有 v26.3/26.6/26.7/26.8 系列 lts/stable 补丁,无新特性披露。来源:AWS;InfoQ;Polars

湖仓:开放表格式从"表可移植"迈向"策略可移植" · lakehouse

本周湖仓侧最有分量的一件事是规范层面的:Snowflake 工程团队提交并合并了 Apache Iceberg REST Catalog 的 Read Restrictions 扩展,把列脱敏与行级访问控制直接写进目录层。客户端加载表时,除表元数据外还会拿到按调用者身份定制的 required-row-filter 与 required-column-projections,由被信任的引擎在返回数据前统一执行——同一张表对不同用户、不同时刻可返回不同过滤指令。它针对的是"一张 Iceberg 表能被任意引擎读,精细化权限却锁死在单一引擎"这个老问题。

入湖链路也在继续收短。AWS 为 Kinesis Data Streams 新增 streaming tables,可全托管地把流数据持续落成可查询的 Iceberg 表(依托 S3 Tables),免去自建 Flink 连接器与格式转换;AWS 称相比自建方案投递成本最多降 50%、内联小文件合并令下游查询成本最多降 30%,数据自动注册进 Glue Data Catalog——均为厂商口径,未见第三方复现。同期还有一篇 Iceberg + Flink 搭建动态流式数据湖的教程博客。

落地侧,AWS 客户案例称社交数据分析公司 Tubular Labs 把 70TB 管道迁到 Iceberg + S3 Tables 后节省约 50% 工程团队产能(厂商案例口径);Starburst 则主推 Trino 查询缓存以提升湖仓分析性能,未披露加速倍数与测试口径。判断:本周湖仓的重心不在性能宣传,而在治理与摄入这两块"接缝",而治理这一步是写进公共规范、对所有引擎生效的。来源:Snowflake;AWS;Starburst

通用 DB · OLTP:Postgres 走向"像分支一样开数据库" · oltp

Neon(现属 Databricks,服务已更名 Lakebase Postgres)本周连发两篇拆解自身弹性能力。一篇披露平台上平均每个生产库每月发生 32,016 次计算规格调整,约每 81 秒一次:依托存算分离就地变配、无需搬迁数据,调度算法以 5 秒轮询跟踪 CPU 一分钟均值与两档内存频率信号,并把内存使用目标压在已分配 RAM 的 75% 以下防 OOM。

另一篇讲 scale-to-zero:闲置库几分钟无活动后自动挂起、按需秒级恢复,挂起期间只计存储不计算力。其直接后果是"为每个 PR、每个 agent 任务、每个用户开一条独立分支数据库"变得经济可行,免费层经济模型随之改变——1000 个注册用户不再等于 1000 个持续运行实例。这条线与本周 agent 主线是同一件事的两面。

格局与生态:Omdia 报告称按 2025 年收入计,OceanBase 在亚太及大洋洲分布式数据库市场排名第一,领先腾讯云 TDSQL、Google Cloud Spanner、华为云 GaussDB 与阿里云 PolarDB-X,坐标由中国单一市场扩展到区域市场(延续上月沙利文口径)。此外 pgEdge 密集更新分层存储与可观测工具链,Oracle 发文详解 OCI 上 PostgreSQL 的纵深防御方案,Yugabyte 推出全球合作伙伴计划;TiDB v8.5.7、CockroachDB v25.4.16、YugabyteDB 多个 backport 均为补丁级。来源:Neon;Omdia;Oracle Blogs

数据库 × AI:agent 负载正在变成一张可量化的账单 · db-ai

本周最具说服力的样本来自 Databricks:用内部可观测工具 Unity Gateway 对 agent 的 MCP 工具调用做端到端 tracing 后发现,agent 舰队里 7 个不起眼的工具服务器 bug 因 agent"静默重试"而非报错,每年多烧约 49.9 万美元 token 费用,外加约 1.2 万工程师小时等待成本,合计约 120 万美元/年;定位、量化到修复全过程仅用一小时。给出的经验是为 LLM 的真实使用方式设计工具,遇模糊输入时优雅降级而非直接报错。

"agent 的状态存在哪"这条产品线同样在推进:AWS 开源 strands-dynamodb-storage,为 Strands Agents SDK 提供基于 DynamoDB 的会话状态与记忆持久层;AWS 还在 DMS Schema Conversion 中引入 AI agent 编排 SQL Server 到 Aurora PostgreSQL 的转换,采用"三步确定性规则引擎 + 第四步生成式 AI 兜底"的分层设计。学界侧的 Zeta-Lite(浏览器内可分支 SQL 库)与 Git4Data(数据库原生版本控制)指向同一需求:agent 并行探索候选状态时需要 git 式分支与回滚,而非整表复制。

表态与营销要分开看:ClickHouse 联合创始人兼 CEO Aaron Katz 在播客中预计 agent 有望在 3–5 年内自主管理自身预算额度,但架构决策与预算控制权未来十年仍留在人类手中——属前瞻表态,非落地能力。MotherDuck 连发多篇 agent 驱动查询负载的内容、华为云称已围绕"agent 吃数据"重构自身数据基础设施,两者均未给出具体指标或技术细节,更接近内容营销。来源:Databricks;AWS;Tech in Asia

Text-to-SQL:修复策略从"整句重来"转向"只修错处" · db-ai

KAIST 团队提出 SafeQL:AI 生成的 SQL 报错时不再把整条语句丢回大模型重写,而是基于数据库报错信息定位并只修复缺失表/字段、连接错误、函数或取值错误等具体环节,系统内置于 PostgreSQL,仅在局部修复困难时才回调 LLM。在 Bird 基准上最多解决 87.4% 的初始执行错误,token 消耗降至最多 1/15.1,修复耗时降至最多 1/29.6;Spider 基准执行准确率 91.7%。成果将在 VLDB(波士顿)展示。

同期几篇论文补足了这条线的另一半:一篇系统评测 LLM 在多轮对话式 text-to-SQL 中应对指代歧义与意图漂移的能力,暴露自然语言查数据库的现实短板;EvoSQL 让生成器与评判器在带记忆机制下协同进化;text2ql 提出语言无关的中间表示,把自然语言转查询语言的接口从 SQL 单一目标扩展到多目标。趋势判断:这一支柱的重心正从"生成得更准"移向"错了之后怎么低成本收敛",且修复逻辑开始下沉进数据库本身。来源:디지털투데이;arXiv

向量检索:规模迈过十亿级,中立基准开始补位 · db-ai

MLCommons 发布 MLPerf Storage v3.0,新增两类测试:KV Cache(衡量 LLM 推理缓存读写)与向量数据库(基于 Milvus、百万向量、1536 维,测 QPS 与召回率/延迟权衡),并新增 S3 对象存储访问层与现有 POSIX 层并列,约六分之一提交使用了 S3 层。本轮 19 家厂商提交,DDN、Dell、华为、IBM、NetApp、VAST、WEKA 等传统存储厂商集体缺席。这是第三方标准化口径,含金量高于厂商自报。

基准数据集侧,Qdrant 联合 Hugging Face、Common Crawl、Vultr 与阿里云,基于 FineWeb(超 15 万亿 token)构建了公开向量检索基准 Fineweb-10B。分析师指出,此前在百亿向量规模上算精确 ground truth 存在巨大算力门槛,企业普遍缺乏中立方法论评测自家检索系统的真实 recall,第三方联合构建被认为比厂商自证更可信。字节跳动同期公开 UBASE 论文,披露其向量检索系统扩展到万亿级规模的工程实践。

底层则在补一致性与硬件两端:LanceDB v0.38.0 带多项 breaking change——表存在性判断改由 manifest 权威裁定(此前可能因缓存不一致误判)、Python 绑定强制 pydantic v2、分支合并更名 cherry_pick,随后 v0.39.0-beta.1 又新增 list_functions 客户端 API;论文侧一篇指出 HNSW、Vamana 等图索引看似对数级的查询复杂度在超大规模下实为幂律增长,另一篇尝试用 GPU 光线追踪核心加速高维相似度搜索。Qdrant v1.19.1、Milvus v3.0.1 为补丁版本。来源:HPCwire;TechTarget;LanceDB

财报与交易:AI 没有吞掉数据平台,但兑现节奏出现分歧 · funding

本周是财报周。Snowflake FY2027 Q2 产品营收 14.9 亿美元、同比 +37%,较上季 30% 进一步加速,管理层称约一半的增速加速来自 AI 负载;AI 产品 CoCo 账户数增至 9100 个、单季新增逾 2000 个。全年产品营收指引上调至 60.7 亿美元(+36%),non-GAAP 营业利润率指引由 13.5% 上调至 14.5%,RPO 同比 +30% 至 90 亿美元,财报后股价单日显著上涨。

MongoDB 同季营收 7.718 亿美元、同比 +30%,为 FY2024 以来首次重回 30%;Atlas 收入 5.659 亿美元(+29%),已连续 5 个季度维持相近增速,RPO 同比 +91% 至 15.192 亿美元。但管理层表示 AI 对 Atlas 收入的直接贡献仍处早期(Voyage AI 客户数连续两季环比近翻倍,主要作为获客入口),股价盘后一度跌约 14%。两份财报合看:AI 对数据平台是增量而非替代,分歧只在兑现为收入的时间表。

交易侧两笔,都不在数据库产品本身。Deloitte 收购 Databricks 生态头部咨询伙伴 Wavicle Data Solutions 的主要业务资产(金额未披露),强化其企业级"编排方"地位;慕尼黑的 Zeit AI 完成 500 万欧元种子轮,由 Y Combinator、牛津大学种子基金、Sequoia Scout Fund、ACE Ventures 与 Hasso Plattner VC 投资,产品定位面向中间市场的"自治数据工程师"。Databricks 另推出 Brickbuilder 合作伙伴四级体系,与 Yugabyte 的全球伙伴计划一道,构成本周三起生态渠道动作。

下周看点:DuckDB v2.0 正式版进入发布倒计时;Iceberg REST Catalog 的 Read Restrictions 扩展能否被 Trino、Spark 等引擎跟进实现;以及 MLPerf Storage v3.0 缺席厂商是否在下一轮补交向量库结果。来源:Reuters;Bloomberg;EU-Startups;PR Newswire

FutureX · 记录未来如何发生

素材来源多方媒体/网络新闻