FutureX · 记录未来如何发生
数据库行业 周报 · 第 9 期 · 2026.08.23 · 过去 7 天 8/18–8/21
本周要点
· DuckDB 一周连发三篇内核拆解,v2.0 今秋带服务器模式落地
· 官方基准称异步 I/O 让远程 CSV 查询提速近 20 倍
· 向量检索继续下沉主库,AlloyDB ScaNN 称可撑 百亿级 向量
· 腾讯 SuperSQL 宣称刷新 TPC-DS 100TB 纪录,为前纪录 10 倍
· Databricks 首度详解 OpenAI 数据底座,月省 40 万美元 存储
· Wiz 的 AI 红队 5 天 攻破 Copilot Autofix 埋下的 Snowflake 漏洞
DuckDB v2.0 三连发:从"进程内分析库"转向服务器 · analytics
本周最连贯的一条脉络来自 DuckDB。周一官方预告 v2.0(代号 Cyanoptera)今秋发布,自 3 月 v1.5 以来已累积超 1 万次提交:preview 阶段的 quack 扩展转正为稳定的客户端/服务器模式,任意进程可经新的 CONNECT 语句被远程挂载查询,下推优化器可把 SQL 直接转发给 PostgreSQL、MySQL。团队的说法是,完整 MVCC 与事务隔离自诞生起就在,只是单机场景下几乎没人用到。来源:DuckDB 官方博客 / InfoWorld
周三补上性能账:v2.0 把 I/O 层与执行层解耦,拆成 REGULAR 与 ASYNC 两个线程池。官方在 EC2 r7i.16xlarge + 同区域 S3 的 TPC-H SF100 测试中,单文件 Parquet 查询由 8.23 秒降至 2.84 秒,CSV 查询从 887 秒降到 45 秒,提速近 20 倍;网络吞吐从约 5 Gbit/s 打满至 25 Gbit/s 上限。来源:DuckDB 官方博客
周五则是解析器:沿用自 2018 年首个 commit 的 PostgreSQL 派生解析器被整体换成 PEG 文法实现,方言(DuckSQL)不变,但语法糖此后可在运行时按需扩展。三篇合看,v2.0 不是一次功能叠加,而是 I/O、解析、存储格式、C API 同时翻新——把一个嵌入式分析库改造成能长时运行、多租户部署的服务端组件。下周看点:官方博客系列大概率继续拆解新存储格式与 VARIANT 类型,正式版仍指向今秋。来源:DuckDB 官方博客
向量检索加速下沉主库,专用向量库的空间继续被挤压 · db-ai
这是本周条数最多的一条主线,四个不同阵营在同一周给出同一个答案。Neon 与 Databricks 共享工程团队发布 Lakebase Search,用 lakebase_vector 与 lakebase_text 两个扩展在一条 SQL 里做向量+BM25 的 RRF 融合排序,冷索引留对象存储、热数据驻内存,分支可秒级克隆整套索引。IBM 则给 Netezza 加了原生 VECTOR 类型(Private Tech Preview),嵌入与业务字段同表存储,支持多种距离度量。来源:Neon / IBM / i-programmer
云厂商这边给的是规模与成本证据。Google Cloud 的 AlloyDB ScaNN 索引推出四级树预览,检索复杂度由 O(N^1/3) 降至 O(N^1/4),内部测试称百亿向量下 p95 ≤51 毫秒、召回率 95%;AWS 则实测用 binary_quantize() 把 1 亿条 768 维向量的 HNSW 索引从约 367GB 压到约 38GB,代价是召回损失只能靠全精度 rerank 部分挽回——背景是 Ring 在 RDS for PostgreSQL 上已存有 1000 亿–2000 亿条 embedding。两家的数字均为厂商自测,未见第三方复核。来源:IT Brief UK / AWS 数据库博客
趋势上,这比上周更进一步:上周还是 Snowflake、Oracle 各自主张"agent 的记忆是数据库问题",本周变成关系型内核直接把十亿到百亿级向量吃下来。学界方向也一致——arXiv 上的 PostgreSQL-V 2.0 主张把向量能力做进内核而非挂扩展,NeuRoute 把十亿级 ANN 索引构建压到亚小时级。专用向量库这一周除 LanceDB v0.38.0-beta.1、Weaviate v1.38.10/11 的例行迭代外,没有对等叙事。来源:arXiv / 厂商 release notes
"减少系统数量"成为本周的架构共识 · oltp
两条独立线索在周内撞到一起。Harper 发布 5.2,靠无锁原子版本槽的记录缓存、写提交调度移出应用线程与规划器优化提速,明确反对"Postgres+Redis+Serverless 函数+实时推送"式拼装;其对照基准把自身与 Neon+Upstash+Vercel+Ably 组成的栈相比,宣称在个性化实时负载下显著领先——纯厂商自测口径。来源:InfoQ
几乎同时,Raphael Bauer 的《PostgreSQL for Everything》在 Hacker News 拿到 427 赞、256 条评论,主张靠插件生态用一个 Postgres 承载全文检索、时序等全部负载。两者路径相反——一个要"Postgres 包打天下",一个要"单一运行时收编数据库/缓存/队列"——诉求却相同:缩短数据路径、砍掉运维面。周内另一场 HN 讨论(是否还该裸跑 Postgres 而不套 PgBouncer,161 赞)指向同一处老痛点,连接管理仍无定论。来源:raphaelbauer.com / Hacker News
配合这条线的还有一则往事复盘:The Register 采访中,Postgres 项目元老把 2010 年 Oracle 收购 Sun 后 MySQL 前途不明,视为把开发者推向 PostgreSQL 的关键节点之一。来源:The Register
湖仓的重心从格式之争转向元数据与 CDC 管道 · lakehouse
格式层本周只有常规推进:Delta Lake 4.4.0 支持 Apache Spark 4.2(向下兼容 4.1/4.0.1),扩展 Unity Catalog Delta Table API 集成,新增 identity/generated column,UniForm 的 delta-iceberg 模块继续维持 Delta 与 Iceberg 元数据同步,delta-flink 连接器跟进 Flink 2.3.0。来源:Delta Lake release notes
真正在动的是两端。入口端,AWS 给出 Aurora DSQL 经 Kinesis、Firehose 落成两张 Iceberg 表的参考架构——cdc_events 按提交时间追加留审计轨迹,current_state 按主键 upsert 并用 tombstone 代替硬删除;接上上周 Snowflake 的 Postgres-to-Iceberg 数据镜像公测,CDC-to-Iceberg 已是主流云厂商的标配拼图。来源:AWS 数据库博客
治理端,Google Cloud 的 Lakehouse 运行时目录新增遗留 Hive Metastore 迁移,同时兼容 Iceberg REST Catalog 与 Hive Catalog,旧表指向 GCS 既有数据、无需重写复制,并把策略统一到 Knowledge Catalog 与 Cloud IAM 的单一控制面。云厂商更急的问题,看来不是 Iceberg 与 Delta 谁赢,而是十年积压的 Hadoop 时代元数据债务。来源:IT Brief UK
Databricks 亮出 OpenAI 案例,agent 数据基建的样板开始成形 · db-ai
Databricks 首度详细披露 OpenAI 的数据平台:自 2024 年起在 Azure 与 AWS 双云上以其为底座,用量数据落入 Unity Catalog 统一治理的 Delta 表,覆盖产品分析、财务、安全与信任等多条线;安全团队让 Codex agent 通过 SQL API 查询受治理数据做"AI 辅助调查",市场团队以 Bronze-Silver-Gold 分层支撑 10 亿周活规模并消除约 40 万美元/月存储成本。厂商称双方工程团队贴身协作,OpenAI 负载反向影响 Photon 与存储调优的迭代方向。来源:Databricks
收购的整合效应也在本周显形:Neon 的 AI Gateway 已直接调用 Databricks Foundation Model APIs 承载开源权重模型,复用连续批处理、KV-cache 分页、TensorRT-LLM 内核与 prompt caching——Databricks 称其 prompt caching 在 gpt-oss 批推理下曾让单副本输入吞吐提升 2.5 倍、P50 延迟降低 3 倍(约 30% 缓存命中率)。承上周"钱与人同时压向 Lakebase",本周补上的是产品层证据。来源:Neon / Databricks
同向的还有 Snowflake 的动态模型路由与 CoCo 治理控件(未披露算法与成本基线)、Databricks 的 Document Intelligence 复杂文档抽取(未给准确率与吞吐),以及 Cloudera 的 Anywhere Cloud——主打不搬迁敏感数据即可就地跑 agentic AI 负载。学界侧,arXiv 的 Agentic Transaction 直接把多步 agent 工作流的可靠性重述为事务的原子性与一致性问题。来源:Snowflake / Databricks / Techzine / arXiv
分析型:一项 TPC 纪录宣称,与 ClickHouse 的渠道扩张 · analytics
腾讯云数据湖计算 DLC 据 TPC 官网公示刷新 TPC-DS 100TB 性能与性价比两项纪录:综合性能 6.54 亿、约为此前最高纪录的 10 倍,单位性能成本 11.04 元、约为此前的六分之一;引擎为自研统一计算引擎 SuperSQL,整合批流与 CPU/GPU 算力,测试覆盖 99 类任务在 4 组并发下的 396 次复杂查询并需同步处理插入更新。这是腾讯继 2023、2024 年后第三次刷新 TPC 核心测试纪录。来源:icloudnews
ClickHouse 本周没有重量级版本,动作集中在商业面:悉尼 Open House 上,ANZ 销售副总裁 Paul Davis 称 2026 年至今新增约 1000 名客户、总数破 4000,并把增长归因于应用架构转向 agent 驱动;同周与咨询服务商 Ciklum 结盟推企业迁移。两者均为厂商单方陈述、无第三方审计,系统集成商结盟也属渠道常规打法,不构成技术里程碑。来源:IT Brief Australia / SiliconANGLE
版本面本周以补丁为主:ClickHouse 密集推出 v26.3.20.7-lts、v25.8.31.9-lts 等多个 LTS/稳定分支,Apache Doris 更新至 4.0.8 与 4.1.4-rc01,YugabyteDB 连续 backport 安全修复(含 CVE-2025-8715),Redpanda、Materialize、Weaviate、TiDB、LanceDB 例行小版本。EDB 则宣布 WarehousePG 容灾正式可用,援引一家银行客户在数百 TB 场景下把恢复窗口从约两天压到 16 分钟(单一案例,未注明是否典型)。来源:厂商 release notes / PR Newswire
AI 写的漏洞,被 AI 独立找到并利用 · infra
Wiz 的自主渗透工具 Red Agent 在 Snowflake 的 HackerOne 项目下,于漏洞上线仅 5 天后独立发现并验证利用了 snowflake-connector-net 仓库的一处 GitHub Actions 脚本注入:构造标题的 issue 即可在 CI runner 执行任意命令,进而触及 Snowflake 内部 Jira 权限。来源:wiz.io
关键在于漏洞来源——它由 6 月 18 日一次署名 Copilot Autofix 的 PR 引入,原本经环境变量转义的安全写法被改回字符串拼接,GitHub 的 AI 代码审查未标出风险。Snowflake 于 6 月 23 日收到披露后当天修复并轮换凭证,审计日志确认暴露窗口内仅 Wiz 一方行为,测试访问数据已删除。攻防两侧同时自动化,这类样本此后大概率不止一例。来源:wiz.io
融资与交易:本周转向图与语义层 · funding
与上周 Databricks 50 亿美元那种量级相比,本周金额小得多,方向却更集中。保加利亚厂商 Graphwise(开源 GraphDB 的开发方)获欧洲私募 Oakley Capital 控股投资(金额未披露),从原股东团手中收购多数股权;其定位是给 AI agent 做"语义层",以知识图谱锚定可验证企业事实、缓解 GraphRAG 幻觉,主打金融与医疗等强监管行业。来源:SiliconANGLE
韩国 GraphAI 完成 1200 万美元 A 轮(K2 Investment Partners 领投,累计 1470 万美元),由 KAIST 教授 Min-Soo Kim 创立,做图+向量+关系三库合一的企业 AI 数据基建——与稍早融资的韩国 Graphie 定位近乎重合,韩系 AI 数据基建近期动作密集。此外印度主权云厂商 Yotta 与 IntelliDB Enterprise 合作推本土托管的 AI DBaaS,延续数据主权这条支线。来源:CryptoRank / Analytics India Magazine
下周看点:DuckDB v2.0 的后续内核拆解与正式发布节奏;AlloyDB 四级 ScaNN、IBM Netezza VECTOR 两项预览能否转公测;Snowflake 与 Databricks 在 agent 侧模型路由的成本口径是否会给出可比基线;以及腾讯 SuperSQL 的 TPC-DS 成绩公示后,是否有同业提交对标结果。
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻