数据库行业日报
本期要点
· Supabase 获 1.5 亿美元融资并收购 Turso,称新建数据库 70% 由 agent 创建(公司口径)
· Cloudflare 的 Basin 正式 GA:Iceberg + R2 的 serverless 分析,零 egress 费
· Supabase Select 发布 Multigres(私有 alpha)与 OrioleDB,并上线自家 Postgres 横评站 dbarena
· Iceberg REST Catalog 合入 read-restrictions,首次为列脱敏和行过滤定标准;S3 Tables 同日补齐 V3 全部数据类型
· turbopuffer v3 把 ANN 向量索引降为二级索引,HN 374 赞
· Snowflake 称 Adaptive Warehouses 的 DML 最高快 13.7 倍(厂商口径)
版本与产品发布
Cloudflare Basin 正式 GA:基于 Iceberg 与 R2 的 serverless 分析平台 · lakehouse
Cloudflare 把 Basin 作为 GA 产品推出,覆盖数据摄取、存储、编目与查询,不需要用户自备集群。数据以 Apache Iceberg 格式存放在 R2 对象存储上,Snowflake、Spark、DuckDB 等工具可直接读取,不必先拷贝或转换。计费按用量,并且不收 egress 费:跨云、跨区域查询自己的数据不额外付费。egress 费一直是多云分析最受诟病的成本项,Basin 把它直接拿掉。Cloudflare 技术负责人 Dane Knecht 的表述是"开发者不该为了回答自己数据的问题而变成数据基础设施运维"。Cloudflare 同时说明,Basin 面向更开放的 serverless 分析场景,并不打算替换所有数仓部署。已见报道没有写明底层查询引擎与性能数字,对 ClickHouse 系读者来说,眼下可比较的是它的开放格式路线与定价,不是引擎指标。[1]
Supabase Select:声明式 Schema 2.0、应用自带 MCP server、Supabase Compute · agent
Supabase 在 Select 大会上围绕"让编码 agent 直接操作后端"发布三组更新。Declarative Schemas 2.0:agent 只编辑 SQL schema 文件,新的 diff 引擎 pg-delta 生成迁移,新项目默认启用;config.toml 可通过 supabase config pull 与控制台同步。应用自带 MCP server:部署在现有 Supabase 项目内,用户的 agent(Claude、ChatGPT、Cursor 等)以登录用户身份接入,只能看到该用户有权限的数据。Supabase Compute:在数据库旁运行不限时长的长驻服务,可选内存和 CPU,每个服务有完整 Linux 环境(Edge Functions 没有)。本地开发新增无 Docker 的原生进程模式,每个目录一套独立栈,目前为 alpha、默认关闭。
运维侧新增:通过 SQL 访问原始项目日志的 MCP 工具、覆盖 Data API / Auth / Storage / Edge Functions 错误率的健康类 Advisor、连接与锁等待视图、可存成文件的 Notebooks。新的 Explorer(SQL 编辑器的演进版)将在 10 月 12 日前陆续铺到所有项目。[2]
Supabase 推出 Multigres 与 OrioleDB,并上线 dbarena 基准站 · oltp ⚠️ 厂商口径
Multigres 是由 Vitess 团队打造的开源 Postgres 扩展层,提供可扩展连接池和自动多节点故障切换,无需单独部署 pooler。高可用方案基于 Postgres 同步复制之上的广义共识协议:节点失败后,集群先确认哪些写入已提交,再在数秒内提升副本,官方称不丢已提交写入。默认跨可用区部署 3 个 Postgres 节点。目前是私有 alpha、凭邀请使用,明确不适合生产负载。
OrioleDB 是开源 Postgres 存储引擎,替换传统 heap 存储,目标是消除表膨胀、VACUUM 开销以及 32 位事务 ID 的 wraparound 限制。dbarena 是 Supabase 自己运营的开放基准站,对比各托管 Postgres 厂商的性能与成本。运营方本身是参赛方,结果在独立复现前按厂商口径看待。[3]
其他版本动态:ClickHouse 发布 v26.9.8.3-stable、v26.7.19.5-stable 及 v26.3.39.7 / v26.3.38.2 两个 lts 补丁;Materialize v26.45.0 连出 rc.1–rc.3;YugabyteDB 多条分支同日出构建,其中 2025.2.8.0-b12 导入了 PG 15.19 安全修复;pgvector 升至 v0.8.7;Weaviate 补丁 v1.39.8 / v1.38.18(MMR 查询向量归一化修复,无 breaking change)。[4]
数据库 × AI
turbopuffer v3:ANN 索引从主索引降为"普通二级索引" · vector
turbopuffer 发文《RIP, vector database》(HN 374 赞 / 105 评),宣布 v3 重写文档与索引的布局、写入、compaction 和查询方式。此前所有索引都围绕 ANN 向量索引转:向量按 SPANN / SPFresh 式层级聚类,属性过滤用的倒排索引也以"聚类 ID + 簇内 LocalId"(ANN 地址)作为指向。官方称这种向量优先的架构已推到极限,已经限制了 GROUP BY 与聚合等查询计划。v3 的做法是换一个新的主索引,让 ANN 与文本、正则等索引并列。官方还说,这是为"把更多 SQL 查询搬进 turbopuffer 并跑得快"打基础。
文中把客户用法的变化写得很清楚:早期客户是 Cursor、Notion,之后出现了 Linear 同步引擎这类非搜索用途。对向量库赛道,这是又一个"向量只是一种索引类型"的信号,不过 v3 目前只是路线说明,没有给出性能数字。[5]
Databricks 推出 ai_decide(Beta):用决策模型替代 LLM 做结构化判断 · ai-native ⚠️ 厂商口径
ai_decide 是 Databricks 的原生 AI Function,底层是 TypeSafe AI 的决策模型 Jev:输入非结构化文本和一组问题,直接返回概率、命名选项或有序分值,而不是生成文本。典型场景是工单分类、文档是否需人工复核、模型路由、agent 评估,可在 SQL 里调用,也提供 REST API。官方称其延迟和成本低于 LLM(未给数字,目前为 Beta)。
同一思路在别处也出现:Neon 上线 pg_redact,用 Jev 在 Postgres 内做按内容识别的 PII 脱敏,不再局限于"一列一类个人数据"。学界同日也有论文 JEVDB(见下文)把类型化决策模型用到语义过滤和 join 上。[6]
Neon AI Gateway 加入 embedding 模型服务 · vector
Neon 的 AI Gateway 现在可在与聊天模型相同的 OpenAI 兼容端点和同一凭证下生成 embedding。对 Postgres + pgvector 的用户,这省掉了单独接入 embedding 服务的一环。[7]
湖仓 · 开放表格式 · HTAP
Iceberg REST Catalog 合入 read-restrictions:列脱敏与行过滤有了引擎中立的标准 · lakehouse
Google Cloud 的 Talat Uyarer 与 Sung Yun 撰文说明,Apache Iceberg 社区已向 REST Catalog 规范合入可选的 read-restrictions 字段:loadTable 响应里可附带行过滤和列投影(脱敏)规则。评估顺序是行过滤先对原始列值求值,再对留下的行做投影,因此策略可以"按 region = 'US' 过滤,同时在输出里遮蔽 region",两者可以组合。
这解决的是开放格式的一个结构性缺口:表数据是对象存储里的 Parquet,BigQuery、Spark、Trino、Flink、DuckDB 等引擎都能直读,catalog 此前只能整表放行或拒绝,也就是粗粒度的凭证发放和服务端 scan planning。需要细粒度治理的用户只能改用厂商私有客户端,或把读请求绕经厂商代理,等于放弃直读存储的性能与开放性。标准落地后,各引擎是否实现、实现到什么程度,仍待观察。[8]
Amazon S3 Tables 支持 Iceberg V3 全部数据类型 · lakehouse
AWS 宣布 S3 Tables 支持 Iceberg V3 规范的所有数据类型,可新建 V3 表,也可把 V2 表原地升级。V3 特性包括:deletion vectors(用紧凑二进制取代 V2 的 positional delete 文件,AWS 举例,合规删除 5 万行不再留下成千上万个小删除文件)、row lineage(每行自动带 _row_id 与 _last_updated_sequence_number,下游无需全表扫描即可找到变更行),以及 variant、纳秒时间戳、geometry、geography、unknown 等类型。compaction 与维护仍由 S3 Tables 托管。[9]
技术 · 架构 · 性能基准
DuckDB:长字符串 GROUP BY 先换成整数键,最后再 join 回字符串 · olap
DuckDB 官方博客给出一个实用模式:对重复度高的长字符串列,先建带有序窄整数键的小维度表,在整数键上聚合,最后才把字符串 join 回来。原因在哈希聚合的实现:DuckDB 的字符串是 16 字节结构,≤12 字节内联,更长的只存 4 字节前缀加指针,因此哈希要读完整个字符串,命中还要沿指针做全串比较,新分组的字符串还会拷进哈希表自己的内存,表会随之变大。示例数据是荷兰铁路停靠表,380,959 行,只有 537 个不同站名,仅 Amsterdam Centraal 就重复 7,591 次。这个做法本质是数据仓库里的星型模型,在这里被用作聚合优化,官方已写入 Performance Guide 的 schema 章节。起因是一份高基数分组的内存占用报告,后来查明并不涉及字符串。[10]
Snowflake Adaptive Warehouses:DML 写路径重做,称最高快 13.7 倍 · olap ⚠️ 厂商口径
Snowflake 工程博客解释了 Adaptive Warehouses 的写路径。micro-partition 是不可变文件,改几行就要重写整个文件,写放大严重。新路径用四招:delta 文件加 bitmap 表示稀疏修改而不重写分区;复用已有元数据而不是重算;让 CPU 计算与 I/O 等待重叠;按负载读取方式安排新文件布局。收益主要出现在 DELETE / UPDATE / MERGE,各项机制按语句自动触发、无需配置。13.7 倍来自 Snowflake 自己的基准对比,对比基线与口径未经第三方验证。[11]
学界 · 研究前沿
· HakiCC(arXiv 2610.00889):用 LLM 多 agent 流水线为特定应用自动设计、验证并优化并发控制协议;动机是多数应用只会默认用 2PL 或 OCC。[12]
· JEVDB(arXiv 2610.02046):语义数据库用快速的类型化决策模型做过滤、join、分类和排序,只把不确定的样本升级给生成式 LLM,并用半连接削减加 Semantic Bloom Filter 减少语义 join 工作量;作者称在 SemBench 上 21 条查询全部延迟最低、19 条成本最低(论文自报)。[13]
· BudgetSchemaBench(arXiv 2610.00092):针对 Text-to-SQL 的 schema 上下文预算做诊断,在 80 个库的合并目录上扫描四档预算、比较三种表示,并用来源命名空间检查剔除"从错误数据库拿到正确结果"的查询。[14]
· Guarded Commits(arXiv 2610.00037):把人工审批写进 LLM 工作流状态,提交前由凭证受限的 commit 适配器核对审批记录;证据仅限合成无环工作流上的校验器测试,属设计提案。[15]
融资 · 并购 · 商业化
Supabase|新一轮|1.5 亿美元|估值未披露,并收购 Turso · agent ⚠️ 公司口径
Supabase 宣布新一轮 1.5 亿美元融资,由 GIC 领投,Alphabet 旗下 CapitalG、IronArc、SquarePeg 参投,距上一轮 5 亿美元 Series F 仅四个月。资金中一部分用于员工流动性。同时宣布收购 Turso:后者用 Rust 重写了 SQLite,并搭了一个单台服务器可管理数百万个数据库、按需加载和挂起的云平台,Superhuman、Sauna.ai、CTO.new、Mastra 都是用户。收购金额与估值在已见材料中均未披露。
Supabase 自述每月新增超过 100 万用户、400 万个数据库,其中 70% 由 agent 或 AI 工具创建,6 月时已披露的同比增幅为 600%,以上均为公司自报数字。逻辑是:SQLite 适合小而随用随开的负载,Postgres 适合业务长大之后,两者合起来给 agent 一条从原型到生产的路径。Turso 将继续独立运营并保持 SQLite 路线,联合创始人 Glauber Costa 将负责 Supabase 的 agent 基础设施方向,Pekka Enberg 同时加入。同日 Select 大会上 Supabase 的 Multigres 与 OrioleDB 发布,见第一章。[16]
Neon 免费版每项目存储翻倍至 1 GB · oltp
Neon 免费计划的每项目存储从 0.5 GB 提到 1 GB,仍保留 100 个项目,已有项目同步获得新额度。[17]