数据库行业日报
本期要点
· Databricks 的 Lakebase Postgres 上线 lakebase_vector / lakebase_text 两个搜索扩展并 GA,宣称 VectorDBBench 100M 吞吐为次优系统的 2 倍(厂商口径)
· DuckDB v1.5.6 发布;官方称 Windows 上 v2.0-dev 跑 TPC-H SF300 比 1.5.6 快 6 倍以上,v2.0.0 定于 10 月
· Aurora DSQL 补上外键约束,这是用户呼声最高的缺口之一
· pgEdge Starfleet 发布:标准社区 Postgres 上做 copy-on-write 分支,可部署到 air-gapped 环境
· Tiger Data 的 agent 记忆在 LoCoMo 上 F1 从 0.392 提到 0.666,41 次实验中有 24 次回退
· Snowflake 拟私募发行 35 亿美元 0.00% 可转债,股价当日跌约 4%
版本与产品发布
DuckDB v1.5.6 发布,v2.0-dev 在 Windows 上宣称快 6 倍 · olap ⚠️ 厂商口径
DuckDB 发布 v1.5.6,这是 1.5(Variegata)线的第六个补丁版,含 bugfix、性能改进与安全补丁。博文同时给出 v2.0.0-dev 的 Windows 预览数据:在 12 核 / 24 线程、128 GB 内存的笔记本上跑 TPC-H SF300,热运行总耗时从 v1.5.6 的 822 秒降到 129 秒,快 6 倍以上。官方归因于改用 clang-cl 编译器和新的内存分配器,并提醒 6 倍不会泛化到所有负载。这是 DuckDB 自己跑的单机测试。v2.0.0 已定于 10 月发布,此前 v2.0-alpha 已报(已报)。[1]
Amazon Aurora DSQL 支持外键约束 · oltp
Aurora DSQL(AWS 的 serverless、PostgreSQL 兼容、多区域 active-active 分布式 SQL 库)现可在新表和已有表上添加外键约束。支持 No Action、Restrict、Cascade、Set Null、Set Default 五种引用动作,也支持 Match Full / Match Simple 与 deferrable 约束。实现分两步:事务按起始快照校验被引用行,不加锁;提交时通过对被引用行隐式加 Key Share 检测并发冲突,冲突则返回 serialization error。这个设计避免了分布式环境下外键锁的开销,代价是并发修改时应用需要重试。[2]
pgEdge Starfleet:标准 Postgres 上的 agent 分支与任意位置部署 · agent ⚠️ 厂商口径
pgEdge 发布 Postgres 云平台 Starfleet,主打把 AI 原型推到生产。它提供每个实验一份 copy-on-write 分支的能力,每个分支有独立连接串和独立 MCP 地址与 token;部署可选 pgEdge 托管云、客户自有云或 air-gapped 本地环境,多区域集群零停机。The New Stack 指出,分支结束时不做 merge,是有意设计。pgEdge 称不替换 Postgres 存储层,但未说明分支实现方式。这与 Databricks Lakebase(基于 Neon 存储计算分离)路线不同。发布稿中的"46% 原型进入生产"引自 IDC 与 Lenovo 研究。[3]
其他版本动态:ClickHouse 同日放出 v26.9.5.2-stable、v26.8.14.3-lts、v26.7.16.2-stable、v26.3.35.3-lts 系列补丁(另有 v26.9.4.3、v26.8.13.2);YugabyteDB 发布 2026.1.3.0-b32、2025.2.7.0-b103、2024.2.12.0-b25 等多个 backport 构建,含 CVE-2026-14677 上游修复导入与 YSQL 聚合下推至远端 tserver 的改动;Milvus 2.6.25 版本号提升。[4]
数据库 × AI
Databricks Lakebase Search GA:Postgres 内置向量与 BM25 全文检索 · vector ⚠️ 厂商口径
Databricks 为 Lakebase Postgres 推出两个扩展 lakebase_vector(近似最近邻检索)与 lakebase_text(BM25 全文检索),已在 AWS 与 Azure GA。官方称在 VectorDBBench 100M 上吞吐为次优系统的 2 倍,成本为使用 pgvector 的云 Postgres 厂商的 1/4,P99 延迟 71 ms(召回率 97%)。这些数字均为 Databricks 自测。
切入点是 pgvector 的内存瓶颈:HNSW 依赖随机访问,官方估算 768 维 float32 向量约占 3.3 KB,1 亿行需约 330 GB RAM 才能保持毫秒级;索引溢出到磁盘后性能下降 10-50 倍,构建 pgvector 索引在标准云实例上近 50 小时。客户 Conexiom 称在超 1 亿行上跑 BM25 混合检索,算力约为原 pgvector 方案的一半。对"用 Postgres 承接向量负载"路线,这意味着专用向量库的差异化空间继续收窄。[5]
Neon:Lakebase 分支式恢复,称 100 TB 库也是秒级 · agent ⚠️ 厂商口径
Neon(Databricks 旗下)博文称,托管 OLTP 的 PITR 需要开新实例、把快照从对象存储拉到盘、再回放 WAL,耗时随规模增长。Lakebase 存储计算分离、历史数据已在对象存储中,恢复只是在某时间点建一个分支,属元数据操作,官方称即便 100 TB 也在秒级完成,agent 也能自己操作。这是厂商架构说明,未附独立实测。[6]
Tiger Data:agent 记忆在 LoCoMo 上 F1 提到 0.666 · agent ⚠️ 厂商口径
Tiger Data(原 Timescale)称用 6 天、41 次实验(17 次采纳、24 次回退)把长期对话记忆的 LoCoMo F1 从 0.392 提到 0.666;raw F1 为 0.638,高于此前已发表最佳的 0.598。代码基本由 Claude 写、实验由其运行。文章的重点在于:决定结果的四次干预都是人质疑"指标是否可信",例如评测框架把题目类别传进了 prompt,等于泄漏答案提示。分数为自跑结果,且存在该类评测泄漏,读者应谨慎对待。[7]
Snowflake Cortex AI 上线 GPT-6 Sol 与 Luna;HPCwire 谈 agent 重塑数据库 · ai-native
Snowflake 宣布在 Cortex AI 中提供 GPT-6 Sol 与 Luna 两个模型,素材未给出更多细节。HPCwire 同日刊文讨论 AI agent 对数据库设计的影响,是延续近期"面向 agent 的数据库"讨论的评论稿。[8]
技术 · 架构 · 性能基准
Postgres 三则 HN 高分技术帖:时区、迁移、DISTINCT · oltp
一是 “at time zone 'UTC'” 的坑(HN 161 赞 / 98 评),讨论集中于该写法对 timestamp 与 timestamptz 语义的反直觉转换。二是 Postgres 迁移是否安全(133 赞 / 45 评)。三是 dbos.dev 的 SELECT DISTINCT 不可扩展(104 赞 / 28 评)。三篇都是生产层面的 Postgres 使用陷阱,素材只有标题与热度,具体论证未取全文。[9]
融资 · 并购 · 商业化
Snowflake|拟私募发行 | 35 亿美元 0.00% 可转债 ⚠️ 单方口径
Snowflake 宣布拟私募发行 35 亿美元 0.00% 可转换优先票据,尚属"拟"阶段,定价与用途以后续公告为准。市场报道称其股价当日下跌约 4%,同期 Datadog 跌约 4%、Oracle 约 3%。另有报道称 Snowflake 与 Salesforce、ServiceNow 曾在 Meta 一则公告后数分钟内同跌 4%,原因未在素材中说明。[10]
Motley|Pre-seed|150 万美元 · agent
Motley 完成 150 万美元 pre-seed,做面向 agent 的语义层(semantic layer)。金额很小,反映的是"给 agent 提供指标语义"这一细分方向仍在早期。[11]
云厂商 · 生态 · 监管
研究人员称约 1.6 万个 Supabase 数据库暴露于公网 ⚠️ 单方口径
据一则二手转述,研究人员发现约 1.6 万个 Supabase 数据库对互联网开放,未见一手研究报告,具体成因(配置不当、RLS 未启用等)素材未说明,数字待核。[12]
茂名石化完成核心业务系统文档数据库国产化替代 · oltp
中石化旗下茂名石化完成核心业务系统的文档数据库国产化替代,属信创替换案例。素材未披露所用产品与迁移规模。[13]