FutureX · 记录未来如何发生

数据库行业 周报 · 第 6 期 · 2026.08.02 · 过去 7 天 7/28–8/1

本周要点

· 快手把百 PB 数据、200+ 集群从 ClickHouse 迁至 Apache Doris

· Milvus 3.0 GA:向量库首次原生直读湖上的开放格式数据。

· DBOS 实测:优化后 Postgres 队列可撑 3 万次 workflow/秒

· OceanBase 启动首次外部融资,传闻拟募 20 亿至 30 亿元人民币。

· DuckDB v2.0 定于今秋上线异步 I/O,主攻远程湖仓查询。

· Google Cloud 湖仓打通 Glue / Unity / Horizon 三大目录(预览)。

▎ 分析型:一个"迁出 ClickHouse"的样本,与单机引擎的天花板上移

快手把百 PB 级 OLAP 负载搬离 ClickHouse,落到 Apache Doris · analytics

本周最实的一条工程叙事来自快手。其内部 ClickHouse 曾承载商业化、电商、AB、KwaiBI 等业务线日均 20 亿次 OLAP 查询,但在多表 Join、湖仓查询、存算分离与运维复杂度上逐渐吃紧。团队基于 Apache Doris(内部发行版 Bleem)自建迁移平台"星移",完成 200+ 集群、数千张表、百 PB 级数据的平滑迁移,用 OneSQL 透明路由做双跑校验与灰度切换。

值得注意的是迁出理由:不是单点查询性能,而是多表 Join 与湖仓一体。这与本刊持续跟踪的 ClickHouse 竞品叙事一致——同业竞争的主战场正从"扫描多快"转向"能不能直接查湖、能不能少建一套系统"。来源:InfoQ 中文站

DuckDB 官宣异步 I/O 路线图,同期实测把单机自托管边界推得更远 · analytics

DuckDB 官方博客披露,计划于 2026 年秋随 v2.0 上线针对 Parquet 与无压缩 CSV 的异步读取。动机很直白:DuckDB 的典型场景已从本地 SSD 转向远程对象存储(数据湖,以及今年 5 月上线的 Quack 协议 server 模式),同步 I/O 下单线程要等数据到达才能干活,网络带宽打不满。异步流水线让读取与解码、聚合重叠执行。原生格式与 JSON 的异步支持仍在开发。

周内还有一篇登上 HN 的实测(84↑)与之呼应:同一台 16.49 美元/月的 Hetzner 云主机上,DuckDB 写入吞吐比 SQLite 快 3–15 倍,仪表盘可扛行数是 SQLite 的 100 倍量级,10.8 GB 磁盘装下 10 亿条指标点。作者结论是日志类负载应完全避开 SQLite,而在上 ClickHouse 这类客户端-服务器 OLAP 之前,嵌入式方案的可行区间比多数人以为的更宽。

生态侧另有社区扩展 DuckPGQ 实现 SQL/PGQ 标准,把图查询接进 DuckDB 分析流程,但项目自我标注仍属研究性、未面向生产。来源:DuckDB 博客、tracewayapp、duckpgq.org

▎ 数据湖·湖仓:向量库主动入湖,目录联邦跨过云的边界

Milvus 3.0 GA:向量库不再当数据的终点,改当湖上的一层索引 · lakehouse

Zilliz 旗下 Milvus 本周发布 v3.0 正式版并于周末补发官方新闻稿确认 GA,核心是 Lake-Native 数据访问:可直接读写落在 Amazon S3、Google BigLake、Azure Data Lake 上、以 Apache Iceberg / Lance / Parquet / Vortex 等开放格式存储的数据,无需先 ETL 进库。配套的 External Collections 支持在外部数据上直接建向量/全文/JSON/标量索引,并提供 Spark DataSource V2 连接器打通 Spark、Databricks、EMR 管线。

底层存储换成基于 manifest 的列式引擎 Storage V3,数据与元数据均落 S3 兼容对象存储。放在上期"向量检索被通用引擎收编"的背景下看,这是专库一方给出的反向答案:不争数据归宿,改做湖上的索引服务——既回避了与 Postgres/Spark 正面抢存储,也把自己钉在了必须持续赢在检索效率上的位置。来源:Milvus 发布说明、Zilliz

Google Cloud 跨云目录联邦进入预览,Iceberg 成三大目录的公共语言 · lakehouse

Google Cloud 扩展"无边界湖仓",基于 Apache Iceberg 的目录联邦让 AWS Glue、Databricks Unity Catalog、Snowflake Horizon 三大目录进入预览互通:客户可用 BigQuery 原地查询其他云上的数据,结果写回原环境,无需搬运复制。配套跨云专线对来自 AWS 的数据访问免收可变出口费,仅按连接时长计费——出口费历来是跨云查询的实际拦路虎,这一刀切在痛点上。

其落点写得很明确:为 Gemini Enterprise 与 Conversational Analytics 等 agent 场景供数,元数据治理接入 Knowledge Catalog。同一支柱下,Apache Paimon 发布 2.0.0-rc4(继 rc2、rc3),PyPaimon 同步跟进;腾讯云的 AI DLC 也把 Spark 与 Ray 放进同一 Serverless 平台,让数据处理与 Agent 任务共享数据、算力与权限体系。

下周看点:Paimon 2.0.0 正式 GA 已迫近。来源:IT Brief Australia、StartupHub.ai、Apache Paimon、雷峰网

▎ 通用 DB·OLTP:Postgres 被继续加载,也被量出天花板

DBOS 连发两篇:Postgres 当队列、当消息总线都比业内共识能扛 · oltp

本周脉络最完整的一条是 DBOS 的"两连击"。周二那篇针对"LISTEN/NOTIFY 不可扩展"的流行说法,称瓶颈是 NOTIFY 触发时持有的全局锁而非机制本身:最初的表触发器实现吞吐不超过 2.9K 写入/秒,优化后用于流式写入(如 LLM 逐 token 输出)达到单机 6 万写入/秒、毫秒级延迟,优于轮询方案。

周末那篇(HN 124↑)接着拆队列:用 FOR UPDATE SKIP LOCKED 解决多 worker 抢同一批任务的竞争(不加锁子句时吞吐上限约百次/秒),叠加优化后实测跨数千台服务器可达 3 万次 workflow 执行/秒。两篇合起来是同一个论证——"Postgres 做不了 X"往往是实现问题,不是架构问题。

反向的一份体检来自 Tiger Data:在 5 万插入/秒的并发写入下,FOREIGN KEY 与 UNIQUE 约束成为隐性写入天花板,真正的瓶颈不是互斥阻塞,而是极少数父行被大量事务共享锁定后 MultiXactID 打满 SLRU 缓存,症状表现为 MultiXact LWLock 等待而非慢查询。NOT NULL / CHECK 代价则小得多。来源:dbos.dev、Tiger Data 博客

Turso 重写完 SQLite,转身押注 Postgres 内核 · oltp

用 Rust 从零重写 SQLite 内核的 Turso 本月正式启动 Postgres 兼容内核项目,创始人 Glauber Costa 称目标是"数据库界的 LLVM"——一套现代虚拟机核心,未来长出 MySQL、Redis 等多种前端。SQLite 重写(前身 Limbo)基于 VDBE 架构把 SQL 编译为自有字节码,团队判断这套执行引擎足够通用。

Costa 特别声明"Postgres 本身没毛病",押注的不是替代其语义,而是替代它在云原生时代显得笨重的执行核心。SQLite 路线已证明可行,Postgres 兼容层能否达生产级仍待验证。同期 TimescaleDB 发布 2.28,连续聚合终于支持底层 schema 演进,并终止 PostgreSQL 15 支持。来源:The Register、Tiger Data 博客

▎ 数据库与 AI:记忆层成形、评测开始有基准、token 变成账本

"给 agent 装记性"从产品线升级为一条共同路线 · db-ai

Snowflake 发布 ArcticMem 并集成进其编码 agent CoCo:Tier 1 索引项目里已有的显性规范文档,Tier 2 从历史会话抽取"只能事后总结出来"的经验——调试踩过的坑、数据质量的隐性发现、项目专属约定——embedding 存入本地向量库,下次会话语义检索后自动注入。厂商称内部 7 项高难基准中 5 项有稳定提升,且无需额外 prompt 工程或微调。

周二上线的 Pinecone Nexus 走的是同一逻辑的另一端:把散在合同、工单、财务记录里的业务知识一次性摄入并整理成结构化层,把 token 消耗从"每次查询的检索循环"前移到"一次性数据规整",厂商宣称 token 降至原先 1/9~1/15、法律场景完成率显著高于 RAG。周末又有中文媒体转述 Karpathy 的「LLM Wiki」构想(摄入时编译,而非查询时做功),并点名 Cognition DeepWiki、Factory AutoWiki、LangChain 等四家已各自落地。

学界同步跟上:MemLens 用 Shapley 值给每条记忆打分以防记忆库被低价值交互堆满。三条线合起来看,"记忆"正在从 RAG 的一个补丁变成独立的基础设施层。厂商自报基准仍需第三方复现。来源:Snowflake 工程博客、InfoQ 中文站、雷峰网、arXiv

Supabase 开源 Evals:agent 建数据库的能力,第一次有了公开考卷 · db-ai

Supabase 开源 supabase/evals,测试 Claude Code、Codex、OpenCode 等 AI coding agent 在真实任务(建表、修复失败的 Edge Function、修 RLS 策略)上的表现,用确定性检查 + LLM-as-judge 打分,既是对外 benchmark 套件也是内部每日回归套件。承接上期"平台上约 90% 新建数据库由 agent 发起"的口径,这一步等于把那条数据变成可被检验的工程问题。

评测这条线本周格外密集:DBA-Bench 给 LLM 数据库运维 agent 立生产级保真度基准,直指各家 DBA agent 评测口径不一、无法横比;WorkSurface-Bench 用 1151 个任务专测"先选对知识源"这一步,表格类答案以真实执行的 DuckDB 查询核验。另有研究指出 HNSW 向量库中"软删除"的 embedding 仍可被重建,是 RAG 隐私合规上的一个缺口。来源:Supabase 博客、arXiv

成本叙事换挡:从"RAG 贵在哪"转向"谁来治理 token 供给" · db-ai

上期的结论是 RAG 烧钱在向量库常驻内存而非嵌入;本周议题向上挪了一层。数据虚拟化厂商 Denodo 提出该治理的是底层数据供给而非模型调用本身,靠统一数据层削掉 agent/RAG 管道里重复拉取与冗余检索的无效 token。Databricks 则给 Unity AI Gateway 加了 AI 支出管控。

"要不要独立向量库"的争论同期升温。Neon(现属 Databricks Lakebase 系)披露客户案例:CommSync 用 lakebase_text(BM25)与 lakebase_vector(1024 维余弦)扩展替换 GIN/tsquery,语义搜索延迟从冷启动约 19.5 秒降至热态 18.6 毫秒,两条路径共用同一 Postgres 库经 RRF 融合,agent 知识库复用同一套向量列。EDB 则发自测报告称 Postgres AI 在 agentic 场景全面胜出向量库、湖仓与文档库。

两份数据均为单一客户自述或厂商自报,测试集与方法论未披露,不宜当作定论——但方向一致:Postgres 阵营正在把"没必要单独存在"喊成一种共识施压,而 Milvus 3.0 入湖恰是专库侧的应答。来源:新浪财经、Neon 博客、Yahoo Finance、Databricks 博客

▎ 融资与交易:国产分布式数据库首个资本化样本浮出

OceanBase 启动成立以来首次外部融资,拟募 20 亿至 30 亿元 · funding

蚂蚁集团旗下 OceanBase 启动首次对外融资,多家媒体报道拟募 20 亿至 30 亿元人民币(约 2.95 亿至 4.43 亿美元),用于加码 AI 数据战略;公司回应称"全力投入 AI 数据创新,与资本市场保持开放沟通",未证实具体金额。轮次、投资方与估值均未披露,目前仍属多方媒体的传闻口径。

背景可循:OceanBase 已于 2024 年设立独立董事会并推行员工持股计划,今年 6 月推出新一代湖仓一体 AI 数据库并启动商业化,客户涵盖交通银行、中国移动等,年化收入据称突破 2 亿美元、同比增长 70%。这轮若落地,将是国产分布式数据库阵营(TiDB / OceanBase / PolarDB)中首个独立走向资本市场的样本。

规模小得多的一笔在欧洲:保加利亚混合云数据基建公司 Tiger Technology 融资 870 万欧元,说明该赛道的小额早期投资仍在持续。下周看点:OceanBase 轮次与投资方是否正式披露。来源:21 世纪经济报道、华尔街见闻、IDNFinancials、EU-Startups

云厂商的商业化动作集中在"弹性算力"与"少搬一次数据" · funding

Snowflake 的 Adaptive Compute 继 5 月首登 AWS 后,本周扩至 Azure 与 Google Cloud 多区域 GA,面向 agent 负载与 AI 应用常见的突发、低并发波动型负载自动伸缩,厂商称相比 6 月版本波动负载最高再降本 30%,现有 Standard warehouse 可零停机升级——这是对 Databricks serverless 在算力弹性上的正面回应。

腾讯云 AI DLC 则主打"少一次搬运":自研向量化引擎 Meson 官方称标准测试查询提升 3.6 倍,多模态引擎 Xpark 称推理吞吐较开源方案提升 3 倍,内部 WorkBuddy 接入后端到端处理时间缩短 80%、算力降至约五分之一,并已适配国产主流 GPU。以上均为厂商自测,未经第三方复现。

其余生态动作:Google Cloud AlloyDB 预览群组 IAM 认证(最多 200 个功能性群组,支持 agent 代入终端用户身份留审计轨迹);中科曙光与深圳计算科学研究院(YashanDB 出品方)联合推全栈自主可控方案;Snowflake 在 Claude Opus 5 发布当日即接入 Cortex AI,云数仓正把大模型接入速度当作一项竞争维度。来源:Snowflake 博客、雷峰网、SecurityBrief Australia、东方财富

FutureX · 记录未来如何发生

素材来源多方媒体/网络新闻