数据库行业日报
本期要点
· MLPerf Storage v3.0 加测向量库与 KV Cache 场景
· StarRocks 在 Graviton4 上性价比省 34%-52%(AWS 实测)
· LanceDB v0.38.0 发布,多项 breaking change
· Qdrant 发布 Fineweb-10B,支撑百亿级向量检索基准
· Deloitte 收购 Wavicle,加码 Databricks 咨询
· Neon:Lakebase Postgres 生产库月均自调 3.2万次
版本与产品发布
MotherDuck 上线 Read Scaling 读扩展功能 · olap
MotherDuck 为其基于 DuckDB 的云分析平台新增 Read Scaling 功能,可为分析型查询按需分配额外只读计算节点,缓解高并发读负载下的排队问题。厂商未披露具体扩容倍数与延迟数据,暂按功能公告处理。[1]
pgEdge 本周密集更新 Postgres 分层存储与可观测性工具 · oltp
pgEdge 在同一周内更新了 PostgreSQL 分布式发行版的分层存储(tiered storage)、可观测性与性能调优工具链,主打降低大表冷数据的存储成本。具体版本号与基准数据未披露。[2]
其他版本动态:ClickHouse 发布多个 v26.3/26.6/26.7/26.8 系列 lts/stable 补丁(无新特性披露);YugabyteDB 密集发布 2025.2.7.0 与 2026.1.x 系列 backport 修复;Apache Doris 发布 4.1.4-rc04;Materialize 发布 v26.40.0-rc.3;TiDB 发布 v8.5.7(保留表达式替换时的本地全文检索状态修复)。[3]
数据库 × AI
LanceDB v0.38.0 发布,表存在性校验改为 manifest 权威 · vector
LanceDB 发布 v0.38.0 稳定版,带多项 breaking change:表存在性判断改由 manifest 文件权威裁定(此前可能因缓存不一致误判)、Python 绑定强制要求 pydantic v2、分支合并操作更名为 cherry_pick,并新增物化视图(materialized view)的 Node.js 绑定。同期多个 0.38.0/0.39.0 beta 版本还加入 GPU 资源需求声明、Blob v2 UDF 签名支持。作为 AI 原生向量数据库的代表项目,这类底层一致性修复直接影响生产环境的 embedding 存储可靠性。[4]
Qdrant 发布 Fineweb-10B,为百亿级向量检索建公开基准 · vector
Qdrant 联合 Hugging Face、Common Crawl、Vultr 与阿里云,基于 FineWeb(超 15 万亿 token 的开源文本集)构建了名为 Fineweb-10B 的公开向量检索基准数据集。McKnight Consulting 分析师指出,此前在百亿向量规模上计算精确 ground truth 存在巨大算力门槛,企业普遍缺乏中立方法论评测自家检索系统的真实 recall;该数据集由第三方联合构建,被认为比厂商自证更具可信度。这类公开基准的出现,反映向量检索工作负载已普遍迈入十亿级以上规模。[5]
AWS 用 AI agent 驱动 SQL Server 到 Aurora PostgreSQL 迁移 · agent
AWS 在 DMS Schema Conversion 中引入 AI agent,通过自然语言编排 SQL Server 到 Aurora PostgreSQL 的 schema 转换流程。转换引擎分四步处理 T-SQL:前三步为确定性规则引擎(对已支持模式产出结果稳定一致),第四步才启用生成式 AI 处理规则引擎无法覆盖的代码结构,Agent 基于 AWS MCP Server 与专用技能包驱动。这种"规则优先、AI 兜底"的分层设计,是当前企业级数据库迁移 agent 化的一个具体样本。[6]
ClickHouse CEO:AI agent 终将自主决定基础设施与预算 · agent ⚠️ 观点表态
ClickHouse 联合创始人兼 CEO Aaron Katz 在播客中谈到,agent 最终会自行选择底层技术栈,这要求 agent 具备身份、预算与授权额度;目前企业仍由人工监控 agent 消费并设置限额,他预计3-5年内 agent 有望在这一环节实现自主化,但架构决策与预算控制权在未来十年内仍将留在人类手中。这属于 CEO 前瞻表态,非已落地产品能力。[7]
Databricks Genie 生态:本体化、企业落地案例与新功能并进 · ai-native
Databricks 近日连发三篇博文推进其 AI/BI agent 产品 Genie:一篇讲如何将企业本体(ontology)与语义层接入数据栈供 Genie 调用;一篇是客户案例,HR SaaS 厂商 Rippling 用 Genie 驱动 AI 营销分析;另一篇预告 Genie One 新增将洞察转化为行动的功能。三者均为厂商自有产品叙事,尚无第三方效果验证。[8]
湖仓 · 开放表格式 · HTAP
Neon 拆解 Lakebase Postgres 自动伸缩:生产库月均自调 3.2 万次 · lakehouse
Neon(现属 Databricks,其 Postgres 服务已更名 Lakebase Postgres)撰文披露,平台上平均一个生产数据库每月发生 32,016 次计算规格调整,约每 81 秒一次。这依赖于存算分离架构:计算节点与持久化存储解耦,令实例可以就地变配而无需搬迁数据。调度算法以 5 秒轮询周期跟踪 CPU 一分钟均值、内存两档频率信号,并把内存使用目标压在已分配 RAM 的 75% 以下防止 OOM。这类细粒度自动伸缩,是 Postgres 系厂商应对 agent 生成型应用突发负载的核心竞争点之一。[9]
AWS Kinesis Data Streams 原生直写 Apache Iceberg 流式表 · streaming
Amazon Kinesis Data Streams 新增 streaming tables 能力,可全托管地把流数据持续落为可查询的 Apache Iceberg 表(依托 Amazon S3 Tables),免去自建 Flink 连接器与格式转换。AWS 表示,相比自建方案可将投递成本降低最高 50%,并通过内联小文件合并将下游查询成本降低最高 30%;数据自动注册进 Glue Data Catalog,供 Athena/Redshift/Spark 及 AI agent 直接发现使用(厂商口径,未见第三方复现)。[10]
Starburst 主推查询缓存能力,冲刺 Trino 分析性能 · lakehouse ⚠️ 厂商口径
Starburst 近期重点宣传其查询缓存(query caching)能力,称可显著提升基于 Trino 的湖仓分析性能,但未披露具体加速倍数与测试口径。[11]
技术 · 架构 · 性能基准
性能 · 基准
· MLCommons 发布 MLPerf Storage v3.0:新增 KV Cache(衡量 LLM 推理缓存读写)与向量数据库(基于 Milvus、百万向量、1536 维,测每秒查询数与召回率/延迟权衡)两类测试,并新增 S3 对象存储访问层与现有 POSIX 层并列,约六分之一提交使用了 S3 层。本轮共 19 家厂商提交结果,DDN、Dell、华为、IBM、NetApp、VAST、WEKA 等传统存储厂商缺席——这是第三方标准化测试口径,非厂商自报。[12]
· AWS 实测 StarRocks 存算分离架构跨 arm64/x86 的 TPC-H/TPC-DS SF1000 基准:Graviton4(m8g)价格性能指数最优,同规格下比 x86 省 34%-52%,查询总耗时也更短(149s vs 194s);测试基于 StarRocks 官方 3.5.19 arm64 构建(尚未启用 SVE2 优化),结论指向此类扫描/聚合负载主要受内存带宽而非 SIMD 宽度制约。需注意该测试由 AWS 自身发布,非独立第三方。[13]
学界 · 研究前沿
· UBASE: An AI Search Engine for Trillion-Scale Vector Data Management at ByteDance(arXiv 2608.30607):字节跳动自 2016 年起支撑其搜索基础设施的向量检索系统,论文披露其扩展到万亿级向量规模的工程实践。[14]
· Diachronic Hypergraphs for Orchestrated Multi-Agent Multimodal Memory Curation(arXiv 2608.29678):提出用随时间演化的超图(hypergraph)结构组织多 agent、多模态协作中的长期记忆,切中当下 agent 记忆存储的痛点。[15]
· Evaluating LLMs on Conversational Text-to-SQL under Chain Ambiguity and Intent Drift(arXiv 2608.29543):系统评测 LLM 在多轮对话式 text-to-SQL 中应对指代歧义与用户意图漂移的能力,暴露当前自然语言查数据库方案的现实短板。[16]
· EvoSQL: Memory-Augmented Critic-Generator Co-Evolution for Text-to-SQL(arXiv 2607.20489):让生成器与评判器(critic)在带记忆机制下协同进化,用于处理复杂数据库查询的 text-to-SQL 任务。[17]
融资 · 并购 · 商业化
Deloitte 收购 Wavicle|并购|金额未披露
Deloitte 宣布收购数据与 AI 工程公司 Wavicle Data Solutions 的主要业务资产,后者是 Databricks 生态内的头部咨询伙伴,覆盖消费品、制造、金融服务、生命科学等行业的定制化数据工程能力。此次收购强化 Deloitte 作为 Databricks 企业级"编排方"的地位——此前 Deloitte 刚在 Databricks 2026 年度伙伴奖中拿下北美年度合作伙伴等三项大奖。这属于数据栈咨询生态的整合,而非数据库产品本身的并购。[18]
云厂商 · 生态 · 监管
Broadcom 押注私有云 AI agent:Tanzu 构建"零信任"agent 运行环境 · cloud
借 VMware Explore 2026(8月31日-9月3日)契机,Broadcom 阐述其 Tanzu 平台的 agent 安全路线:以 2025 年 8 月推出的 Tanzu Data Intelligence(多模态数据 lakehouse,宣称亚毫秒级响应处理 PB 级结构化/非结构化数据)为底座,叠加今年 4 月发布的 Tanzu Platform Agent Foundations——默认拒绝的网络模型,agent 未经服务绑定显式授权不能访问任何数据或服务,并以沙箱容器限制 CPU/内存、用可信 Buildpack 保证 agent 运行时不可被篡改。目标客群锁定金融等对数据不出私有云高度敏感的行业。[19]
Databricks 上线 Brickbuilder 合作伙伴四级体系
Databricks 正式推出 Brickbuilder Partner Network 的 Bronze/Silver/Gold/Platinum 四级体系,面向 ISV 与数据提供商,以其 Partner Well-Architected Framework 为技术准入门槛,分级决定联合营销与共同销售资源投入,意在把生态资源向真正投入深的伙伴倾斜。[20]
生态短讯:Neon 现已作为插件接入 Grok Bot,连接账号后即可在 Grok 对话中直接创建与操作 Neon 数据库。[21]