━━━━━ 正文从此处全选复制 ━━━━━

FutureX · Database

本期要点

· MLPerf Storage v3.0 加测向量库与 KV Cache 场景

· StarRocks 在 Graviton4 上性价比省 34%-52%(AWS 实测)

· LanceDB v0.38.0 发布,多项 breaking change

· Qdrant 发布 Fineweb-10B,支撑百亿级向量检索基准

· Deloitte 收购 Wavicle,加码 Databricks 咨询

· Neon:Lakebase Postgres 生产库月均自调 3.2万次

▎ 版本与产品发布

MotherDuck 上线 Read Scaling 读扩展功能 · olap

MotherDuck 为其基于 DuckDB 的云分析平台新增 Read Scaling 功能,可为分析型查询按需分配额外只读计算节点,缓解高并发读负载下的排队问题。厂商未披露具体扩容倍数与延迟数据,暂按功能公告处理。[1]

pgEdge 本周密集更新 Postgres 分层存储与可观测性工具 · oltp

pgEdge 在同一周内更新了 PostgreSQL 分布式发行版的分层存储(tiered storage)、可观测性与性能调优工具链,主打降低大表冷数据的存储成本。具体版本号与基准数据未披露。[2]

其他版本动态:ClickHouse 发布多个 v26.3/26.6/26.7/26.8 系列 lts/stable 补丁(无新特性披露);YugabyteDB 密集发布 2025.2.7.0 与 2026.1.x 系列 backport 修复;Apache Doris 发布 4.1.4-rc04;Materialize 发布 v26.40.0-rc.3;TiDB 发布 v8.5.7(保留表达式替换时的本地全文检索状态修复)。[3]

▎ 数据库 × AI

LanceDB v0.38.0 发布,表存在性校验改为 manifest 权威 · vector

LanceDB 发布 v0.38.0 稳定版,带多项 breaking change:表存在性判断改由 manifest 文件权威裁定(此前可能因缓存不一致误判)、Python 绑定强制要求 pydantic v2、分支合并操作更名为 cherry_pick,并新增物化视图(materialized view)的 Node.js 绑定。同期多个 0.38.0/0.39.0 beta 版本还加入 GPU 资源需求声明、Blob v2 UDF 签名支持。作为 AI 原生向量数据库的代表项目,这类底层一致性修复直接影响生产环境的 embedding 存储可靠性。[4]

Qdrant 发布 Fineweb-10B,为百亿级向量检索建公开基准 · vector

Qdrant 联合 Hugging Face、Common Crawl、Vultr 与阿里云,基于 FineWeb(超 15 万亿 token 的开源文本集)构建了名为 Fineweb-10B 的公开向量检索基准数据集。McKnight Consulting 分析师指出,此前在百亿向量规模上计算精确 ground truth 存在巨大算力门槛,企业普遍缺乏中立方法论评测自家检索系统的真实 recall;该数据集由第三方联合构建,被认为比厂商自证更具可信度。这类公开基准的出现,反映向量检索工作负载已普遍迈入十亿级以上规模。[5]

AWS 用 AI agent 驱动 SQL Server 到 Aurora PostgreSQL 迁移 · agent

AWS 在 DMS Schema Conversion 中引入 AI agent,通过自然语言编排 SQL ServerAurora PostgreSQL 的 schema 转换流程。转换引擎分四步处理 T-SQL:前三步为确定性规则引擎(对已支持模式产出结果稳定一致),第四步才启用生成式 AI 处理规则引擎无法覆盖的代码结构,Agent 基于 AWS MCP Server 与专用技能包驱动。这种"规则优先、AI 兜底"的分层设计,是当前企业级数据库迁移 agent 化的一个具体样本。[6]

ClickHouse CEO:AI agent 终将自主决定基础设施与预算 · agent ⚠️ 观点表态

ClickHouse 联合创始人兼 CEO Aaron Katz 在播客中谈到,agent 最终会自行选择底层技术栈,这要求 agent 具备身份、预算与授权额度;目前企业仍由人工监控 agent 消费并设置限额,他预计3-5年内 agent 有望在这一环节实现自主化,但架构决策与预算控制权在未来十年内仍将留在人类手中。这属于 CEO 前瞻表态,非已落地产品能力。[7]

Databricks Genie 生态:本体化、企业落地案例与新功能并进 · ai-native

Databricks 近日连发三篇博文推进其 AI/BI agent 产品 Genie:一篇讲如何将企业本体(ontology)与语义层接入数据栈供 Genie 调用;一篇是客户案例,HR SaaS 厂商 Rippling 用 Genie 驱动 AI 营销分析;另一篇预告 Genie One 新增将洞察转化为行动的功能。三者均为厂商自有产品叙事,尚无第三方效果验证。[8]

▎ 湖仓 · 开放表格式 · HTAP

Neon 拆解 Lakebase Postgres 自动伸缩:生产库月均自调 3.2 万次 · lakehouse

Neon(现属 Databricks,其 Postgres 服务已更名 Lakebase Postgres)撰文披露,平台上平均一个生产数据库每月发生 32,016 次计算规格调整,约每 81 秒一次。这依赖于存算分离架构:计算节点与持久化存储解耦,令实例可以就地变配而无需搬迁数据。调度算法以 5 秒轮询周期跟踪 CPU 一分钟均值、内存两档频率信号,并把内存使用目标压在已分配 RAM 的 75% 以下防止 OOM。这类细粒度自动伸缩,是 Postgres 系厂商应对 agent 生成型应用突发负载的核心竞争点之一。[9]

AWS Kinesis Data Streams 原生直写 Apache Iceberg 流式表 · streaming

Amazon Kinesis Data Streams 新增 streaming tables 能力,可全托管地把流数据持续落为可查询的 Apache Iceberg 表(依托 Amazon S3 Tables),免去自建 Flink 连接器与格式转换。AWS 表示,相比自建方案可将投递成本降低最高 50%,并通过内联小文件合并将下游查询成本降低最高 30%;数据自动注册进 Glue Data Catalog,供 Athena/Redshift/Spark 及 AI agent 直接发现使用(厂商口径,未见第三方复现)。[10]

Starburst 主推查询缓存能力,冲刺 Trino 分析性能 · lakehouse ⚠️ 厂商口径

Starburst 近期重点宣传其查询缓存(query caching)能力,称可显著提升基于 Trino 的湖仓分析性能,但未披露具体加速倍数与测试口径。[11]

▎ 技术 · 架构 · 性能基准

性能 · 基准

· MLCommons 发布 MLPerf Storage v3.0:新增 KV Cache(衡量 LLM 推理缓存读写)与向量数据库(基于 Milvus、百万向量、1536 维,测每秒查询数与召回率/延迟权衡)两类测试,并新增 S3 对象存储访问层与现有 POSIX 层并列,约六分之一提交使用了 S3 层。本轮共 19 家厂商提交结果,DDN、Dell、华为、IBM、NetApp、VAST、WEKA 等传统存储厂商缺席——这是第三方标准化测试口径,非厂商自报。[12]

· AWS 实测 StarRocks 存算分离架构跨 arm64/x86 的 TPC-H/TPC-DS SF1000 基准:Graviton4(m8g)价格性能指数最优,同规格下比 x86 省 34%-52%,查询总耗时也更短(149s vs 194s);测试基于 StarRocks 官方 3.5.19 arm64 构建(尚未启用 SVE2 优化),结论指向此类扫描/聚合负载主要受内存带宽而非 SIMD 宽度制约。需注意该测试由 AWS 自身发布,非独立第三方。[13]

学界 · 研究前沿

· UBASE: An AI Search Engine for Trillion-Scale Vector Data Management at ByteDance(arXiv 2608.30607):字节跳动自 2016 年起支撑其搜索基础设施的向量检索系统,论文披露其扩展到万亿级向量规模的工程实践。[14]

· Diachronic Hypergraphs for Orchestrated Multi-Agent Multimodal Memory Curation(arXiv 2608.29678):提出用随时间演化的超图(hypergraph)结构组织多 agent、多模态协作中的长期记忆,切中当下 agent 记忆存储的痛点。[15]

· Evaluating LLMs on Conversational Text-to-SQL under Chain Ambiguity and Intent Drift(arXiv 2608.29543):系统评测 LLM 在多轮对话式 text-to-SQL 中应对指代歧义与用户意图漂移的能力,暴露当前自然语言查数据库方案的现实短板。[16]

· EvoSQL: Memory-Augmented Critic-Generator Co-Evolution for Text-to-SQL(arXiv 2607.20489):让生成器与评判器(critic)在带记忆机制下协同进化,用于处理复杂数据库查询的 text-to-SQL 任务。[17]

▎ 融资 · 并购 · 商业化

Deloitte 收购 Wavicle|并购|金额未披露

Deloitte 宣布收购数据与 AI 工程公司 Wavicle Data Solutions 的主要业务资产,后者是 Databricks 生态内的头部咨询伙伴,覆盖消费品、制造、金融服务、生命科学等行业的定制化数据工程能力。此次收购强化 Deloitte 作为 Databricks 企业级"编排方"的地位——此前 Deloitte 刚在 Databricks 2026 年度伙伴奖中拿下北美年度合作伙伴等三项大奖。这属于数据栈咨询生态的整合,而非数据库产品本身的并购。[18]

▎ 云厂商 · 生态 · 监管

Broadcom 押注私有云 AI agent:Tanzu 构建"零信任"agent 运行环境 · cloud

VMware Explore 2026(8月31日-9月3日)契机,Broadcom 阐述其 Tanzu 平台的 agent 安全路线:以 2025 年 8 月推出的 Tanzu Data Intelligence(多模态数据 lakehouse,宣称亚毫秒级响应处理 PB 级结构化/非结构化数据)为底座,叠加今年 4 月发布的 Tanzu Platform Agent Foundations——默认拒绝的网络模型,agent 未经服务绑定显式授权不能访问任何数据或服务,并以沙箱容器限制 CPU/内存、用可信 Buildpack 保证 agent 运行时不可被篡改。目标客群锁定金融等对数据不出私有云高度敏感的行业。[19]

Databricks 上线 Brickbuilder 合作伙伴四级体系

Databricks 正式推出 Brickbuilder Partner Network 的 Bronze/Silver/Gold/Platinum 四级体系,面向 ISV 与数据提供商,以其 Partner Well-Architected Framework 为技术准入门槛,分级决定联合营销与共同销售资源投入,意在把生态资源向真正投入深的伙伴倾斜。[20]

生态短讯:Neon 现已作为插件接入 Grok Bot,连接账号后即可在 Grok 对话中直接创建与操作 Neon 数据库。[21]

来源链接

[1] 〔来源〕TipRanks | 9月1日 https://www.tipranks.com/news/private-companies/motherduck-enhances-analytics-performance-with-read-scaling-feature

[2] 〔来源〕TipRanks | 约8月29-30日 https://www.tipranks.com/news/private-companies/pgedge-inc-sharpens-postgresql-tiered-storage-observability-and-performance-tooling-in-busy-week

[3] 〔5 方报道〕ClickHouse;YugabyteDB;Apache Doris;Materialize;TiDB https://github.com/ClickHouse/ClickHouse/releases/tag/v26.3.28.5-lts https://github.com/ClickHouse/ClickHouse/releases/tag/v26.8.2.7-lts

[4] 〔来源〕LanceDB | 约8月30日-9月1日 https://github.com/lancedb/lancedb/releases/tag/v0.38.0 https://github.com/lancedb/lancedb/releases/tag/v0.38.0-beta.15

[5] 〔来源〕TechTarget | 9月1日晚 https://www.techtarget.com/data-technologies/news/366649627/Qdrant-builds-dataset-to-benchmark-vector-retrieval-at-scale

[6] 〔来源〕Amazon Web Services (AWS) | 9月1日晚 https://aws.amazon.com/blogs/database/sql-server-to-aurora-postgresql-conversion-with-ai-agents-for-aws-dms/

[7] 〔来源〕Tech in Asia | 9月1日 https://www.techinasia.com/clickhouse-ceo-give-ai-agents-a-spending-limit

[8] 〔来源〕Databricks | 约8月28日-9月1日 https://www.databricks.com/blog/operationalizing-genie-ontology-your-data-stack https://www.databricks.com/customers/rippling/genie

[9] 〔来源〕Neon | 8月31日晚 https://neon.com/blog/autoscaling-lakebase-postgres

[10] 〔来源〕Amazon Web Services (AWS) | 9月1日 https://aws.amazon.com/blogs/big-data/deliver-real-time-data-to-streaming-tables-for-apache-iceberg-with-amazon-kinesis-data-streams/

[11] 〔来源〕TipRanks | 9月1日 https://www.tipranks.com/news/private-companies/starburst-highlights-query-caching-capabilities-to-enhance-analytics-performance

[12] 〔3 方报道〕HPCwire;The Manila Times;Blocks & Files https://www.hpcwire.com/2026/09/01/mlcommons-bolsters-mlperf-storage-benchmark-with-kv-cache-vector-db-and-s3-support/ https://www.manilatimes.net/2026/09/01/tmt-newswire/globenewswire/mlcommons-releases-new-mlperf-storage-v30-benchmark-results/2416343

[13] 〔来源〕Amazon Web Services (AWS) https://aws.amazon.com/cn/blogs/china/starrocks-architecture-arm64-vs-x86-testing/

[14] 〔来源〕arXiv https://arxiv.org/abs/2608.30607

[15] 〔来源〕arXiv https://arxiv.org/abs/2608.29678

[16] 〔来源〕arXiv https://arxiv.org/abs/2608.29543

[17] 〔来源〕arXiv https://arxiv.org/abs/2607.20489

[18] 〔来源〕PR Newswire | 8月31日晚 https://www.prnewswire.com/news-releases/deloitte-acquires-the-business-of-wavicle-accelerating-data-and-ai-engineering-capabilities-302864318.html

[19] 〔3 方报道〕thestack.technology;区块周刊BlockWeeks;Crypto Briefing | 8月31日-9月1日 https://www.thestack.technology/vmware-explore-broadcom-touts-faster-metal-to-model-partnerships-hardened-container-images/ https://blockweeks.com/news/308722

[20] 〔来源〕Databricks | 9月1日 https://www.databricks.com/blog/new-brickbuilder-partner-network-tiers-isvs-and-data-providers-are-here

[21] 〔来源〕Neon https://neon.com/blog/neon-is-now-available-in-grok-bot

FutureX · 记录未来如何发生

素材来源多方媒体/网络新闻