━━━━━ 正文从此处全选复制 ━━━━━
FutureX · Database
本期要点
· MLPerf Storage v3.0 加测向量库与 KV Cache 场景
· StarRocks 在 Graviton4 上性价比省 34%-52%(AWS 实测)
· LanceDB v0.38.0 发布,多项 breaking change
· Qdrant 发布 Fineweb-10B,支撑百亿级向量检索基准
· Deloitte 收购 Wavicle,加码 Databricks 咨询
· Neon:Lakebase Postgres 生产库月均自调 3.2万次
▎ 版本与产品发布
MotherDuck 上线 Read Scaling 读扩展功能 · olap
MotherDuck 给旗下这套基于 DuckDB 打造的云端分析平台加上了一项新本事,叫 Read Scaling。有了它,系统能在需要的时候临时多拨出几个只读计算节点专门跑分析查询,这样一来读请求扎堆、排队等待的问题就能缓解不少。不过厂商这次没有公布具体能扩几倍、延迟表现如何,所以这条只能先当作功能公告来看。[1]
pgEdge 本周密集更新 Postgres 分层存储与可观测性工具 · oltp
这一周里,pgEdge 一口气给它那套分布式 PostgreSQL 发行版做了好几处更新,涉及分层存储(tiered storage)、可观测性还有性能调优的整条工具链,核心思路是让那些冷门的大表数据存起来更省钱。至于具体升到了哪个版本号、跑分数据怎么样,官方这次没有公开。[2]
其他版本动态:ClickHouse 这次一口气推出了 v26.3/26.6/26.7/26.8 好几条线的 lts/stable 补丁包,但没提到有什么新特性;YugabyteDB 也很忙,密集放出 2025.2.7.0 以及 2026.1.x 系列的 backport 修复;Apache Doris 把 4.1.4-rc04 放了出来;Materialize 更新到 v26.40.0-rc.3;TiDB 则升级到 v8.5.7,这版里保留了一处修复——替换表达式时本地全文检索的状态问题得到了处理。[3]
▎ 数据库 × AI
LanceDB v0.38.0 发布,表存在性校验改为 manifest 权威 · vector
LanceDB 把稳定版升到了 v0.38.0,这一版带来不少不兼容的改动:以后判断一张表存不存在,得看 manifest 文件说了算(以前有时候会因为缓存没同步而误判);Python 绑定这边也做了硬性要求,必须用上 pydantic v2;分支合并的操作改名叫 cherry_pick 了;另外还给物化视图(materialized view)补上了 Node.js 绑定。差不多同一时间发出来的几个 0.38.0/0.39.0 beta 版本,还加进了 GPU 资源需求声明和 Blob v2 的 UDF 签名支持。作为一款主打 AI 原生的向量数据库,这些底层一致性上的修补,直接关系到生产环境里 embedding 存储靠不靠谱。[4]
Qdrant 发布 Fineweb-10B,为百亿级向量检索建公开基准 · vector
Qdrant 拉上 Hugging Face、Common Crawl、Vultr 还有阿里云一起,基于 FineWeb(这是一个超过 15 万亿 token 的开源文本合集)做出了一套叫 Fineweb-10B 的公开向量检索基准数据集。McKnight Consulting 的分析师提到,以前要在百亿这个量级的向量上算出精确的 ground truth,算力门槛高得吓人,很多企业根本没有中立的方法去验证自家检索系统的召回率到底真不真实。而这次的数据集是几方联手搞出来的第三方产物,可信度自然要比厂商自己说自己好高得多。这类公开基准接连出现,也说明向量检索这类负载如今普遍已经站到了十亿级以上的门槛上。[5]
AWS 用 AI agent 驱动 SQL Server 到 Aurora PostgreSQL 迁移 · agent
AWS 给 DMS Schema Conversion 装上了 AI agent,让用户能用自然语言来指挥 SQL Server 往 Aurora PostgreSQL 迁移时的 schema 转换流程。整套转换引擎处理 T-SQL 时分四步走:前面三步靠的是确定性的规则引擎,只要是规则引擎已经支持的模式,出来的结果就稳定可靠;到了第四步才会请出生成式 AI,专门去啃规则引擎搞不定的那些代码结构,而这个 Agent 是靠 AWS MCP Server 和一套专用技能包在背后驱动的。这种"先靠规则、AI 兜底"的分层做法,可以说是眼下企业级数据库迁移走向 agent 化的一个实实在在的例子。[6]
ClickHouse CEO:AI agent 终将自主决定基础设施与预算 · agent ⚠️ 观点表态
ClickHouse 的联合创始人兼 CEO Aaron Katz 在一档播客里谈到,agent 最终会自己挑基础技术栈用什么,而这就要求它具备身份、预算和授权额度这些东西;眼下企业还是靠人盯着 agent 花了多少钱、给它设个上限,他估计再过3-5年,agent 在这块有望实现自主运作,但真正把架构决策和预算控制权交出去,他觉得未来十年内还轮不到,仍会攥在人手里。这番话是 CEO 的前瞻性看法,不代表已经落地的产品能力。[7]
Databricks Genie 生态:本体化、企业落地案例与新功能并进 · ai-native
最近几天,Databricks 一连发了三篇博文,都是围绕它那款 AI/BI agent 产品 Genie 展开的:第一篇讲的是怎么把企业本体(ontology)和语义层接进数据栈,好让 Genie 能调用起来;第二篇是个客户案例,讲 HR SaaS 厂商 Rippling 怎么用 Genie 来做 AI 营销分析;第三篇则是预告,说 Genie One 马上要加一个能把洞察直接转化成行动的新功能。这三篇内容都是厂商自己讲自己的故事,还没有第三方出来验证效果究竟怎样。[8]
▎ 湖仓 · 开放表格式 · HTAP
Neon 拆解 Lakebase Postgres 自动伸缩:生产库月均自调 3.2 万次 · lakehouse
Databricks 旗下的 Neon(它那套 Postgres 服务如今改叫 Lakebase Postgres)发文透露了一个数字:平台上一个生产数据库平均每月会自动调整计算规格32,016 次,算下来差不多每 81 秒就要调一回。这背后靠的是存算分离的架构——计算节点跟持久化存储各干各的,实例想变配就地换就行,不用把数据搬来搬去。它的调度算法每 5 秒轮询一次,盯着 CPU 一分钟的均值和两档频率的内存信号,同时把内存使用目标死死压在已分配 RAM 的 75% 以内,免得触发 OOM。像这种精细到秒级的自动伸缩能力,正是 Postgres 系厂商用来应对 agent 生成型应用突发流量的核心竞争筹码之一。[9]
AWS Kinesis Data Streams 原生直写 Apache Iceberg 流式表 · streaming
Amazon Kinesis Data Streams 加了个 streaming tables 的新本事,能把流进来的数据全托管地持续落成可查询的 Apache Iceberg 表(背后靠的是 Amazon S3 Tables),这样一来就不用再自己搭 Flink 连接器、折腾格式转换了。AWS 方面说,跟自建方案比起来,这能把投递成本最多降低 50%;再加上内联小文件合并,下游查询成本最多还能再省 30%。数据落地后会自动注册进 Glue Data Catalog,Athena、Redshift、Spark 以及各类 AI agent 都能直接拿去用(这是厂商自己给的说法,暂时还没见第三方复现验证)。[10]
Starburst 主推查询缓存能力,冲刺 Trino 分析性能 · lakehouse ⚠️ 厂商口径
近段时间 Starburst 一直在重点宣传它的查询缓存(query caching)能力,说这能把基于 Trino 的湖仓分析性能明显提上去,但具体能快多少倍、测试是怎么口径的,官方没有说明。[11]
▎ 技术 · 架构 · 性能基准
性能 · 基准
· MLCommons 把 MLPerf Storage v3.0 放了出来,这一版新增了两类测试:一是 KV Cache,用来衡量 LLM 推理时缓存读写的表现;二是向量数据库,基于 Milvus,拿百万级向量、1536 维数据测每秒查询数和召回率/延迟之间怎么权衡。另外还新增了 S3 对象存储访问层,跟原有的 POSIX 层并列存在,这次大约六分之一的提交用上了 S3 层。总共有 19 家厂商参与提交结果,不过 DDN、Dell、华为、IBM、NetApp、VAST、WEKA 这些传统存储厂商这次都缺了席——这是第三方标准化测试拿到的口径,不是厂商自己报的数。[12]
· AWS 拿 StarRocks 存算分离架构在 arm64 和 x86 上跑了一遍 TPC-H/TPC-DS SF1000 基准测试:结果 Graviton4(m8g)的价格性能指数最出色,同等配置下比 x86 省下 34%-52%的开销,查询总耗时也更短,只要 149 秒,而 x86 要 194 秒;测试用的是 StarRocks 官方 3.5.19 的 arm64 构建,还没启用 SVE2 优化,结论指向这类扫描聚合类负载,主要受制于内存带宽而不是 SIMD 位宽。要注意的是,这份测试是 AWS 自己发布的,并非独立第三方所做。[13]
学界 · 研究前沿
· UBASE: An AI Search Engine for Trillion-Scale Vector Data Management at ByteDance(arXiv 2608.30607):这篇论文讲的是字节跳动从 2016 年起就用来支撑搜索基础设施的向量检索系统,把它一路扩展到万亿级向量规模背后的工程经验都写了出来。[14]
· Diachronic Hypergraphs for Orchestrated Multi-Agent Multimodal Memory Curation(arXiv 2608.29678):这篇提出用一种随时间不断演化的超图(hypergraph)结构,去组织多 agent、多模态协作场景里的长期记忆,正好戳中了当下 agent 记忆存储上的痛点。[15]
· Evaluating LLMs on Conversational Text-to-SQL under Chain Ambiguity and Intent Drift(arXiv 2608.29543):这篇做了系统性评测,看 LLM 在多轮对话式 text-to-SQL 场景下能不能扛住指代歧义和用户意图漂移,结果暴露出眼下用自然语言查数据库这条路子还有不少现实短板。[16]
· EvoSQL: Memory-Augmented Critic-Generator Co-Evolution for Text-to-SQL(arXiv 2607.20489):这篇的思路是让生成器跟评判器(critic)在带记忆机制的前提下一起协同进化,用来对付复杂数据库查询里的 text-to-SQL 任务。[17]
▎ 融资 · 并购 · 商业化
Deloitte 收购 Wavicle|并购|金额未披露
Deloitte 宣布把数据与 AI 工程公司 Wavicle Data Solutions 的主要业务资产收入囊中,Wavicle 在 Databricks 生态里算得上是头部咨询伙伴,业务覆盖消费品、制造、金融服务、生命科学等多个行业的定制化数据工程。这笔收购让 Deloitte 作为 Databricks 企业级"编排方"的地位更稳了——就在不久前,Deloitte 才刚在 Databricks 2026 年度伙伴奖上拿下北美年度合作伙伴等三项大奖。要说清楚的是,这属于数据栈咨询这块生态的整合,并不是针对数据库产品本身的并购。[18]
▎ 云厂商 · 生态 · 监管
Broadcom 押注私有云 AI agent:Tanzu 构建"零信任"agent 运行环境 · cloud
借着 VMware Explore 2026(8月31日到9月3日)这个场合,Broadcom 把 Tanzu 平台在 agent 安全方面的路子讲了讲:底座是去年 2025 年 8 月推出的 Tanzu Data Intelligence(一套多模态数据 lakehouse,号称能以亚毫秒级响应处理 PB 级的结构化和非结构化数据),在这基础上又叠加了今年 4 月发布的 Tanzu Platform Agent Foundations——这是个默认拒绝的网络模型,agent 要是没经过服务绑定明确授权,就什么数据、什么服务都碰不了;同时用沙箱容器限制住 CPU 和内存,还靠可信 Buildpack 保证 agent 运行时不会被人动手脚。目标客户瞄准的是金融这类对数据绝不能出私有云极其敏感的行业。[19]
Databricks 上线 Brickbuilder 合作伙伴四级体系
Databricks 正式把 Brickbuilder Partner Network 的四级体系——Bronze/Silver/Gold/Platinum——推了出来,面向的是 ISV 和数据提供商这类合作伙伴。这套体系拿它的 Partner Well-Architected Framework 当技术准入门槛,等级不同,联合营销和共同销售上能拿到的资源投入也不一样,用意就是把生态资源更多地倾斜给那些真正肯投入的深度合作伙伴。[20]
生态短讯:Neon 眼下已经能以插件形式接进 Grok Bot 了,账号一连上,就可以直接在 Grok 的对话里创建和操作 Neon 数据库。[21]
来源链接
[1] 〔来源〕TipRanks | 9月1日 https://www.tipranks.com/news/private-companies/motherduck-enhances-analytics-performance-with-read-scaling-feature
[2] 〔来源〕TipRanks | 约8月29-30日 https://www.tipranks.com/news/private-companies/pgedge-inc-sharpens-postgresql-tiered-storage-observability-and-performance-tooling-in-busy-week
[3] 〔5 方报道〕ClickHouse;YugabyteDB;Apache Doris;Materialize;TiDB https://github.com/ClickHouse/ClickHouse/releases/tag/v26.3.28.5-lts https://github.com/ClickHouse/ClickHouse/releases/tag/v26.8.2.7-lts
[4] 〔来源〕LanceDB | 约8月30日-9月1日 https://github.com/lancedb/lancedb/releases/tag/v0.38.0 https://github.com/lancedb/lancedb/releases/tag/v0.38.0-beta.15
[5] 〔来源〕TechTarget | 9月1日晚 https://www.techtarget.com/data-technologies/news/366649627/Qdrant-builds-dataset-to-benchmark-vector-retrieval-at-scale
[6] 〔来源〕Amazon Web Services (AWS) | 9月1日晚 https://aws.amazon.com/blogs/database/sql-server-to-aurora-postgresql-conversion-with-ai-agents-for-aws-dms/
[7] 〔来源〕Tech in Asia | 9月1日 https://www.techinasia.com/clickhouse-ceo-give-ai-agents-a-spending-limit
[8] 〔来源〕Databricks | 约8月28日-9月1日 https://www.databricks.com/blog/operationalizing-genie-ontology-your-data-stack https://www.databricks.com/customers/rippling/genie
[9] 〔来源〕Neon | 8月31日晚 https://neon.com/blog/autoscaling-lakebase-postgres
[10] 〔来源〕Amazon Web Services (AWS) | 9月1日 https://aws.amazon.com/blogs/big-data/deliver-real-time-data-to-streaming-tables-for-apache-iceberg-with-amazon-kinesis-data-streams/
[11] 〔来源〕TipRanks | 9月1日 https://www.tipranks.com/news/private-companies/starburst-highlights-query-caching-capabilities-to-enhance-analytics-performance
[12] 〔3 方报道〕HPCwire;The Manila Times;Blocks & Files https://www.hpcwire.com/2026/09/01/mlcommons-bolsters-mlperf-storage-benchmark-with-kv-cache-vector-db-and-s3-support/ https://www.manilatimes.net/2026/09/01/tmt-newswire/globenewswire/mlcommons-releases-new-mlperf-storage-v30-benchmark-results/2416343
[13] 〔来源〕Amazon Web Services (AWS) https://aws.amazon.com/cn/blogs/china/starrocks-architecture-arm64-vs-x86-testing/
[14] 〔来源〕arXiv https://arxiv.org/abs/2608.30607
[15] 〔来源〕arXiv https://arxiv.org/abs/2608.29678
[16] 〔来源〕arXiv https://arxiv.org/abs/2608.29543
[17] 〔来源〕arXiv https://arxiv.org/abs/2607.20489
[18] 〔来源〕PR Newswire | 8月31日晚 https://www.prnewswire.com/news-releases/deloitte-acquires-the-business-of-wavicle-accelerating-data-and-ai-engineering-capabilities-302864318.html
[19] 〔3 方报道〕thestack.technology;区块周刊BlockWeeks;Crypto Briefing | 8月31日-9月1日 https://www.thestack.technology/vmware-explore-broadcom-touts-faster-metal-to-model-partnerships-hardened-container-images/ https://blockweeks.com/news/308722
[20] 〔来源〕Databricks | 9月1日 https://www.databricks.com/blog/new-brickbuilder-partner-network-tiers-isvs-and-data-providers-are-here
[21] 〔来源〕Neon https://neon.com/blog/neon-is-now-available-in-grok-bot
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻