━━━━━ 正文从此处全选复制 ━━━━━
FutureX · Database
本期要点
· Milvus 客户端转正式 v3.0.0,不兼容 2.6 服务端
· Azure 9 月 CVE 集群蔓延至 PostgreSQL、计费层
· Snowflake 流式写入 Elastic Channels GA,单表 20GB/s
· OceanBase 对标 Databricks,押注万亿级 AI 数据基建市场
· Percona CEO:现有数据库都非 AI agent 理想选择
▎ 版本与产品发布
Milvus 客户端转正 v3.0.0,与 2.6 服务端不兼容 · vector
Milvus 官方推出了 Go 客户端的新版本 client/v3.0.0,这次 SDK 编号正式从 3.0.0-beta 跳到了符合 SemVer 规范的 GA 版本,也就是说 Milvus 3.0 这套生态终于算是站稳了脚跟;与此同时服务端也同步跟进,发了 v3.0.2 补丁。此次新版本换用了 v3 版本的 protobuf(也就是 milvus-proto/go-api/v3),因为这套类型跟 v2 已经互不兼容,想升级的用户得照着迁移指南把导入路径改一遍,而且要注意,这个新客户端不兼容 Milvus 2.6 的服务端。功能方面也添了不少东西:集合可以做快照了,能创建、能挂起、能恢复,还能按需触发垃圾回收;外部数据源现在能直接接进来并支持增量刷新;聚合方面新增了多字段桶聚合,涵盖 avg、sum、count、min、max;检索这块加了个 WithIDs 选项,可以拿已有的向量主键去查;另外查询排序这个功能也是新加的。[1]
Snowflake · Snowpipe Streaming Elastic Channels GA · streaming ⚠️ 厂商口径
Snowflake 宣布旗下 Snowpipe Streaming 的 Elastic Channels 功能已经正式 GA 上线,这意味着应用、设备或者服务今后可以直接把数据写进 Snowflake 的表,或者写进它托管的 Iceberg 表,不用再专门搭一套中间摄入系统来落数据了。到了 GA 这个阶段,单张表的吞吐量能跑到 20 GB/s,数据写进去最快 5 秒就能被查到;据官方在内测阶段透露的数据,单表的峰值一度被推到了 40 GB/s 这么高。已经在生产环境验证过的设计伙伴有两家:一家是 Yuvital,做的是用户行为和点击流方向;另一家是 HighByte,专注工业 IoT 数据。对那些已经在用 Kafka 做多消费者分发的团队来说,其实不用换掉 Kafka,只要把其中一份副本经由 Elastic Channels 写进 Snowflake 就行。[2]
其他方面还有几个版本更新:ClickHouse 这边放出了两个补丁版本,分别是 v26.8.7.19-lts 和 v26.7.11.16-stable [3];Materialize 一口气连发了三个版本,v26.42.0、v26.41.2,还有一个 v26.43.0-rc.1 [4];TiDB 更新到了 v26.3.15 [5];Weaviate 方面,v1.38.16 修了副本迁移之类的问题 [6],而 v1.40.0-rc.1 也进入了功能冻结阶段,主打的是 RQ-4 量化以及可删向量索引这两块,这个话题已经连续报道两期了 [7];YugabyteDB 当天一口气发了 8 个 backport 版本,大多是运维和日志相关的修复 [8]。
▎ 数据库 × AI
ClickHouse AI Functions:SQL 里直接调用 LLM · ai-native ⚠️ 厂商口径
ClickHouse 推出的 AI Functions 让用户能在 SQL 语句里直接调用 LLM 或者 embedding 服务:aiGenerate、aiClassify、aiExtract、aiTranslate 这几个是随 26.4 版本上线的,aiEmbed 是 26.6 才加进来的,而 aiFilter、aiRedact、aiSimilarity 则是在 26.8 里补上的,不过整套功能目前还处于 Beta 阶段。这背后的核心思路是把模型挪到数据这一侧,而不是反过来让数据去凑模型——考虑到 ClickHouse 本身已经具备存储和检索向量的能力,官方说这样一来 RAG 的整个流程理论上就不用再东拼西凑一个独立向量库、一套编排框架、外加一个外部 LLM API 了,一步就能在库内搞定。[9]
OceanBase 对标 Databricks,押注万亿级 AI 数据基建 · ai-native
OceanBase 在外滩大会上联手 IDC 放出一份测算:中国 AI 数据基础设施这个市场,2025 年的规模大概是 149 亿美元,往后每年按 37.7% 的复合增速往上走,到 2030 年能到 738 亿美元,一路到 2035 年更是能摸到约 1 万亿元人民币的量级——比起 2025 年那个起点,涨幅超过了 10 倍;IDC 也提出一个判断,认为往后大家竞争的重心会从拼模型转向拼数据基建。OceanBase 今年 6 月发布的那套"湖库一体"AI 数据库(包括 Lakebase、seekdb 这些产品线)已经被定位成撬动这个市场的抓手,而管理层这次把对标的估值目标定成了 Databricks——后者今年 8 月刚完成一轮 50 亿美元的融资,估值来到 1900 亿美元;巧的是,这两家公司不约而同都把自己面向 agent 的数据库产品叫作 Lakebase。据 OceanBase 方面透露的数字,2026 年他们的年化收入已经冲过了 14 亿元人民币,同比增速大约在 70% 左右。[10]
Percona CEO:AI agent 专属数据库尚不存在 · agent
Percona 的 CEO Peter Farkas 在阿姆斯特丹举行的 Percona Live 大会上接受《The Register》采访时说,眼下这个 AI 时代,还没真正出现一款适合 agent 工作负载的数据库:像 MySQL、PostgreSQL、MongoDB 这些打磨了几十年的成熟系统,说到底都不是冲着"agent 一口气试 150 种方案、再从里面挑一个最优解"这种高频迭代式的负载去设计的。在他看来,AI 应用目前也只能凑合用现成的数据库,真正为 agentic 负载量身定制的产品,恐怕得等市场需求稳定下来之后才会出现——他的原话是,"没有足够的时间让新东西积累出老牌数据库那样的成熟度"。[11]
Dnotitia 展示服务器级专用向量检索硅片 · vector ⚠️ 单方口径
在 AI Infra Summit 2026 上,Dnotitia 拿出了一款面向服务器规模部署的专用向量检索硬件,主打的思路是把向量近邻检索这活儿直接下沉到硬件层去做,从而绕开用通用 GPU 跑 ANN 计算所带来的算力和功耗开销,不过具体细节目前还没有第三方去验证过。[12]
▎ 技术 · 架构 · 性能基准
Show HN:Scry 把 500TB 公开语料装进 ClickHouse 供 agent 查询
有个人开发者上线了一个叫 Scry 的项目,把 Reddit、Hacker News、LessWrong、arXiv、Stack Exchange、Wikipedia 这些公开语料统统索引进了一套规模约 500TB 的 NVMe ClickHouse 集群里,然后通过 MCP 协议把它开放给 agent 用,agent 可以在上面跑只读 SQL,也能跑一部分 Datalog 查询,而且针对每次查询都设了超时时间、内存上限和返回行数上限,目的就是让 agent 直接"跑查询"拿结果,而不是老是去反复抓网页再自己拼凑。这个项目在 HN 上拿到了 43 个赞、21 条评论。作者自己测了一下,在 Google 的 DeepSearchQA 基准(这是个包含 900 道题、需要精确匹配答案的研究型问答集)上,经 Scry 检索之后 agent 的答对率能到 71.8%,比 Google 自家在 Kaggle 榜单上公布的 Gemini Deep Research Agent 那个 66.1% 还要高——不过话说回来,它的语料覆盖面其实连 Common Crawl 的一半都不到,测评方法跟 Google 官方那套跑分是不是完全对得上,也还没经过第三方复核。[13]
DuckDB-Wasm 借 OPFS 实现浏览器端真持久化
DuckDB 官方博客发文介绍,DuckDB-Wasm 现在借助浏览器的 OPFS(也就是 Origin Private File System,说白了就是一套同源沙箱化的持久文件系统)实现了真正意义上的浏览器端持久数据库:只要用 opfs:// 这个路径打开 .duckdb 文件,就自带了 WAL 和检查点机制,就算刷新页面或者重启浏览器,数据也不会丢,导出之后这份数据还能被 DuckDB 的 CLI 或者 Python 客户端直接打开。文章里也提醒了一个坑:npm 上现在标着 latest 的那个版本会创建出 OPFS 文件,但实际上从来不往里面写数据,想要真正实现持久化,得把版本锁定在 1.32.0 或者 1.33.1-dev64.0 以上才行。[14]
TimescaleDB:如何给复合索引的写入成本定价
TimescaleDB 官方博客给出了一套复合索引的成本核算思路:每次写入数据,复合索引都要收一笔"过路费",可真正能从中受益的查询却只是一部分而已;文章为此设计了一个四步流程,专门用来给现有索引的写入代价和查询收益做个定价,好让团队看清楚哪些复合索引其实留着也没多大用处。[15]
学界 · 研究前沿
· ZigZag Trie: A Novel Index for Contextual Queries(arXiv 2609.19914):这篇论文盯上的是"字符串 P 出现在更长文本 T 中的上下文"这类检索需求,提出了一种新的索引结构,用来降低传统后缀结构处理上下文查询时的开销。[16]
· Reverse Neighbor Sliding and Order Selection for Efficient Multi-Proximity Graph Merging(arXiv 2602.17099):这篇研究瞄准的是高维近似最近邻(AKNN)检索里近邻图合并这个环节,提出了反向邻居滑动加上顺序选择的策略,用来给向量索引的构建过程提速。[17]
· Efficiently Linking Unstructured Data for Multi-step Reasoning(arXiv 2609.19491):这篇论文研究的场景是 LLM 或者 agent 需要跨多个来源的非结构化证据做多步推理,探讨的是怎样高效地把散落各处的数据关联起来,从而撑起整条数据工程流水线。[18]
· A Functional Pilot for Certified Freshness-Aware Semantic-Spatial Range Retrieval(arXiv 2609.19855):这篇论文针对的是地理场景里那种"某个半径范围内所有满足语义阈值的对象"这类检索需求,探索的是一种既能兼顾新鲜度保证、又能把语义和空间结合起来查询的方案。[19]
▎ 云厂商 · 生态 · 监管
Azure 9 月 CVE 集群蔓延至数据层与计费层 · cloud
Microsoft 这周把 Azure AI Foundry 那个满分级别的漏洞给修了:CVE-2026-85889(CVSS 打了满分 10.0,问题出在关键功能缺失身份验证,可能导致越权提权)的正式补丁已经放出来了,官方说用户不用做任何操作,而且到目前为止也没发现有在野利用的证据。同一天,Tenable 和 MITRE 又确认了两条新的 CVE,也就是说这波从 9 月开始的 Azure 漏洞集群,已经从身份层一路蔓延到了数据层和计费层:一个是 Azure Database for PostgreSQL 上的 CVE-2026-85878(CVSS 9.9,会导致越权提权),另一个是 Azure Billing 上的 CVE-2026-62874(CVSS 同样是满分 10.0,不需要身份验证就能篡改计费完整性)。再加上之前已经曝出来的 Cosmos DB(CVSS 8.5)、Microsoft Fabric(CVSS 10.0)等等,这一轮漏洞集群累计下来已经涉及了 10 余项服务,身份、AI、数据、计费这四层都被牵扯进去了。[20]
Snowflake × STACKIT,欧盟数据主权合规再落一子 · cloud
Snowflake 宣布跟欧洲云服务商 STACKIT 达成了集成合作,专门为那些受欧盟数据主权要求约束的客户提供本地化的数据驻留和合规选项,算是 Snowflake 在欧洲合规这盘棋上又落下的一子。[21]
达梦数据落地平陆运河数字化管理系统
国产数据库厂商达梦数据的产品这次被用到了平陆运河通航后的数字化管理系统里,为其提供支撑,这也是国产数据库又一次在国家级水运基建项目里落地,不过具体的技术细节目前还没有披露。[22]
文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻