FutureX · Database
本期要点
· Elastic 称其指标引擎比 ClickHouse 快 8 倍,直接对标 ClickHouse 系可观测场景(厂商口径)
· Google AlloyDB 预览「agent 节点」:秒级拉起、只读、与生产集群物理隔离
· Pinecone BYOC 覆盖 AWS / Azure / GCP,数据面留在客户云账号内
· OceanBase 以 GLM-5.2 提交的 Scout 方案登顶 Data Agent Benchmark,90.62%(自报提交)
· 阿里云云栖发布 Agent Context 与 ApsaraLakebase,称 RDS PostgreSQL 新增实例约 80% 由 Agent 创建
· Pinterest 用量化把向量索引压小,生产服务成本降 20%-30%
▎ 版本与产品发布
Elastic 指标平台:Elasticsearch 内新增指标专用 column store · olap ⚠️ 厂商口径
Elastic 在投资者电话会上介绍其指标产品(6 月随新财年推出),称已把 Elasticsearch 重构为可承载指标负载:文档存储管日志与链路、column store 管指标、向量存储管向量数据。设计目标是不限制高基数维度(unique 维度组合很多的数据),靠维度过滤与存储 codec 调优来控制查询与存储成本。Elastic 称基准与代码已开源在 GitHub,结果为比 Prometheus / Mimir 快 30 倍、比 ClickHouse 快 8 倍;这些数字由 Elastic 自己给出,电话会上未经第三方验证。兼容性上称与常见 PromQL 仪表盘的兼容度已达 90%,并提供迁移工具。公司还提到已收购做 agent 根因分析的 Deductive AI,更多可观测发布留到 10 月 8 日的 ElasticON 纽约站。对 ClickHouse 系而言,Elastic 从搜索侧进入指标 / 可观测的列存赛道,"AI 负载让指标量暴增"是它的叙事,实际差距需要独立基准来验证。[1]
SereneDB 发布 Krummelanke:直接在 S3 上做全文检索的开源引擎 ⚠️ 厂商口径
Krummelanke 采用 Apache 2.0 协议,兼容 Postgres 与 Elastic,把搜索与分析放在同一个引擎里。它要解决的痛点是:分析引擎读 S3 上的列存靠大块顺序扫描,符合对象存储的延迟特性;全文检索依赖倒排索引,需要大量随机访问,所以 Lucene 系引擎通常把索引放在本地闪存,可搜索的数据要多存一份(即"copy-first")。SereneDB 称其自研的 IResearch 核心可以原地索引数据、无需复制,并称搜索操作"以纳秒计"、十亿级记录问答"毫秒返回"、是"全球最快的数据库搜索引擎",均为自述、未见第三方基准。CTO 强调与 Cloudian 等"给存储桶挂元数据搜索"的方案不同,它是搜索引擎层面的差异。[2]
Snowflake Interactive Analytics 夏季更新:Terraform 资源、dbt 物化、扫描优化 · olap
三项更新聚焦"接入现有工具链":新增 snowflake_warehouse_interactive Terraform 资源(预览,需在 provider 中开启 preview 特性),此前只能靠 snowflake_execute 绕行,丢失 plan/apply 与漂移检测;dbt-fusion v2.0.0 起 Snowflake 适配器原生支持 interactive_table 物化类型(beta,必须指定 cluster_by);Interactive Warehouse 还加入引擎级优化,针对子串 LIKE、非前导聚簇列等值这类无法靠 micro-partition 剪枝的谓词,减少重复查询的无效扫描。这是 Snowflake 主打低延迟交互查询的配套完善,对标实时分析引擎的动作。[3]
其他版本动态:Apache Iceberg 1.12.0-rc2 出炉,正式版临近;Apache Druid 38.0.0-rc1、Apache Doris 4.1.4.1-rc01、Materialize v26.44.0-rc.1 均为候选版;CockroachDB v26.2.7、Weaviate v1.39.7(修复 async replication 与 RAFT 启动竞态,无新功能)、LanceDB v0.40.0-beta.7~11(新增 view CRUD API、可清理任务的 drop_view,beta.9 含 node 端 breaking change)、TiDB 多个分支补丁、YugabyteDB 多条 backport 构建。[4]
▎ 数据库 × AI
Google AlloyDB「PostgreSQL for agents」:临时 agent 节点与生产集群物理隔离 · agent
Google Cloud 于 9 月 24 日发布预览版(需申请)。针对多个 agent 同时反复查询造成的突发负载,AlloyDB 可在数秒内拉起临时只读 agent 节点,直接从 Colossus 存储读取新鲜的生产数据,计算、网络、存储路径均与主集群隔离;任务结束后节点可停止、计算缩到零,按秒计费。与传统 read replica 的区别是:replica 通常要预先配置并有独立数据复制,而 agent 节点是按需创建的一次性算力,重点是把 agent 负载与线上交易隔开。[5]
Pinecone BYOC 扩展至 AWS、Azure、GCP · vector
Pinecone 的 bring-your-own-cloud 模式把数据面放进客户自己的云账号和区域,Pinecone 控制面只管资源生命周期、认证与服务健康,据称不存储或处理客户内容与请求载荷。运维由控制面通过出站调用下发、在本地执行,不需要 SSH、VPN、入站网络或长期跨账号 IAM 角色。管理员使用与标准部署相同的 API、SDK 与控制面流程。Toyota Motor North America 是首批生产用户,把制造知识库留在自家环境内。报道称 Pinecone 还在向本地部署(on-prem)延伸。这对合规敏感客户是补课:Weaviate、Qdrant、Milvus 等开源向量库本来就能自托管。[6]
阿里云云栖:Agent Context、ApsaraLakebase 与 AIDBS 升级 · ai-native ⚠️ 厂商口径
阿里云提出 Context Engine,把企业数据转成 Agent 的实时上下文,并发布两款数据库新品。ApsaraLakebase 以对象存储为单一数据源,支持 Lance、Apache Iceberg、Apache Paimon 等开放格式,让结构化数据、文件、向量索引、图关系和上下文记忆共用一套体系;昆仑万维的 Agent 平台用它支撑 300 万+ Agent 独立工作空间。Agent Context 提供跨会话、跨任务、跨 Agent 复用的记忆与知识层,官方称 token 使用效率可提升 3 倍以上、复杂知识任务准确率最高提升 50 个百分点,小红书用它为 3000+ 员工的子 Agent 建统一上下文底座。阿里云数据库负责人称,过去一年 RDS PostgreSQL 新增实例环比增长 400%+,约 80% 由 Agent 创建、约 50% 的输入输出流量由 Agent 驱动。以上均为阿里云自报,未见第三方数据。产品形态与 Databricks/Neon 的 Lakebase 思路相近。[7]
OceanBase 方案登顶 Data Agent Benchmark,准确率 90.62% · ai-native ⚠️ 自报口径
基准 DAB 由 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 推出,覆盖 7 个行业、PostgreSQL / MongoDB / SQLite / DuckDB 等多种库,考察 agent 从理解数据到验证结果的端到端能力,而非单纯 Text-to-SQL。OceanBase 用 GLM-5.2 构建的内部代号 Scout 方案,称是榜上首个突破 90% 的方案,超过基于 GPT、Claude 系模型的方案。Scout 通过 DataLens 做数据画像、规划执行路径,再以证据追踪与答案校验形成闭环,能力将并入 OceanBase DataPilot。成绩来自 OceanBase 自己的提交,榜单方口径以榜单为准;这里的成绩体现的是"模型 + agent + 数据系统"组合,不是数据库引擎本身。[8]
▎ 技术 · 架构 · 性能基准
Pinterest Manas:量化 + SSD 上的 SPANN,替代内存型 HNSW · vector
Pinterest 的搜索平台 Manas 部署在 80 个集群,服务数百亿嵌入。在 1 亿条 GraphSage 数据集的离线测试中,HNSW 基线 121 GB、Recall@100 为 93.72%;加标量量化(SQ)后 50 GB、召回 92.92%、吞吐反升至 305.2 QPS;加乘积量化(PQ)后 32 GB、召回降至 77.25%。SQ 在 IVF 上压到 25 GB 而召回 95.71%。线上落地后生产服务成本降 20%-30%;用 SIMD 实现的线性缩放 SQ 减少查询算力 10%-15%。SSD 服务方面,PQ 版 SPANN 吞吐是 DiskANN 的 3 倍、延迟为三分之一、召回降约 5%,在 50 亿级向量评估里比全内存 HNSW 节省超 40% CPU 时间。团队还在试点 ColBERT 类多向量 late-interaction 检索。以上均为 Pinterest 自家工程数据,非第三方基准,但工程细节完整。[9]
Tiger Data(TimescaleDB):一条 20 字节的传感器读数落盘 95.6 字节 · oltp
Tiger Data 给出的估算方法:timestamp + tag_id + float 共 20 字节,加上 23 字节 tuple 头、对齐填充与索引,实测占用 95.6 字节,约为朴素估算的 4.8 倍,"看似 12 TB 的方案实际是 60 TB"。文中测得 10 万级传感器规模下重写表需持 ACCESS EXCLUSIVE 锁:1000 万行约 19 秒,推算 6310 亿行约两周。测试环境为 Postgres 16.13、2 核、128 MB shared_buffers,作者自己也说数字因环境而异,价值在方法:先用真实行与真实索引建 PoC 表再测。此文出自 TimescaleDB 厂商,也是在为自家时序扩展做铺垫。[10]
DuckDB 直读 Hugging Face 数据集 · olap
DuckDB 官方博客介绍可直接读取 Hugging Face 上数十万数据集,无需先下载。这延续 DuckDB 作为跨引擎"数据结缔组织"的定位(已报),本条为使用层面的扩展。[11]
▎ 云厂商 · 生态 · 监管
Neon 披露:Electric 团队并入后将为 Neon 做 realtime 同步 · agent
Neon 的后端全线 GA(已报)之后,下一步是在平台里加入 realtime / sync,由已加入 Databricks 旗下 Neon 的 Electric 团队负责。Electric 联合创始人 James Arthur 表示,sync 更适合作为 BaaS 平台的一项功能而非独立产品,且 agent 需要更高层的抽象。他也承认 realtime 常"demo 很好、上生产就掉链子",核心矛盾是可同步内容的表达力与性能。目前是路线图口径,暂无发布时间与产品细节。[12]
Aiven 拓展印度市场;Snowflake Cortex AI 上线 Kimi K3 · cloud
芬兰托管数据基础设施厂商 Aiven 宣布进入印度,瞄准 AI 与云数据基础设施需求。Snowflake 同日宣布 Kimi K3 上线 Cortex AI,继续扩充平台内可调用的第三方模型。两条均只有标题级信息,细节未展开。[13]
来源链接
[1] 〔来源〕TradingView | 约 9 月 25 日 https://www.tradingview.com/news/marketbeat:3d5602721094b:0-elastic-unveils-ai-era-metrics-platform-claims-major-speed-and-storage-gains/
[2] 〔来源〕Blocks & Files | 9 月 22 日 https://www.blocksandfiles.com/ai-ml/2026/09/22/serenedb-launches-superfast-s3-data-search-engine/5298324
[3] 〔来源〕Snowflake | 9 月 26 日 https://www.snowflake.com/en/blog/engineering/snowflake-interactive-analytics-summer-2026-updates/
[4] 〔9 方报道〕Apache Iceberg;Apache Druid;Apache Doris;Materialize;CockroachDB;等 9 家 https://github.com/apache/iceberg/releases/tag/apache-iceberg-1.12.0-rc2 https://github.com/apache/druid/releases/tag/druid-38.0.0-rc1
[5] 〔来源〕Techgenyz | 9 月 24 日 https://techgenyz.com/google-alloydb-postgresql-ai-agents-isolated/
[6] 〔来源〕Blocks & Files | 9 月 24 日 https://www.blocksandfiles.com/ai-ml/2026/09/24/byoc-pinecone-vector-database-managed-service-expands-to-aws-azure-gcp/5298778
[7] 〔来源〕搜狐网 | 9 月 24 日 https://m.sohu.com/a/1080381195_104421?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334
[8] 〔来源〕InfoQ-CN | 约 9 月 21 日 https://www.infoq.cn/article/Obuxu1mvY9p6RNOlxFGc
[9] 〔来源〕InfoQ-CN | 9 月 23 日 https://www.infoq.cn/article/rB0WGcG9iLIRH3xZojY5
[10] 〔来源〕TimescaleDB | 9 月 25 日 https://www.tigerdata.com/blog/sizing-your-iiot-table-before-you-deploy
[11] 〔来源〕DuckDB | 9 月 25 日 https://duckdb.org/2026/09/25/hugging-face.html
[12] 〔来源〕Neon | 9 月 24 日 https://neon.com/blog/electrifying-neon-building-the-realtime-backend
[13] 〔2 方报道〕Entrackr;Snowflake | 9 月 24-25 日 https://entrackr.com/snippets/finlands-aiven-expands-into-india-targets-ai-and-cloud-data-infrastructure-market-12574652 https://www.snowflake.com/en/blog/kimi-k3-cortex-ai/
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻