FutureX · 记录未来如何发生
数据库行业 周报 · 第 5 期 · 2026.07.26 · 过去 7 天 7/22–7/24
本周要点
· Supabase 称平台上约 90% 的新建数据库由 AI agent 发起,非人类。
· 向量检索被通用引擎收编:Spark 4.2 GA 新增 SQL 算子 NEAREST BY。
· AlloyDB 列存加速 pgvector 的 HNSW,厂商自测吞吐最高提升 4.9 倍。
· RAG 成本结构被两篇实测拆穿:烧钱的是向量库常驻内存,不是嵌入。
· Databricks 与微软把 Azure 战略合作续签至 2030 年代。
· 「让 agent 安全碰数据库」成产品线:Neon 只读诊断、DeepSQL 自托管 DBA。
向量检索正从独立品类下沉为通用基建的内置能力 · db-ai
本周最清晰的一条主线,由三件互不相关的发布共同勾勒。Apache Spark 4.2 GA 新增 NEAREST BY——一个直接跑在 SQL 里的向量相似度 Top-K 算子,配合向量距离/归一化函数,开发者不必再为向量检索单独引入一套数据库;同版还带来治理指标视图与 Arrow C Data Interface(可与 Polars、DuckDB 零拷贝直传)。
存储层同样在收编:SNIA 披露的方案显示 Ceph 可经 Amazon S3 Vectors 桶类型存放 LLM 向量,向量、全文与标量索引一并落在 LanceDB 使用的 Lance 格式中,无需外部向量服务,目标延迟 100–800ms。官方明确表态"非替代专用向量库"——要个位数毫秒或复杂查询 DSL 仍需专用系统。
关系库这一侧,Google AlloyDB 让常驻内存的列存引擎加速 pgvector 的 HNSW 索引,绕开 PostgreSQL 共享缓冲区的锁与页面管理开销;据 Google 自测(GloVe-100、逾百万条记录),0.95 目标召回率下 QPS 最高提升 4.9 倍,同等吞吐下召回率从约 0.78 升至 0.94 以上,均为厂商基准。三条路径指向同一个压力面:Pinecone、Weaviate、Milvus 等专用向量库的独立存在理由,正被上下游同时挤压。来源:The New Stack / Blocks & Files / DataCenterNews Asia Pacific
专用向量库的回应:补齐生产级可运维性 · db-ai
Weaviate v1.39.0-rc.0 进入功能冻结,四线并进:Namespaces(多租户 collection 隔离)、Alter Schema(不停机变更)、gRPC Web 网关(浏览器直连)与新的 Search REST API。补的不是检索精度,而是多租户与运维弹性——这正是与 Pinecone、Milvus、Qdrant 竞速的战场已从算法转向"能不能扛生产"的信号。
承接上期 Milvus 3.0 原生直读 Iceberg/Lance 的转向看,本周走势更明确:向量库要么向湖仓靠拢放弃自持主存,要么把企业级运维能力补齐守住生产场景,单纯做"更快的 ANN"已不构成护城河。同期 Milvus v2.6.21、Chroma dev build 1.5.10 等为常规补丁。来源:Weaviate
RAG 的账单结构被公开拆解:钱花在向量库常驻成本上 · db-ai
周四、周五两篇独立文章从相反方向指向同一结论。HackerNoon 复盘的一起真实案例中,某内部文档检索 RAG 从 demo 期月成本 340 美元、上生产半年后涨至 6.1 万美元/月;作者称生产系统里向量库常年吃掉总成本的 40%–50%,其中内存又占向量库开销的 85%–90%,且一次 agent 问答背后往往是 5–15 次检索,真实查询量远超表面请求数,换用压缩索引可将内存成本压低约 70%。
另一份把 RAG 管道八个阶段逐一计价的实测则给出被低估的另一面:按 OpenAI 最新嵌入计费,约千页文档一次嵌入仅 0.18 美元——"嵌入是吞金兽"的社区共识不成立。持续吃钱的是向量库按月/按小时计费的常驻存储、规模上来后的索引与检索,以及最终 LLM 阅读分块生成回答。该文的优化重心相应转向文档去重(约 80% 内容未变、只需增量处理)与压减喂给模型的分块数。
两者口径均为单方案例、未经交叉核实,但结论互为印证:RAG 的成本曲线是数据库问题,不是模型问题。这也解释了为何本周多方都在把向量能力塞回已有的数据库/存储里——省掉的正是那笔常驻开销。来源:HackerNoon / 手机网易网
Postgres 成为 agent 时代的默认底座,用量结构已经变形 · oltp
本周最值得记住的数字来自 Supabase:联合创始人兼 CEO Paul Copplestone 在 Y Combinator 播客上称,平台可精确统计到的 agent 建库占比约 60%,"但更可能接近 90%,且每月以百万计"。触发点始于 2024 年底 Bolt、Lovable 两款自然语言建站工具悄然把 Supabase 设为默认后端,一度让工程团队误以为遭遇 DDoS。该平台现已突破 1000 万注册开发者,以超 100 亿美元估值融资 5 亿美元;Copplestone 把 PostgreSQL 的"无厂商垄断"视为护城河——正因无人独占内核,云厂商才被迫持续把 Postgres 做到最好。以上为厂商口径。
负载画像的变化同样被另一端印证。Cockroach Labs CEO Spencer Kimball 在 RoachFest 伦敦站透露公司去年营收增长 50%、团队约 500 人、五年多未融资也无融资计划("我们有无限跑道");他坦言 CockroachDB "一直是一个昂贵的数据库",服务 Cisco、摩根大通、NVIDIA、SpaceX 这类停机零容忍客户时是可接受的取舍,但 agent 化流量带来的突发、不可预测查询压力正在重塑分布式 SQL 的负载画像。
工程侧的配套也在跟进:YugabyteDB 2.31.0.0-b280 把 ysql_enable_write_pipelining 转为默认开启,DocDB 写入路径流水线化;Hatchet 创始人的「初创公司 Postgres 生存指南」在 HN 收获 303↑ 167💬,文中"先写查询再定 schema""用 jsonb 打破范式边界"之外,还专门提示若查询完全交给 Claude 等工具生成则部分内容可跳过——AI 辅助写 SQL 正在改变团队对底层调优知识的依赖。来源:finance.biggo.com / thestack.technology / YugabyteDB / hatchet.run
「让 agent 安全接触数据库」从演示走向可交付产品 · db-ai
这条线本周一次性冒出四个实现。Neon CLI 新增 14 个只读诊断子命令(inspect db),直接对 Postgres 系统目录与统计视图跑预置查询,替代手写 SQL 排查慢查询、锁等待与缓存命中率;产品文档直接点名动机——agent 若持有连接串手写 SQL,存在幻觉列名、误执行 DROP、无界 SELECT 拖爆上下文等风险。DeepSQL(Show HN,45↑)则主打"7×24 小时 DBA",单条命令自托管于客户 VPC,读慢查询日志与 pg_stat_statements,可经 MCP 接入 Claude/Codex/Cursor。
另一侧是把 agent 的运行时状态也交给数据库。审计机构 CLA 与 Databricks 合建的文档处理 agent 系统,把长任务编排、重试与成本归因全部收进 Lakebase Postgres——两张表实现任务队列,省去 Kafka/Redis 与 Airflow/Temporal;这与上一日荷兰光纤运营商 Glaspoort 用 Lakebase 做数据库分支式 CI/CD(每个 PR 从生产分支出临时库、迁移脚本为唯一事实源)构成同一条脉络:Lakebase 正被当作 agent 与应用的通用状态层,而非湖仓的附属品。
最激进的样本来自 Neon:让 agent 只读其 Beta 后端文档(Functions + Object Storage),独立实现了一个可 clone/push/pull、无本地文件系统的 Git 托管服务——blob/tree/commit 全部以行存进 Postgres,大文件转存 Object Storage,整个服务跑在单个无状态函数里,已开源为 neon-git。来源:Neon / deepsql.ai / Databricks
湖仓与云:Databricks 双线加固,语境层成为新战场 · lakehouse
承接上期约 30 亿美元战略轮、1880 亿美元投后估值的势头,Databricks 本周把筹码押在生态绑定上:与微软将 Azure 战略合作续签至 2030 年代。Databricks 承诺核心业务与湖仓更多运行在 Azure Databricks 上,并扩大使用微软 Arm 架构算力 Azure Cobalt(下一代 Cobalt 200,微软自称性能提升最高 50%、默认内存加密);作为回报,微软将把 Genie、Unity AI Gateway 等整合进 Microsoft 365、Teams、Copilot、Power BI、OneLake、Purview。双方给出的共同叙事是解决企业"手握数据却难让 agent 可信调用"。
同一叙事的产品落点是 Discover 与 Domains 公开预览:由 Unity Catalog 驱动,按业务职能/部门/地域组织表、看板、Genie Agent 等资产,并对接 Genie Ontology,让 agent 只从可信资产取数。可以看出,湖仓的竞争重心正从"存得下、查得快"移向"agent 取数取得对"——业务语境层(指标定义、领域划分、本体)成为新的护城河候选,Spark 4.2 的治理指标视图与之同源。
数据搬运侧,Supabase Pipelines 进入公测,基于自研开源 Rust CDC 引擎 Supabase ETL,经 Postgres 逻辑复制把变更同步至分析系统;本次最大新增是 schema 变更自动同步,并行化初始全量同步以降低延迟。BigQuery 率先对所有用户开放,ClickHouse、Snowflake、DuckLake 为新增目的地申请入口——OLTP 生产负载与分析查询的解耦,正变成 Postgres 平台的标配能力而非第三方工具的生意。MotherDuck 则连发两篇博文阐述"agent 优先"的数据平台设计理念并主推 DuckLake 元数据引擎,未公开基准数据。来源:SiliconANGLE / PR Newswire / Databricks / Supabase / TipRanks
分析型引擎:ClickHouse 高频迭代加品牌高举,中国厂商主打软硬一体 · analytics
ClickHouse 本周发布节奏密集,24 小时内接连放出 v26.7.1.1315-stable 与 v26.8.1.1-new 开发预览,另有 v26.6.2、v26.5.6、v26.4.5、v26.3.17 等 stable/LTS 补丁,延续"nightly 探路、stable 收口"的双轨节奏。同期它宣布成为英超富勒姆足球俱乐部主赞助商及球衣胸前广告,消息经多家通讯社多语言同步发布——融资后的高举高打品牌打法在继续。竞品侧本周相对安静:StarRocks 3.5.20、DuckDB 1.5.5(回溯修复越界访问安全漏洞)、CockroachDB v24.1.32(TLS 密码套件相关安全修复)、Materialize v26.34.x、Polars 1.43.0、DataFusion 54.1.0 等多为补丁。
中国厂商这一周走的是另一条路。星环科技发布"GPU 原生认知数据库",用 GIDS(GPU-Initiated Direct Storage)让 GPU 直接发起存储访问、绕开 CPU 中转,宣称 TPC-DS SF1000 全 99 项查询下性能达 DuckDB 的 70 倍、较 Snowflake/Databricks 同规格最高快 66 倍,向量索引检索吞吐最高提升 238 倍——以上均为厂商自测,未见第三方复现,宜按"宣称"看待。中国信通院在 2026 可信数据库发展大会上发布《数据库发展研究报告》与产业图谱,归纳五条趋势:双 AI 智能体(运维+开发)替代人工调库、HTAP 同源内核透明切换、云原生存算解耦、CPU+GPU 协同的软硬一体机、图+向量双引擎为 agent 提供分层记忆;武汉达梦以 DM9、图数据库 V4.0、一体机 PAI V2.0 逐条对应,案例为厂商自述。
值得注意的是"软硬一体"在中国厂商叙事中的权重明显高于海外同行,而海外本周的对应议题是 GPU 利用率本身——有报道指出 AI 集群瓶颈正从算力转向数据搬运与准备效率,Cloudera 与 VAST Data 均把自身架构定位为解法,技术细节暂缺。来源:ClickHouse / 手机网易网 / 新浪财经 / Qoo Media
时序与国产替代:TDengine 转型 AI 原生,去 O 路线在东亚扩散 · oltp
涛思数据把 TDengine 从高性能时序数据库升级为面向工业场景的 AI 原生数据平台,称为品牌史上最大升级:新增工业本体建模层,为设备、测点、工艺路线建立语义身份;工业智能体运行时(IAR)内置 13 个开箱即用 AI 助手,第三方 agent 可经 MCP 调用逾 50 项系统能力;TDgpt 把异常检测、趋势预测下沉进数据库内核,一条 SQL 调用、数据不出库。配套推出5000 测点以内全功能永久免费的中小企业计划,称不缩减功能、不限性能、不强制转收费。创始人陶建辉称意在解决"工业数据未结构化、AI 读不懂"的落地痛点;为厂商口径。
区域市场上,韩国数据库厂商 Data Grit 与流通/技术支持企业 Sync On 结盟,采取产品研发与营业分离的协作体系扩大国产混合数据库供应,目标直指 Oracle 替代市场——与 TiDB/OceanBase/PolarDB 的"去 O"路线在东亚同步扩散。OceanBase CTO 杨传辉在 WAIC 2026 提出数据库需从"人类友好"转向"Agent 友好"、适配高频多轮调用,产品路径未披露,暂属愿景表态。此外 Yugabyte 发布委托研究量化传统数据库架构的隐性成本、主张分布式 PostgreSQL 更优,方法论未经第三方验证。来源:美通社 / 매일경제 / 雷峰网 / Business Wire
学界:基准数据集与调优范式同时被翻新 · infra
本周 arXiv 上有两条与工业界直接相关的线索。基准侧,Hollywood(2607.19666)提出用电影数据集接棒沿用十余年的 IMDb/JOB 基准,为查询优化器测试提供更贴近真实分布的语料;另一篇(2607.19679)首次对物化视图查询重写做全链路端到端基准,而非只测重写算法本身,覆盖 OLAP/数仓加速场景——在厂商基准满天飞的一周里,这类工作的价值格外具体。
调优与检索侧,From Blind Search to Memory-Aware Evolution(2607.17841)提出记忆感知的 DBMS 自动调优框架,以协同诊断与效用感知检索跳出盲搜式旋钮调优;D-NOVA(2607.17538)把 RAG 的向量相似度检索下沉到 3D NAND 存储内部执行,是本周"向量能力下沉"主线在存内计算方向的学术对应。另有 ANN 投影增强图方法(2603.06660)迎来 v2 修订。来源:arXiv
下周看点 · infra
Weaviate v1.39.0 已进入功能冻结,正式版落地与 Namespaces 的实际多租户表现值得跟踪;ClickHouse v26.8 开发线的特性面貌将在下周逐步显形。Databricks 与微软的合作细则、Discover/Domains 从公开预览走向 GA 的节奏,是观察"agent 语境层"能否兑现的第一个检查点。此外,Supabase Pipelines 的 ClickHouse/Snowflake 目的地何时对所有用户开放,以及本周两篇 RAG 成本拆解是否会引出更多第三方复现数据,同样值得关注。
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻