数据库行业日报
本期要点
· DuckDB v2.0 拟今秋上线异步 I/O,远程查询望大幅提速
· Supabase Evals 开源,首个面向 AI agent 建库能力的基准
· 腾讯云发布 AI DLC,WorkBuddy 端到端提速80%(厂商口径)
· Google Cloud 湖仓跨云目录联邦进入预览
· Neon Lakebase Search 客户实测:混合检索延迟降千倍
· DBOS:Postgres 队列优化后达3万次/秒执行
一、版本与产品发布
CloudCanal 6.3.0.0 发布 ⚠️ 厂商口径
国产数据迁移同步工具 CloudCanal 发布 6.3.0.0 版本,官方称对 Oracle 目标端写入性能做了大幅优化,具体基准未披露。CloudCanal 是国产数据库生态里常用的异构库间实时同步与迁移工具之一。[1]
其他版本动态:Materialize 连发 v26.36.0-rc.1/rc.2 候选版本;YugabyteDB 2025.2/2026.1 分支密集回合补丁(含向量索引自动分片等);CockroachDB v26.2.5-rc 修复并发场景下的锁释放问题。
二、数据库 × AI
腾讯云 发布智能数据湖计算平台 AI DLC · ai-native ⚠️ 厂商口径
腾讯云正式发布 AI DLC,让 Spark 与 Ray 首次同台跑在同一 Serverless 平台上:Spark 负责大规模数据处理,Ray 承接多模态处理、训练、推理与 Agent 任务,两者共享数据、算力与权限体系,免去跨平台搬运。自研向量化引擎 Meson 兼容 Spark 生态,官方称标准测试查询性能提升3.6倍;多模态引擎 Xpark 官方称推理吞吐较开源方案提升3倍。腾讯内部 WorkBuddy 接入后端到端处理时间缩短80%,所需算力降至约此前五分之一(均为厂商自测数据,未经第三方复现)。平台已适配国产主流 GPU 芯片。[2]
Neon:Postgres 混合检索延迟降至毫秒级 · vector ⚠️ 单一客户口径
Neon(现属 Databricks Lakebase 系)披露客户案例:消息聚合产品 CommSync 用其新推出的 lakebase_text(BM25全文检索)与 lakebase_vector(1024维余弦相似度向量检索)扩展替换原有 GIN/tsquery 方案,语义搜索延迟从冷启动约19.5秒降至热态 18.6毫秒,客户称约千倍提升。两条检索路径共用同一 Postgres 库、经 RRF 融合排序,Agent 知识库检索也复用同一套向量列,省去独立向量数据库。数字来自客户自述,未经第三方复现。[3]
Supabase 开源 Evals 基准框架 · agent
Supabase 开源 supabase/evals,用于测试 AI coding agent(含 Claude Code、Codex、OpenCode)在真实 Supabase 任务(建表、修复失败的 Edge Function、修 RLS 策略等)上的表现,兼具对外公开 benchmark 套件与内部每日回归套件,用确定性检查 + LLM-as-judge 打分。该项目服务于 Supabase 自身的 agent 体验优化,也是首个面向"agent 建数据库能力"的公开评测基准。[4]
「LLM Wiki」构想引四家跟进落地 · agent ⚠️ 二手转述
Andrej Karpathy 今年4月提出「LLM Wiki」构想——与 RAG 的"查询时做功"相反,改为"摄入时编译":大模型一次性通读原始文档生成结构化 Markdown 维基页面,查询时直接读维基而非重新检索拼接原文片段,理论上省去重复检索的算力开销,但仅适用于约百个信息源、几百页面的中等规模,超出后仍需回补 BM25+向量检索。AI记忆项目 Mem0 近期撰文梳理,指出 Cognition(DeepWiki,代码仓库维基)、Factory(AutoWiki,绑定 CI/CD)、LangChain 与投资人 Garry Tan 团队已各自落地同类产品,方向各异。本条为中文媒体对 Karpathy 原始设想与 Mem0 综述文章的转述,未直接核对英文原文。[5]
Denodo:数据层治理是 token 浪费的解法 · ai-native ⚠️ 厂商口径
数据虚拟化厂商 Denodo 提出,企业 AI 应用 token 消耗暴涨后,真正该治理的是底层数据供给而非模型调用本身——通过统一数据层减少 agent/RAG 管道里重复拉取、冗余检索带来的无效 token 支出。方向与此前"千页嵌入仅0.18美元、真正烧钱在检索与推理"的实测结论呼应,但本条为厂商自身表态,未附具体数字。[6]
Zilliz 今日发布官方新闻稿确认 Milvus 3.0 GA、向量库首次原生直读数据湖(已报,详见近期要点)。
三、湖仓 · 开放表格式 · HTAP
Google Cloud 湖仓跨云目录联邦进入预览 · lakehouse
Google Cloud 扩展其"无边界湖仓"(borderless Lakehouse),核心是基于 Apache Iceberg 的目录联邦(catalog federation)——AWS Glue、Databricks Unity Catalog、Snowflake Horizon 三大目录均已进入预览互通,客户可通过 BigQuery 等引擎原地查询其他云上的数据,无需搬运复制,处理结果也可写回原环境。Google 同时提供跨云专线,来自 AWS 的数据访问免收可变出口费(仅按连接时长收专线费)。布局明确指向为 Gemini Enterprise 与 Conversational Analytics 等 agent 场景服务,元数据治理接入 Knowledge Catalog。[7]
Apache Paimon 2.0.0 发布第四个候选版 · lakehouse
Apache Paimon(流式湖仓表格式,与 Iceberg/Hudi/Delta 同属开放表格式赛道)继 rc2、rc3 后发布 2.0.0-rc4,PyPaimon 同步跟进,正式 GA 已迫近。[8]
四、技术 · 架构 · 性能基准
DuckDB 官宣 v2.0 将支持异步 I/O · olap
DuckDB 官方博客披露,计划于 2026年秋随 v2.0 上线针对 Parquet 与无压缩 CSV 文件的异步读取。背景是 DuckDB 的典型场景已从本地 SSD 查询转向远程对象存储(数据湖场景,以及今年5月上线的 Quack 协议 server 模式)——同步 I/O 下单线程要等数据到达才能干活,网络带宽打不满、线程大量时间耗在等待上;异步 I/O 流水线让读取与解码、聚合等计算重叠执行,尤其利好带宽未打满的远程查询场景。DuckDB 原生格式与 JSON 的异步支持仍在开发中。[9]
DBOS:Postgres 队列优化后撑住 3 万次/秒 · oltp
"Postgres 做不了大规模队列"是业内常见共识——DBOS 撰文(HN 124↑)反驳:用 FOR UPDATE SKIP LOCKED 锁定子句解决多 worker 并发抢同一批任务的竞争问题(不加锁子句时吞吐上限约百次/秒),叠加进一步优化后,实测跨数千台服务器可达 3万次 workflow 执行/秒。该文延续 DBOS 此前"优化后 Postgres LISTEN/NOTIFY 单机达6万写入/秒"的队列扩容路线,进一步给出并发控制的具体技法。[10]
开发者把 PostgreSQL 做成一座可漫游的城市
工程师 Nik Samokhvalov 开源 PGSimCity,用 SimCity 式 3D 可视化呈现 PostgreSQL 内部运行:事务化作街道上流动的动画,后台进程在远处各自运转,支持俯瞰漫游与街头行走两种视角。项目由一条 prompt 喂给 Claude 起步,累计消耗 38.6亿 token 的 AI 辅助编码,代码已开源。[11]
学界 · 研究前沿
· AgenticER(arXiv 2607.27435):探索用 agentic 方法做实体解析(Entity Resolution),这是数据管理里的经典老问题,本文尝试引入 agent 式流程处理。[12]
· Fully Inductive Cardinality Estimation(arXiv 2607.28311):面向知识图谱 SPARQL 查询(Basic Graph Pattern)的归纳式基数估计方法,服务查询优化器决策。[13]
· A Structured Knowledge Infrastructure for Domain-Specific Data Asset Discovery(arXiv 2607.27748):指出企业数据分析 agent 面临两类结构性失败——通用 RAG 常检索错数据资产,提出面向领域的结构化知识基建方案。[14]
六、云厂商 · 生态 · 监管
Google Cloud AlloyDB 预览群组 IAM 认证 · cloud
AlloyDB(Google Cloud 的 PostgreSQL 兼容托管库)预览版新增 IAM 群组认证,安全团队最多可定义200个功能性 Google 群组,按库/表级别控管权限,替代此前逐个体身份映射的模式,主要解决大规模实例/用户场景下的权限管理与审计难题。该能力也面向 AI agent 场景:agent 可代入终端用户身份与权限范围访问数据库,而非用共享通用账号,便于留下清晰审计轨迹。此前 Cloud SQL 已支持同类群组认证。[15]
中科曙光 × 深圳计算科学研究院推国产数据库联合方案
中科曙光与深圳计算科学研究院(YashanDB/崖山数据库出品方)联合推出全栈自主可控核心业务数据库方案,将曙光 FlashNexus 全闪存储与 YashanDB 深度整合,覆盖底层存储到上层数据服务,面向金融、电信运营商、医疗等对国产化替代要求较高的核心业务场景。[16]
SmartRent 选择 Databricks Data+AI 平台 · cloud
多户住宅物联网平台 SmartRent 宣布采用 Databricks Data + AI 平台支撑其下一代物业分析。属常规客户案例发布,未披露合同规模等细节。[17]
PHP 修复 SQL 注入等三项安全漏洞
PHP 官方修复三个安全漏洞,涉及 SQL 注入、内存损坏与服务崩溃风险,建议使用 PHP 的数据库应用尽快升级。属语言层修复,非数据库产品自身漏洞。[18]