数据库行业日报
本期要点
· Apache Spark 4.2 GA,原生向量检索 NEAREST BY 或挤压独立向量库空间
· TDengine 转型 AI 原生工业数据平台,**5000 测点内**永久免费
· Supabase Pipelines 公测,Postgres 增量直连 ClickHouse/Snowflake
· Ceph 经 S3 Vectors + LanceDB 把向量搜索做进存储层
· Databricks Lakebase 落地数据库分支式 CI/CD 生产实践
一、版本与产品发布
Apache Spark 4.2 正式发布,向量检索、治理指标视图、Arrow 互操作三线并进
Apache Spark 4.2 已于近期 GA,新增 NEAREST BY ——一个直接跑在 SQL 里的向量相似度 Top-K 检索算子,配合向量距离/归一化/聚合函数,让开发者不必再为向量检索单独引入一套数据库;同时推出治理指标视图(governed metric views),把业务指标定义收敛为 Spark 可理解的一等对象,跨应用统一口径,避免不同团队/AI 应用对同一指标算出不同结果;还新增 Arrow C Data Interface 与 PyCapsule protocol 支持,DataFrame 可与 Polars、DuckDB 之间零拷贝直传。这一版释放的信号是:通用查询引擎正把此前需要独立中间件(向量库、指标层)的能力收编进主干,对 Pinecone、Weaviate、Milvus 等专用向量库构成结构性压力。[1]
其他版本动态:YugabyteDB 密集发布多个 2025.2.x / 2026.1.x / 2.31.x 补丁与 backport(xCluster 修复、pgvector 距离崩溃修复等)[2];ClickHouse v26.6.2、v26.4.5、v26.3.17 stable/LTS 补丁 [3];TiDB v8.5.5、v8.5.4 补丁 [4];Materialize v26.34.0、v26.33.2 [5];Polars 1.43.0 弃用多个分类型/LazyFrame 旧接口 [6];DataFusion 54.1.0 [7];Weaviate v1.36.23 修复集群通信 [8];Milvus Go SDK v3.0.0-beta(对应 Milvus 3.0,已报)[9]。
二、数据库 × AI
涛思数据 TDengine 完成品牌史上最大升级,转型 AI 原生工业数据平台 · ai-native ⚠️ 厂商口径
TDengine 从高性能时序数据库升级为面向工业场景的 AI 原生数据平台:新增工业本体建模层,为设备、测点、工艺路线建立语义身份,让 AI 能"读懂"结构化数据而非孤立数值;工业智能体运行时(IAR)内置 13 个开箱即用 AI 助手,支持第三方智能体经 MCP 协议调用逾 50 项系统能力;TDgpt 时序 AI 引擎把异常检测、趋势预测等分析下沉到数据库内核,一条 SQL 调用、数据不出库。配套推出中小企业永久免费计划:5000 测点以内全功能永久免费,不缩减功能、不限制性能、不强制转收费。创始人陶建辉称此举意在解决"工业数据未结构化、AI 读不懂"的落地痛点。[10]
Ceph 经 S3 Vectors + LanceDB 把向量搜索做进存储层 · vector
SNIA 披露的技术方案显示,Ceph 可通过 Amazon S3 Vectors 桶类型存储 LLM 向量,向量、全文与标量索引与数据集一并存放于 LanceDB 使用的 Lance 格式中,无需外部向量服务;索引阶段用 AVX2 SIMD 加速 K-means 聚类,nprobe 可调、目标延迟 100–800ms,支持 L2/余弦距离。官方明确定位"非替代专用向量库"——若需要个位数毫秒延迟或复杂查询 DSL,仍应用专用系统;S3 Vectors 瞄准的是已经跑着 Ceph、想低成本存海量向量的场景。这与同期 Apache Spark 4.2 把向量算子搬进查询引擎的思路呼应:向量能力正从独立数据库下沉为通用基础设施的内置特性。[11]
星环科技 发布 GPU 原生认知数据库,宣称 TPC-DS 性能达 DuckDB 70 倍 · ai-native ⚠️ 厂商基准口径
星环科技推出"GPU 原生认知数据库"(Transwarp Cognitive Database),把 SQL 分析、知识检索与记忆系统整合进以 GPU 为中心的架构,并通过 GIDS(GPU-Initiated Direct Storage)让 GPU 直接发起存储访问、绕开 CPU 中转。官方宣称在 TPC-DS SF1000 测试中完成全部 99 项查询,性能达开源 DuckDB 的 70 倍,较 Snowflake/Databricks 同规格配置最高快 66 倍;向量索引检索吞吐最高提升 238 倍,显存利用率据称可提升 20 倍;记忆基准 BEAM 500K 与 LongMemEval-S 准确率分别为 79.6% 和 92.8%。以上数据均为厂商自测,未见第三方复现。[12]
OceanBase CTO:数据库要从"人类友好"转向"Agent 友好" · agent ⚠️ 演示口径
OceanBase CTO 杨传辉在 WAIC 2026 上提出,数据库下一步需适配 AI Agent 的高频、多轮调用模式,而非仅面向人工查询优化;具体产品路径未披露,暂属愿景表态。[13]
Databricks Genie:某游戏工作室用自然语言问答替代仪表盘发布 · ai-native
Databricks 客户案例博客介绍某游戏工作室用 Genie 自然语言对话式分析替代传统仪表盘发布流程,属客户案例宣传,无新功能披露。[14]
三、湖仓 · 开放表格式 · HTAP
Supabase Pipelines 进入公测,Postgres 增量同步直连 ClickHouse/Snowflake/BigQuery · streaming
Supabase Pipelines 基于自研开源 Rust CDC 引擎 Supabase ETL,通过 Postgres 逻辑复制读取变更并同步至分析系统。公测版最大新增是 schema 变更自动同步——源表结构变化后目的端自动跟进,无需手工迁移;同时并行化初始全量同步、降低复制延迟。Google BigQuery 率先对所有用户开放,ClickHouse、Snowflake、DuckLake 为新增目的地申请入口。Supabase 强调其定位是"Realtime 面向前端实时体验,Pipelines 面向可靠的分析数据搬运",把 OLTP 生产负载与分析查询解耦。[15]
Databricks Lakebase 生产落地数据库分支式 CI/CD(Glaspoort 案例) · htap
荷兰光纤运营商 Glaspoort 把 Lakebase(Databricks 的 serverless Postgres OLTP,与湖仓并行运行)当作应用代码一样管理:每个 PR 从生产分支出临时数据库、以迁移脚本作唯一事实源,解决多人共享测试库时"单测通过、合并即崩"与环境数据漂移的老问题。案例展示了湖仓与 OLTP 前端融合的一种具体工程实践。[16]
华为 发布《数据工厂白皮书》,AI 数据湖定位"数据工厂"底座 · lakehouse ⚠️ 厂商口径
华为发布白皮书,提出以 AI 数据湖为底座构建企业"数据工厂",具体技术细节未披露,属白皮书/路线图表态。[17]
四、技术 · 架构 · 性能基准
YugabyteDB DocDB 写入流水线默认开启,脱离预览标志 · oltp
YugabyteDB 2.31.0.0-b280 把 ysql_enable_write_pipelining 从预览特性转为默认开启,DocDB 层写入路径流水线化,为分布式 SQL 引擎的写入吞吐提供架构性改进。[18]
学界 · 研究前沿
· From Blind Search to Memory-Aware Evolution(arXiv 2607.17841):提出记忆感知的 DBMS 自动调优框架,结合协同诊断与效用感知检索,跳出传统盲搜式旋钮调优。[19]
· Natural Language Access to Domain-Specific Metadata(arXiv 2607.18029):面向特定领域元数据构建可复用的 LLM 查询生成框架,让研究者用自然语言访问专业档案库。[20]
· D-NOVA(arXiv 2607.17538):把 RAG 所需的向量相似度检索下沉到 3D NAND 存储内部执行,探索存内检索加速器方向。[21]
· Natural Language Interfaces for Databases: What Changes for Users?(arXiv 2511.14718):修订版论文重新审视自然语言查数据库接口对用户实际行为与心智模型的改变。[22]
五、云厂商 · 生态 · 监管
Data Grit(韩国)与 Sync On 结盟,进军 Oracle 替代市场 · oltp
韩国数据库厂商 Data Grit 宣布与流通/技术支持企业 Sync On 合作,采取产品研发与营业分离的协作体系,扩大国产混合动力数据库供应,目标瞄准 Oracle 替代市场——延续了 TiDB/OceanBase/PolarDB 等"去 O"路线在东亚区域的扩散。[23]
ClickHouse 冠名英超富勒姆俱乐部球衣与主赞助
ClickHouse 宣布成为富勒姆足球俱乐部(Fulham FC)主赞助商及球衣胸前广告,消息经多家通讯社以多语言同步发布,延续其融资后的高举高打品牌营销节奏。[24]
AWS:Nubank 把关键支付业务迁移至 Amazon Aurora PostgreSQL · cloud
AWS 博客介绍巴西数字银行 Nubank 将其关键支付系统迁移至 Aurora PostgreSQL 的实践,属客户案例,技术细节未展开。[25]