Dataphin V5.4版本发布:拥有「最强大脑」的数据中台,究竟智能在哪儿?

简介: Dataphin是阿里巴巴数据中台方法论的实践产品,助力企业构建湖仓一体、多云兼容的数据资产体系。V5.4版本升级集成、治理、安全与运维能力,新增API/FTP增强、数据质量智能分析、外部血缘注册、行级权限申请等特性,全面提升数据开发效率与治理水平。

关于Dataphin

Dataphin 是阿里巴巴十余年内部实践及方法论的产品化输出,为企业提供数据建设、治理、运营、消费的Data x AI全链路服务,深度适配湖仓一体架构,灵活兼容多云复杂环境,助力企业高效构建标准化数据资产体系,加速释放数据价值。


关于Dataphin V5.4

您是否曾设想,一个理想的数据平台应该是什么模样?

它应该足够强大,能轻松应对从API、FTP到各类数据源的复杂集成;它应该足够智能,能主动发现数据隐患并给出药方;它更应该足够贴心,让权限申请、资源监控、数据操作都像日常对话一样简单。

现在,这个理想的模样已清晰可见。

近日,Dataphin V5.4 正式登场,旨在成为您团队中无所不能拥有[最强大脑]的数据中台。 本次更新,我们围绕“集成、治理、安全、运维”四大核心场景,为您带来一系列重磅能力升级!


新版本重点特性详解及应用场景

特性 1:API组件升级:新增支持多个签名函数以及支持自定义签名串

背景:

在 ToB/ToG 多场景 API 集成过程中,不同合作方的接口签名规则存在显著差异 —— 部分场景需特定加密算法保障数据安全,部分场景要求灵活配置参数分隔符、键值连接符以适配个性化签名格式,传统 API 组件固定的签名逻辑和有限的算法支持,难以满足多样化对接需求,导致用户在集成不同来源 API 时需额外开发适配代码,效率低下且易出错。

功能概览:

  1. 支持自定义参数分隔符、建值连接符
  2. 签名函数新增支持SHA1HEX、SHA256、SHA256HEX、SHA512HEX、HMAC_SHA512
  3. 支持自定义签名串,通过“#{param}”方式引用参数,支持通过“@”可触发参数提示

 


特性 2:FTP 组件升级:支持tar.gz 解压 、压缩包下文件筛选以及JSONL文件读取

背景:

在企业数据集成场景中,FTP 作为常用文件传输工具,常需处理 tar.gz、zip 等压缩包文件。过去 FTP 组件仅支持基础文件传输,缺乏压缩包直接解压能力,需用户额外手动处理;并且面对压缩包内海量文件时,无法精准筛选目标文件,导致数据处理效率低下;在文件类型上缺乏对JSONL 格式支持,一般需借助第三方工具转换,增加了数据集成的复杂度与成本。

功能概览:

  1. 支持读取tar.gz压缩格式的文件
  2. 当压缩格式为tar.gz、zip格式时,支持配置文件匹配规则筛选压缩包下的文件
  3. 支持读取JSONL格式的文本数据,按行读取文本中的JSON数据

特性 3:数据源扩展:离线集成、实时集成数据源扩展

背景:

为满足企业对国产化适配、数据库新版本及湖表流读的需求,扩展离线与实时集成数据源,新增并优化多类核心引擎支持。

功能概览:

  1. 离线集成:输入输出组件支持Easysearch(国产化适配)、适配Hudi-1.0.2、人大金仓(国产化适配)特殊类型支持
  2. 实时集成:来源端自持MySQL8.4.4(适配特殊语法)、PolarDB-MySQL(全新支持)、Hudi(全新支持,单湖表流读)

   

   



特性 4:X-数据质量,智能分析质量问题并推荐整改建议

背景:

在数据治理的实际工作中,数据质量问题不仅影响数据的准确性和可信度,还直接影响业务分析和决策的可靠性。传统治理方式主要依赖人工异常排查,面对复杂的数据血缘关系和庞大的数据体量,难以及时发现质量缺陷、精准定位问题根因和高效完成整改,导致治理效率低下。

功能概览:

  1. 问题分析,根因追溯:依托AI驱动自动分析数据质量异常,层层深入查找问题根因,实现质量问题的精准溯源定位。
  2. 数据支撑,证据确凿:智能采样数据、解析数据血缘,构建问题分析证据链,为根因推断和决策提供有力数据依据。
  3. 整改建议,报告闭环:基于根因分析和证据链,自动生成质量问题整改建议及影响评估,形成完整质量报告,实现治理流程闭环。

特性 5:支持注册外部血缘关系

背景:

血缘关系是追溯数据来源、分析影响范围及资产价值的关键依据。当前大部分数据开发与治理平台的血缘关系仅支持基于任务自动解析或手动配置,无法覆盖外部系统的血缘信息,导致数据血缘存在断层。亟需实现外部系统血缘的批量导入和灵活配置,补全端(first mile ETL)到端(last mile BI)的血缘关系。

功能概览:

  1. 支持通过OpenAPI注册表级、字段级血缘关系
  2. 支持通过OpenAPI删除表级、字段级血缘关系


特性 6:支持增删改的数据操作类API

场景:

在数字化转型和智能化升级的浪潮中,企业对数据驱动能力的需求日益增长。为了帮助企业更高效、安全地管理和利用数据,Dataphin 5.4 版本推出了全新的增删改 API 功能,让开发团队能够以更低的成本和更短的时间将数据库中的数据转化为可管理且安全的 API 接口。

  • AI 编程与智能应用:快速为智能助手、自动化脚本或微服务提供结构化数据接口,简化API编程和数据应用中的数据接入工作,减少定制开发成本。支持实时或批量的数据读取/写回,确保数据访问的安全性和可追溯性。
  • 数据集成与ETL:轻松构建用于数据迁移、同步或集成的增删改 API,实现不同系统间的数据流转。支持参数化查询与批量操作,简化定时任务与数据流水线的开发和维护,提高数据处理效率。
  • 内部工具与业务中台:为后台管理系统、运营工具、BI 报表及移动端应用快速生成标准化的 CRUD 接口,缩短前后端联调周期。通过配置实现字段映射、输入校验与数据变换,提高一致性和安全性。
  • 低代码/无代码与快速原型:非技术人员也能通过简单配置生成所需的数据 API,加速原型验证与业务流程自动化落地。自动生成详细的 API 文档、示例请求及返回结构定义,降低使用门槛。

借助 Dataphin 5.4 的新增删改 API 功能,企业可以更加高效地管理和利用数据资源,加速业务创新与发展,充分释放数据的价值。

功能概览:

  1. 可视化创建:通过直观易用的界面,用户无需编写代码即可快速创建增删改 API,大大降低了技术门槛。
  2. 参数校验与默认值填充:自动进行参数校验并填充默认值,确保数据的完整性和合法性。
  3. 批量操作:支持单条和批量数据操作,性能更优,满足大规模数据处理需求。
  4. 事务控制:灵活选择单事务、无事务或分批独立事务模式,保证数据的一致性和可靠性。
  5. 错误处理与详细反馈:提供详尽的错误处理机制,支持部分成功和全部成功的选项,并返回具体的成功和失败记录,便于问题排查。
  6. 性能优化:针对不同数据量和并发情况自动优化性能,如批量操作时自动调整 JDBC 连接设置。
  7. 权限管理:支持 API 级别的权限申请,保障数据安全,目前暂不支持行级权限。
  8. 多种数据源支持:兼容 MySQL、Oracle、Microsoft SQL Server 和 PostgreSQL 等主流数据库,满足多样化的企业需求。


特性 7:行级权限支持申请

当前问题:

分析师在取数时发现,编写的SQL在执行后总是返回空数据。一番查找后,发现自己所查询的表命中了行级权限,系统自动添加了Where语句。在之前的版本中,分析师只能找管理员进行授权,无法自行申请。

功能概览:

  1. 清晰可见:代码开发者能清晰知道自己所查询的哪张表开启了行级权限、命中什么行级权限规则;
  2. 操作简便:支持用户一键申请字段权限+行级权限,也支持单独申请行级权限。



特性 8:支持查看注册调度集群的资源消耗趋势

场景:

Dataphin支持通过注册调度集群连接其余网络中的数据源,从而避免任务调度需要跨网络传输数据。为了高效分配和管理任务资源,集群管理员期望可以看见整个集群和不同资源组的资源消耗趋势。

功能概览:

  1. 界面配置:支持界面配置注册调度集群的Prometheus HTTP API和认证方式;
  2. 灵活操作和指标丰富:支持将注册调度集群设置为默认展示集群,支持查看集群下不同资源组的资源消耗趋势。

--使用须知:需要提前在注册调度集群中安装Prometheus组件




Dataphin 将持续迭代技术深度与场景覆盖能力,更多精彩功能,敬请期待!

相关文章
|
3天前
|
JSON 运维 安全
云时代的身份安全:别再靠“密码123456”扛风险了
云时代的身份安全:别再靠“密码123456”扛风险了
68 17
|
3天前
|
存储 运维 安全
别再把 Collector 当黑箱:OpenTelemetry Collector 拓展与自定义处理器实战指南
别再把 Collector 当黑箱:OpenTelemetry Collector 拓展与自定义处理器实战指南
68 14
|
6天前
|
Prometheus 分布式计算 监控
大数据指标和 SLA,那些你以为懂了其实没懂的事
大数据指标和 SLA,那些你以为懂了其实没懂的事
116 7
|
17天前
|
存储 SQL 分布式计算
手把手教你搞定大数据上云:数据迁移的全流程解析
本文深入探讨了企业数据迁移的核心价值与复杂挑战,重点分析了离线大数据平台在物理传输、系统耦合与数据校验三方面的难题。文章系统阐述了存储格式、表格式、计算引擎等关键技术原理,并结合LHM等工具介绍了自动化迁移的实践演进,展望了未来智能化、闭环化的数据流动方向。
344 11
手把手教你搞定大数据上云:数据迁移的全流程解析
|
4天前
|
传感器 算法 物联网
室内定位无线技术的分类和原理全解析(一)
室内定位无线技术通过射频、声波、光信号等解决卫星信号无法覆盖的盲区,实现人员、物资精准定位。主流技术分射频、声波、光学及新兴四大类,涵盖蓝牙、UWB、Wi-Fi、红外、可见光、毫米波等,适用于工业、医疗、园区等多场景,各具精度、成本与部署优势。
|
4天前
|
弹性计算 人工智能 应用服务中间件
租用阿里云服务器一年要多少钱?ECS、轻量与 GPU 服务器最新价格汇总(手动整理)
2025年10月阿里云优惠持续,轻量服务器38元/年起,ECS 2核2G仅99元/年,4核16G 89元/月,新老同享,续费不涨。香港轻量25元/月起,高带宽不限流,企业与个人皆宜。(238字)
157 7
|
SQL 人工智能 分布式计算
【产品升级】Dataphin V5.3 全新上线:四大能力升级,数据管理更统一、更智能!
V5.3版本,Dataphin推出众多重磅功能:例如,全新的智能应用:X-数据标准、X-数据安全以及智能应用反馈看板;更前沿的数据研发能力:利用SelectDB/Doris/StarRocks查询加速Hive和MaxCompute的离线引擎、全面支持Paimon格式的数据湖构建;资产运营和数据服务持续提效。
463 0
|
5月前
|
数据可视化 Java 数据库连接
Dataphin JDBC:助您实现数据权限的集中管理
Dataphin JDBC提供了统一访问Dataphin中数据的功能,助您实现数据权限的集中式管理。
223 3
|
9天前
|
存储 网络协议 数据挖掘
阿里云服务器通用算力型实例解析:u1/u2i/u2a性能特点与适用场景对比及选择参考
通用算力型实例作为阿里云推出的主打高性价比的云服务器实例,属于企业级实例,采用固定CPU调度模式。是很多用户在中小型Web应用、开发测试环境、轻量级数据分析等场景的首选实例。目前通用算力型实例已推出u1、u2i、u2a三大实例规格,不过有的用户并不是很清楚他们之间的区别,本文将通过深度对比三大实例的技术架构、性能指标、适用场景及收费标准,以供大家选购和参考。