DataWorks:新一代 Data+AI 数据开发与数据治理平台演进

本文涉及的产品
大数据开发治理平台DataWorks,Serverless资源组抵扣包300CU*H
简介: 本文介绍了阿里云 DataWorks 在 DA 数智大会 2024 上的最新进展,包括新一代智能数据开发平台 DataWorks Data Studio、全新升级的 DataWorks Copilot 智能助手、数据资产治理、全面云原生转型以及更开放的开发者体验。这些更新旨在提升数据开发和治理的效率,助力企业实现数据价值最大化和智能化转型。

本文根据 DA 数智大会(Data+AI Conference)2024演讲实录整理而成,演讲信息如下:

演讲人:田奇铣 | 阿里云智能集团高级产品专家、阿里云 DataWorks 产品负责人

演讲内容:

- 新一代智能数据开发平台 DataWorks Data Studio,Data+AI 协同开发平台

- 全新升级 DataWorks Copilot 智能助手,数据开发分析平均提效35%

- DataWorks 全新升级数据资产治理,AI 时代的数据资产治理

- DataWorks 全面云原生转型,资源组全面 Serverless 化

- 更开放的 DataWorks,更好的开发者体验


image.png


DataWorks 积累和沉淀了阿里巴巴15年大数据建设方法论和最佳实践,深度适配阿里云 MaxCompute、Hologres、EMR、Flink、PAI 等数十种大数据和 AI 计算服务。阿里云智能集团高级产品专家、DataWorks 产品负责人田奇铣在DA数智大会(Data+AI Conference)中表示,今年,DataWorks全新升级和推出新一代Data+ AI智能湖仓一体数据开发与治理平台,为 OpenLake 湖仓一体数据架构提供智能化数据集成、数据开发、数据分析与主动式数据资产治理服务,助力“Data+AI”全生命周期的数据管理,致力于为用户构建一个开放的云原生数据开发治理平台。

新一代智能数据开发平台 DataWorks Data Studio,Data+AI 协同开发平台

为更好的适应湖仓一体、Data+AI 的发展趋势与需求,DataWorks 正式推出全新一代数据开发 IDE,即DataWorks Data Studio,在原有基础上进行全面的架构和云原生化升级,致力于打造一个更加开放的、更符合开发者习惯的云原生 WebIDE。新一代 Data Studio 适配更多计算引擎,新增支持流式计算引擎 Flink、StarRocks 等主流 OLAP 计算引擎;全新升级工作流,将工作流定义为可编排可管理、可独立调度的实体对象;覆盖多种数据仓库、Lakehouse 湖仓的统一元数据管理,同时覆盖了包含 AI 数据集、AI 模型在内的数据实体对象。可支持基于 OpenLake 湖仓一体架构的多种计算引擎协同数据开发。


新一代 Data Studio 更大的升级是在开发模式上,在传统的 WebIDE 之上,DataWorks 全新推出个人开发环境。个人开发环境是一种云原生的 WebIDE,构建在 Serverless 资源组之上,可为开发者提供自定义容器实例和自定义镜像能力,可以执行 Python、Shell 等脚本,并支持代码调试。在个人开发环境中,支持连接云存储 NAS 和 GIT,用户可以自由选择将任务代码存储在 NAS 中或者使用 GIT 进行代码版本管理。从 WebIDE 到云原生版 WebIDE,DataWorks 可以让你在任意地点像使用本地 IDE 一样使用云上的 IDE,最大程度为开发者保留更 Native 的开发体验。


个人开发环境的出现使得 DataWorks Notebook 应运而生,DataWorks Notebook 基于 PAI-DSW 构建,重点解决了 Jupyter Notebook 对于大数据开发分析支持的不完善的问题和增强了 Data+AI 协同开发的能力。DataWorks Notebook 支持多种计算引擎 SQL 查询,增强数据可视化,支持 Python 与 SQL 交互式数据分析,内置 Copilot 智能助手。DataWorks Notebook 同时将大数据计算引擎的分布式数据处理、Python 单机和分布式数据处理、AI 模型训练协同起来,提供 Data+AI 一站式协同开发。


全新升级 DataWorks Copilot 智能助手,数据开发分析平均提效35%

DataWorks Copilot 全面支持包含 MaxCompute SQL、Hologres SQL、Spark SQL、Hive SQL、StarRocks SQL 等在内的各类计算引擎的 SQL 方言的生成和 SQL 代码补全,同时支持 Python 等非 SQL 语言的代码生成;在 AI Agent 方向持续丰富,尤其是数据开发流程上提供各类 Agent,通过大模型的语义理解与内容生成能力,在找表、建表、图表生成、代码变更描述和函数描述生成等方面提供 Agent,提升了操作效率和体验。据调研统计,DataWorks Copilot 可平均为数据开发和分析工作效率提升35%,更重要的是, Copilot 为开发者在开发过程中带来愉悦感。


DataWorks 全新升级数据资产治理,AI 时代的数据资产治理

业务价值是数据资产治理的核心驱动力,为加速企业数据治理工作的落地,我们将 DataWorks 数据治理中心全新升级为 DataWorks 数据资产治理,提供了从技术视角+业务视角的资产治理体系和 Data+AI 全方位数据资产治理体系。DataWorks 数据资产治理新增通过业务标签将数据资产按数据产品或者业务进行分类,然后基于业务标签自动进行业务数据资产的健康评估,自动识别问题业务资产,推荐场景化数据治理计划,增强数据质量管理及数据安全管控。DataWorks 数据资产治理增加了对 AI 资产的覆盖,全新推出 Data+AI 全链路数据血缘,从数据集、数据处理、PAI 模型训练到 PAI 推理服务,端到端全链路追溯和可视化展现数据血缘,帮助 AI 开发者记录和识别数据与模型之间的关系,加速 AI 模型的迭代效率。


DataWorks 全面云原生转型,资源组全面 Serverless 化

为提升整体的服务效率和平台的开放度,DataWorks 进行了Kubernetes 改造,优化了任务调度策略,增强了网络层的灵活性以适配多样化需求。此外,引入了云原生调度系统,并对资源节点进行优化,以便更好地对接云产品,同时简化了用户对网络管理的复杂度,提升了数据处理的便捷性和灵活性。在此基础上 DataWorks 实现了资源组全面 Serverless 化,从原有多类型资源组统一为通用型资源组,Serverless 化不仅带来使用门槛的降低,更显著提升了资源的利用效率,付费方式的灵活和资源效率的提升,在保障更高安全性的情况下,大幅度降低了使用成本,特定使用场景下成本最高可节省40%。未来 DataWorks 将持续释放云原生技术红利,帮助企业有效降低数据生产的成本。


更开放的 DataWorks,更好的开发者体验

DataWorks 致力于为开发者提供更开放的、更灵活、更 Native 的开发体验。

DataWorks 将调度系统中DAG背后完整的定义描述FlowSpec完全开源(https://github.com/aliyun/alibabacloud-DataWorks-tool-dflow),并提供了便捷的配套工具,用户可以基于DataWorks FlowSpec快速将其他调度系统的工作流导入到DataWorks,也可以便捷的将DataWorks中的工作流导出,从而不用担心被Lock-in的问题。

同时,DataWorks 在提供高效方便的可视化开发界面的同时,也为用户提供了覆盖 DataWorks 完整产品能力的全套 OpenAPI,使得用户可以结合自身业务特点,将DataWorks的能力集成到其自有平台,甚至是构建一套高度定制化的数据管理平台。


DataWorks致力于打造更加开放、更加智能的,面向湖仓一体架构和Data+AI场景的一站式数据开发治理平台,助力企业快速实现数据价值的最大化和智能化转型。

产品体验优惠

为了回馈广大用户的支持,DataWorks将在11月推出版本使用优惠活动*,在基础版免费使用的基础上,届时新购/升级到标准版或专业版的用户,将免费体验企业版独有的数据资产治理功能3个月;购买/升级到企业版的用户,可享受首月299元的优惠。

*具体活动细则与说明,敬请关注阿里云官网DataWorks产品详情页

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
一站式大数据开发治理平台DataWorks初级课程
DataWorks 从 2009 年开始,十ー年里一直支持阿里巴巴集团内部数据中台的建设,2019 年双 11 稳定支撑每日千万级的任务调度。每天阿里巴巴内部有数万名数据和算法工程师正在使用DataWorks,承了阿里巴巴 99%的据业务构建。本课程主要介绍了阿里巴巴大数据技术发展历程与 DataWorks 几大模块的基本能力。 课程目标  通过讲师的详细讲解与实际演示,学员可以一边学习一边进行实际操作,可以深入了解DataWorks各大模块的使用方式和具体功能,让学员对DataWorks数据集成、开发、分析、运维、安全、治理等方面有深刻的了解,加深对阿里云大数据产品体系的理解与认识。 适合人群  企业数据仓库开发人员  大数据平台开发人员  数据分析师  大数据运维人员  对于大数据平台、数据中台产品感兴趣的开发者
相关文章
|
16天前
|
存储 人工智能 大数据
AI开发新范式,PAI模型构建平台升级发布
本次分享由阿里云智能集团产品专家高慧玲主讲,聚焦AI开发新范式及PAI模型构建平台的升级。分享分为四个部分,围绕“人人可用”和“面向生产”两大核心理念展开。通过降低AI工程化门槛、提供一站式全链路服务,PAI平台致力于帮助企业和开发者更高效地实现AI应用。案例展示中,介绍了多模态模型微调在文旅场景的应用,展示了如何快速复现并利用AI解决实际问题。最终目标是让AI技术更普及,赋能各行业,推动社会进步。
|
12天前
|
SQL 分布式计算 DataWorks
活动实践 | DataWorks智能交互式数据开发与分析之旅
本指南介绍了如何使用阿里云平台进行大数据开发与分析。首先,在MaxCompute控制台创建项目并配置计算资源;接着,通过DataWorks控制台创建工作空间和独享资源组,并绑定工作空间。然后,创建个人开发环境,载入案例并新建Notebook实例。在Notebook中,通过SQL和Python Cell进行交互式开发和数据分析,体验智能助手Copilot的功能,如SQL改写、解释、生成注释及智能建表。最后,清理所有创建的资源,包括删除DataWorks资源、MaxCompute项目及网络配置,确保环境整洁。
|
1天前
|
数据采集 SQL 人工智能
瓴羊Dataphin:AI驱动的数据治理——千里之行,始于标准
数据标准是数据治理的核心抓手,通过梳理数据标准可以有效提升数据质量。瓴羊Dataphin平台利用AI技术简化数据治理流程,实现自动化的数据标准建立、质量规则构建和特征识别,助力企业在大模型时代高效治理数据,推动数据真正为业务服务。
46 26
|
4天前
|
SQL 存储 人工智能
DMS+X构建Gen-AI时代的一站式Data+AI平台
本文整理自阿里云数据库团队Analytic DB、PostgreSQL产品及生态工具负责人周文超和龙城的分享,主要介绍Gen-AI时代的一站式Data+AI平台DMS+X。 本次分享的内容主要分为以下几个部分: 1.发布背景介绍 2.DMS重磅发布:OneMeta 3.DMS重磅发布:OneOps 4.DMS+X最佳实践,助力企业客户实现产业智能化升级
DMS+X构建Gen-AI时代的一站式Data+AI平台
|
6天前
|
人工智能 自然语言处理 API
用AI Agent做一个法律咨询助手,罗老看了都直呼内行 feat.通义千问大模型&阿里云百炼平台
本视频介绍如何使用通义千问大模型和阿里云百炼平台创建一个法律咨询助手AI Agent。通过简单配置,无需编写代码或训练模型,即可快速实现智能问答功能。演示包括创建应用、配置知识库、上传民法典文档、构建知识索引等步骤。最终,用户可以通过API调用集成此AI Agent到现有系统中,提供专业的法律咨询服务。整个过程简便高效,适合快速搭建专业领域的小助手。
88 21
|
24天前
|
人工智能 安全 DataX
【瓴羊数据荟】 Data x AI :大模型时代的数据治理创新实践 | 瓴羊数据Meet Up城市行第三期
第三期瓴羊数据Meetup 将于2025年1月3日在线上与大家见面,共同探讨AI时代的数据治理实践。
88 10
【瓴羊数据荟】 Data x  AI :大模型时代的数据治理创新实践 | 瓴羊数据Meet Up城市行第三期
|
1月前
|
人工智能 数据可视化 JavaScript
NodeTool:AI 工作流可视化构建器,通过拖放节点设计复杂的工作流,集成 OpenAI 等多个平台
NodeTool 是一个开源的 AI 工作流可视化构建器,通过拖放节点的方式设计复杂的工作流,无需编码即可快速原型设计和测试。它支持本地 GPU 运行 AI 模型,并与 Hugging Face、OpenAI 等平台集成,提供模型访问能力。
114 14
NodeTool:AI 工作流可视化构建器,通过拖放节点设计复杂的工作流,集成 OpenAI 等多个平台
|
23天前
|
存储 人工智能 BI
Paimon 1.0: Unified Lake Format for Data + AI
本文整理自阿里云智能开源湖存储负责人李劲松在Flink Forward Asia 2024上海站主论坛的演讲。Apache Paimon于今年3月成为顶级项目,计划发布1.0版本,目标是Unified Lake Format for Data + AI,解决数据处理与AI应用中的关键问题。Paimon结合Flink打造Streaming Lakehouse解决方案,已在阿里巴巴集团及多个行业中广泛应用。来自淘天、抖音和vivo的嘉宾分享了基于Paimon + Flink技术栈的数据湖实时处理与分析实践案例。内容涵盖大数据从业者面临的痛点、Paimon的发展历程及大厂的应用经验。
387 1
Paimon 1.0: Unified Lake Format for Data + AI
|
2天前
|
存储 人工智能 关系型数据库
AnalyticDB PostgreSQL版:Data+AI 时代的企业级数据仓库
AnalyticDB PostgreSQL版是面向Data+AI时代的企业级数据仓库,涵盖产品架构、核心技术、客户案例及功能发布四大部分。产品架构包括数据分析和AI/ML的存储与计算优化;核心技术涉及高性能实时引擎Beam、向量化执行引擎Laser及优化器Orca;客户案例展示了丝芙兰和领跑汽车的应用;新功能如pgsearch全文检索和In-Database AI/ML进一步提升了性能与易用性。
|
13天前
|
人工智能 物联网
如何将Together AI上基于Qwen2-7B训练的模型部署到ModelScope平台
如何将Together AI上基于Qwen2-7B训练的模型部署到ModelScope平台
55 10

热门文章

最新文章

相关产品

  • 大数据开发治理平台 DataWorks