开放语义模型:构建企业级数据语义层

本文涉及的产品
PolarDB Agent Flow,2核4GB
PolarSearch,搜索节点 4核8GB
云数据库 PolarDB MySQL 版,列存表分析加速 8核16GB
简介: 过去二十年,企业围绕数据建设逐步形成了一套成熟的方法体系,形成了数据仓库(中台),通过BI和报表进行业务赋能。然而,在智能化时代,这些是远远不够的,现在的数据治理体系并不足以让AI真正理解企业业务。换句话说,不能被AI通过消耗Token方式消费的数据平台,是没有未来的。本文介绍另一种受到广泛关注的知识管理的方法,就是(逻辑)语义模型。

近年以来,大模型、智能问答、智能体等AI应用快速发展,很多企业都在积极探索如何将AI能力融入业务场景。那么,在AI时代,数据治理和数据仓库如何顺应时代发展呢?过去二十年,企业围绕数据建设逐步形成了一套成熟的方法体系,形成了数据仓库(中台),通过BI和报表进行业务赋能。然而,在智能化时代,这些是远远不够的,现在的数据治理体系并不足以让AI真正理解企业业务。换句话说,不能被AI通过消耗Token方式消费的数据平台,是没有未来的。

从管理数据到管理知识:企业语义探索之路

企业在过去很多年里一直在探索如何让数据承载更多业务知识。最早,人们通过数据资产目录、元数据管理等方式,对数据进行分类、标注和管理,希望让数据更容易被发现和理解。近年来,随着大模型和生成式AI的发展,RAG(Retrieval-Augmented Generation)知识库成为热门方向。很多企业尝试将制度文档、业务手册、指标说明等内容导入知识库,希望AI能够通过检索增强的方式回答业务问题。与此同时,本体模型(Ontology)也受到越来越多关注,数语科技也推出了DOM本体系统,它通过定义概念、关系和规则,构建企业知识网络,为知识推理和智能分析提供基础。这些探索虽然路径不同,也各有优缺点,但本质上都在解决同一个问题:如何让企业知识能够被机器理解和使用。

本文介绍另一种受到广泛关注的知识管理的方法,就是(逻辑)语义模型。

什么是语义模型?

语义模型(Semantic Model)并不是一个新概念,但是在AI时代变得更加重要。早在数据仓库和商业智能(BI)发展的过程中,人们就开始尝试在底层数据结构与业务应用之间建立一层统一的业务语义,用来解决不同系统、不同报表之间口径不一致、理解不一致的问题。随着企业数据规模不断扩大,以及云计算、数据中台和AI技术的发展,语义模型的价值被重新认识。近年来,国际上出现了OSI(Open Semantic Interchange)等开放语义理念,希望建立跨平台、跨系统共享的统一语义标准,让语义能够像数据一样被交换、共享和复用。从内容上看,语义模型主要用于统一描述企业的业务知识,包括业务实体、业务术语、指标口径、业务规则以及实体之间的关系等内容,并将这些定义沉淀为统一的语义资产。

语义模型(Open Semantic Model)

开放语义模型(Open Semantic Model),简称OSM,是数语科技制定的企业级语义模型标准,并由其数据建模工具DDM提供设计、管理和落地支持。OSM借鉴了近年来国际上开放语义领域的发展成果,同时结合数语在数据模型和本体模型的数十年的积累,希望建立一种开放的本体化、标准化的语义描述方式,使企业能够将数据模型升级到业务语义模型,实现跨平台共享、跨系统复用以及面向AI的统一消费。本体化语义模型主要包含以下内容:指标与度量(Metrics):定义业务指标及其计算逻辑,以及与业务实体之间的关系。业务实体(Business Entities):定义业务口径中的实体。如客户、产品、订单、合同、设备、组织等核心业务实体。属性(Attributes):描述业务对象的关键属性及业务含义。关系(Relationships):定义对象之间的业务关系,如隶属、拥有、参与、依赖、影响等。映射(Mapping):定义业务实体与物理表(或视图)之间的映射关系,用来做数据查询引擎。业务规则(Business Rules):沉淀企业运营规则、约束条件和业务逻辑。在规范方面,本体化语义模型通常遵循国际知识表示与语义建模标准,包括:OSI(Open Semantic Intercharge, yaml) : 开放语义交互协议的yaml格式。RDF(Resource Description Framework):资源描述框架,用于统一表达实体及其关系。OWL(Web Ontology Language):用于构建企业本体模型和复杂业务规则。
image.png《Datablau DDM中的语义模型》

数语科技基于OSM,还提供通用数据查询系统,将企业统一语义层与自然语言交互能力深度融合,实现统一问数与数据探索分析。当前市场上不少方案采用Text2SQL、Text2DSL再转换为SQL等技术路线,虽然能够实现自然语言到查询语句的转换,但往往缺乏统一、完整的企业语义模型支撑,对业务概念、指标口径、规则关系和跨系统数据关联的理解能力有限,容易出现语义歧义、查询结果不一致以及复杂业务场景适配困难等问题。实践证明,无论采用哪个toSQL的路线,最后的瓶颈都是语义上下文的缺失。因此通过OSM实现的问数从准确率到开放性能力都要上一个台阶。
image.png《基于语义模型的数据查询系统》

如何从数据模型走向语义模型

对于很多国内企业来说,数据模型建设并不陌生。过去十多年,企业围绕数据资产建设,逐步形成了从业务系统到数据仓库、从数据标准到指标体系的完整方法论。尤其是在数据治理领域,很多企业已经建立了较为成熟的五级数据架构体系,通过概念模型、逻辑模型、物理模型以及数据标准等方式,实现了数据资产的规范化管理。这些建设成果并不会因为AI时代的到来而失去价值,企业过去积累的数据模型和治理成果,正在成为构建智能化能力最重要的基础。对于DDM而言,我们认为企业级语义模型建设可以分阶段推进。
第一步,基于现有数据模型、数据标准和指标体系,建立统一的业务术语和语义定义;
第二步,将业务实体、指标口径、业务规则等内容纳入统一管理,形成企业级语义资产库;
第三步,通过开放标准实现语义共享与复用,支撑跨系统、跨平台的数据协同;
第四步,将语义模型与AI应用结合,为智能问答、智能分析、智能体等场景提供统一知识底座;最终,逐步构建覆盖数据、语义和知识的企业级智能数据架构。从数据模型走向语义模型,并不是一次技术替换,而是一次数据资产价值的延伸。将过去建设的数据底座,升级为企业需要建设的知识底座。

写在最后

AI不会取代数据治理,也不会取代数据仓库。但AI的出现,正在重新定义它们的价值。从数据到语义,从资产到知识,这不仅是技术架构的演进方向,也是数据治理和数据仓库在AI时代最重要的发展方向。

相关文章
|
3天前
|
SQL 人工智能 自然语言处理
Vibe Coding 是什么?当“感觉编程”遇上数据库
Vibe Coding是2026年编程圈最火的概念之一,指开发者通过自然语言描述“感觉”或“意图”,由AI自动生成代码、调试、优化。本文从Vibe Coding的起源讲起,分析它如何改变数据库开发方式:从手写SQL到自然语言查询、从人工调索引到AI推荐、从经验运维到智能诊断。探讨这项趋势对DBA职业的影响,并给出拥抱变化的实用建议。技术会变,但人的判断力、审美和业务理解才是长期竞争力。
|
NoSQL Java 关系型数据库
【AgentScope Java新手村系列】(5)记忆与会话管理
记忆与会话管理 — AgentState 管理上下文窗口,AgentStateStore 持久化,RuntimeContext.sessionId 隔离多用户会话。
107 0
|
5天前
|
存储 人工智能 弹性计算
2026年阿里云618大促政策详解:新老用户权益与补贴规则
2026年阿里云618以**“AI加速季,智惠生产力”**为主题,活动周期为6月1日至6月30日,为期30天,是阿里云年度力度最大的云产品促销活动。本次大促投入**5亿元算力补贴**,覆盖轻量应用服务器、ECS云服务器、GPU高性能实例、数据库、AI大模型、存储与CDN等全品类产品,构建“新客秒杀、老客同价、企业补贴、AI特惠”的完整优惠体系。政策层面打破行业“首年低价、次年涨价”的痛点,推出**续费同价至2029年**、**新老用户权益互通**、**企业迁云高额补贴**等核心规则,同时将AI产品纳入优惠核心,通义千问主力模型直降97%,GPU实例低至1.5折。本文从活动基础信息、核心优惠政策
175 3
|
3天前
|
开发框架 测试技术 定位技术
Codex 实践系列 Vol.02:让 Codex 读懂开源项目 Typer
这次用 Codex 读 Typer,最重要的一点是:面对一个新项目,第一步先别急着让它写代码。比较稳妥的做法,是先让 Codex 读目录、找入口、解释核心文件,再沿着一个具体功能追下去,最后通过测试理解项目如何验证行为。
Codex 实践系列 Vol.02:让 Codex 读懂开源项目 Typer
|
3天前
|
人工智能 缓存 运维
阿里云百炼通义千问Qwen3.7-Plus完整指南:全维度功能特性、落地优势与优惠订阅方案实操手册
AI应用规模化落地进程中,绝大多数企业与开发者面临性能与成本难以平衡的核心难题:轻量化模型推理、图文解析、长文档处理能力不足,无法支撑中等复杂度智能体任务;旗舰级模型长期高频调用成本偏高,中小团队难以持续投入算力预算。依托自研通义千问技术体系打造的Qwen3.7-Plus,是阿里云百炼平台推出的中端全能型多模态大模型,精准填补轻量化模型与旗舰模型之间的市场空白,在保留百万级上下文、原生图文多模态、全链路工具调用、通用代码生成全套核心能力的基础上,大幅下调调用单价,适配个人开发者、小微创业团队、中小企业全层级使用需求。
176 1
|
3天前
|
Web App开发 安全 Linux
《Chrome扩展:穿透沙箱与签名体系的技术本质》
本文深入剖析Chrome第三方扩展的技术内核与生态博弈,跳出常规安装教程的表层视角。文章拆解了Chrome基于数字签名、沙箱隔离与权限管控构建的立体防护体系,详解开发者模式、本地加载、打包分发、企业策略部署等核心安装路径,分析了不同操作系统及Chromium衍生浏览器的生态差异。同时探讨了官方生态垄断、Manifest V3的深远影响,以及技术自由与安全管控的永恒矛盾,为深度用户提供了超越操作层面的技术洞察与安全边界指南。
|
2天前
|
人工智能 自然语言处理 算法
AI时代品牌信任度重建:基于阿里云技术栈的睿擎GEO五层架构实践指南
本文提出“GEO五层架构”方法论,助力企业应对AI搜索时代新挑战:从传统SEO“让人搜到我”,转向生成式引擎优化“让AI确信我是最可靠答案”。融合阿里云技术栈与国标框架,覆盖战略诊断、证据构建、场景覆盖、全域治理及风险应对,实现品牌在AI生态中的可信入驻。(239字)
|
3天前
|
缓存 人工智能 自然语言处理
阿里云百炼通义千问Qwen3.6-Flash完整实操指南:轻量化旗舰功能特性、落地优势与分层优惠订阅方案详解
当前AI应用落地场景分化愈发明显,除复杂智能体、百万字长文档、全栈大型工程开发等高门槛业务外,大量企业存在高频轻量问答、实时客服对话、短文本批量生成、简单数据提取、前端实时交互等标准化轻量化需求。这类场景单日调用频次可达数万乃至数十万次,对接口响应延迟、单轮调用成本、并发承载能力有极高要求,若选用高规格旗舰模型会造成算力预算严重浪费,而普通基础轻量化模型又存在逻辑推理弱、工具调用不稳定、短文本输出质量差等短板。
118 4
|
3天前
|
存储 人工智能 弹性计算
阿里云ECS云服务器零基础部署AI Agent 配置百炼Token Plan 保姆级教程
在阿里云上部署AI Agent并配置百炼Token Plan,需先完成基础准备工作,确保后续流程顺利推进。首先,需拥有阿里云账号并完成个人或企业实名认证,这是开通百炼服务、获取API密钥的前提。其次,准备好开发环境,本地需安装Python 3.8及以上版本,同时安装pip包管理工具,用于后续安装依赖库。此外,需具备基础的命令行操作能力,了解简单的Python语法,无需复杂的AI开发经验,零基础用户也可按步骤操作。
88 1
|
3天前
|
Web App开发 缓存 资源调度
《你的Chrome卡顿,真的是因为内存不够吗?》
本文跳出“删插件治卡顿”的表层认知,从Chrome多进程架构的底层逻辑出发,提出“扩展熵增”核心观点,剖析无序安装导致性能滑坡的深层诱因。文章揭示了扩展间隐性资源竞争、版本功能膨胀、第三方依赖链寄生、商业化模块植入等易被忽视的性能黑洞,详解了按需激活、版本锁定、权限收紧、进程优先级调度等精细化管理手段,并给出建立周期性复盘体系的长效方案,为用户提供了兼顾功能与性能的扩展管理思路。

热门文章

最新文章