开源 SPL 强化 MongoDB 计算

本文涉及的产品
云数据库 MongoDB,独享型 2核8GB
推荐场景:
构建全方位客户视图
RDS MySQL Serverless 基础系列,0.5-2RCU 50GB
云数据库 RDS MySQL,集群系列 2核4GB
推荐场景:
搭建个人博客
简介: MongoDB是NoSQL数据库的典型代表,支持文档结构的存储方式数据存储和使用更为便捷,数据存取效率也很高,但计算能力较弱,实际使用中涉及MongoDB的计算尤其是复杂计算会很麻烦,这就需要具备强计算能力的数据处理引擎与其配合。开源集算器SPL是一款专业结构化数据计算引擎,拥有丰富的计算类库和完备、不依赖数据库的计算能力。SPL提供了独立的过程计算语法,尤其擅长复杂计算,可以增强MongoDB的计算能力,完成分组汇总、关联计算、子查询等通通不在话下。

MongoDB是NoSQL数据库的典型代表,支持文档结构的存储方式数据存储和使用更为便捷,数据存取效率也很高,但计算能力较弱,实际使用中涉及MongoDB的计算尤其是复杂计算会很麻烦,这就需要具备强计算能力的数据处理引擎与其配合。

开源集算器SPL是一款专业结构化数据计算引擎,拥有丰富的计算类库和完备、不依赖数据库的计算能力。SPL提供了独立的过程计算语法,尤其擅长复杂计算,可以增强MongoDB的计算能力,完成分组汇总、关联计算、子查询等通通不在话下。

常规查询

MongoDB不容易搞定的连接JOIN运算,用SPL很容易搞定:

A B
1 =mongo_open("mongodb://127.0.0.1:27017/raqdb") /连接MongDB
2 =mongo_shell(A1,"c1.find()").fetch() /获取数据
3 =mongo_shell(A1,"c2.find()").fetch()
4 =A2.join(user1:user2,A3:user1:user2,output) /关联计算
5 >A1.close() /关闭连接

 

单表多次参与运算,复用计算结果:

A B
1 =mongo_open("mongodb://127.0.0.1:27017/raqdb")
2 =mongo_shell(A1,“course.find(,{_id:0})”).fetch() /获取数据
3 =A2.group(Sno).((avg   = ~.avg(Grade), ~.select(Grade>avg))).conj() /计算成绩大于平均值
4 >A1.close()

 

IN计算:

A B
1 =mongo_open("mongodb://localhost:27017/test")
2 =mongo_shell(A1,"orders.find(,{_id:0})") /获取数据
3 =mongo_shell(A1,"employee.find({STATE:'California'},{_id:0})").fetch() /过滤employee数据
4 =A3.(EID).sort() /取出EID并排序
5 =A2.select(A4.pos@b(SELLERID)).fetch() /二分法查找
6 >A1.close()

 

外键对象化,外键指针不仅方便,效率也高:

A B
1 =mongo_open("mongodb://localhost:27017/local")
2 =mongo_shell(A1,"Progress.find({},   {_id:0})").fetch() /获取Progress数据
3 =A2.groups(courseid;   count(userId):popularityCount) /按课程分组计数
4 =mongo_shell(A1,"Course.find(,{title:1})").fetch() /获取Course数据
5 =A3.switch(courseid,A4:_id) /外键连接
6 =A5.new(popularityCount,courseid.title) /创建结果集
7 =A1.close()

 

APPLY算法的简单实现:

A B
1 =mongo_open("mongodb://127.0.0.1:27017/raqdb")
2 =mongo_shell(A1,"users.find()").fetch() /获取users数据
3 =mongo_shell(A1,"workouts.find()").fetch() /获取workouts数据
4 =A2.conj(A3.select(A2.workouts.pos(_id)).derive(A2.name)) /查询_id 值workouts 序列的记录
5 >A1.close()

 

集合运算,合并交差:

A B
1 =mongo_open("mongodb://127.0.0.1:27017/raqdb")
2 =mongo_shell(A1,"emp1.find()").fetch()
3 =mongo_shell(A1,"emp2.find()").fetch()
4 =[A2,A3].conj() /多序列合集
5 =[A2,A3].merge@ou() /全行对比求并集
6 =[A2,A3].merge@ou(_id,   NAME) /键值对比求并集
7 =[A2,A3].merge@oi() /全行对比求交集
8 =[A2,A3].merge@oi(_id,   NAME) /键值对比求交集
9 =[A2,A3].merge@od() /全行对比求差集
10 =[A2,A3].merge@od(_id,   NAME) /键值对比求差集
11 >A1.close()

 

在序列中查找成员序号:

A B
1 =mongo_open("mongodb://localhost:27017/local)
2 =mongo_shell(A1,"users.find({name:'jim'},{name:1,friends:1,_id:0})")   .fetch()
3 =A2.friends.pos("luke") /从friends序列中获取成员序号
4 =A1.close()

 

多成员集合的交集:

A B
1 [Chemical,   Biology, Math] /课程
2 =mongo_open("mongodb://127.0.0.1:27017/raqdb")
3 =mongo_shell(A2,"student.find()").fetch() /获取student数据
4 =A3.select(Lesson^A1!=[]) /查询选修至少一门的记录
5 =A4.new(_id,   Name, ~.Lesson^A1:Lession) /计算出结果
6 >A2.close()

复杂计算

TOPN运算:

A B
1 =mongo_open("mongodb://127.0.0.1:27017/test")
2 =mongo_shell(A1,"last3.find(,{_id:0};{variable:1})") /获取last3数据,并按variable排序
3 for A2;variable =A3.top(3;-timestamp) /选出timestamp最晚的3个
4 =@|B3 /将选出文档追加到B4中
5 =B4.minp(~.timestamp)      /选出timstamp最早的文档
6 >mongo_close(A1)

 

嵌套结构的聚合:

A
1 =mongo_open("mongodb://127.0.0.1:27017/raqdb")
2 =mongo_shell(A1,"computer.find()").fetch()
3 =A2.new(_id:ID,income.array().sum():INCOME,output.array().sum():OUTPUT)
4 >A1.close()

 

合并多属性子文档:

A B C
1 =mongo_open("mongodb://localhost:27017/local")
2 =mongo_shell(A1,"c1.find(,{_id:0};{name:1})")
3 =create(_id,   readUsers) /创建结果序表
4 for   A2;name =A4.conj(acls.read.users|acls.append.users|acls.edit.users|acls.fullControl.users).id() /取出所有users字段
5 >A3.insert(0,   A4.name, B4) /插入本组数据
6 =A1.close()

 

嵌套List子文档的查询

A B
1 =mongo_open("mongodb://localhost:27017/local")
2 =mongo_shell(A1,"Cbettwen.find(,{_id:0})").fetch()
3 =A2.conj((t=~.objList.data.dataList,   t.select((s=float(~.split@c1()(1)), s>6154   && s<=6155)))) /找到符合条件的字符串
4 =A1.close()

 

交叉汇总:

A
1 =mongo_open("mongodb://localhost:27017/local")
2 =mongo_shell(A1,"student.find()").fetch()
3 =A2.group(school)
4 =A3.new(school:school,~.align@a(5,sub1).(~.len()):sub1,~.align@a(5,sub2).(~.len()):sub2)
5 =A4.new(school,sub1(5):sub1-5,sub1(4):sub1-4,sub1(3):sub1-3,sub1(2):sub1-2,sub1(1):sub1-1,sub2(5):sub2-5,sub2(4):sub2-4,sub2(3):sub2-3,sub2(2):sub2-2,sub2(1):sub2-1)
6 =A1.close()

 

分段分组

A B
1 [3000,5000,7500,10000,15000] /Sales分段区间
2 =mongo_open("mongodb://127.0.0.1:27017/raqdb")
3 =mongo_shell(A2,"sales.find()").fetch()
4 =A3.groups(A1.pseg(~.SALES):Segment;count(1):   number) /根据 SALES 区间分组统计员工数
5 >A2.close()

 

分类分组

A B
1 =mongo_open("mongodb://127.0.0.1:27017/raqdb")
2 =mongo_shell(A1,"books.find()")
3 =A2.groups(addr,book;count(book):   Count) /分组计数
4 =A3.groups(addr;sum(Count):Total) /分组统计
5 =A3.join(addr,A4:addr,Total) /关联计算
6 >A1.close()

 

数据写入

导出成CSV:

A B
1 =mongo_open("mongodb://localhost:27017/raqdb")
2 =mongo_shell(A1,"carInfo.find(,{_id:0})")
3 =A2.conj((t=~,cars.car.new(t.id:id,   t.cars.name, ~:car))) /对car字段进行拆分成行
4 =file("D:\\data.csv").export@tc(A3) /导出生成csv文件
5 >A1.close()

 

更新数据库(MongoDB到MySQL):

A B
1 =mongo_open("mongodb://localhost:27017/raqdb") /连接MongDB
2 =mongo_shell(A1,"course.find(,{_id:0})").fetch()
3 =connect("myDB1") /连接mysql
4 =A3.query@x("select   * from course2").keys(Sno, Cno)
5 >A3.update(A2:A4,   course2, Sno, Cno, Grade; Sno,Cno) /向mysql更新数据
6 >A1.close()

 

更新数据库(MySQL到MongoDB):

A B
1 =connect("mysql") /连接mysql
2 =A1.query@x("select   * from course2") /获取表course2数据
3 =mongo_open("mongodb://localhost:27017/raqdb") /连接MongDB
4 =mongo_insert(A3,   "course",A2) /将MySQL表course2导入MongoDB集合course
5 >A3.close()

 

混合计算

借助SPL还很容易实现MongoDB与其他数据源进行混合计算:

A B
1 =mongo_open("mongodb://localhost:27017/test") /连接MongDB
2 =mongo_shell(A1,"emp.find({'$and':[{'Birthday':{'$gte':'"+string(begin)+"'}},{'Birthday':{'$lte':'"+string(end)+"'}}]},{_id:0})").fetch() /查询某时间段的记录
3 =A1.close() /关闭MongoDB
4 =myDB1.query("select   * from cities") /获取mysql中表cities数据
5 =A2.switch(CityID,A4:   CityID) /外键关联
6 =A5.new(EID,Dept,CityID.CityName:CityName,Name,Gender) /创建结果集
7 return   A6 /返回

SQL支持

SPL除了原生语法,还提供了相当于SQL92标准的SQL支持,可以使用SQL查询MongoDB了,比如前面的关联计算:

A
1 =mongo_open("mongodb://127.0.0.1:27017/test")
2 =mongo_shell(A1,"c1.find()").fetch()
3 =mongo_shell@x(A1,"c2.find()").fetch()
4 $select s.* from {A2} as s left join {A3}   as r on s.user1=r.user1 and s.user2=r.user2 where r.income>0.3

应用集成

不仅如此,SPL提供了标准JDBC/ODBC等应用程序接口,集成调用很方便。如JDBC的使用:

Class.forName("com.esproc.jdbc.InternalDriver");
Connection conn = DriverManager.getConnection("jdbc:esproc:local://");
PrepareStatement st=con.prepareStatement("call splScript(?)"); // splScript为spl脚本文件名
st.setObject(1,"California");
st.execute();
ResultSet rs = st.getResultSet();

有了这些功能,增强MongoDB的计算能力可不是说说而已,要不要下载试试?

SPL资料

相关实践学习
MongoDB数据库入门
MongoDB数据库入门实验。
快速掌握 MongoDB 数据库
本课程主要讲解MongoDB数据库的基本知识,包括MongoDB数据库的安装、配置、服务的启动、数据的CRUD操作函数使用、MongoDB索引的使用(唯一索引、地理索引、过期索引、全文索引等)、MapReduce操作实现、用户管理、Java对MongoDB的操作支持(基于2.x驱动与3.x驱动的完全讲解)。 通过学习此课程,读者将具备MongoDB数据库的开发能力,并且能够使用MongoDB进行项目开发。 &nbsp; 相关的阿里云产品:云数据库 MongoDB版 云数据库MongoDB版支持ReplicaSet和Sharding两种部署架构,具备安全审计,时间点备份等多项企业能力。在互联网、物联网、游戏、金融等领域被广泛采用。 云数据库MongoDB版(ApsaraDB for MongoDB)完全兼容MongoDB协议,基于飞天分布式系统和高可靠存储引擎,提供多节点高可用架构、弹性扩容、容灾、备份回滚、性能优化等解决方案。 产品详情: https://www.aliyun.com/product/mongodb
相关文章
|
30天前
|
存储 NoSQL atlas
探索MongoDB:发展历程、优势与应用场景
MongoDB 是一个开源的文档型数据库,由 DoubleClick 团队于2007年创立,旨在解决传统数据库的扩展性和灵活性问题。它支持 JSON 格式的存储和查询,具备高可用性、高扩展性和灵活性等优势。MongoDB 适用于社交、物联网、视频直播和内容管理等多种场景,并被阿里巴巴、腾讯等一线互联网公司广泛使用。其主要版本包括 MongoDB Atlas(云服务)、MongoDB Enterprise Advanced(商业版)和 MongoDB Community Edition(免费版)。自2009年发布1.0版本以来,MongoDB 不断创新,最新版本为7.0,在性能和功能上持续优化。
78 12
|
3月前
|
人工智能 NoSQL 机器人
MongoDB Atlas与YoMio.AI近乎完美适配:推理更快速、查询更灵活、场景更丰富
随着MongoDB的新发布和革新,YoMio.AI的“闪电式发展”值得期待。
|
7月前
|
存储 NoSQL 数据处理
探索MongoDB:灵活、高性能的NoSQL数据库解决方案与应用实践
探索MongoDB:灵活、高性能的NoSQL数据库解决方案与应用实践
365 1
|
7月前
|
存储 NoSQL 数据管理
MongoDB关系处理:优化数据管理、提升性能的最佳实践
MongoDB关系处理:优化数据管理、提升性能的最佳实践
|
8月前
|
NoSQL 大数据 数据处理
MongoDB聚合框架与复杂查询优化:技术深度解析
【4月更文挑战第30天】本文深入探讨了MongoDB的聚合框架和复杂查询优化技术。聚合框架包含$match、$group、$sort和$project阶段,用于数据处理和分析,提供灵活性和高性能。优化查询涉及创建合适索引、使用聚合框架、简化查询语句、限制返回结果数、避免跨分片查询、只查询所需字段及使用$inc操作符。理解这些技术有助于提升MongoDB在大数据和复杂查询场景下的性能。
|
8月前
|
人工智能 NoSQL atlas
官宣!MongoDB Atlas再添新功能!进一步简化构建现代应用程序
利用数据简化高响应性应用程序的构建过程
3195 0
|
8月前
|
存储 NoSQL 数据挖掘
MongoDB的产品特性
MongoDB的产品特性
|
存储 机器学习/深度学习 人工智能
向量数据库:新一代的数据处理工具
向量数据库是一种特殊类型的数据库,它可以存储和处理向量数据。向量数据通常用于表示多维度的数据点,例如在机器学习和人工智能中使用的数据。在向量数据库中,数据被表示为向量,这些向量可以在多维空间中进行比较和搜索。这种数据库的一个关键特性是它能够快速地找到与给定向量最相似的其他向量,这是通过计算向量之间的距离(例如欧氏距离或余弦相似度)来实现的。
2210 0
向量数据库:新一代的数据处理工具
|
存储 人工智能 NoSQL
MongoDB推出五项MongoDB Atlas新功能,帮助企业使用单一开发者数据平台构建新应用程序类别
Beamable、Pureinsights、Anywhere Real Estate及Hootsuite等客户和合作伙伴,正使用MongoDB Atlas新功能构建下一代应用程序
MongoDB推出五项MongoDB Atlas新功能,帮助企业使用单一开发者数据平台构建新应用程序类别
|
存储 NoSQL 数据建模
MongoDB性能系列最佳实践-数据建模与内存优化
帮助用户在多个关键方面实现规模化性能优化
MongoDB性能系列最佳实践-数据建模与内存优化