MongoDB源码解析:Full Text Search Index

本文涉及的产品
云数据库 MongoDB,独享型 2核8GB
推荐场景:
构建全方位客户视图
云原生内存数据库 Tair,内存型 2GB
云原生多模数据库 Lindorm,多引擎 多规格 0-4节点
简介: 框架实现 FTS本质上也是Btree索引类型 索引AccessMethod定义: class FTSAccessMethod : public BtreeBasedAccessMethod 关键成员: fts::FTSSpec _ftsSpec; 获取索引的函数入口: void

框架实现

FTS本质上也是Btree索引类型

索引AccessMethod定义:


class FTSAccessMethod : public BtreeBasedAccessMethod

关键成员:

fts::FTSSpec _ftsSpec;

获取索引的函数入口:

void FTSAccessMethod::getKeys(const BSONObj& obj, BSONObjSet* keys) {
  ExpressionKeysPrivate::getFTSKeys(obj, _ftsSpec, keys);
}

追踪到:

fts::FTSIndexFormat::getKeys(ftsSpec, obj, keys);
  • ftsSepc:是用来描述语言类型的类,定义的语言索引的一系列属性
  • obj:需要被索引的文档
  • keys:分词后产生的结果

FTSIndexFormat的实现:

  • getKeys:找多文档所有命中的索引,FTS也支持组合索引,全文索引分词的建立通过函数FTSSpec::scoreDocument,注意:单个文档所有的索引加起来不能大于4MB,数量小于400000个。所以MongoDB的全文索引不实用于较大的文档。尤其是中文情况下,由于中文的复杂性,所以要格外注意,从性能角度上建议把文档控制在几百KB左右范围内。
  • getIndexKey:获取索引Key,VERSION2的算法对较长的Key进行了Hash压缩,算法是截取前32字节的前缀,后32字节用Murmurhash运算出来的数值代替,所以,最长不会超过64字节。

FTSSpec::scoreDocument,分词,然后统计频度,最后算法评分,算法原则是单词出现比例越大分数约高,单词的基数越大,造成的分数差距越小,算法大概如下:

  • exp = 2^(count-1)
  • freq = SIGMA(1/exp)
  • coeff = (count + totalCount) / ( 2 * totalCount)
  • score = weight * freq * coeff

分词实现

分词是搜索的基础,MongoDB目前只支持拉丁语系的分词处理,拉丁语的分词相对与中文简单很多,只需要有限的stop-word(比如the,a,空格等)即可完成一个套简单的分词功能。而中文博大精深,目前还没有非常好的开源库实现中文分词。

具体算法,先用stop-word进行文本切割,然后调用libstemmer三方库进行词干提取,最后得到文本分词。

挑战中文分词

经过一天的代码学习,总结下来,要实现中文分词首先要解决的是中文分词器,然后是字库。

有了两者的基础后,可以通过定义VERSION版本来自定一套分词算法,甚至是评分标准。

相关实践学习
MongoDB数据库入门
MongoDB数据库入门实验。
快速掌握 MongoDB 数据库
本课程主要讲解MongoDB数据库的基本知识,包括MongoDB数据库的安装、配置、服务的启动、数据的CRUD操作函数使用、MongoDB索引的使用(唯一索引、地理索引、过期索引、全文索引等)、MapReduce操作实现、用户管理、Java对MongoDB的操作支持(基于2.x驱动与3.x驱动的完全讲解)。 通过学习此课程,读者将具备MongoDB数据库的开发能力,并且能够使用MongoDB进行项目开发。   相关的阿里云产品:云数据库 MongoDB版 云数据库MongoDB版支持ReplicaSet和Sharding两种部署架构,具备安全审计,时间点备份等多项企业能力。在互联网、物联网、游戏、金融等领域被广泛采用。 云数据库MongoDB版(ApsaraDB for MongoDB)完全兼容MongoDB协议,基于飞天分布式系统和高可靠存储引擎,提供多节点高可用架构、弹性扩容、容灾、备份回滚、性能优化等解决方案。 产品详情: https://www.aliyun.com/product/mongodb
目录
相关文章
|
22天前
|
监控 网络协议 Java
Tomcat源码解析】整体架构组成及核心组件
Tomcat,原名Catalina,是一款优雅轻盈的Web服务器,自4.x版本起扩展了JSP、EL等功能,超越了单纯的Servlet容器范畴。Servlet是Sun公司为Java编程Web应用制定的规范,Tomcat作为Servlet容器,负责构建Request与Response对象,并执行业务逻辑。
Tomcat源码解析】整体架构组成及核心组件
|
28天前
|
运维 监控 NoSQL
【MongoDB 复制集秘籍】Secondary 同步慢怎么办?深度解析与实战指南,让你的数据库飞速同步!
【8月更文挑战第24天】本文通过一个具体案例探讨了MongoDB复制集中Secondary成员同步缓慢的问题。现象表现为数据延迟增加,影响业务运行。经分析,可能的原因包括硬件资源不足、网络状况不佳、复制日志错误等。解决策略涵盖优化硬件(如增加内存、升级CPU)、调整网络配置以减少延迟以及优化MongoDB配置(例如调整`oplogSize`、启用压缩)。通过这些方法可有效提升同步效率,保证系统的稳定性和性能。
40 4
|
1月前
|
存储 NoSQL Redis
redis 6源码解析之 object
redis 6源码解析之 object
55 6
|
7天前
|
存储 缓存 Java
什么是线程池?从底层源码入手,深度解析线程池的工作原理
本文从底层源码入手,深度解析ThreadPoolExecutor底层源码,包括其核心字段、内部类和重要方法,另外对Executors工具类下的四种自带线程池源码进行解释。 阅读本文后,可以对线程池的工作原理、七大参数、生命周期、拒绝策略等内容拥有更深入的认识。
什么是线程池?从底层源码入手,深度解析线程池的工作原理
|
11天前
|
开发工具
Flutter-AnimatedWidget组件源码解析
Flutter-AnimatedWidget组件源码解析
|
7天前
|
设计模式 Java 关系型数据库
【Java笔记+踩坑汇总】Java基础+JavaWeb+SSM+SpringBoot+SpringCloud+瑞吉外卖/谷粒商城/学成在线+设计模式+面试题汇总+性能调优/架构设计+源码解析
本文是“Java学习路线”专栏的导航文章,目标是为Java初学者和初中高级工程师提供一套完整的Java学习路线。
|
29天前
|
测试技术 Python
python自动化测试中装饰器@ddt与@data源码深入解析
综上所述,使用 `@ddt`和 `@data`可以大大简化写作测试用例的过程,让我们能专注于测试逻辑的本身,而无需编写重复的测试方法。通过讲解了 `@ddt`和 `@data`源码的关键部分,我们可以更深入地理解其背后的工作原理。
25 1
|
1月前
|
开发者 Python
深入解析Python `httpx`源码,探索现代HTTP客户端的秘密!
深入解析Python `httpx`源码,探索现代HTTP客户端的秘密!
68 1
|
1月前
|
开发者 Python
深入解析Python `requests`库源码,揭开HTTP请求的神秘面纱!
深入解析Python `requests`库源码,揭开HTTP请求的神秘面纱!
123 1
|
2月前
|
负载均衡 Java Spring
@EnableFeignClients注解源码解析
@EnableFeignClients注解源码解析
60 14

相关产品

  • 云数据库 MongoDB 版
  • 推荐镜像

    更多