Python实现中英文全文搜索的示例


Posted in Python onDecember 04, 2020

文章版权所有:州的先生博客

原文地址:https://zmister.com/archives/1596.html

在互联网上的各类网站中,无论大小,基本上都会有一个搜索框,用来给用户对内容进行搜索,小到站点搜索,大到搜索引擎搜索。

从简单的来说,搜索功能确实很简单,一个简单的 select 语句就可以实现数据的搜索。

而从复杂的来看,无论是搜索的精度还是搜索的效率,都是有很深的研究范围的。

对于简单的搜索功能来说,一个 select 查询语句也足够使用,但在稍微复杂一点的搜索环境下,比如网页、文档、新闻资讯等场景,单纯的 select 查询语句则是远远不够。在这些场景下的搜索,全文搜索则是最低配置。

什么是全文搜索?百度百科如是说:

全文数据库是全文检索系统的主要构成部分。所谓全文数据库是将一个完整的信息源的全部内容转化为计算机可以识别、处理的信息单元而形成的数据集合。全文数据库不仅存储了信息,而且还有对全文数据进行词、字、段落等更深层次的编辑、加工的功能,而且所有全文数据库无一不是海量信息数据库。

是不是看得不明不白的?讲一个简单的例子大概就理解了。正常情况下,我们搜索“Python 安装教程”,如果是普通的搜索,会直接使用 select 数据库中包含“Python 安装教程”的内容。但是全文搜索,会首先将搜索词拆分成:“Python 安装教程”、“Python”、“安装教程”、“安装”、“教程”等,然后用这些拆分后的词组进行搜索。

市面上所有的搜索引擎都使用了全文搜索:

Python实现中英文全文搜索的示例

最近“MrDoc 交流群”里让觅道文档添加上全文搜索的呼声很高,遂打算在觅道文档中把常规的 select 查询搜索替换为全文搜索。

最常见的开源全文搜索引擎是 Elasticsearch,功能强大、性能强悍,但是其基于 Java 进行编写,在 Python 中使用不是很方便,最终州的先生选择了纯 Python 实现的全文搜索引擎——whoosh,并借助 Django 下的开源搜索框架——haystack,依靠 jieba 中文分词库,在觅道文档这一典型 Python Web 应用中实现了中英文的全文搜索。

Python实现中英文全文搜索的示例

安装依赖库

如上述所言,本次纯 Python 方案实现中英文全文搜索使用到了如下 3 个库:

  • whoosh
  • haystack
  • jieba

需要对其进行安装,使用 pip 命令进行安装即可:

pip install whoosh
pip install django-haystack
pip install jieba

settings 配置

首先需要在 Django 项目的 settings.py 文件中进行配置。

第一、在 INSTALLED_APPS 中添加 haystack 库:

Python实现中英文全文搜索的示例

第二、添加配置 haystack 的配置项

Python实现中英文全文搜索的示例

# 当添加、修改、删除数据时,自动生成索引
HAYSTACK_SIGNAL_PROCESSOR = 'haystack.signals.RealtimeSignalProcessor'
# 自定义高亮
HAYSTACK_CUSTOM_HIGHLIGHTER = "app_doc.search.highlight.MyHighLighter"

创建索引

在 app_doc 目录下新建一个名为 search_indexes.py 的文件,在其中输入如下内容:

Python实现中英文全文搜索的示例

在 template 目录下新建一色名为 search 的目录,然后在 search 目录下新建一个名为 indexes 的目录,接着在其中新建一个名为 app_doc 的目录(与 Django 应用同名),最后在这个/template/search/app_doc 目录下新建一个名称 doc_text.txt 的文件(模型名称_text.txt),在其中输入需要索引的模型字段:

{{object.name}}
{{object.pre_content}}

创建中文分词器

由于 whoosh 对中文的分词能力不行,如果我们搜索中文,其八成不会对其进行分词,所以我们额外引入了 jieba 模块来进行中文分词。

在 /MrDoc/app_doc/search 目录下新建一个名为 chines_analyzer.py 的文件,在其中写入如下代码:

Python实现中英文全文搜索的示例

自定义 whoosh 搜索引擎

在 /MrDoc/app_doc/search 目录下新建一个名为 whoosh_cn_backend.py 的文件(这个路径文件即是我们在 settings.py 文件中指定的引擎路径),复制 python 安装路径\Lib\site-packages\haystack\backends\whoosh_backend.py 的内容到这个文件中,并做如下修改:

from whoosh.analysis import StemmingAnalyzer

替换为:

from app_doc.search.chinese_analyzer import ChineseAnalyzer as StemmingAnalyzer

这样,我们自定义能够进行中文分词的 whoosh 引擎就完成了。

编写视图函数

完成上述步骤之后,全文搜索引擎幕后的工作就已经完成了,我们接下来需要按照 Django 的方式,编写逻辑视图,并进行 HTML 模板的渲染。

在这里,州的先生在/MrDoc/app_doc/下新建了一个名为 views_search.py 的文件来放置全文搜索的视图函数,继承 haystack.views.SearchView 类,自定义了一个全文搜索视图类:

Python实现中英文全文搜索的示例

HTML 模板渲染

全文搜索引擎的数据默认返回在了特定的 HTML 模板中,州的先生没有对此进行自定义,所以按照 haystack 的要求,在 template/search 目录下新建了一个名为 search.html 的模板文件,对全文搜索视图类返回的搜索数据集进行渲染解析。

Python实现中英文全文搜索的示例

生成索引

最后我们需要在命令行终端生成一下索引文件,使用如下命令:

python manage.py rebuild_index

这样,就实现了纯 Python 方案的中英文全文搜索,效果如下动图所示:

Python实现中英文全文搜索的示例

文中所涉代码均为 MrDoc 觅道文档源码,包括:

  • /MrDoc/MrDoc/settings.py
  • /MrDoc/app_doc/search/chinese_analyzer.py
  • /MrDoc/app_doc/search/highlight.py
  • /MrDoc/app_doc/search/whoosh_cn_backend.py
  • /MrDoc/app_doc/search_indexes.py
  • /MrDoc/app_doc/views_search.py
  • /MrDoc/template/search/*

源码地址为:

https://gitee.com/zmister/MrDoc
https://github.com/zmister2016/MrDoc

以上就是Python实现中英文全文搜索的示例的详细内容,更多关于python 实现全文搜索的资料请关注三水点靠木其它相关文章!

Python 相关文章推荐
Python数据结构与算法之完全树与最小堆实例
Dec 13 Python
python队列通信:rabbitMQ的使用(实例讲解)
Dec 22 Python
Python实现简易版的Web服务器(推荐)
Jan 29 Python
Python使用MyQR制作专属动态彩色二维码功能
Jun 04 Python
Python中使用双下划线防止类属性被覆盖问题
Jun 27 Python
pytorch torch.expand和torch.repeat的区别详解
Nov 05 Python
pyqt5中动画的使用详解
Apr 01 Python
Python使用os.listdir和os.walk获取文件路径
May 21 Python
python中sys模块是做什么用的
Aug 16 Python
如何用Python 加密文件
Sep 10 Python
python中pandas.read_csv()函数的深入讲解
Mar 29 Python
python利用while求100内的整数和方式
Nov 07 Python
一文带你了解Python 四种常见基础爬虫方法介绍
Dec 04 #Python
使用Python通过oBIX协议访问Niagara数据的示例
Dec 04 #Python
python飞机大战游戏实例讲解
Dec 04 #Python
python 根据列表批量下载网易云音乐的免费音乐
Dec 03 #Python
python中字符串的编码与解码详析
Dec 03 #Python
python 爬取百度文库并下载(免费文章限定)
Dec 04 #Python
filter使用python3代码进行迭代元素的实例详解
Dec 03 #Python
You might like
Drupal7连接多个数据库及常见问题解决
2014/03/02 PHP
CentOS 安装 PHP5.5+Redis+XDebug+Nginx+MySQL全纪录
2015/03/25 PHP
PHP实现微信退款的方法示例
2019/03/26 PHP
尽可能写"友好"的"Javascript"代码
2007/01/09 Javascript
JavaScript中的console.time()函数详细介绍
2014/12/29 Javascript
AngularJS 表达式详细讲解及实例代码
2016/07/26 Javascript
Bootstrap幻灯片轮播图支持触屏左右手势滑动的实现方法
2016/10/13 Javascript
JS无缝滚动效果实现方法分析
2016/12/21 Javascript
js阻止移动端页面滚动的两种方法
2017/01/25 Javascript
BootStrap Table 后台数据绑定、特殊列处理、排序功能
2017/05/27 Javascript
Vue底层实现原理总结
2018/02/17 Javascript
Nodejs 和 Electron ubuntu下快速安装过程
2018/05/04 NodeJs
Vue利用History记录上一页面的数据方法实例
2018/11/02 Javascript
es6中Promise 对象基本功能与用法实例分析
2020/02/23 Javascript
关于javascript中的promise的用法和注意事项(推荐)
2021/01/15 Javascript
[02:19]DOTA2女子战队FOX视频专访:希望更多美眉一起加入
2013/10/15 DOTA
[55:35]VGJ.S vs Mski Supermajor小组赛C组 BO3 第二场 6.3
2018/06/04 DOTA
Python OpenCV获取视频的方法
2018/02/28 Python
python实现超简单的视频对象提取功能
2018/06/04 Python
python用pandas数据加载、存储与文件格式的实例
2018/12/07 Python
Linux上使用Python统计每天的键盘输入次数
2019/04/17 Python
python opencv捕获摄像头并显示内容的实现
2019/07/11 Python
微信端html5页面调用分享接口示例
2018/03/14 HTML / CSS
Expedia丹麦:全球领先的旅游网站
2018/03/18 全球购物
澳大利亚当地社区首选的光学商店:1001 Optical
2019/08/24 全球购物
应届生幼儿园求职信
2013/11/12 职场文书
社区优秀志愿者材料
2014/02/02 职场文书
校园标语大全
2014/06/19 职场文书
护理学院专科毕业生求职信
2014/06/28 职场文书
社会学专业求职信
2014/07/17 职场文书
2014年最新大专生职业生涯规划书范文
2014/09/13 职场文书
办公室主任四风问题对照检查材料思想汇报
2014/09/28 职场文书
社区五一劳动节活动总结
2015/02/09 职场文书
2015年服务员个人工作总结
2015/05/27 职场文书
小学三年级数学教学反思
2016/02/16 职场文书
Sql Server之数据类型详解
2022/02/28 SQL Server