最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Mysql實現(xiàn)簡易版搜索引擎的示例代碼

 更新時間:2021年08月30日 09:51:12   作者:靚仔聊編程  
前段時間,因為項目需求,需要根據關鍵詞搜索聊天記錄,所以本文實現(xiàn)了Mysql實現(xiàn)簡易版搜索引擎,具有一定的參考價值,感興趣的可以了解一下

前言

前段時間,因為項目需求,需要根據關鍵詞搜索聊天記錄,這不就是一個搜索引擎的功能嗎?

于是我第一時間想到的就是 ElasticSearch 分布式搜索引擎,但是由于一些原因,公司的服務器資源比較緊張,沒有額外的機器去部署一套 ElasticSearch 服務,而且上線時間也比較緊張,數據量也不大,然后就想到了 Mysql 的全文索引。

簡介

其實 Mysql 很早就支持全文索引了,只不過一直只支持英文的檢索,從5.7.6 版本開始,Mysql 就內置了 ngram 全文解析器,用來支持中文、日文、韓文分詞。

Mysql 全文索引采用的是倒排索引的原理,在倒排索引中關鍵詞是主鍵,每個關鍵詞都對應著一系列文件,這些文件中都出現(xiàn)了這個關鍵詞。這樣當用戶搜索某個關鍵詞時,排序程序在倒排索引中定位到這個關鍵詞,就可以馬上找出所有包含這個關鍵詞的文件。

本文測試,基于 Mysql 8.0 版本,數據庫引擎采用的是 InnoDB

ngram 全文解析器

ngram 就是一段文字里面連續(xù)的 n 個字的序列。ngram 全文解析器能夠對文本進行分詞,每個單詞是連續(xù)的 n 個字的序列。例如,用 ngram 全文解析器對“你好靚仔”進行分詞:

n=1: '你', '好', '靚', '仔' 
n=2: '你好', '好靚', '靚仔' 
n=3: '你好靚', '好靚仔' 
n=4: '你好靚仔'

MySQL 中使用全局變量 ngram_token_size 來配置 ngram 中 n 的大小,它的取值范圍是1到10,默認值是 2。通常 ngram_token_size 設置為要查詢的單詞的最小字數。如果需要搜索單字,就要把 ngram_token_size 設置為 1。在默認值是 2 的情況下,搜索單字是得不到任何結果的。因為中文單詞最少是兩個漢字,推薦使用默認值 2。

可以通過以下命令查看 Mysql 默認的 ngram_token_size 大?。?/p>

show variables like 'ngram_token_size'

有兩種方式可以設置全局變量 ngram_token_size 的值:

1、啟動 mysqld 命令時指定:

mysqld --ngram_token_size=2

2、修改 Mysql 配置文件 my.ini,末尾增加一行參數:

ngram_token_size=2

創(chuàng)建全文索引

1、建表時創(chuàng)建全文索引

CREATE TABLE `article` (
  `id` bigint NOT NULL,
  `url` varchar(1024) COLLATE utf8mb4_general_ci NOT NULL DEFAULT '',
  `title` varchar(256) COLLATE utf8mb4_general_ci NOT NULL DEFAULT '',
  `source` varchar(32) COLLATE utf8mb4_general_ci DEFAULT '',
  `keywords` varchar(32) COLLATE utf8mb4_general_ci DEFAULT NULL,
  `publish_time` timestamp NULL DEFAULT NULL,
  PRIMARY KEY (`id`),
  FULLTEXT KEY `title_index` (`title`) WITH PARSER `ngram`
) ENGINE=InnoDB DEFAULT CHARSET=utf8mb4 COLLATE=utf8mb4_general_ci;

2、通過 alter table 方式

ALTER TABLE article ADD FULLTEXT INDEX title_index(title) WITH PARSER ngram;

3、通過 create index 方式

CREATE FULLTEXT INDEX title_index ON article (title) WITH PARSER ngram;

檢索方式

1、自然語言檢索(NATURAL LANGUAGE MODE)

自然語言模式是 MySQL 默認的全文檢索模式。自然語言模式不能使用操作符,不能指定關鍵詞必須出現(xiàn)或者必須不能出現(xiàn)等復雜查詢。

示例

select * from article where MATCH(title) AGAINST ('北京旅游' IN NATURAL LANGUAGE MODE);

// 不指定模式,默認使用自然語言模式
select * from article where MATCH(title) AGAINST ('北京旅游');

可以看出,該模式下根據“北京旅游”搜索,可以搜索出包含“北京”的或者包含“旅游”的內容,因為它是根據自然語言分成了兩個關鍵詞。

上面示例中返回的結果會自動按照匹配度排序,匹配度高的在前面,匹配度是一個非負浮點數。

示例

// 查看匹配度
select * , MATCH(title) AGAINST ('北京旅游') as score from article where MATCH(title) AGAINST ('北京旅游' IN NATURAL LANGUAGE MODE);

2、布爾檢索(BOOLEAN MODE)

布爾檢索模式可以使用操作符,可以支持指定關鍵詞必須出現(xiàn)或者必須不能出現(xiàn)或者關鍵詞的權重高還是低等復雜查詢。

示例

// 無操作符
// 包含“約會”或“攻略”
select * from article where MATCH(title) AGAINST ('約會 攻略' IN BOOLEAN MODE);

// 使用操作符
// 必須包含“約會”,可包含“攻略”
select * from article where MATCH(title) AGAINST ('+約會 攻略' IN BOOLEAN MODE);

更多操作符示例:

'約會 攻略' 
無操作符,表示或,要么包含“約會”,要么包含“攻略”

'+約會 +攻略'
必須同時包含兩個詞

'+約會 攻略'
必須包含“約會”,但是如果也包含“攻略”的話,匹配度更高。

'+約會 -攻略'
必須包含“約會”,同時不能包含“攻略”。

'+約會 ~攻略'
必須包含“約會”,但是如果也包含“攻略”的話,匹配度要比不包含“攻略”的記錄低。

'+約會 +(>攻略 <技巧)'
查詢必須包含“約會”和“攻略”或者“約會”和“技巧”的記錄,但是“約會 攻略”的匹配度要比“約會 技巧”高。

'約會*'
查詢包含以“約會”開頭的記錄。

'"約會攻略"'
使用雙引號把要搜素的詞括起來,效果類似于like '%約會攻略%',
例如“約會攻略初級篇”會被匹配到,而“約會的攻略”就不會被匹配。

與 Like 對比

全文索引和 like 查詢對比,有以下優(yōu)點:

  • like 只是進行模糊匹配,全文索引卻提供了一些語法語義的查詢功能,會將要查的字符串進行分詞操作,這決定于 Mysql 的詞庫。
  • 全文索引可以自己設置詞語的最小、最大長度,要忽略的詞,這些都是可以設置的。
  • 用全文索引去某個列查一個字符串,會返回匹配度,可以理解為匹配的關鍵字個數,是個浮點數。

而且全文檢索的性能也是優(yōu)于 like 查詢的

以下是以 50w 左右數據進行的測試:

// like 查詢
select * from article where title like '%北京%';

// 全文索引查詢
select * from article where MATCH(title) AGAINST ('北京' IN BOOLEAN MODE);

可以看出 like 查詢是 1.536s,全文索引查詢是 0.094s,快了16倍左右。

總結

全文索引能快速搜索,但是也存在維護索引的開銷。字段長度越大,創(chuàng)建的全文索引也越大,會影響DML語句的吞吐量。數據量不大的情況下可以采用全文索引來做搜索,簡單方便,但是數據量大的話還是建議用專門的搜索引擎 ElasticSearch 來做這件事。

到此這篇關于Mysql實現(xiàn)簡易版搜索引擎的示例代碼的文章就介紹到這了,更多相關Mysql 搜索引擎內容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!

相關文章

  • 全面分析MySQL?ERROR?1045出現(xiàn)的原因及解決

    全面分析MySQL?ERROR?1045出現(xiàn)的原因及解決

    這篇文章主要介紹了全面分析MySQL?ERROR?1045出現(xiàn)的原因及解決方案,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2022-07-07
  • 一次mysql遷移的方案與踩坑實戰(zhàn)記錄

    一次mysql遷移的方案與踩坑實戰(zhàn)記錄

    這篇文章主要給大家介紹了一次mysql遷移的方案與踩坑的相關資料,MySQL遷移是DBA日常維護中的一個工作,遷移究其本義,無非是把實際存在的物體挪走,保證該物體的完整性以及延續(xù)性,需要的朋友可以參考下
    2021-08-08
  • MySQL 丟失數據的原因及解決

    MySQL 丟失數據的原因及解決

    這篇文章主要介紹了MySQL 丟失數據的原因及解決,幫助大家更好的理解和學習使用MySQL數據庫,感興趣的朋友可以了解下
    2021-05-05
  • MySQL動態(tài)列轉行的實現(xiàn)示例

    MySQL動態(tài)列轉行的實現(xiàn)示例

    本文介紹了如何在MySQL中實現(xiàn)動態(tài)列轉行的功能,通過使用格式化日期、計數函數、分組、存儲過程、分組合并函數和SQL拼接等技巧,可以將動態(tài)列轉換為行,從而更好地進行數據分析和展示,感興趣的可以了解一下
    2024-11-11
  • 在MAC OS X上安裝MYSQL

    在MAC OS X上安裝MYSQL

    MAC系統(tǒng)自帶apache和php,但是沒有mysql,那么我們只好自力更生了,經過一番研究,借鑒網上一位大神的文章,終于成功安裝上了mysql,這里推薦給有需要的朋友
    2014-10-10
  • 在sql中對兩列數據進行運算作為新的列操作

    在sql中對兩列數據進行運算作為新的列操作

    這篇文章主要介紹了在sql中對兩列數據進行運算作為新的列操作,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-10-10
  • 分享101個MySQL調試與優(yōu)化技巧

    分享101個MySQL調試與優(yōu)化技巧

    隨著越來越多的數據庫驅動的應用程序,人們一直在推動MySQL發(fā)展到它的極限。這里是101條調節(jié)和優(yōu)化MySQL安裝的技巧。一些技巧是針對特定的安裝環(huán)境的,但這些思路是通用的。我已經把他們分成幾類,來幫助你掌握更多MySQL的調節(jié)和優(yōu)化技巧
    2017-05-05
  • 詳解如何在MySQL中自動生成和更新時間戳

    詳解如何在MySQL中自動生成和更新時間戳

    在數據庫設計中,時間戳字段(如 create_time 和 update_time)是非常常見的需求,它們通常用于記錄數據的創(chuàng)建時間和最后更新時間,以便于數據追蹤和分析,本文將深入探討如何在 MySQL 中設置自動生成和更新時間戳字段,需要的朋友可以參考下
    2025-02-02
  • mysql忘記密碼重置的方法實現(xiàn)

    mysql忘記密碼重置的方法實現(xiàn)

    本文主要介紹了mysql忘記密碼重置的方法實現(xiàn),文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2023-03-03
  • 用Eclipse連接MySQL數據庫的步驟

    用Eclipse連接MySQL數據庫的步驟

    這篇文章主要介紹了如何用Eclipse連接MySQL數據庫,需要的朋友可以參考下
    2015-08-08

最新評論

鄂尔多斯市| 牙克石市| 敦化市| 上犹县| 金坛市| 曲阳县| 长海县| 奇台县| 南溪县| 仙游县| 通辽市| 大方县| 察雅县| 林甸县| 洛浦县| 沙洋县| 韶关市| 邻水| 出国| 宜昌市| 沁阳市| 通城县| 银川市| 依安县| 平潭县| 宣武区| 北川| 时尚| 大厂| 琼结县| 天峨县| 荣成市| 安平县| 亚东县| 社旗县| 涿州市| 天峨县| 马边| 德化县| 西盟| 阿拉善右旗|