適用于多用戶自定義字典的中文分詞詞頻方法及裝置
基本信息
申請?zhí)?/td> | CN202110736452.6 | 申請日 | - |
公開(公告)號 | CN113486660A | 公開(公告)日 | 2021-10-08 |
申請公布號 | CN113486660A | 申請公布日 | 2021-10-08 |
分類號 | G06F40/289(2020.01)I;G06F40/216(2020.01)I;G06F16/33(2019.01)I | 分類 | 計算;推算;計數(shù); |
發(fā)明人 | 王平;潘成;趙鵬 | 申請(專利權(quán))人 | 上海眾言網(wǎng)絡(luò)科技有限公司 |
代理機(jī)構(gòu) | 北京知果之信知識產(chǎn)權(quán)代理有限公司 | 代理人 | 卜榮麗;李志剛 |
地址 | 200030上海市徐匯區(qū)宜山路700號B2棟22層 | ||
法律狀態(tài) | - |
摘要
摘要 | 本發(fā)明公開了一種適用于多用戶自定義字典的中文分詞詞頻方法及裝置,其中方法包括:初始化hanlp分詞服務(wù);采用Aho?Corasick算法,根據(jù)第一文本和多用戶自定義字典生成各用戶自定義字典詞頻結(jié)果;根據(jù)第一文本和多用戶自定義字典,通過hanlp分詞服務(wù)生成第二文本分詞詞頻結(jié)果;合并所述各用戶自定義字典詞頻結(jié)果和所述第二文本分詞詞頻結(jié)果,得到最終中文分詞詞頻結(jié)果。本發(fā)明通過Aho?Corasick算法快速定位用戶自定義字典在文本中的位置,并將原始文本替換為空格字符的方法,對于多用戶自定義字典的分詞服務(wù),只需要一次初始化操作,即可實現(xiàn)高并發(fā)地支持多個用戶的自定義字典的高性能分詞詞頻服務(wù)。 |
