計算文本語義距離的方法、去重方法、聚類方法以及裝置
基本信息

| 申請?zhí)?/td> | CN201810892067.9 | 申請日 | - |
| 公開(公告)號 | CN109033087A | 公開(公告)日 | 2018-12-18 |
| 申請公布號 | CN109033087A | 申請公布日 | 2018-12-18 |
| 分類號 | G06F17/27;G06F17/22;G06F17/30 | 分類 | 計算;推算;計數(shù); |
| 發(fā)明人 | 孫雨軒;吳成龍 | 申請(專利權(quán))人 | 中證數(shù)智科技(深圳)有限公司 |
| 代理機構(gòu) | - | 代理人 | - |
| 地址 | 518038 廣東省深圳市福田區(qū)深南大道2012號深圳證券交易所廣場44樓 | ||
| 法律狀態(tài) | - | ||
摘要

| 摘要 | 本發(fā)明公開了一種計算文本語義距離的方法、去重方法、聚類方法及裝置,計算文本語義距離的方法包括:獲取第一及第二文本;判斷第一及第二文本之間是否需要進行語義距離計算;若是,對第一及第二文本進行預(yù)處理以得到第一及二句子集合;將第一及第二句子集合中公開的主體替換為對應(yīng)的唯一編碼,獲取第一及第二句子集合中的唯一編碼以形成第一及第二編碼集合,獲取第一及第二句子集合中的關(guān)鍵詞以形成第一及第二關(guān)鍵詞集合及每一關(guān)鍵詞的權(quán)重;轉(zhuǎn)換第一及第二關(guān)鍵詞集合中的每一關(guān)鍵詞,以得到第一及第二文本特征向量;根據(jù)第一編碼集合、第一文本特征向量、第一文本發(fā)布時間及第二編碼集合、第二文本特征向量、第二文本發(fā)布時間計算兩文本語義距離。 |





