一種主題詞生成模型的訓練方法及計算設備

基本信息

申請?zhí)?/td> CN202110710401.6 申請日 -
公開(公告)號 CN113609841A 公開(公告)日 2021-11-05
申請公布號 CN113609841A 申請公布日 2021-11-05
分類號 G06F40/216(2020.01)I;G06F40/289(2020.01)I;G06F40/30(2020.01)I;G06N20/10(2019.01)I 分類 計算;推算;計數(shù);
發(fā)明人 李輝;陳永生 申請(專利權)人 北京齊爾布萊特科技有限公司
代理機構 北京思睿峰知識產權代理有限公司 代理人 高攀;趙愛軍
地址 100080北京市海淀區(qū)丹棱街3號B座10層1010室
法律狀態(tài) -

摘要

摘要 本發(fā)明公開了一種主題詞生成模型的訓練方法,在計算設備中執(zhí)行,包括步驟:獲取文檔集合和記錄用戶行為的日志;針對用戶每一次搜索行為,對用戶搜索的關鍵詞進行分詞處理,得到一個或多個切分后的詞;針對每一個切分后的詞和文檔集合中的每一個文檔,根據(jù)切分后的詞、日志和文檔集合生成特征向量,將切分后的詞作為特征向量的標簽,并確定包含特征向量及其標簽的樣本為正樣本或負樣本;根據(jù)樣本,對主題詞生成模型進行訓練,得到訓練后的主題詞生成模型。本發(fā)明一并公開了相應的裝置、計算設備及可讀存儲介質。