基于关键词挖掘的热线文本数据犯罪线索筛查方法研究
|
甄沐华:硕士研究生 |
|
陈鹏:副教授,博士 |
|
王坤:食药环侦支队一大队大队长 |
|
范子杨:本科生 |
|
王者:本科生 |
收稿日期: 2022-07-01
网络出版日期: 2025-04-28
基金资助
本文系北京市自然科学基金项目“数据驱动下的城市犯罪风险机理分析与防控优化研究”(项目编号:9192022)研究成果之一。
Research on hotline text data crime clue screening method based on keyword mining
Received date: 2022-07-01
Online published: 2025-04-28
[目的/意义] 针对公安业务中对热线文本数据犯罪线索关键信息识别与筛查时存在的信息化分析能力不足问题,提出一种基于关键词挖掘的热线文本数据犯罪线索筛查方法,帮助业务部门提高相关情报研判效率,使得犯罪线索筛查工作更加信息化和科学化。[方法/过程] 考虑到直接采用文本类等算法方法或因有效信息样本量占比过小使得模型训练不充分,本文首先对已知犯罪线索进行基于文本相似度的种子词集抽取,然后采用Word2Vec对种子词汇从同类词、替代词两个角度扩展构成专业词库,最后使用基于语义的积分筛查模型实现对热线文本数据中犯罪线索筛查。[结果/结论] 对济南市1 050条先验热线文本数据作犯罪线索筛查实验,并进行实际比对与结果指标分析,得到结果召回率86%,可以认为本文所述基于语义的积分筛查方法对济南市热线文本数据内犯罪信息具体性识别达到预期效果并实现犯罪线索有效筛查。
甄沐华 , 陈鹏 , 王坤 , 范子杨 , 王者 . 基于关键词挖掘的热线文本数据犯罪线索筛查方法研究[J]. 知识管理论坛, 2022 , 7(5) : 539 -548 . DOI: 10.13266/j.issn.2095-5472.2022.044
[Purpose/Significance] Aiming at the problem of insufficient information analysis ability in the current public security business about identification and screening of crime clues in hotline texts, a method of hotline text data crime clue screening based on keyword mining is proposed to help business departments improve relevant intelligence and judgment [Method/Process] Considering that algorithms such as automatic text classification are subject to the problem of sample size, this paper firstly identified the key information of the known attribute data and established a seed lexicon, and then used Word2Vec to expand the seed vocabulary from the perspectives of similar words and synonym words to form a professional thesaurus, and finally used a semantics-based integral screening model to screen criminal clues in the hotline text data. [Result/Conclusion] This paper conducted a crime clue screening experiment on 1 050 priori hotline text data in Jinan City. After actual comparison and index analysis, the recall rate reached 86%. The specific identification of crime information in the text data of the city hotline achieved the expected effect and realized the effective screening of crime clues.
公式(1)
公式(2)
公式(3)
公式(4)
公式(5)表1 实验语料部分示例 |
| 序号 | 事件文本内容(脱敏处理) | 数据属性 |
| 1 | 有人在**社区东北角 私自打了两口机井,据有村民反映村书记赵*与别人合伙,打算从其他地区运输 有害气体投放谋取利益。来电投诉,要求 追究责任。 | 犯罪线索 (线索发现) |
| 2 | 收到*先生诉求后,派出所所领导 高度重视,原*局的 督办件中了解到,举报**厂排放重金属,此项 超出派出所 管辖范围,系环保部门管辖,关于**厂经理马**逃避故意杀人、投毒、非法经营、污染环境问题,经过调阅档案, 未查询到此案件,电话联系*先生,*先生强烈要求检察院处理,不要求公安机关处理,申请 不计入考核。 | 普通事件 |
| 3 | 市生态环境保护综合行政执法支队执法人员就举报人反映的问题对**公司莱芜分公司进行了现场 核查,具体核查情况是……。现场 检查时,**公司各单位 正常生产,污染防治设施均 正常运行, 未发现有在线数据超标的现象。执法人员现场要求**公司各单位严格生产管理,确保各项污染物达标排放,同时要求加强对区管企业的监管力度。关于**厂污染的投诉问题,我局已按照 信访程序办理。建议12345热线 不列入年终满意率考核,谢谢! | 普通事件 |
| 4 | 针对“网传济南某整形机构女老板殴打顾客的视频”一事,经济南市公安局高新分局 立案侦查, 犯罪嫌疑人刘某明 涉嫌非法拘禁罪,被依法 刑事拘留; 嫌疑人曲某、孙某笑 涉嫌非法拘禁罪,被依法 取保候审。案件正在进一步 侦办中, 调查处理情况将及时向社会公布。 | 犯罪线索 (线索督办) |
| …… | …… | …… |
表2 种子词集词汇部分示例 |
| 类型 | 词集示例 |
| seed_T | 已/立案、口头劝诫、勒令、实施/扣押、涉嫌违法、正在/调查处理、采取措施、限期整改、线索已移交、取缔、依法处理、情节严重、落实查处…… |
| seed_F | 不/纳入/考核、不予/立案、恳请、恶意/举报、继续/监督、没有/发现、不/存在、不/属实、正常/现象、达成一致、自行协商/解决、不再/追究、不予/受理…… |
表3 同类词集词汇部分示例 |
| 类型 | 词集示例 |
| seed_T_similar | 案件、法定程序、立案查处、行政处罚、介入、调查、核查、核实、查处、实地调查、口头、劝诫、警告、教育批评、逾期…… |
| seed_F_ similar | 不计、考核、记入、不记、满意率、考核成绩、纳入、不列入、列为、不予、拒绝、恶意、故意、刁难、报复、个人行为、威胁…… |
表4 替代词集词汇部分示例 |
| 类型 | 词集示例 |
| seed_T_synonym | 起诉、批捕、受理、裁定、调查结果、进行调查、调查报告、深入调查、书面形式、当面、劝诫、告诫…… |
| seed_F_synonym | 不能、没有、不会绝不、计入、扣除、算入、扣减、考核、绩效考核、奖惩、绩效评价、不计、数等、上列、所获、纳入…… |
表5 犯罪线索筛查方法结果指标统计 |
| 指标 | 准确率 | 精确率 | 召回率 | 漏报率 |
| 数值/% | 98.38 | 81.13 | 86.00 | 14.00 |
甄沐华:设计研究方法,完成实验,起草论文,修改论文与定稿
陈鹏:提出研究思路,修改论文
王坤:提供数据,提出研究问题
范子杨:采集数据,进行实验
王者:集数据,进行实验
| [1] |
王勇.大数据在我国食药智慧监管中的应用[J].中国食品药品监管,2018(5):44-47.
|
| [2] |
袁猛,刘文杰,胡建华,等.“昆仑2020”:全方位构筑食药环安全防线[J].人民公安,2020(16):30-33.
|
| [3] |
徐建民,王金花,马伟瑜.利用本体关联度改进的TF-IDF特征词提取方法[J].情报科学,2011,29(2):279-283.
|
| [4] |
彭云,万常选,江腾蛟,等.基于语义约束LDA的商品特征和情感词提取[J].软件学报,2017,28(3):676-693.
|
| [5] |
刘耕,方勇,刘嘉勇.基于关联词和扩展规则的敏感词库设计[J].四川大学学报(自然科学版),2009,46(3):667-671.
|
| [6] |
刘亚桥,陆向艳,邓凯凯,等.摄影领域评论情感词典构建方法[J].计算机工程与设计,2019,40(10):3037-3042.
|
| [7] |
谭敏博.基于知识图谱的谷类作物病害识别及个性化推送研究[D].长沙:湖南农业大学,2018.
|
| [8] |
夏松,林荣蓉,刘勘.网络谣言敏感词库的构建研究——以新浪微博谣言为例[J].知识管理论坛,2019,4(5):267-275.
|
| [9] |
唐晓波,高和璇.基于关键词词向量特征扩展的健康问句分类研究[J].数据分析与知识发现,2020,4(7):66-75.
|
| [10] |
姜天宇,王苏,徐伟.基于朴素贝叶斯的中文文本分类[J].电脑知识与技术,2019,15(23):253-254,263.
|
| [11] |
吴绍忠.重点人员积分预警模型建设基础问题研究[J].中国人民公安大学学报(自然科学版),2012,18(2):76-79.
|
| [12] |
涂铭,刘祥,刘树春.Python自然语言处理实战核心技术与算法[M].北京:机械工业出版社,2021:120,129.
|
| [13] |
严红.词向量发展综述[J].现代计算机(专业版),2019(8):50-52.
|
| [14] |
CHEN K J, MA W Y. Unknown word extraction for Chinese documents[C]// Proceedings of international conference on DBLP. Taipei: Morgan Kaufmann Publishers, 2002:169-175.
|
| [15] |
PEDERSEN T, KULKARNI A. Identifying similar words and contexts in natural language with sense clusters[C]//Proceedings of the 20th national conference on artificial intelligence. Pittsburgh: AAAI Press, 2010:1694-1695.
|
| [16] |
NEVIAROUSKAYA A, PRENDINGER H, ISHIZUKAM. SentiFul: a lexicon for sentiment analysis[J].IEEE transactions on affective computing,2011,2(1):22-36.
|
/
| 〈 |
|
〉 |