-
公开(公告)号:CN113095858A
公开(公告)日:2021-07-09
申请号:CN202110497356.0
申请日:2021-05-07
Applicant: 广州市刑事科学技术研究所 , 国家计算机网络与信息安全管理中心广东分中心
IPC: G06Q30/00 , G06F16/335 , G06F16/35 , G06F40/194 , G06F40/279 , G06F40/30 , G06N3/04 , G06N3/08
Abstract: 本发明为解决没有考虑对文本信息的过滤及涉诈类别的分类导致存在识别准确率和效率低的问题,提出一种涉诈短文本识别方法,包括以下步骤:获取待识别的短文本,对所述短文本中的正常短文本进行过滤,得到疑似涉诈短文本数据集;将所述疑似涉诈短文本数据集输入神经网络模型中提取语义特征;根据所述疑似涉诈短文本数据集中字符的拼音和笔顺与预设的涉诈关键词的相似度对所述疑似涉诈短文本数据集进行特征抽取得到人工特征,并基于预设的涉诈关键词进行硬匹配,得到硬匹配特征;将所述语义特征、人工特征和硬匹配特征进行特征融合后通过多分类算法进行建模训练,生成用于诈骗短文本识别的分类器,输出得到涉诈短文本识别结果。
-
公开(公告)号:CN114398581B
公开(公告)日:2024-11-05
申请号:CN202210056971.2
申请日:2022-01-18
Applicant: 广州市刑事科学技术研究所 , 国家计算机网络与信息安全管理中心广东分中心
IPC: G06F16/958 , G06F16/903 , G06F40/216 , G06F40/284 , G06V30/42 , G06V30/18
Abstract: 本发明提出一种诈骗网站的识别方法及系统,包括:采集诈骗网站和官方网站的网页数据,构建碰撞数据库和比对数据库;判断待识别网站是否存在入口页面,若存在入口页面则利用碰撞数据库的数据下载待识别网站的页面图片;提取待识别网站的页面图片中的文字和图片特征,将所述文字和图片特征与比对数据库进行比对,分别判断待识别网站是否为诈骗网站;本发明考虑到诈骗网站利用入口页面来规避一般的诈骗网站检测的特点,对待识别网站进行入口页面判断,且构建了碰撞数据库,绕过待识别网站的入口页面并获取待识别网站的页面图片,利用待识别网站的页面图片,与基于官网网站的网页数据构建的比对数据进行比对,提升了诈骗网站的识别效果。
-
公开(公告)号:CN114398581A
公开(公告)日:2022-04-26
申请号:CN202210056971.2
申请日:2022-01-18
Applicant: 广州市刑事科学技术研究所 , 国家计算机网络与信息安全管理中心广东分中心
IPC: G06F16/958 , G06F16/903 , G06F40/216 , G06F40/284 , G06K9/62 , G06V30/42 , G06V30/18
Abstract: 本发明提出一种诈骗网站的识别方法及系统,包括:采集诈骗网站和官方网站的网页数据,构建碰撞数据库和比对数据库;判断待识别网站是否存在入口页面,若存在入口页面则利用碰撞数据库的数据下载待识别网站的页面图片;提取待识别网站的页面图片中的文字和图片特征,将所述文字和图片特征与比对数据库进行比对,分别判断待识别网站是否为诈骗网站;本发明考虑到诈骗网站利用入口页面来规避一般的诈骗网站检测的特点,对待识别网站进行入口页面判断,且构建了碰撞数据库,绕过待识别网站的入口页面并获取待识别网站的页面图片,利用待识别网站的页面图片,与基于官网网站的网页数据构建的比对数据进行比对,提升了诈骗网站的识别效果。