您当前的位置: > 详细浏览

维语网页中n-gram模型结合类不平衡SVM的不良文本过滤方法

请选择邀稿期刊:
摘要: 随着新疆地区网络的建设发展,产生了大量维吾尔语网页。为了构建健康网络环境,提出了一种结合n-gram统计模型和类不平衡支持向量机(SVM)分类器的维语文本过滤方法。首先,将网页文本进行预处理操作,通过n-gram统计模型来初步提取词干;然后,对词干进行语义分析,将具有相似含义的词干聚合为一类,以此降低词干维度;最后,在传统SVM中引入一个控制超平面之间距离的参数,构建一种类不平衡SVM,使其能够很好地分类具有非线性不可分和不平衡性的维吾尔语文本。实验结果表明,该方法能够准确分类出不良文本,且具有较短的分类时间。

版本历史

[V1] 2018-10-11 09:20:10 ChinaXiv:201810.00040V1 下载全文
点击下载全文
预览
许可声明
metrics指标
  •  点击量1773
  •  下载量1020
评论
分享