基于语义相关度主题爬虫的语料采集方法 Corpus Collection Based on Semantic Relevancy Focused Crawler期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

基于语义相关度主题爬虫的语料采集方法

引用本文：	周昆,王钊,于碧辉.基于语义相关度主题爬虫的语料采集方法[J].计算机系统应用,2019,28(5):190-195.

作者姓名：	周昆王钊于碧辉

作者单位：	中国科学院大学, 北京 100049;中国科学院沈阳计算技术研究所, 沈阳 110168;沈阳市国家税务局信息中心,辽宁沈阳,110013

摘要：	针对特定领域语料采集任务，设计了基于语义相关度主题爬虫的语料采集方法.根据选定的主题词，利用页面描述信息，基于维基百科中文语料训练出的词分布式表示综合HowNet计算页面信息相关度，结合URL的结构信息预测未访问URL链指的页面内容与特定领域的相关程度.实验表明，系统能够有效的采集互联网中的党建领域页面内容作为党建领域生语料，在党建领域网站上的平均准确率达到94.87%，在门户网站上的平均准确率达到64.20%.
关键词：	生语料采集语义相关度主题爬虫页面信息相关度 URL结构信息
收稿时间：	2018/11/26 0:00:00
修稿时间：	2018/12/18 0:00:00
Corpus Collection Based on Semantic Relevancy Focused Crawler

ZHOU Kun,WANG Zhao and YU Bi-Hui.Corpus Collection Based on Semantic Relevancy Focused Crawler[J].Computer Systems& Applications,2019,28(5):190-195.

Authors:	ZHOU Kun WANG Zhao and YU Bi-Hui

Affiliation:	University of Chinese Academy of Sciences, Beijing 100049, China;Shenyang Institute of Computing Technology, Chinese Academy of Sciences, Shenyang 110168, China,Center for Information Technology, Shenyang State Tax Bureau, Shenyang 110013, China and University of Chinese Academy of Sciences, Beijing 100049, China;Shenyang Institute of Computing Technology, Chinese Academy of Sciences, Shenyang 110168, China

Abstract:

Keywords:	corpus collection semantic relevancy focused crawler page information semantic relevancy URL structural information
本文献已被万方数据等数据库收录！
	点击此处可从《计算机系统应用》浏览原始摘要信息
	点击此处可从《计算机系统应用》下载全文

设为首页 | 免责声明 | 关于勤云 | 加入收藏