基于CSS模板的职位信息并行抽取系统设计 |
| |
引用本文: | 薛安荣,王 丹,黄祖卫.基于CSS模板的职位信息并行抽取系统设计[J].电子科技,2016,29(10):93. |
| |
作者姓名: | 薛安荣 王 丹 黄祖卫 |
| |
作者单位: | (江苏大学 计算机科学与通信工程学院,江苏 镇江 212013) |
| |
基金项目: | 薛安荣(1965-),男,博士,教授,硕士生导师。研究方向:数据库与数据挖掘。王丹(1989-),女,硕士研究生。研究方向:数据挖掘。黄祖卫(1991-),男,硕士研究生。研究方向:数据挖掘。 |
| |
摘 要: | 针对现有职位信息抽取方法由于缺乏自适应性和并行性,存在冗余度高和抽取效率低的问题,提出了基于CSS模板的方式并行职位信息抽取方法。该方法根据职位信息页面特点使用CSS路径抽取方法,并制定抽取模板解决抽取的准确性和自适应性,使用了MapReduce编程模型实现职位信息的并行化抽取。使用MD5算法计算已抽取得到的职位信息的MD5值,结合MapReduce并行计算编程模型的特性实现职位信息去重,最终将去重后的职位信息存储在分布式数据库HBase。实验测试结果表明,并行计算与传统的非并行编程模型相比在处理的时间效率和采集的职位信息量上都有明显的提高。
|
关 键 词: | 信息抽取 MapReduce CSS模板 MD5算法 分布式数据库HBase |
|
| 点击此处可从《电子科技》浏览原始摘要信息 |
|
点击此处可从《电子科技》下载全文 |