首页 | 官方网站   微博 | 高级检索  
     

基于Active Learning的中文分词领域自适应
引用本文:许华婷,张玉洁,杨晓晖,单 华,徐金安,陈钰枫.基于Active Learning的中文分词领域自适应[J].中文信息学报,2015,29(5):55-63.
作者姓名:许华婷  张玉洁  杨晓晖  单 华  徐金安  陈钰枫
作者单位:北京交通大学 计算机与信息技术学院,北京 100044
基金项目:国家国际科技合作专项资助(2014DFA11350);国家自然科学基金(61370130)
摘    要:在新闻领域标注语料上训练的中文分词系统在跨领域时性能会有明显下降。针对目标领域的大规模标注语料难以获取的问题,该文提出Active learning算法与n-gram统计特征相结合的领域自适应方法。该方法通过对目标领域文本与已有标注语料的差异进行统计分析,选择含有最多未标记过的语言现象的小规模语料优先进行人工标注,然后再结合大规模文本中的n-gram统计特征训练目标领域的分词系统。该文采用了CRF训练模型,并在100万句的科技文献领域上,验证了所提方法的有效性,评测数据为人工标注的300句科技文献语料。实验结果显示,在科技文献测试语料上,基于Active Learning训练的分词系统在各项评测指标上均有提高。


关 键 词:中文分词  领域自适应  主动学习  

Active Learning Based Domain Adaptation for Chinese Word Segmentation
XU Huating,ZHANG Yujie,YANG Xiaohui,SHAN Hua,XU Jinan,CHEN Yufeng.Active Learning Based Domain Adaptation for Chinese Word Segmentation[J].Journal of Chinese Information Processing,2015,29(5):55-63.
Authors:XU Huating  ZHANG Yujie  YANG Xiaohui  SHAN Hua  XU Jinan  CHEN Yufeng
Affiliation:School of Computer and Information Technology, Beijing Jiaotong University, Beijing 100044, China
Abstract:
Keywords:Chinese word segmentation  domain adaptation  active learning  
点击此处可从《中文信息学报》浏览原始摘要信息
点击此处可从《中文信息学报》下载全文
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司    京ICP备09084417号-23

京公网安备 11010802026262号