首页 | 官方网站   微博 | 高级检索  
相似文献
 共查询到20条相似文献,搜索用时 31 毫秒
1.
针对领域术语抽取中含字长度较大的术语被错误切分的问题,本文提出一种基于术语长度和语法特征的统计领域术语抽取方法。本方法在利用机器学习抽取候选术语时,加入基于术语长度和语法特征的约束规则;在使用统计方法确定候选术语的领域性时,充分考虑词长比这一概念的重要性,将其作为判断术语领域性的重要权值。实验表明,提出的方法能够正确抽取含字长度较大的领域术语,抽取结果的准确率和召回率相比以往的方法有所提高。  相似文献   

2.
一种基于Bootstrapping的本体学习方法   总被引:1,自引:0,他引:1  
提出了一种基于自扩展的本体学习方法用于获取领域术语.该方法只需提供少量种子术语和一个未标注语料库作为输入,由种子术语开始学习抽取模式,再由学习到的模式发现新的术语,进一步由新发现的术语学习新的抽取模式,如此循环迭代.实验结果表明,该算法能够产生较高质量的领域术语集合和抽取模式集合,这样的集合可用于相关领域的信息抽取.  相似文献   

3.
癫痫病相关论文缺乏命名实体识别和关系抽取任务的标注数据,命名实体识别和关系抽取模型无法用常规方法训练。为解决该问题,针对癫痫病相关论文的数据特点,改进了命名实体识别和关系抽取模型,提出利用相近领域的医疗数据和预训练模型构建零资源癫痫病领域命名实体识别和关系抽取模型。评估了现有无监督和半监督模型在癫痫病领域论文数据集上的性能,并针对数据集特征引入域对抗网络和关系判别器,有效地提高了命名实体识别和关系抽取模型的性能。将癫痫患者的脑电特征以视觉模态嵌入知识图谱中,在提高脑电分析可解释性的同时,构建了更加直观的多模态知识图谱。  相似文献   

4.
基于半监督学习的蛋白质关系抽取研究   总被引:2,自引:2,他引:0  
使用半监督学习方法中的自训练、协同训练方法,利用少量已标注样本和大量未标注样本来完成蛋白质关系抽取的任务.首先使用基于词特征的SVM(support vector machine)模型进行自训练,然后使用基于词特征的SVM模型和基于依存树特征的SVM模型进行协同训练.通过对4个语料的实验,验证了自训练及协同训练方法在蛋白质关系抽取领域中的应用效果.相比于自训练,协同训练可以通过两个相对独立的视图相互补充、相互学习,进而可以有效利用未标注数据.  相似文献   

5.
跨领域文本情感分析时,为了使抽取的共享情感特征能够捕获更多的句子语义信息特征,提出域对抗和BERT(bidirectional encoder representations from transformers)的深度网络模型。利用BERT结构抽取句子语义表示向量,通过卷积神经网络抽取句子的局部特征。通过使用域对抗神经网络使得不同领域抽取的特征表示尽量不可判别,即源领域和目标领域抽取的特征具有更多的相似性;通过在有情感标签的源领域数据集上训练情感分类器,期望该分类器在源领域和目标领域均能达到较好的情感分类效果。在亚马逊产品评论数据集上的试验结果表明,该方法具有良好的性能,能够更好地实现跨领域文本情感分类。  相似文献   

6.
基于自扩展与最大熵的领域实体关系自动抽取   总被引:2,自引:2,他引:0  
实体关系自动获取是信息抽取的难题之一。本文提出自扩展算法和最大熵机器学习算法相结合的方法,以旅游领域为研究对象进行实体关系的自动抽取。首先利用自扩展算法自动获取能体现实体对间大类关系的语义词汇,该词汇作为特征加入最大熵机器学习算法的特征集,并设定阈值实现训练语料的自动标注;然后使用最大熵机器学习算法对训练语料进行学习,构建实体关系抽取的分类器,实现实体关系的自动获取。在收集600篇旅游领域语料的基础上进行实验,4大类实体关系的抽取获得了较好的结果,其中地理位置关系和时节关系的F值分别为82.56%和81.17%。实验结果表明:在人工干预较少的情况下,加入实体对间的语义词汇能有效提高抽取效果。  相似文献   

7.
信息领域汉英术语的特征及其在语料中的分布规律   总被引:2,自引:0,他引:2  
在对 725万字的信息领域专业文献中带英文注释的术语(汉英术语)进行了人工标记,然后利用程序提取汉英术语及其前界环境(前至少 4个汉字)的工作基础上 ,本文对汉英术语的自身特征和前界环境进行了分析,目的是为术语的自动抽取提供规则及相关统计数据。  相似文献   

8.
为了提高中文领域本体概念抽取的准确率和召回率,提出一种多策略的中文领域本体概念抽取方法。该方法使用模式匹配法改进原有的单字合并法,经词性过滤和缺陷检测筛选出概念集组成用户词典,并送入概念抽取系统进行二次分词获得候选概念集;利用词频-逆向文本频率(TFIDF)方法和信息熵融合得到TFIDFE方法,计算概念权重以获得领域概念集。实验结果表明,该方法在领域术语抽取的准确率、召回率和F值上均有较好的效果。  相似文献   

9.
随着数字视频技术在交通领域的广泛应用,视频车辆识别成为了一个"ITS"领域的基础问题.视频图像中的车辆识别是一个典型的分类学习问题,针对这一问题,提出一种基于特征融合和集成机器学习的车辆识别算法.该方法首先获取视频序列中的兴趣区域;然后对兴趣区域提取纹理特征、Hu不变矩特征和小波特征,将这些特征组合成一种新的特征向量;然后将组合特征向量作为BP神经网络输入进行训练得到基分类器,最后利用Adaboost方法将BP神经网络集成得到强分类器.对所用方法进行了实验对比分析,其统计正检率、误检率、漏检率以及准确率等多参数结果均优于其他两种算法,实验验证该方法具有较好的识别率和鲁棒性.  相似文献   

10.
提出了一种基于句法模式的语义关系抽取方法,用于从术语词典中抽取语义关系.该方法以句法模式为中心,结合了自然语言处理技术和统计的思想,充分利用术语词典文档中的句法信息,通过抽取包含着语义关系信息的句法模式,并将其与词典文本进行近似匹配以达到抽取语义关系的目的.实验结果表明,该方法可以有效地从术语词典中抽取多种语义关系.  相似文献   

11.
提出了一种用平滑型排序支持向量机(Rank-sSVM)抽取博客文章摘要的方法。使用该排序算法抽取的摘要,反映了评论者的意见和博客文集的特性。自动摘要过程中,首先经人工从文章选择重要句子标记为摘要,作为训练对象;再由机器生成表示文章语句的特征集,共14个特征,包含标签、评论等博客文章独有的信息;最后用Rank-sSVM学习人工摘要后,将文章所有句子排序,选取最靠前的若干语句构成摘要。该方法在一个中文博客数据集上取得良好效果。  相似文献   

12.
为了解决在抽取过程中出现的关系三元组重叠问题,提出了一种基于位置辅助标记的实体关系联合抽取模型,使用BERT作为预训练语言模型,并且通过位置辅助矩阵方法,将关系三元组抽取转换成实体和关系的匹配问题,实现实体和关系的联合抽取,在中文数据集DuIE上进行了相关实验。实验结果表明,该模型抽取效果较好,提出的基于位置的辅助标记方法有效解决了关系重叠问题。  相似文献   

13.
多领域机器翻译一直以来都是机器翻译领域研究的重点,而短语归纳是重中之重。传统加权的方法并没有考虑到整个归约过程,本文提出了一种使用层次化的Pitman Yor过程进行短语归约,同时把多通道引入到模型中,使得在短语归约的过程中平衡各领域的影响;从模型角度,本文的方法为生成式模型,模型更有表现力,且把对齐和短语抽取一起建模,克服了错误对齐对原有短语抽取性能的影响。从复杂度上来说,该模型独立于解码,更易于训练;从多领域融合来说,对短语归约过程中进行融合,更好地考虑到整个归约过程。在两种不同类型的语料上验证了机器翻译的性能,相对于传统的单领域启发式短语抽取和多领域加权,BLEU分数有所提高。  相似文献   

14.
术语定义提取研究   总被引:3,自引:0,他引:3  
本文的术语定义抽取,在分析术语定义的语言学特征,进行硬匹配的基础上,通过将术语定义用词与人民日报用词进行对比,给出了词语和句子的定义隶属度这一概念,并且与向量空间模型有效结合起来,提出了一种术语智能匹配算法。实验取得了较好的效果,有效地解决了术语定义的提取问题。  相似文献   

15.
一种基于内容的文档图像检索方法   总被引:1,自引:0,他引:1  
使用一个图像作为查询检索输入,根据该图像的版面分析特征、统计特征、纹理特征与数据库中图像的相似程度检索图像.该检索方法首先利用数学形态学对文档图像进行段落分割和行分割,作为文档图像的版面结构特征;然后根据图像的统计特征包括字符数、统计数特征、纹理特征给出文档图像抽取算法;最后给出检索算法模型.实验结果表明,本算法具有较好的查准率和查全率,在基于内容的文档图像检索中具有应用价值.  相似文献   

16.
针对当前虚拟路谱准确度评价方法中的局限性,利用随机森林建立了一个虚拟路谱的智能主观评分模型,以路谱的客观统计值作为模型输入,以主观评价的分值作为输出. 在建模过程中全面考虑信号的多方面特征,利用特征重要度筛选出最重要的6个客观统计值作为模型输入; 通过模型训练固化多位专家的专业评分经验,避免每次进行主观评分时由人为因素导致的结果波动. 工程应用显示,该模型的精度高、泛化能力强,是对虚拟路谱评价的一个全面、高效、准确的智能工具.  相似文献   

17.
军事实体关系抽取是军事信息抽取的主要任务之一,目的在于识别非结构化军事文本中两个命名实体的关系类别.传统的军事关系抽取方法难以解决人工特征不充分、军事领域中文分词不准确以及未能充分利用句子间的实体关系特征等问题.因此,提出了一种融合预训练语言模型(BERT)和注意力机制的军事关系识别方法.该方法能够有效学习上下文语义特...  相似文献   

18.
一种基于HMM聚类的视频目标轨迹分析方法   总被引:1,自引:0,他引:1  
针对视觉监控中基于运动轨迹的目标行为分析问题,提出了一种基于隐马尔科夫模型(HMM)聚类的轨迹分布模式提取和异常行为检测算法。首先为每一条运动轨迹训练一个HMM,并通过这些模型来计算轨迹两两之间的距离;然后对该距离矩阵采用主元分析法(PCA)降维并以降维后的每一行作为对应轨迹的特征进行模糊C均值聚类,接着为聚类后的每一类轨迹训练一个HMM作为其分布表达模型;最后利用这些HMM模型来检测给定轨迹所表示的目标行为是否异常。对不同场景的轨迹分析实验表明了方法的有效性。  相似文献   

19.
设计了一种中韩科技信息综合平台中的翻译辅助系统.首先,依据关键词确定的组词特证获取候选术语,并使用互信息评估候选术语以实现术语自动提取.其次,将已有术语、抽取到的新术语、术语译文和历史翻译记录等信息存储到系统数据库中建立术语库.最后,设计翻译工作者的用户接口,使其通过该接口获取已有术语的译文信息、新术语的相似译文信息和译文记忆库为基础的历史翻译数据.测试结果表明,本文设计的术语自动抽取功能和辅助译文生成功能达到了预定的设计目标,术语自动抽取算法召回率达到61.8%,结合优化方法进行优化后达到66.9%;辅助译文生成平均延时为0.031s,MRR为0.951,测试结果满足用户需求.  相似文献   

20.
针对目前本体构建中存在的如手工构建难以确保高效性和可扩展性,且自动构建难度大,可操作性不强等研究现状,提出了一种基于WordNet和Wikipedia的学科领域本体半自动构建方法。首先构建一个领域顶层本体,在此基础上,重用WordNet的结构,从深度上对其进行术语和术语层次的扩展;同时根据Wikipedia中的页面信息,从广度上对其进行术语间关系的扩展和术语的补充;并将该本体构建方法应用于平面几何领域。实验表明该方法能大大提高本体构建的效率,并在一定程度上保证了本体的质量。  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司    京ICP备09084417号-23

京公网安备 11010802026262号