首页 | 官方网站   微博 | 高级检索  
相似文献
 共查询到20条相似文献,搜索用时 140 毫秒
1.
文章基于"指代消解"、"文本外部特征"、"图排序"的混合方法实现多语言多文档新闻摘要系统。该系统由四大模块组成,分别为:原文预处理;基于文本外部特征的摘要计算;基于图排序的摘要计算与;摘要生成模块。首先对新闻文本进行预处理和指代消解,然后在第二模块使用文本外部特征(如:主题词、线索词语、关键词与其同义词、时间、地点、命名实体等)来计算原文中句子的重要程度,句子与新闻主题的相关度,并且对每个句子第一次打分。然后在第三模块采用图排序的算法再从原文中计算句子之间的连贯程度,并且第二次对每个句子打分。最后在第四模块通过两个不同算法的得分计算原文中句子的总得分并且按原文中句子出现的顺序摘出新闻文本的摘要。文章以汉语、英语、孟加拉语为例,实现该系统并进行摘要测试。实验表明系统能够从三个不同语种的多文档新闻文本中有效地摘出摘要。  相似文献   

2.
习海旭  何胜  黄纯国 《情报学报》2023,(10):1176-1186
在移动互联网时代,移动阅读、碎片化阅读已经成为人们阅读的主流方式。在用户阅读过程中,提供摘要内容以提高阅读效率是解决信息过载问题的重要途径之一。科技研究论文文本长、内容广且包含领域知识,其摘要生成任务相比于新闻等普通文本更具有挑战性。本文提出了一种科技论文结构化摘要方法。首先,将科技论文划分为不同的语步;其次,分别对不同语步文本进行抽取式摘要,将文本多特征按权重融入TextRank算法的迭代计算过程中,引入MMR (maximal marginal relevance)算法对预选摘要集进行冗余处理;最后,使用依存句法分析对文本进行语义分析,进一步精简摘要,并组合成结构化摘要。研究结果表明,相比于基准模型,该方法在不同语步的相关性、多样性和可读性指标提升上具有一定差异;结合人工评价发现,该方法在显著提升摘要多样性的同时,一定程度上提升了摘要的相关性和可读性。  相似文献   

3.
[目的/意义]以汽车论坛例,提出一种针对专业社交媒体文本的主题知识元抽取方法。[方法/过程]首先,通过LDA模型提取出汽车论坛中文本的主题,并进行去重,形成主题列表;其次,基于融合主题特征的深度学习模型T-LSTM模型构建适于汽车论坛本文的情感分析模型;然后,通过计算各词汇在图模型TextRank中的重要性与各词汇的Word2Vec主题相似度,抽取情感关键词与关键句,用于对文本主题与情感倾向的解释与补充;最后,对上述方法进行集成,输出结构化的主题知识元。[结果/结论]实验结果中,抽取得到的主题知识元合格率达到69.1%,表明本文提出的主题知识元抽取方法,能够围绕知识主题较为准确地抽取知识元,实现知识的结构化转换。  相似文献   

4.
一种基于词共现图的文档自动摘要研究   总被引:1,自引:0,他引:1  
耿焕同  蔡庆生  赵鹏  于琨 《情报学报》2005,24(6):651-656
本文提出了一种基于词共现图的文档自动摘要算法。该算法以统计方法为基础,又利用词共现图形成的主题信息以及不同主题间的连接特征信息,旨在能够有效地生成既全面反映文档的主要内容,又不受领域限制的文档摘要;同时该方法能动态地确定文档摘要长度。在实验评估中,该文档自动摘要方法取得了令人满意的摘要效果。  相似文献   

5.
[目的/意义] 为帮助读者从热点事件产生的海量微博报道中快速了解事件的来龙去脉,提高微博事件摘要的准确性和可读性,提出一种基于事件要素的多模型微博热点事件时间轴摘要提取方法。[方法/过程] 针对微博文本特征,结合主题模型(LDA)与互信息最大熵模型(MaRxEnt-MI)的特点提取事件摘要关键词,以微博传播价值和主题相关性为标准筛选微博,以时间-摘要关键词-摘要微博的形式生成时间轴摘要。[结果/结论] 利用人工标注的测试集,与传统的TextRank方法进行对比,F值提高8%-13%,内部测试表明摘要可读性提高明显。实验文本和测试集的数量及事件丰富度需要进一步扩展,应考虑更多的加权策略模型以提高摘要的准确性。实验结果及测试反馈表明,本文的方法能很好满足用户对热点事件摘要信息需求,提高微博摘要提取的准确率。  相似文献   

6.
文本信息内容的影响力是虚拟社区影响力的基本构成,但针对其情感表达特征效用的研究尚为空白.研究基于扎根理论产生虚拟社区文本情感表达方式范畴、构建文本情感表达丰裕度对用户参与行为的作用模型,并利用文本分析方法对模型进行验证.研究显示虚拟社区帖标题和帖内容的情感表达丰裕度分别对用户浏览和回帖行为发挥正向促进作用,基于此应将文本情感表达丰裕度(包括情感表达多样性和情感表达充裕度)作为虚拟社区信息内容分析重要指标.研究并提出虚拟社区文本情感表达充裕度算法.  相似文献   

7.
聂卉 《图书情报工作》2014,58(13):83-89
以获取高质量的用户评论为直接目标,研究评论质量的评估和“有用评论”的自动识别。主要从评论内容的语言特征、语义内容、情感倾向等多个特征维度来探索文本特征对用户可感知的效用的影响力,采用深层次的文本内容分析技术提取特征指标,并结合计量分析和机器学习方法验证指标的科学性,设计可行的面向效用价值的预测模型。研究证明,依据评论内容可有效探测评论质量,辨识高质量评论,提高评论的效用价值。  相似文献   

8.
[目的/意义] 对引文文本分类的标准、实现方法和应用进行梳理,分析存在的问题,提出可改进的方向。[方法/过程] 总结目前引文文本分类的几个重要角度,如基于引用功能、基于情感倾向、基于引文影响力等,对引文文本分类的实现方法进行比较,分析其优缺点。[结果/结论] 目前引文文本没有统一的分类标准和实现方法,引文文本的获取较为困难,计算机分类算法准确率较低,中文引文文本分析文献少。未来研究思路和方向应该是:统一文本分类的标准,提高引文文本计算机处理技术的准确性,扩大应用范围。  相似文献   

9.
自动文本摘要中一个关键的步骤是确定文章的主旨并将反映文章主旨的句子提取出来.在讨论分析k-means, k-medoids等聚类算法的基础上,根据对文本摘要的实际要求以及文档自身的特点,提出一种基于聚类算法的主旨句提取方法.实验结果表明,在提高聚类准确性的基础上,新方法较其他聚类算法能够更加有效地避免遗漏主题的问题,能较全方位地反映全文的主旨,提取出的摘要既覆盖全面又突出重点.  相似文献   

10.
[目的/意义]借助信息扩散研究方法,对伴随文化内容传播的社交媒体热点这一特殊类型事件中的民族文化演化扩散规律进行探究,为解释民族文化扩散规律、推动民族文化传播提供新视角。[方法/过程]以微博平台“丁真事件”发布文本为数据来源。基于LDA主题模型、民族文化符号识别与情感分析构建主题—民族文化符号—情感关联网络,对热点事件中不同主题传播伴随的民族文化演化扩散动态进行情境还原。量化不同类型用户的民族文化传播影响力,探究热点事件中不同主体的民族文化传递接力过程。[结果/结论]结果表明,从主题—民族文化符号—情感关联网络构建与传播主体影响力两大层次分析社交媒体情境下民族文化扩散路径规律,可帮助人文学者精准把握文化传播细节及其动态交互特征。  相似文献   

11.
挖掘图书评论不仅有助于用户了解图书内容,还可帮助出版社优化营销策略。图书评论摘要能够大幅提升用户获取信息的效率,用户只需简短阅读摘要即可了解评论的重点内容。如何为用户提供简洁、准确的图书评论摘要具有重要研究意义。目前的评论摘要研究多是采用句子抽取式的方法,忽视了评论中细粒度的情感信息。此外,不同的图书评论平台在评论内容方面存在较大的差异,仅基于单一平台的评论构建摘要,用户难以通过评论摘要全面了解图书。本文提出了一种包含属性信息和内容信息的图书评论摘要模型,并设计了基于细粒度评论挖掘的书评摘要方法。实证结果表明,本文提出的评论自动摘要方法,生成的评论摘要能够提供细粒度、多维度的图书评价信息。  相似文献   

12.
[目的/意义]从定量分析和定性分析两个方面对英文网络书评进行内容挖掘,形成一套基于信息分类的英文网络书评的内容挖掘方法体系,实现多文本书评的信息整合。[方法/过程]对书评文本中句子的分类方法、关键信息的提取方法、情感分类的方法以及内容的呈现方式等几方面进行实验和改进。[结果/结论]用户评价结果表明,本文所设计的内容挖掘方法所生成的书评信息摘要在生成质量和有用性两方面都有较好的表现。  相似文献   

13.
本文系统性地研究面向查询的观点摘要任务,旨在构建一种查询式观点摘要模型框架,探究不同的摘要方法对摘要效果的影响。通过综合考虑情感倾向与句子相似度,从待检文档中抽取出待摘要语句,再结合神经网络和词嵌入技术生成摘要,进而构建面向查询的观点摘要框架。从Debatepedia网站上爬取议题和论述内容构建观点摘要实验数据集,将本文方法应用到该数据集上,以检验不同模型的效果。实验结果表明,在该数据集上,仅使用基于抽取式的方法生成的观点摘要质量更高,取得了最高的平均ROUGE分数、深度语义相似度分数和情感分数,较生成式方法分别提高6.58%、1.79%和11.52%,而比组合式方法提高了8.33%、2.80%和13.86%;同时,本文提出的句子深度语义相似度和情感分数评估指标有助于更好地评估面向查询的观点摘要模型效果。研究结果对于提升面向查询的观点摘要效果,促进观点摘要模型在情报学领域的应用具有重要意义。  相似文献   

14.
[目的 /意义]将海量学术文本观点提取工作由人工转向机器,提高效率的同时又能够保证观点提取的准确性、客观性。[方法 /过程]使用UniLM统一语言预训练模型,训练过程中对模型进行精调,以人工标注数据集进行机器学习。将学术文摘作为长度为a的文本序列,经过机器学习,生成长度为b的句子序列(a≥b),并且作为学术论文观点句输出。[结果 /结论 ]研究结果表明:UniLM模型对于规范型文摘、半规范型文摘、非规范型文摘观点生成精准度分别为94.36%、77.27%、57.43%,规范型文摘生成效果最好。将机器学习模型应用于长文本观点生成,为学术论文观点生成提供一种新方法。不足之处在于本文模型依赖文摘的结构性,对非规范型文摘观点生成效果有所欠缺。  相似文献   

15.
针对文本信息内容结构参差不齐的问题,提出一种评价文本内容结构分析方法,该方法将文本中的句子作为节点,句子之间的共同名词作为边,构建文本复杂网络,并选取复杂网络的拓扑性质对文本结构特征进行分析。基于一个新闻文本案例构建复杂网络,并计算度、强度、最短路径、加权聚类系数等衡量指标,这些指标能很好地评价文本内容结构的好坏,也为理解和提取文本的中心思想、生成摘要、文本检索过滤提供重要参考依据。  相似文献   

16.
句子情感分析及其关键问题   总被引:2,自引:0,他引:2  
情感分析关注具有情感倾向的评价性信息,具有广泛的应用。情感分析按照粒度的不同分为三种:词汇情感分析、句子情感分析和文档情感分析。文中对句子情感分析及其关键问题进行介绍,首先简要描述句子情感分析的任务,然后介绍句子情感分析中主客观句分类方法及两种主观句情感分类方法--基于情感词的方法和机器学习方法,最后对情感分析中的三个关键问题--词汇上下文极性判定、评价主题识别、意见持有者识别进行总结。  相似文献   

17.
[目的/意义]基于图片的情感分析已逐渐成为情感分析的潜在研究热点。本文回顾与总结了图片情感分析的历史与现状,有助于相关研究工作的推进。[研究设计/方法]从传统的视觉情感分析方法和深度学习两个方向对图片情感分析相关研究的技术方法进行梳理并评述。[结论/发现]随着图片情感分析粒度的细化,进一步的研究方向在于深度学习算法和标注方式的优化;同时,加快带有情感标签图片数据集的开放进程,可以更好地推动研究者在此领域研究的不断深入。[创新/价值]深入梳理了图片情感分析现阶段的研究重点与未来发展方向,为该领域进一步研究提供相关借鉴。  相似文献   

18.
面对网络中日益丰富的文本性情感信息资源,利用关联挖掘技术对其进行智能化的自动挖掘与分析,获取语义层面的用户情感知识,对于企业竞争策略的制定和竞争优势的保持具有重要的潜在价值。将关联挖掘技术融入文本情感分析之中,研究并设计一种融合语义关联挖掘的文本情感分析算法,实现语义层面的情感分析与用户情感知识挖掘。实验结果表明,该算法取得了很好的预期效果,显著提高了情感分析的准确率与效率以及关联挖掘的深度与广度。  相似文献   

19.
停用词表对中文文本情感分类的影响   总被引:6,自引:2,他引:4  
王素格  魏英杰 《情报学报》2008,27(2):175-179
本文利用三种特征选择方法、两种权重计算方法、五种停用词表以及支持向量机分类器对汽车语料的文本情感类别进行了研究.实验结果表明,不同特征选择方法、权重计算以及停用词表,对文本情感分类的影响也不尽相同;除形容词、动词和副词外的其余词语作为停用词表以及不使用停用词表对情感分类作用较大,得到的分类结果比较好;总体上,采用信息增益和布尔型权重进行中文文本情感分类的效果较好.  相似文献   

20.
网络推手识别研究在净化网络环境、监测网络舆论导向等领域有广阔的发展前景。采用文本情感倾向分析方法进行网络推手识别,通过分析信息发布者的情感倾向,统计正面情感信息与负面情感信息的比重,确定该信息发布者是否是网络推手。重点讨论信息抽取及情感分类相关技术的实现,并验证方法的可行性。  相似文献   

设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司    京ICP备09084417号-23

京公网安备 11010802026262号