期刊文献+
共找到7篇文章
< 1 >
每页显示 20 50 100
领域问答系统中的文本错误自动发现方法 被引量:19
1
作者 刘亮亮 王石 +2 位作者 王东升 汪平仄 曹存根 《中文信息学报》 CSCD 北大核心 2013年第3期77-83,共7页
文本自动校对是自然语言处理的一个挑战性的研究课题,也是一个难题。该文对中文的错误类型和原因进行分析,提出了一种基于领域问答系统用户问题日志的错别字自动发现方法。该方法首先对语料进行分词,然后对分词的结果中出现的散串进行合... 文本自动校对是自然语言处理的一个挑战性的研究课题,也是一个难题。该文对中文的错误类型和原因进行分析,提出了一种基于领域问答系统用户问题日志的错别字自动发现方法。该方法首先对语料进行分词,然后对分词的结果中出现的散串进行合并,对分词中的多字词和合并的串进行相似词串聚类,对相似词串的上下文语境进行统计分析,从中自动获取错别字对。实验表明,该系统获得71.32%的召回率,82.6%的准确率。 展开更多
关键词 文本自动校对 问答系统 非词错误 真词错误 错别字对
下载PDF
基于局部上下文特征的组合的中文真词错误自动校对研究 被引量:8
2
作者 刘亮亮 曹存根 《计算机科学》 CSCD 北大核心 2016年第12期30-35,共6页
中文的真词错误类似于英文的真词错误,指一个中文词错成另一个词典中的词。提出一种基于混淆集的真词错误发现方法,通过对目标词的局部特征的提取,形成局部左邻接二元、右邻接二元及3个三元特征,然后通过和目标词对应的混淆集中的混淆... 中文的真词错误类似于英文的真词错误,指一个中文词错成另一个词典中的词。提出一种基于混淆集的真词错误发现方法,通过对目标词的局部特征的提取,形成局部左邻接二元、右邻接二元及3个三元特征,然后通过和目标词对应的混淆集中的混淆词来估计二元概率和三元概率。最后提出一种多特征融合的模型,然后利用规则来判断中文文本中的真词错误。将查错结果分为标记错误和更改错误两种类型,采用18组混淆集,构造2万行的测试语料进行实验。实验表明,该方法能有效地发现中文文本中的真词错误,并且能给出真词错误的修改建议。该方法是一种集自动查错和自动纠错于一体的中文文本自动校对方法。 展开更多
关键词 真词错误 混淆集 上下文特征 NGram模型
下载PDF
英文作文的自动拼写检查研究 被引量:5
3
作者 李斌 姚建民 朱巧明 《郑州大学学报(理学版)》 CAS 2008年第3期48-51,共4页
基于自动拼写检查的研究现状,将英文作文中的拼写错误进行了分类,并分别采用规则匹配和统计建模的方法对单词的非词错误和真词错误进行了研究,从而扩大了对英文单词进行拼写检查的研究范围.真词错误检查主要是利用贝叶斯定理,并通过建... 基于自动拼写检查的研究现状,将英文作文中的拼写错误进行了分类,并分别采用规则匹配和统计建模的方法对单词的非词错误和真词错误进行了研究,从而扩大了对英文单词进行拼写检查的研究范围.真词错误检查主要是利用贝叶斯定理,并通过建立一些特定的混淆集的方法来实现.通过实验数据分析,该系统的准确率达到了80%以上. 展开更多
关键词 拼写检查 真词错误 非词错误 贝叶斯定理 混淆集
下载PDF
一种中文真词错误检测与修复方法 被引量:3
4
作者 叶俊民 徐松 +2 位作者 罗达雄 王志锋 陈曙 《计算机工程》 CAS CSCD 北大核心 2019年第8期178-183,共6页
在线学习社区中的中文真词错误会给中文文本语义的理解带来困难,从而影响基于在线学习社区文本的学习分析效果。为此,提出一种针对在线学习社区短文本的真词错误检测与修复方法。构建混淆词集和混淆词对应的固定搭配知识库,基于n-gram... 在线学习社区中的中文真词错误会给中文文本语义的理解带来困难,从而影响基于在线学习社区文本的学习分析效果。为此,提出一种针对在线学习社区短文本的真词错误检测与修复方法。构建混淆词集和混淆词对应的固定搭配知识库,基于n-gram概率统计模型、上下文语境模型和固定搭配知识库,分别计算每一个混淆词的 n-gram得分、上下文语境得分和固定搭配得分,对其加权求和作为判断原文是否出错的依据,并将最高得分的混淆词作为修复意见。实验结果表明,该方法召回率、准确率与修复率分别为85.6 %、86.3 %、92.9 %,能准确有效检测与修复学习社区中的中文真词错误。 展开更多
关键词 真词错误 混淆词集 n-gram概率统计模型 上下文语境 中文固定搭配
下载PDF
面向油田领域的中文真词错误自动校对方法研究 被引量:1
5
作者 王辉 Marius Petrescu +3 位作者 潘俊辉 王浩畅 张强 张岩 《计算技术与自动化》 2021年第1期140-143,共4页
中文真词错误自动校对是自然语言理解的一项重要的基础研究课题,油田数字化过程中利用图像识别及人工录入产生的中文真词错误会直接影响后期数据综合分析准确度。对中文真词错误成因和统计语言模型进行分析,提出一种面向油田领域的中文... 中文真词错误自动校对是自然语言理解的一项重要的基础研究课题,油田数字化过程中利用图像识别及人工录入产生的中文真词错误会直接影响后期数据综合分析准确度。对中文真词错误成因和统计语言模型进行分析,提出一种面向油田领域的中文真词错误自动校对方法。该方法首先构建通用领域和油田领域混淆集,再引入同义词集丰富知识库,对语料分词后,综合统计分析目标词与混淆词、周边词的同义词之间关系,自动校对真词错误。实验表明,提出的方法能有效校对油田领域的中文真词错误。 展开更多
关键词 真词错误 N-GRAM 文本自动校对 知识库构建
下载PDF
词汇语法拼写校对软件——功能语法的应用实例
6
作者 许庆欣 《天津外国语学院学报》 2007年第2期49-54,共6页
真词错误拼写校对是自然语言处理领域中的一个难题。真词错误具有出现频率高、种类多样的特点。现有的计算机拼写校对软件不足以侦别所有的真词错误。词汇语法拼写校对软件模型以系统功能语言学理论为指导,有四个处理单元,分别对应语言... 真词错误拼写校对是自然语言处理领域中的一个难题。真词错误具有出现频率高、种类多样的特点。现有的计算机拼写校对软件不足以侦别所有的真词错误。词汇语法拼写校对软件模型以系统功能语言学理论为指导,有四个处理单元,分别对应语言的四个级阶,可以侦别出词汇层、局域性句法层、整体性句法层和语义层次上的拼写错误。词汇语法拼写校对模型在进行真词错误纠错工作的时候充分考虑了文本的语境知识,最终产生按照盖然率大小排列的校正参考。 展开更多
关键词 真词错误 词汇语法 拼写校对
下载PDF
基于规则与统计相结合的藏文文本自动查错方法研究 被引量:2
7
作者 完么扎西 尼玛扎西 《中文信息学报》 CSCD 北大核心 2022年第2期69-75,共7页
针对目前藏文文本自动查错方法的不足,该文提出了一种基于规则和统计相结合的自动查错方法。首先以藏文拼写文法为基础,结合形式语言与自动机理论,构造37种确定型有限自动机识别现代藏文字;然后利用查找字典的方法识别梵音藏文字;最后... 针对目前藏文文本自动查错方法的不足,该文提出了一种基于规则和统计相结合的自动查错方法。首先以藏文拼写文法为基础,结合形式语言与自动机理论,构造37种确定型有限自动机识别现代藏文字;然后利用查找字典的方法识别梵音藏文字;最后利用互信息和t-测试差等统计方法查找藏语词语搭配错误和语法错误等真字词错误,实现藏文文本的自动查错。实验测试集由100篇新闻类语料构成,共包含49处错误。实验表明,该文方法能有效发现非字错误和真字词错误,该方法的查错召回率达到83.7%,查错准确率达到70.7%,F值达到76.7%。 展开更多
关键词 藏文文本自动查错 非字错误 真字词错误
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部