《南京信息工程大学学报·自然科学版杂志》发表论文赏析
作者:龙林涛,黄瑞章,白瑞娜,陈艳平,秦永彬
单位:龙林涛,贵州大学 文本计算与认知智能教育部工程研究中心, 贵阳, 550025;贵州大学 公共大数据国家重点实验室, 贵阳, 550025;贵州大学 计算机科学与技术学院, 贵阳, 550025,黄瑞章,贵州大学 文本计算与认知智能教育部工程研究中心, 贵阳, 550025;贵州大学 公共大数据国家重点实验室, 贵阳, 550025;贵州大学 计算机科学与技术学院, 贵阳, 550025,白瑞娜,贵州大学 文本计算与认知智能教育部工程研究中心, 贵阳, 550025;贵州大学 公共大数据国家重点实验室, 贵阳, 550025;贵州大学 计算机科学与技术学院, 贵阳, 550025,陈艳平,贵州大学 文本计算与认知智能教育部工程研究中心, 贵阳, 550025;贵州大学 公共大数据国家重点实验室, 贵阳, 550025;贵州大学 计算机科学与技术学院, 贵阳, 550025,秦永彬,贵州大学 文本计算与认知智能教育部工程研究中心, 贵阳, 550025;贵州大学 公共大数据国家重点实验室, 贵阳, 550025;贵州大学 计算机科学与技术学院, 贵阳, 550025
摘要:中文语法错误纠正(CGEC)旨在通过最少编辑次数来修正中文文本错误.大语言模型(LLMs)在语法纠错过程中,存在误将错误修正模式应用到其他相似句子,以及过度校正等问题.针对上述问题,本文提出了一种基于LLMs多视角协同的中文语法纠正方法(Multi-Perspective Coordination LLM Method,Multi-PC).不同于LLMs解码只关注局部词元的可信度,Multi-PC从句子的所有组成词元入手综合考虑句中存在的语法问题,利用LLMs不同视角的推理结果,通过去无关词元的序列联合概率计算方法重新计算句子整体的可信度,最终推理出全局可信的纠正结果.该方法不需要增加额外训练成本,可以缓解过度校正或修正模式错误匹配问题.在CGEC数据集上的实验结果表明,本文所提出的方法简单而有效.
关键词:中文语法错误纠正;大语言模型;回答可信度;多候选
基金资助:贵州大学自然科学基金(贵大特岗合字[2024]31号);贵州省科技支撑计划(黔科合支撑[2023]一般300)