多元化藏文问答数据集构建方法研究

马光祥 ,  刘鹏飞 ,  胡宝 ,  才让卓玛

高原科学研究 ›› 2025, Vol. 9 ›› Issue (3) : 120 -129.

PDF (646KB)
高原科学研究 ›› 2025, Vol. 9 ›› Issue (3) : 120 -129. DOI: 10.16249/j.cnki.2096-4617.2025.03.013
高原交通与信息处理

多元化藏文问答数据集构建方法研究

作者信息 +

Study on the Construction of Diversified Tibetan Question-answering Dataset Method

Author information +
文章历史 +
PDF (660K)

摘要

藏文自动问答研究对藏语自然语言处理、计算语言学、知识工程、跨语言信息处理等人工智能交叉领域的发展具有重要意义。问答数据集是自动问答的研究基础,但当前藏文问答数据集构建方式单一且开源藏文问答数据稀缺。为此,文章通过深入对比分析国内外公开数据集,提出多元化藏文问答数据集构建方法。首先,从藏文网站和非藏文数据源收集整理不同的问答数据,拓展藏文问答数据的数据源。其次,通过融合微博对话数据、专业领域问答数据及面向机器阅读理解的问答数据,增强藏文问答数据领域的多样性。最后,通过综合应用网络爬取、BERT情感分类、翻译非藏文问答数据、正则化并校正藏文问答数据,以多元化方法构建了包含84 118对问答语料的藏文问答数据集。将构建的数据集用于模型训练,并对模型性能进行了验证。结果表明,构建的数据集在Seq2Seq模型上分别实现了44.12%的BLEU和78.63%的EmbAve,较基线数据集Qingyun(BLEU为43.16%、EmbAve为77.21%)分别提升了0.96和1.42个百分点,充分验证了其在问答生成任务中的有效性。

Abstract

Tibetan automated question-answering (Q&A) plays a significant role in the development of artificial intelligence interdisciplinary fields such as natural language processing, computational linguistics, knowledge engineering, and cross-language information processing. Q&A datasets are the cornerstone of studying automated Q&A, yet currently, the methods for Tibetan Q&A dataset construction are limited, and Tibetan Q&A open-source datasets are scarce. Therefore, this paper proposed a diversified approach for constructing a Tibetan Q&A dataset through an in-depth comparative analysis of publicly available datasets both domestically and internationally. First, it expands data sources by collecting and organizing diversified Q&A data from Tibetan websites and non-Tibetan datasets. Then, it enhances the diversification of Tibetan Q&A data by integrating Weibo dialogue data, domain-specific Q&A data, and machine reading comprehension-based Q&A data. Finally, through the comprehensive application of web scraping, BERT-based sentiment classification, translation of non-Tibetan Q&A data, and normalization and correction of Tibetan Q&A data, a diversified Tibetan Q&A dataset comprising 84,118 pairs is constructed. The experimental results demonstrate that the constructed dataset achieves 44.12% BLEU and 78.63% EmbAve on the Seq2Seq model, representing improvements of 0.96 and 1.42 percentage points over the baseline Qingyun datasets, for which the BLEU and EmbAve are 43.16% and 77.21%, respectively. This fully validates its effectiveness for the Q&A generation tasks.

Graphical abstract

关键词

藏文自动问答 / 数据集 / BERT / 多元化 / 正则化

Key words

Tibetan question-answering / dataset / BERT / diversification / normalization

引用本文

引用格式 ▾
马光祥,刘鹏飞,胡宝,才让卓玛. 多元化藏文问答数据集构建方法研究[J]. 高原科学研究, 2025, 9(3): 120-129 DOI:10.16249/j.cnki.2096-4617.2025.03.013

登录浏览全文

4963

注册一个新账户 忘记密码

引 言

自动问答(Automated Question Answering)是人工智能和自然语言处理领域中一个备受关注并具有广泛应用前景的研究方向,其旨在让计算机根据用户的自然语言形式提问,自动结合上下文语境为用户返回准确、可靠的答案[1]。自动问答研究与人工智能的发展紧密相关,该研究最早可以追溯到20世纪60年代。在这一时期,研究人员主要致力于构建能够回答限定领域内结构化数据问题的自动问答系统。早期的自动问答系统虽然能够提供一定程度的问题解答,但由于当时技术与知识库的局限性,系统无法满足广大用户的实际需求。随着自然语言处理和机器学习等技术的不断发展,自动问答技术也从早期的基于规则和统计的方法(如Baseball[2]和Lunar[3]),经历传统的机器学习方法(如基于隐马尔可夫模型[4]、朴素贝叶斯[5]、条件随机场[6]),发展到当前基于深度学习的方法(如注意力机制[7]、神经网络[8]等)阶段,自动问答系统的智能程度也得到不断提升。

高质量的问答数据集是研究自动问答的重要基础,中文和英文等数据资源丰富的语言凭借优秀的问答数据集,自动问答技术发展迅速,目前已相继出现众多优秀的问答系统,例如ChatGPT、Google Bard、文心一言、微软小冰等。藏语作为中国少数民族语言之一,由于缺乏大规模问答数据集, 藏文自动问答研究还处于起步阶段。2015年,文献[9]首次借鉴中英文自动问答系统模式给出基于知识库的藏文问答系统构建思路。近年来,越来越多的学者或团体开始关注藏文自动问答技术,并积极尝试构建藏文问答数据集。其中,中央民族大学孙媛团队先后提出藏文问答混合网络模型[10]、QuGAN[11]、序列到序列[12]、TQGR[13]及基于语法知识和细粒度分类[14]的藏文问答语料生成模型,并最终基于云藏网采用众包方式人工构建了面向机器阅读理解的藏语数据集TibetanQA[15]。TibetanQA共包含20 000个问答对和1 513篇文章,现已向社会公开了其中2 000个问答对,成为国内首个开源藏文问答数据集。青海师范大学柔特团队采用人工、半自动和自动相结合方法构建了包含74 252个篇章、352 397个段落、问题和答案三元组的藏文机器阅读理解数据集[16]

从相关研究不难看出,尽管藏文自动问答研究呈现出可喜态势,但藏文问答数据集仍面临以下问题:

(1)开源藏文问答数据稀缺,无法支撑藏文自动问答模型训练需求。

(2)当前藏文问答数据集构建主要采用网络爬取或自动生成,方法相对单一。由于缺乏成熟的藏文社交媒体平台,网络爬取方法无法获取风格多样且内容丰富的日常问答数据,而自动生成方法难以捕捉语言的细微变化和表达方式。

因此,本文通过深入对比分析国内外开源数据集,提出了多元化藏文问答数据集构建方法,并基于所提方法构建了大规模实用的藏文问答数据集。本文主要贡献如下:

(1)通过从藏文网站和非藏文数据集收集整理不同数据源问答数据,拓展了藏文问答数据的数据源。

(2)通过融合LCCC-base微博对话数据、藏文专业领域数据及藏文机器阅读理解数据,增强了藏文问答数据领域的多样性。

(3)通过综合应用网络爬取,BERT情感分类、翻译非藏文问答数据,正则化并校正藏文问答数据,以多元化方法构建了藏文问答数据集。

1 藏文自动问答数据集构建策略

1.1 国内外开源数据集对比分析

在自动问答研究中,数据集的质量和多样性直接影响自动问答系统的性能和实际应用效果,是自动问答技术研究的核心基础。目前,国内外常用的开源数据集有WikiQA、WebQA、DailyDialog、QuAC、CoQA、LCCC-base、QAConv、TibetanQA等。其中,WikiQA是由微软研究院于2015年发布的源自维基百科的问答数据集,共包含3 047个问题和29 258条句子(其中1 473个句子被标记为对应问题的回答句),该数据集为开放领域问答系统的研究提供便利;WebQA 是由百度于2016年发布的源自百度的问答数据集,共包含42 000 个问题和556 000 个回答,该数据集为事实类问答研究提供了数据资源;DailyDialog是由李艳然等于2017年发布的源于英语学习者相关网站的问答数据集,共包含11 949个问题,其中句子长度约15个字,该数据集涵盖了人们日常生活中的各种话题,为日常问答类研究提供了基础数据;QuAC是由斯坦福大学于2018年发布的源于对话和文章的问答数据集,共包含10万个问题,该数据集的特点是提问者只知道问答的主题并没看过文章且问题间存在语义关联,该数据集为通过训练模型提取上下文语义提供了数据资源;CoQA是由Siva reddy等于2019年发布的源于新闻和文学作品的问答数据集,共包含127 000个问题和答案,8 000个文本段落,这些段落又分属于7个不同的领域,该数据集为衡量机器对话问答能力提供了数据资源;LCCC-base[17]是由清华大学于2020年发布的源于微博对话的问答数据集,共包含13 365 268句对话,其中单轮对话有3 354 382个,多轮对话有3 466 607个,该数据集为问答模型训练提供了数据资源;QAConv是由香港科技大学于2021年发布的源于电子邮件的问答数据集,共包含34 608个问题,该数据集使用问题生成器和对话摘要生成器作为辅助工具,用来收集和推荐问题,为复杂且异步的问答研究提供了数据资源;TibetanQA是由中央民族大学于2024年发布的面向藏语机器阅读理解的数据集,共包含20 000问答对和1 513篇文章,目前开源2 000个问答对,该数据集为藏文自动问答研究提供了宝贵的数据资源。上述数据集及其相关信息如表1所示。

从上述数据集的相关介绍不难发现,LCCC-base数据集在数据来源、规模和质量等方面都具备较为显著的优势,其优质的问答数据有望成为构建藏文问答数据集的宝贵资源。

首先,从数据来源看,LCCC-base取材于微博,而微博作为对话内容丰富的社交媒体,其数据源自真实的社交环境,语料涵盖不同主题、风格和语言习惯。因此LCCC-base的数据不仅具有较高的可靠性和真实性,而且能反映出自然语言的多样性和复杂性。其次,从数据规模来看,LCCC-base既包含简短明了的单轮对话,又包含层次分明的多轮对话,数据多达13 365 268句,与其他数据集相比,LCCC-base数据集不仅类型丰富,数据规模方面也展现出极为显著的优势。最后,从语种看,尽管藏、汉语在词汇和语音方面存在较大差异,但两者在语言发生学方面有着共同的历史背景和亲缘关系,且汉、藏语的语法结构、词汇构成及语言表达习惯具有一定的相似性和关联性。因此,将汉文数据集LCCC-base作为基础数据源,经筛选翻译后能够获取大规模可靠的藏文问答数据。

1.2 多元化藏文问答数据集构建策略

从1.1可知,LCCC-base在数据来源、规模和质量等方面都具备将其作为改建藏文问答数据集的基本条件,但由于LCCC-base的问答数据源于微博日常对话,缺乏跨领域的多样性。因此,为了建立高质量的藏文问答数据集,本文从数据源、数据领域和数据集构建方法出发,进行多元化藏文问答数据集构建。

首先,为保证藏文问答数据源的多元化,从藏文网站云藏网(https://www.yongzin.com/)收集整理专业领域知识问答数据,同时,从非藏文微博对话数据集LCCC-base中筛选社交主题日常问答数据。其次,为保证藏文问答数据领域的多元化,将LCCC-base微博对话数据、藏文专业领域数据及开源藏文机器阅读理解数据进行了融合,使得数据集涵盖日常生活涉及的所有领域数据。最后,为保证藏文问答数据集构建方法的多元化,通过综合应用网络爬虫、BERT情感分类、翻译、正则化并校正藏文问答数据,构建了包含84 118句对的藏文问答数据集。

2 藏文自动问答数据集构建

针对当前藏文问答数据集构建中网络爬取和自动生成方法面临的局限性,本文联合通过网络爬取、BERT情感分类、翻译非藏文问答数据,正则化并校正藏文问答数据等手段,以多元化方法构建了藏文问答数据集。

2.1 藏文问答数据采集与整理

本文首先通过网络爬虫采集了藏文网站上的问答数据。然而,由于藏文网站上的日常问答数据相对稀缺,本文进一步使用BERT筛选了非藏文中情感积极性较高的日常问答数据,并将其翻译成藏文。随后,通过人工校正和正则化处理,对藏文问答数据进行优化,从而以多元化方法构建了高质量的藏文问答数据集。

2.1.1 网络藏文问答数据的收集

本文使用网络爬虫技术从云藏网采集了包含教育与科学类、政治与法规类、社会与民生类、文化与艺术类、医学与保健类、地理与资源类、历史与人物类、网络与信息类、哲学与宗教类、文学与翻译类、商业与金融类等领域的64 000对藏文问答数据。经人工检查并删除与问答本身无关的日期、图片等非必要内容后,整理出62 177对有效的藏文问答数据。其中,教育与科学类12 000对,政治与法规类15 000对,社会与民生类1 900对,文化与艺术类2 800对,医学与保健类12 559对,地理与资源类3 395对,历史和人物类2 000对,网络与信息类645对,哲学与宗教类7 818对,文学与翻译类3 000对,商业与金融类1 000对。详细信息如表2所示,问答数量分布如图1所示。

2.1.2 LCCC-base数据筛选与翻译

本文对LCCC-base对话问答数据进行了考察,发现相对于多轮问答对话,单轮问答对话不受历史信息干扰,更能聚焦于当前对话中的问答信息。LCCC-base单轮和多轮问答对话示例如表3所示。从表3中的单轮和多轮问答对话示例不难看出,多轮问答对话能够通过多次交互逐步收集用户的意图,但多轮问答对话通常有多个问题重叠、问题跨度大、主题不明确和受历史信息干扰等问题。因此,本文以LCCC-base的单轮问答对话作为数据集的筛选目标,设计问答数据筛选算法从LCCC-base中筛选出单轮问答对话数据,同时进行了汉藏翻译。

(1) 问答数据筛选算法

为了高效筛选出单轮问答的对话数据,本文采用BERT[18]模型对原始语料进行情感分类。情感评分范围为0至5分,其中,0表示强烈消极,5表示强烈积极。为提取更加符合社交媒体场景的日常对话语料,本文将情感评分的筛选阈值区间设定为大于3,以筛选出情感倾向较为积极、语言更具自然性的问答内容。

该阈值的设置依据人工标注与模型性能评估实验,本文随机抽取100条样本数据,邀请专业人员进行情感评分标注,并将其作为参考标准,对BERT模型的分类性能进行测试。结果显示,当筛选阈值区间设定为大于3时,模型在该区间的情感分类准确率达到86.2%,召回率为82.5%,整体性能最优,因而最终选定该阈值用于问答数据筛选。

在完成情感筛选后,本文进一步从中筛选取结构为单轮的日常问答数据,最终获得25 000组问答对(即共计50 000个句子)。具体筛选流程如图2所示。

筛选算法如下:

(2) 问答数据翻译

为了保证问答数据的翻译质量,本文对当前可用的线上与线下汉藏翻译工具进行了对比评测,选取了“藏汉翻译君”、神经藏汉双向机器翻译以及微软翻译等工具,对同一批汉文问答数据进行翻译,并随机抽取100对翻译结果进行人工评估。其中,“藏汉翻译君”支持翻译不同文件版本(如docx、txt、Excel、pdf等格式)的内容,且翻译准确率较高,在语义保留和语言自然度方面表现更佳。基于以上评测结果,本文最终选用“藏汉翻译君”作为自动翻译工具,将通过算法1(问答数据筛选算法)获得的25 000对汉文问答对翻译为藏文。

2.2 藏文文本正则化

由于自然语言表达的复杂性与灵活性,问答数据中的语言表达相对比较灵活和随意,例如:ང་ཁྱེད་ལ་དགའ། ཧ་ཧ་ཧ་ཧ་ཧ(我喜欢你哈哈哈哈哈),ས་གནས་གང་ན་ཡོད། (在什么地方?)⊙▽⊙,ཁྱོད་ཀྱིས་ཨ་ཧྥན་ཏ་བལྟས་མྱོང་ངམ།(你看过阿凡达?)。常见的类似字符或字符串还有“!”“?”“《》”“~”等。尽管这些重复或表义字符能够增强语句的感染力和表达效果,但却不利于后期自动问答模型的训练。因此,本文通过统计归纳和过滤重复或特殊字符,对藏文问答语料进行文本正则化,以期提高数据集的实用性和后期模型的泛化能力。

同时,为评估正则化处理对语料质量的影响,本文引入了正则化前后问答自然性对比分析。随机抽取100组问答对,分别由3位藏文母语者进行流畅性与自然性评分(满分5分)。结果显示,正则化处理虽在部分极端情感表达中略有“克制”效果,但整体自然性评分下降不明显(平均下降0.18分),同时提升了语义清晰度与句式规范性,提升了语料对下游模型的适配度与泛化能力。

综上,文本正则化不仅提升了语料的结构统一性,也在保持语言自然性的基础上,有效增强了数据集的实用价值。正则化如下算法2所示。

2.3 藏文问答数据校正

整体来说,从云藏网爬取的藏文问答数据质量相对较好,但自动翻译的问答数据由于受到语境和表达习惯等的影响,在文本正则化后仍存在词法、语法或语义错误的现象。例如,“太阳的光线(ཉི་མའི་འོད་ཟེར།)”被译为“ཉི་མ་འོད་ཟེར།”(丢失名词“ཉི་མ(太阳)”后的属格虚词“འི”),“我有100美元(ང་ལ་ཨ་སྒོར་༡༠༠ཡོད།)”被译为“ང་ལ་སྒོར་༡༠༠ཡོད།”(将“ཨ་སྒོར(美元)”译为“སྒོར(元)”,“我现在在海南县(ང་ད་ལྟ་མཚོ་ལྷོ་རྫོང་ལ་ཡོད།)”被译为“ང་ད་ལྟ་ཧའེ་ནན་རྫོང་ལ་”(缺失介词“ཡོད(在)”,又用汉语音译“ཧའེ་ནན(海南)”替代藏文规范地名“མཚོ་ལྷོ(海南)”。因此,为了提高数据集的实用性,本文聘请3名藏文学专业的研究生对藏文问答数据进行人工抽查和分析,归纳出问答数据中的错误类型,并对数据集进行了校正。

3 实验与数据分析

3.1 实验评价指标

问答数据集的质量将直接影响模型的理解能力,因此需要对构建的数据集进行有效性验证。本文使用Wikiqa(英文)数据集、Qingyun(中文)数据集和本文所构建的藏文问答数据集,在Seq2Seq模型上做了对比实验,并用BLEU和Embave两种指标进行评测。其中,BLEU值用于衡量预测生成的回答与标准答案(即参考答案)之间的相似性,其计算生成答案中不同长度的n-gram(1-gram、2-gram、3-gram等)在参考答案中的重叠次数,反映候选句子与参考句子的匹配程度。其公式如下:

pn=C{Candidates}ngramCCountclip(n-gram)C'{Candidates}ngram'C'Count(n-gram')
BLEU=BPexp(n=1Nwnlogpn)

式中,BP(Brevity Penalty,BP)称为简短惩罚,用于避免生成过短的句子。因为过短的句子可能会有很高的精确率,但并不能提供完整的语义信息。

Embave是用于计算句子嵌入向量的平均余弦相似度,简称“嵌入平均得分(EmbAve Score)”,它的核心思想是将两个句子的嵌入向量进行比较,以衡量它们在嵌入空间中的相似程度,常用于评估神经网络模型的生成效果。其公式如下:

cosine_similarity(a,b)=ab||a||||b||

式中,a为目标句子的平均嵌入向量,b为预测句子的平均嵌入向量,ab为点积,||a||||b||分别为范数(向量的长度)。通过公式(3)可计算出每对句子的相似度分数。

3.2 对比实验

目前,基于数据集的问答系统任务主要采用深度学习方法进行研究。2014年,Seq2Seq[19]模型被提出并成功应用于机器翻译,随后也被广泛应用于对话和问答等任务。Seq2Seq模型的核心思想是将输入序列映射到输出序列,且输入和输出的长度可以不同。该模型由编码器和解码器组成,其中编码器负责并行处理输入序列并生成其表示,解码器则基于这些表示以自回归的方式生成输出序列。研究表明,Seq2Seq[20]模型在问答任务中具有出色表现。因此,将Seq2Seq模型应用于本文所构建的藏文问答数据集上,用于验证数据集质量。本文所用的数据集随机划分为训练集和测试集,wikiqa(英文)、Qingyun(中文)和本文藏文问答数据集的统计信息如表4所示。

本文用不同的数据在Seq2Seq模型上做了对比实验,结果如表5所示。

表5所示,Seq2Seq模型在不同数据集上的表现存在一定差异,但总体结果表明,本文所构建的数据集在问答任务中具有较强的竞争力和可靠性。在使用2万对数据集时,Seq2Seq模型在WikiQA(英文)数据集上取得了35.21%的BLEU值和67.21%的EmbAve值,表现较为突出;而在Qingyun(中文)数据集上,模型的BLEU值为34.43%,EmbAve值为65.21%。使用本文所构建的数据集时,Seq2Seq模型的BLEU值为34.25%,EmbAve值为65.63%,虽略低于WikiQA(英文)数据集,但差距较小,表明本文数据集同样具备较强的问答生成能力。随着数据集规模增至8万对,Seq2Seq模型在Qingyun(中文)数据集上的表现略低于本文数据集,但整体差异不大,说明本数据集的质量随着数据量增大而得到了提升。

结 语

本文在构建藏文问答数据集方面提出了一种多元化的方法,通过系统分析国内外公开数据集,整合了来自藏文网站和非藏文语料的大量问答数据,不仅丰富了数据来源,还为其他低资源语言数据集的构建提供了借鉴。通过将教育、法律等专业领域的藏文问答数据与LCCC-base微博对话数据相结合,显著提升了数据集的领域多样性。此外,本文还结合爬虫技术和非藏文问答筛选策略,为数据集构建提供了有效的技术路径。最终,构建了一个涵盖84 118对问答句对的多元化藏文问答数据集,为藏文问答技术的研究提供了数据基础,并助推了藏文的数字化发展和应用普及。

然而,受到时间和资源的限制,本研究所构建的藏文问答数据集,其数据集规模相对较为有限。未来,将基于现有的数据集,进一步探索藏文问答数据集的构建技术与方法,采用更为自动化、更具高效性的手段,来构建数量更为庞大、质量更优的藏文问答数据集,并深入使用不同的神经网络模型进行评估,从而为相关研究提供更有力的数据支撑。

参考文献

[1]

闫悦,郭晓然,王铁君,.问答系统研究综述[J].计算机系统应用,2023,32(8):1-18.

[2]

Green B F, Wolf A K, Chomsky C, et al. Baseball: An automatic question-answerer[C]. Proceedings of the Western Joint Computer Conference, 1961:219-224.

[3]

Woods W A. Semantics and quantification in natural language question answering[M]. Advances in computers. Elsevier, 1978, 17:1-87.

[4]

Stolcke A, Ries K, Coccaro N, et al. Dialogue act modeling for automatic tagging and recognition of conversational speech[J]. Computational linguistics, 2000,26(3):339-373.

[5]

Lendvai P, Geertzen J. Token-based chunking of turn-internal dialogue act sequences[C]. Proceedings of the 8th SIGDIAL Workshop on Discourse and Dialogue, 2007:174-181.

[6]

Zimmermann M. Joint segmentation and classification of dialog acts using conditional random fields[C]. Conference of the International Speech Communication Association(INTERSPEECH), 2009:864-867.

[7]

Yan F, Silamu W, Chai Y, et al. OECA-Net: A co-attention network for visual question answering based on OCR scene text feature enhancement [J]. Multimedia Tools and Applications, 2024,83(3):7085-7096.

[8]

Zhang W, Liu Q. Convolutional neural network for substantiation of children's books, intelligent interactive communication and application analysis of voice question answering [J]. Entertainment Computing, 2024,48:100608.

[9]

孙浩蒸,于洪志,苏敏.基于知识库的藏文问答系统研究[J].西北民族大学学报(自然科学版),2015,36(2):45-50.

[10]

Sun Y, Xia T. A hybrid network model for Tibetan question answering [J]. IEEE Access, 2019,7:52769-52777.

[11]

Sun Y, Chen C, Xia T, et al. QuGAN: quasi generative adversarial network for Tibetan question answering corpus generation [J]. IEEE Access, 2019,7:116247-116255.

[12]

Sun Y, Chen C, Chen A, et al. Tibetan question generation based on sequence to sequence model[J]. Computers, Materials & Continua, 2021,68(3).

[13]

Liu S, Chen C, Sun Y. Paragraph-level Tibetan question generation for machine reading comprehension[C]. 2022 International Conference on Asian Language Processing(IALP). IEEE, 2022:280-285.

[14]

Sun Y, Liu S, Dan Z, et al. Question generation based on grammar knowledge and fine-grained classification[C]. Proceedings of the 29th International Conference on Computational Linguistics. 2022:6457-6467.

[15]

孙媛,刘思思,陈超凡,旦正错,赵小兵. 面向机器阅读理解的高质量藏语数据集构建[J].中文信息学报.2024, 38(3): 56-64.

[16]

羊毛加.片段抽取型藏文机器阅读理解研究[D].西宁:青海师范大学,2024.

[17]

Wang Y, Ke P, Zheng Y, et al. A large-scale chinese short-text conversation dataset [J]. International conference natural language processing, 2020:91-103.

[18]

Devlin J, Chang M W, Lee K, et al. Bert: Pre-training of deep bidirectional transformers for language understanding[C]. Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human language Technologies, 2019: 4171-4186.

[19]

Sutskever I, Vinyals O, Le Q V. Sequence to sequence learning with neural networks[J]. Advances in Neural Information Processing Systems, 2014,27.

[20]

Chiranjeevi R. Chatbot for government schemes using SEQ2SEQ model[C]. 2024 Second International Conferenceon Advances in Information Technology (ICAIT). IEEE, 2024:1-6.

基金资助

国家自然科学基金项目(61966031)

西南民族大学高层次人才引进项目(RQD2022039)

四川省哲学社会科学重点实验室项目(ZHKFYB2401)

AI Summary AI Mindmap
PDF (646KB)

24

访问

0

被引

详细

导航
相关文章

AI思维导图

/