<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Corpus语料库</title>
	<atom:link href="http://www.nlpir.org/wordpress/category/corpus%e8%af%ad%e6%96%99%e5%ba%93/feed/" rel="self" type="application/rss+xml" />
	<link>http://www.nlpir.org/wordpress</link>
	<description></description>
	<lastBuildDate>Tue, 03 Jan 2023 07:30:45 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.3</generator>

<image>
	<url>http://www.nlpir.org/wordpress/wp-content/uploads/2018/12/logo1.gif</url>
	<title>Corpus语料库</title>
	<link>http://www.nlpir.org/wordpress</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>NLPIR_UGWS: 维吾尔语分词语料库</title>
		<link>http://www.nlpir.org/wordpress/2022/12/29/nlpir_ugws-%e7%bb%b4%e5%90%be%e5%b0%94%e8%af%ad%e5%88%86%e8%af%8d%e8%af%ad%e6%96%99%e5%ba%93/</link>
					<comments>http://www.nlpir.org/wordpress/2022/12/29/nlpir_ugws-%e7%bb%b4%e5%90%be%e5%b0%94%e8%af%ad%e5%88%86%e8%af%8d%e8%af%ad%e6%96%99%e5%ba%93/#respond</comments>
		
		<dc:creator><![CDATA[nlpir]]></dc:creator>
		<pubDate>Thu, 29 Dec 2022 04:02:37 +0000</pubDate>
				<category><![CDATA[Corpus语料库]]></category>
		<guid isPermaLink="false">http://www.nlpir.org/wordpress/?p=8923</guid>

					<description><![CDATA[项目介绍 NLPIR_UGWS(Natural&#160;Language&#038;nb &#8230; <a href="http://www.nlpir.org/wordpress/2022/12/29/nlpir_ugws-%e7%bb%b4%e5%90%be%e5%b0%94%e8%af%ad%e5%88%86%e8%af%8d%e8%af%ad%e6%96%99%e5%ba%93/">继续阅读 <span class="meta-nav">&#8594;</span></a>]]></description>
										<content:encoded><![CDATA[
<h1 class="wp-block-heading" id="项目介绍">项目介绍</h1>



<p class="wp-block-paragraph">NLPIR_UGWS(Natural&nbsp;Language&nbsp;Processing&nbsp;&amp;&nbsp;Information&nbsp;Retrieval&nbsp;Sharing&nbsp;Platform Uyghur Word Segmentation Corpus )是由NLPIR实验室构建的维吾尔语分词语料。原始语料为从CWMT往届语料中选取的共5000条句子。语料库构建的步骤为：语料搜集、聚类、随机抽取、自动分词、人工分词、反复校对。</p>



<h1 class="wp-block-heading" id="标准规范">标准规范</h1>



<p class="wp-block-paragraph">“/”代表切分</p>



<h1 class="wp-block-heading" id="数据格式">数据格式</h1>



<p class="wp-block-paragraph">原文本</p>



<figure class="wp-block-image size-large"><img fetchpriority="high" decoding="async" width="1024" height="226" src="http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/原文本-1024x226.png" alt="" class="wp-image-8924" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/原文本-1024x226.png 1024w, http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/原文本-300x66.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/原文本-768x169.png 768w, http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/原文本-80x18.png 80w, http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/原文本.png 1444w" sizes="(max-width: 1024px) 100vw, 1024px" /></figure>



<p class="wp-block-paragraph">分词后的文本</p>



<figure class="wp-block-image size-large"><img decoding="async" width="1024" height="231" src="http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/分词后的文本-1024x231.png" alt="" class="wp-image-8925" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/分词后的文本-1024x231.png 1024w, http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/分词后的文本-300x68.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/分词后的文本-768x173.png 768w, http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/分词后的文本-80x18.png 80w, http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/分词后的文本.png 1468w" sizes="(max-width: 1024px) 100vw, 1024px" /></figure>



<h1 class="wp-block-heading" id="下载">下载</h1>



<div class="wp-block-file"><a id="wp-block-file--media-d909cfd4-23cb-417f-bf43-467436b4fb0b" href="http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/维吾尔语分词500条-1.txt">维吾尔语分词500条.txt</a><a href="http://www.nlpir.org/wordpress/wp-content/uploads/2022/12/维吾尔语分词500条-1.txt" class="wp-block-file__button" download aria-describedby="wp-block-file--media-d909cfd4-23cb-417f-bf43-467436b4fb0b">下载</a></div>



<p class="wp-block-paragraph">需要购买更大规模语料联系邮箱liwang@nlpir.org或电话13681251543</p>



<h1 class="wp-block-heading" id="开源协议">开源协议</h1>



<ol class="wp-block-list" type="1"><li>NLPIR_UGWS面向国内外大学、研究所、企业以及个人研究者免费开放源。</li><li>如有机构或个人拟将NLPIR_UGWS用于商业目的，请发邮件至邮箱洽谈技术许可协议。</li><li>欢迎对该语料的任何宝贵意见和建议，请发邮件至邮箱。</li><li>如果您在NLPIR_UGWS基础上发表论文或取得科研成果，请您在发表论文和申报成果时声明“使用了NLPIR_UGWS”，并引用相关论文。</li></ol>



<h1 class="wp-block-heading" id="相关论文">相关论文</h1>



<h1 class="wp-block-heading" id="作者">作者</h1>



<p class="wp-block-paragraph">张华平，严若豪</p>
]]></content:encoded>
					
					<wfw:commentRss>http://www.nlpir.org/wordpress/2022/12/29/nlpir_ugws-%e7%bb%b4%e5%90%be%e5%b0%94%e8%af%ad%e5%88%86%e8%af%8d%e8%af%ad%e6%96%99%e5%ba%93/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>中国外交部例行记者会语料库</title>
		<link>http://www.nlpir.org/wordpress/2021/10/11/%e4%b8%ad%e5%9b%bd%e5%a4%96%e4%ba%a4%e9%83%a8%e4%be%8b%e8%a1%8c%e8%ae%b0%e8%80%85%e4%bc%9a%e8%af%ad%e6%96%99%e5%ba%93/</link>
					<comments>http://www.nlpir.org/wordpress/2021/10/11/%e4%b8%ad%e5%9b%bd%e5%a4%96%e4%ba%a4%e9%83%a8%e4%be%8b%e8%a1%8c%e8%ae%b0%e8%80%85%e4%bc%9a%e8%af%ad%e6%96%99%e5%ba%93/#respond</comments>
		
		<dc:creator><![CDATA[gaoyuxiao]]></dc:creator>
		<pubDate>Mon, 11 Oct 2021 02:57:45 +0000</pubDate>
				<category><![CDATA[Corpus语料库]]></category>
		<guid isPermaLink="false">http://www.nlpir.org/wordpress/?p=8389</guid>

					<description><![CDATA[1、本语料库包含自2017年6月9日至2021年9月29日的中国外交部例行记者会 &#8230; <a href="http://www.nlpir.org/wordpress/2021/10/11/%e4%b8%ad%e5%9b%bd%e5%a4%96%e4%ba%a4%e9%83%a8%e4%be%8b%e8%a1%8c%e8%ae%b0%e8%80%85%e4%bc%9a%e8%af%ad%e6%96%99%e5%ba%93/">继续阅读 <span class="meta-nav">&#8594;</span></a>]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">1、本语料库包含自2017年6月9日至2021年9月29日的中国外交部例行记者会（共1000场）的全部数据。<br>2、在&#8221;https://www.fmprc.gov.cn/web/fyrbt_673021/jzhsl_673025/&#8221;后拼接语料库中&#8221;href&#8221;属性的值，即可得到每场记者会对应的链接。<br>3、外交部网站自2020-03-24及以后开始记录记者的单位，所以语料库中2020-03-24以前的&#8221;journal&#8221;属性值都为空。<br>4、本语料库由北京理工大学2021年秋季大数据分析与应用课程第四小组发布。<br>5、由于时间有限，语料库中部分日期的记者会格式存在一定问题。</p>



<div class="wp-block-file"><a href="http://www.nlpir.org/wordpress/wp-content/uploads/2021/10/中国外交部例行记者会.txt">中国外交部例行记者会数据</a><a href="http://www.nlpir.org/wordpress/wp-content/uploads/2021/10/中国外交部例行记者会.txt" class="wp-block-file__button" download>下载</a></div>



<p class="wp-block-paragraph"></p>
]]></content:encoded>
					
					<wfw:commentRss>http://www.nlpir.org/wordpress/2021/10/11/%e4%b8%ad%e5%9b%bd%e5%a4%96%e4%ba%a4%e9%83%a8%e4%be%8b%e8%a1%8c%e8%ae%b0%e8%80%85%e4%bc%9a%e8%af%ad%e6%96%99%e5%ba%93/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
