<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Paper论文</title>
	<atom:link href="http://www.nlpir.org/wordpress/category/paper%e8%ae%ba%e6%96%87/feed/" rel="self" type="application/rss+xml" />
	<link>http://www.nlpir.org/wordpress</link>
	<description></description>
	<lastBuildDate>Mon, 31 Aug 2026 03:15:28 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.3</generator>

<image>
	<url>http://www.nlpir.org/wordpress/wp-content/uploads/2018/12/logo1.gif</url>
	<title>Paper论文</title>
	<link>http://www.nlpir.org/wordpress</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>NLPIR实验室多篇论文被EMNLP2026录用</title>
		<link>http://www.nlpir.org/wordpress/2026/08/22/nlpir%e5%ae%9e%e9%aa%8c%e5%ae%a4%e5%a4%9a%e7%af%87%e8%ae%ba%e6%96%87%e8%a2%abemnlp2026%e5%bd%95%e7%94%a8/</link>
					<comments>http://www.nlpir.org/wordpress/2026/08/22/nlpir%e5%ae%9e%e9%aa%8c%e5%ae%a4%e5%a4%9a%e7%af%87%e8%ae%ba%e6%96%87%e8%a2%abemnlp2026%e5%bd%95%e7%94%a8/#respond</comments>
		
		<dc:creator><![CDATA[nlpir]]></dc:creator>
		<pubDate>Sat, 22 Aug 2026 10:45:31 +0000</pubDate>
				<category><![CDATA[Paper论文]]></category>
		<category><![CDATA[Update动态]]></category>
		<guid isPermaLink="false">http://www.nlpir.org/wordpress/?p=3243257</guid>

					<description><![CDATA[快讯 近日，自然语言处理领域国际顶级会议 Conference on Empir &#8230; <a href="http://www.nlpir.org/wordpress/2026/08/22/nlpir%e5%ae%9e%e9%aa%8c%e5%ae%a4%e5%a4%9a%e7%af%87%e8%ae%ba%e6%96%87%e8%a2%abemnlp2026%e5%bd%95%e7%94%a8/">继续阅读 <span class="meta-nav">&#8594;</span></a>]]></description>
										<content:encoded><![CDATA[		<div data-elementor-type="wp-post" data-elementor-id="3243257" class="elementor elementor-3243257">
				<div class="elementor-element elementor-element-aa06798 e-flex e-con-boxed e-con e-parent" data-id="aa06798" data-element_type="container" data-e-type="container">
					<div class="e-con-inner">
				<div class="elementor-element elementor-element-21aa0170 elementor-widget elementor-widget-text-editor" data-id="21aa0170" data-element_type="widget" data-e-type="widget" data-widget_type="text-editor.default">
									
<p class="wp-block-paragraph"><strong>快讯</strong></p>

<p class="wp-block-paragraph">近日，自然语言处理领域国际顶级会议 Conference on Empirical Methods in Natural Language Processing（EMNLP）公布论文录用结果，NLPIR实验室共有4篇论文被接收。相关研究覆盖大语言模型推理、音频语言模型、多模态理解、时间认知推理、开放关系抽取等方向，展现了实验室在认知智能、大模型与多模态人工智能领域的持续探索与创新能力。以下为入选论文介绍。</p>

<div class="wp-block-group is-nowrap is-layout-flex wp-container-core-group-is-layout-8f761849 wp-block-group-is-layout-flex">
<p class="wp-block-paragraph"><strong>论文一</strong></p>
</div>

<p class="wp-block-paragraph"><strong>论文题目：</strong>Is the Future Predictable? Modeling Future Predictability for Reliable Temporal Reasoning</p>

<p class="wp-block-paragraph"><strong>论文作者：</strong>黄咏仪 张华平 崔文耀 李秋池 李磊 张宝华</p>

<p class="wp-block-paragraph"><strong>作者单位：</strong>北京理工大学</p>

<p class="wp-block-paragraph"><strong>论文概述：</strong>大语言模型（LLMs）在进行未来推理时仍然存在可靠性不足的问题。现有模型通常忽视不同未来状态之间的差异，即使所查询的事实本身具有高度不确定性，模型仍然会给出确定性的答案。为应对这一挑战，本文提出了 ChronoRegime，一种面向未来的时间推理任务，要求模型判断：已有的历史时间证据是否足以支持对未来答案做出确定性判断。此外，本文提出了 置信感知时间推理框架（Confidence-Aware Temporal Reasoning, CTR）。该框架通过分析时间演化规律来评估未来状态的可预测性，并据此调节模型是否应该对答案做出承诺。与无条件地进行未来预测不同，CTR仅在重构后的证据能够支持目标未来状态时才给出确定性预测。在多个大语言模型上的实验表明，与普通问答基线方法相比，CTR使严格总体准确率平均提升 6.7个百分点，并使幻觉率平均降低 18.4个百分点。实验结果证明，显式评估未来事件的可预测性，是提升未来不确定环境下时间推理安全性和可靠性的有效机制。</p>

<figure class="wp-block-image size-large"><img fetchpriority="high" decoding="async" class="aligncenter wp-image-3244479 size-full" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/image.png" alt="" width="1071" height="913" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/image.png 1071w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/image-300x256.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/image-1024x873.png 1024w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/image-768x655.png 768w" sizes="(max-width: 1071px) 100vw, 1071px" /></figure>

<p class="wp-block-paragraph"><strong>论文二</strong></p>

<p class="wp-block-paragraph"><strong>论文题目：</strong>Learning to Explore the Crux in Formal Theorem Proving</p>

<p class="wp-block-paragraph"><strong>论文作者：</strong>李林翰 崔文耀 张公铎 顾立宏 周琳 商建云 张华平</p>

<p class="wp-block-paragraph"><strong>作者单位：</strong>北京理工大学、蚂蚁集团</p>

<p class="wp-block-paragraph"><strong>论文概述：</strong>作者提出了一种面向形式化定理证明的基于熵的最佳优先搜索算法（Entropy-Based Best-First Search, EBFS），针对Lean形式化证明过程中不同推理步骤难度和重要性不均衡的问题，从熵的视角识别证明树中更值得探索的关键步骤，并据此优化证明搜索过程，使证明生成模型能够在有限搜索预算下更高效地探索证明空间，提高找到正确证明的概率。在此基础上，作者进一步提出了面向证明树搜索的强化微调方法，并在生成阶段结合EBFS进一步提升模型的形式化证明能力。实验结果表明，在相同采样预算下，该方法相较于完整证明生成基线，在ProofNet测试集上提升3.2%，并在MiniF2F和ProverBench上分别提升1.9%和1.5%，验证了该方法在形式化定理证明搜索效率和证明成功率方面的有效性。</p>

<figure class="wp-block-image size-full"><img decoding="async" class="aligncenter wp-image-3244482 size-full" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/image-1.png" alt="" width="1018" height="654" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/image-1.png 1018w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/image-1-300x193.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/image-1-768x493.png 768w" sizes="(max-width: 1018px) 100vw, 1018px" /></figure>

<p class="wp-block-paragraph"><strong>论文三</strong></p>

<p class="wp-block-paragraph"><strong>论文题目</strong>：Modality-Specific Gating for Large Audio-Language Models</p>

<p class="wp-block-paragraph"><strong>论文作者：</strong>任珍妮 王娟 李秋池 李磊 高春晓 张宝华 张华平</p>

<p class="wp-block-paragraph"><strong>作者单位：</strong>北京理工大学</p>

<p class="wp-block-paragraph"><strong>论文概述：</strong>大型音频语言模型（Large Audio-Language Models, LALMs）近年来在音频-文本指令理解和多模态交互方面取得了显著进展。然而，由于其采用文本条件生成架构，当前的LALM往往会受到输入文本提示的过度影响。当声学证据与文本提示发生冲突时，错误或无关的文本信息可能会引导模型偏离真实的音频内容，导致预测结果错误。本文系统分析了这一问题，并发现具有代表性的LALM在生成过程中存在持续性的音频-文本模态失衡现象：随着生成步骤推进，模型对音频token的关注程度逐渐减弱。为解决这一失衡问题，本文提出了模态特定门控机制（Modality-Specific Gating, MSG）。该方法是一种声学校准机制，仅引入少量额外参数，即可增强模型对音频信息的感知能力。具体而言，MSG在softmax计算之前，针对音频token的注意力logit引入一种基于查询条件（query-conditioned）的逐token偏置（token-wise bias），从而提升音频信息在注意力计算中的权重，同时保持原有注意力计算过程不变。通过参数高效微调（parameter-efficient fine-tuning），MSG能够增强模型对声学证据的利用能力，使其在声音分类（vocal sound classification）和语音情感识别（speech emotion recognition）任务中持续获得性能提升，并且在面对对抗性文本提示或无关文本提示时表现出更强的鲁棒性。</p>

<figure class="wp-block-image"><img decoding="async" class="aligncenter wp-image-3244612 size-full" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/768c07b6-5776-43dd-ac25-4e23fe4a970d.png" alt="" width="1200" height="526" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/768c07b6-5776-43dd-ac25-4e23fe4a970d.png 1200w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/768c07b6-5776-43dd-ac25-4e23fe4a970d-300x132.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/768c07b6-5776-43dd-ac25-4e23fe4a970d-1024x449.png 1024w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/768c07b6-5776-43dd-ac25-4e23fe4a970d-768x337.png 768w" sizes="(max-width: 1200px) 100vw, 1200px" /></figure>

<p class="wp-block-paragraph"><strong>论文四</strong></p>

<p class="wp-block-paragraph"><strong>论文题目：</strong>Distributional Recalibration for Zero-Shot Relation Extraction</p>

<p class="wp-block-paragraph"><strong>论文作者：</strong>刘永鑫 张华平 李秋池 李磊 高春晓 吕浩成 严若豪 张宝华</p>

<p class="wp-block-paragraph"><strong>作者单位：</strong>北京理工大学 新疆大学</p>

<p class="wp-block-paragraph"><strong>论文概述：</strong>基于联合编码（joint-encoding）的零样本关系抽取方法能够在一次Transformer前向传播中对所有候选关系标签进行分类，因此兼具较高的准确率和推理效率。然而，在完整关系词表规模（full-vocabulary scale）下，该方法会暴露出两类分布性问题：一方面，未归一化的点积评分（unnormalized dot-product scoring）会导致召回坍缩（recall collapse），使部分关系类型无法被模型预测；另一方面，实例级二元交叉熵损失（per-instance BCE loss）会导致真实类别与负类别评分分布严重混叠，难以确定可靠阈值，造成置信度歧义（confidence ambiguity）。针对上述问题，本文提出了SCAR（Stabilized Cascade and Alignment for Robust joint-encoding ZSRE）方法。该方法保持原有基线模型结构不变，通过两个经过稳定化设计的辅助分支对评分分布和表示分布进行重新校准：一是基于梯度隔离的粗到细级联模块，通过Z-score归一化调整关系评分分布，缓解召回坍缩问题；二是仅用于训练阶段的对比对齐模块，通过优化关系表示空间，提高不同关系类别之间的区分能力。在Wiki-ZSL数据集（候选关系数量 m=15）上的实验结果表明，SCAR将Macro F1指标从75.9%提升至83.0%，并将零召回关系类型数量从35类降低至1类。实验结果说明，传统的小规模候选关系评测协议可能会掩盖大规模关系词表部署中的关键失效模式，而SCAR能够有效提升零样本关系抽取方法在开放环境下的稳定性和可靠性。</p>

<figure class="wp-block-image"></figure>
<p><img loading="lazy" decoding="async" class="aligncenter wp-image-3244619 size-full" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/6cfd56e1-ea23-4989-9dd1-e2136e1b3c06.png" alt="" width="1200" height="731" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/6cfd56e1-ea23-4989-9dd1-e2136e1b3c06.png 1200w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/6cfd56e1-ea23-4989-9dd1-e2136e1b3c06-300x183.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/6cfd56e1-ea23-4989-9dd1-e2136e1b3c06-1024x624.png 1024w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/08/6cfd56e1-ea23-4989-9dd1-e2136e1b3c06-768x468.png 768w" sizes="(max-width: 1200px) 100vw, 1200px" /></p>
								</div>
					</div>
				</div>
				</div>
		]]></content:encoded>
					
					<wfw:commentRss>http://www.nlpir.org/wordpress/2026/08/22/nlpir%e5%ae%9e%e9%aa%8c%e5%ae%a4%e5%a4%9a%e7%af%87%e8%ae%ba%e6%96%87%e8%a2%abemnlp2026%e5%bd%95%e7%94%a8/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>KDD 2026：从打分到符号化失败诊断，让大模型推理&#8221;可诊断、可解释&#8221;</title>
		<link>http://www.nlpir.org/wordpress/2026/05/21/kdd-2026%ef%bc%9a%e4%bb%8e%e6%89%93%e5%88%86%e5%88%b0%e7%ac%a6%e5%8f%b7%e5%8c%96%e5%a4%b1%e8%b4%a5%e8%af%8a%e6%96%ad%ef%bc%8c%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%8e%a8%e7%90%86%e5%8f%af%e8%af%8a/</link>
					<comments>http://www.nlpir.org/wordpress/2026/05/21/kdd-2026%ef%bc%9a%e4%bb%8e%e6%89%93%e5%88%86%e5%88%b0%e7%ac%a6%e5%8f%b7%e5%8c%96%e5%a4%b1%e8%b4%a5%e8%af%8a%e6%96%ad%ef%bc%8c%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%8e%a8%e7%90%86%e5%8f%af%e8%af%8a/#respond</comments>
		
		<dc:creator><![CDATA[nlpir]]></dc:creator>
		<pubDate>Thu, 21 May 2026 14:32:19 +0000</pubDate>
				<category><![CDATA[Paper论文]]></category>
		<category><![CDATA[Update动态]]></category>
		<guid isPermaLink="false">http://www.nlpir.org/wordpress/?p=2092379</guid>

					<description><![CDATA[北京理工大学、中关村学院、中国科学院自动化研究所 KDD会议简介 KDD（ACM &#8230; <a href="http://www.nlpir.org/wordpress/2026/05/21/kdd-2026%ef%bc%9a%e4%bb%8e%e6%89%93%e5%88%86%e5%88%b0%e7%ac%a6%e5%8f%b7%e5%8c%96%e5%a4%b1%e8%b4%a5%e8%af%8a%e6%96%ad%ef%bc%8c%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%8e%a8%e7%90%86%e5%8f%af%e8%af%8a/">继续阅读 <span class="meta-nav">&#8594;</span></a>]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">北京理工大学、中关村学院、中国科学院自动化研究所</p>



<figure class="wp-block-image size-large"><img loading="lazy" decoding="async" width="1024" height="631" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-1024x631.png" alt="" class="wp-image-3244532" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-1024x631.png 1024w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-300x185.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-768x474.png 768w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image.png 1200w" sizes="(max-width: 1024px) 100vw, 1024px" /></figure>



<p class="wp-block-paragraph"><strong>KDD会议简介</strong></p>



<p class="wp-block-paragraph">KDD（ACM SIGKDD Conference on Knowledge Discovery and Data Mining）是数据挖掘与知识发现领域的国际顶级学术会议，由 ACM 旗下的 SIGKDD 专委会主办，自 1999 年起每年举办一届，被中国计算机学会（CCF）列为 A 类推荐会议。</p>



<p class="wp-block-paragraph">作为数据科学与大数据生态的风向标，KDD 专注于“从海量数据中发现有价值知识”的全流程研究，议题覆盖数据挖掘算法、机器学习、深度学习、图神经网络、推荐系统及异常检测等前沿方向，同时也高度重视在生物信息、金融风控及社会网络等领域的落地应用。</p>



<p class="wp-block-paragraph">该会议学术门槛极高，主会论文录用率常年维持在 15%~20% 之间，与 ICML、NeurIPS 并列为人工智能与数据科学领域的三大顶尖会议。</p>



<p class="wp-block-paragraph"><strong>论文宗旨</strong></p>



<p class="wp-block-paragraph">大模型 (LLM) 已经能做出像模像样的多步推理。但越来越多研究发现一个尴尬现象：<strong>答案对了，思维链却未必成立</strong>——中间步骤跳跃、隐藏假设、忽略边界条件，结果&#8221;碰巧对&#8221;。在医疗、金融、科研助理这种高风险场景里，&#8221;偶尔答对&#8221;和&#8221;过程可信&#8221;完全是两件事。</p>



<p class="wp-block-paragraph">现有验证手段都难以回答&#8221;为什么错&#8221;：Answer Matching 只给 1 bit；LLM-as-Judge 主观难审计；Reward / PRM 是一个标量；已有的神经符号方法又分不清&#8221;<strong>翻译失败</strong>&#8220;和&#8221;<strong>推理缺陷</strong>&#8220;。</p>



<p class="wp-block-paragraph">来自&nbsp;<strong>北京理工大学 NLPIR 实验室</strong>&nbsp;与&nbsp;<strong>中关村学院 / 中国科学院自动化研究所</strong>&nbsp;的联合研究团队，在论文&nbsp;<strong>《SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification》（KDD 2026）</strong>中提出了一种全新的范式：<strong>把推理验证重新定义为&#8221;可解释的失败诊断&#8221;</strong>——不仅指出&#8221;哪一步错&#8221;，更给出可被符号求解器独立校验的证据，并据此驱动迭代修复。</p>



<p class="wp-block-paragraph"><strong>从&#8221;打分&#8221;到&#8221;诊断&#8221;</strong></p>



<p class="wp-block-paragraph">这项工作的出发点很朴素：多轮事实核查时，<strong>每一步证据并不是简单地堆在一起</strong>，而是有<strong>层次、依赖、约束</strong>关系。光看最终答案、或者请另一个 LLM 来打分，都看不见这些结构。</p>



<figure class="wp-block-image size-full"><img loading="lazy" decoding="async" width="847" height="414" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-1.png" alt="" class="wp-image-3244534" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-1.png 847w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-1-300x147.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-1-768x375.png 768w" sizes="(max-width: 847px) 100vw, 847px" /></figure>



<p class="wp-block-paragraph">论文借鉴神经符号方法的思路，把 CoT 编译成统一签名下的<strong>符号程序</strong>，再交给 SWI-Prolog 这样的求解器去做<strong>步级 SAT / 蕴含校验</strong>。</p>



<p class="wp-block-paragraph">这意味着——当你说&#8221;这一步错了&#8221;，<strong>你能拿出一份反例 / Unsat 核心 / 缺失前提</strong>，而不是模糊的&#8221;我觉得不太对&#8221;。</p>



<p class="wp-block-paragraph"><strong>关键挑战：是真错，还是翻译噪声？</strong></p>



<p class="wp-block-paragraph">把自然语言翻成形式化语言再求解，这条路其实<strong>不新</strong>。Logic-LM、SymbCoT、Aristotle 都尝试过。但<strong>所有这条路上的方法都被同一个问题困扰</strong>：当求解器报&#8221;违规&#8221;时，我们到底是抓住了一个真实推理缺陷？还是只是<strong>翻译过程产生的噪声</strong>？</p>



<p class="wp-block-paragraph">当前的核心难点是如果不能区分二者，所有反馈都会被污染——验证器越严格，反而错得越离谱。一个好的诊断系统，必须在<strong>翻译错误 (TranslationError)&nbsp;</strong>与&nbsp;<strong>推理错误 (ReasoningError)&nbsp;</strong>之间画出一条可靠的界。</p>



<p class="wp-block-paragraph">SymDiag 的破局点是<strong>自审计机制 (Self-Auditor)</strong>：对同一段 CoT 同时生成两份独立的符号编码——<strong>Formal Translation&nbsp;</strong>走标准翻译，<strong>Critical Restatement</strong>&nbsp;做更严格的复述再编译。两条路径相互&#8221;作证&#8221;，能暴露原文里被掩盖的隐藏假设。</p>



<p class="wp-block-paragraph">如果某个&#8221;违规&#8221;在最小化、文本一致的改写下就消失了——那它是<strong>翻译错误</strong>；否则才会被认定为<strong>真正的推理错误</strong>。只有通过审计的状态才会进入下一阶段的步级验证。</p>



<p class="wp-block-paragraph"><strong>SymDiag 框架：四件套构成的诊断闭环</strong></p>



<figure class="wp-block-image size-full"><img loading="lazy" decoding="async" width="831" height="469" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-2.png" alt="" class="wp-image-3244537" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-2.png 831w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-2-300x169.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-2-768x433.png 768w" sizes="(max-width: 831px) 100vw, 831px" /></figure>



<p class="wp-block-paragraph"><strong>① 双分支神经符号生成器</strong>：同一条 CoT 被编译为两份独立的形式化程序，<strong>两条路径相互校验</strong>，降低单点翻译偏差。</p>



<p class="wp-block-paragraph"><strong>② Self-Auditor（核心创新）</strong>：用跨分支一致性检查 + 轻量符号正则化测试，把每一处&#8221;违规&#8221;明确归因到<strong>TranslationError 或 ReasoningError</strong>。</p>



<p class="wp-block-paragraph"><strong>③ 步级符号验证</strong>：对每一步状态 Si = {Pi, Ii, Ci}（前提 / 推断 / 约束）执行 SAT 与局部蕴含检查，输出可校验证据。</p>



<p class="wp-block-paragraph"><strong>④ 诊断引导的修复</strong>：根据失败的影响范围 (scope) 选择&#8221;局部补丁&#8221;或&#8221;全局重写&#8221;，形成诊断 → 修复 → 再诊断的闭环。</p>



<p class="wp-block-paragraph">一句话总结：SymDiag&nbsp;<strong>不是更好的 verifier，也不是更好的 reward</strong>，而是一个可解释的神经符号诊断系统——它定位错误、归因原因，并以可被独立校验的证据驱动修复。</p>



<p class="wp-block-paragraph"><strong>实验：跨四大领域的全面验证</strong></p>



<p class="wp-block-paragraph">研究团队构建了一个覆盖<strong>数学 / 逻辑 / 科学 / 通用推理</strong>的统一诊断数据集，自动构建样本达<strong>&nbsp;437,792 条</strong>，并人工审核出<strong>&nbsp;240 条</strong>高质量黄金集。</p>



<figure class="wp-block-image size-full"><img loading="lazy" decoding="async" width="832" height="610" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-3.png" alt="" class="wp-image-3244539" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-3.png 832w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-3-300x220.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-3-768x563.png 768w" sizes="(max-width: 832px) 100vw, 832px" /></figure>



<p class="wp-block-paragraph"><strong>不忠实推理检测：</strong>SymDiag 在所有<strong>&nbsp;8 个 benchmark&nbsp;</strong>上均取得 F1 最优，整体 F1 达到<strong>&nbsp;70.7</strong>。在 AR-LSAT / LogiDed / MMLU 这种&#8221;答案对、过程错&#8221;高占比的数据集上优势最大——基线在这里几乎完全失效。</p>



<figure class="wp-block-image size-full"><img loading="lazy" decoding="async" width="850" height="387" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-4.png" alt="" class="wp-image-3244541" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-4.png 850w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-4-300x137.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-4-768x350.png 768w" sizes="(max-width: 850px) 100vw, 850px" /></figure>



<p class="wp-block-paragraph"><strong>多轮修复：</strong>Answer Matching 几乎无改善；Reward / LogicReward 的标量信号嘈杂；LLM-as-Judge 早期略有提升但很快饱和。<strong>只有 SymDiag 在每一轮都领先所有基线</strong>——并且增长更陡、不饱和。</p>



<figure class="wp-block-image size-full"><img loading="lazy" decoding="async" width="843" height="504" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-5.png" alt="" class="wp-image-3244544" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-5.png 843w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-5-300x179.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-5-768x459.png 768w" sizes="(max-width: 843px) 100vw, 843px" /></figure>



<p class="wp-block-paragraph"><strong>错误归因：模型越大，&#8221;幻觉规则&#8221;越严重</strong></p>



<p class="wp-block-paragraph">借助 SymDiag 的步级诊断，研究团队第一次系统刻画了不同规模模型的&#8221;失败画像&#8221;：</p>



<figure class="wp-block-image size-full"><img loading="lazy" decoding="async" width="834" height="504" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-6.png" alt="" class="wp-image-3244546" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-6.png 834w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-6-300x181.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-6-768x464.png 768w" sizes="(max-width: 834px) 100vw, 834px" /></figure>



<p class="wp-block-paragraph"><strong>小模型 (Llama-3.2-1B / Qwen3-1.7B)</strong>：算术错误 35% / 30%、前提缺失 30% / 28%——符号操控与前提追踪不稳。</p>



<p class="wp-block-paragraph"><strong>中等模型 (Qwen3-8B)</strong>：低层错误下降，非蕴含推理 22%、约束忽略 25% 上升。</p>



<p class="wp-block-paragraph"><strong>大模型 (GPTOSS-20B)</strong>：算术只剩 5%，但<strong>规则误用激增到 32%、类型错配 20%</strong>——更强的抽象能力反而带来<strong>&#8220;过度泛化&#8221;</strong>风险。</p>



<p class="wp-block-paragraph">这一发现意味着：<strong>推理监督应当模型规模感知</strong>——小模型需要约束强化与前提补全，大模型则需要防范规则幻觉。同一种 reward，对大小模型完全是两种药。</p>



<p class="wp-block-paragraph">经过 3 轮 Self-Auditor 反馈，<strong>翻译错误从 20.1% 降到接近 0</strong>，执行失败从 5.5% 降到 1% 以下。证据表明：显式 SAT / 蕴含检查是诊断准确性的主驱动；Self-Auditor 则是诊断可靠性的关键开关。</p>



<p class="wp-block-paragraph"><strong>意义</strong></p>



<p class="wp-block-paragraph">这篇论文的价值不仅在于&#8221;提升了多跳事实核查的准确率&#8221;，更在于<strong>提出了一种新的范式</strong>：</p>



<p class="wp-block-paragraph">用<strong>结构化的失败诊断</strong>取代<strong>笼统的打分</strong>，约束和优化大模型的多跳推理过程。过去我们经常用 Chain-of-Thought 来观察模型&#8221;怎么想&#8221;，但 CoT 本身并不保证逻辑关系真正存在，也不保证每一步都有证据支撑。</p>



<p class="wp-block-paragraph">SymDiag 给出了进一步要求模型明确说明：</p>



<ul class="wp-block-list">
<li><strong>哪些信息</strong>来自证据？</li>



<li><strong>哪些结论</strong>是推导出来的？</li>



<li><strong>每一步</strong>推导依赖哪些前置信息？</li>



<li><strong>最终结论</strong>如何由这些结构化证据支撑？</li>
</ul>



<p class="wp-block-paragraph">这使得推理过程更具可解释性，也更容易检查与调试。对于需要可靠性的场景，比如事实核查、医学证据综述、科研问答和复杂信息检索，这类对结构因果模型的推理方式可能具有重要意义。</p>



<p class="wp-block-paragraph">SymDiag&nbsp;<strong>提供的翻译/推理错误解耦机制</strong>，也为类似工作提供了一个新思路——可靠的步级符号推理不在于把翻译做得更&#8221;花哨&#8221;，而在于在出错的时候，能让&#8221;翻译&#8221;和&#8221;逻辑&#8221;两条腿同时被检查、修复。</p>



<p class="wp-block-paragraph">它提醒我们：未来的大模型推理能力，不应该只看最终答案是否生成长长的解释，而应该看是否能够构建更可靠、更可验证、更有依据的<strong>推理结构</strong>。</p>



<p class="wp-block-paragraph">从&#8221;<strong>说得像有道理</strong>&#8220;到&#8221;<strong>每一步都有证据和结构支撑</strong>&#8220;，这或许是大模型可靠推理走向真实部署的关键。</p>



<p class="wp-block-paragraph"><strong>论文标题：</strong></p>



<p class="wp-block-paragraph"><strong>SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification</strong></p>



<p class="wp-block-paragraph"><strong>录用会议：</strong></p>



<p class="wp-block-paragraph">ACM SIGKDD 2026 (KDD &#8217;26) · Research Track</p>



<p class="wp-block-paragraph"><strong>关键词：</strong></p>



<p class="wp-block-paragraph">LLM · Diagnosis · Symbolic · Faithful Reasoning · Explainability</p>



<p class="wp-block-paragraph"><strong>论文链接：</strong></p>



<p class="wp-block-paragraph">暂未公开（camera-ready 后将提供）</p>



<p class="wp-block-paragraph"><strong>代码 / 数据：</strong></p>



<p class="wp-block-paragraph">camera-ready 后开源</p>



<p class="wp-block-paragraph"><strong>第一作者：崔文耀</strong></p>



<figure class="wp-block-image size-full"><img loading="lazy" decoding="async" width="844" height="847" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-7.png" alt="" class="wp-image-3244548" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-7.png 844w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-7-300x300.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-7-150x150.png 150w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/05/image-7-768x771.png 768w" sizes="(max-width: 844px) 100vw, 844px" /></figure>
]]></content:encoded>
					
					<wfw:commentRss>http://www.nlpir.org/wordpress/2026/05/21/kdd-2026%ef%bc%9a%e4%bb%8e%e6%89%93%e5%88%86%e5%88%b0%e7%ac%a6%e5%8f%b7%e5%8c%96%e5%a4%b1%e8%b4%a5%e8%af%8a%e6%96%ad%ef%bc%8c%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%8e%a8%e7%90%86%e5%8f%af%e8%af%8a/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
