<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Paper论文</title>
	<atom:link href="http://www.nlpir.org/wordpress/category/paper%e8%ae%ba%e6%96%87/feed/" rel="self" type="application/rss+xml" />
	<link>http://www.nlpir.org/wordpress</link>
	<description></description>
	<lastBuildDate>Sun, 31 May 2026 08:08:19 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.3</generator>

<image>
	<url>http://www.nlpir.org/wordpress/wp-content/uploads/2018/12/logo1.gif</url>
	<title>Paper论文</title>
	<link>http://www.nlpir.org/wordpress</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>KDD 2026：从打分到符号化失败诊断，让大模型推理&#8221;可诊断、可解释&#8221;</title>
		<link>http://www.nlpir.org/wordpress/2026/05/21/kdd-2026%ef%bc%9a%e4%bb%8e%e6%89%93%e5%88%86%e5%88%b0%e7%ac%a6%e5%8f%b7%e5%8c%96%e5%a4%b1%e8%b4%a5%e8%af%8a%e6%96%ad%ef%bc%8c%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%8e%a8%e7%90%86%e5%8f%af%e8%af%8a/</link>
					<comments>http://www.nlpir.org/wordpress/2026/05/21/kdd-2026%ef%bc%9a%e4%bb%8e%e6%89%93%e5%88%86%e5%88%b0%e7%ac%a6%e5%8f%b7%e5%8c%96%e5%a4%b1%e8%b4%a5%e8%af%8a%e6%96%ad%ef%bc%8c%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%8e%a8%e7%90%86%e5%8f%af%e8%af%8a/#respond</comments>
		
		<dc:creator><![CDATA[nlpir]]></dc:creator>
		<pubDate>Thu, 21 May 2026 14:32:19 +0000</pubDate>
				<category><![CDATA[Paper论文]]></category>
		<category><![CDATA[Update动态]]></category>
		<guid isPermaLink="false">http://www.nlpir.org/wordpress/?p=2092379</guid>

					<description><![CDATA[北京理工大学、中关村学院、中国科学院自动化研究所 KDD会议简介 KDD（ACM &#8230; <a href="http://www.nlpir.org/wordpress/2026/05/21/kdd-2026%ef%bc%9a%e4%bb%8e%e6%89%93%e5%88%86%e5%88%b0%e7%ac%a6%e5%8f%b7%e5%8c%96%e5%a4%b1%e8%b4%a5%e8%af%8a%e6%96%ad%ef%bc%8c%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%8e%a8%e7%90%86%e5%8f%af%e8%af%8a/">继续阅读 <span class="meta-nav">&#8594;</span></a>]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">北京理工大学、中关村学院、中国科学院自动化研究所</p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" style="width: 650px;" src="https://mmbiz.qpic.cn/sz_mmbiz_jpg/yozlYZeLGPeOklH98bTiaPsRLicjr1opRhicr1JkCXVCtxD9pabDT4s2q6sauIaBq12VJXGxRW5mnfSZLSE0LNIzRHuSVNUO6fA2qwMuZYdSuE/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=1" alt="图片"></p>



<p class="wp-block-paragraph"><strong>KDD会议简介</strong></p>



<p class="wp-block-paragraph">KDD（ACM SIGKDD Conference on Knowledge Discovery and Data Mining）是数据挖掘与知识发现领域的国际顶级学术会议，由 ACM 旗下的 SIGKDD 专委会主办，自 1999 年起每年举办一届，被中国计算机学会（CCF）列为 A 类推荐会议。</p>



<p class="wp-block-paragraph">作为数据科学与大数据生态的风向标，KDD 专注于“从海量数据中发现有价值知识”的全流程研究，议题覆盖数据挖掘算法、机器学习、深度学习、图神经网络、推荐系统及异常检测等前沿方向，同时也高度重视在生物信息、金融风控及社会网络等领域的落地应用。</p>



<p class="wp-block-paragraph">该会议学术门槛极高，主会论文录用率常年维持在 15%~20% 之间，与 ICML、NeurIPS 并列为人工智能与数据科学领域的三大顶尖会议。</p>



<p class="wp-block-paragraph"><strong>论文宗旨</strong></p>



<p class="wp-block-paragraph">大模型 (LLM) 已经能做出像模像样的多步推理。但越来越多研究发现一个尴尬现象：<strong>答案对了，思维链却未必成立</strong>——中间步骤跳跃、隐藏假设、忽略边界条件，结果&#8221;碰巧对&#8221;。在医疗、金融、科研助理这种高风险场景里，&#8221;偶尔答对&#8221;和&#8221;过程可信&#8221;完全是两件事。</p>



<p class="wp-block-paragraph">现有验证手段都难以回答&#8221;为什么错&#8221;：Answer Matching 只给 1 bit；LLM-as-Judge 主观难审计；Reward / PRM 是一个标量；已有的神经符号方法又分不清&#8221;<strong>翻译失败</strong>&#8220;和&#8221;<strong>推理缺陷</strong>&#8220;。</p>



<p class="wp-block-paragraph">来自&nbsp;<strong>北京理工大学 NLPIR 实验室</strong>&nbsp;与&nbsp;<strong>中关村学院 / 中国科学院自动化研究所</strong>&nbsp;的联合研究团队，在论文&nbsp;<strong>《SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification》（KDD 2026）</strong>中提出了一种全新的范式：<strong>把推理验证重新定义为&#8221;可解释的失败诊断&#8221;</strong>——不仅指出&#8221;哪一步错&#8221;，更给出可被符号求解器独立校验的证据，并据此驱动迭代修复。</p>



<p class="wp-block-paragraph"><strong>从&#8221;打分&#8221;到&#8221;诊断&#8221;</strong></p>



<p class="wp-block-paragraph">这项工作的出发点很朴素：多轮事实核查时，<strong>每一步证据并不是简单地堆在一起</strong>，而是有<strong>层次、依赖、约束</strong>关系。光看最终答案、或者请另一个 LLM 来打分，都看不见这些结构。</p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" src="https://mmbiz.qpic.cn/sz_mmbiz_jpg/yozlYZeLGPfamBQl78d0NP8olr3wLoxZhkHTu37gkVTbGKBY9zxpNgzbfrokicI9vDvUkyaTtF5FbuuUibticSs74dNhGHd3vPUl1zzYedLU9c/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=5" alt="图片" style="width: 650px;"></p>



<p class="wp-block-paragraph">论文借鉴神经符号方法的思路，把 CoT 编译成统一签名下的<strong>符号程序</strong>，再交给 SWI-Prolog 这样的求解器去做<strong>步级 SAT / 蕴含校验</strong>。</p>



<p class="wp-block-paragraph">这意味着——当你说&#8221;这一步错了&#8221;，<strong>你能拿出一份反例 / Unsat 核心 / 缺失前提</strong>，而不是模糊的&#8221;我觉得不太对&#8221;。</p>



<p class="wp-block-paragraph"><strong>关键挑战：是真错，还是翻译噪声？</strong></p>



<p class="wp-block-paragraph">把自然语言翻成形式化语言再求解，这条路其实<strong>不新</strong>。Logic-LM、SymbCoT、Aristotle 都尝试过。但<strong>所有这条路上的方法都被同一个问题困扰</strong>：当求解器报&#8221;违规&#8221;时，我们到底是抓住了一个真实推理缺陷？还是只是<strong>翻译过程产生的噪声</strong>？</p>



<p class="wp-block-paragraph">当前的核心难点是如果不能区分二者，所有反馈都会被污染——验证器越严格，反而错得越离谱。一个好的诊断系统，必须在<strong>翻译错误 (TranslationError)&nbsp;</strong>与&nbsp;<strong>推理错误 (ReasoningError)&nbsp;</strong>之间画出一条可靠的界。</p>



<p class="wp-block-paragraph">SymDiag 的破局点是<strong>自审计机制 (Self-Auditor)</strong>：对同一段 CoT 同时生成两份独立的符号编码——<strong>Formal Translation&nbsp;</strong>走标准翻译，<strong>Critical Restatement</strong>&nbsp;做更严格的复述再编译。两条路径相互&#8221;作证&#8221;，能暴露原文里被掩盖的隐藏假设。</p>



<p class="wp-block-paragraph">如果某个&#8221;违规&#8221;在最小化、文本一致的改写下就消失了——那它是<strong>翻译错误</strong>；否则才会被认定为<strong>真正的推理错误</strong>。只有通过审计的状态才会进入下一阶段的步级验证。</p>



<p class="wp-block-paragraph"><strong>SymDiag 框架：四件套构成的诊断闭环</strong></p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" src="https://mmbiz.qpic.cn/sz_mmbiz_jpg/yozlYZeLGPdLianop7uw3os5Zlq9Lc47Qc0Ojyn0OEtSUTblI0OiaN6WkVZnG3SsqlpYAcX6gDV2H4Eg8MefAcpeOwy6pjy7dcPtRgI7LGEdQ/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=8" alt="图片" style="width: 650px;"></p>



<p class="wp-block-paragraph"><strong>① 双分支神经符号生成器</strong>：同一条 CoT 被编译为两份独立的形式化程序，<strong>两条路径相互校验</strong>，降低单点翻译偏差。</p>



<p class="wp-block-paragraph"><strong>② Self-Auditor（核心创新）</strong>：用跨分支一致性检查 + 轻量符号正则化测试，把每一处&#8221;违规&#8221;明确归因到<strong>TranslationError 或 ReasoningError</strong>。</p>



<p class="wp-block-paragraph"><strong>③ 步级符号验证</strong>：对每一步状态 Si = {Pi, Ii, Ci}（前提 / 推断 / 约束）执行 SAT 与局部蕴含检查，输出可校验证据。</p>



<p class="wp-block-paragraph"><strong>④ 诊断引导的修复</strong>：根据失败的影响范围 (scope) 选择&#8221;局部补丁&#8221;或&#8221;全局重写&#8221;，形成诊断 → 修复 → 再诊断的闭环。</p>



<p class="wp-block-paragraph">一句话总结：SymDiag <strong>不是更好的 verifier，也不是更好的 reward</strong>，而是一个可解释的神经符号诊断系统——它定位错误、归因原因，并以可被独立校验的证据驱动修复。</p>



<p class="wp-block-paragraph"><strong>实验：跨四大领域的全面验证</strong></p>



<p class="wp-block-paragraph">研究团队构建了一个覆盖<strong>数学 / 逻辑 / 科学 / 通用推理</strong>的统一诊断数据集，自动构建样本达<strong> 437,792 条</strong>，并人工审核出<strong> 240 条</strong>高质量黄金集。</p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" src="https://mmbiz.qpic.cn/mmbiz_jpg/yozlYZeLGPfD5XTZ92PYTjv5FO26667MZ0owKgRBq37LqrFdbNJs8amYar3ocAhSQapn2z7oq5tKzdovRAQ21WZXJqvL8qy2icHblBDB0TWA/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=10" alt="图片" style="width: 650px;"></p>



<p class="wp-block-paragraph"><strong>不忠实推理检测：</strong>SymDiag 在所有<strong> 8 个 benchmark </strong>上均取得 F1 最优，整体 F1 达到<strong> 70.7</strong>。在 AR-LSAT / LogiDed / MMLU 这种&#8221;答案对、过程错&#8221;高占比的数据集上优势最大——基线在这里几乎完全失效。</p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" style="width: 650px;" src="https://mmbiz.qpic.cn/mmbiz_jpg/yozlYZeLGPcQUDywzPxfgCrJ4KzibgwCUQvNPtZGv79FruBYGO8bDNxFdBw4aicrnDoIRqpQ9ggJa1uKKTS4eTthYmiaxZJPFib6DQoTLokcGRU/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=11" alt="图片"></p>



<p class="wp-block-paragraph"><strong>多轮修复：</strong>Answer Matching 几乎无改善；Reward / LogicReward 的标量信号嘈杂；LLM-as-Judge 早期略有提升但很快饱和。<strong>只有 SymDiag 在每一轮都领先所有基线</strong>——并且增长更陡、不饱和。</p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" src="https://mmbiz.qpic.cn/mmbiz_jpg/yozlYZeLGPeyvH2txF4bGuYg1Oggde6NusJxzatk7sjGxhVhQEwPygMv93CFic3f0u9sMN5S7hcwCw9MglZCMibC1mWLlLF6Svricw1wTxV468/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=12" alt="图片" style="width: 650px;"></p>



<p class="wp-block-paragraph"><strong>错误归因：模型越大，&#8221;幻觉规则&#8221;越严重</strong></p>



<p class="wp-block-paragraph">借助 SymDiag 的步级诊断，研究团队第一次系统刻画了不同规模模型的&#8221;失败画像&#8221;：</p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" style="width: 650px;" src="https://mmbiz.qpic.cn/sz_mmbiz_jpg/yozlYZeLGPdKacL7sk5CwRO6VAg3ZMRZ58PwSsf4ZDj2P2MVibYLPHg6RsyQ1ibfvBrPMaibkWfia6HGYICJNYiaiaHWMooCzuqOISycltpiajTRy4/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=14" alt="图片"></p>



<p class="wp-block-paragraph"><strong>小模型 (Llama-3.2-1B / Qwen3-1.7B)</strong>：算术错误 35% / 30%、前提缺失 30% / 28%——符号操控与前提追踪不稳。</p>



<p class="wp-block-paragraph"><strong>中等模型 (Qwen3-8B)</strong>：低层错误下降，非蕴含推理 22%、约束忽略 25% 上升。</p>



<p class="wp-block-paragraph"><strong>大模型 (GPTOSS-20B)</strong>：算术只剩 5%，但<strong>规则误用激增到 32%、类型错配 20%</strong>——更强的抽象能力反而带来<strong>&#8220;过度泛化&#8221;</strong>风险。</p>



<p class="wp-block-paragraph">这一发现意味着：<strong>推理监督应当模型规模感知</strong>——小模型需要约束强化与前提补全，大模型则需要防范规则幻觉。同一种 reward，对大小模型完全是两种药。</p>



<p class="wp-block-paragraph"><strong>关键数字</strong></p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" src="https://mmbiz.qpic.cn/mmbiz_jpg/yozlYZeLGPdVCuCR89SnHNEowWAmYSh7VDukNqzlGWnaVr7ibKMLicTnQE3RdfS6sShLics8aj2ewlF8HjIFViao7M6Z5fpAicjfwCurgyLmnyUY/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=16" alt="图片" style="width: 650px;"></p>



<p class="wp-block-paragraph">经过 3 轮 Self-Auditor 反馈，<strong>翻译错误从 20.1% 降到接近 0</strong>，执行失败从 5.5% 降到 1% 以下。证据表明：显式 SAT / 蕴含检查是诊断准确性的主驱动；Self-Auditor 则是诊断可靠性的关键开关。</p>



<p class="wp-block-paragraph"><strong>意义</strong></p>



<p class="wp-block-paragraph">这篇论文的价值不仅在于&#8221;提升了多跳事实核查的准确率&#8221;，更在于<strong>提出了一种新的范式</strong>：</p>



<p class="wp-block-paragraph">用<strong>结构化的失败诊断</strong>取代<strong>笼统的打分</strong>，约束和优化大模型的多跳推理过程。过去我们经常用 Chain-of-Thought 来观察模型&#8221;怎么想&#8221;，但 CoT 本身并不保证逻辑关系真正存在，也不保证每一步都有证据支撑。</p>



<p class="wp-block-paragraph">SymDiag 给出了进一步要求模型明确说明：</p>



<ul class="wp-block-list">
<li><strong>哪些信息</strong>来自证据？</li>



<li><strong>哪些结论</strong>是推导出来的？</li>



<li><strong>每一步</strong>推导依赖哪些前置信息？</li>



<li><strong>最终结论</strong>如何由这些结构化证据支撑？</li>
</ul>



<p class="wp-block-paragraph">这使得推理过程更具可解释性，也更容易检查与调试。对于需要可靠性的场景，比如事实核查、医学证据综述、科研问答和复杂信息检索，这类对结构因果模型的推理方式可能具有重要意义。</p>



<p class="wp-block-paragraph">SymDiag&nbsp;<strong>提供的翻译/推理错误解耦机制</strong>，也为类似工作提供了一个新思路——可靠的步级符号推理不在于把翻译做得更&#8221;花哨&#8221;，而在于在出错的时候，能让&#8221;翻译&#8221;和&#8221;逻辑&#8221;两条腿同时被检查、修复。</p>



<p class="wp-block-paragraph">它提醒我们：未来的大模型推理能力，不应该只看最终答案是否生成长长的解释，而应该看是否能够构建更可靠、更可验证、更有依据的<strong>推理结构</strong>。</p>



<p class="wp-block-paragraph">从&#8221;<strong>说得像有道理</strong>&#8220;到&#8221;<strong>每一步都有证据和结构支撑</strong>&#8220;，这或许是大模型可靠推理走向真实部署的关键。</p>



<p class="wp-block-paragraph"><strong>论文标题：</strong></p>



<p class="wp-block-paragraph"><strong>SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification</strong></p>



<p class="wp-block-paragraph"><strong>录用会议：</strong></p>



<p class="wp-block-paragraph">ACM SIGKDD 2026 (KDD &#8217;26) · Research Track</p>



<p class="wp-block-paragraph"><strong>关键词：</strong></p>



<p class="wp-block-paragraph">LLM · Diagnosis · Symbolic · Faithful Reasoning · Explainability</p>



<p class="wp-block-paragraph"><strong>论文链接：</strong></p>



<p class="wp-block-paragraph">暂未公开（camera-ready 后将提供）</p>



<p class="wp-block-paragraph"><strong>代码 / 数据：</strong></p>



<p class="wp-block-paragraph">camera-ready 后开源</p>



<p class="wp-block-paragraph"><strong>第一作者：崔文耀</strong></p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" style="width: 650px;" src="https://mmbiz.qpic.cn/mmbiz_jpg/yozlYZeLGPdO4cOzT5GpH7YPIy20FYj64kumbMHP9vSwNZvG5eNsRhQW23HUPlY3gZtHrEhQBKEibUByXUP0B8IJpo6eCSEwbqQqw5RYOfV4/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=18" alt="图片"></p>
]]></content:encoded>
					
					<wfw:commentRss>http://www.nlpir.org/wordpress/2026/05/21/kdd-2026%ef%bc%9a%e4%bb%8e%e6%89%93%e5%88%86%e5%88%b0%e7%ac%a6%e5%8f%b7%e5%8c%96%e5%a4%b1%e8%b4%a5%e8%af%8a%e6%96%ad%ef%bc%8c%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%8e%a8%e7%90%86%e5%8f%af%e8%af%8a/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>ACL 2026 Findings：拒绝盲目采样，让大模型推理“精打细算”且“优胜劣汰”</title>
		<link>http://www.nlpir.org/wordpress/2026/05/21/2092400/</link>
					<comments>http://www.nlpir.org/wordpress/2026/05/21/2092400/#respond</comments>
		
		<dc:creator><![CDATA[nlpir]]></dc:creator>
		<pubDate>Thu, 21 May 2026 14:28:57 +0000</pubDate>
				<category><![CDATA[Paper论文]]></category>
		<category><![CDATA[Update动态]]></category>
		<guid isPermaLink="false">http://www.nlpir.org/wordpress/?p=2092400</guid>

					<description><![CDATA[ACL 2026 Findings：拒绝盲目采样，让大模型推理“精打细算”且“优 &#8230; <a href="http://www.nlpir.org/wordpress/2026/05/21/2092400/">继续阅读 <span class="meta-nav">&#8594;</span></a>]]></description>
										<content:encoded><![CDATA[
<h1 class="wp-block-heading" id="activity-name">ACL 2026 Findings：拒绝盲目采样，让大模型推理“精打细算”且“优胜劣汰”</h1>



<p class="wp-block-paragraph"><strong>论文引言</strong></p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" style="width: 650px;" src="https://mmbiz.qpic.cn/sz_mmbiz_png/yozlYZeLGPcyHRtwfIbZXtlMIscHiadiazDGZYiaqbQ2lXq9spD4yte8sUC9v6wJOPTYyAfL2ToOLGDULiabcqXPlHzRzyWAF8Vxp68rbjodOrg/640?wx_fmt=png&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=2" alt="图片"></p>



<p class="wp-block-paragraph">在解决复杂数学和逻辑问题时，测试时扩展（Test-Time Scaling, TTS）已经成为提升大语言模型推理能力的核心驱动力 。这类方法通常遵循一个直观的逻辑：多采样几条推理路径，然后选出最好的一条。然而，现有大模型在实际应用这类系统时，面临着一个核心的资源与效率瓶颈： 盲目的大批量采样，既昂贵又低效。</p>



<p class="wp-block-paragraph">目前主流的方法（如 Best-of-N）大多依赖“一次性生成，保留少数（Sample once and keep few）”的粗暴策略 。这意味着无论题目难易，模型都会死板地消耗固定的算力，导致大量计算资源浪费在注定被丢弃的低质量候选答案上 。更棘手的是，为了从这些庞杂的候选中挑出正确答案，现有的主流框架严重依赖外部训练的奖励模型（ORM/PRM），这不仅需要海量的细粒度人工标注数据，还带来了沉重的部署与推理延迟负担 。</p>



<p class="wp-block-paragraph">基于此，我们最新的工作提出了一个新的框架：ConMA ，全称为： Confidence-Guided Kernel Sampling with Multi-Stage Aggregation for LLM Reasoning</p>



<p class="wp-block-paragraph">它的核心思想可以概括为：<strong>彻底摒弃外部验证器，利用大模型内在的置信度信号，将静态的算力预算重组为“过滤-探索-聚合”的动态演化闭环 。</strong></p>



<p class="wp-block-paragraph">也就是说，这项工作不再让模型“蒙着眼睛盲目海投”，而是赋予了它基于自身概率信号的“自审视”能力 。通过置信度核心采样（CKS）尽早剔除劣质噪音 ，利用存活的高质量路径激发多样性探索（DSE），最后将提纯过程转化为多项选择题（MCQ）进行多轮单选迭代（MSA）。它能够根据题目难度自适应地提前停止——在简单题上仅需少量采样即可输出，在难题上则进行深度的逻辑修正 。最终，我们在无需任何外部奖励模型的情况下，让仅有 4B 参数的 Qwen3-4B 模型在 AIME 2025 上达到了 80% 的准确率，并且平均每题仅消耗 18 次采样，大幅超越了 32B 级别的大模型并极大地降低了推理成本 。</p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" style="width: 650px;" src="https://mmbiz.qpic.cn/sz_mmbiz_png/yozlYZeLGPfqJLMib2MndYCRqEicDhMicicQdmmic2Szq7Q4pzcLcjmjPNCYDlOdrMeJalymHG5FXn9rVumwgm2ck80tpxDrm3yCYhjgpPAFV0xI/640?wx_fmt=png&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=3" alt="图片"></p>



<p class="wp-block-paragraph">ConMA 激发了候选集的演化。相比于传统方法在单次采样中浪费大量资源，ConMA 在固定算力预算下，通过迭代修剪低质量路径、从幸存者中生成多样化探索，并利用模型内在的选择能力对下一轮候选集进行优化 。</p>



<p class="wp-block-paragraph">近年来，大语言模型（LLM）的快速进步不仅仅依赖于扩展模型自身的参数量，推理阶段的算力分配（Test-Time Scaling, TTS）也正成为提升复杂推理能力的关键驱动力 。通过在推理预算内采样并聚合多条推理轨迹，小模型也能展现出媲美更大规模模型的表现 。</p>



<p class="wp-block-paragraph">近日，研究团队提出了ConMA（Confidence-guided Multi-stage Aggregation）：一种免训练、无需外部验证器的即插即用TTS 框架。在AIME 2025 挑战集上，搭载该框架的Qwen3-4B模型成功拿下了80.0%的准确率，远超同等算力下的其他强大基线方法，甚至越级打败了32B级别的模型。该工作目前已被ACL 2026 Findings接收。</p>



<p class="wp-block-paragraph"><strong>传统 TTS 困境：</strong></p>



<p class="wp-block-paragraph"><strong>为什么现有方法不够高效？</strong></p>



<p class="wp-block-paragraph">当前主流的 TTS 框架，往往依赖于基于外部验证器（Reward Models）的高级搜索策略，或者主流的基于采样的方法（例如 Best-of-N 和自一致性多数投票） 。尽管取得了经验上的成功，但这种“单次大批量采样（sample once and keep few）”的范式面临着结构性的局限 ：</p>



<p class="wp-block-paragraph">（1）昂贵的外部监督：依赖辅助的奖励模型需要海量细粒度的监督数据进行训练，同时在部署和推理时带来了不可忽视的额外开销。</p>



<p class="wp-block-paragraph">（2）忽视中间高质量轨迹：独立生成轨迹的同质化特征，导致系统无法复用中间高质量的推理线索 。搜索空间被无引导的随机性主导，产生大量冗余或高度聚集的解 。</p>



<p class="wp-block-paragraph">（3）计算资源分配僵化：不区分难度的“单次采样”策略，将大量算力浪费在注定被丢弃的低质量候选答案上 。这导致系统在简单任务上算力超载，而在复杂问题上却因为缺乏迭代优化而遭遇性能瓶颈 。</p>



<p class="wp-block-paragraph"><strong>让模型推理内部信号引导推理：</strong></p>



<p class="wp-block-paragraph"><strong>ConMA的“自我进化”路线</strong></p>



<p class="wp-block-paragraph">为了打破这一瓶颈，ConMA 选择了一条更“内省”的路线：不依赖外部监督，而是重新利用大模型自身的内部不确定性作为引导信号，来协调自适应的推理循环 。整个框架通过三个协同机制运作：</p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" style="width: 650px;" src="https://mmbiz.qpic.cn/mmbiz_png/yozlYZeLGPcJpjuExyMhXxibLAhNiblZrp8KiaTicK0icN1YhicBvHBp9olhnh6gXMkHDGf1JcD3TfvbTw2UpUdAmHz7CzETuSdia5J8Y89XsfOvOM/640?wx_fmt=png&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=6" alt="图片"></p>



<p class="wp-block-paragraph">系统在初始采样后进入协同循环：首先，CKS 利用复合置信度打分修剪低质量答案组；接着，DSE 从核心代表中生成多样化路径以扩展搜索空间；最后，MSA 通过多项选择题（MCQ）形式巩固共识 。</p>



<p class="wp-block-paragraph">（1）置信度引导的核采样（CKS）：不再仅凭输出频率或外部奖励模型打分，CKS 利用基于 token 概率的内在置信度来评估轨迹，并对答案组进行过滤，从而保留一个紧凑的高质量候选“核心（Kernel）”。</p>



<p class="wp-block-paragraph">（2）追求多样性的探索（DSE）：为了打破同质化采样，DSE 以核心代表为条件，引导模型生成具有截然不同推理模式的新轨迹。不仅复用了高质量的中间痕迹，还极大地扩展了搜索空间 。</p>



<p class="wp-block-paragraph">（3）多阶段聚合（MSA）：MSA 是一个节省预算的外层循环。它摒弃了“单次大批量采样”，将总预算 N 划分为小批量轮次 。系统将更新样本池的过程转化为重复的单选多项选择题，选出的轨迹被循环作为下一轮的输入，驱动系统逐步逼近正确答案 。</p>



<p class="wp-block-paragraph"><strong>实验结果</strong></p>



<p class="wp-block-paragraph">研究团队在四个极具挑战性的推理基准（AIME 2024、AIME 2025、AMC 23 和 GPQA-Diamond）上进行了评估，ConMA 均持续优于强大的基线方法 。</p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" src="https://mmbiz.qpic.cn/mmbiz_png/yozlYZeLGPfic3Tj9rtmbCC0LLWS1SATJtzoYXwSUeWiaVTCWBpYcCxklm8wSS4fuzHx1bNOsKicL3wHx7zicl4U5CSjCV1GDAdaLodsQWruROg/640?wx_fmt=png&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=8" alt="图片" style="width: 650px;"></p>



<p class="wp-block-paragraph"><strong>实验证明：</strong></p>



<p class="wp-block-paragraph"><strong>不仅做得更对，还省了70%的算力</strong></p>



<p class="wp-block-paragraph"><strong>越级击败大模型：</strong>在极具挑战的 AIME 2025 数据集上，ConMA 助力 Qwen3-4B 实现了 80.0% 的准确率 。这一成绩大幅领先于参数量大得多的 Qwen3-32B（70.4%）和 QwQ-32B（69.0%） 。类似地，Qwen3-1.7B 结合 ConMA 在 AIME 2024 上达到 72.1%，几乎追平了 4B 基础模型（72.4%）的标准表现 。</p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" style="width: 650px;" src="https://mmbiz.qpic.cn/sz_mmbiz_png/yozlYZeLGPdQGdDX7lXVyczP5E9y4pM5W81glubGoETOAMtI4Daqicmx2KdvNMKExUDWDlr6aIiaCMqSAT9nDRZnnibQuvwicZsFfy2IWKrSJok/640?wx_fmt=png&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=10" alt="图片"></p>



<p class="wp-block-paragraph"><strong>惊人的算力效率：</strong>更加值得一提的是 ConMA 的动态计算分配能力。得益于基于收敛的提前停止机制，系统能够根据任务难度自适应调节计算强度 。在最大预算设定为 64 的情况下，ConMA 在 AIME 2025 上平均仅需 18 次采样就能达到 80% 的峰值性能 。它打破了固定预算基线方法的线性成本依赖，在精准定位最优解的同时，大幅降低了超过 70% 的推理成本 。</p>



<p class="wp-block-paragraph"><strong>共一作者：王一诺 李清洁</strong></p>



<p class="wp-block-paragraph"><strong>王一诺</strong></p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" style="width: 650px;" src="https://mmbiz.qpic.cn/sz_mmbiz_jpg/yozlYZeLGPeBfdq2DPAkhqDUUyY8ZAQMrVNB86kYDQ0zCFacSNWZVdGABvkiaxCZcBIvu6Edx3zXPwg365Ce7Q7De4xS9Dfe2iaMQiaRbib3CkU/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=11" alt="图片"></p>



<p class="wp-block-paragraph"><strong>李清洁</strong></p>



<p class="has-text-align-center wp-block-paragraph"><img decoding="async" style="width: 650px;" src="https://mmbiz.qpic.cn/sz_mmbiz_jpg/yozlYZeLGPeRxkvBxJTwthKVnTwOrSibehNDb8ghhKrOsDNk0tpYN9EGwLVx2gPjhrp1L5yctMU6yY5wPYicQ6GYia1uzhVOhB0hCtvPjIibHws/640?wx_fmt=jpeg&amp;from=appmsg&amp;watermark=1&amp;tp=webp&amp;wxfrom=5&amp;wx_lazy=1#imgIndex=12" alt="图片"></p>
]]></content:encoded>
					
					<wfw:commentRss>http://www.nlpir.org/wordpress/2026/05/21/2092400/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
