快讯
近日,自然语言处理领域国际顶级会议 Conference on Empirical Methods in Natural Language Processing(EMNLP)公布论文录用结果,NLPIR实验室共有4篇论文被接收。相关研究覆盖大语言模型推理、音频语言模型、多模态理解、时间认知推理、开放关系抽取等方向,展现了实验室在认知智能、大模型与多模态人工智能领域的持续探索与创新能力。以下为入选论文介绍。
论文一
论文题目:Is the Future Predictable? Modeling Future Predictability for Reliable Temporal Reasoning
论文作者:黄咏仪 张华平 崔文耀 李秋池 李磊 张宝华
作者单位:北京理工大学
论文概述:大语言模型(LLMs)在进行未来推理时仍然存在可靠性不足的问题。现有模型通常忽视不同未来状态之间的差异,即使所查询的事实本身具有高度不确定性,模型仍然会给出确定性的答案。为应对这一挑战,本文提出了 ChronoRegime,一种面向未来的时间推理任务,要求模型判断:已有的历史时间证据是否足以支持对未来答案做出确定性判断。此外,本文提出了 置信感知时间推理框架(Confidence-Aware Temporal Reasoning, CTR)。该框架通过分析时间演化规律来评估未来状态的可预测性,并据此调节模型是否应该对答案做出承诺。与无条件地进行未来预测不同,CTR仅在重构后的证据能够支持目标未来状态时才给出确定性预测。在多个大语言模型上的实验表明,与普通问答基线方法相比,CTR使严格总体准确率平均提升 6.7个百分点,并使幻觉率平均降低 18.4个百分点。实验结果证明,显式评估未来事件的可预测性,是提升未来不确定环境下时间推理安全性和可靠性的有效机制。
论文二
论文题目:Learning to Explore the Crux in Formal Theorem Proving
论文作者:李林翰 崔文耀 张公铎 顾立宏 周琳 商建云 张华平
作者单位:北京理工大学、蚂蚁集团
论文概述:作者提出了一种面向形式化定理证明的基于熵的最佳优先搜索算法(Entropy-Based Best-First Search, EBFS),针对Lean形式化证明过程中不同推理步骤难度和重要性不均衡的问题,从熵的视角识别证明树中更值得探索的关键步骤,并据此优化证明搜索过程,使证明生成模型能够在有限搜索预算下更高效地探索证明空间,提高找到正确证明的概率。在此基础上,作者进一步提出了面向证明树搜索的强化微调方法,并在生成阶段结合EBFS进一步提升模型的形式化证明能力。实验结果表明,在相同采样预算下,该方法相较于完整证明生成基线,在ProofNet测试集上提升3.2%,并在MiniF2F和ProverBench上分别提升1.9%和1.5%,验证了该方法在形式化定理证明搜索效率和证明成功率方面的有效性。
论文三
论文题目:Modality-Specific Gating for Large Audio-Language Models
论文作者:任珍妮 王娟 李秋池 李磊 高春晓 张宝华 张华平
作者单位:北京理工大学
论文概述:大型音频语言模型(Large Audio-Language Models, LALMs)近年来在音频-文本指令理解和多模态交互方面取得了显著进展。然而,由于其采用文本条件生成架构,当前的LALM往往会受到输入文本提示的过度影响。当声学证据与文本提示发生冲突时,错误或无关的文本信息可能会引导模型偏离真实的音频内容,导致预测结果错误。本文系统分析了这一问题,并发现具有代表性的LALM在生成过程中存在持续性的音频-文本模态失衡现象:随着生成步骤推进,模型对音频token的关注程度逐渐减弱。为解决这一失衡问题,本文提出了模态特定门控机制(Modality-Specific Gating, MSG)。该方法是一种声学校准机制,仅引入少量额外参数,即可增强模型对音频信息的感知能力。具体而言,MSG在softmax计算之前,针对音频token的注意力logit引入一种基于查询条件(query-conditioned)的逐token偏置(token-wise bias),从而提升音频信息在注意力计算中的权重,同时保持原有注意力计算过程不变。通过参数高效微调(parameter-efficient fine-tuning),MSG能够增强模型对声学证据的利用能力,使其在声音分类(vocal sound classification)和语音情感识别(speech emotion recognition)任务中持续获得性能提升,并且在面对对抗性文本提示或无关文本提示时表现出更强的鲁棒性。
论文四
论文题目:Distributional Recalibration for Zero-Shot Relation Extraction
论文作者:刘永鑫 张华平 李秋池 李磊 高春晓 吕浩成 严若豪 张宝华
作者单位:北京理工大学 新疆大学
论文概述:基于联合编码(joint-encoding)的零样本关系抽取方法能够在一次Transformer前向传播中对所有候选关系标签进行分类,因此兼具较高的准确率和推理效率。然而,在完整关系词表规模(full-vocabulary scale)下,该方法会暴露出两类分布性问题:一方面,未归一化的点积评分(unnormalized dot-product scoring)会导致召回坍缩(recall collapse),使部分关系类型无法被模型预测;另一方面,实例级二元交叉熵损失(per-instance BCE loss)会导致真实类别与负类别评分分布严重混叠,难以确定可靠阈值,造成置信度歧义(confidence ambiguity)。针对上述问题,本文提出了SCAR(Stabilized Cascade and Alignment for Robust joint-encoding ZSRE)方法。该方法保持原有基线模型结构不变,通过两个经过稳定化设计的辅助分支对评分分布和表示分布进行重新校准:一是基于梯度隔离的粗到细级联模块,通过Z-score归一化调整关系评分分布,缓解召回坍缩问题;二是仅用于训练阶段的对比对齐模块,通过优化关系表示空间,提高不同关系类别之间的区分能力。在Wiki-ZSL数据集(候选关系数量 m=15)上的实验结果表明,SCAR将Macro F1指标从75.9%提升至83.0%,并将零召回关系类型数量从35类降低至1类。实验结果说明,传统的小规模候选关系评测协议可能会掩盖大规模关系词表部署中的关键失效模式,而SCAR能够有效提升零样本关系抽取方法在开放环境下的稳定性和可靠性。