<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>多模态</title>
	<atom:link href="http://www.nlpir.org/wordpress/category/%E5%A4%9A%E6%A8%A1%E6%80%81/feed/" rel="self" type="application/rss+xml" />
	<link>http://www.nlpir.org/wordpress</link>
	<description></description>
	<lastBuildDate>Thu, 30 Jul 2026 12:12:36 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.3</generator>

<image>
	<url>http://www.nlpir.org/wordpress/wp-content/uploads/2018/12/logo1.gif</url>
	<title>多模态</title>
	<link>http://www.nlpir.org/wordpress</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>项目启动！NLPIR实验室参与丽江壁画遗产数字化保护与活化利用研究，探索多模态大模型赋能文化遗产新路径</title>
		<link>http://www.nlpir.org/wordpress/2026/07/30/%e9%a1%b9%e7%9b%ae%e5%90%af%e5%8a%a8%ef%bc%81nlpir%e5%ae%9e%e9%aa%8c%e5%ae%a4%e5%8f%82%e4%b8%8e%e4%b8%bd%e6%b1%9f%e5%a3%81%e7%94%bb%e9%81%97%e4%ba%a7%e6%95%b0%e5%ad%97%e5%8c%96%e4%bf%9d%e6%8a%a4/</link>
					<comments>http://www.nlpir.org/wordpress/2026/07/30/%e9%a1%b9%e7%9b%ae%e5%90%af%e5%8a%a8%ef%bc%81nlpir%e5%ae%9e%e9%aa%8c%e5%ae%a4%e5%8f%82%e4%b8%8e%e4%b8%bd%e6%b1%9f%e5%a3%81%e7%94%bb%e9%81%97%e4%ba%a7%e6%95%b0%e5%ad%97%e5%8c%96%e4%bf%9d%e6%8a%a4/#respond</comments>
		
		<dc:creator><![CDATA[nlpir]]></dc:creator>
		<pubDate>Thu, 30 Jul 2026 12:12:36 +0000</pubDate>
				<category><![CDATA[Update动态]]></category>
		<category><![CDATA[多模态]]></category>
		<guid isPermaLink="false">http://www.nlpir.org/wordpress/?p=3141977</guid>

					<description><![CDATA[近日，云南省重点研发计划社会发展专项《多模态大模型驱动的文化遗产旅游活化关键技术 &#8230; <a href="http://www.nlpir.org/wordpress/2026/07/30/%e9%a1%b9%e7%9b%ae%e5%90%af%e5%8a%a8%ef%bc%81nlpir%e5%ae%9e%e9%aa%8c%e5%ae%a4%e5%8f%82%e4%b8%8e%e4%b8%bd%e6%b1%9f%e5%a3%81%e7%94%bb%e9%81%97%e4%ba%a7%e6%95%b0%e5%ad%97%e5%8c%96%e4%bf%9d%e6%8a%a4/">继续阅读 <span class="meta-nav">&#8594;</span></a>]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">近日，云南省重点研发计划社会发展专项《多模态大模型驱动的文化遗产旅游活化关键技术与应用示范研究》项目启动会在黑龙潭公园牡丹苑召开。区委常委、大研街道党工委书记李凤龙，市科技局、区文旅局、区科技局、区旅投公司相关负责人及项目技术支持高校代表参加了会议。</p>



<figure class="wp-block-image"><img decoding="async" src="https://mmbiz.qpic.cn/mmbiz_jpg/yozlYZeLGPf3XIgjKg1EOrgNTtXBoe3PMRfZZAW3Jpc3IUBq8VnA3bYia6xCWl7icQw8XVyIRUTtU50DlV5fia410RK8xJMvMW4Z1om1X5PNdc/640?wx_fmt=jpeg&amp;from=appmsg&amp;wxfrom=5&amp;watermark=1&amp;tp=webp&amp;wx_lazy=1#imgIndex=1" alt="图片"/></figure>



<p class="wp-block-paragraph">该项目由云南师范大学地理学部牵头，北京理工大学计算机学院、北京大学城市与环境学院作为技术支持单位，丽江市科学技术局、丽江市古城区旅游投资开发有限公司共同协作，以丽江现存明清壁画为核心研究载体，依托多模态大模型前沿数字技术，推进文物保护、遗产活化与文旅业态创新，开启丽江壁画遗产数字化保护与活化利用新阶段。</p>



<figure class="wp-block-image"><img decoding="async" src="https://mmbiz.qpic.cn/mmbiz_jpg/yozlYZeLGPcCM9wbvUh7kxzQmoxviauSicQk2hzvRuiabuibN03beVrPCg6tjGMvTInjZjMwCW8qEDtr6It0w9rmjaBvVLMOzHOy95faoGG0qR0/640?wx_fmt=jpeg&amp;from=appmsg&amp;wxfrom=5&amp;wx_lazy=1&amp;watermark=1&amp;tp=webp#imgIndex=2" alt="图片"/></figure>



<p class="wp-block-paragraph">启动会上，项目负责人、云南师范大学地理学部陈亚颦教授代表项目组介绍了项目研究背景、实施方案、任务分解与预期成果。据介绍，项目将立足地方文旅运营实际，以多模态大模型、高清数字采集、AI智慧讲解等前沿技术为支撑，规划建设沉浸式数字体验场景，推动文化遗产数字化保护与旅游活化融合发展。</p>



<p class="wp-block-paragraph">北京理工大学计算机学院张华平教授团队围绕核心技术研发任务汇报了技术方案与实施思考，提出了构建覆盖数据、知识、模型、智能体、仿真与应用六层的技术体系，拟打造数字孪生、高清细节探索、题材叙事、多教融合思想体系、人物智能体沉浸导览等五类场景，并建立数据分级、事实观点分层、模型安全测试及专家审核的多层保障机制。由北京大学城市与环境学院院长彭建教授领衔的团队阐述了理论建构方案，将为项目提供文化遗产学、旅游地理学与数字人文领域的支撑，并重点参与价值阐释与体验转化研究。</p>



<p class="wp-block-paragraph">作为项目技术支持单位，北京理工大学计算机学院NLPIR实验室张华平教授团队承担项目核心技术研发工作，围绕多模态大模型驱动的文化遗产智能化保护与活化利用开展技术攻关。</p>



<figure class="wp-block-image"><img decoding="async" src="https://mmbiz.qpic.cn/sz_mmbiz_jpg/yozlYZeLGPctwL9n9PTyPja1sfMRibNiaxogxcJaVRpdd7SdSDcibiaGUc40Xbu6hmJru3Vgp2gFAicLlOhmE7AyiaaQlgOHluflJcVkTpY6nT0lo/640?wx_fmt=jpeg&amp;from=appmsg&amp;wxfrom=5&amp;wx_lazy=1&amp;watermark=1&amp;tp=webp#imgIndex=3" alt="图片"/></figure>



<p class="wp-block-paragraph">与会各单位负责人表示将全力配合项目落地，提供好材料收集、科研管理及配套服务，做好行政协调与政策保障，积极为项目落地提供从资源归集、场地配套到后期运营管理的全链条属地保障。</p>



<p class="wp-block-paragraph">启动会结束后，参会人员一行前往束河古镇茶马古道博物馆大觉宫壁画开展实地踏勘调研，针对高清数据采集、数字场景复刻、沉浸式体验搭建等核心环节进行了现场技术论证。</p>



<figure class="wp-block-image"><img decoding="async" src="https://mmbiz.qpic.cn/sz_mmbiz_jpg/yozlYZeLGPckFX90XLAVvNeAibaAcgVSPlPX7KBhgFsiaapTK6lLXoc6pACicXBdO7g7QmUdWuynDXoouRut3q1LiaQoMrTl8DWCULDoicfqCbA0/640?wx_fmt=jpeg&amp;from=appmsg&amp;wxfrom=5&amp;wx_lazy=1&amp;watermark=1&amp;tp=webp#imgIndex=4" alt="图片"/></figure>



<p class="wp-block-paragraph">未来，NLPIR实验室将持续探索自然语言处理、多模态大模型与文化遗产数字化融合的新方向，推动人工智能技术服务文化保护、知识传播与产业创新，为我国文化遗产数字化发展贡献科技力量。</p>
]]></content:encoded>
					
					<wfw:commentRss>http://www.nlpir.org/wordpress/2026/07/30/%e9%a1%b9%e7%9b%ae%e5%90%af%e5%8a%a8%ef%bc%81nlpir%e5%ae%9e%e9%aa%8c%e5%ae%a4%e5%8f%82%e4%b8%8e%e4%b8%bd%e6%b1%9f%e5%a3%81%e7%94%bb%e9%81%97%e4%ba%a7%e6%95%b0%e5%ad%97%e5%8c%96%e4%bf%9d%e6%8a%a4/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>复杂场景下多人3D人体运动重建取得新进展（CVPR 2026）</title>
		<link>http://www.nlpir.org/wordpress/2026/04/14/%e5%8c%97%e4%ba%ac%e7%90%86%e5%b7%a5%e5%a4%a7%e5%ad%a6%e8%81%94%e5%90%88%e5%8d%8e%e7%9b%9b%e9%a1%bf%e5%a4%a7%e5%ad%a6%e3%80%81%e5%ae%89%e5%be%bd%e5%a4%a7%e5%ad%a6%e7%ad%89%e6%8f%90%e5%87%baram/</link>
					<comments>http://www.nlpir.org/wordpress/2026/04/14/%e5%8c%97%e4%ba%ac%e7%90%86%e5%b7%a5%e5%a4%a7%e5%ad%a6%e8%81%94%e5%90%88%e5%8d%8e%e7%9b%9b%e9%a1%bf%e5%a4%a7%e5%ad%a6%e3%80%81%e5%ae%89%e5%be%bd%e5%a4%a7%e5%ad%a6%e7%ad%89%e6%8f%90%e5%87%baram/#respond</comments>
		
		<dc:creator><![CDATA[nlpir]]></dc:creator>
		<pubDate>Tue, 14 Apr 2026 02:44:24 +0000</pubDate>
				<category><![CDATA[Paper论文]]></category>
		<category><![CDATA[Update动态]]></category>
		<category><![CDATA[多模态]]></category>
		<guid isPermaLink="false">http://www.nlpir.org/wordpress/?p=1347999</guid>

					<description><![CDATA[视频是人类理解现实世界的重要载体。相较于静态图像，视频不仅包含丰富的空间结构信息 &#8230; <a href="http://www.nlpir.org/wordpress/2026/04/14/%e5%8c%97%e4%ba%ac%e7%90%86%e5%b7%a5%e5%a4%a7%e5%ad%a6%e8%81%94%e5%90%88%e5%8d%8e%e7%9b%9b%e9%a1%bf%e5%a4%a7%e5%ad%a6%e3%80%81%e5%ae%89%e5%be%bd%e5%a4%a7%e5%ad%a6%e7%ad%89%e6%8f%90%e5%87%baram/">继续阅读 <span class="meta-nav">&#8594;</span></a>]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-video"><video height="2160" style="aspect-ratio: 3838 / 2160;" width="3838" controls src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/cb2fd51db5c95c8358017b6fc9701d18_raw.mp4"></video></figure>



<p class="wp-block-paragraph">视频是人类理解现实世界的重要载体。相较于静态图像，视频不仅包含丰富的空间结构信息，还蕴含连续的时间动态与交互关系。如何从视频中准确理解人体运动，并在三维空间中进行连续、稳定的建模，一直是计算机视觉领域的重要研究方向之一。</p>



<p class="wp-block-paragraph">近年来，单目视频3D人体重建技术取得了显著进展，使得从普通视频中恢复人体姿态成为可能。然而，在真实场景（in-the-wild）中，该任务仍面临诸多挑战。例如，在多人交互场景中，频繁的遮挡、快速运动以及视角变化，往往会导致身份关联不稳定、运动轨迹中断以及三维重建结果不连续等问题，严重制约了相关技术的实际应用。</p>



<p class="wp-block-paragraph">针对上述问题，北京理工大学联合华盛顿大学、安徽大学等研究机构，提出了一种面向复杂真实场景的多人三维人体运动恢复方法RAM（Recover Any Motion）。相关研究成果以论文《RAM: Recover Any 3D Human Motion in-the-Wild》被计算机视觉领域顶级会议CVPR 2026接收。</p>



<figure class="wp-block-image size-large"><img fetchpriority="high" decoding="async" width="1024" height="259" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/1-1024x259.png" alt="" class="wp-image-1348001" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/1-1024x259.png 1024w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/1-300x76.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/1-768x194.png 768w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/1-1536x389.png 1536w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/1-2048x518.png 2048w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/1.png 1200w" sizes="(max-width: 1024px) 100vw, 1024px" /></figure>



<p class="wp-block-paragraph">与传统方法将“目标跟踪”与“三维重建”相对独立处理不同，RAM从整体视角出发，构建了一个统一框架，将运动感知跟踪、时序建模与动作预测有机融合，使模型能够在时间维度上形成更加完整的动态理解能力。该方法不仅关注当前帧的观测信息，还能够结合历史信息进行记忆建模，并对未来运动状态进行合理预测，从而显著提升系统在复杂场景下的鲁棒性与稳定性。</p>



<figure class="wp-block-image size-large"><img decoding="async" width="1024" height="693" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/2-1024x693.png" alt="" class="wp-image-1348003" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/2-1024x693.png 1024w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/2-300x203.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/2-768x519.png 768w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/2.png 1270w" sizes="(max-width: 1024px) 100vw, 1024px" /></figure>



<p class="wp-block-paragraph">在具体方法设计上，RAM主要包含四个关键模块。首先，在跟踪阶段，研究团队提出了SegFollow模块，通过引入基于卡尔曼滤波的运动建模机制，将运动一致性信息融入目标关联过程，使模型在遮挡或外观变化明显的情况下，依然能够保持稳定的身份跟踪。这一设计有效缓解了传统方法对外观特征过度依赖的问题。</p>



<p class="wp-block-paragraph">在三维重建阶段，RAM设计了基于时间记忆机制的T-HMR模块。该模块通过从邻近帧中筛选关键特征，并利用Transformer结构进行跨时间信息融合，使模型在当前帧信息不完整或存在噪声时，仍能够生成平滑且一致的三维人体结构。这种基于时序上下文的建模方式显著提升了重建结果的连续性与稳定性。</p>



<p class="wp-block-paragraph">此外，为了应对目标被完全遮挡等极端情况，RAM进一步引入了动作预测模块。该模块基于历史运动序列对人体动态进行建模，并对未来姿态进行预测，从而在当前观测信息缺失时，仍能够维持运动序列的连续性。</p>



<figure class="wp-block-image size-large"><img decoding="async" width="1024" height="732" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/3-1024x732.png" alt="" class="wp-image-1348006" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/3-1024x732.png 1024w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/3-300x214.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/3-768x549.png 768w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/3.png 1188w" sizes="(max-width: 1024px) 100vw, 1024px" /></figure>



<p class="wp-block-paragraph">在此基础上，研究团队设计了融合模块，对当前帧重建结果与预测结果进行自适应加权。该模块能够根据观测信息的可靠性动态调整两者的权重，在不同场景下实现最优融合，从而进一步提升整体系统的稳定性与重建精度。</p>



<p class="wp-block-paragraph">实验结果表明，RAM在多个国际主流数据集上均取得了优异表现。在PoseTrack等复杂场景数据集上，该方法在身份一致性、跟踪稳定性以及三维重建精度等方面均显著优于现有方法。值得注意的是，在无需针对目标数据集进行额外训练的情况下（zero-shot设置），RAM依然能够取得领先性能，体现了其良好的泛化能力与应用潜力。</p>



<figure class="wp-block-image size-large"><img loading="lazy" decoding="async" width="1024" height="562" src="http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/4-1024x562.png" alt="" class="wp-image-1348008" srcset="http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/4-1024x562.png 1024w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/4-300x165.png 300w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/4-768x422.png 768w, http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/4.png 1200w" sizes="(max-width: 1024px) 100vw, 1024px" /></figure>



<p class="wp-block-paragraph">从研究意义上看，该工作不仅推动了多人三维人体运动重建技术的发展，也为视频理解任务提供了新的研究思路。通过引入时间记忆与动作预测机制，模型实现了从“逐帧处理”向“时序建模”的转变，更接近真实世界中的动态认知过程。这一方向对于体育分析、虚拟现实、人机交互以及医疗康复等应用领域具有重要潜在价值。</p>



<p class="wp-block-paragraph">未来，研究团队将进一步探索更长时间尺度下的复杂交互建模问题，并推动相关技术在实际场景中的应用落地。</p>
]]></content:encoded>
					
					<wfw:commentRss>http://www.nlpir.org/wordpress/2026/04/14/%e5%8c%97%e4%ba%ac%e7%90%86%e5%b7%a5%e5%a4%a7%e5%ad%a6%e8%81%94%e5%90%88%e5%8d%8e%e7%9b%9b%e9%a1%bf%e5%a4%a7%e5%ad%a6%e3%80%81%e5%ae%89%e5%be%bd%e5%a4%a7%e5%ad%a6%e7%ad%89%e6%8f%90%e5%87%baram/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		<enclosure url="http://www.nlpir.org/wordpress/wp-content/uploads/2026/04/cb2fd51db5c95c8358017b6fc9701d18_raw.mp4" length="242258304" type="video/mp4" />

			</item>
	</channel>
</rss>
