Markov Chain Monte Carlo with Diffusion Paths
带扩散路径的马尔可夫链蒙特卡罗
专题命中 多模态生成 :multimodal(abstract)
AI总结 针对多模态分布采样难题,提出沿扩散路径插值的方法,通过变分估计中间得分,引入MAD - Path采样器消除偏差,经谱隙分析明确路径特性,量化误差影响,实验表明其在全局探索和模式权重估计上优于其他方法。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
带扩散路径的马尔可夫链蒙特卡罗
专题命中 多模态生成 :multimodal(abstract)
AI总结 针对多模态分布采样难题,提出沿扩散路径插值的方法,通过变分估计中间得分,引入MAD - Path采样器消除偏差,经谱隙分析明确路径特性,量化误差影响,实验表明其在全局探索和模式权重估计上优于其他方法。
SegDiff:用于一致且自适应机器人操作的分段轨迹扩散
机构 * Institute of Trustworthy Embodied AI, Fudan University, China(可信具身人工智能研究院,复旦大学,中国) ; Shanghai Key Laboratory of Multimodal Embodied AI, China(上海多模态具身人工智能重点实验室,中国)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 研究针对机器人模仿学习中现有方法的不足,提出SegDiff闭环视觉运动策略,分解示范为运动段并预测连续轨迹,利用扩散模型等提出动态时间集成机制,在多场景中性能优于现有方法,能处理长时间依赖并保持实时适应与控制稳定。
通过轻量级流匹配实现大象启发式软躯干运动的全身语义到驱动的基础
专题命中 多模态生成 :multimodal(abstract)
AI总结 针对近距离人机交互中类似躯干机器人关联开放词汇响应难的问题,提出基于轻量级流匹配的全身语义到驱动基础框架,将多模态大语言模型响应转换为元组,参数化轨迹并采样运动,实验显示其提升关联正确性、减少推理时间,还提升了人机交互满意度。
PIER-Flow:用于实时移动机器人导航的物理信息高效整流流
机构 * School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 研究针对移动机器人在复杂环境下导航问题,提出PIER-Flow策略。通过将MPC专家知识融入常微分方程,利用并行潜在采样等实现单步动作生成,经物理信息训练目标及异步架构提升性能,在模拟和实际部署中均取得良好效果,显著加速规划并降低延迟。
基于CBF引导扩散模型的无人机安全轨迹规划
专题命中 多模态生成 :multi-modal(abstract)
AI总结 本文提出AeroTrajGen框架,通过CBF引导采样提升扩散模型在无人机轨迹生成中的安全性与敏捷性,减少碰撞率94.7%。
Comments Some equations need to be checked
通过从正向演示中学习逆向任务进行任务参数外推
机构 * Bogazici University(博雅科技大学) ; University of Trento(特伦托大学) ; The University of Tokyo(东京大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文提出了一种基于任务逆向学习的联合学习方法,通过利用辅助正向演示实现准确且高效的知识转移,以解决机器人学习中的泛化问题。
Comments Accepted for publication in IEEE RA-L
CoGenCast:用于时间序列预测的耦合自回归流生成框架
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 针对时间序列预测需兼顾语义理解与随机建模的问题,提出CoGenCast框架,将预训练大语言模型与流匹配机制结合,通过修改注意力拓扑重配置模型,集成流匹配机制捕捉动态,实现多模态预测和跨域统一训练,实验显示性能具竞争力。
智能人工智能无线接入网络助力协同感知、通信、计算和控制
专题命中 多模态生成 :multimodal(abstract)
AI总结 研究6G低空无线网络中,智能人工智能无线接入网络(Agentic AI-RAN)架构助力协同SC3任务执行。提出面向任务的架构解决资源受限边缘环境异构负载协调难题,经无人机系统原型验证,该框架在6G关键任务低空网络中具可行性。
Comments 7 pages, 5 figures, 1 table; revised version with minor corrections
车内手语语料库(ICSL):用于受限空间手语识别的多模态资源
机构 * Technische Hochschule Ingolstadt (THI)(因戈尔施塔特技术大学) ; Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学) ; Universidade de São Paulo (USP)(圣保罗大学)
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
AI总结 研究共享出行服务中受限空间的手语识别挑战,提出ICSL数据集,含高精度实验室数据和现实多模态车内记录,为相关比较分析提供基础,描述了语料库多方面细节,助力提升聋人社区公共交通可达性及乘客生活质量。
Comments Published in the Proceedings of the LREC2026 12th Workshop on the Representation and Processing of Sign Languages: Language in Motion Original publication: https://www.sign-lang.uni-hamburg.de/lrec/pub/26.html The paper is distributed under the CC BY-NC 4.0 license. Link to paper: https://www.sign-lang.uni-hamburg.de/lrec/pub/26033.html
Journal ref Proceedings of the LREC2026 12th Workshop on the Representation and Processing of Sign Languages: Language in Motion
ProAct:用于结构感知主动响应的基准和多模态框架
机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST), Hong Kong SAR, China(香港科技大学计算机科学与工程系) ; Tencent, Shenzhen, China(腾讯(中国深圳)) ; Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究所(SIAT),中国科学院)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract)
AI总结 针对主动智能体开发受资源缺乏阻碍的问题,引入ProAct-75基准,提出由多模态大语言模型驱动的ProAct-Helper,其利用任务图进行行动选择,实验证明该方法在触发检测等方面优于闭源模型。
SpurLens:多模态大语言模型中虚假线索的自动检测
机构 * Department of Computer Science University of Maryland(计算机科学系大学马里兰大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 研究多模态大语言模型中虚假偏差,介绍SpurLens管道,利用GPT-4和开放集目标检测器自动识别虚假视觉线索,揭示虚假关联导致的两种失败模式,验证发现并探索缓解策略,呼吁提高评估方法和策略以增强MLLMs可靠性。
用于能源领域大语言模型应用的多模态数据集
机构 * UBITECH
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 介绍mAIEnergy多模态数据集,整合文本、图像、时间序列及地理空间等数据,统一为结构化格式并伴有元数据与工作流程,可作能源知识库,遵循FAIR原则,助力能源领域大语言模型应用的研究、建模和决策。
用于运动评估的多模态脑电-惯性测量单元融合:利用任务相关互补性提高鲁棒性
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 研究针对运动障碍评估中多传感模式整合不足问题,通过同步记录脑电-惯性测量单元数据,评估特定任务模态性能和多模态融合。结果表明脑电和惯性测量单元各有优势,后期融合可利用互补性提高评估可靠性,为大规模临床验证提供依据。
将物理信息神经网络与3D血管几何学习相结合用于脑动脉瘤检测和多模态破裂风险预测
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 研究旨在结合物理信息神经网络与3D血管几何学习用于脑动脉瘤检测及多模态破裂风险预测。通过基于PointNeXt的检测器识别动脉瘤,利用物理信息神经网络生成血流动力学描述符,多模态模型整合多种变量预测风险,取得良好检测及预测效果,提供了定量多模态评估策略。
人工智能在心脏淀粉样变性诊断途径中的应用:从单模态检测到多模态临床整合
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 研究心脏淀粉样变性诊断中人工智能的应用,按筛查、检测等临床任务综合相关研究,揭示其成熟度梯度,骨闪烁显像和SPECT/CT的二元检测及量化接近临床转化,亚型识别等任务尚处早期。
Comments Diana Shadibaeva and Rochak Dhakal contributed equally to this work. Total Pages = 35, No. of Figures = 4, No. of Tables on Manuscript = 1, Supplementary Tables = 6
NSF未来制造数据挑战:用于激光轨迹中概率局部几何预测的多模态DED数据集
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 该研究针对NSF未来制造数据挑战,引入多模态DED数据集预测激光轨迹局部几何变化,包含热图像序列、SEM图像和高度图三种模态,在不同激光功率下进行实验,发布相关代码及坐标约定。
Comments 4 pages, 2 figures
具有多模态、多任务、多轮对话的设备-云协作大语言模型推理
机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) ; Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) ; Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)
专题命中 多模态评测 :multi-modal(title,abstract)
AI总结 研究大语言模型部署挑战,设计TMO设备-云推理系统,结合轻量级设备LLM和大规模云LLM,开发资源受限强化学习策略优化推理,贡献M4A1数据集,实验证明TMO在延迟、成本和响应质量方面效果显著。
Comments ACM MobiHoc 2025 (Best Paper Runner-Up) -> IEEE/ACM Transactions on Networking (extended journal version)
HEART-Watch:来自谷歌Pixel手表的不同身体状态下的多模态生理数据集
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 针对消费级智能手表心血管监测算法开发缺现实多样数据的问题,提出HEART-Watch多模态生理数据集,涵盖40名健康成年人三种身体状态下的多种信号及血压测量值,以支持相关算法开发与基准测试。
你的简答题VQA分数实际衡量的是什么?多模态简答题基准中依赖评估者的不稳定性
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.MM
AI总结 研究简答题VQA基准中模型答案语义正确性与和评估者期望表面形式匹配度被混淆的问题,通过人工验证语义判断等方法研究六个视觉语言模型和六个基准,发现答案类型影响不稳定性,提出官方分数应伴有语义审计和答案类型诊断以保持可解释性。
CLIR-Bench:针对不规则临床时间序列的多模态问答基准测试
机构 * Shandong University(山东大学) ; University of Auckland(奥克兰大学)
专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI
AI总结 研究针对临床时间序列稀疏、不规则等问题,引入CLIR-Bench基准,通过四阶段流程构建,含6600个问答实例。实验发现现有通用模型处理稀疏临床证据困难,强调需更强不规则时间序列推理方法。
UniLM-Nav:零样本最后一英里导航的统一框架
机构 * Tsinghua University(清华大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peking University(北京大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)
AI总结 研究移动操作中最后一英里导航问题,提出UniLM-Nav统一框架,通过多模态大语言模型后端分解任务为视图选择、功能接地和姿态推理,在OVMM基准上优于现有方法,还验证了在实际机器人上的适用性。
Comments Project page: https://unilm-nav.github.io
IntentVLA:用于有歧义机器人操作的短周期意图建模
机构 * HUST(华中科技大学) ; ZGCA(中钢集团人工智能研究院) ; ZGCI(中钢智能科技有限公司) ; HIT(哈尔滨工业大学) ; HKUST(GZ)(香港科技大学(广州)) ; BUAA(北京航空航天大学) ; ZZU(浙江工业大学) ; ECNU(华东师范大学) ; USTC(中国科学技术大学) ; DeepCybo
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。
Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA
关于CVPR 2026@AdvML研讨会挑战赛的技术报告
机构 * Beihang University(北京航空航天大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Tongji University(同济大学) ; iFLYTEK Co., Ltd.(科大讯飞股份有限公司) ; Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) ; Wenzhou Business College(温州商学院) ; Jiangnan University(江南大学) ; Guangzhou City University of Technology(广州理工学院) ; Inceptio Technology(智元机器) ; Institute of Dataspace(数据空间研究所) ; Zhongguancun Laboratory(中关村实验室) ; Tsinghua University(清华大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Oxford(牛津大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; BAAI(北京智源人工智能研究院) ; Meta ; Johns Hopkins University(约翰·霍普金斯大学) ; University of California, Berkeley(加州大学伯克利分校) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。
ChartSync:视觉逻辑级联图表编辑的基准测试
机构 * Jianghan University(江汉大学) ; HiThink Research(海思睿研) ; University of Science and Technology of China(中国科学技术大学) ; Southeast University(东南大学) ; Zhejiang University(浙江大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。
4DR360:用于4D雷达-相机全场景感知中联合3D检测和占用预测的状态推理
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对4D雷达-相机全场景感知,提出\method框架,遵循跨模态状态推理范式,通过状态引导的BEV增强和多普勒引导的时间融合进行联合3D检测和占用预测,扩展数据集并实验,提升多任务学习效果。
Comments 5 pages, 8 figures
阿格斯能评判一切吗?跨领域比较视觉语言模型
机构 * Bharati Vidyapeeth(巴哈提大学) ; Macquarie University(麦考瑞大学) ; DSEU-Okhla ; Vivekananda Institute of Professional Studies(维维kananda专业研究学院) ; IIIT-Delhi(德里印度理工学院) ; Center for SDGC(SDGC中心) ; Stanford University(斯坦福大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 研究跨领域视觉语言模型,提出ARGUS-EVAL评估框架,通过多种指标刻画模型行为,评估多个模型在下游任务表现,发现能力与可靠性导向排名有显著差异,如Qwen-2.5VL-3B-Instruct能力强,CLIP延迟和内存占用低。
CHM-Net:基于中心热图驱动的宏观-微观建模网络用于基于MRI的微生物密度分层
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; School of Future Technology(未来技术学院) ; Department of Medical Imaging(医学影像科) ; Affiliated Cancer Hospital, Guangzhou Medical University(广州医学院附属癌症医院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 研究基于MRI的微生物密度分层,提出CHM-Net,通过中心热图引导小病变反应定位,构建宏观-微观证据预测微生物密度,在GBNPC 2026数据集上验证有效性,在两个3D医学图像数据集上证实鲁棒性。
Claude Fable 5在生物医学挑战问题上的能力
机构 * School of Computing, University of Georgia(佐治亚大学计算学院) ; Department of Chemistry, University of Illinois(伊利诺伊大学化学系) ; Institute of Bioinformatics, University of Georgia(佐治亚大学生物信息学研究所)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 研究评估Claude Fable 5在八个生物医学基准上的能力,以确定性评分针对固定答案键评估,含两个Claude前身和GPT-5作基线。发现Fable 5拒绝率因基准而异,排除拒绝项后准确率超其他模型,还识别出两种拒绝模式,其生物医学应用主要受限在参与意愿。
Comments 15 pages, 6 tables, 4 figures, appendix with qualitative examples
通过虚拟模态合成将大型多模态模型推广到通用视觉模态
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 研究大型多模态模型推广到未见视觉模态的挑战,提出VVM-Tuning训练框架,通过模态合成和上下文让模型具备相关能力,引入VVM-Bench基准,实验证明经合成模态训练的模型在多模态上有改进且无需模态内训练。
Comments Accepted by the European Conference on Computer Vision (ECCV) 2026
迈向现实世界的可穿戴运动重建
机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ; Saarbrücken Research Center for Visual Computing, Interaction and AI(萨尔布吕肯视觉计算、交互与人工智能研究中心) ; Google(谷歌)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 研究可穿戴设备运动捕捉问题,提出优先考虑轻便设备。贡献包括提供多模态数据集,提出WHIP模型,研究传感器互补性,以实现从任意传感器子集重建运动,处理缺失模态并生成合理运动。
Comments Accepted at ECCV 2026