arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-15 至 2026-04-15 共收录 78 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 5 篇

2604.12622 2026-04-15 cs.CV cs.AI cs.NI 62%

Efficient Semantic Image Communication for Traffic Monitoring at the Edge

边缘交通监控中的高效语义图像通信

Damir Assylbek, Nurmukhammed Aitymbetov, Marko Ristin, Dimitrios Zorbas

机构 * Nazarbayev University, School of Engineering & Digital Sciences(纳扎尔拜耶夫大学工程与数字科学学院) Zurich University of Applied Sciences (ZHAW)(苏黎世应用科学大学(ZHAW))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMSD和SAMR两种语义图像通信管道,通过压缩和加密实现高效传输,同时保持视觉信息。MMSD用语义表示替代原始图像,SAMR通过语义重要性选择性抑制区域,两者均采用边缘轻量处理与服务器重计算的异构架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12353 2026-04-15 cs.CV 57%

Combating Pattern and Content Bias: Adversarial Feature Learning for Generalized AI-Generated Image Detection

对抗模式与内容偏差:面向通用AI生成图像检测的对抗性特征学习

Haifeng Zhang, Qinghui He, Xiuli Bi, Bo Liu, Chi-Man Pun, Bin Xiao

机构 * Chongqing Key Laboratory of Image Cognition, School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆图像认知重点实验室,重庆邮电大学计算机科学与技术学院) Faculty of Science and Technology of the University of Macau(澳门大学科学与技术学院) Jinan Inspur Data Technology Co., Ltd.(济南 Inspur 数据科技有限公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MAFL框架,通过对抗性学习减少生成图像检测中的模式与内容偏差,提升跨模型泛化能力,实验表明其在准确率和AP上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08209 2026-04-15 cs.CL 57%

Generation-Augmented Generation: A Plug-and-Play Framework for Private Knowledge Injection in Large Language Models

生成增强生成:一种用于大语言模型私有知识注入的即插即用框架

Rongji Li, Jian Xu, Yi Chen, Xueqing Chen, Yisheng Yang, Jiayi Wang, Xingyu Chen, Chunyu Xie, Dawei Leng, Xu-Yao Zhang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) AI Research(360人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文提出GAG框架,通过将私有专业知识作为辅助模态注入冻结的基础模型,解决私有知识注入中的效率与效果平衡问题,在科学和通用领域问答中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12992 2026-04-15 stat.ML cs.LG econ.EM 50%

Causal Diffusion Models for Counterfactual Outcome Distributions in Longitudinal Data

因果扩散模型用于纵向数据中的反事实结果分布

Farbod Alinezhad, Jianfei Cao, Gary J. Young, Brady Post

机构 * Department of Economics, Northeastern University(东北大学经济学系) Center for Health Policy and Healthcare Research, Northeastern University(东北大学健康政策与医疗研究中心) Department of Public Health and Health Sciences, Bouvé College of Health Sciences, Northeastern University(东北大学布维健康科学学院公共卫生与健康科学系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出因果扩散模型,用于生成在连续干预下的反事实结果分布,通过新颖的残差去噪架构和关系自注意力机制,提升了复杂时间依赖性和多模态结果轨迹的捕捉能力,同时在高混杂环境下实现了更高的分布准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 11 篇

2603.29977 2026-04-15 cs.LG cs.AI q-bio.QM 88%

Quantifying Cross-Modal Interactions in Multimodal Glioma Survival Prediction via InterSHAP: Evidence for Additive Signal Integration

通过InterSHAP量化多模态胶质瘤生存预测中的跨模态交互:证据显示信号整合是加性的

Iain Swift, JingHua Ye, Ruairi O'Reilly

机构 * Department of Computer Science, Munster Technological University, Cork, Ireland(莫斯堡技术大学计算机科学系,爱尔兰科克)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 本文通过InterSHAP评估多模态深度学习在胶质瘤生存预测中的跨模态交互,发现性能提升源于互补信号聚合而非协同效应,为模型审计和联邦学习提供新视角。

Comments 8 pages, 1 figure, under review at XAI 2026 LBW

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12700 2026-04-15 cs.AI 83%

MISID: A Multimodal Multi-turn Dataset for Complex Intent Recognition in Strategic Deception Games

MISID:一种多模态多轮对话数据集,用于战略欺骗游戏中复杂意图识别

Shufang Lin, Muyang Chen, Xiabing Zhou, Rongrong Zhang, Dayou Zhang, Fangxin Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Capital Normal University(首都师范大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出MISID数据集,用于复杂战略欺骗游戏中多模态多轮对话的意图识别,通过系统评估发现现有多模态大语言模型在复杂场景中存在缺陷,并提出FRACTAM框架提升性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21652 2026-04-15 eess.IV cs.AI physics.med-ph 79%

Enabling Ultra-Fast Cardiovascular Imaging Across Heterogeneous Clinical Environments with A Generalist Foundation Model and Multimodal Database

通过通用基础模型和多模态数据库实现跨异构临床环境的超快速心血管成像

Zi Wang, Mingkai Huang, Zhang Shi, Hongjie Hu, Lan Lan, Hui Zhang, Yan Li, Xi Hu, Qing Lu, Zongming Zhu, Qiong Yao, Yuxiang Dai, Fanwen Wang, Yinzhe Wu, Jun Lyu, Qianqian Gao, Guangming Xu, Zhenxuan Zhang, Haosen Zhang, Qing Li, Guangming Wang, Tianxing He, Lizhen Lan, Siyue Li, Le Xue, Mengting Sun, Yuntong Lyu, Junpu Hu, Jiayu Zhu, Rizwan Ahmad, Zhengyu Bu, Xianling Qian, Guanke Cai, Ruiyu Cao, Weirui Cai, Chang Xu, Yuyang Ren, Feidan Yu, Siying Ma, Ziqiang Xu, Xinran Chen, Sha Hua, Daniel Kim, Yajing Zhang, Chen Ouyang, Wenjia Bai, Jing Qin, Yucheng Yang, Daniel Rueckert, He Wang, Qian Tao, Claudia Prieto, Michael Markl, Alistair Young, Lianming Wu, Shuo Wang, Chen Qin, Mengsu Zeng, Xihong Hu, Haibo Xu, Xiaobo Qu, Hao Li, Guang Yang, Chengyan Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CardioMM模型,通过统一语义理解和物理约束数据一致性,实现跨不同扫描仪、协议和患者情况的稳健重建,验证了24倍加速仍能保持关键心脏表型和诊断图像质量。

Comments Github: https://github.com/wangziblake/CardioMM_MMCMR-427K

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12315 2026-04-15 cs.CV cs.MM 73%

GTPBD-MM: A Global Terraced Parcel and Boundary Dataset with Multi-Modality

GTPBD-MM:一种具有多模态的全球梯田地块和边界数据集

Zhiwei Zhang, Xingyuan Zeng, Xinkai Kong, Kunquan Zhang, Haoyuan Liang, Bohan Shi, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Northeastern University(东北大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM

AI总结 本文提出GTPBD-MM数据集,用于复杂梯田地块提取,结合高分辨率影像、文本描述和DEM数据,提出ETTerra模型,通过文本和地形信息提升提取精度。

Comments 15 pages, 11 figures. Submitted to ACM Multimedia 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 62%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12512 2026-04-15 cs.CV cs.AI 62%

NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)

NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:专业图像质量评估(Track 1)

Guanyi Qin, Jie Liang, Bingbing Zhang, Lishen Qu, Ya-nan Guan, Hui Zeng, Lei Zhang, Radu Timofte, Jianhui Sun, Xinli Yue, Tao Shao, Huan Hou, Wenjie Liao, Shuhao Han, Jieyu Yuan, Chunle Guo, Chongyi Li, Zewen Chen, Yunze Liu, Jian Guo, Juan Wang, Yun Zeng, Bing Li, Weiming Hu, Hesong Li, Dehua Liu, Xinjie Zhang, Qiang Li, Li Yan, Wei Dong, Qingsen Yan, Xingcan Li, Shenglong Zhou, Manjiang Yin, Yinxiang Zhang, Hongbo Wang, Jikai Xu, Zhaohui Fan, Dandan Zhu, Wei Sun, Weixia Zhang, Kun Zhu, Nana Zhang, Kaiwei Zhang, Qianqian Zhang, Zhihan Zhang, William Gordon, Linwei Wu, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Cici Liu, Yaokun Shi

机构 * NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)(NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:专业图像质量评估(Track 1))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出NTIRE 2026挑战赛,聚焦专业图像质量评估,通过多模态大语言模型提升图像评估的准确性与解释性,吸引200多团队参与,推动专业IQA领域的发展。

Comments NTIRE Challenge Report. Accepted by CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19328 2026-04-15 cs.CV cs.LG 57%

BAH Dataset for Ambivalence/Hesitancy Recognition in Videos for Digital Behavioural Change

用于数字行为改变视频中矛盾/犹豫识别的BAH数据集

Manuela González-González, Soufiane Belharbi, Muhammad Osama Zeeshan, Masoumeh Sharafi, Muhammad Haseeb Aslam, Marco Pedersoli, Alessandro Lameiras Koerich, Simon L Bacon, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔埃克塞特学院,加拿大) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(LIVIA软件与IT工程系,蒙特利尔埃克塞特学院,加拿大) Dept. of Health, Kinesiology, & Applied Physiology, Concordia University, Montreal, Canada(健康、运动科学与应用生理学系,康科迪亚大学,蒙特利尔,加拿大) Montreal Behavioural Medicine Centre, CIUSSS Nord-de-l’Ile-de-Montréal, Canada(蒙特利尔行为医学中心,北岛-蒙特利尔医疗与社会服务委员会,加拿大)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BAH数据集,用于多模态识别视频中的矛盾/犹豫,包含1427个视频,旨在为机器学习模型提供训练数据,通过专家标注和基准测试展示识别挑战。

Comments 46 pages, 21 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12162 2026-04-15 cs.CL 57%

AlphaEval: Evaluating Agents in Production

AlphaEval:生产环境中的代理评估

Pengrui Lu, Bingyu Xu, Wenjun Zhang, Shengjia Hua, Xuanjian Gao, Ranxiang Ge, Lyumanshan Ye, Linxuan Wu, Yiran Li, Junfei Fish Yu, Yibo Zhang, Ruixin Li, Manxiang Li, Xiao Han, Xiaocong Zhou, Guangyao Chi, Zisheng Chen, Kaishen Chen, Kun Wang, Qihua Xu, Fengyue Meng, Yuchen Ni, Jiajun Li, Jinxiu Liu, Danfeng Zhang, Jingru Zhao, Pengfei Liu

机构 * SII MiraclePlus SJTU(上海交通大学) GAIR HIT(哈尔滨工业大学) UCAS(中国科学技术大学) LangCore Jiqizhixin HunterAI CinoCore KuaFuAI POET

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

AI总结 AlphaEval 是一个基于生产环境的评估基准,包含 94 个任务,涵盖六个职业领域,通过多种评估方法评估完整代理产品,提供可复现的构建框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12329 2026-04-15 cs.CR cs.SI 50%

UniDetect: LLM-Driven Universal Fraud Detection across Heterogeneous Blockchains

UniDetect: 基于大语言模型的跨异构区块链通用欺诈检测

Shuyi Miao, Wangjie Qiu, Shengda Zhuo, Fei Shen, Dan Lin, Xingtong Yu, Chua Tat-Seng, Zhiming Zheng

专题命中 多模态评测 :multimodal(abstract)

AI总结 UniDetect利用大语言模型生成跨异构区块链账户的交易摘要文本,结合两阶段交替训练策略,提升欺诈检测性能,在多个区块链上实现5.57%-7.58%的KS提升,跨链零样本检测准确率超94.58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12001 2026-04-15 cs.CE 50%

Divergence-Guided Particle Swarm Optimization

基于分歧的粒子群优化

Kleyton da Costa, Bernardo Modenesi, Ivan F. M. Menezes, Hélio Lopes

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出DPSO,通过引入 modulation 项来引导粒子避免过早收敛,提升了多模态问题的优化性能,同时保持了单模态问题的探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11934 2026-04-15 cs.CY 50%

BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models

BiasIG:评估文本到图像模型中多维社会偏见的基准测试

Hanjun Luo, Zhimu Huang, Haoyu Huang, Ziye Deng, Ruizhe Chen, Xinfeng Li, Zuozhu Liu, Hanan Salam

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。

Comments Accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 6 篇

2603.05295 2026-04-15 cs.AI cs.CV 62%

WebChain: A Large-Scale Human-Annotated Dataset of Real-World Web Interaction Traces

WebChain:一个大规模的人工标注的真实世界网页交互轨迹数据集

Sicheng Fan, Rui Wan, Yifei Leng, Gaoning Liang, Li Ling, Yanyi Shang, Dehan Kong

机构 * Fudan University(复旦大学) IMean AI WebAgentLab

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WebChain数据集,包含31,725条轨迹和318k步,通过视觉、结构和动作数据的三元对齐提供多模态监督,提出双中层训练方法,实现了WebChainBench等公开GUI基准的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12896 2026-04-15 cs.CV cs.LG 57%

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

不要显示像素,显示提示:通过感知程序解锁语言模型中的视觉工具推理

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

机构 * Huawei Technologies, Canada(华为技术(加拿大)) University of Alberta, Canada(阿尔伯塔大学(加拿大))

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出感知程序(P²),通过将视觉工具输出转换为结构化摘要,提升语言模型的视觉推理能力,在六个任务中均取得显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24168 2026-04-15 cs.AI 57%

MGA: Memory-Driven GUI Agent for Observation-Centric Interaction

MGA:基于记忆的GUI代理用于以观察为中心的交互

Weihua Cheng, Junming Liu, Yifei Sun, Botian Shi, Yirong Chen, Ding Wang

机构 * Shanghai Tech University(上海科技大学) Tongji University(同济大学) East China University of Science and Technology(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 MGA通过解耦长周期轨迹和结构化状态记忆机制,减少认知负担和系统复杂度,实现高效的GUI自动化。

Comments Submitted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12909 2026-04-15 cs.RO 50%

Tree Learning: A Multi-Skill Continual Learning Framework for Humanoid Robots

树学习:一种面向双足机器人的人机交互连续学习框架

Yifei Yan, Linqi Ye

机构 * School of Future Technology, Shanghai University(上海大学未来技术学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出Tree Learning框架,通过参数继承机制和多模态适应机制,实现双足机器人多技能连续学习,避免灾难性遗忘,提升技能切换和交互控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12831 2026-04-15 cs.RO 50%

VULCAN: Vision-Language-Model Enhanced Multi-Agent Cooperative Navigation for Indoor Fire-Disaster Response

VULCAN:基于视觉-语言模型的多智能体协作导航用于室内火灾应急响应

Shengding Liu, Qiben Yan

机构 * Computer Science \& Engineering Michigan State University East Lansing, MI, USA

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出VULCAN框架,结合多模态感知与视觉语言模型,解决火灾环境下多智能体协作导航的挑战,通过模拟真实火灾场景评估现有方法的失效模式,强调鲁棒感知与危险意识规划的重要性。

Comments INFOCOM EIN Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16615 2026-04-15 cs.RO 50%

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning

基于大型语言模型的任务与能力层面探索的强化学习

Jelle Luijkx, Runyu Ma, Zlatan Ajanović, Jens Kober

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出LLM-TALE框架,利用大型语言模型的规划能力引导强化学习探索,提升学习效率和任务成功率,实验证明在抓取放置任务中表现出更高的样本效率和成功率。

Comments 8 pages, 7 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 17 篇

2604.12630 2026-04-15 cs.CV cs.CL 91%

GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning

GeoAlign:用于MLLM空间推理的几何特征重定位

Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang

机构 * National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学) Meituan Inc.(美团公司) National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出GeoAlign框架,通过动态聚合多层几何特征以解决MLLM在空间推理中的任务对齐偏差问题,实验表明其紧凑模型在多个基准测试中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12767 2026-04-15 cs.CV cs.AI 86%

CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models

CLASP:面向多模态大语言模型的类适应层融合与双阶段剪枝

Yunkai Dang, Yizhu Jiang, Yifan Jiang, Qi Fan, Yinghuan Shi, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence Science and Technology(人工智能科学与技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 CLASP通过类适应层融合和双阶段剪枝,实现多模态大语言模型中视觉token的高效减少,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12502 2026-04-15 cs.CV cs.AI 84%

SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker

SEATrack: 简单、高效且自适应的多模态跟踪器

Junbin Su, Ziteng Xue, Shihui Zhang, Kun Chen, Weiming Hu, Zhipeng Zhang

机构 * School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) School of Software, Beihang University(北航软件学院) Hebei Key Laboratory of Computer Virtual Technology and System Integration(河北省计算机虚拟技术与系统集成重点实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(多模态人工智能系统国家重点实验室(MAIS),CASIA) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院自动化实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SEATrack通过跨模态对齐和层次混合专家机制,在RGB-T、RGB-D和RGB-E跟踪任务中实现性能与效率的平衡。

Comments Accepted as a CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12380 2026-04-15 cs.CV 83%

Modality-Agnostic Prompt Learning for Multi-Modal Camouflaged Object Detection

多模态伪装物体检测的模态无关提示学习

Hao Wang, Jiqing Zhang, Xin Yang, Baocai Yin, Lu Jiang, Zetian Mi, Huibing Wang

机构 * Information Science and Technology College, Dalian Maritime University(大连海事大学信息科学与技术学院) Beijing University of Technology(北京理工大学) Dalian University of Technology(大连理工大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种模态无关的提示学习框架,用于多模态伪装物体检测,通过数据驱动内容域与知识驱动提示域的交互,生成统一提示以提升SAM模型性能,并引入轻量级Mask Refine模块以提高检测精度。

Comments 10

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12424 2026-04-15 cs.CL cs.AI cs.CV 82%

Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation

解码中的扰动:通过动态文本扰动缓解多模态大语言模型的幻觉

Sihang Jia, Shuliang Liu, Songbo Yang, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Decoding by Perturbation方法,通过动态文本扰动缓解多模态大语言模型的幻觉问题,通过控制文本干预减少语言先验的影响,提升解码稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08291 2026-04-15 cs.AI 79%

A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning

多模态数学推理综述:从感知、对齐到推理

Tianyu Yang, Sihong Wu, Yilun Zhao, Zhenwen Liang, Lisen Dai, Chen Zhao, Minhao Cheng, Arman Cohan, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Yale University(耶鲁大学) Columbia University(哥伦比亚大学) New York University(纽约大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了多模态数学推理的研究进展,探讨了如何从多模态输入中提取信息、对齐文本与视觉信息、进行推理以及评估推理过程的正确性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11992 2026-04-15 cs.RO cs.CV 79%

ReefMapGS: Enabling Large-Scale Underwater Reconstruction by Closing the Loop Between Multimodal SLAM and Gaussian Splatting

ReefMapGS:通过多模态SLAM与高斯点云之间的闭环实现大规模水下重建

Daniel Yang, Jungseok Hong, John J. Leonard, Yogesh Girdhar

机构 * Massachusetts Institute of Technology(麻省理工学院) Woods Hole Oceanographic Institution(伍兹霍尔海洋研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ReefMapGS框架,通过多模态传感器数据与高斯点云结合,实现水下复杂场景的增量重建与全局轨迹优化,展示无COLMAP的3D重建与高精度AUV轨迹估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11835 2026-04-15 cs.LG cs.AI 79%

Schema-Adaptive Tabular Representation Learning with LLMs for Generalizable Multimodal Clinical Reasoning

基于LLM的Schema自适应表格表示学习用于通用多模态临床推理

Hongxi Mao, Wei Zhou, Mengting Jia, Tao Fang, Huan Gao, Bin Zhang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Boston University(波士顿大学) University of Southern California(南加州大学) GDIIST Renyixun Health Technology Co., Ltd.(仁心迅健康科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于LLM的Schema自适应表格表示学习方法,通过将结构化变量转换为语义自然语言并编码,实现零样本跨schema对齐,结合表格和MRI数据在多模态 dementia 诊断中取得优于临床基准的性能。

Comments 11 pages, 4 figures

Journal ref ACL 2026, Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12026 2026-04-15 cs.LG q-bio.BM q-bio.QM 67%

TriFit: Trimodal Fusion with Protein Dynamics for Mutation Fitness Prediction

TriFit:结合蛋白质动力学的三模态融合用于突变适应度预测

Seungik Cho

机构 * Department of Physics(物理系) Astronomy, Rice University, Texas, USA(天文学、里士满大学、德克萨斯州、美国)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 TriFit通过三模态融合模块整合序列、结构和蛋白质动力学信息,利用四专家混合专家模型提升突变适应度预测性能,实现优于现有基线模型的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏