arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-03 至 2026-04-03 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2604.01634 2026-04-03 cs.LG cs.CL 85%

CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

CRIT: 基于图的自动数据合成以增强跨模态多跳推理

Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(高丽大学计算机科学与工程系) Google DeepMind(谷歌DeepMind)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CL

AI总结 CRIT通过图基自动管道生成复杂跨模态推理任务,提升多跳推理能力,实验表明先进模型在该任务上表现欠佳,训练于CRIT的模型在SPIQA等基准上显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01916 2026-04-03 cs.CL 79%

SURE: Synergistic Uncertainty-aware Reasoning for Multimodal Emotion Recognition in Conversations

SURE:用于对话中多模态情绪识别的协同不确定性推理

Yiqiang Cai, Chengyan Wu, Bolei Ma, Bo Chen, Yun Xue, Julia Hirschberg, Ziwei Gong

机构 * Guangdong Provincial Key Laboratory of Quantum Engineering and Quantum Materials(广东省量子工程与量子材料重点实验室) School of Electronic Science and Engineering (School of Microelectronics), South China Normal University(华南师范大学电子科学与工程学院(微电子学院)) Shenzhen University(深圳大学) Columbia University(哥伦比亚大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 SURE通过整合多模态信号并增强鲁棒性和上下文建模,改进了对话中情绪识别的不确定性处理和细粒度推理能力。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01433 2026-04-03 cs.ET cs.AI eess.SP 79%

Semantically Annotated Multimodal Dataset for RF Interpretation and Prediction

语义标注的多模态数据集用于射频解释与预测

Steve Blandino, Jelena Senic, Raied Caromi, Samuel Berweger, Anuraag Bodi, Camillo Gentile, Nada Golmie

机构 * National Institute of Standards and Technology (NIST)(美国国家标准与技术研究院) Prometheus Computing LLC(普罗米修斯计算有限责任公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出结合射频测量与视觉数据的多模态数据集,用于提升射频信号与物理环境的解释与预测能力。

Journal ref NeurIPS 2025 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00580 2026-04-03 cs.RO cs.AI 79%

OmniUnet: A Multimodal Network for Unstructured Terrain Segmentation on Planetary Rovers Using RGB, Depth, and Thermal Imagery

OmniUnet:一种多模态网络,用于使用RGB、深度和热成像的无结构地形分割在火星车上的应用

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

机构 * University of Luxembourg(卢森堡大学) Universidad de Málaga(马拉加大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 OmniUnet通过整合RGB、深度和热成像数据,实现无结构地形的高效分割,利用自定义传感器设备在西班牙Bardenas半沙漠收集数据,并在资源受限设备上验证了其性能。

Journal ref 2025 International Conference on Space Robotics (iSpaRo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01626 2026-04-03 cs.DB 78%

CogPic: A Multimodal Dataset for Early Cognitive Impairment Assessment via Picture Description Tasks

CogPic:一种通过图片描述任务进行早期认知障碍评估的多模态数据集

Liuyu Wu, Rui Feng, Jie Li, Wentao Xiang, Yi Zhang, Yin Cao, Siyang Song, Xiao Gu, Jianqing Li, Wei Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出CogPic数据集,用于通过图片描述任务进行早期认知障碍评估,该数据集包含同步的音频、视觉和语言数据,由专家神经心理学家进行临床验证,为多模态研究提供了坚实基础。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12797 2026-04-03 cs.CV cs.AI cs.CL 67%

KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding

KARL:面向知识密集型视觉定位的知识感知推理与强化学习

Xinyu Ma, Ziyang Ding, Zhicong Luo, Chi Chen, Zonghao Guo, Derek F. Wong, Zhen Zhao, Xiaoyi Feng, Maosong Sun

机构 * University of Macau(澳门大学) Shandong University(山东大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出KARL框架,通过知识引导的推理数据和强化学习方法,提升模型在知识密集型视觉定位任务中的表现,实现跨领域泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01941 2026-04-03 cs.CV cs.AI 62%

Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm

在早期教育中的日常活动图像描述:基准和算法

Sixing Li, Zhibin Gu, Ziqi Zhang, Weiguo Pan, Bing Li, Ying Wang, Hongzhe Liu

机构 * School of Robotics, Beijing Union University(北京联合大学机器人学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) National Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) PeopleAI, Inc.(人民人工智能公司) People Youhe Education Technology Co., Ltd.(人民优和教育科技有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ECAC基准和RSRS算法,通过专家标注和细粒度标签提升早期教育图像描述的专业性,实验显示KinderMM-Cap-3B在TTS上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01586 2026-04-03 cs.CV cs.AI 62%

SHOE: Semantic HOI Open-Vocabulary Evaluation Metric

SHOE:语义HOI开放词汇评估度量

Maja Noack, Qinqian Lei, Taipeng Tian, Bihan Dong, Robby T. Tan, Yixin Chen, John Young, Saijun Zhang, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究员) ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SHOE评估框架,通过结合预测与真实HOI标签的语义相似性,改进开放词汇HOI检测的评估方法,实验表明其与人类判断一致率达85.73%。

Comments Accepted to GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18588 2026-04-03 cs.CV cs.MM 62%

A Novel FACS-Aligned Anatomical Text Description Paradigm for Fine-Grained Facial Behavior Synthesis

一种基于FACS的解剖学对齐的面部行为描述范式用于细粒度面部行为合成

Jiahe Wang, Cong Liang, Xuandong Huang, Yuxin Wang, Xin Yun, Yi Wu, Yanan Chang, Shangfei Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于FACS的面部行为合成新范式,通过解剖学驱动的自然语言控制信号,构建了首个大规模文本-图像配对数据集,并提出AAAD指标和VQ-AUFace框架,显著提升了合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02328 2026-04-03 cs.CV 57%

Modulate-and-Map: Crossmodal Feature Mapping with Cross-View Modulation for 3D Anomaly Detection

调制与映射:用于3D异常检测的跨模态特征映射与跨视图调制

Alex Costanzino, Pierluigi Zama Ramirez, Giuseppe Lisanti, Luigi Di Stefano

机构 * CVLab, University of Bologna(博洛尼亚大学CVLab) Ca’ Foscari University of Venice(威尼斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 ModMap提出一种多视图多模态框架,通过跨模态特征映射和视图依赖关系建模,实现3D异常检测与分割,采用跨视图训练策略提升异常评分。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02040 2026-04-03 cs.CV 57%

Efficient Reasoning via Thought Compression for Language Segmentation

通过思维压缩实现高效的语言分段推理

Qing Zhou, Shiyu Zhang, Yuyu Jia, Junyu Gao, Weiping Ni, Junzheng Wu, Qi Wang

机构 * Northwestern Polytechnical University, China(西北工业大学) Northwest Institute of Nuclear Technology, China(西北核技术研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 WISE通过压缩推理过程提升语言分段性能,采用自蒸馏目标确保简洁总结与详细解释的语义一致性,实验显示其在ReasonSeg基准上达到58.3 cIoU,推理长度减少近5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01354 2026-04-03 cs.CL 57%

Open-Domain Safety Policy Construction

开放领域安全政策构建

Di Wu, Siyue Liu, Zixiang Ji, Ya-Liang Chang, Zhe-Yu Liu, Andrew Pleffer, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Taboola

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Deep Policy Research(DPR),通过仅使用人类撰写的种子领域信息,构建完整的内容审核政策。DPR利用单一网络搜索工具和轻量级框架,迭代提出搜索查询,提炼多样化网络资源为政策规则,并将规则组织成索引文档。

Comments EACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29200 2026-04-03 cs.LG cs.AI 57%

Improving Ensemble Forecasts of Abnormally Deflecting Tropical Cyclones with Fused Atmosphere-Ocean-Terrain Data

通过融合大气-海洋-地形数据提升异常偏转热带气旋集合预报

Qixiang Li, Yuan Zhou, Shuwei Huo, Chong Wang, Xiaofeng Li

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Center for Ocean Mega-Science, Chinese Academy of Sciences(中国科学院海洋大科学研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出AOT-TCs多源多模态数据集及首个融合大气-海洋-地形耦合架构的预报模型,显著提升正常和异常偏转热带气旋的预报精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21687 2026-04-03 cs.AI 57%

MIRAGE: The Illusion of Visual Understanding

MIRAGE:视觉理解的幻觉

Mohammad Asadi, Jack W. O'Sullivan, Fang Cao, Tahoura Nedaee, Kamyar Rajabalifardi, Fei-Fei Li, Ehsan Adeli, Euan Ashley

机构 * Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究揭示多模态AI系统在视觉-语言推理中的漏洞,指出模型能生成未提供图像的详细描述及推理,挑战现有假设,提出B-Clean作为公平评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12324 2026-04-03 cs.CR cs.AI 57%

UniMark: Artificial Intelligence Generated Content Identification Toolkit

UniMark:人工智能生成内容识别工具包

Meilin Li, Ji He, Yi Yu, Jia Xu, Shanzhe Lei, Yan Teng, Yingchun Wang, Xuhong Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shandong University(山东大学) Shanghai Information Security Testing Evaluation and Certification Center(上海市信息安全测评认证中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 UniMark通过统一框架和双操作策略,解决AI生成内容识别的碎片化问题,支持隐水印和可见标记,提供标准化评估框架以提升内容治理透明度和安全性。

Comments 5 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03828 2026-04-03 cs.AI cs.MA 57%

AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance

AssetOpsBench:工业资产运维任务自动化AI代理的基准测试

Dhaval Patel, Shuxin Lin, James Rayfield, Nianjun Zhou, Chathurangi Shyalika, Suryanarayana R Yarrabothula, Roman Vaculin, Natalia Martinez, Fearghal O'donncha, Jayant Kalagnanam

机构 * IBM University of South Carolina(南卡罗来纳大学) IBM Research(IBM研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出AssetOpsBench,一个统一框架,用于协调和评估工业4.0中的领域专用代理。该框架包含四个领域代理目录、140+人工撰写的自然语言查询数据集及模拟的CouchDB后端物联网环境,通过三个关键指标分析工具-代理与计划-执行者范式的架构权衡,并系统化发现新兴故障模式。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏