arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-16 至 2026-06-16 共收录 167 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 37 篇

2606.14958 2026-06-16 cs.CV cs.IR cs.LG 新提交 81%

MVEB: Massive Video Embedding Benchmark

MVEB:大规模视频嵌入基准

Adnan El Assadi, Roman Solomatin, Isaac Chung, Chenghao Xiao, Deep Shah, Manan Dey, Shriya Sudhakar, Zacharie Bugaud, Wissam Siblini, Ayush Sunil Munot, Yashwanth Devavarapu, Rakshitha Ireddi, Michelle Yang, Márton Kardos, Niklas Muennighoff, Kenneth Enevoldsen

机构 * Harvard University(哈佛大学) SaluteDevices MIRAI Zendesk Shanghai University of Finance and Economics(上海财经大学) Google LLC Salesforce Cornell University(康奈尔大学) Astera Institute(Astera研究院) Independent Contributor(独立贡献者) Indian Institute of Technology, Kharagpur(印度理工学院,克拉格浦分校) Barclays(巴克莱银行) Aarhus University(奥胡斯大学) Stanford University(斯坦福大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出MVEB基准,包含23个任务评估33种视频嵌入模型,发现无单一模型占优,音频贡献取决于标注来源,并集成到MTEB生态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14963 2026-06-16 cs.CV cs.AI 新提交 81%

Multi-Modal Attention for Automated Disaster Damage Assessment Using Remote Sensing Imagery and Deep Learning

基于遥感影像和深度学习的多模态注意力自动灾害损伤评估

Tewodros Syum Gebre, Jagrati Talreja, Leila Hashemi-Beni

机构 * Built Environment Department, College of Science and Technology, North Carolina A&T State University(北卡罗来纳农工州立大学科技学院建筑环境系) United Nations University Institute for Water, Environment and Health(联合国大学水、环境与健康研究所)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种多模态注意力机制融合双时相遥感影像的深度学习框架,实现建筑物损伤四分类(无/轻微/严重/毁坏),准确率达94.90%。

Comments This paper has been accepted for publication in ISPRS Congress 2026 and the 47th Canadian Symposium on Remote Sensing (CSRS 2026) Annals

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14766 2026-06-16 cs.CV cs.AI cs.MA 新提交 81%

XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems

XMedFusion:面向自主医疗系统的知识引导多模态感知与推理框架

Hamza Riaz, Arham Haroon, Maha Baig, Muhammad Dawood Rizwan, Muhammad Naseer Bajwa, Muhammad Moazam Fraz

机构 * National University of Sciences and Technology (NUST)(巴基斯坦国立科技大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出XMedFusion模块化AI框架,通过视觉感知、知识图谱构建和检索引导生成等智能体协同,增强放射学报告生成的视觉基础与临床发现捕捉能力,在公共数据集上显著优于基线模型。

Comments Accepted at the 2026 International Conference on Robotics and Automation in Industry (ICRAI)

Journal ref 2026 International Conference on Robotics and Automation in Industry (ICRAI), pp. 1-6, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09669 2026-06-16 cs.AI cs.CL 新提交 81%

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

SpatialWorld: 在多模态智能体真实世界任务中基准测试交互式空间推理

Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学) Peking University(北京大学) ZenoMind AI Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SpatialWorld基准,集成8种异构模拟后端,通过760个人工标注任务评估多模态智能体在视觉部分可观测环境中的交互式空间理解,发现最强模型GPT-5任务成功率仅17.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15890 2026-06-16 cs.AI 新提交 79%

UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics

UrbanWell: 面向时空城市福祉分析的多模态大语言模型基准测试

Yanxin Xi, Xiang Su, Jie Feng, Yu Liu, Sasu Tarkoma, Pan Hui

机构 * University of Helsinki(赫尔辛基大学) Zhongguancun Academy(中关村学院) University of Oxford(牛津大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出UrbanWell基准,通过卫星和街景图像联合建模,系统评估多模态大语言模型在环境、空间可达性、城市形态、活力和主观感知等5类城市福祉指标上的时空推理能力,并定义时序预测和趋势分类任务。

Comments accepted by KDD Datasets and Benchmarks Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15152 2026-06-16 cs.CL 新提交 79%

Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

智能体能否读懂房间气氛?多模态模拟中的视觉社交智能基准测试

Shijun Wan, Xuehai Wu, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 提出AgentViSS基准,通过240个场景和四项角色级任务评估多模态大模型的视觉社交智能,发现局部角色扮演接近饱和而交互调控仍困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18827 2026-06-16 q-bio.NC cs.AI 版本更新 79%

OmniMouse: Scaling properties of multi-modal, multi-task Brain Models on 150B Neural Tokens

OmniMouse: 基于1500亿神经令牌的多模态多任务脑模型的可扩展性

Konstantin F. Willeke, Polina Turishcheva, Alex Gilbert, Goirik Chakrabarty, Hasan A. Bedel, Paul G. Fahey, Yongrong Qiu, Marissa A. Weis, Michaela Vystrčilová, Taliah Muhammad, Lydia Ntanavara, Rachel E. Froebe, Kayla Ponder, Zheng Huan Tan, Emin Orhan, Erick Cobos, Sophia Sanborn, Katrin Franke, Fabian H. Sinz, Alexander S. Ecker, Andreas S. Tolias

机构 * Department of Ophthalmology, Byers Eye Institute, Stanford University(斯坦福大学眼科学系、比尔斯眼科研究所) Stanford Bio-X, Stanford University(斯坦福大学生物交叉学科) Wu Tsai Neurosciences Institute, Stanford University(斯坦福大学吴泰教授神经科学研究所) Institute of Computer Science and Campus Institute Data Science, University Göttingen(哥廷根大学计算机科学研究所和校园数据科学研究所)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 利用小鼠视觉皮层31亿神经元数据,训练多模态多任务模型OmniMouse,在神经预测、行为解码等任务上达到最优,发现性能随数据量可靠提升但模型规模收益饱和,与AI领域标准扩展规律相反。

Comments Published at ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22391 2026-06-16 cs.CL 版本更新 79%

Detecting Hate and Inflammatory Content in Bengali Memes: A New Multimodal Dataset and Co-Attention Framework

检测孟加拉语模因中的仇恨和煽动性内容:一个新的多模态数据集和共注意力框架

Rakib Ullah, Mominul islam, Md Sanjid Hossain, Md Ismail Hossain

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CL

AI总结 针对孟加拉语模因中仇恨和煽动性内容检测的研究空白,构建了首个区分煽动性内容与直接仇恨言论的数据集Bn-HIB,并提出多模态共注意力融合模型MCFM,通过联合分析视觉和文本特征实现更准确分类。

Comments Added public link to dataset and fixed typo in abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05888 2026-06-16 cs.CV 版本更新 79%

BioAutoML-NAS: An End-to-End AutoML Framework for Multimodal Insect Classification via Neural Architecture Search on Large-Scale Biodiversity Data

BioAutoML-NAS:基于大规模生物多样性数据通过神经架构搜索进行多模态昆虫分类的端到端AutoML框架

Arefin Ittesafun Abian, Debopom Sutradhar, Md Rafi Ur Rashid, Reem E. Mohamed, Md Rafiqul Islam, Asif Karim, Kheng Cher Yeo, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka, Bangladesh(乌姆国际大学计算机科学与工程系,达卡,孟加拉国) Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory, 1217, Dhaka, Bangladesh(应用人工智能与智能系统实验室(AAIINS),1217号,达卡,孟加拉国) Department of Computer Science and Engineering, Penn State University, University Park, PA, USA(宾夕法尼亚州立大学计算机科学与工程系,University Park,PA,美国) Faculty of Science and Information Technology, Charles Darwin University, Sydney, NSW, Australia(查尔斯达尔文大学科学与信息技术学院,悉尼,新南威尔士州,澳大利亚) Faculty of Science and Technology, Charles Darwin University, Casuarina, 0909, NT, Australia(查尔斯达尔文大学科学与技术学院,Casuarina,0909,北领地,澳大利亚)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出首个多模态BioAutoML模型BioAutoML-NAS,利用神经架构搜索自动学习图像操作,结合元数据融合与交替双层优化,在BIOSCAN-5M数据集上以96.81%准确率超越现有方法。

Comments Accepted in IEEE Transactions on Big Data

Journal ref IEEE Transactions on Big Data (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21036 2026-06-16 cs.CL 版本更新 79%

GePBench: Evaluating Fundamental Geometric Perception for Multimodal Large Language Models

GePBench:评估多模态大语言模型的基础几何感知能力

Shangyu Xing, Changhao Xiang, Yuteng Han, Yifan Yue, Zhen Wu, Xinyu Liu, Zhangtai Wu, Fei Zhao, Xinyu Dai

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 提出GePBench基准,系统评估多模态大语言模型的几何形状识别与空间关系感知能力,发现现有模型存在显著缺陷,而基于该基准训练可提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15559 2026-06-16 cs.SE cs.DC cs.LG 新提交 78%

SDVDiag: Multimodal Causal Discovery for Online Diagnosis in Software-defined Vehicles

SDVDiag:软件定义车辆中用于在线诊断的多模态因果发现

Matthias Weiß, Athreya Hosahalli Prakash, Falk Dettinger, Nasser Jazdi, Michael Weyrich

机构 * University of Erlangen-Nuremberg(埃尔兰根-纽伦堡大学) Fraunhofer Institute for Software and Virtual Systems(弗劳恩霍夫软件与虚拟系统研究所)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出SDVDiag多模态因果发现管道,融合日志和指标表示构建因果图,结合异常触发实现持续在线诊断,在自动泊车测试中因果图更稀疏,根因定位准确。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14969 2026-06-16 cs.RO 新提交 78%

Multimodal Physiological Assessment of Contact-Rich Physical Human-Robot Interaction Under Varying Environmental Conditions

多变环境条件下接触丰富型物理人机交互的多模态生理评估

Yanyi Chen, Xi Wang, Min Deng

机构 * Texas Tech University(德克萨斯理工大学) Texas A&M University(德克萨斯农工大学) University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究通过多模态生理测量(EDA、sEMG、眼动追踪)和主观舒适度评估,揭示了接触丰富型物理人机交互中操作者因环境压力(温度、噪声、照度)而付出的隐藏生理代价,并发现操作者通过增加生理努力维持任务性能的补偿机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16184 2026-06-16 cs.LG 版本更新 78%

A Multimodal Approach to Alzheimer's Diagnosis: Geometric Insights from Cube Copying and Cognitive Assessments

一种多模态阿尔茨海默病诊断方法:来自立方体复制和认知评估的几何洞察

Jaeho Yang, Kijung Yoon

机构 * Department of Electronic Engineering, Hanyang University(电子工程系,翰阳大学) Department of Artificial Intelligence, Hanyang University(人工智能系,翰阳大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出多模态框架,将手绘立方体草图转换为图结构,结合人口统计和神经心理测试分数,用于阿尔茨海默病分类,图表示优于像素模型,多模态融合提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24043 2026-06-16 cs.LG stat.ML 版本更新 78%

Localized Kernel Projection Outlyingness: A Two-Stage Approach for Multi-Modal Outlier Detection

局部核投影离群度:一种用于多模态离群检测的两阶段方法

Akira Tamamori

机构 * Department of Computer Science, Aichi Institute of Technology(爱知技术大学计算机科学系)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出两阶段LKPLO框架,结合自适应损失函数、全局核PCA和局部聚类,解决多模态离群检测问题,在10个基准数据集上取得最优性能。

Comments 12 pages, 5 figures; accepted by The IEICE Transactions on Information and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00873 2026-06-16 cs.MM cs.AI cs.CV 版本更新 75%

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

BRITE:面向不可信场景的可靠可解释文本到视频评估基准

Advait Tilak, Jiwon Choi, Nazifa Mouli, Wei Le

机构 * Department of Computer Science, Iowa State University, Ames, Iowa, USA(计算机科学系,爱荷华州立大学,爱荷华州阿姆斯,美国)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出BRITE基准,通过人工参与协议统一不可信提示、细粒度音视频一致性评估和可解释QA评估,揭示现有模型在对象-动作绑定和音视频同步上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16749 2026-06-16 cs.CV 新提交 70%

Structure-aware Knowledge-guided Heterogeneous Mamba for Zygomaticomaxillary Suture Assessment

结构感知知识引导的异构Mamba用于颧上颌缝评估

Xiaoqi Guo, Birui Chen, Xinquan Yang, Chaoyun Zhang, Xuefen Liu, Mianjie Zheng, Kun Tang, Xuguang Li, Wen Ma, Yanhua Xu, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Affiliated Stomatology Hospital of Kunming Medical University(昆明医科大学附属口腔医院) Shenzhen University General Hospital(深圳大学总医院)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出首个ZMS公开数据集(3790张图像,覆盖4-24岁),并设计SKMamba框架,通过解耦双路径架构、隐式边缘提取器和跨模态语义对齐模块,实现自动化ZMS成熟度评估,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03788 2026-06-16 cs.CV 版本更新 70%

SLU-2K: A Question-Based Benchmark for Semantic Evaluation of Sign Language Translation

SLU-2K:基于问题的手语翻译语义评估基准

Zeno Testa, Antonino Furnari, Lorenzo Baraldi, Natalia Díaz-Rodríguez

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Catania(卡塔尼亚大学) University of Granada(格拉纳达大学) CITIC & DaSCI Institute(CITIC与DaSCI研究所)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出SLU-2K基准,通过2350个视频问答对评估手语翻译的语义理解,揭示当前系统在语义正确性上的不足。

Comments Accepted at the GenSign Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15307 2026-06-16 cs.CL cs.AI 新提交 62%

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

利用思维链监督的强化学习进行仇恨和宣传模因的可解释检测

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Qatar University(卡塔尔大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出基于强化学习的后训练方法,结合任务特定奖励和组相对策略优化(GRPO),提升思考型多模态大语言模型在仇恨和宣传模因检测中的分类性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16970 2026-06-16 cs.CV cs.AI 版本更新 62%

MAND: Modality-Aware Novelty Detection for Open-World Egocentric Activity Recognition

MAND: 面向开放世界自我中心活动识别的模态感知新颖性检测

Hyejeong Im, Wonseon Lim, Dae-Won Kim

机构 * Department of Computer Science and Engineering, Chung-Ang University(Chung-Ang大学计算机科学与工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MAND框架,通过模态感知自适应评分和表示稳定训练,利用视觉和惯性模态互补信息,提升开放世界自我中心活动识别中的新颖性检测和已知类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13602 2026-06-16 eess.IV cs.AI cs.CV 62%

Translating Electrocardiograms to Cardiac Magnetic Resonance Imaging Useful for Cardiac Assessment and Disease Screening: A Multi-Center Study

将心电图转换为心脏磁共振成像对心脏评估和疾病筛查有用:一项多中心研究

Zhengyao Ding, Ziyu Li, Yujian Hu, Youyao Xu, Chengchen Zhao, Yiheng Mao, Haitao Li, Zhikang Li, Qian Li, Jing Wang, Yue Chen, Mengjia Chen, Longbo Wang, Xuesen Chu, Weichao Pan, Ziyi Liu, Fei Wu, Hongkun Zhang, Ting Chen, Zhengxing Huang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Vascular Surgery, The First Affiliated Hospital of Zhejiang University School of Medicine(浙江大学医学院附属第一医院血管外科) Department of Cardiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院心内科) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院放射科) Department of Vascular Surgery, Quzhou People’s Hospital(衢州人民医院血管外科) Department of Cardiology, The Second Affiliated Hospital of Zhejiang University School of Medicine(浙江大学医学院附属第二医院心内科) China Ship Scientific Research Center(中国船舶科学研究院) Guangdong Transtek Medical Electronics Co., Ltd.(广东 Transtek 医疗电子有限公司)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CardioNets框架,通过深度学习将12导联心电图信号转换为心脏磁共振成像级别的功能参数和合成图像,提升大规模心血管疾病筛查的效率和可及性。

Comments 29 pages, 7 figures

Journal ref NEJM AI 2026;3(4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16991 2026-06-16 cs.CV cs.LG 新提交 57%

A Multi-Center Benchmark for Abdominal Disease Diagnosis and Report Generation from Non-Contrast CT

基于非增强CT的腹部疾病诊断与报告生成的多中心基准

Mariam Elbakry, Aliaa Sayed Sheha, Salma Hassan Tantawy, Aya Yassin, Concetto Spampinato, Karim Lekadir, Xiaomeng Li, Marawan Elbatel

机构 * Ain Shams University(艾因夏姆斯大学) The Hong Kong University of Science and Technology(香港科技大学) University of Catania(卡塔尼亚大学) Universitat de Barcelona(巴塞罗那大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出一个多中心基准,利用非增强CT合成增强CT发现,用于多器官腹部疾病诊断和自动报告生成,实验表明非增强CT保留诊断信号,平均AUC达69.1%(内部)和63.1%(外部)。

Comments Early Accept (top ~9%), MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16175 2026-06-16 cs.AI 新提交 57%

PAL-Bench: Evidence-Grounded Profile Reconstruction from Longitudinal Personal Albums

PAL-Bench: 基于纵向个人相册的证据驱动画像重建

Qiwei Yan, Zhiqiang Yuan, Zexi Jia, Nanxing Hu, Kailin Lyu, Jie Zhou, Jinchao Zhang

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出PAL-Bench基准,通过合成用户和隐私保护审计,评估从纵向个人相册中重建用户画像、社交关系和身份映射的能力,发现现有系统在身份解析和证据引用方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15779 2026-06-16 cs.CV cs.LG 新提交 57%

Faithful Action-unit Causal Reasoning for Counterfactually Faithful Emotion Explanations

面向反事实忠实情感解释的忠实动作单元因果推理

Van Thong Huynh, Hong Hai Nguyen, Thuy Pham, Trong Nghia Nguyen, Soo-Hyung Kim

机构 * Faculty of CSE, Ho Chi Minh City University of Technology (HCMUT), VNUHCM(胡志明市理工大学计算机科学与工程学院,越南国家大学胡志明市分校) Dept. of AI, FPT University(FPT大学人工智能系) Faculty of DSAI, College of Technology, National Economic University(国民经济大学技术学院数据科学与人工智能系) Dept. of AI Convergence, Chonnam National University(全南大学人工智能融合系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出FACR方法,通过反事实一致性目标和极性感知因果图,训练模型在动作单元与情感之间实现可测量的因果忠实性,在UNBC-PAIN数据集上将忠实度从0.08提升至0.57。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15034 2026-06-16 cs.AI 新提交 57%

OSGuard: A Benchmark for Safety in Computer-Use Agents

OSGuard:计算机使用智能体安全基准

Mina Mohammadmirzaei, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出OSGuard双粒度基准,通过动作级安全判断和风险增强执行评估智能体在良性指令下的安全性,揭示局部监督与端到端安全的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08525 2026-06-16 cs.CV 新提交 57%

DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving

DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型

Qimao Chen, Fang Li, Yuechen Luo, Zehan Zhang, Haiyang Sun, Fangzhen Li, Bing Wang, Guang Chen, Yang Ji, Jiong Deng, Hongwei Xie, Hangjun Ye, Long Chen, Yi Zhang

机构 * Tsinghua University(清华大学) Xiaomi EV(小米汽车)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04184 2026-06-16 cs.CV 版本更新 57%

GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs

GroupToM-Bench: 多模态大语言模型中群体心智理论和非线性社会涌现的基准测试

Weidong Tang, Jierui Li, Yueling Hou, Zihan Mei, Can Zhang, Xinyan Wan, Zhiyuan Liang, Pengfei Zhou, Yang You, Wangbo Zhao

机构 * Xidian University(西安电子科技大学) National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在群体心智理论推理上的不足,提出GroupToM-Bench基准,通过七级认知审计框架评估模型从微观BDI状态到宏观结果预测的因果链,揭示模型在处理社会结构和非线性集体动态上的缺陷。

Comments ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03447 2026-06-16 cs.CV 版本更新 57%

Proact-VL: A Proactive VideoLLM for Real-Time AI Companions

Proact-VL:用于实时AI伴侣的主动式视频大语言模型

Weicai Yan, Yuhong Dai, Qi Ran, Haodong Li, Wang Lin, Tao Jin, Xing Xie, Hao Liao, Jianxun Lian

机构 * Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Proact-VL框架,通过游戏场景中的评论和引导任务,解决实时AI伴侣在低延迟推理、自主响应决策和内容质量控制方面的挑战,实现了主动式实时交互。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10496 2026-06-16 cs.CV 版本更新 57%

CheXGenBench: A Unified Benchmark For Fidelity, Privacy and Utility of Synthetic Chest Radiographs

CheXGenBench:合成胸片保真度、隐私和实用性的统一基准

Raman Dutt, Pedro Sanchez, Yongchen Yao, Steven McDonagh, Sotirios A. Tsaftaris, Timothy Hospedales

机构 * University of Edinburgh(爱丁堡大学) Samsung AI Center, Cambridge(剑桥三星AI中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出CheXGenBench,首个统一评估框架,同时衡量合成胸片生成模型的保真度、隐私风险和下游实用性,涵盖11种前沿T2I模型,揭示当前模型在长尾分布、隐私风险和下游多模态任务中的局限。

Comments Published in Transactions of Machine Learning Research (06/2026)

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16788 2026-06-16 cs.RO 新提交 50%

SoK: Security and Privacy of Foundation-Model-Powered Robots

SoK: 基础模型驱动机器人的安全与隐私

Xueluan Gong, Chen Chen, Jinxin Liu, Qian Wang, Kwok-Yan Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出F-E-S-G结构边界框架,系统分析基础模型驱动机器人的安全与隐私风险,并基于96篇论文揭示威胁模式、防御不匹配和评估差距。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24987 2026-06-16 q-bio.QM cs.LG q-bio.GN 50%

scMRDR: A scalable and flexible framework for unpaired single-cell multi-omics data integration

scMRDR:一种可扩展且灵活的无配对单细胞多组学数据整合框架

Jianle Sun, Chaoqi Liang, Ran Wei, Peng Zheng, Lei Bai, Wanli Ouyang, Hongliang Yan, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) Guangzhou Laboratory(广州实验室)

专题命中 多模态评测 :cross-modal(abstract)

AI总结 scMRDR通过β-VAE架构解耦细胞潜在表示,结合等距正则化、对抗目标和掩码重建损失,实现无配对多组学数据整合,有效提升大规模数据处理能力。

Comments Accepted at NeurIPS 2025 (Spotlight)

Journal ref Advances in Neural Information Processing Systems 38 (2025): 154538-154565

详情

展开后加载摘要…

URL PDF HTML 收藏