arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9087 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9087 篇

2410.01861 2024-10-04 cs.CV 86%

OCC-MLLM-Alpha:Empowering Multi-modal Large Language Model for the Understanding of Occluded Objects with Self-Supervised Test-Time Learning

Shuxin Yang, Xinhan Di

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(title);分类 cs.CV

Comments Accepted by ECCV 2024 Observing and Understanding Hands in Action Workshop (5 pages, 3 figures, 2 tables). arXiv admin note: substantial text overlap with arXiv:2410.01261

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11616 2026-08-14 cs.AI cs.CV cs.LG 版本更新 86%

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

MBA:面向现实世界商业创意的多模态基准与智能体

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究推出首个多模态商业创意基准MBA-Bench,提出MBA-b和MBA-k两种智能体,经实验其性能显著优于相关基准,为多模态商业创意智能体研究提供了重要支撑。

Comments Project page: https://hchoi256.github.io/projects/mba/ Code: https://github.com/hchoi256/MBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 86%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20295 2026-08-10 cs.LG cs.AI cs.CV 版本更新 86%

Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription

通过封面判断书籍:调查多模态大语言模型用于多页手写文档转录

Benjamin Gutteridge, Matthew Thomas Jackson, Toni Kukurin, Xiaowen Dong

机构 * University of Oxford(牛津大学) QuantCo

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究多模态大语言模型在多页手写文档转录中的应用,提出OCR+PAGE-1和OCR+PAGE-N策略,通过共享页面内容提升转录效果。

Comments 10 pages (36 including references and appendices), 11 figures, accepted at COLM 2026, earlier version accepted at AAAI 2025 Workshop on Document Understanding and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04759 2026-08-06 cs.CV cs.CL 新提交 86%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24856 2026-07-29 cs.CV cs.AI 新提交 86%

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧

Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Southeast University(东南大学自动化学院) Department of Geography, National University of Singapore(新加坡国立大学地理系)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00546 2026-07-16 cs.AI cs.CV 版本更新 86%

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型

Zeyu Chen, Huanjin Yao, Ziwang Zhao, Min Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30794 2026-07-08 cs.CV cs.AI 版本更新 86%

MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

MechVQA:在综合机械图纸理解上基准测试与增强多模态大语言模型

Qian Kou, Xiaofeng Shi, Yulin Li, Xiaosong Qiu, Xinyang Wang, Hua Zhou, Cao Dongxing

机构 * Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所) Beijing University of Technology, China(北京理工大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在机械工程图纸理解上的不足,提出首个综合机械图纸理解数据集MechVQA,并开发MechVL模型,通过多阶段训练显著提升性能。

Comments accept by iclm2026, add github link

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea, PMLR 306 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21666 2026-05-28 cs.AI cs.CV 86%

SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

SONIC-O1:用于评估多模态大语言模型在音视频理解上的真实世界基准

Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum, Deval Pandya, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Groningen(Groningen大学) York University(约克大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出SONIC-O1基准,包含60小时人工验证的音视频数据,评估多模态大语言模型在开放摘要、多项选择问答和时序定位上的能力,发现模型在时序定位上存在显著性能差距和人口统计偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08820 2026-05-12 cs.CV cs.AI cs.CR 86%

FraudBench: A Multimodal Benchmark for Detecting AI-Generated Fraudulent Refund Evidence

FraudBench: 一个多模态基准用于检测AI生成的欺诈性退款证据

Xinyu Yan, Boyang Chen, Jiaming Zhang, Tiantong Wu, Hong Xi Tae, Yichen He, Tiantong Wang, Yachun Mi, Yurong Hao, Yilei Zhao, Lei Xiao, Longtao Huang, Pengjun Xie, Wei Liu, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性科技实验室) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出FraudBench,一个用于检测AI生成欺诈性退款证据的多模态基准。通过真实用户评价证据构建,结合图像编辑模型生成伪造证据,并评估不同模型在不同生成器下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25720 2026-04-29 cs.CV cs.CL 86%

Toward Multimodal Conversational AI for Age-Related Macular Degeneration

迈向年龄相关性黄斑变性的多模态对话式人工智能

Ran Gu, Benjamin Hou, Mélanie Hébert, Asmita Indurkar, Yifan Yang, Emily Y. Chew, Tiarnán D. L. Keenan, Zhiyong Lu

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 本文提出OcularChat,一种基于多模态大语言模型的系统,通过模拟患者与医生对话,利用视网膜彩色照相进行黄斑变性诊断,展现出优于现有模型的分类性能和临床解释能力。

Comments 38 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22884 2026-04-28 cs.CV cs.AI 86%

Can Multimodal Large Language Models Truly Understand Small Objects?

多模态大语言模型真的能理解小物体吗?

Fujun Han, Junan Chen, Xintong Zhu, Jingqi Ye, Xuanjie Mao, Tao Chen, Peng Ye

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出SOUBench基准,评估现有多模态大语言模型对小物体的理解能力,发现其能力有限,并通过SOU-Train数据集提升模型表现。

Comments Under Peer Review (26 pages, 9 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10971 2026-04-14 cs.CV cs.AI 86%

MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models

MMR-AD:一个大规模多模态数据集,用于基于多模态大语言模型的通用异常检测基准测试

Xincheng Yao, Zefeng Qian, Chao Shi, Jiayang Song, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMR-AD数据集,用于评估多模态大语言模型在通用异常检测中的性能,揭示当前SOTA模型与工业需求的差距,并提出基于推理的Anomaly-R1模型,实现了异常检测与定位的显著提升。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06688 2026-03-16 cs.CV cs.AI 86%

Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

叙事编织者:迈向多模态可控的长程视觉一致性

Zhengjian Yao, Yongzhi Li, Xinyuan Gao, Quan Chen, Peng Jiang, Yanye Lu

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09427 2026-03-03 cs.CV cs.AI 86%

A High-Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation

一种高质量数据集和可靠的评估方法用于交错图像-文本生成

Yukang Feng, Jianwen Sun, Chuanhao Li, Zizhen Li, Jiaxin Ai, Fanrui Zhang, Yifan Chang, Sizhuo Zhou, Shenglin Zhang, Yu Dai, Kaipeng Zhang

机构 * Nankai University(南开大学) Shanghai Innovation Institute(上海创新研究院) Shanda AI Research(尚德人工智能研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :image-text(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 InterSyn数据集通过高质量、大规模和多样化指导设计,提升LMMs在图像-文本生成任务中的性能,并提出SynJudge评估方法,全面评估内容和跨模态交互质量。

Comments Accepted in ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21717 2026-02-03 cs.CL cs.CV 86%

CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution

CrossCheck-Bench:多模态冲突解决中的组成性故障诊断

Baoliang Tian, Yuxuan Si, Jilong Wang, Lingyao Li, Zhongyuan Bao, Zineng Zhou, Tao Wang, Sixu Li, Ziyao Xu, Mingze Wang, Zhouzhuo Zhang, Zhihao Wang, Yike Yun, Ke Tian, Ning Yang, Minghui Qiu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15241 2025-09-22 cs.CV cs.CL 86%

M-PACE: Mother Child Framework for Multimodal Compliance

Shreyash Verma, Amit Kesari, Vinayak Trivedi, Anupam Purwar, Ratnesh Jamidar

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

Comments The M-PACE framework uses a "mother-child" AI model system to automate and unify compliance checks for ads, reducing costs while maintaining high accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12591 2025-08-19 cs.CL cs.AI cs.SD 86%

Beyond Modality Limitations: A Unified MLLM Approach to Automated Speaking Assessment with Effective Curriculum Learning

Yu-Hsuan Fang, Tien-Hong Lo, Yao-Ting Sung, Berlin Chen

机构 * National Taiwan Normal University(台湾国立正常大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted at IEEE ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17539 2025-07-24 cs.AI cs.CV eess.IV 86%

Constructing Ophthalmic MLLM for Positioning-diagnosis Collaboration Through Clinical Cognitive Chain Reasoning

Xinyao Liu, Diping Song

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05058 2024-11-26 cs.SD cs.MM eess.AS 86%

Multimodal Fish Feeding Intensity Assessment in Aquaculture

Meng Cui, Xubo Liu, Haohe Liu, Zhuangzhuang Du, Tao Chen, Guoping Lian, Daoliang Li, Wenwu Wang

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18193 2024-06-27 cs.CV cs.AI 86%

MammothModa: Multi-Modal Large Language Model

Qi She, Junwen Pan, Xin Wan, Rui Zhang, Dawei Lu, Kai Huang

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16211 2024-04-02 cs.CV cs.AI 86%

VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models

Zihao Zhu, Mingda Zhang, Shaokui Wei, Bingzhe Wu, Baoyuan Wu

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14203 2023-09-26 cs.CV 86%

Detecting and Grounding Multi-Modal Media Manipulation and Beyond

Rui Shao, Tianxing Wu, Jianlong Wu, Liqiang Nie, Ziwei Liu

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Extension of our CVPR 2023 paper: arXiv:2304.02556 Code: https://github.com/rshaojimmy/MultiModal-DeepFake

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13173 2026-05-14 cs.DB 86%

OxyEcomBench: Benchmarking Multimodal Foundation Models across E-Commerce Ecosystems

OxyEcomBench:跨电子商务生态系统的多模态基础模型基准测试

Yong Liu, Ximan Liu, Guoqing Yang, Bing Bai, Xiaoqiang Xu, Zhen Chen, Ke Zhang, Yan Li

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title)

AI总结 本文提出OxyEcomBench,一个涵盖6300个高质量实例的多模态基准,用于评估模型在电子商务场景中的表现,通过覆盖平台运营者、商家和消费者六个能力方面和29项任务,验证模型在多模态输入下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02561 2026-08-04 cs.CV 新提交 85%

ReMiX-MAE: Learning Missing-Channel Cross-Modal Representations from RGB-Only Clinical Facial Videos for Sympathetic-Mediated Pain Assessment

ReMiX-MAE:从仅含RGB的临床面部视频中学习缺失通道跨模态表征以用于交感介导的疼痛评估

Nan Bi, Taoyue Wang, Lijun Yin, Vandana Sharma

机构 * School of Computing, Binghamton University(宾汉姆顿大学计算学院) SUNY Upstate Medical University(纽约州立大学上州医科大学)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出ReMiX-MAE框架,构建SMP数据集,在仅用RGB的疼痛评估任务中,其性能优于仅用RGB的基线,且在数据有限的临床场景中迁移能力更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01008 2026-08-04 cs.AI 新提交 85%

Toward Fine-Grained Forgetting:Attribute Unlearning for Multimodal Large Language Models

面向细粒度遗忘:多模态大语言模型的属性遗忘

Junkai Lin, Junkai Chen, Siqi Hou, Yuhao He, Ruiqi Liu, Chenhan Jin, Shengze Xu, Tieyong Zeng

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 针对多模态大语言模型(MLLMs)属性遗忘的细粒度需求,提出轻量级训练无关框架CLRP,通过激活修补定位因果层并应用保留感知投影,实现目标属性遗忘同时保留同一身份信息,在多种MLLMs上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11385 2026-08-04 cs.CV 版本更新 85%

DeceptionX: From Multimodal Evidence to Explainable Deception Detection

DeceptionX: 基于多模态大语言模型的可解释欺骗检测

Jiayu Zhang, Shuo Ye, Jiajian Huang, Yawen Cui, Taorui Wang, Wei Xia, Zeheng Wang, Haowen Tang, Yelin Wang, Hui Ma, Zitong Yu

机构 * Great Bay University(大湾区大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出DeceptionX框架,将欺骗检测从黑箱分类转变为可解释的观察-思考-总结推理过程,通过构建DeceptChain数据集和三阶段训练管道,在标准基准上超越现有方法,同时提供专家级可解释推理路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28318 2026-07-31 cs.AI 新提交 85%

PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?

PathView-Bench:多模态大语言模型能否实现病理图像的细粒度多尺度理解?

Zongyi Chen, Yu Liang, Jie Lin, Liansheng Wang

机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康与医学数据科学国家研究院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对现有病理多模态基准的不足,推出PathVU基准,评估发现主流MLLMs在多尺度病理图像细粒度视觉任务上存在显著局限,为相关模型的开发评估提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25325 2026-07-21 cs.AI 版本更新 85%

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

全模态感知策略优化用于多模态情感推理

Zhiyuan Han, Beier Zhu, Wenwen Tong, Pengyang Shao, Peipei Song, Xinyi Wang, Jiangnan Chen, Lewei Lu, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) SenseTime Research(商汤科技研究院) National University of Singapore(新加坡国立大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.AI

AI总结 提出OPPO强化学习框架,通过全模态感知奖励和损失优化多模态感知,提升情感推理中模态利用率和忠实度,在多个基准上达到最优。

Comments Accepted at ICML 2026. Project page: https://zjycutieee.github.io/OPPO-page/ Code: https://github.com/ZhiyuanHan-Aaron/OPPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09492 2026-07-13 cs.AI 新提交 85%

Multimodal Reward Hacking in Reinforcement Learning

强化学习中的多模态奖励黑客攻击

Jiayu Yao, Yiwei Wang, Anmeng Zhang, Zhe Sun, Songsong Wang, Lingrui Mei, Yuyao Ge, Shenghua Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) Southeast University(东南大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究强化学习中多模态奖励黑客攻击问题,通过引入新奖励失败率(NRFR)等方法,在多种设置下改变模型规模、算法等因素进行实验,发现仅结果奖励易导致黑客攻击,扩大规模可减少但不能消除,还得出不同算法和奖励方式对黑客攻击的影响及相关结论。

详情

展开后加载摘要…

URL PDF HTML 收藏