arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1439 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 200 篇

2601.00126 2026-07-21 cs.RO 版本更新 50%

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10201 2026-07-21 cs.GR 版本更新 50%

B-repLer: Language-guided Editing of CAD Models

B-repLer:CAD模型的语言引导编辑

Yilin Liu, Niladri Shekhar Dutt, Changjian Li, Niloy J. Mitra

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究语言引导的CAD编辑问题,提出B-repLer框架直接连接自然语言与CAD模型编辑,绕过构建历史,还引入数据集,展示其自动生成等方法,能对复杂CAD形状准确执行复杂编辑。

Comments Accepted by SIGGRAPH 2026; Project page at https://yilinliu77.github.io/brepler.github.io Code at https://github.com/yilinliu77/Brepler

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10051 2026-07-21 q-bio.NC cs.ET 版本更新 50%

An Intelligent Infrastructure as a Foundation for Modern Science

作为现代科学基础的智能基础设施

Satrajit S. Ghosh

专题命中 多模态生成 :multimodal(abstract)

AI总结 以神经科学多模态和多尺度数据增长为背景,提出将基础设施转变为动态、与人工智能契合的生态系统的范式转变,给出实施原则的操作指南,强调人工智能协调作用,有望加速科学发现并转化为社会利益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14125 2026-07-15 stat.ML cs.LG 版本更新 50%

Spectral Diffusion Processes

谱扩散过程

Angus Phillips, Thomas Seror, Michael Hutchinson, Valentin De Bortoli, Arnaud Doucet, Emile Mathieu

机构 * University of Oxford(牛津大学) ENS, CNRS, PSL University Paris(巴黎高等师范学院、国家科学研究中心、巴黎大学) University of Cambridge(剑桥大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究将扩散模型应用于函数空间上的随机过程,通过谱表示分离随机部分与时空结构,用有限维扩散模型建模谱系数,经截断确保模型有效性,投影回原空间对应相关噪声扩散模型,还展示了方法在多模态数据建模及条件采样上的有效性。

Comments This version (v3) extends the previous workshop version (v2) with conditional sampling and theoretical results. Work carried out in 2022/23. V2 appeared in Score-based Methods Workshop at the 36th Conference on Neural Information Processing Systems (NeurIPS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17527 2026-07-14 cs.RO 版本更新 50%

Safer Trajectory Planning with CBF-guided Diffusion Model for Unmanned Aerial Vehicles

基于CBF引导扩散模型的无人机安全轨迹规划

Peiwen Yang, Shiyu Bai, Weisong Wen, Yixin Gao, Jiahao Hu

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出AeroTrajGen框架,通过CBF引导采样提升扩散模型在无人机轨迹生成中的安全性与敏捷性,减少碰撞率94.7%。

Comments Some equations need to be checked

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05576 2026-07-14 cs.RO 版本更新 50%

Task Parameter Extrapolation via Learning Inverse Tasks from Forward Demonstrations

通过从正向演示中学习逆向任务进行任务参数外推

Serdar Bahar, Fatih Dogangun, Matteo Saveriano, Yukie Nagai, Emre Ugur

机构 * Bogazici University(博雅科技大学) University of Trento(特伦托大学) The University of Tokyo(东京大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种基于任务逆向学习的联合学习方法,通过利用辅助正向演示实现准确且高效的知识转移,以解决机器人学习中的泛化问题。

Comments Accepted for publication in IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03564 2026-07-14 cs.LG 版本更新 50%

CoGenCast: A Coupled Autoregressive-Flow Generative Framework for Time Series Forecasting

CoGenCast:用于时间序列预测的耦合自回归流生成框架

Mingyue Cheng, Yaguo Liu, Daoyu Wang, Xiaoyu Tao, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对时间序列预测需兼顾语义理解与随机建模的问题,提出CoGenCast框架,将预训练大语言模型与流匹配机制结合,通过修改注意力拓扑重配置模型,集成流匹配机制捕捉动态,实现多模态预测和跨域统一训练,实验显示性能具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16565 2026-07-14 eess.SY cs.SY 版本更新 50%

Agentic AI-RAN Empowering Synergetic Sensing, Communication, Computing, and Control

智能人工智能无线接入网络助力协同感知、通信、计算和控制

Lingxiao Sun, Zhaoyang Zhang, Zihan Lin, Zirui Chen, Weijie Zhou, Zhaohui Yang, Tony Q. S. Quek

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究6G低空无线网络中,智能人工智能无线接入网络(Agentic AI-RAN)架构助力协同SC3任务执行。提出面向任务的架构解决资源受限边缘环境异构负载协调难题,经无人机系统原型验证,该框架在6G关键任务低空网络中具可行性。

Comments 7 pages, 5 figures, 1 table; revised version with minor corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03360 2026-07-09 math.ST stat.TH 版本更新 50%

Structured drift design for denoising diffusion models

去噪扩散模型的结构化漂移设计

Mahsa Taheri

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出几何感知Ornstein-Uhlenbeck过程,通过方差感知各向异性漂移嵌入数据几何结构,改善扩散模型对多模态、高相关分布的模式分离和相关性保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01894 2026-07-09 cs.LG 版本更新 50%

Bifidelity Parameter Estimation Using Conditional Diffusion Models

使用条件扩散模型的双保真参数估计

Caroline Tatsuoka, Minglei Yang, Dongbin Xiu, Guannan Zhang

机构 * UT-Battelle, LLC(UT-巴特勒公司) US Department of Energy(美国能源部) The Ohio State University(俄亥俄州立大学) Oak Ridge National Laboratory(橡树岭国家实验室) Oak Ridge(橡树岭) Computer Science and Mathematics Division(计算机科学与数学 division)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对复杂系统参数估计不确定性量化,提出双保真方法。先构建低保真条件生成模型,特定情况时用其细化采样空间,再训练高保真无条件生成模型,经数值示例和实际应用验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09832 2026-06-26 astro-ph.GA astro-ph.CO astro-ph.IM 版本更新 50%

LITMUS: Bayesian Lag Recovery in Reverberation Mapping with Fast Differentiable Models

LITMUS:基于快速可微模型的贝叶斯滞后恢复在回波测绘中的应用

Hugh McDougall, Tamara M. Davis, Benjamin J. S. Pope

专题命中 多模态生成 :multimodal(abstract)

AI总结 LITMUS利用快速可微模型实现回波测绘中滞后恢复,通过处理季节观测窗口的多模态混叠问题,提高滞后验证的准确性,显著优于现有方法JAVELIN。

Comments 17 Pages, 10 Figures

Journal ref pasa.2026.10149

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21860 2026-06-24 math.OC stat.ML 版本更新 50%

Pathwise Learning of Stochastic Dynamical Systems with Partial Observations

部分观测下随机动力系统的路径学习

Nicole Tianjiao Yang

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出一种摊销路径生成方法,通过变分推断和受控SDE表示,从噪声观测中学习随机动力系统的滤波分布,实现不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18457 2026-06-23 eess.SP 版本更新 50%

Sense Smarter, Think Better: A Survey on Edge Perception for Next-Generation Networks

智能感知,更优思考:面向下一代网络的边缘感知

Zhonghao Lyu, Xiaowen Cao, Xianxin Song, Yuchen Li, Jiacheng Wang, Shuoyao Wang, Yuanhao Cui, Weijie Yuan, Xianghao Yu, Guangxu Zhu, Hai Liu, Jie Xu, Derrick Wing Kwan Ng, Shuguang Cui

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文综述了边缘感知的核心方法与贡献,涵盖传感模态、边缘AI技术及其协同作用,分析了边缘AI如何增强感知能力,并探讨了任务驱动感知在边缘AI中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02581 2026-06-23 cs.LG 版本更新 50%

Training Diffusion Policies via Prior-Mapping Co-Evolution

通过先验映射协同进化训练扩散策略

Chubin Zhang, Zhenglin Wan, Feng Chen, Fuchao Yang, Lang Feng, Yaxin Zhou, Xingrui Yu, Yang You, Ivor Tsang, Bo An

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Carnegie Mellon University(卡内基梅隆大学) CFAR Agency for Science Technology and Research(科技研究局(CFAR)) IHPC Agency for Science Technology and Research(科技研究局(IHPC))

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出GoRL框架,通过将策略优化限制在易处理的潜空间,同时用条件生成解码器合成动作,解耦优化与生成,实现稳定优化与表达力提升,在连续控制任务上显著超越基线。

Comments Ver 3 (Accepted as a conference paper by ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00271 2026-06-19 cs.RO 版本更新 50%

Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online

从我们所拥有的学习:在线推理过去交互的历史感知验证器

Yishu Li, Xinyi Mao, Ying Yuan, Kyutae Sim, Ben Eisner, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出历史感知验证器HAVE,通过解耦动作生成与验证,利用历史交互在线消除歧义,理论证明其提升期望动作质量,在多个模拟和真实环境中验证有效性。

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28690 2026-06-18 quant-ph cs.LG 版本更新 50%

Latent-Conditioned Parameterized Quantum Circuits as Universal Approximators for Distributions over Quantum States

潜在条件参数化量子电路作为量子态分布的通用近似器

Quoc Hoan Tran, Koki Chinzei, Yasuhiro Endo, Hirotaka Oshima

机构 * Quantum Laboratory, Fujitsu Research, Fujitsu Limited(Fujitsu 研究所量子实验室, Fujitsu 有限公司)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出潜在条件参数化量子电路(LPQC),通过经典神经网络将潜在变量映射到量子电路参数,证明其在1-Wasserstein距离下是密度算子概率测度的通用近似器,并引入多模态潜在先验和专家混合电路架构缓解贫瘠高原问题。

Comments 21 pages, 11 figures (fix the proof and update appendix for barren plateaus analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09465 2026-06-16 stat.ML cs.LG 版本更新 50%

Branching Flows: Discrete, Continuous, and Manifold Flow Matching with Splits and Deletions

分支流:带有分裂和删除的离散、连续和流形流匹配

Lukas Billera, Hedwig Nora Nordlinder, Jack Collier Ryder, Anton Oresten, Aron Stålmarck, Theodor Mosetti Björk, Ben Murrell

机构 * Department of Microbiology, Tumor and Cell Biology, Karolinska Institutet(卡罗林斯卡研究所微生物学、肿瘤和细胞生物学系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出分支流框架,通过随机分支和死亡过程控制序列元素数量,适用于变长数据生成,并在小分子、抗体序列和蛋白质骨架生成中验证效果。

Comments 39 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13751 2026-06-16 cs.LG 版本更新 50%

Manifold-Orthogonal Dual-spectrum Extrapolation for Parameterized Physics-Informed Neural Networks

流形正交双谱外推法用于参数化物理信息神经网络

Zhangyong Liang, Huanhuan Gao

机构 * National Center for Applied Mathematics, Tianjin University(天津大学应用数学中心) School of Mechanical and Aerospace Engineering, Jilin University(吉林大学机械与 aerospace 工程学院)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 提出流形正交双谱外推法(MODE),通过主谱密集混合、残谱激活和平移解锁三种机制,在保持SVD参数效率的同时实现参数化PINN的强分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09787 2026-06-09 astro-ph.IM astro-ph.GA cs.LG 版本更新 50%

Learning What's Real: Disentangling Signal and Measurement Artifacts in Multi-Sensor Data, with Applications to Astrophysics

学习真实内容:在多传感器数据中分离信号和测量伪影,应用于天体物理学

Pablo Mercader-Perez, Carolina Cuesta-Lazaro, Daniel Muthukrishna, Jeroen Audenaert, V. Ashley Villar, David W. Hogg, Marc Huertas-Company, William T. Freeman

机构 * Massachusetts Institute of Technology(麻省理工学院) Flatiron Institute, Simons Foundation(Flatiron研究所,Simons基金会) Institute for Advanced Studies(高级研究 institute) Harvard University(哈佛大学) New York University(纽约大学) Instituto de Astrofísica de Canarias(加那利大天文台)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出一种深度学习框架,通过重叠观测、双编码器架构和反事实生成目标,分离多传感器数据中的信号与伪影,提升天体物理学研究的准确性。

Comments Accepted at the 2nd Workshop on Foundation Models for Science at ICLR 2026. 10 pages, 7 figures (main text), plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15422 2026-06-09 cs.SE 版本更新 50%

A Survey on the Applications of Generative Artificial Intelligence in Automated Driving Systems Test Scenario Generation Methods

生成式人工智能在自动驾驶系统测试场景生成方法中的应用综述

Ji Zhou, Yongqi Zhao, Yixian Hu, Hexuan Li, Zhengguo Gu, Nan Xu, Arno Eichberger

专题命中 多模态生成 :multimodal(abstract)

AI总结 综述生成式AI在自动驾驶测试场景生成中的应用,分析31篇主要研究,提出包含多模态扩展、伦理检查表和ODD覆盖图的分类法,以解决标准化评估缺失等问题。

Comments 40 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 301 篇

2512.02318 2026-06-15 cs.CR cs.AI 版本更新 89%

COGNITION: From Evaluation to Defense against Multimodal LLM CAPTCHA Solvers

认知:从评估到对抗多模态大语言模型CAPTCHA求解器

Junyu Wang, Changjia Zhu, Yuanbo Zhou, Lingyao Li, Xu He, Mingkui Wei, Junjie Xiong

机构 * Missouri University of Science and Technology(密苏里科技大学) University of South Florida(佛罗里达州立大学) Visa Inc.(Visa公司) George Mason University(乔治·马歇尔大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型如何削弱视觉CAPTCHA的安全性,评估7种主流MLLM在18种CAPTCHA任务中的表现,揭示其解决能力及防御策略。

Comments Accepted by USENIX Sec'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03300 2026-06-17 cs.LG cs.AI cs.CL cs.CV 版本更新 88%

R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?

R1-SyntheticVL:生成模型的合成数据是否已为多模态大语言模型做好准备?

Jingyi Zhang, Tianyi Lin, Huanjin Yao, Xiang Lan, Shunyu Liu, Jiaxing Huang

机构 * Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出集体对抗数据合成(CADS)方法,通过集体智能和对抗学习自动生成高质量、多样且具有挑战性的多模态数据,用于增强多模态大语言模型(MLLM)在复杂现实任务中的性能。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27637 2026-08-04 cs.CV 版本更新 87%

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

MMOOC:多模态大语言模型的上下文外评估综合基准

Wenjie Zhu, Yabin Zhang, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MMOOC基准,评估多模态大语言模型在上下文偏移场景下的拒绝与作答能力,实验发现当前模型难以平衡可答性与拒绝性,后训练可提升稳健性,该基准将公开。

Comments project page:https://zhuwenjie98.github.io/MMOOC-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23786 2026-07-20 cs.AI cs.LG 版本更新 86%

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

FAIR_XAI: 通过可解释性提升多模态基础模型公平性以用于幸福感评估

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Harvard University(哈佛大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.AI

AI总结 本文研究了多模态基础模型在幸福感评估中的公平性问题,通过可解释性干预框架改善诊断可靠性与公平性,发现不同模型在不同数据集上表现差异显著,且存在性别和种族偏见。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11616 2026-08-14 cs.AI cs.CV cs.LG 版本更新 86%

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

MBA:面向现实世界商业创意的多模态基准与智能体

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究推出首个多模态商业创意基准MBA-Bench,提出MBA-b和MBA-k两种智能体,经实验其性能显著优于相关基准,为多模态商业创意智能体研究提供了重要支撑。

Comments Project page: https://hchoi256.github.io/projects/mba/ Code: https://github.com/hchoi256/MBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20295 2026-08-10 cs.LG cs.AI cs.CV 版本更新 86%

Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription

通过封面判断书籍:调查多模态大语言模型用于多页手写文档转录

Benjamin Gutteridge, Matthew Thomas Jackson, Toni Kukurin, Xiaowen Dong

机构 * University of Oxford(牛津大学) QuantCo

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究多模态大语言模型在多页手写文档转录中的应用,提出OCR+PAGE-1和OCR+PAGE-N策略,通过共享页面内容提升转录效果。

Comments 10 pages (36 including references and appendices), 11 figures, accepted at COLM 2026, earlier version accepted at AAAI 2025 Workshop on Document Understanding and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00546 2026-07-16 cs.AI cs.CV 版本更新 86%

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型

Zeyu Chen, Huanjin Yao, Ziwang Zhao, Min Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30794 2026-07-08 cs.CV cs.AI 版本更新 86%

MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

MechVQA:在综合机械图纸理解上基准测试与增强多模态大语言模型

Qian Kou, Xiaofeng Shi, Yulin Li, Xiaosong Qiu, Xinyang Wang, Hua Zhou, Cao Dongxing

机构 * Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所) Beijing University of Technology, China(北京理工大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在机械工程图纸理解上的不足,提出首个综合机械图纸理解数据集MechVQA,并开发MechVL模型,通过多阶段训练显著提升性能。

Comments accept by iclm2026, add github link

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea, PMLR 306 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11385 2026-08-04 cs.CV 版本更新 85%

DeceptionX: From Multimodal Evidence to Explainable Deception Detection

DeceptionX: 基于多模态大语言模型的可解释欺骗检测

Jiayu Zhang, Shuo Ye, Jiajian Huang, Yawen Cui, Taorui Wang, Wei Xia, Zeheng Wang, Haowen Tang, Yelin Wang, Hui Ma, Zitong Yu

机构 * Great Bay University(大湾区大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出DeceptionX框架,将欺骗检测从黑箱分类转变为可解释的观察-思考-总结推理过程,通过构建DeceptChain数据集和三阶段训练管道,在标准基准上超越现有方法,同时提供专家级可解释推理路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25325 2026-07-21 cs.AI 版本更新 85%

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

全模态感知策略优化用于多模态情感推理

Zhiyuan Han, Beier Zhu, Wenwen Tong, Pengyang Shao, Peipei Song, Xinyi Wang, Jiangnan Chen, Lewei Lu, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) SenseTime Research(商汤科技研究院) National University of Singapore(新加坡国立大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.AI

AI总结 提出OPPO强化学习框架,通过全模态感知奖励和损失优化多模态感知,提升情感推理中模态利用率和忠实度,在多个基准上达到最优。

Comments Accepted at ICML 2026. Project page: https://zjycutieee.github.io/OPPO-page/ Code: https://github.com/ZhiyuanHan-Aaron/OPPO

详情

展开后加载摘要…

URL PDF HTML 收藏