arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-10 至 2026-04-10 共收录 85 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 11 篇

2604.08522 2026-04-10 cs.CV 70%

UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding

UniversalVTG: 一种通用且轻量的视频时间定位基础模型

Joungbin An, Agrim Jain, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出UniversalVTG,一种通用轻量视频时间定位模型,通过大规模跨数据集预训练实现高效长视频定位,优于专用模型且比大语言模型更轻量。

Comments Project Page: https://vision.cs.utexas.edu/projects/universalvtg

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07772 2026-04-10 cs.CV 57%

ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions

ESOM:基于开放世界动态定义的高效流视频异常理解

Zihao Liu, Xiaoyu Wu, Wenna Li, Jianqin Wu, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出ESOM模型,通过定义规范化、帧间匹配、混合流内存和概率评分模块,实现高效流视频异常检测,同时引入OpenDef-Bench基准测试,在单GPU上实现实时效率和先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06036 2026-04-10 cs.DC cs.CV cs.LG 57%

CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference

CodecSight: 利用视频编码信号实现高效的流式视频语言模型推理

Yulin Zou, Yan Chen, Wenyan Chen, JooYoung Park, Shivaraman Nitin, Luo Tao, Francisco Romero, Dmitrii Ustiugov

机构 * Beihang University(北京航空航天大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 CodecSight通过利用视频编码器内嵌的时空结构信息,实现流式视频分析的高效推理,提升吞吐量并减少GPU计算量,同时保持高精度。

Comments 18 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08443 2026-04-10 cs.RO cs.HC 50%

A Soft Robotic Interface for Chick-Robot Affective Interactions

一种柔软的机器人接口用于鸡-机器人情感互动

Jue Chen, Alexander Mielke, Kaspar Althoefer, Elisabetta Versace

机构 * Queen Mary University of London(伦敦玛丽女王大学) School of Biological and Behavioural Sciences, Queen Mary University of London(伦敦玛丽女王大学生物与行为科学学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种以动物为中心的柔软机器人情感接口,用于新生鸡的机器人情感互动研究,通过温度、呼吸样变形和面孔状视觉刺激等安全可控的提示,评估鸡对接口的接受度及与机器人互动。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 2 篇

2604.07863 2026-04-10 cs.IR cs.AI 79%

Task-Adaptive Retrieval over Agentic Multi-Modal Web Histories via Learned Graph Memory

基于学习图记忆的代理多模态网络历史任务自适应检索

Saman Forouzandeh, Kamal Berahmand, Mahdi Jalili

机构 * School of Engineering, Royal Melbourne Institute of Technology University(皇家墨尔本理工大学工程学院)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出ACGM方法,通过任务自适应图记忆检索代理历史,利用策略梯度优化提升检索质量,在多个数据集上取得显著成果。

Comments The 49th International ACM SIGIR Conference on Research and Development in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08008 2026-04-10 cs.CV cs.AI cs.LG 62%

SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving

SearchAD:大规模稀有图像检索数据集用于自动驾驶

Felix Embacher, Jonas Uhrig, Marius Cordts, Markus Enzweiler

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Institute for Intelligent Systems, Esslingen University of Applied Sciences(埃斯林根应用技术大学智能系统研究所)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 SearchAD为自动驾驶提供大规模稀有图像检索数据集,包含423k帧和513k个标注框,针对稀有类别检索问题,支持文本到图像和图像到图像检索及少样本学习。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 11 篇

2512.12623 2026-04-10 cs.CV cs.CL 84%

Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space

思维中的推理:潜在空间中的动态多模态交错

Chengzhi Liu, Yuzhe Yang, Yue Fan, Qingyue Wei, Sheng Liu, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出DMLR框架,通过动态潜在策略梯度优化和视觉注入策略,在潜在空间中实现视觉与文本的动态交错推理,提升多模态推理性能并保持高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11435 2026-04-10 cs.CV cs.AI 81%

The Persistence of Cultural Memory: Investigating Multimodal Iconicity in Diffusion Models

文化记忆的延续:探究扩散模型中的多模态图标性

Maria-Teresa De Rosa Palmini, Eva Cetinic

机构 * University of Zurich(苏黎世大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究扩散模型在文化共享视觉参考提示下的泛化与记忆模糊性,提出CRT指标评估模型对文化参考的识别与实现能力,揭示模型行为依赖于对参考的识别与再现方式,推动评估向更丰富的语境理解发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08068 2026-04-10 cs.CV 79%

Brain3D: EEG-to-3D Decoding of Visual Representations via Multimodal Reasoning

Brain3D: 通过多模态推理实现EEG到3D视觉表示的解码

Emanuele Balloni, Emanuele Frontoni, Chiara Matti, Marina Paolanti, Roberto Pierdicca, Emiliano Santarnecchi

机构 * Università Politecnica delle Marche(马尔凯理工大学) University of Macerata(马切拉塔大学) Horizon Intelligence Labs(地平线智能实验室) Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Brain3D,通过多模态推理实现EEG到3D解码,分阶段生成3D网格,提升神经解码的几何理解与应用性。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08063 2026-04-10 cs.CV 79%

EEG2Vision: A Multimodal EEG-Based Framework for 2D Visual Reconstruction in Cognitive Neuroscience

EEG2Vision:一种基于EEG的多模态框架,用于认知神经科学中的2D视觉重建

Emanuele Balloni, Emanuele Frontoni, Chiara Matti, Marina Paolanti, Roberto Pierdicca, Emiliano Santarnecchi

机构 * Università Politecnica delle Marche(马尔凯理工大学) University of Macerata(马切拉塔大学) Horizon Intelligence Labs(地平线智能实验室) Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 EEG2Vision通过多模态大语言模型和图像扩散模型提升低密度电极配置下的视觉重建质量,验证了低分辨率EEG设备在实时脑-图像应用中的可行性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-04-10 cs.CV 79%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Project Page: https://yunhe24.github.io/langdrivectrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23310 2026-04-10 cs.CV 79%

Balanced Diffusion-Guided Fusion for Multimodal Remote Sensing Classification

多模态遥感分类的平衡扩散引导融合

Hao Liu, Yongjie Zheng, Yuhan Kang, Mingyang Zhang, Maoguo Gong, Lorenzo Bruzzone

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) College of Electrical and Information Engineering, Hunan University(湖南大学电气与信息工程学院) Key Laboratory of Collaborative Intelligent Systems of Ministry of Education, Xidian University(西安电子科技大学教育部协同智能系统重点实验室) School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Academy of Artificial Intelligence, Inner Mongolia Normal University(内蒙古师范大学人工智能学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出平衡扩散引导融合框架,通过多模态扩散特征指导多分支网络进行土地覆盖分类,采用自适应模态掩码策略和跨模态注意力机制提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04678 2026-04-10 cs.CV 79%

ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Sensing

ChangeBridge: 多模态控制下的遥感时空图像生成

Zhenghui Zhao, Chen Wu, Xiangyong Cao, Di Wang, Hongruixuan Chen, Datao Tang, Liangpei Zhang, Zhuo Zheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ChangeBridge模型,通过多模态事件控制生成时空一致的遥感图像,解决了现有方法在跨时间变化建模上的不足,提升了土地利用规划和变化检测任务的数据生成能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07422 2026-04-10 cs.LG 78%

Multimodal Large Language Models for Multi-Subject In-Context Image Generation

多模态大语言模型用于多主体上下文图像生成

Yucheng Zhou, Dubing Chen, Huan Zheng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学,科技学院,计算机与信息科学系,智慧城市物联网国家重点实验室)

专题命中 多模态生成 :multimodal(title);MLLM(abstract)

AI总结 本文提出MUSIC模型,通过视觉链式思维机制和空间布局规划方法,解决多主体上下文图像生成中的主体缺失和语义漂移问题,并在多主体场景中取得显著优势。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08121 2026-04-10 cs.CV cs.AI 62%

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

Uni-ViGU:通过基于扩散的视频生成器实现视频生成与理解的统一

Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能实验室) Fudan University(复旦大学) Independent Researcher(独立研究者) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Uni-ViGU通过基于扩散的视频生成器统一视频生成与理解,引入统一流方法和模态驱动的MoE框架,实现多模态生成与理解的协同优化。

Comments Page and Code: https://fr0zencrane.github.io/uni-vigu-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08037 2026-04-10 cs.CR cs.AI cs.CV cs.LG 62%

PrivFedTalk: Privacy-Aware Federated Diffusion with Identity-Stable Adapters for Personalized Talking-Head Generation

PrivFedTalk: 隐私感知的联邦扩散模型与身份稳定的适配器用于个性化说话头生成

Soumya Mazumdar, Vineet Kumar Rakesh, Tapas Samanta

机构 * Engineering Sciences, Homi Bhabha National Institute(霍米·巴巴国立研究所工程科学系)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PrivFedTalk框架,结合条件潜在扩散模型与参数高效的身份适应,解决个性化说话头生成中的隐私问题,通过身份稳定联邦聚合和时间去噪一致性正则化提升性能。

Comments GitHub: https://github.com/mazumdarsoumya/PrivFedTalk

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08084 2026-04-10 cs.CV 57%

DiffVC: A Non-autoregressive Framework Based on Diffusion Model for Video Captioning

DiffVC: 一种基于扩散模型的非自回归框架用于视频描述生成

Junbo Wang, Liangyu Fu, Yuke Li, Yining Zhu, Ya Jing, Xuecheng Wu, Jiangbin Zheng

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Beijing University Of Technology(北京工业大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DiffVC,一种基于扩散模型的非自回归框架,解决视频描述生成中自回归方法速度慢和累积误差问题,通过并行解码和判别性条件扩散模型提升生成质量,实验表明其在多个数据集上优于非自回归方法并接近自回归方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态评测 14 篇

2604.07429 2026-04-10 cs.CV cs.AI cs.HC 84%

GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

GameWorld: 向标准化和可验证的多模态游戏代理评估迈进

Mingyu Ouyang, Siyuan Hu, Kevin Qinghong Lin, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GameWorld提出一个标准化且可验证的多模态游戏代理评估基准,包含34种游戏和170个任务,通过可验证的指标评估代理能力,揭示了当前代理在视频游戏中与人类能力的差距。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15118 2026-04-10 cs.CV 83%

VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents

VAREX:多模态结构提取文档的基准

Udi Barzelay, Ophir Azulai, Inbar Shapira, Idan Friedman, Foad Abo Dahood, Madison Lee, Abraham Daniels

机构 * IBM Research(IBM研究院)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 VAREX基准通过四类输入模态评估多模态基础模型在政府表格结构数据提取中的性能,揭示参数规模、输入格式对提取准确率的影响,强调结构合规性是关键瓶颈。

Comments 9 pages, 4 figures, 4 tables, plus 12-page supplementary. Dataset: https://huggingface.co/datasets/ibm-research/VAREX Code: https://github.com/udibarzi/varex-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08140 2026-04-10 cs.CR cs.AI cs.MM cs.NI 82%

Multimodal Reasoning with LLM for Encrypted Traffic Interpretation: A Benchmark

基于LLM的多模态推理用于加密流量解释:一个基准

Longgang Zhang, Xiaowei Fu, Fuxiang Huang, Lei Zhang

机构 * School of Microelectronics and Communication Engineering, Chongqing University(重庆大学微电子与通信工程学院) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 本文提出BGTD基准和mmTraffic框架,通过结合原始字节与结构化注释,实现可解释的加密流量解释,生成高保真的人可读报告,同时保持高分类准确率。

Comments Project page \url{https://github.com/lgzhangzlg/Multimodal-Reasoning-with-LLM-for-Encrypted-Traffic-Interpretation-A-Benchmark}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18472 2026-04-10 cs.AI cs.CV 81%

Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding

多模态大语言模型在离散符号理解中的认知不匹配

Yinghui Li, Jiayi Kuang, Peng Xing, Daixian Liu, Yongheng Zhang, Junnan Dong, Shu-Yu Guo, Yangning Li, Qingyu Zhou, Wenhao Jiang, Hai-Tao Zheng, Ying Shen, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Independent Researcher(独立研究员) The Hong Kong Polytechnic University(香港理工大学) Guangdong Laboratory of AI and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究发现多模态大语言模型在离散符号识别上表现欠佳,而在复杂推理任务上表现较好,揭示了当前系统依赖语言先验而非稳健视觉基础的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20718 2026-04-10 cs.CV cs.AI 81%

MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models

MM-MoralBench: 一种多模态道德评估基准用于大型视觉-语言模型

Bei Yan, Jie Zhang, Zhiyuan Chen, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 为评估大型视觉-语言模型的道德对齐性,提出MM-MoralBench基准,通过多模态场景测试模型在六个道德基础上的判断与分类能力,揭示模型存在显著的道德偏见问题。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06925 2026-04-10 cs.MM 79%

LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment

LungCURE:多模态真实世界临床推理基准测试用于精准肺癌诊断与治疗

Fangyu Hao, Jiayu Yang, Yifan Zhu, Zijun Yu, Qicen Wu, Wang Yunlong, Jiawei Li, Yulin Liu, Xu Zeng, Guanting Chen, Shihao Li, Zhonghong Ou, Meina Song, Mengyang Sun, Haoran Luo, Yu Shi, Yingyi Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出LungCURE基准测试,通过1000个真实世界病例评估多模态模型在肺癌TNM分期、治疗推荐和临床决策支持中的性能,并引入LCAgent框架提升模型在复杂医疗场景中的推理能力。

Comments 20 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23322 2026-04-10 cs.CV 79%

Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework

缓解大多模态模型中的视觉上下文退化:一种无需训练的解耦代理框架

Hongrui Jia, Chaoya Jiang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Shandong University(山东大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出无需训练的解耦代理框架DRP,通过让LLM作为策略推理者与LMM作为观察者解耦,有效缓解多模态推理中的视觉退化问题,实验表明其在MathVision基准上准确率优于GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08540 2026-04-10 cs.CV cs.AI cs.CL 75%

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准

Ziwei Zhou, Zeyuan Lai, Rui Wang, Yifan Yang, Zhen Xing, Yuqing Yang, Qi Dai, Lili Qiu, Chong Luo

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08494 2026-04-10 cs.CV cs.CL cs.HC 73%

What They Saw, Not Just Where They Looked: Semantic Scanpath Similarity via VLMs and NLP metric

他们所见,而不仅仅是他们看的地方:通过VLMs和NLP度量的语义扫视路径相似性

Mohamed Amine Kerkouri, Marouane Tliba, Bin Wang, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * Northwestern University(西北大学) Radiology, Northwestern University(西北大学放射学系)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

AI总结 本文提出一种整合视觉语言模型的语义扫视路径相似性框架,通过控制视觉上下文生成文本描述,利用NLP度量计算语义相似性,揭示空间差异下的内容一致性。

Comments Accepted at ETRA 2026 GenAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07763 2026-04-10 cs.CV cs.AI 73%

Beyond Surface Artifacts: Capturing Shared Latent Forgery Knowledge Across Modalities

超越表面伪影:跨模态捕捉共享的潜在伪造知识

Jingtong Dou, Chuancheng Shi, Jian Wang, Fei Shen, Zhiyong Wang, Tat-Seng Chua

机构 * The University of Sydney(悉尼大学) Nanjing University of Posts and Telecommunications(南京邮电大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种跨模态伪造检测框架MAF,通过解耦模态特定风格,提取跨模态的潜在伪造知识,并定义了两个维度评估模型泛化能力,推动多模态防伪技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07883 2026-04-10 cs.AI cs.CL cs.CY cs.MA 62%

An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks

用于教育教科书历史偏见检测的代理评估架构

Gabriel Stefan, Adrian-Marius Dumitran

机构 * University of Bucharest(布加勒斯特大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种代理评估架构,通过多模态筛查代理、异质陪审团和元代理,有效检测教育教科书中的隐性偏见,实验表明其在经济性和准确性上具有优势。

Comments Accepted for ITS(Intelligent Tutoring Systems) 2026 Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22683 2026-04-10 cs.CV cs.AI 62%

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08211 2026-04-10 cs.CV 57%

SciFigDetect: A Benchmark for AI-Generated Scientific Figure Detection

SciFigDetect:一种用于AI生成科学图表检测的基准测试

You Hu, Chenzhuo Zhao, Changfa Mo, Haotian Liu, Xiaobai Li

机构 * Zhejiang University(浙江大学) Independent Researcher(独立研究员) University of Oulu(奥卢大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个AI生成科学图表检测基准,通过多模态数据管道构建,涵盖多种图表类别和生成源,揭示现有方法在零样本迁移和对抗性攻击下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏