arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-18 至 2026-08-18 共收录 178 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 25 篇

2608.16745 2026-08-18 cs.CV 新提交 57%

VicEdit: Learning to Edit Videos from Visual In-Context Examples

VicEdit:从视觉上下文示例学习编辑视频

Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 针对文本指令视频编辑难以传达细粒度视觉信息的问题,提出视觉上下文编辑新范式,构建VicEdit-400K数据集,开发VicEdit框架,在VicEditBench上实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16717 2026-08-18 cs.CV 新提交 57%

PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation

PersonaShot:多镜头视频生成中以人为中心的叙事连续性基准

Yuji Wang, Yuheng Chen, Teng Hu, Ran Yi, Yijia Hong, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对多镜头视频生成中角色叙事连续性评估的不足,推出PersonaShot基准,设计三类特定评估器,发现先进模型感知质量与跨镜头连续性存在差距,评估器与人类专家判断一致性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15336 2026-08-18 cs.CV 新提交 57%

SAGE-OR: Semi-supervised Adaptive Scene Graph Generation for Operating Rooms

SAGE-OR:面向手术室的半监督自适应场景图生成

Brandon Leblanc, Charalambos Poullis

机构 * Concordia University(康考迪亚大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03025 2026-08-18 cs.AI 版本更新 57%

DiffImaginE: Imagine to Verify Entity Types with Diffusion

DiffImaginE:通过想象验证实体类型

Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

机构 * Fuzhou University(福州大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司) Baidu(百度) Wuhan University(武汉大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 DiffImaginE将多模态命名实体识别的类型验证建模为条件潜在扩散推理,在Twitter-2015和Twitter-2017数据集上,相比确定性对照模型取得了一致的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16229 2026-08-18 cs.RO 新提交 50%

Planner-Conditioned Diffusion for Coordinated Multi-Agent Exploration

用于协调多智能体探索的规划器条件扩散模型

Marcus Yu Siong Teo, Jeric Lew, Tanishq Duhan, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出规划器条件扩散策略PCDP,通过规划器身份作为条件输入训练多模态单智能体策略,结合局部重排序实现协调,在多智能体探索中提升性能并验证了方法有效性。

Comments Code and models are available at https://github.com/marmotlab/PCDP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03820 2026-08-18 stat.ML cs.LG 版本更新 50%

A Quantitative Approximation Framework for Flow Distillation in Diffusion Models

扩散模型中流蒸馏的定量近似框架

Weiguo Gao, Ming Li, Lei Shi, Hanfei Zhou

机构 * School of Mathematical Sciences, Fudan University(复旦大学数学学院) Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University(复旦大学当代应用数学重点实验室)

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对扩散模型中的流蒸馏,提出一个定量近似框架,将少步采样视为学习流映射组合下的误差传播,通过理论分析和实验验证了稳定性平衡的非均匀时间网格能显著降低端到端相对MSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00490 2026-08-18 eess.SY cs.SY 50%

Cooperative Safety Intelligence in V2X-Enabled Transportation: A Survey

车联网中协同安全智能:一项综述

Jiaxun Zhang, Qian Xu, Zhenning Li, Chengzhong Xu, Keqiang Li

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文综述了V2X环境下协同安全智能的研究进展,围绕SPD框架分析了协同感知、多模态预测和风险感知规划的发展,提出基于SPD的设计原则和评估实践,以提升交通安全水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 36 篇

2608.15404 2026-08-18 cs.CV 新提交 89%

CBX-Bench: A Human-Aligned MLLM Council for Benchmarking Concept Bottleneck Model Explanations

CBX-Bench:用于评估概念瓶颈模型解释的人类对齐多模态大语言模型委员会

Yusuf Meric Karadag, Gulay Oklan, Seref Baris Cagliyan, Umut Ozdemir, Emre Akbas

专题命中 多模态评测 :MLLM(title,summary_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究开发了人类对齐的多模态大语言模型(MLLM)委员会,构建了CBX-Bench基准,实现了概念瓶颈模型(CBM)解释的可扩展定量评估,其在人类偏好排名上的恢复率达70%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14558 2026-08-18 cs.AI cs.CV 新提交 84%

The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning

未书写基准:多模态机器学习在抽象感知推理领域的新挑战

Garima Arya Yadav, Nilay Yilmaz, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出The Unwritten Benchmark基准,针对多模态模型在抽象感知推理中的不足,开展声-运动学文字推理任务评估,发现模型性能远逊于人类且存在模态融合悖论。

Comments To be published in CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15006 2026-08-18 cs.CV cs.AI cs.MM 新提交 82%

MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems

MetaReason:通过编辑元信息实现精确的交错多模态推理以解决几何问题

Penghao Yin, Haomin Wang, Qihong Tang, Xiaoye Qu, Hongjie Zhang, Xiao-Ping Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究提出MetaReason框架,构建TutorGeo与ExamGeo数据集,结合监督微调与强化学习,实现几何问题的精确交错多模态推理,性能优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14767 2026-08-18 cs.CV cs.AI cs.CL cs.RO 新提交 82%

NARRATE: A Multimodal Real-World Australian Driving Dataset for Human-Centred Explanations in Automated Driving

NARRATE:用于自动驾驶中以人为本解释的多模态真实世界澳大利亚驾驶数据集

Ashkan Yousefi Zadeh, Zishuo Zhu, Xiaomeng Li, Andry Rakotonirainy, Sebastien Glaser, Ronald Schroeter, Patricia Delhomme, Zahra Mehraban

机构 * ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(澳大利亚农村及偏远地区自动驾驶车辆ARC培训中心) Université Gustave Eiffel(Gustave Eiffel大学) Queensland University of Technology (QUT)(昆士兰科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究人员推出多模态真实世界澳大利亚驾驶数据集NARRATE,含2050个带注释事件,提供多类标签与情境意识注释,开展四项基准任务验证其价值,为开发以人为本的自动驾驶解释模型奠定基础。

Comments Accepted at The 19th European Conference on Computer Vision (ECCV 2026) DriveX Workshop (Foundation Models for Autonomous Driving)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16233 2026-08-18 eess.IV cs.AI cs.CV 新提交 81%

A cross-modal generative model for incomplete and degraded prostate MRI with multicentre clinical validation

面向不完整与退化前列腺MRI的跨模态生成模型及多中心临床验证

Siyuan Ma, Liang He, Mengying Zhu, Yi Chai, Mengyao Lyu, Haowei Wang, Qizhen Lan, HaoBo Sun, Qixin Zhang, Jingli Chen, Xiaobing Wei, Jiaming Liu, Guiqin Liu, Qianwen Zhang, Yang Liu, Dacheng Tao, Guangyu Wu

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究开发MSCNet跨模态生成框架,可重建前列腺MRI缺失对比、恢复退化扫描,经多中心临床验证,其图像质量符合部分非劣效标准,诊断效能优于基线生成图像,可作为前列腺MRI的辅助技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16276 2026-08-18 cs.HC cs.CL 新提交 79%

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

PolyDebate:一种用于辩论技能练习与评估的游戏编排多模态系统

Jianing Yin, Weng Pan Kuan, Xiaoyun Liu, Zhiyuan Wen, Yuxuan Li, Milos Stojmenovic, Jiannong Cao

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 PolyDebate是一款游戏化多模态辩论练习评估系统,含Unity 3D游戏与网页版本,经四项研究验证,可结合AI对手、多模态评估与结构化反馈助力学习者提升辩论技能。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15999 2026-08-18 cs.AI 新提交 79%

MUPA$^{2}$E: Multimodal Unified Perception with Asymmetric Attention for Emotion Assessment

MUPA²E:用于情绪评估的非对称注意力多模态统一感知框架

Stefanos Gkikas, Eric Nichols, Christian Arzate Cruz, Randy Gomez

机构 * Honda Research Institute Japan(日本本田研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MUPA²E多模态统一感知框架,用共享非对称注意力骨干处理面部视频与EEG,在DMER数据集上对比多配置,发现时长线索影响分类,控制时长后准确率下降,证明统一架构处理异质信号的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15265 2026-08-18 cs.AI 新提交 79%

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12407 2026-08-18 cs.RO cs.CV cs.LG 版本更新 79%

MiDAS: A Multimodal Data Acquisition System and Dataset for Robot-Assisted Minimally Invasive Surgery

MiDAS:一种用于机器人辅助微创手术的多模态数据采集系统和数据集

Keshara Weerasinghe, Seyed Hamid Reza Roodabeh, Andrew Hawkins, Zhaomeng Zhang, Zachary Schrader, Homa Alemzadeh

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MiDAS是一种开源多模态数据采集系统,能够实现机器人辅助微创手术的非侵入式数据采集,并发布首个高保真仿真模型的缝合任务数据集。

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09434 2026-08-18 quant-ph 版本更新 78%

Biocompatible Vaterite Carriers Enable Multimodal Quantum Sensing with Nanodiamonds

双折射生物矿物微载体稳定液体中的多模态纳米金刚石量子传感

T. Amro, M. Attrash, A. Droby, A. Ushkov, R. Malkinson, P. Penshin, A. Hen, V. Bobrovs, P. Ginzburg, H. Barhum, N. Bar-Gill

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究利用双折射球文石微球作为载体,组装氮空位纳米金刚石,开发杂化平台实现液体中多模态量子传感,可用于磁场与质子浓度、pH值检测,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25232 2026-08-18 cs.LG 版本更新 78%

Neurai-VN Benchmark: Standardized Machine Learning Models for Multimodal Digital Phenotyping in Mental Health Classification

神经-VN基准:用于心理健康分类中多模态数字表型分析的标准化机器学习模型

Quoc-Cuong Pham, Hoang-Thuy-Duong Vu, Thi-Thanh-Huong Ha, Huy-Hieu Pham

机构 * College of Engineering and Computer Science, VinUni-Illinois Smart Health Center, VinUniversity(工程与计算机科学学院,VinUni - 伊利诺伊智能健康中心,Vin大学) School of Biomedical Engineering, International University, Vietnam National University HCMC(生物医学工程学院,胡志明市越南国立大学国际大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究基于Neurai-VN数据集构建可重复基准,定义四个临床相关二元分类任务,用标准化受试者交叉验证评估,在预定义特征配置下评估多种基线模型,给出各任务F1分数,为心理健康分类任务的多模态DP研究提供可重复基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24476 2026-08-18 eess.SP 版本更新 78%

WiWorld-RealData: A Real-World Multi-Modal Dataset for 6G Wireless World Models

WiWorld-RealData:用于6G无线世界模型的真实世界多模态数据集

Yinyin Jiao, Huixin Xu, Jianhua Zhang, Yuelong Qiu, Jingjing Wang, Shaoyi Liu, Yuxiang Zhang, Li Yu, Xuebin Sun, Guangyi Liu

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出WiWorld-RealData数据集,包含3.7 GHz和6.775 GHz的信道冲激响应、多视角图像、全景图像、LiDAR点云、毫米波雷达记录和GNSS轨迹,支持环境辅助的信道预测,路径损耗预测MAE为2.02 dB。

Comments 6 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15721 2026-08-18 cs.CV 新提交 77%

Anatomical and Physical Supervision for CT-less PET Attenuation Correction: BIC-MAC 2026 Challenge

用于无CT的PET衰减校正的解剖学与物理学监督:BIC-MAC 2026挑战赛

Petros Chatzitoulousis, George K. Matsopoulos

机构 * National Technical University of Athens(雅典国家技术大学)

专题命中 多模态评测 :cross-modal(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本研究针对BIC-MAC 2026挑战赛,基于nnU-Net架构结合解剖学与物理学监督,利用预训练权重优化流程,实现了无CT的PET衰减校正方案,验证了该方法的有效性。

Comments 6 pages, 1 table. Technical report for the BIC-MAC 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14741 2026-08-18 cs.CV cs.AI 新提交 76%

PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models

PolyComp:面向多模态模型组合式3D空间推理的基于多立方体(polycube)的基准测试集

Siddharth Patel

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 该研究推出PolyComp基准测试集,考察多模态模型的组合式3D空间推理能力,测试了GPT-5.6 Sol等模型的准确率与成本,并发布了120个问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-18 cs.CV cs.MM 版本更新 76%

MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.MM

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05177 2026-08-18 cs.CL cs.AI eess.AS 版本更新 75%

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

MCBench:面向全能大语言模型的多上下文安全评估基准

Manh Luong, Tamas Abraham, Junae Kim, Amar Kaur, Rollin Omari, Gholamreza Haffari, Trang Vu, Lizhen Qu, Dinh Phung

机构 * Monash University(墨尔本大学) Defence Science and Technology Group(国防科学与技术集团)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 针对现有多模态安全基准仅处理视觉输入的局限,提出MCBench基准,包含1196个跨四类安全场景的测试,要求整合多模态信息进行安全评估,揭示当前全能大语言模型在跨模态安全推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03988 2026-08-18 cs.AI 版本更新 74%

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

想象感知标记增强多模态语言模型的空间推理能力

Mahtab Bigverdi, Linjie Li, Weikai Huang, Yiming Liu, Jaemin Cho, Tuhin Kundu, Chris Dongjoo Kim, Zelun Luo, Jieyu Zhang, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(Allen人工智能研究所) Microsoft(微软) OpenAI(开放人工智能研究院)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16480 2026-08-18 cs.CV cs.AI 新提交 73%

RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning

RISE:跨三维跟踪与结构化视觉-语言推理的路边基础设施序列理解

Yanbo Jiang, Haotian Zheng, Jiahao Wang, Hanxiao Ren, Yitao Xu, Yining Xing, Zehong Ke, Hao Cheng, Yiqian Tu, Jinhao Li, Zhiyuan Xuan, Fang Zhang, Jianqiang Wang

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究提出RISE框架,结合仅图像的三维跟踪方法与结构化视觉-语言推理,构建含33910个问答对的RISE-VQA数据集,通过RISE-Bench评估任务,揭示相关挑战并验证域自适应与时间上下文的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14391 2026-08-18 cs.CV cs.AI 版本更新 73%

Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

我们能否防御AI生成视频对现实世界危机事件的攻击?对检测器、生成器及社交传播的系统性评估

Shuo Liang, Yixing Ma, Pengfei Zhou, Zhenglin Wan, Xingyan Chen, Zihan Mei, Manting Li, Feihan Chen, Zhiwen Wang, Bin Xu, Haotian Zhang, Jiajun Song, Shiya Su, Run Liu, Zhenghang Ni, Yifa Yu, Jintao Hong, Bolong Feng, Yifei Liu, Zirui Zhang, Jingxuan Zhang, Songlin Zhao, Yifan Bai, Kang Tan, Yizhe Liu, Junhao Du, Yongtao Ge, Zhaopan Xv, Xinyuan Zhang, Mengru Ma, Chunhua Shen, Wei Wang, Yang You, Zheng Zhu, Kaipeng Zhang, Wangbo Zhao

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究推出RA-Bench基准,系统评估AI生成视频检测器、生成器及社交传播特性,发现现有检测器泛化性差、难以检测逼真生成视频,需鲁棒检测器。

Comments 63 pages, 20 figures, 32 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27856 2026-08-18 cs.CV 版本更新 70%

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation

基准测试用于小样本医学图像分割的基础模型与大语言模型

Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16622 2026-08-18 cs.CV cs.AI 新提交 62%

HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes

HarmTrace:用于恶意梗图细粒度目标识别的锚定校准解耦优化方法

Yujia Li, Yiqun Zhang, Zihan Cheng, Yijie Huang, Tenglong Ye, Zihan Wang, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对多模态恶意梗图检测中存在的目标识别错误问题,提出HarmTrace框架,结合实体感知微调与CTPO方法,在Qwen3-VL-8B上JRA提升至52.51%,还构建了Meme3W数据集与JRA指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15630 2026-08-18 cs.HC cs.AI cs.CL 新提交 62%

Do Assessment Instruments Measure the Same Thing for Humans and LLMs? A Latent Structure Analysis

评估工具对人类和大语言模型(LLMs)是否测量相同的内容?潜在结构分析

Alona Strugatski, Licol Zeinfeld, Giora Alexandron

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过探索性因子分析等方法,发现高中化学和大学入学考试定量推理部分的评估,对人类与六个多模态LLMs测量的潜在结构存在系统性差异,质疑了此类评估用于推断AI能力的效度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15425 2026-08-18 cs.CV cs.AI 新提交 62%

NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models

NumerosityVLM:一种受认知启发的、用于解释视觉-语言模型中数量表征的基准测试

Yiming Fu, Fangjun Li, Xiujin Liu, Ruidong Ma, Hang Yu, Zhichen Lu, Kanwei He, Alessandro Di Nuovo, Angelo Cangelosi, Zhegong Shangguan

机构 * The University of Manchester(曼彻斯特大学) University of Michigan(密歇根大学) Sheffield Hallam University(谢菲尔德哈勒姆大学) Tufts University(塔夫茨大学) ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院国立高等先进技术学校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉-语言模型数量感知研究的基准缺陷,提出受认知启发的NumerosityVLM基准,评估7个模型发现架构对性能影响最大,数量信号出现在视觉编码器早期,差异主要来自语言模型组件。

详情

展开后加载摘要…

URL PDF HTML 收藏