arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 600 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 600 篇

2606.25527 2026-06-25 cs.LG 新提交 67%

Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors

超越一刀切:基于诊断的在线强化学习与离线先验知识

Guozheng Ma, Lu Li, Zilin Wang, Pierre-Luc Bacon, Dacheng Tao

机构 * Nanyang Technical University(南洋理工大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文提出诊断驱动的张力管理框架,通过三种功能角色表征离线先验知识如何重塑在线优化,并展示跨领域证据,解决先验知识有效性随部署变化的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13877 2026-06-15 cs.RO 新提交 67%

ContactWorld: What Matters in Vision-Tactile World Models for Contact-Rich Manipulation

ContactWorld: 视觉-触觉世界模型中什么对接触丰富操作至关重要

Zhiyuan Zhang, Pokuang Zhou, Kaidi Zhang, Adeesh Desai, Temitope Amosa, Davood Soleymanzadeh, Jiuzhou Lei, Minghui Zheng, Yu She

机构 * School of Industrial Engineering, Purdue University(普渡大学工业工程学院) Department of Mechanical Engineering, Texas A&M University(德克萨斯农工大学机械工程系)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 通过12项接触丰富操作任务,发现空间结构化和时间连续的表征(如点云)能显著提升规划成功率,且触觉传感的有效性依赖于跨模态表征兼容性。

Comments 32 pages, 12 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12169 2026-06-11 cs.CV cs.AI cs.CL cs.LG 新提交 67%

OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

OpenMedReason: 医学视觉语言模型的科学推理监督

Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci, Abeer Badawi, Adibvafa Fallahpour, Arash Afkanpour, Leonid Sigal, Ali Etemad, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Unity Health Toronto / St. Michael’s Hospital(多伦多联合健康/圣迈克尔医院) University Health Network(大学健康网络) Arc Institute(弧研究所) Queen's University(女王大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出OpenMedReason,一个包含约45万图像-问题-答案实例的大规模开放医学推理语料库,其推理轨迹主要来自生物医学科学文章,并配套基准OpenMedReason-Bench进行细粒度评估,在监督微调和强化对齐中有效提升模型性能。

Comments 42 pages, 9 figures, 24 tables. Dataset and code: https://huggingface.co/datasets/neginb/OpenMedReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11702 2026-06-11 cs.CV cs.AI cs.CL 新提交 67%

MedCTA: A Benchmark for Clinical Tool Agents

MedCTA: 临床工具智能体基准

Tajamul Ashraf, Hyewon Jeong, Fida Mohammad Thoker, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出MedCTA基准,基于放射影像、病理切片和报告等真实临床多模态输入,评估医疗AI智能体在工具检索、证据获取和集成方面的规划与执行能力。

Comments Project Page: https://ivul-kaust.github.io/MedCTA/ Code: https://github.com/IVUL-KAUST/MedCTA Data: https://huggingface.co/datasets/IVUL-KAUST/MedCTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09925 2026-06-10 cs.SD 新提交 67%

AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

AudioProcessBench: 音频基础推理中过程错误识别的基准

Xiangyu Zhao, Junyu Yan, Yaling Shen, Zimu Wang, Yiwen Jiang, Stephanie Fong, Qingyang Xu, Jiahe Liu, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) Xi’an Jiaotong-Liverpool University(西安交通大学-利物浦大学) Orygen(Orygen研究所) University of Melbourne(墨尔本大学)

专题命中 多模态评测 :multi-modal(abstract);omni-modal(abstract)

AI总结 提出AudioProcessBench基准,用于评估音频-语言模型在推理步骤中的过程错误识别能力,涵盖步骤正确性、错误类型检测和链级聚合三种范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08170 2026-06-09 cs.RO 新提交 67%

Learning from Human Driving: A Human-in-the-Loop Online Behavior Cloning Framework for Autonomous Driving

从人类驾驶中学习:一种用于自动驾驶的人机协同在线行为克隆框架

Yuhong Shi, Jianyi Liu, Lihang Sun, Li Li, Xudong Dong

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract)

AI总结 提出人机协同在线行为克隆框架HiL-OBC,通过人类干预初始化策略、贝叶斯潜在行为建模和在线更新,结合大模型感知与人类驾驶智能,在CARLA基准上显著提升驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12911 2026-08-14 cs.CV cs.CR cs.MM 新提交 62%

Beyond Visual Evidence: Revealing and Mitigating Relational Privacy Leakage in Document MLLMs

超越视觉证据:揭示并缓解文档多模态大语言模型中的关系隐私泄露

Beining Xu, Hairui Wang, Jiaxin Wang, Changsheng Chen, Anirban Chakraborty

机构 * Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程学院) Faculty of CMC, Shenzhen MSU-BIT University(深圳北理莫斯科大学计算机、数学与力学学院) Department of CDS, Indian Institute of Science(印度科学学院计算机与数据科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文针对文档理解MLLMs的KIE任务,揭示其在视觉证据不足时会通过记忆的字段关系泄露隐私,提出DRUF框架与DocPrivacyBench基准,实验显示DRUF可提升泄露抑制效果并维持KIE性能。

Comments ACM mm 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12590 2026-08-14 cs.AI cs.CV 新提交 62%

Auditable agentic AI for evidence-grounded thyroid ultrasound diagnosis and reporting

用于循证甲状腺超声诊断与报告的可审计智能体AI

Haifan Gong, Shiyu Chen, Bodong Wang, Yuqi Wang, Shijie Wang, Guoliang You, Xinyu Xiong, Haowei Wang, Mingzhi Mao, Dexing Kong, Qinghua Liu, Wei Lou, Fei Chen, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院) Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院) Zhujiang Hospital, Southern Medical University(南方医科大学珠江医院) College of Mathematical Medicine, Zhejiang Normal University(浙江师范大学数学医学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出可审计的智能体AI系统ThyroidXAgent,基于多中心数据集开发,可协同完成甲状腺超声诊断多任务,提升分类准确率与报告一致性,缩短耗时,支持临床医生修正。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11741 2026-08-13 cs.CV cs.AI 新提交 62%

JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

JieZi:用于古文字训诂的大规模专家审核数据集与基准

Ran Li, Huiguo He, Jiahuan Cao, Junle Liu, Hiuyi Cheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。

Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10964 2026-08-12 cs.CV cs.AI 新提交 62%

CARE: Confidence-Aware Reasoning for Reliable Medical VQA

CARE:用于可靠医学视觉问答的置信感知推理

Yuetian Du, Yucheng Wang, Zhenyuan Chen, Luyuan Chen, Rongyu Zhang, Jinjian Zhang, Wei Zhou, Zhijie Xu, Ming Kong, Zhan Zhou, Jie Liu, Qiang Zhu

机构 * Ant Group(蚂蚁集团) University of Michigan(密歇根大学) City University of Hong Kong(香港城市大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对医学多模态大语言模型的置信度校准问题,提出CARE框架,通过双阶段流程优化准确率与校准度,在三个医学VQA基准上取得最优性能,为临床决策支持提供可信基础。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09374 2026-08-11 cs.AI cs.CV 新提交 62%

CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Circuits

CircuitReason-1k:电路中的长程视觉到符号推理基准测试

Xinqi Yang, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CircuitReason-1k是含1000个真实教材电路问题的基准,用于评估多模态模型的长程视觉到符号推理,现有模型在长程问题上表现差,该基准为相关测试提供了聚焦平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09296 2026-08-11 cs.AI cs.CV cs.LG cs.RO 新提交 62%

CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly Reasoning, and Physics Simulation

CADEngBench:它看起来像CAD,但真的能用吗?——参数化设计、装配推理与物理仿真的评估

Harmanjot Singh, Abhra Dubey, Jorge Alejandro Amador Herrera

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CADEngBench双轨基准,从参数化设计、装配推理等维度评估8种多模态代码模型,发现编辑现有CAD更易,复杂编辑与匹配FEA仍难,装配预测存在缺陷,强调CAD评估需关注工程行为而非外观。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08135 2026-08-11 cs.CV cs.AI 新提交 62%

Compositional Cross-Modality Translation via Whole-Volume Multitask Latent Flow Matching

基于全容积多任务潜在流匹配的组合跨模态医学图像转换

Daniele Molino, Alessio Zoboli, Camillo Maria Caruso, Valerio Guarrasi, Paolo Soda

机构 * Università Campus Bio-Medico di Roma(罗马 Campus Bio-Medico 大学) Umeå University(于默奥大学) UniCamillus – Saint Camillus International University of Health Sciences(UniCamillus – 圣卡米勒斯国际健康科学大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出基于全容积多任务潜在流匹配的方法,解耦容积先验与跨模态映射目标,训练单个多任务模型实现跨/模态内转换,在全容积处理、零样本泛化等方面优于基线,为合成系统泛化提供可扩展途径。

Comments Accepted ad Sashimi 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03817 2026-08-05 cs.CV cs.AI 新提交 62%

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

UHP检测:大型视觉语言模型(LVLMs)在一致性空间中具有独特的幻觉模式

Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对LVLMs的幻觉问题,提出UHP检测框架,通过图像与文本扰动模态、陈述与否定逻辑极性构建四组一致性特征,训练分类器,在AMBER和PhD数据集上显著优于现有基线。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00872 2026-08-04 cs.AI cs.CR cs.CV 新提交 62%

Similarity Weighted Aggregation with Global Differential Privacy for Federated Brain Lesion Segmentation

面向联邦脑病灶分割的结合全局差分隐私的相似度加权聚合

Muhammad Irfan Khan, Eero Lehtonen, Joni Obradovic, Elina Kontio, Esa Alhoniemi, Suleiman A. Khan, Mojtaba Jafaritadi

机构 * Turku University of Applied Sciences(图尔库应用科学大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出DP-SimAgg框架,结合相似度加权聚合与服务器端差分隐私,在FeTS 2022数据集上验证其可在保护隐私的同时保持脑病灶分割的竞争力性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27895 2026-07-31 cs.AI cs.CV 新提交 62%

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

MMHBench:用于长视频心理健康理解的多视角基准测试集

Jinpeng Hu, Erqiang Wang, Shan Wang, Zhuo Li, Peipei Song, Xun Yang, Meng Wang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27084 2026-07-30 cs.CV cs.AI 新提交 62%

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

SciFigQual-Bench:面向全文本上下文的科学图片质量评估基准

Zihan Deng, Chuanzhi Xu, Huiqi Liang, Haoyang Li, Xiaozhen Zhong, Lequan Yu

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对现有科学图片质量评估方法的不足,构建了SciFigQual-Bench基准,设计SFQ-Agent框架实现自动化评估,实验显示其在eval1200子集上表现优于主流方案。

Comments † Equal contribution. Affiliations: 1: The University of Hong Kong 2: The University of Sydney 3: University of Electronic Science and Technology of China Corresponding authors: Zihan Deng (zhdeng@hku.hk), Chuanzhi Xu (chuanzhi.xu@sydney.edu.au) Project page: https://frankdengai.github.io/SciFigQual-Bench Source code & dataset: https://github.com/FrankDengAI/SciFigQual-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26452 2026-07-30 cs.AI cs.CV cs.GR 新提交 62%

CG-World: A Large-Scale World-State Dataset and Protocol for World Models

CG-World:面向世界模型的大规模世界状态数据集与协议

Yiming Cai, Fangjie Yu, Meiqing Yu, Ziyue Shi, Pengfei Yuan, Yong Guo

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CG-World是源自工业计算机图形流水线的大规模世界状态数据集,含约85万时间对齐片段,支持干预学习与反事实推理,经评估可为世界模型相关任务提供结构化监督,拟打造共享数据基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25467 2026-07-29 cs.CV cs.AI 新提交 62%

Seen, Said, or Forgotten? A Causal Audit of Visual KV Memory Across Dialog Turns

看过、说过还是被遗忘了?跨对话轮次的视觉键值记忆因果审计

Hong Chen, Kang Chen, Yuxuan Fan, Bo Wang, Yubo Gao, Yuanlin Chu, Xuming Hu

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究跨对话轮次视觉键值记忆何时可安全遗忘,提出因果视觉记忆审计框架,通过在VisDial和ConvBench上实验发现当前注意力对未来有用区域排名不佳,揭示安全遗忘受低未来视觉依赖性或特定事实语言表达支持而非低当前注意力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25108 2026-07-29 cs.CV cs.AI cs.LG eess.IV 新提交 62%

OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis

OPERA:用于通用生物医学图像分析的离线策略引导专家路由与适应

Zihan Li, Feiyang Liu, Dandan Shan, Ruibo Wang, Qingqi Hong

机构 * University of Washington(华盛顿大学) Delft University of Technology(代尔夫特理工大学) Xiamen University(厦门大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对生物医学图像分析中分布变化阻碍模型部署的问题,提出OPERA多智能体集成框架,通过离线策略学习专家权重分配,结合多种机制协调智能体,经多数据集评估,有效提升性能与校准质量,为可部署生物医学AI提供实用路径。

Comments Accepted by ACM MM 2026. 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24567 2026-07-28 cs.AI cs.CV cs.IR 新提交 62%

DSCH-Loss: A Dynamic Semantic Channel Objective for Deep Semantic Hashing

DSCH损失:用于深度语义哈希的动态语义通道目标

Tobias J. Bauer, Christian Riess, Daniel Loebenberger, Christian Bergler

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究语义哈希方法,提出动态语义通道哈希(DSCH)损失函数,通过动态调整语义通道避免损失景观不连续性,采用考虑平局的mAP评估,实验表明DSCH训练的模型在多任务中表现优异,优于其他现有损失函数。

Comments 12 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24516 2026-07-28 cs.CV cs.AI 新提交 62%

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

DecoupleMix:用于可扩展视觉语言模型数据配方的解耦比率搜索和凸分配

Jiahao Xie, Zhongbin Guo, Qianle Wang, Ruiqi Lu, Dongling Xiao, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉语言模型数据构建缺乏原则性标准的问题,提出DecoupleMix框架,将其解耦为类间比率搜索和类内凸分配两个子问题,实验证明该方法优于启发式基线,且最优比率可跨规模转移,提升了VLM竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 62%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21619 2026-07-27 cs.CL cs.AI 新提交 62%

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21155 2026-07-24 cs.CV cs.AI 新提交 62%

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) MIT(麻省理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-07-24 cs.AI cs.CL 新提交 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, David R. Pugh, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20445 2026-07-24 cs.CL cs.SD eess.AS 新提交 62%

SCoPE: Shift-Aware Speaker-Conditioned Priors for Emotion Recognition in Conversations

SCoPE:用于对话中情感识别的转移感知说话者条件先验

Burak Can Kaplan, Stefan Wermter

机构 * University of Hamburg(汉堡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 针对对话情感识别中现有方法的局限,提出SCoPE模块,利用说话者情感历史建模先验,纳入情感转移预测并采用转移感知融合机制,在多模态IEMOCAP数据集上取得优于现有模型的性能。

Comments Under review at Cognitive Computation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18448 2026-07-22 cs.CL cs.CV 新提交 62%

PathReportEval: A Systematic Benchmark for Pathology Report Generation

PathReportEval:病理学报告生成的系统基准测试

Suryakant Singh, Sejuti Majumder, Beatrice Knudsen, Joel Saltz, Prateek Prasanna

机构 * Stony Brook University(石溪大学) University of Utah(犹他大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对病理学报告生成难以衡量进展的问题,提出标准化基准测试和评估框架,用三种编码器在三个数据集上评估四种方法,引入临床报告质量评分(CRQS),揭示模型和编码器差异,为病理学报告生成评估奠定可重复基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18438 2026-07-22 cs.CL cs.AI cs.LG 新提交 62%

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench:评估大语言模型在多领域推理链上的表现

Liam Swayne

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 Relay-Bench是用于评估大语言模型在多领域推理链能力的基准测试,测试集含复合问题,涵盖多领域,模型使用无限制,鼓励利用工具,领先模型GPT-5.5(xHigh)得分43.3%,问题由两到十三个子问题组成,无需多模态输入输出。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16283 2026-07-21 cs.CV cs.AI 新提交 62%

GenSyn10: A Multi-Generative AI Dataset For Benchmarking Image Classification

GenSyn10:用于图像分类基准测试的多生成式人工智能数据集

Md Faraz Kabir Khan, Saeed Anwar, Ghulam Mubashar Hassan

机构 * The University of Western Australia(西澳大利亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对生成式AI输出检测难的问题,引入GenSyn10数据集,由三种模型生成图像。通过标准化协议整理数据,评估17个分类模型,结果显示CIFAR-10训练模型在该数据集上有一定准确率,确立其为合成图像检测基准,助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏