arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-08 至 2026-05-08 共收录 94 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 9 篇

2605.05781 2026-05-08 cs.CV cs.AI 81%

Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

通过理解监督引导统一多模态模型的视觉生成

Zeyu Liu, Zanlin Ni, Yang Yue, Cheng Da, Huan Yang, Di Zhang, Kun Gai, Gao Huang

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手技术团队)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UNO框架,通过将理解作为监督信号引导生成,提升多模态模型在图像生成与编辑中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06439 2026-05-08 cs.CY cs.CV cs.ET 79%

From Review to Design: Ethical Multimodal Driver Monitoring Systems for Risk Mitigation, Incident Response, and Accountability in Automated Vehicles

从评审到设计:面向风险缓解、事故响应和问责的伦理多模态驾驶员监控系统

Bilal Khana, Waseem Shariff, Rory Coyne, Muhammad Ali Farooq, Peter Corcoran

机构 * C3I Imaging Lab, School of Engineering, University of Galway(Galway大学工程学院C3I成像实验室) Royal College of Surgeons in Ireland(爱尔兰皇家外科医师学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出针对自动驾驶车辆中多模态驾驶员监控系统的设计框架,解决伦理和法律挑战,强调透明、可信和以人为本的设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05593 2026-05-08 cs.AI 79%

Causal Probing for Internal Visual Representations in Multimodal Large Language Models

多模态大语言模型内部视觉表征的因果探测

Zehao Deng, Tianjie Ju, Zheng Wu, Liangbo He, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Ant Group(蚂蚁集团)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 研究通过激活引导框架系统干预四个视觉概念类别,揭示实体记忆局部化与抽象概念全局分布的差异,发现模型深度对复杂抽象概念编码至关重要,且反向引导揭示感知与生成之间的补偿机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06295 2026-05-08 cs.LG cs.AI stat.ML 70%

Attributions All the Way Down? The Metagame of Interpretability

逐层归因?可解释性中的元游戏

Hubert Baniecki, Przemyslaw Biecek, Fabian Fumagalli

机构 * University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(可信AI中心,华沙技术大学) Bielefeld University(比勒菲尔德大学) LMU Munich, MCML(慕尼黑大学LMU,MCML)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出元游戏框架,通过将归因方法视为合作博弈计算Shapley值,研究模型解释的第二阶交互效应,揭示归因的层级分解及其在多领域可解释性应用中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06641 2026-05-08 cs.AI cs.CV 62%

GlazyBench: A Benchmark for Ceramic Glaze Property Prediction and Image Generation

GlazyBench:陶瓷釉料属性预测与图像生成的基准测试

Ziyu Zhai, Siyou Li, Juexi Shao, Juntao Yu

机构 * Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GlazyBench,首个用于AI辅助釉料设计的基准数据集,包含23148种真实釉料配方,支持釉料属性预测与图像生成任务,通过传统机器学习和大语言模型建立基线,展示出有前景但具挑战性的实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19182 2026-05-08 cs.CV cs.AI 62%

SOWing Information: Cultivating Contextual Coherence with MLLMs in Image Generation

信息播种:利用大规模语言模型在图像生成中培养上下文一致性

Yuhan Pei, Ruoyu Wang, Yongqi Yang, Ye Zhu, Olga Russakovsky, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SOW方法,通过多模态大语言模型实现文本-视觉到图像生成,提升图像像素级条件保真度和视觉语义一致性。

Comments Project page: https://pyh-129.github.io/SOW/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06091 2026-05-08 math.ST cs.LG math.PR stat.CO stat.TH 50%

Time-Inhomogeneous Preconditioned Langevin Dynamics

时间非齐次预条件拉格朗日动力学

Alexander Falk, Laurenz Nagler, Andreas Habring, Thomas Pock

机构 * Institute of Visual Computing(视觉计算研究所) Graz University of Technology(格拉茨技术大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出TIPreL方法,通过时间与位置依赖的预条件器解决拉格朗日动力学在多模分布中的全局模式覆盖与局部模式探索问题,证明其在Wasserstein-2距离下的收敛性,并在实验中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01548 2026-05-08 astro-ph.GA astro-ph.CO 50%

Photometric Redshift PDFs via Neural Network Classification for DESI Legacy Imaging Surveys and Pan-STARRS

通过神经网络分类进行光度红移PDFs的估计:DESI遗产成像调查与Pan-STARRS

Da-Chuan Tian, Zhong-Lue Wen, Jun-Qing Xia

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出一种神经网络分类方法,用于生成校准良好的红移概率密度函数,通过离散化红移空间并优化CRPS,提升了红移估计的精度和不确定性量化。

Comments 19 pages, 8 figures, accepted for publication in The Astrophysical Journal Supplement Series. Data available at https://doi.org/10.5281/zenodo.18410731

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 29 篇

2605.06643 2026-05-08 cs.CV cs.AI cs.LG cs.MM 82%

Are We Making Progress in Multimodal Domain Generalization? A Comprehensive Benchmark Study

我们是否在多模态领域泛化中取得进展?一个全面的基准研究

Hao Dong, Hongzhao Li, Shupan Li, Muhammad Haris Khan, Eleni Chatzi, Olga Fink

机构 * ETH Zürich(苏黎世联邦理工学院) Zhengzhou University(郑州大学) MBZUAI(马克斯·普朗克人工智能研究所) EPFL(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文通过MMDG-Bench基准测试,评估了多模态领域泛化方法的有效性,发现现有方法在公平比较下进步有限,且存在领域和模态配置差异,揭示了领域泛化仍需进一步改进。

Comments Code: https://github.com/lihongzhao99/MMDG_Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06351 2026-05-08 cs.HC 82%

SIGMA-ASL: Sensor-Integrated Multimodal Dataset for Sign Language Recognition

SIGMA-ASL:用于手语识别的传感器集成多模态数据集

Xiaofang Xiao, Guangchao Li, Guangrong Zhao, Qi Lin, Wen Ma, Hongkai Wen, Yanxiang Wang, Yiran Shen

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出SIGMA-ASL数据集,整合RGB-D相机、毫米波雷达和惯性测量单元,通过多模态信息提升手语识别鲁棒性,提供统一框架和标准化流程以评估单模态与多模态识别系统。

Comments 33 pages. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11509 2026-05-08 cs.CL cs.AI cs.CV 82%

Multimodal Fact-Level Attribution for Verifiable Reasoning

多模态事实级归因用于可验证推理

David Wan, Han Wang, Ziyang Wang, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MuRGAt基准,用于评估多模态事实归因能力,要求模型在复杂推理中生成明确推理和精确引用,揭示强模型在正确推理下仍易产生幻觉,且增加推理深度或结构化归因会降低准确性。

Comments Accepted to ICML 2026. Code and data are available at https://github.com/meetdavidwan/murgat

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05955 2026-05-08 cs.CL cs.CV 81%

TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity

TableVista:在视觉和结构复杂性下多模态表格推理的基准测试

Zheyuan Yang, Liqiang Shang, Junjie Chen, Xun Yang, Chenglong Xu, Bo Yuan, Chenyuan Jiao, Yaoru Sun, Yilun Zhao

机构 * Tongji University(同济大学) University of Bristol(布里斯托大学) Tianjin University(天津大学) Yale University(耶鲁大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 TableVista包含3000个高质量表格推理问题,通过多风格渲染和转换流程生成30000个多模态样本,评估29种基础模型在不同复杂性下的表现,揭示结构复杂性和视觉整合对推理一致性的影响。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06584 2026-05-08 cs.AI 79%

NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research

NeuroAgent:用于多模态神经影像分析和研究的LLM代理

Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 NeuroAgent通过LLM驱动的代理框架自动化多模态神经影像预处理与分析,支持自然语言查询,提升神经影像研究的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06371 2026-05-08 cs.AI 79%

Debiased Multimodal Personality Understanding through Dual Causal Intervention

通过双因果干预实现去偏的多模态人格理解

Yangfu Zhu, Zitong Han, Nianwen Ning, Yuting Wei, Yuandong Wang, Hang Feng, Zhenzhou Shao

机构 * Capital Normal University(首都师范大学) Henan University(河南大学) University of International Relations(国际关系大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出双因果调整网络DCAN,通过因果模型消除多模态特征与人格特质间的偏见关联,提升预测准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06289 2026-05-08 stat.ML cs.AI cs.LG 79%

Multimodal Deep Generative Model for Semi-Supervised Learning under Class Imbalance

多模态深度生成模型用于类别不平衡下的半监督学习

Heegeon Yoon, Heeyoung Kim

机构 * Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology (KAIST), Daejeon, Republic of Korea(工业与系统工程系,韩国科学技术院(KAIST),大田,大韩民国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态深度生成模型,通过共享潜在变量和t分布改进类别不平衡问题,提升半监督学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05014 2026-05-08 cs.CV 79%

CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography

CARD: 一种用于复杂道路地形密集3D重建的多模态汽车数据集

Gasser Elazab, Frank Neuhaus, Tilman Koß, Malte Splietker, Aditya Date, Michael Unterreiner, Maximilian Jansen, Olaf Hellwich

机构 * CARIAD SE(CARIAD公司) Technische Universität Berlin(柏林技术大学) Vision & Robotics GmbH(视觉与机器人技术有限公司)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 CARD数据集通过提供连续序列中的近密3D地面真实信息,解决了现有数据集在复杂道路地形下深度估计和补全的不足,支持更精确的几何和感知任务评估。

Comments Accepted at CVPR 2026 (Highlight). Project page: https://card.content.cariad.digital

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22859 2026-05-08 cs.CV 79%

From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models

从盲点到收益:面向大型多模态模型的诊断驱动迭代训练

Hongrui Jia, Chaoya Jiang, Yongrui Heng, Shikun Zhang, Wei Ye

机构 * Peking University(北京大学) Shandong University(山东大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DPE方法,通过诊断驱动的数据生成和强化学习,实现大型多模态模型的持续改进,实验表明在多个基准测试中取得稳定收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05712 2026-05-08 cs.CV 79%

EgoEMG: A Multimodal Egocentric Dataset with Bilateral EMG and Vision for Hand Pose Estimation

EgoEMG:一个用于手姿态估计的多模态自体视角数据集,包含双侧EMG和视觉信息

Ziheng Xi, Jiayi Yu, Yitao Wang, Yanbo Duan, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 EgoEMG数据集融合双侧EMG和视觉信息,用于手姿态估计,包含16通道EMG、IMU、RGB视频和RGB-D视频,涵盖41名参与者60种手势,提供EMG-to-pose、vision-to-pose和融合任务的基准测试。

Comments 34 pages, 13 figures, 15 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05573 2026-05-08 astro-ph.IM cs.AI 79%

AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

AstroAlertBench: 评估多模态大语言模型在天文学分类中的准确性、推理和诚实性

Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu, Facundo Perez Paolino, Luke Handley, Theophile Jegou du Laz, Ricky Nilsson, Alice Zou, Matthew Graham, Ashish Mahabal

机构 * California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院) Purdue University(普渡大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出AstroAlertBench,通过多阶段逻辑链评估多模态大语言模型在天文学事件分类中的性能,揭示高精度与模型诚实性之间的矛盾,并引入人机协同评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21471 2026-05-08 cs.AI 79%

SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition

SpatialBench: 多模态大语言模型空间认知的基准测试

Peiran Xu, Sudong Wang, Yao Zhu, Jianing Li, Gege Qi, Yunjian Zhang

机构 * Sun Yat-Sen University(中山大学) HKUST (GZ)(香港科技大学) Zhejiang University(浙江大学) Peking University(北京大学) CAICT(中国科学院电子技术研究所) UCAS(中国科学技术大学) CUC(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SpatialBench基准,通过五级空间认知框架评估多模态大语言模型的空间能力,揭示模型在感知与符号推理间的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01719 2026-05-08 cs.CL 79%

What MLLMs Learn about When they Learn about Multimodal Reasoning

大语言模型在学习多模态推理时所学的内容

Jiwan Chung, Neel Joshi, Pratyusha Sharma, Youngjae Yu, Vibhav Vineet

机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MathLens基准测试,通过分解性能为感知、推理和多模态特定组件,揭示多模态推理模型评估中隐含的假设。研究显示,不同训练策略导致的能力谱系不同,多模态特定错误占比上升,表明进展反映的是子技能平衡变化而非统一提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04791 2026-05-08 cs.HC 78%

OpenWatch: A Multimodal Benchmark for Hand Gesture Recognition on Smartwatches

OpenWatch: 一种用于智能手表手部动作识别的多模态基准

Pietro Bonazzi, Youssef Ahmed, Daniel Eckert, Andrea Ronco, Junjie Zeng, Dengxin Dai, Michele Magno

专题命中 多模态评测 :multimodal(title);multi-modal(abstract)

AI总结 本文提出OpenWatch多模态基准,通过同步惯性与生理传感数据,评估手部动作识别方法,展示了MixToken和NormWear-Lora等新方法的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06157 2026-05-08 cs.CL cs.AI cs.CV 75%

HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities

HNC:利用硬负样本提升具有细粒度视觉-语言理解能力的模型

Esra Dönmez, Pascal Tilli, Hsiu-Yu Yang, Thang Vu, Carina Silberer

机构 * Institute for Natural Language Processing, University of Stuttgart(自然语言处理研究所,斯图加特大学)

专题命中 多模态评测 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出HNC数据集,通过自动创建硬负样本提升图像-文本匹配模型的细粒度跨模态理解能力,并提供人工创建的测试集评估模型在复杂跨模态匹配任务中的表现。

Journal ref Association for Computational Linguistics (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03331 2026-05-08 cs.CL cs.AI 73%

PulseLM: A Foundation Dataset and Benchmark for PPG-Text Learning

PulseLM:PPG-文本学习的基础数据集和基准

Hung Manh Pham, Jinyang Wu, Xiao Ma, Yiming Zhang, Yixin Xu, Aaqib Saeed, Bin Zhu, Zhou Pan, Dong Ma

机构 * Singapore Management University(新加坡管理大学) Queen Mary University of London(伦敦玛丽女王大学) Eindhoven University of Technology(埃因霍温理工大学) University of Cambridge(剑桥大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 PulseLM通过统一的问答框架连接原始PPG波形与自然语言,包含100万标准化PPG片段及250万问题-答案对,为研究语言基础生理推断和多模态模型基准提供标准化基础。

Comments PulseLM v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05447 2026-05-08 cs.CV 70%

EchoXFlow: A Beamspace Echocardiography Dataset for Cardiac Motion, Flow, and Function

EchoXFlow:一种用于心脏运动、血流和功能的超声成像数据集

Elias Stenhede, Joanna Sulkowska, Eivind Bjørkan Orstad, Henrik Schirmer, Arian Ranjbar

机构 * Medical Technology & E-Health, Akershus University Hospital, Norway(医疗技术与电子健康,阿克ershus大学医院,挪威) Department of Technology Systems, University of Oslo, Norway(技术系统系,奥斯陆大学,挪威) Department of Cardiology, Akershus University Hospital, Norway(心脏病学系,阿克ershus大学医院,挪威)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 EchoXFlow数据集通过保留原始超声采集几何结构,为学习心脏解剖、心肌运动和血流之间的跨模态关系提供了新的可能性,其包含37125条记录,支持物理基础的超声学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06478 2026-05-08 cs.RO 67%

GA3T: A Ground-Aerial Terrain Traversability Dataset for Heterogeneous Robot Teams in Unstructured Environments

GA3T:一种用于异构机器人团队在非结构化环境中的地面-空中地形可 traversability 数据集

Siwei Cai, Knut Peterson, Quan Tran, Christian Ricks, Dhanush Parthasarathy, Amir Kaidarov, Neil Deshpande, Sukaina Najm, David Han, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract)

AI总结 GA3T 数据集通过地面和空中平台的多模态数据融合,提升非结构化环境中的地形可 traversability 估计与协同场景理解能力。

Comments For DARS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13310 2026-05-08 cs.CV cs.AI 62%

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

视觉并行思考器:用于视觉理解的分而治之推理

Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) University of Chinese Academy of Sciences(中国科学院大学) Independent Researcher(独立研究者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉并行思考器,通过并行推理框架提升视觉理解能力,结合Pa-Attention和LPRoPE实现高效多模态处理,验证了并行推理在视觉领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06201 2026-05-08 cs.AI 57%

Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

迈向无标注验证的MLLMs:一种视觉-语言逻辑一致性度量

Ying Gu, Mei Chee Leong, Hui Li Tan, Shangbo Mao, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I 2 R), Agency for Science, Technology and Research (A*STAR), Singapore(信息通信研究所(I2R),科技研究局(A*STAR),新加坡)

专题命中 多模态评测 :MLLM(abstract);分类 cs.AI

AI总结 本文提出一种无需标注的视觉-语言逻辑一致性度量,用于评估大语言模型在因果关系上的逻辑一致性,发现尽管准确率提升,但逻辑一致性仍显著滞后。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06197 2026-05-08 cs.CV cs.LG 57%

Bridging visual saliency and large language models for explainable deep learning in medical imaging

弥合视觉显著性与大语言模型以实现医学影像中可解释的深度学习

Paul Valery Nguezet, Elie Tagne Fute, Yusuf Brima, Benoit Martin Azanguezet, Marcellin Atemkeng

机构 * Department of Mathematics and Computer science(数学与计算机科学系) Institute of Cognitive Science(认知科学研究所) Rhodes University(罗德斯大学) National Institute for Theoretical and Computational Sciences (NITheCS)(理论与计算科学国家研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种多模态可解释框架,通过结合CNN和大语言模型,生成脑肿瘤分类的可操作临床见解,提升深度学习在医学影像中的透明度和临床责任性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06121 2026-05-08 cs.CV 57%

Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning

Pest-Thinker: 通过强化学习学习像昆虫学家一样思考和推理

Xueheng Li, Yu Wang, Tao Hu, Ji Huang, Ke Cao, Qize Yang, Rui Li, Jie Zhang, Chengjun Xie

机构 * Institute of Intelligent Machines, Hefei Institute of Physical Science, Chinese Academy of Sciences(智能机器研究所、合肥物理科学研究所、中国科学院) University of Science and Technology of China(中国科学技术大学) Zhongke Hefei Institute of Technology Innovation Engineering(中科创新合肥科技研究院) Hefei University of Technology(合肥工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Pest-Thinker框架,通过强化学习提升多模态大语言模型对害虫形态的细粒度理解,构建了两个高精度害虫基准数据集,并通过监督微调和GRPO优化提升模型在农业害虫识别中的表现。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏