arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-14 至 2026-04-14 共收录 143 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2512.18073 2026-04-14 cs.CV 79%

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);分类 cs.CV

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10233 2026-04-14 cs.CV cs.AI 79%

Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis

将2D多模态大语言模型适应于3DCT图像分析

Yang Yu, Dunyuan Xu, Yaoqian Li, Xiaomeng Li, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子及计算机工程学系) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所) Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人创新中心)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出将2D多模态大语言模型适应于3DCT图像分析,设计Text-Guided Hierarchical MoE框架,采用两阶段训练策略提升医学报告生成和视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11156 2026-04-14 cs.CV 70%

rPPG-VQA: A Video Quality Assessment Framework for Unsupervised rPPG Training

rPPG-VQA:一种用于无监督rPPG训练的视频质量评估框架

Tianyang Dai, Ming Chang, Yan Chen, Yang Hu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出rPPG-VQA框架,通过信号级和场景级分析评估视频对rPPG模型训练的适用性,结合双分支架构和两阶段自适应采样策略提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17012 2026-04-14 cs.CV cs.AI 62%

SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence

SpatialScore:迈向空间智能的综合评估

Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SpatialScore,首个全面评估多模态空间智能的基准,评估49个模型发现其在空间理解上存在显著差距,并构建了SpatialCorpus和SpatialAgent提升模型性能。

Comments Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09594 2026-04-14 cs.AI cs.LG 62%

Spatial Competence Benchmark

空间能力基准

Jash Vira, Ashley Harris

机构 * Independent Researcher(独立研究员) Maptek

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 本文提出空间能力基准(SCBench),通过三级能力层级评估大模型的空间能力,发现模型在能力层级上准确性呈递减趋势,且低预算下准确性提升显著。

Comments Accepted at the ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17012 2026-04-14 cs.CV 57%

4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation

4D-RGPT:通过感知蒸馏实现区域级4D理解

Chiao-An Yang, Ryo Hachiuma, Sifei Liu, Subhashree Radhakrishnan, Raymond A. Yeh, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA(英伟达)

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

AI总结 本文提出4D-RGPT和P4D框架,解决3D/4D视频问答中4D感知和时间理解不足的问题,并构建了区域级提示的R4D-Bench基准。

Comments CVPR 2026 (Highlight). Project page: https://www.ca-joe-yang.com/resource/projects/4D_RGPT/. GitHub: https://github.com/NVlabs/4D-RGPT. Dataset: https://huggingface.co/datasets/nvidia/R4D-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09666 2026-04-14 cs.IR cs.AI 57%

Do We Still Need GraphRAG? Benchmarking RAG and GraphRAG for Agentic Search Systems

我们仍然需要GraphRAG吗?对RAG和GraphRAG在代理搜索系统中的基准测试

Dongzhe Fan, Zheyi Xue, Siyuan Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文通过RAGSearch基准测试,评估了代理搜索系统对密集RAG和代表性的GraphRAG方法的影响,发现代理搜索显著提升了密集RAG性能,但在复杂多跳推理中GraphRAG仍具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09270 2026-04-14 cs.CL 50%

MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus

MCGA:多任务古典中文文学体裁音频语料库

Yexing Du, Kaiyuan Liu, Bihe Zhang, Youcheng Pan, Bo Yang, Liangyu Huo, Xiyuan Zhang, Jian Xie, Daojing He, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Du xiaoman(杜小满)

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 本文提出MCGA语料库,包含22000个音频样本,涵盖六个任务:ASR、S2TT、SEC、SQA、SU和SR,评估十种MLLM发现其在MCGA测试集上仍面临显著挑战,并引入领域特定的SEC指标和语音与文本一致性度量。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 27 篇

2604.11627 2026-04-14 cs.CV 83%

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs

POINTS-Long: 基于人类视觉系统的自适应双模式视觉推理MLLM

Haicheng Wang, Yuan Liu, Yikun Liu, Zhemeng Yu, Zhongyin Zhao, Yangxiu You, Zilin Yu, Le Tian, Xiao Zhou, Jie Zhou, Weidi Xie, Yanfeng Wang

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院) WeChat AI, Tencent(腾讯微信人工智能)

专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 POINTS-Long引入动态视觉token缩放机制,通过聚焦模式和待机模式实现效率与精度的动态平衡,在细粒度视觉任务中保持最优性能,在长形式视觉理解中使用1/40-1/10的视觉token保留97.7-99.7%的精度,支持流式视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09712 2026-04-14 cs.CV cs.AI 81%

LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models

LAST:利用工具作为提示以增强多模态大语言模型的空间推理能力

Shi-Yu Tian, Zhi Zhou, Kun-Yang Yu, Ming Yang, Yang Chen, Ziqiao Shang, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 LAST通过整合专用视觉模型,解决多模态大语言模型在复杂几何布局解析中的幻觉和不精确问题,提出统一框架提升空间推理能力。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27960 2026-04-14 cs.LG cs.CL cs.CV 81%

Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies

迈向高效的大型视觉-语言模型:关于推理策略的综合调查

Surendra Pathak, Bo Han

机构 * George Mason University(乔治梅森大学)

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.LG

AI总结 本文综述了提升大型视觉语言模型推理效率的最新方法,从视觉token压缩、内存管理、架构设计和解码策略四个维度进行分类,并指出当前方法的局限性及未来研究方向。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11177 2026-04-14 cs.CV 79%

Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding

推理流是否重要?评估Gemini视觉-语言模型在视频场景理解中的推理能力

Shivam Sharma, Sankalp Nagaonkar, Ashish Choithani, Ashutosh Trivedi

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究评估了Gemini视频语言模型中推理流对视频场景理解的影响,提出三个评估指标,并发现增加推理量对输出质量的提升迅速达到平台期,Flash Lite在质量和token使用之间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10506 2026-04-14 cs.AI 79%

A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning

一种用于对抗具身推理中时空幻觉的渐进训练策略

Xiaoda Yang, Shuai Yang, Can Wang, Jingyang Xue, Menglan Tang, Checheng Yu, Xunzhe Zhou, Sashuai Zhou, Tao Jin, Lixin Yang, Xiangyu Yue, Zhou Zhao

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学) Qingdao University(青岛大学) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of YYY(YYY大学) Institute of WWW(WWW研究所)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出一种渐进训练框架,通过构建CoT数据集和弱标签数据提升视觉语言模型的时空推理能力,有效缩小了正反向性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13621 2026-04-14 cs.CL cs.CV cs.LG 79%

LaMI: Augmenting Large Language Models via Late Multi-Image Fusion

LaMI:通过晚期多图像融合增强大型语言模型

Guy Yariv, Idan Schwartz, Yossi Adi, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Bar-Ilan University(巴伊兰大学)

专题命中 视觉推理 :visual language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 LaMI通过在测试时融合多个图像提升视觉常识推理能力,同时保持文本推理性能,适用于视觉和NLP任务。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17022 2026-04-14 cs.CV cs.AI cs.CL cs.LG cs.MM 78%

GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning

GoT-R1:通过强化学习提升MLLM的视觉生成推理能力

Chengqi Duan, Rongyao Fang, Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li, Xihui Liu

机构 * HKU MMLAB(香港大学多媒体实验室) CUHK MMLAB(香港中文大学多媒体实验室) Sensetime(商汤科技) Beihang University(北京航空航天大学) SUAT(上海人工智能实验室)

专题命中 视觉推理 :MLLM(title);分类 cs.CV、cs.AI、cs.LG

AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。

Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10425 2026-04-14 cs.CV 77%

DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain

DiningBench:面向饮食领域的分层多视角基准测试平台

Song Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei Lin, Yong Liu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Meituan(美团) Wuhan University(武汉大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出DiningBench,一个分层多视角基准,用于评估视觉语言模型在饮食领域感知与推理能力,包含3021种不同菜品,通过多视角输入和链式推理方法,揭示了当前VLM在细粒度视觉识别和营养推理上的不足。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10042 2026-04-14 cs.CV cs.AI 76%

Fake-HR1: Rethinking Reasoning of Vision Language Model for Synthetic Image Detection

Fake-HR1: 重新思考视觉语言模型在合成图像检测中的推理方式

Changjiang Jiang, Xinkuan Sha, Fengchang Yu, Jingjing Liu, Jian Liu, Mingqi Fang, Chenfeng Zhang, Wei Lu

机构 * Wuhan University(武汉大学) AntGroup(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 视觉推理 :vision language model(title);分类 cs.CV、cs.AI

AI总结 Fake-HR1通过两阶段训练框架实现自适应推理,提升合成图像检测性能与效率,优于现有LLMs。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22361 2026-04-14 cs.CL cs.AI cs.LG 76%

MERMAID: Memory-Enhanced Retrieval and Reasoning with Multi-Agent Iterative Knowledge Grounding for Veracity Assessment

MERMAID:基于多智能体迭代知识接地的记忆增强检索与推理用于真实性评估

Yupeng Cao, Chengyang He, Yangyang Yu, Ping Wang, K. P. Subbalakshmi

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视觉推理 :grounding(title);分类 cs.AI、cs.LG

AI总结 MERMAID通过整合智能体驱动搜索、结构化知识表示和持久记忆模块,提升事实核查和主张验证的效率与一致性,实现检索、推理与记忆的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02387 2026-04-14 cs.AI 70%

VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments

VS-Bench:评估多智能体环境中视觉语言模型的战略能力

Zelai Xu, Zhexuan Xu, Xiangmin Yi, Huining Yuan, Mo Guang, Kaiwen Long, Xinlei Chen, Yi Wu, Chao Yu, Yu Wang

机构 * EE, Tsinghua University(清华大学电子工程系) SIGS, Tsinghua University(清华大学深圳国际研究生院) Li Auto Inc.(理想汽车) IIIS, Tsinghua University(清华大学交叉信息研究院)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.AI

AI总结 VS-Bench是首个评估多智能体环境中视觉语言模型战略能力的多模态基准,涵盖合作、竞争和混合动机交互,通过感知、推理和决策三个维度评估15种领先模型,揭示当前模型在推理和决策上的显著差距。

Comments Published at CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10436 2026-04-14 cs.CV 70%

SignReasoner: Compositional Reasoning for Complex Traffic Sign Understanding via Functional Structure Units

SignReasoner:通过功能结构单元实现复杂交通标志理解的组合推理

Ruibin Wang, Zhenyu Lin, Xinhai Zhao

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出SignReasoner,通过功能结构单元实现复杂交通标志的组合推理,提升自动驾驶安全。核心方法是功能结构单元,通过分解标志为基本功能块,增强模型对未知配置的泛化能力。

Comments CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11004 2026-04-14 cs.CV cs.AI cs.LG 67%

Panoptic Pairwise Distortion Graph

全景成对失真图

Muhammad Kamran Janjua, Abdul Wahab, Bahador Rashidi

机构 * Huawei Technologies(华为技术有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出全景成对失真图任务,通过区域结构化组成图像对,改进现有方法对整体图像分析的局限性,构建PandaSet数据集、PandaBench基准和Panda架构,揭示多模态大语言模型在区域级失真理解上的不足。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09907 2026-04-14 cs.CV cs.AI cs.CL 62%

From UAV Imagery to Agronomic Reasoning: A Multimodal LLM Benchmark for Plant Phenotyping

从无人机图像到农学推理:一种多模态大语言模型基准用于植物表型分析

Yu Wu, Guangzeng Han, Ibra Niang Niang, Francia Ravelombola, Maiara Oliveira, Jason Davis, Dong Chen, Feng Lin, Xiaolei Huang

机构 * University of Memphis(孟菲斯大学) University of Missouri(密苏里大学) University of Arkansas Division of Agriculture(阿肯色大学农业分部) Mississippi State University(密西西比州立大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PlantXpert基准,用于大豆和棉花表型分析,评估多模态模型在农业领域的表现,发现任务特定微调显著提升准确率,但模型扩展和跨物种泛化仍面临挑战。

Comments In review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11102 2026-04-14 cs.CV cs.MM 57%

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进

Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan

机构 * ARC Lab, Tencent(腾讯ARC实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。

Comments Project Page: https://arcomniscript.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04849 2026-04-14 physics.chem-ph cs.AI cs.MA 57%

El Agente Estructural: An Artificially Intelligent Molecular Editor

结构代理:一种人工智能分子编辑器

Changhyeok Choi, Yunheng Zou, Marcel Müller, Han Hao, Yeonghun Kang, Juan B. Pérez-Sánchez, Ignacio Gustin, Hanyong Xu, Andrew Wang, Mohammad Ghazi Vakili, Chris Crebolder, Alán Aspuru-Guzik, Varinia Bernales

机构 * University of Toronto(多伦多大学) Acceleration Consortium(加速联盟) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院) NVIDIA(英伟达)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出El Agente Estructural,一种多模态、自然语言驱动的几何生成与操控代理,用于自主化学和分子建模。该代理通过整合领域知识工具和视觉语言模型,实现对分子结构的精确操控,无需重建核心分子框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10973 2026-04-14 cs.AI cs.CL 57%

CFMS: A Coarse-to-Fine Multimodal Synthesis Framework for Enhanced Tabular Reasoning

CFMS:一种用于增强表格推理的粗到细多模态合成框架

Qixian Huang, Hongqiang Lin, Tong Fu, Yingsen Wang, Zhenghui Fu, Qirui Wang, Yiding Sun, Dongxu Zhang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出CFMS框架,通过粗到细的多模态合成方法提升表格推理能力,实验表明其在处理大表格和小模型时具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10517 2026-04-14 cs.AI 57%

From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning

从感知到规划:通过课程学习进化自主任务导向的空间时间推理

Xiaoda Yang, Yuxiang Liu, Shenzhou Gao, Can Wang, Jingyang Xue, Lixin Yang, Yao Mu, Tao Jin, Shuicheng Yan, Zhimeng Zhang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Qingdao University(青岛大学) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出EgoTSR框架,通过课程学习提升任务导向的空间时间推理能力,解决静态感知和动态环境中的时空幻觉问题,实验显示其在长周期推理任务中准确率达92.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10470 2026-04-14 cs.CL cs.AI 57%

From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal Consultation

从查询到建议:基于多智能体框架和数据集的结构化推理用于法律咨询

Mingfei Lu, Yi Zhang, Mengjia Wu, Yue Feng

机构 * Australian Artificial Intelligence Institute (AAII), University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出JurisCQAD数据集和JurisMA框架,通过结构化任务分解和多智能体协作,提升法律咨询问答的准确性与解释性。

Comments Accepted by ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10420 2026-04-14 cs.LG 57%

CARE-ECG: Causal Agent-based Reasoning for Explainable and Counterfactual ECG Interpretation

CARE-ECG:基于因果代理的可解释与反事实ECG解读

Elahe Khatibi, Ziyu Wang, Ankita Sharma, Krishnendu Chakrabarty, Sanaz Rahimi Moosavi, Farshad Firouzi, Amir Rahmani

机构 * University of California, Irvine(加州大学尔湾分校) Arizona State University(亚利桑那州立大学) California State University, Dominguez Hills(加州州立大学多明格斯山分校)

专题命中 视觉推理 :grounding(abstract);分类 cs.LG

AI总结 CARE-ECG通过统一的表示学习、诊断和解释流程,提升ECG解读的准确性与可信度,减少幻觉,适用于多基准和专家问答场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05767 2026-04-14 cs.CV cs.CL 57%

Beyond the Beep: Scalable Collision Anticipation and Real-Time Explainability with BADAS-2.0

超越蜂鸣声:通过BADAS-2.0实现可扩展的碰撞预测与实时可解释性

Roni Goldshmidt, Hamish Scott, Lorenzo Niccolini, Hernan Matzner

机构 * Nexar AI

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 BADAS-2.0在长尾基准、知识蒸馏和可解释性三方面提升,通过大规模数据集扩展和轻量模型部署实现实时碰撞预测与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00013 2026-04-14 cs.CL cs.AI 57%

C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis

C2F-Thinker:基于提示引导强化学习的粗到细推理用于多模态情感分析

Miaosen Luo, Zhenhao Yang, Jieshen Long, Jinghu Sun, Yichu Liu, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出C2F-Thinker框架,通过粗到细结构推理与提示引导强化学习,提升多模态情感分析的可解释性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏