arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-19 至 2026-05-19 共收录 138 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 32 篇

2605.17329 2026-05-19 cs.CR cs.AI 57%

LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails

LPG: 在潜在策略护栏中平衡效率与政策推理

Nanxi Li, Zhengyue Zhao, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出LPG框架,通过学习动态政策的语义潜在推理,在保持高安全准确率的同时实现低延迟的政策执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17262 2026-05-19 cs.CV 57%

EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准

Zeyu Wang, Chang Liu, Eduardus Tjitrahardja, Yuntao Wang, Borislav Pavlov, Fangfei Gou, Jose Manuel Davila, Dai Shi, Ran Xu, Yue Pan, Jiayi Tan, Shuting Chang, Qi Wang, Jinzhao Li, Jiacheng Hua, Yifei Huang, Jingwei Sun, Yu Zhang, Liuxin Zhang, Guocai Yao, Jia Jia, Yin Li, Qianying Wang, Yuanchun Shi, Miao Liu

机构 * Tsinghua University(清华大学) Tongji University(同济大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学) Lenovo Group(联想集团) Peking University(北京大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出EgoIntrospect数据集,用于研究用户中心内部状态推理,通过自注释揭示用户与AI助手的交互意图,评估多模态大语言模型在从注视观察中推理用户内部状态的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17187 2026-05-19 cs.CL cs.AI cs.CY 57%

PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media

PluRule:一种用于社交媒体上多元社区调节的基准测试

Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer

机构 * Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国) Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 研究探讨了AI模型在调节社交媒体上多元社区中的挑战,提出PluRule基准测试以检测13371条规则违规情况,发现即使使用最先进的视觉语言模型,也难以有效识别违规行为。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17077 2026-05-19 cs.RO cs.AI 57%

How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning

如何指导你的机器人:密集语言标注助力机器人策略学习

Bosung Kim, Ruiyi Wang, David Acuna, Jaehun Jung, Alexander Trevithick, Brandon Cui, Yejin Choi, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

AI总结 本研究通过密集语言标注提升机器人策略学习效率,提出DeMiAn方法,利用视觉语言模型生成多方面标注,提升策略和世界模型性能,无需新增演示数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14504 2026-05-19 cs.AI 57%

When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution

当机器人做家务:一个基准和代理用于长期家庭任务执行

Zilin Zhu, Longteng Guo, Yanghong Mei, Bowen Pang, Zongxun Zhang, Xingjian He, Ruyi Ji, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

AI总结 本文提出LongAct基准和HoloMind代理,用于评估长期家庭任务执行中的高层自主能力,实验显示HoloMind在减少模型规模依赖的同时提升了长期性能,但目标完成率仍较低,凸显了长期规划的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07245 2026-05-19 cs.CV 57%

Zero-Shot Textual Explanations via Translating Decision-Critical Features

通过翻译决策关键特征实现零样本文本解释

Toshinori Yamauchi, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国家信息研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TEXTER方法,通过隔离决策关键特征生成更准确的文本解释,提升模型可解释性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08501 2026-05-19 cs.AI 57%

GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games

GVGAI-LLM:通过无限游戏评估大语言模型代理

Yuchen Li, Cong Lin, Muhammad Umair Nasir, Philip Bontrager, Jialin Liu, Julian Togelius

机构 * New York University(纽约大学) University of the Witwatersrand(沃尔特·斯通大学) Meta Lingnan University(岭南大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 GVGAI-LLM通过 arcade 式游戏测试大语言模型的推理与问题解决能力,定义了可解释的评估指标,揭示了模型在空间推理和基本规划中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01608 2026-05-19 cs.CV 57%

From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models

从像素到地点:一个系统性基准,用于评估大语言模型中的图像地理定位能力

Lingyao Li, Runlong Yu, Qikai Hu, Bowei Li, Min Deng, Yang Zhou, Xiaowei Jia

机构 * University of South Florida Tampa USA University of Alabama Tuscaloosa USA University of Michigan Ann Arbor USA Texas Tech University Lubbock USA Texas A \& M University College Station USA University of Pittsburgh Pittsburgh USA University of South Florida University of Alabama University of Michigan Texas Tech University Texas A \& M University University of Pittsburgh

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出IMAGEO-Bench基准,系统评估大语言模型在图像地理定位中的准确性、距离误差、地理偏见和推理过程,揭示闭源模型在高资源区域表现优于欠代表区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17962 2026-05-19 cs.CE 50%

FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation

FinDocMRE:一个文档级金融多模态推理评估基准

Jiayong Zhu, Jiangtong Li, Jinru Ding, Dawei Cheng, Jie Xu, Feng Yu

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出FinDocMRE基准,用于评估金融多模态模型在文档级推理中的能力,通过构建包含12,207个样本的金融报告数据集,评估多图像处理和文档理解能力,发现现有模型在复杂文档环境中整合视觉基础与逻辑推理存在挑战。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉定位与Grounding 31 篇

2605.17070 2026-05-19 cs.CV 92%

EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准

Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju

机构 * X-Humanoid Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Monash University(墨尔本大学) Celonis AI University of New South Wales(新南威尔士大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出 EPIC-Bench,一种以感知为中心的细粒度具身视觉 grounding 基准,旨在系统评估 VLMs 在现实世界具身环境中的视觉感知能力。该基准包含 6.6k 个精心标注的元组(图像,文本,掩码),涵盖 23 个细粒度任务,涉及具身交互管道的三个核心阶段:目标定位、导航和操作。评估结果显示,尽管先进推理模型表现出潜力,但当前 VLMs 在复杂视觉-文本对齐方面普遍存在困难,特别是在多目标计数、部分-整体关系理解和 affordance 区域检测方面存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18434 2026-05-19 cs.IR cs.CV 87%

TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval

TIGER-FG: 基于文本引导的隐式细粒度 grounding 用于电商检索

Xinyu Sun, Huangyu Dai, Lingtao Mao, Zexin Zheng, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文提出TIGER-FG框架,通过文本引导生成目标聚焦的物品表示,解决电商检索中模态和粒度不匹配的问题,并在两个基准测试中提升了检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18748 2026-05-19 cs.CV 86%

Aurora: Unified Video Editing with a Tool-Using Agent

Aurora: 一种基于工具使用的统一视频编辑框架

Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

机构 * MIT-IBM(MIT-IBM研究院) NVIDIA(NVIDIA公司)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出Aurora框架,通过结合增强的视觉语言模型(VLM)代理和统一视频扩散变换器,解决视频编辑中的文本和视觉不充分问题,提升了视频编辑的灵活性和准确性。

Comments Code: https://github.com/yeates/Aurora

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10871 2026-05-19 physics.med-ph cs.AI cs.LG 81%

Attractor-Vascular Coupling Theory: Formal Grounding and Empirical Validation for AAMI-Standard Cuffless Blood Pressure Estimation from Smartphone Photoplethysmography

吸引子-血管耦合理论:为基于智能手机光电容积图的AAMI标准无创血压估计提供形式基础和实证验证

Timothy Oladunni, Farouk Ganiyu Adewumi

机构 * Department of Computer Science, Morgan State University(莫根州立大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种数学框架,证明心脏吸引子几何编码了足够的血压信息,用于AAMI标准估计,并通过校准的无创血压模型验证了该理论,利用光电容积图(PPG)进行血压估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04343 2026-05-19 cs.IR 80%

The Personalization Paradox: Semantic Loss vs. Reasoning Gains in Agentic AI Q&A

个性化悖论:语义损失与推理增益在代理AI问答中的权衡

Satyajit Movidi, Stephen Russell

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract)

AI总结 本文研究了个性化对系统性能的影响,通过比较不同配置发现个性化虽提升推理和 grounding 能力,但导致语义相似度下降,揭示了现有 LLM 评估方法的不足。

Journal ref Cloud Computing and Data Science 2026 May 18;7(2):290-313

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02060 2026-05-19 cs.CV cs.RO 79%

CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects

CompassAD: 基于意图的多功能竞争物体3D affordance 地标

Jingliang Li, Jindou Jia, Tuo An, Chuhao Zhou, Xiangyu Chen, Shilin Shan, Boyu Ma, Bofan Lyu, Gen Li, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University, Singapore(MARS实验室,南洋理工大学,新加坡)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 该研究提出了一种新的3D affordance设定,即意图驱动的可混淆地标,旨在预测多物体点云中正确物体的每点affordance掩码,基于隐含的自然语言意图。通过构建CompassAD基准,该研究展示了在具有隐含意图的多物体组合中的先进结果,并在机器人机械臂上验证了其在真实世界抓取中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00876 2026-05-19 cs.AI cs.MA 79%

BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning

BioProAgent:用于受限科学规划的神经符号接地

Yuyang Liu, Jingya Wang, Liuzhenghao Lv, Yonghong Tian

机构 * School of AI for Science, Peking University(科学人工智能学院,北京大学) School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 BioProAgent通过神经符号框架将概率规划锚定在确定性有限状态机中,解决复杂设备模式中的上下文瓶颈,提升物理执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13795 2026-05-19 cs.CV 74%

Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models

无需训练的零样本时序动作检测与视觉-语言模型

Chaolei Han, Hongsong Wang, Jidong Kuang, Lei Zhang, Jie Gui

机构 * Southeast University School of Cyber Science and Engineering(东南大学网络安全科学与工程学院) Southeast University School of Computer Science and Engineering(东南大学计算机科学与工程学院) Nanjing Normal University School of Electrical Engineering and Automation(南京师范大学电气工程与自动化学院)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV

AI总结 本文提出一种无需训练的零样本时序动作检测方法FreeZAD,利用现有的视觉-语言模型直接对未标记视频中的未知活动进行分类和定位,无需额外微调或适应,并通过LogOIC和频率基于的动作校准以及测试时适应策略提升性能。

Journal ref IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17456 2026-05-19 cs.CV cs.AI 73%

GCE-MIL: Faithful and Recoverable Evidence for Multiple Instance Learning in Whole-Slide Imaging

GCE-MIL: 多实例学习中全滑片成像的可信且可恢复的证据

Xiangyu Li, Ran Su

机构 * College of Intelligence and Computing(智能与计算学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究提出GCE-MIL方法,通过优化S/N/R标准直接提升多实例学习中全滑片成像的预测性能和证据质量,改进了宏F1分数和C-index,并减少了连续-离散差距。

Comments 10 pages, 17 figures, 24 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18653 2026-05-19 cs.MM 71%

Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web

它会流行吗?基于开放网络的微视频流行度预测

Ryang Heo, Dongha Lee

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出了一种基于开放网络的微视频流行度预测方法,通过引入实时开放网络上下文来提升预测准确性,展示了WEBSHORTS数据集和SHORTS-CAST框架在预测微视频流行度方面的有效性。

Comments Working Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18593 2026-05-19 cs.CR cs.AI cs.RO 70%

Not What You Asked For: Typographic Attacks in Household Robot Manipulation

并非你所要求的:家庭机器人操作中的字体攻击

Ali Iranmanesh, Peng Liu

机构 * Cyber Security Lab(网络安全实验室) The Pennsylvania State University(宾夕法尼亚州立大学) State College, USA(州立学院,美国)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本研究探讨了字体攻击对家庭机器人操作全流程的影响,提出了一种解耦感知架构,并发现感知错误会通过持久的3D语义地图导致物理性故障,揭示了字体误分类对机器人安全性的实际威胁。

Comments 10 pages, 1 figure, IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18547 2026-05-19 cs.AI 70%

VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation

VISAFF: 以说话者为中心的视觉情感特征学习用于对话中的情感识别

Linan ZHU, Zihao Zhai, Xiao Han, Yuqian Fu, Xiangfan Chen, Xiangjie Kong, Guojiang Shen

机构 * Zhejiang University of Technology(浙江工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出VISAFF框架,通过以说话者为中心的视觉情感特征学习方法,解决对话中情感识别中的复杂场景问题,提升计算效率并避免大规模模型微调的高成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17669 2026-05-19 cs.AI 70%

Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models

多模态文化遗产品知图扩展与语言和视觉模型

Yang Zhang, Nada Mimouni, Jean-Claude Moissinac, Fayçal Hamdi

机构 * Center for Studies and Research in Computer Science and Communication, CNAM(计算机科学与通信研究所以及CNAME)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出了一种多模态方法,利用语言和视觉模型扩展文化遗产品知图,通过构建多模态知识图谱WJoconde并建立评估基准,提高知识图谱的扩展效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16431 2026-05-19 cs.CV 70%

CT-DegradBench: A Physics-Informed Benchmark for CT Degradation Detection and Severity Estimation

CT-DegradBench:一种用于CT退化检测和严重程度估计的物理引导基准

Yousra Nabila Taifour, Marouane Tliba, Zuheng Ming, Marie Luong, Nour Aburaed, Aladine Chetouani, Gorkem Durak, Alessandro Bruno, Faouzi Alaya Cheikh, Habib Zaidi, Ulas Bagci, Azeddine Beghdadi

机构 * Université Sorbonne Paris Nord(索邦巴黎北大学) University of Dubai(迪拜大学) Northwestern University(西北大学) IULM University(IULM大学) Norwegian University of Science and Technology(挪威科学与技术大学) University of Geneva(日内瓦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出CT-DegradBench,一个用于评估CT退化检测和严重程度估计的基准,结合语义先验和频域线索,提出SeSpeCT框架,在多模态嵌入空间中构建免训练的语义质量轴,实现退化类型和严重程度的联合预测。

Comments Accepted in CVPR 2026 VISION Workshop (DEXTER track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04727 2026-05-19 cs.CV cs.AI 62%

Are Multimodal LLMs Ready for Surveillance? A Reality Check on Zero-Shot Anomaly Detection in the Wild

多模态大语言模型是否准备好用于监控?对零样本异常检测在现实中的检验

Shanle Yao, Armin Danesh Pazho, Narges Rashvand, Hamed Tabkhi

机构 * Electrical and Computer Engineering Department(电气与计算机工程系)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型在现实中的零样本异常检测性能,发现其存在保守偏差,通过特定指令可以提升F1分数,但召回率仍是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16795 2026-05-19 cs.CV cs.AI cs.GR 62%

3DPhysVideo: Consistency-Guided Flow SDE for Video Generation via 3D Scene Reconstruction and Physical Simulation

3DPhysVideo: 通过3D场景重建和物理模拟的一致性引导流SDE用于视频生成

Hwidong Kim, Yunho Kim, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种无需训练的管道,通过3D场景重建和物理模拟生成逼真视频,利用一致性引导流SDE分解预测速度以确保条件输入的一致性,从而在多物体和流体交互场景中实现从单张图像到物理合理视频的过渡。

Comments Project page: https://hwidong-kim.github.io/projects/3DPhysVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04202 2026-05-19 cs.LG cs.AI cs.CL 62%

ClawArena: Benchmarking AI Agents in Evolving Information Environments

ClawArena:在演化的信息环境中评估AI代理的基准测试

Haonian Ji, Kaiwen Xiong, Siwei Han, Peng Xia, Shi Qiu, Yiyang Zhou, Jiaqi Liu, Jinlong Li, Bingzhou Li, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳州立大学夏洛特分校) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 ClawArena评估AI代理在信息环境动态变化中的能力,通过多源冲突推理、动态信念更新和隐式个性化三个挑战,测试代理在多通道会话、工作区文件和阶段更新中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13270 2026-05-19 cs.CV cs.AI 62%

RadGame: An AI-Powered Platform for Radiology Education

RadGame:一种基于人工智能的放射学教育平台

Mohammed Baharoon, Siavash Raissi, John S. Jun, Thibault Heintz, Mahmoud Alabbad, Ali Alburkani, Sung Eun Kim, Kent Kleinschmidt, Abdulrahman O. Alhumaydhi, Mohannad Mohammed G. Alghamdi, Jeremy Francis Palacio, Mohammed Bukhaytan, Noah Michael Prudlo, Rithvik Akula, Brady Chrisler, Benjamin Galligos, Mohammed O. Almutairi, Mazeen Mohammed Alanazi, Nasser M. Alrashdi, Joel Jihwan Hwang, Sri Sai Dinesh Jaliparthi, Luke David Nelson, Nathaniel Nguyen, Sathvik Suryadevara, Steven Kim, Mohammed F. Mohammed, Yevgeniy R. Semenov, Kun-Hsing Yu, Abdulrhman Aljouie, Hassan AlOmaish, Adam Rodman, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院) Mass General Brigham(麻省总医院) Maastricht University(马斯特里赫特大学) Department of Medical Imaging, King Abdulaziz Medical City, Ministry of National Guard, Riyadh, Saudi Arabia(国王阿卜杜勒-阿齐兹医疗城医学影像科,沙特阿拉伯) National Strategic Technology Research Institute, Seoul National University Hospital(全国战略技术研究所,首尔国立大学医院) Saint Louis University School of Medicine(圣路易斯大学医学院) College of Medicine, King Saud bin Abdulaziz University for Health Sciences(国王萨勒曼·本·阿卜杜勒阿齐兹大学医学院) Tufts University School of Medicine(塔夫茨大学医学院) Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RadGame通过结合游戏化与大规模公开数据集,提供AI驱动的反馈,提升放射学教育中的定位和报告撰写能力,显著提高学习效果。

Comments ML4H Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16441 2026-05-19 cs.LG cs.AI 62%

DeepArrhythmia: Segment-Contextualized ECG Arrhythmia Classification via Selective Evidence Acquisition

DeepArrhythmia: 基于选择性证据获取的段落上下文化ECG心律失常分类

Jiahui Li, Ruili Fang, Zishuai Liu, WenZhan Song, Jin Lu, Fei Dou

机构 * University of Georgia(佐治亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 DeepArrhythmia通过选择性证据获取实现段落上下文化ECG心律失常分类,结合原始ECG信号和渲染波形图像,利用专门工具分离生理测量与证据整合,提升多beat节奏上下文下的心律失常检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18630 2026-05-19 cs.AI physics.comp-ph 57%

SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science

SCICONVBENCH: 评估LLM在计算科学任务公式化中的多轮澄清能力

Nithin Somasekharan, Youssef Hassan, Shiyao Lin, Gihan Panapitiya, Patrick Emami, Anurag Acharya, Sameera Horawalavithana, Shaowu Pan

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) University of Texas at Arlington(德克萨斯大学阿灵顿分校) Pacific Northwest National Laboratory(太平洋西北国家实验室) National Renewable Energy Laboratory(国家可再生能源实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出SCICONVBENCH基准,用于评估LLM在计算科学任务公式化中的多轮澄清能力,重点在于获取缺失信息和解决请求中的矛盾,通过结构化任务本体和基于标准的评估框架,系统测量LLM在澄清行为、对话基础性和最终规格忠实度三个维度上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18327 2026-05-19 cs.AI 57%

Causely: A Causal Intelligence Layer for Enterprise AI A Benchmark Study on SRE and Reliability Workflows

Causely: 企业AI中的因果智能层 一项关于SRE和可靠性工作流的基准研究

Dhairya Dalal, Endre Sara, Ben Yemini, Christine Miller, Shmuel Kliger

机构 * Causely

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Causely,一种企业AI的因果智能层,通过维护环境拓扑、属性依赖性和因果关系的结构化表示,为AI代理提供语义和因果基础,以诊断、评估影响并安全地在生产环境中操作。通过在受控环境下注入故障的24微服务OpenTelemetry演示应用进行基准研究,评估了Causely的价值主张。

详情

展开后加载摘要…

URL PDF HTML 收藏