arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

2026-05-20 至 2026-05-20 共收录 10
2605.20165 2026-05-20 cs.CV

CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models

CaMo:基于摄像机运动的视觉-语言模型评估与训练

Hsiang-Wei Huang, Junbin Lu, Kuang-Ming Chen, Jianxu Shangguan, Cheng-Yen Yang, Jenq-Neng Hwang

机构 * Department of Electrical and Computer Engineering, University of Washington, Seattle, USA(华盛顿大学电气与计算机工程系)

AI总结 本文提出了一种基于摄像机运动的视觉-语言模型评估与训练方法CaMo,通过要求模型生成显式的空间叙述并进行推理,揭示了现有空间视觉-语言模型在空间认知方面的不足,并展示了CaMo在空间叙述评估和直接空间问题回答准确性上的一致表现。

Comments Code and model available at https://github.com/hsiangwei0903/CaMo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19357 2026-05-20 cs.CL

SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models

SciCustom: 一个用于大型语言模型科学能力定制评估的框架

Yiyang Gu, Junwei Yang, Junyu Luo, Ye Yuan, Bin Feng, Yingce Xia, Shufang Xie, Kaili Liu, Bohan Wu, Qi Shi, Haoran Li, Beier Xiao, Zhiping Xiao, Xiao Luo, Weizhi Zhang, Philip S. Yu, Zequn Liu, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(多媒体信息处理国家重点实验室,计算机学院,PKU-Anker LLM实验室,北京大学) Zhongguancun Academy(中关村学院) IDEA Xidian University(西安电子科技大学) Peking University(北京大学) University of Washington(华盛顿大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文提出SciCustom框架,通过从大规模科学数据中自定义构建基准,评估LLM在特定科学任务中的能力,无需专家标注或合成问题生成,展示了细粒度科学能力差异。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19185 2026-05-20 cs.LG cs.AI

Planner-Admissible Graph-PDE Value Extensions for Sparse Goal-Conditioned Planning

规划可接受的图-偏微分方程值扩展用于稀疏目标条件规划

Shiheng Zhang

机构 * Department of Applied Mathematics, University of Washington(应用数学系,华盛顿大学)

AI总结 本文研究了在操作argmin-Q规划器下,哪些图值扩展是规划可接受的,提出了一种局部动作间隙证书,证明在 rollout 过程中若代理值误差低于真实动作间隙的一半,则贪心 rollout 可达到目标。通过比较原理填充距离界,AMLE 实现了该证书,而调和扩展由于反映边界击中概率而非最短路径贪心顺序,可能导致局部动作排名错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17859 2026-05-20 cs.HC cs.LG

Multi-site PPG: An In-the-Wild Physiological Dataset from Emerging Multi-site Wearables

多站点PPG:来自新兴多站点可穿戴设备的野外生理数据集

Jiayi Shao, Jiaying Ye, Shengyao Liu, Zachary Englhardt, Girish Narayanswamy, Vikram Iyer, Qiuyue Shirley Xue

机构 * University of Washington(华盛顿大学) Purdue University(普渡大学)

AI总结 本文提出一个多站点PPG数据集,通过四个定制开发的无感可穿戴设备收集了超过350小时的原始数据,用于评估不同身体部位的PPG信号在心率估计中的表现差异。

Comments 20 pages, 6 figures, 11 tables. Dataset and code available at the URLs in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16679 2026-05-20 cs.CL cs.AI

CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?

CHI-Bench: 能否让AI代理自动化端到端、长周期、政策丰富的医疗工作流程?

Haolin Chen, Deon Metelski, Leon Qi, Tao Xia, Joonyul Lee, Steve Brown, Kevin Riley, Frank Wang, T. Y. Alvin Liu, Hank Capps MD, Zeyu Tang, Xiangchen Song, Lingjing Kong, Fan Feng, Tianyi Zeng, Zhiwei Liu, Zixian Ma, Hang Jiang, Fangli Geng, Yuan Yuan, Chenyu You, Qingsong Wen, Hua Wei, Yanjie Fu, Yue Zhao, Carl Yang, Biwei Huang, Kun Zhang, Caiming Xiong, Sanmi Koyejo, Eric P. Xing, Philip S. Yu, Weiran Yao

机构 * Johns Hopkins Medicine(约翰霍普金斯医学中心) Wellstar Health System(Wellstar健康系统) Stanford University(斯坦福大学) CMU(卡内基梅隆大学) UCSD(加州大学圣地亚哥分校) Yale School of Medicine(耶鲁医学院) Salesforce AI Research(Salesforce人工智能研究) University of Washington(华盛顿大学) Northeastern University(东北大学) Brown University(布朗大学) Boston College(波士顿学院) Stony Brook University(史泰森布里克大学) University of Oxford(牛津大学) Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Emory University(埃默里大学) MBZUAI Recursive Superintelligence(递归超级智能) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文提出CHI-Bench基准,旨在评估AI代理在医疗工作流程中端到端、长周期和政策丰富任务中的自动化能力,揭示当前基准测试中政策密度、多角色协作和多方交互等能力的不足。

Comments Website: https://actava.ai/benchmarks Code: https://github.com/actava-ai/chi-bench Dataset: https://huggingface.co/datasets/actava/chi-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06740 2026-05-20 q-bio.QM cs.AI

ViroGym: Realistic Large-Scale Benchmarks for Evaluating Viral Proteins

ViroGym: 用于评估病毒蛋白的现实大规模基准

Yichen Zhou, Jonathan Golob, Amir Karimi, Stefan Bauer, Patrick Schwab

机构 * GlaxoSmithKline(葛兰素史克) Technical University of Munich(慕尼黑技术大学) University of Washington(华盛顿大学) KTH Royal Institute of Technology(皇家理工学院)

AI总结 本文提出ViroGym,一个用于评估蛋白质语言模型在病毒蛋白上的表现的综合基准,通过三个任务评估pLMs:79个深入突变扫描实验、21个流感中和任务以及SARS-CoV-2的现实世界预测任务,发现ProGen2家族在所有任务中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14261 2026-05-20 cs.CL

Rewriting History: A Recipe for Interventional Analyses to Study Data Effects on Model Behavior

重写历史:一种用于干预分析以研究数据对模型行为影响的配方

Rahul Nadkarni, Yanai Elazar, Hila Gonen, Noah A. Smith

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·阿伦计算机科学与工程学院,华盛顿大学) Department of Computer Science, Bar-Ilan University(巴伊兰大学计算机科学系) Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Allen Institute for Artificial Intelligence(人工智能阿伦研究所)

AI总结 本文提出了一种实验方法,用于研究训练数据与语言模型行为之间的关系,通过干预数据批次(即'重写历史')并重新训练模型检查点来测试数据与行为之间的假设,展示了如何通过案例研究来验证事实知识获取中的数据影响。

Comments Accepted to TACL, pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05746 2026-05-20 cs.AI cs.CL cs.LG

ARM: Discovering Agentic Reasoning Modules for Generalizable Multi-Agent Systems

ARM:为通用多智能体系统发现代理推理模块

Bohan Yao, Shiva Krishna Reddy Malay, Vikas Yadav

机构 * University of Washington(华盛顿大学)

AI总结 本文提出了一种新的自动多智能体系统设计范式,通过优化链式推理(CoT)来发现代理推理模块(ARM),该模块通过在代码空间中进行树搜索,利用执行轨迹的反思来进化,从而提升多智能体系统的泛化能力。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18959 2026-05-20 astro-ph.IM astro-ph.CO astro-ph.EP astro-ph.GA cs.LG

Hyrax: An Extensible Framework for Rapid ML Experimentation and Unsupervised Discovery in the Era of Rubin, Roman, and Euclid

Hyrax:一个用于快速机器学习实验和无监督发现的可扩展框架,在Rubin、Roman和Euclid时代

Aritra Ghosh, Drew Oldag, Michael Tauraso, Andrew J. Connolly, Peter Ferguson, Derek Jones, Gourav Khullar, Argyro Sasli, Samarth Venkatesh, Gracia Wang, Maxine West, Dylan Berry, Neven Caplar, Colin Orion Chandler, Tanawan Chatchadanoraset, Michael W. Coughlin, Melissa DeLucchi, Alexandra Junell, Diego Miura, Felipe Fontinele Nunes, Wilson Beebe, Doug Branton, Sandro Campos, Liam Cunningham, Mi Dai, Jeremy Kubica, Konstantin Malanchev, Rachel Mandelbaum, Sean McGuire, Imad Pasha, Dan S. Taranu, Tianqing Zhang

机构 * Dept. of Astronomy \& the DiRAC Institute, University of Washington, Box 351580, Seattle, WA 98195, USA School of Physics Astronomy, University of Minnesota, Minneapolis, MN 55455, USA Department of Astronomy Planetary Science, Northern Arizona University, Flagstaff, USA McWilliams Center for Cosmology Astrophysics, Department of Physics, Carnegie Mellon University, Pittsburgh, PA 15213, USA

AI总结 本文提出Hyrax,一个支持天文领域完整机器学习生命周期的开源框架,通过五个实际应用展示了其在大规模天文数据中的无监督发现和监督检测能力,为下一代天文调查提供了系统化的机器学习基础设施。

Comments 28 pages, 20 figures, submitted to AJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02818 2026-05-20 cs.RO cs.LG

RoboMD: Uncovering Robot Vulnerabilities through Semantic Potential Fields

RoboMD: 通过语义势场揭示机器人漏洞

Som Sagar, Jiafei Duan, Sreevishakh Vasudevan, Yifan Zhou, Heni Ben Amor, Dieter Fox, Ransalu Senanayake

机构 * Arizona State University(亚利桑那州立大学) University of Washington(华盛顿大学)

AI总结 本研究提出RoboMD框架,通过学习基于连续视觉-语言嵌入的深度强化学习策略,揭示机器人在现实世界中因外部变化导致的漏洞,通过虚拟运行实现高效安全的漏洞分析,实验表明其能发现比现有基线多23%的漏洞,并提升机器人操作性能。

Comments 26 Pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏