arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-05-14 至 2026-05-14 共收录 6
2605.13737 2026-05-14 cs.AI cs.CL

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

宽视角闭合:多模态大语言模型中的表征-行动鸿沟

Trung Nguyen Quang, Yiming Gao, Fanyi Pu, Kaichen Zhang, Shuo Sun, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) LMMs-Lab Team(多模态大模型实验室团队) Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究发现多模态大语言模型在感知与行动之间存在鸿沟,通过IMAVB基准测试揭示模型在处理冲突信息时的不足,提出PGLA方法提升拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13711 2026-05-14 cs.LG

MILM: Large Language Models for Multimodal Irregular Time Series with Informative Sampling

MILM:用于多模态不规则时间序列的大型语言模型与信息采样

Hsing-Huan Chung, Shijun Li, Yoav Wald, Xing Han, Suchi Saria, Joydeep Ghosh

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Technion-IIT(技术学院-以色列理工学院) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出MILM模型,通过两阶段策略处理多模态不规则时间序列,有效利用采样模式和观测值进行分类,提升医疗记录中住院死亡率预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13675 2026-05-14 cs.CV cs.LG q-bio.NC

Characterizing Universal Object Representations Across Vision Models

跨视觉模型的通用对象表示表征

Florian P. Mahner, Johannes Roth, Ka Chun Lam, Michael F. Bonner, Francisco Pereira, Martin N. Hebart

机构 * Vision and Computational Cognition Group(视觉与计算认知组) Max Planck Institute(马克斯·普朗克研究所) Justus-Liebig-University Giessen(吉森约瑟夫·李贝大学) Machine Learning Core(机器学习核心) Department of Cognitive Science(认知科学系) National Institute of Mental Health(国家心理健康研究所) Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究通过分解162种不同视觉模型的对象相似性结构,发现通用维度比模型特定维度更可解释,且与概念图像属性相关,表明生物视觉与深度学习模型的对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13625 2026-05-14 cs.AI

How to Interpret Agent Behavior

如何解释智能体行为

Jie Gao, Kaiser Sun, Jen-tse Huang, Katherine Van Koevering, Sijie Ji, Heyuan Huang, Weiyan Shi, Zhuoran Lu, Ziang Xiao, Daniel Khashabi, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) California Institute of Technology(加州理工学院) Northeastern University(东北大学) Purdue University(普渡大学)

AI总结 本文提出ACT*ONOMY框架,通过构建行为分类体系和开放仓库,帮助研究人员更一致地解读智能体行为,提升监控与控制能力。

Comments 34 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13595 2026-05-14 cs.CL

Inducing Artificial Uncertainty in Language Models

在语言模型中诱导人工不确定性

Sophia Hager, Simon Zeng, Nicholas Andrews

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软)

AI总结 本文研究了在缺乏挑战性数据时如何通过诱导人工不确定性来提升语言模型的不确定性量化能力,通过训练探测器识别人工不确定性,实现了在困难数据上的高校准性,且对简单数据的性能影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01502 2026-05-14 q-bio.NC cs.CV cs.LG

Behavioral Geometric Supervision Aligns Video Foundation Models with Human Social Perception

行为几何监督使视频基础模型与人类社会感知对齐

Kathy Garcia, Leyla Isik

机构 * Department of Cognitive Science(认知科学系) Department of Biomedical Engineering(生物医学工程系) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出行为几何监督(BGS),通过引入人类社会判断数据,提升视频模型对社会关系的感知能力,实验表明该方法能显著提升模型性能并揭示可解释的社会情感属性。

Comments v2: Major revision. Retitled; expanded from TimeSformer alone to four backbones (V-JEPA 2/2.1, TimeSformer, VideoMAE, CLIP), with V-JEPA 2.1 nearly tripling pretrained performance. Adds zero-shot PHASE transfer, attention-rollout analysis, and a language-distillation control. Data (OOO sim. judgments) & core hybrid triplet+RSA LoRA method unchanged from v1. Prepared for NeurIPS 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏