arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

共收录 1184
2604.04720 2026-04-07 cs.CL cs.AI

What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features

什么使多语言推理有效?通过可测量的特征解构推理痕迹

Dayeon Ki, Kevin Duh, Marine Carpuat

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文通过定义可测量的推理特征,研究多语言环境下有效推理的特征,并发现这些特征在不同语言中的关联强度差异显著,挑战了以英语为中心的奖励设计。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04443 2026-04-07 cs.CL

DeonticBench: A Benchmark for Reasoning over Rules

DeonticBench: 一个用于规则推理的基准

Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出DeonticBench,包含6232个任务,涵盖美国联邦税收、航空行李政策等真实领域,研究复杂规则推理问题,结合语言推理与符号计算,评估LLM在非符号和符号环境下的规则推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04426 2026-04-07 cs.AI

ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems

ShieldNet: 针对代理系统中新兴供应链注入的网络级防护

Zhuowen Yuan, Zhaorun Chen, Zhen Xiang, Nathaniel D. Bastian, Seyyed Hadi Hashemi, Chaowei Xiao, Wenbo Guo, Bo Li

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) University of Georgia(佐治亚大学) United States Military Academy(美国军事学院) eBay Johns Hopkins University(约翰霍普金斯大学) UCSB(加州大学圣塔芭芭拉分校) Virtue AI

AI总结 本文提出ShieldNet,通过观察真实网络交互检测供应链注入,优于现有工具,检测性能达0.995 F-1,误报率低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04274 2026-04-07 cs.AI cs.CE stat.AP

InferenceEvolve: Towards Automated Causal Effect Estimators through Self-Evolving AI

InferenceEvolve:通过自演化AI实现自动因果效应估计器

Can Wang, Hongyu Zhao, Yiqun Chen

机构 * Johns Hopkins Bloomberg School of Public Health(约翰霍普金斯大学彭博公共卫生学院) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)

AI总结 本文提出InferenceEvolve框架,利用大语言模型发现并迭代优化因果方法,在多个基准测试中优于现有方法,展示了语言模型引导的进化在因果推断中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04172 2026-04-07 cs.CV cs.AI

GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models

GENFIG1:学术工作的视觉摘要对视觉-语言模型的挑战

Yaohan Guan, Pristina Wang, Najim Dehak, Alan Yuille, Jieneng Chen, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 GENFIG1基准测试要求视觉-语言模型生成能清晰表达论文核心思想的图表,强调科学理解与视觉合成的结合,揭示生成高质量学术图表的难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18052 2026-04-07 cs.CL cs.CY

The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies

PIMMUR 原则:确保 LLM 社会集体行为的有效性

Jiaxu Zhou, Jen-tse Huang, Xuhui Zhou, Man Ho Lam, Xintao Wang, Hao Zhu, Wenxuan Wang, Maarten Sap

机构 * Chinese University of Hong Kong(香港中文大学) Johns Hopkins University(约翰斯·霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学) Stanford University(斯坦福大学) Renmin University of China(中国人民大学)

AI总结 本文通过审计39项研究,识别出六个普遍缺陷,指出89.7%的研究违反至少一个原则,导致模拟有效性受损。通过复现实验发现,当遵循PIMMUR原则时,报告的集体现象往往消失或反转,表明许多'涌现'行为可能是方法学伪影而非真实社会动态。

Comments 13 pages, 9 figures, 3 tables; add more papers in our systematic audit (39 in total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03877 2026-04-07 cs.CL cs.AI cs.LG

When Models Know More Than They Say: Probing Analogical Reasoning in LLMs

当模型知道更多 than 它说:探测类比推理在 LLMs 中

Hope McGovern, Caroline Craig, Thomas Lippincott, Hale Sirin

机构 * Cambridge University(剑桥大学) Northeastern University(东北大学) Athenahealth Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究探讨了LLMs在类比推理任务中的表现,发现探测内部表示比提示性能更优,揭示了任务依赖性和提示机制的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23064 2026-04-07 cs.CR cs.AI cs.SI

Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution

注意你的HEARTBEAT!Claw背景执行本质上使内存污染静默

Yechao Zhang, Shiqian Zhao, Jie Zhang, Gelei Deng, Jiawen Zhang, Xiaogeng Liu, Chaowei Xiao, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局(A*STAR)) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 研究揭示Claw个人AI代理中因心跳驱动背景执行导致的内存污染漏洞,通过MissClaw实验发现社会可信度驱动行为影响,内存污染可进入长期记忆并影响用户行为。

Comments 26 pages, 6 figures, 7 tables; identifies a vulnerability in the heartbeat mechanism of Claw systems with version-scoped evaluation (pre-fix OpenClaw, February 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06977 2026-04-07 cs.LG cs.AI cs.GT

NePPO: Near-Potential Policy Optimization for General-Sum Multi-Agent Reinforcement Learning

NePPO:近势策略优化用于一般和多智能体强化学习

Addison Kalanther, Sanika Bharvirkar, Shankar Sastry, Chinmay Maheshwari

机构 * UC Berkeley(加州大学伯克利分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出NePPO方法,通过学习玩家无关的势函数近似纳什均衡,解决多智能体强化学习中一般和合作-竞争环境下的收敛问题,实验证明其优于IPPO和MAPPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15148 2026-04-07 cs.CV cs.AI

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

XModBench:多模态能力与一致性在多语言模型中的基准测试

Xingrui Wang, Jiang Liu, Chao Huang, Xiaodong Yu, Ze Wang, Ximeng Sun, Jialian Wu, Alan Yuille, Emad Barsoum, Zicheng Liu

机构 * Advanced Micro Devices(超威半导体) Johns Hopkins University(约翰霍普金斯大学) University of Rochester(罗彻斯特大学)

AI总结 XModBench通过大规模三模态基准测试,评估多语言模型在跨模态一致性中的能力,揭示模型在不同模态下的推理偏差和不平衡问题。

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02678 2026-04-06 stat.ME cs.AI stat.AP

Eligibility-Aware Evidence Synthesis: An Agentic Framework for Clinical Trial Meta-Analysis

有资格意识的证据合成:一个用于临床试验元分析的代理框架

Yao Zhao, Zhiyue Zhang, Yanxun Xu

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 EligMeta框架整合了自动化试验发现与有资格意识的元分析,通过自然语言查询生成可复现的试验选择,并基于资格对研究加权,以产生特定群体的汇总估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02581 2026-04-06 stat.ML cs.LG cs.NA math.NA

Learning interacting particle systems from unlabeled data

从无标签数据中学习相互作用粒子系统

Viska Wei, Fei Lu

机构 * Department of Applied Mathematics and Statistics and Department of Physics and Astronomy, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系和物理与天文学系) Department of Mathematics, Johns Hopkins University(约翰霍普金斯大学数学系)

AI总结 本文提出一种无需轨迹信息的自测损失函数,用于从无标签数据中学习相互作用粒子系统的势能,通过弱形式经验分布随机演化方程实现鲁棒估计,适用于大规模高维系统。

Comments 39 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02543 2026-04-06 cs.CV cs.LG

Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation

过度自信与校准在医学视觉问答中的研究:实证发现与幻觉意识缓解

Ji Young Byun, Young-Jin Park, Jean-Philippe Corbeil, Asma Ben Abacha

机构 * Johns Hopkins University, School of Medicine(约翰霍普金斯大学医学院) Massachusetts Institute of Technology(麻省理工学院) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

AI总结 本文研究了医学VQA中VLMs的过度自信问题,发现校准方法如Platt缩放能有效提升校准精度,但无法提升预测区分度,提出幻觉意识校准方法以提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02423 2026-04-06 cs.CL cs.CY

SWAY: A Counterfactual Computational Linguistic Approach to Measuring and Mitigating Sycophancy

SWAY:一种反事实计算语言学方法用于衡量和缓解谄媚倾向

Joy Bhalla, Kristina Gligorić

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出SWAY,一种无监督的计算语言学指标,用于衡量和缓解大语言模型的谄媚倾向。通过反事实提示机制,识别模型在正负语言压力下的同意变化,发现谄媚倾向随认知承诺增加而增强,并提出基于反事实的CoT缓解策略,有效降低谄媚倾向而不影响对真实证据的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01432 2026-04-06 cs.CL

Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation

更细致的引用总是更好吗?重新思考属性生成中的粒度

Hexuan Wang, Jingyu Zhang, Benjamin Van Durme, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究探讨了属性生成中引用粒度对模型性能的影响,发现中间粒度(段落级)表现最佳,细粒度引用会破坏语义依赖,粗粒度则引入噪声,需优化粒度以提升属性质量和生成可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02323 2026-04-03 cs.CV

Beyond Referring Expressions: Scenario Comprehension Visual Grounding

超越指称表达:场景理解视觉 grounding

Ruozhen He, Nisarg A. Shah, Qihua Dong, Zilin Xiao, Jaywon Koo, Vicente Ordonez

机构 * Rice University(莱斯大学) Johns Hopkins University(约翰霍普金斯大学) Northeastern University(东北大学)

AI总结 本文提出RSC基准,探索基于场景的视觉 grounding,通过角色、意图和关系上下文推断目标,而非显式命名。ScenGround方法结合监督预热与难度感知强化学习,提升模型在复杂场景下的表现。

Comments 20 pages, 18 figures, Project Page: https://catherine-r-he.github.io/RSC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29966 2026-04-03 cs.CV

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01977 2026-04-03 cs.CR cs.AI cs.CL cs.LG cs.SE

RuleForge: Automated Generation and Validation for Web Vulnerability Detection at Scale

RuleForge: 用于大规模Web漏洞检测的自动化生成与验证

Ayush Garg, Sophia Hager, Jacob Montiel, Aditya Tiwari, Michael Gentile, Zach Reavis, David Magnotti, Wayne Fullen

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon Web Services(亚马逊云服务)

AI总结 RuleForge通过自动化生成基于JSON的检测规则,结合LLM作为判断系统和反馈机制,提升漏洞检测的准确性和效率,减少误报。

Comments 11 pages, 10 figures. To be submitted to CAMLIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01523 2026-04-03 cs.RO

Robust Autonomous Control of a Magnetic Millirobot in In Vitro Cardiac Flow

在体外心脏流中磁性微机器人自主控制的鲁棒性

Anuruddha Bhattacharjee, Xinhao Chen, Lamar O. Mair, Suraj Raval, Yancy Diaz-Mercado, Axel Krieger

机构 * Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室) Division of Magnetic Manipulation and Particle Research, Weinberg Medical Physics, Inc.(温伯格医学物理公司磁操控与粒子研究部) Department of Mechanical Engineering, University of Maryland(马里兰大学机械工程系)

AI总结 本文提出基于视觉引导的控制框架,实现磁性微机器人在生理相关流体条件下的自主导航,通过滑模控制器与扰动观测器在多线圈电磁驱动下实现亚毫米精度,优于PID和MPC基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01371 2026-04-03 cs.CV cs.AI cs.RO eess.IV

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

AffordTissue: 密集的工具-动作特定组织交互 affordance 预测

Aiza Maksutova, Lalithkumar Seenivasan, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Yiqing Shen, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出AffordTissue框架,通过多模态方法预测手术中工具-动作特定的组织affordance区域,改进了视觉语言模型在密集手术affordance预测中的表现,为安全手术自动化提供空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18649 2026-04-03 cs.CR cs.AI

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

PRISM:面向多模态集成安全的原理化推理对齐

Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

AI总结 PRISM通过结构化四阶段推理过程,有效应对多模态安全违规,提升VLM的鲁棒性与安全性,同时保持模型实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00464 2026-04-02 cs.HC cs.AI cs.CL cs.CY

Not My Truce: Personality Differences in AI-Mediated Workplace Negotiation

不是我的和解:人工智能调解职场谈判中的人格差异

Veda Duddu, Jash Rajesh Parekh, Andy Mao, Hanyi Min, Ziang Xiao, Vedant Das Swain, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

AI总结 研究探讨了人工智能调解职场谈判中个体差异对效果的影响,发现不同人格特质的用户对不同干预方式的响应不同,强调了针对个体需求设计干预的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17180 2026-04-02 cs.LG econ.EM stat.ME

Regularizing Extrapolation in Causal Inference

在因果推断中正则化外推

David Arbour, Harsh Parikh, Bijan Niknam, Elizabeth Stuart, Kara Rudolph, Avi Feller

机构 * Adobe Research(Adobe研究院) Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出统一框架,通过正则化外推水平来改进因果推断中的外推问题,引入偏倚-偏倚-方差权衡,并通过合成实验和实际应用验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08250 2026-04-02 cs.CV cs.LG

CHEEM: Continual Learning by Reuse, New, Adapt and Skip -- A Hierarchical Exploration-Exploitation Approach

CHEEM:通过重用、新信息、适应和跳过进行持续学习——一种分层探索-利用方法

Chinmay Savadikar, Michelle Dai, Tianfu Wu

机构 * North Carolina State University(北卡罗来纳州立大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出CHEEM框架,通过分层探索-利用方法解决持续学习中的稳定性与可塑性矛盾,实现高效神经网络架构搜索,优于现有方法,接近全微调上限。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02976 2026-04-02 cs.AI

Teaching AI to Handle Exceptions: Supervised Fine-Tuning with Human-Aligned Judgment

教AI处理例外:基于人类对齐判断的监督微调

Matthew DosSantos DiSorbo, Harang Ju, Sinan Aral

机构 * Harvard Business School(哈佛商学院) Johns Hopkins University(约翰霍普金斯大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

AI总结 研究探讨了如何通过监督微调使AI处理例外,发现使用人类解释的微调能显著提升模型决策能力,揭示了对齐人类判断需明确训练决策过程而非仅决策结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30016 2026-04-01 cs.CR cs.AI

Architecting Secure AI Agents: Perspectives on System-Level Defenses Against Indirect Prompt Injection Attacks

构建安全的AI代理:系统级防御间接提示注入攻击的视角

Chong Xiang, Drew Zagieboylo, Shaona Ghosh, Sanjay Kariyappa, Kai Greshake, Hanshen Xiao, Chaowei Xiao, G. Edward Suh

机构 * NVIDIA(英伟达) Independent Researcher(独立研究员) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文探讨了针对间接提示注入攻击的系统级防御策略,提出动态重计划、安全策略更新及人类交互在代理设计中的重要性,同时指出现有基准的局限性及系统级防御的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06353 2026-04-01 cs.CV cs.AI cs.LG

TransFIRA: Transfer Learning for Face Image Recognizability Assessment

TransFIRA: 用于人脸图像可识别性评估的迁移学习

Allen Tu, Kartik Narayan, Joshua Gleason, Jennifer Xu, Matthew Meyn, Tom Goldstein, Vishal M. Patel

机构 * Systems and Technology Research(系统与技术研究公司) University of Maryland, College Park(马里兰大学帕克分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 TransFIRA提出一种轻量且无需标注的框架,通过嵌入空间定义可识别性,改进了人脸和身体识别的可识别性评估,实现了高准确性和解释性。

Comments Project Page: https://transfira.github.io/

Journal ref Proceedings of the IEEE International Conference on Automatic Face and Gesture Recognition (FG), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14794 2026-04-01 cs.CV cs.LG

Face-to-Face: A Video Dataset for Multi-Person Interaction Modeling

面对面:一个多人物交互建模的视频数据集

Ernie Chu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出F2F-JF数据集,用于研究多人物交互建模,通过半自动流程提取对齐的主持人和嘉宾轨迹,并展示基于该数据集的反应式数字虚拟形象任务,验证了扩散模型在跨人物视觉上下文中的表现。

Comments Project Page: https://face2face2026.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27886 2026-03-31 cond-mat.mtrl-sci cs.AI physics.comp-ph

AI-ready design of realistic 2D materials and interfaces with Mat3ra-2D

面向AI的现实二维材料与界面的Mat3ra-2D设计

Vsevolod Biryukov, Kamal Choudhary, Timur Bazhirov

机构 * Exabyte Inc. (Mat3ra.com)(Exabyte Inc.(Mat3ra.com)) Department of Materials Science and Engineering, Johns Hopkins University(约翰霍普金斯大学材料科学与工程系) Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)

AI总结 本文提出Mat3ra-2D框架,通过模块化实现二维材料及界面的快速设计,支持缺陷和无序性,结合标准数据存储与配置流水线,降低AI应用门槛。

Comments 23 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03181 2026-03-31 cs.LG

Q-Learning with Shift-Aware Upper Confidence Bound in Non-Stationary Reinforcement Learning

具有迁移感知的Q学习上置信界在非平稳强化学习中的应用

Ha Manh Bui, Felix Parker, Kimia Ghobadi, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出Density-QUCB算法,通过转移密度函数检测分布变化,提升Q学习上置信界在非平稳强化学习中的探索与利用平衡,理论和实验均证明其优于QUCB。

Comments International Conference on Artificial Intelligence and Statistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏