arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Maryland, College Park(马里兰大学帕克分校)

共收录 580
2604.13452 2026-04-16 cs.CL

CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

CANVAS:通过视觉代理脚本实现连续性叙事

Ishani Mondal, Yiwen Song, Mihir Parmar, Palash Goyal, Jordan Boyd-Graber, Tomas Pfister, Yale Song

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Google(谷歌)

AI总结 CANVAS通过多代理框架实现多镜头叙事中的视觉连续性,提升背景、角色和道具的一致性,优于现有基准,背景连续性提升21.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12092 2026-04-15 cs.RO cs.SY eess.SY

Ternary Logic Encodings of Temporal Behavior Trees with Application to Control Synthesis

三值逻辑的时间行为树编码及其在控制综合中的应用

Ryan Matheu, John S. Baras, Calin Belta

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文提出基于三值信号时序逻辑的三值逻辑时间行为树编码,用于构建线性动态系统的正确-by-设计控制策略,通过混合整数优化解决最优控制问题。

Comments 8 pages, 4 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10884 2026-04-14 cs.SE cs.AI

Ambiguity Detection and Elimination in Automated Executable Process Modeling

自动可执行过程建模中的歧义检测与消除

Ion Matei, Praveen Kumar Menaka Sekar, Maksym Zhenirovskyy, Hon Yung Wong, Sayuri Kohmura, Shinji Hotta, Akihiro Inomata

机构 * Fujitsu Research of America(富士通美国研究院) University of Maryland, College Park(马里兰大学帕克分校) Fujitsu Limited(富士通株式会社)

AI总结 本文提出一种基于诊断的框架,通过分析关键性能指标的分布检测行为不一致,定位逻辑分歧并修复文本,以减少生成模型行为的变异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10423 2026-04-14 cs.LG cs.DS

Replicable Composition

可复制组合

Kiarash Banihashem, MohammadHossein Bateni, Hossein Esfandiari, Samira Goudarzi, MohammadTaghi Hajiaghayi

机构 * University of Maryland, College Park(马里兰大学帕克分校) Google Research(谷歌研究院)

AI总结 研究解决如何在保持可复制性的同时联合解决多个问题,提出新的组合定理并改进样本复杂度。

Comments Abstract shortened due to Arxiv requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15651 2026-04-14 cs.CV

GaNI: Global and Near Field Illumination Aware Neural Inverse Rendering

GaNI:全局和近场照明感知的神经逆渲染

Jiaye Wu, Saeed Hadadan, Geng Lin, Matthias Zwicker, David Jacobs, Roni Sengupta

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出GaNI,一种能从共位光相机拍摄的场景图像中重建几何、反照率和粗糙度参数的神经逆渲染技术。通过两阶段方法解决多物体场景中全局和近场照明建模问题,改进神经体积渲染和逆神经辐射度算法,提升反射率和几何重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05125 2026-04-14 cs.CL cs.LG

Catalog-Native LLM: Speaking Item-ID Dialect with Less Entanglement for Recommendation

基于目录的LLM:以更少的纠缠进行推荐的口语化项ID表达

Reza Shirkavand, Xiaokai Wei, Chen Wang, Zheng Hui, Heng Huang, Michelle Gong

机构 * University of Maryland - College Park(马里兰大学帕克分校) Roblox University of Cambridge(剑桥大学)

AI总结 本文提出IDIOMoE模型,通过将物品交互历史视为语言空间中的本地方言,结合预训练LLM的文本理解和协作信号,提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05744 2026-04-13 cs.CL cs.SE

CodeScout: Contextual Problem Statement Enhancement for Software Agents

CodeScout: 为软件代理提供上下文化的问题陈述增强

Manan Suri, Xiangci Li, Mehdi Shojaie, Songyang Han, Chao-Chun Hsu, Shweta Garg, Aniket Anand Deshmukh, Varun Kumar

机构 * University of Maryland, College Park(马里兰大学帕克分校) Amazon Web Services (AWS)(亚马逊云服务(AWS)) Databricks

AI总结 CodeScout通过轻量级预探索将模糊请求转化为完整问题陈述,提升软件代理性能,实验表明其在解决率上提升20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08798 2026-04-13 cs.CL cs.AI

Structured Uncertainty guided Clarification for LLM Agents

结构不确定性引导的LLM代理澄清

Manan Suri, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院)

AI总结 本文提出结构不确定性框架,通过量化潜在问题的澄清价值,提升LLM代理在模糊任务中的推理效率和训练效率,展示了其在SAGE-Agent和ClarifyBench中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08524 2026-04-10 cs.LG cs.AI cs.CL

What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal

是什么驱动了表示引导?对引导拒绝的机制性案例研究

Stephen Cheng, Sarah Wiegreffe, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 研究通过机制性案例分析,探讨引导向量如何通过注意力机制影响模型输出,揭示引导向量主要作用于OV电路而非QK电路,并发现引导向量可被稀疏化而不影响性能。

Comments 9 pages + appendix, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07652 2026-04-10 cs.AI cs.HC

Bridging Natural Language and Interactive What-If Interfaces via LLM-Generated Declarative Specification

通过LLM生成的声明性规范桥接自然语言与交互式假设分析接口

Sneha Gathani, Sirui Zeng, Diya Patel, Ryan Rossi, Dan Marshall, Cagatay Demiralp, Steven Drucker, Zhicheng Liu

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院) Microsoft Research(微软研究院) AWS AI Labs(AWS人工智能实验室) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 本文提出一种两阶段工作流,通过Praxa规范语言将自然语言假设分析问题转化为交互式可视化界面,提升假设分析工具的交互性和准确性。

Comments 17 pages 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22486 2026-04-10 stat.ML cs.LG math.ST stat.TH

Flow Matching is Adaptive to Manifold Structures

流匹配适应于流形结构

Shivam Kumar, Yixin Wang, Lizhen Lin

机构 * Booth School of Business, University of Chicago(芝加哥大学布斯商学院) Department of Statistics, University of Michigan(密歇根大学统计系) Department of Mathematics, University of Maryland, College Park(马里兰大学帕克分校数学系)

AI总结 本文研究流匹配在流形支持下的收敛性,证明其在高维数据中适应数据几何并避免维度灾难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-04-10 cs.CV

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Project Page: https://yunhe24.github.io/langdrivectrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04691 2026-04-09 cs.RO cs.AI cs.MA

Before Humans Join the Team: Diagnosing Coordination Failures in Healthcare Robot Team Simulation

在人类加入团队之前:医疗机器人团队模拟中的协调失败诊断

Yuanchen Bai, Zijian Ding, Shaoyue Wen, Xiang Chang, Angelique Taylor

机构 * Cornell Tech(康奈尔科技校区) Department of Information Science, Cornell University(康奈尔大学信息科学系) University of Maryland, College Park(马里兰大学帕克分校) Imperial College London(伦敦帝国学院)

AI总结 本文通过模拟方法研究医疗机器人团队的协调失败问题,发现团队结构是协调的主要瓶颈,并提出安全的人机协作设计方法。

Comments Revised version incorporating new analysis and restructuring

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18525 2026-04-09 cs.RO cs.CV

Splatblox: Traversability-Aware Gaussian Splatting for Outdoor Robot Navigation

Splatblox:面向户外机器人导航的可通行性感知高斯点绘制

Samarth Chopra, Jing Liang, Gershom Seneviratne, Yonghan Lee, Jaehoon Choi, Jianyu An, Stephen Cheng, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 Splatblox通过融合RGB图像和LiDAR点云,构建了具有几何和语义信息的可通行性感知ESDF,实现户外复杂环境下的实时自主导航,实验表明其在可通行性判断和路径规划方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06107 2026-04-08 cs.AI math.HO math.LO

Artificial Intelligence and the Structure of Mathematics

人工智能与数学的结构

Maissam Barkeshli, Michael R. Douglas, Michael H. Freedman

机构 * Meta Superintelligence Labs, Fundamental AI Research(Meta超级智能实验室,基础人工智能研究) Department of Physics and Joint Quantum Institute, University of Maryland, College Park(马里兰大学帕克分校物理系与联合量子研究所) Center for Mathematical Sciences and Applications, Harvard University(哈佛大学数学科学与应用中心)

AI总结 本文探讨人工智能如何通过构建新的路径,补充数学逻辑,揭示数学的全球结构。提出AI在数学发现中的关键要素及标准,并反思数学的本质。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24935 2026-04-08 cs.RO

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

SABER:一种针对视觉-语言-动作模型的隐秘代理黑盒攻击框架

Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

AI总结 SABER通过生成最小有效指令修改,评估VLA模型的鲁棒性,展示小幅度指令扰动可显著降低机器人执行效果,且代理黑盒方法在红队测试中表现高效且可扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03868 2026-04-07 eess.SY cs.RO cs.SY

Risk-Constrained Belief-Space Optimization for Safe Control under Latent Uncertainty

在潜在不确定性下安全控制的风险约束信念空间优化

Clinton Enwerem, John S. Baras, Calin Belta

机构 * Institute for Systems Research, University of Maryland, College Park(马里兰大学帕克分校系统研究所)

AI总结 本文提出一种风险敏感的信念空间MPPI控制器,通过在信念分布下规划并施加CVaR约束,以确保轨迹安全边际。该方法在物理仿真中实现了高风险规避下的高成功率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03226 2026-04-06 cs.LG cs.AI

Enhancing Robustness of Federated Learning via Server Learning

通过服务器学习增强联邦学习的鲁棒性

Van Sy Mai, Kushal Chakrabarti, Richard J. La, Dipankar Maity

机构 * National Institute of Standards and Technology (NIST)(美国国家标准与技术研究院) University of Maryland, College Park(马里兰大学帕克分校) Tata Consultancy Services Research(塔塔咨询服务公司研究院) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 本文提出结合服务器学习与客户端更新过滤的启发式算法,通过几何中位数聚合提升联邦学习在恶意攻击下的模型准确率,即使在恶意客户端比例高达50%且服务器数据集较小的情况下也有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03121 2026-04-06 cs.CR cs.AI cs.CL

An Independent Safety Evaluation of Kimi K2.5

Kimi K2.5 的独立安全性评估

Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen

机构 * Constellation Anthropic Fellows Program(Anthropic研究员项目) Brown University(布朗大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Imperial College London(伦敦帝国学院) University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院) Bar Ilan University(巴伊兰大学) University of Toronto(多伦多大学) University of Oxford(牛津大学)

AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02605 2026-04-06 cs.AI cs.SD

Do Audio-Visual Large Language Models Really See and Hear?

音频视觉大语言模型真的能看见和听见吗?

Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。

Comments CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25126 2026-04-03 cs.LG cs.AI

Bridging the Divide: End-to-End Sequence-Graph Learning

弥合鸿沟:端到端序列图学习

Yuen Chen, Yulun Wu, Samuel Sharpe, Igor Melnyk, Nam H. Nguyen, Furong Huang, C. Bayan Bruss, Rizal Fathony

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学帕克分校)

AI总结 本文提出BRIDGE模型,通过整合序列与图学习,解决实体间序列与关系数据的联合建模问题,在关系预测和欺诈检测中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03131 2026-04-02 cs.AI cs.CL cs.LG

Code Comprehension then Auditing for Unsupervised LLM Evaluation

代码理解后审计用于无监督LLM评估

Bhrij Patel, Souradip Chakraborty, Mengdi Wang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学帕克分校) Princeton University(普林斯顿大学) University of Central Florida(中佛罗里达大学)

AI总结 本文提出CoCoA框架,通过先理解代码功能再评估任务对齐,提升无监督LLM评估的准确性与F1分数。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00162 2026-04-02 cs.RO

Long-Horizon Geometry-Aware Navigation among Polytopes via MILP-MPC and Minkowski-Based CBFs

基于MILP-MPC和Minkowski基础CBF的多面体间长周期几何感知导航

Yi-Hsuan Chen, Salman Ghori, Ania Adil, Eric Feron, Calin Belta

机构 * University of Maryland, College Park(马里兰大学帕克分校) KAUST(阿卜杜拉国王科技大学)

AI总结 本文提出一种分层规划控制框架,结合MILP-MPC生成轨迹并利用Minkowski差空间的符号距离CBF确保几何安全,实验证明在复杂环境中实现安全实时导航。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27971 2026-04-01 cs.LG

Principal Prototype Analysis on Manifold for Interpretable Reinforcement Learning

流形上的主原型分析用于可解释的强化学习

Bodla Krishna Vamshi, Haizhao Yang

机构 * University of Maryland College park(马里兰大学帕克分校)

AI总结 本文提出一种自动选择最优原型的方法,用于增强强化学习的可解释性,无需人工定义原型,实验显示其性能与现有方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05955 2026-04-01 cs.RO cs.CV

SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models

SIMPACT:基于视觉-语言模型的仿真增强动作规划

Haowen Liu, Shaoxiong Yao, Haonan Chen, Jiawei Gao, Jiayuan Mao, Jia-Bin Huang, Yilun Du

机构 * UMD(马里兰大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学) Amazon FAR(亚马逊FAR) UPenn(宾夕法尼亚大学)

AI总结 SIMPACT通过仿真循环世界建模赋予视觉-语言模型物理推理能力,实现高效动作规划,优于现有通用机器人操作模型,在五个复杂真实世界任务中表现优异。

Comments Accepted to CVPR 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06353 2026-04-01 cs.CV cs.AI cs.LG

TransFIRA: Transfer Learning for Face Image Recognizability Assessment

TransFIRA: 用于人脸图像可识别性评估的迁移学习

Allen Tu, Kartik Narayan, Joshua Gleason, Jennifer Xu, Matthew Meyn, Tom Goldstein, Vishal M. Patel

机构 * Systems and Technology Research(系统与技术研究公司) University of Maryland, College Park(马里兰大学帕克分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 TransFIRA提出一种轻量且无需标注的框架,通过嵌入空间定义可识别性,改进了人脸和身体识别的可识别性评估,实现了高准确性和解释性。

Comments Project Page: https://transfira.github.io/

Journal ref Proceedings of the IEEE International Conference on Automatic Face and Gesture Recognition (FG), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29263 2026-04-01 cs.SD

Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models

音频幻觉攻击:测试大型音频语言模型的可靠性

Ashish Seth, Sonal Kumar, Ramaneswaran Selvakumar, Nishit Anand, Utkarsh Tyagi, Prem Seetharaman, Ramani Duraiswami, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院)

AI总结 本文提出Audio Hallucination Attacks,通过6500个问答对测试大型音频语言模型是否真实基于音频输入生成响应,发现其可靠性与基准性能存在差距,并提出AHA-Guard数据集降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28943 2026-04-01 cs.LG cs.AI cs.AR

Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling

可微初始化加速的CPU-GPU混合组合调度

Mingju Liu, Jiaqi Yin, Alvaro Velasquez, Cunxi Yu

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Colorado, Boulder(科罗拉多大学博尔德分校)

AI总结 本文提出一种混合CPU-GPU框架,用于解决以整数线性规划(ILP)形式化的组合调度问题。通过结合可微优化与经典ILP求解,利用可微预处理快速生成高质量部分解,作为商业ILP求解器的热启动,从而显著提升早期剪枝效果。

Comments 7 pages, 4 figures, 8 equations, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28757 2026-03-31 cs.CV cs.MM cs.SD

SonoWorld: From One Image to a 3D Audio-Visual Scene

SonoWorld:从一张图像到一个三维音频视觉场景

Derong Jin, Xiyi Chen, Ming C. Lin, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 本文提出Image2AVScene任务,通过SonoWorld框架生成三维音频视觉场景,结合图像生成全景、三维场景构建、语言引导声音锚点和空间音频渲染,实现沉浸式体验。

Comments Accepted by CVPR 2026, project page: https://humathe.github.io/sonoworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19097 2026-03-31 cs.GR cs.CV cs.HC cs.LG

NARVis: Neural Accelerated Rendering for Real-Time Scientific Point Cloud Visualization

NARVis:神经加速渲染用于实时科学点云可视化

Srinidhi Hegde, Kaur Kullman, Thomas Grubb, Leslie Lait, Stephen Guimond, Matthias Zwicker

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) NASA(美国国家航空航天局) Hampton University(汉普顿大学)

AI总结 NARVis通过神经后处理提升大规模点云渲染效率,实现高速高保真可视化,适用于多维流场和地形扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏