arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Maryland, College Park(马里兰大学帕克分校)

共收录 580
2503.09820 2026-03-10 cs.RO cs.AI

ViLAM: Distilling Vision-Language Reasoning into Attention Maps for Social Robot Navigation

ViLAM:将视觉-语言推理转化为注意力图用于社交机器人导航

Mohamed Elnoor, Kasun Weerakoon, Gershom Seneviratne, Jing Liang, Vignesh Rajagopal, Dinesh Manocha

机构 * Dept. of Electrical and Computer Engineering, University of Maryland, College Park, MD, USA(电气与计算机工程系,马里兰大学,College Park, MD, USA) Dept. of Computer Science, University of Maryland, College Park, MD, USA(计算机科学系,马里兰大学,College Park, MD, USA) James Clark School of Engineering, University of Maryland, College Park, MD, USA(James Clark工程学院,马里兰大学,College Park, MD, USA)

AI总结 ViLAM通过蒸馏视觉-语言模型的注意力图,提升社交机器人导航的社会适应性与导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06533 2026-03-09 cs.CV

NEGATE: Constrained Semantic Guidance for Linguistic Negation in Text-to-Video Diffusion

NEGATE: 用于文本到视频扩散中的语义约束指导以处理语言否定

Taewon Kang, Ming C. Lin

机构 * University of Maryland at College Park(马里兰大学 College Park 分校)

AI总结 本文提出了一种基于扩散模型的语义约束指导方法,用于处理文本到视频生成中的语言否定问题,通过结构化约束实现否定的统一建模。

Comments 50 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06350 2026-03-09 cs.DC cs.AI cs.LG

MoEless: Efficient MoE LLM Serving via Serverless Computing

MoEless:通过无服务器计算实现高效的MoE大语言模型服务

Hanfei Yu, Bei Ouyang, Shwai He, Ang Li, Hao Wang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) University of Maryland College Park(马里兰大学帕克分校)

AI总结 MoEless通过无服务器计算实现高效的MoE大语言模型服务,减少推理延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17781 2026-03-06 cs.RO

ROVER: Regulator-Driven Robust Temporal Verification of Black-Box Robot Policies

ROVER: 基于监管的黑盒机器人策略时间验证

Kristy Sakano, Jianyu An, Dinesh Manocha, Huan Xu

机构 * University of Maryland, College Park(马里兰大学学院 park)

AI总结 ROVER通过监管驱动的方法验证黑盒机器人策略的时间安全,提升满意度和合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05360 2026-03-06 cs.LG math.OC stat.ML

Curse of Dimensionality in Neural Network Optimization

神经网络优化中的维度灾难

Sanghoon Na, Haizhao Yang

机构 * University of Maryland College Park(马里兰大学College Park分校)

AI总结 本文研究了神经网络优化中维度灾难的产生机制,通过分析梯度流下的参数分布演变,揭示了函数光滑性对优化效率的影响。

Comments Accepted for publication in Information and Inference: A Journal of the IMA. 32 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04340 2026-03-05 cs.CV cs.LG

Balancing Fidelity, Utility, and Privacy in Synthetic Cardiac MRI Generation: A Comparative Study

在合成心脏磁共振成像生成中平衡保真度、实用性与隐私:一项比较研究

Madhura Edirisooriya, Dasuni Kawya, Ishan Kumarasinghe, Isuri Devindi, Mary M. Maleckar, Roshan Ragel, Isuru Nawinne, Vajira Thambawita

机构 * University of Peradeniya, Sri Lanka(斯里兰卡大学) University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Tulane University School of Medicine, USA(美国 Tulane 大学医学院) Simula Research Laboratory, Norway(挪威 Simula 研究实验室) SimulaMet, Norway(挪威 SimulaMet)

AI总结 本研究比较了三种生成模型在合成心脏MRI中的性能,发现DDPM在保真度、实用性和隐私保护之间达到最佳平衡,而FM在隐私方面表现突出但性能略低。

Comments 7 pages, 4 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03646 2026-03-05 cs.CV

InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions

InfinityStory: 无限视频生成与世界一致性及角色感知镜头过渡

Mohamed Elmoghany, Liangbing Zhao, Xiaoqian Shen, Subhojyoti Mukherjee, Yang Zhou, Gang Wu, Viet Dac Lai, Seunghyun Yoon, Ryan Rossi, Abdullah Rashwan, Puneet Mathur, Varun Manjunatha, Daksh Dangi, Chien Nguyen, Nedim Lipka, Trung Bui, Krishna Kumar Singh, Ruiyi Zhang, Xiaolei Huang, Jaemin Cho, Yu Wang, Namyong Park, Zhengzhong Tu, Hongjie Chen, Hoda Eldardiry, Nesreen Ahmed, Thien Nguyen, Dinesh Manocha, Mohamed Elhoseiny, Franck Dernoncourt

机构 * Adobe Research(Adobe研究院) KAUST(卡塔尔科技大学) University of Oregon(俄勒冈大学) University of Memphis(密苏里大学孟菲斯分校) Johns Hopkins University(约翰霍普金斯大学) Meta AI Texas A&M University(德克萨斯农工大学) Dolby Labs(杜比实验室) Virginia Tech(弗吉尼亚理工大学) Cisco(思科) University of Maryland, College Park(马里兰大学学院市分校)

AI总结 InfinityStory通过引入背景一致的生成管道和过渡感知的视频合成模块,实现了多主体场景下的长篇视频生成,提升了背景一致性、主体一致性和时间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20760 2026-03-05 cs.LG cs.AI cs.CL

Generalization of RLVR Using Causal Reasoning as a Testbed

使用因果推理作为测试平台的RLVR泛化

Brian Lu, Hongyu Zhao, Shuo Sun, Hao Peng, Rui Ding, Hongyuan Mei

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research Asia(微软亚洲研究院) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

AI总结 本文通过实验证明,RLVR在特定模型规模和训练查询层次下能提升因果推理能力,尤其在复杂查询中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13298 2026-03-05 cond-mat.mes-hall cs.CV cs.LG quant-ph

QDFlow: A Python package for physics simulations of quantum dot devices

QDFlow:用于量子点器件物理模拟的Python包

Donovan L. Buterakos, Sandesh S. Kalantre, Joshua Ziegler, Jacob M. Taylor, Justyna P. Zwolak

机构 * Joint Center for Quantum Information and Computer Science, University of Maryland, College Park, MD 20742, USA(联合量子信息与计算机科学中心,马里兰大学,学院公园,MD 20742,美国) National Institute of Standards and Technology, Gaithersburg, MD 20899, USA(国家标准与技术研究院,加斯比尔,MD 20899,美国) Department of Physics, University of Maryland, College Park, MD 20742, USA(物理系,马里兰大学,学院公园,MD 20742,美国) Department of Physics, Stanford University, Stanford, CA 94305, USA(物理系,斯坦福大学,斯坦福,CA 94305,美国) Axiomatic AI, Inc., Cambridge, MA 02139, USA(Axiomatic AI 公司,剑桥,MA 02139,美国)

AI总结 QDFlow是一个开源Python包,通过生成具有真实标签的合成数据,为量子点器件的物理模拟和机器学习研究提供支持。

Comments 19 pages, 6 figures

Journal ref SciPost Phys. Codebases 65 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19373 2026-03-04 cs.CR cs.AI

Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models

通过镜头进行Doxing:揭示多模态大推理模型中的位置相关隐私泄露

Weidi Luo, Tianyu Lu, Qiming Zhang, Xiaogeng Liu, Bin Hu, Yue Zhao, Jieyu Zhao, Song Gao, Patrick McDaniel, Zhen Xiang, Chaowei Xiao

机构 * University of Georgia(佐治亚大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) John Hopkins University(约翰·霍普金斯大学) University of Southern California(南加州大学) University of Maryland, College Park(马里兰大学学院市分校)

AI总结 本文研究了多模态大推理模型中的位置隐私泄露问题,提出DoxBench和GeoMiner框架,揭示模型在推断地理位置信息上的能力及隐私风险。

Comments Camera-ready version. Accepted as a poster at the 14th International Conference on Learning Representations (ICLR 2026). For official ICLR page, see https://iclr.cc/virtual/2026/poster/10006914

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15682 2026-03-04 cs.CV

Evolutionary Caching to Accelerate Your Off-the-Shelf Diffusion Model

进化缓存加速现成扩散模型

Anirud Aggarwal, Abhinav Shrivastava, Matthew Gwilliam

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 ECAD通过遗传算法学习高效缓存策略,显著提升扩散模型推理速度并优化质量-延迟平衡。

Comments 39 pages, 29 figures, 15 tables. Accepted at ICLR 2026. Project page and code: https://research.aniaggarwal.com/ecad

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02205 2026-03-03 cs.SD

Analytical Exploration of Spatial Audio Cues: A Differentiable Multi-Sphere Scattering Model

空间音频线索的解析性探索:一种可微多球体散射模型

Siminfar Samakoush Galougah, Pranav Pulijala, Ramani Duraiswami

机构 * Perceptual Intelligence & Reality Lab, University of Maryland, College Park, MD, USA(感知智能与现实实验室,马里兰大学,College Park, MD, USA)

AI总结 本文提出了一种可微多球体散射模型,用于准确建模水下和陆地环境中的空间音频线索,通过结合机器学习优化主动定位和移动源跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02096 2026-03-03 cs.CV cs.AI

FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding

FluxMem: 用于流视频理解的自适应分层内存

Yiweng Xie, Bo He, Junke Wang, Xiangyu Zheng, Ziyi Ye, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究所) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) University of Maryland, College Park(马里兰大学 College Park 分校)

AI总结 FluxMem通过自适应分层内存压缩技术,在流视频理解中实现了高效处理,提升了实时性能和离线表现。

Comments Accepted at CVPR 2026. Project page: https://yiwengxie.com/FluxMem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02004 2026-03-03 cs.RO

CHOP: Counterfactual Human Preference Labels Improve Obstacle Avoidance in Visuomotor Navigation Policies

CHOP:反事实人类偏好标签改进视觉运动导航策略中的障碍物避让

Gershom Seneviratne, Jianyu An, Vaibhav Shende, Sahire Ellahy, Yaxita Amin, Kondapi Manasanjani, Samarth Chopra, Jonathan Deepak Kannan, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 CHOP通过反事实人类偏好标签改进视觉运动导航策略的障碍物避让能力,显著提升安全性和导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04784 2026-03-03 cs.CL cs.AI

Post-training Large Language Models for Diverse High-Quality Responses

在训练后为大型语言模型生成多样化高质量响应

Yilei Chen, Souradip Chakraborty, Lorenz Wolf, Yannis Paschalidis, Aldo Pacchiano

机构 * Boston University(波士顿大学) University of Maryland, College Park(马里兰大学学院公园分校) University College London(伦敦大学学院) Boston University Broad Institute of MIT and Harvard(MIT和哈佛大学波士顿大学Broad研究所)

AI总结 本文提出DQO方法,通过确定性点过程优化大型语言模型的质量和语义多样性,提升输出多样性而不影响性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04097 2026-03-03 cs.LG

Do Vision-Language Models Leak What They Learn? Adaptive Token-Weighted Model Inversion Attacks

视觉-语言模型是否会泄露所学内容?基于自适应令牌加权的模型逆向攻击

Ngoc-Bao Nguyen, Sy-Tuyen Ho, Koh Jun Hao, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本研究提出SMI-AW攻击方法,揭示视觉-语言模型在隐私泄露方面的脆弱性,通过自适应令牌加权提升图像重建效果,验证了VLMs在敏感领域中的隐私风险。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00381 2026-03-03 cs.CR cs.AI cs.SY eess.SY

Verifier-Bound Communication for LLM Agents: Certified Bounds on Covert Signaling

用于LLM代理的验证器绑定通信:对隐蔽信号的认证界限

Om Tailor

机构 * umd(马里兰大学)

AI总结 本文提出CLBC协议,通过验证器绑定通信限制LLM代理的隐蔽信号,确保安全性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00207 2026-03-03 cs.CV cs.AI

VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models

VisRef: 通过思考进行视觉再聚焦以提高多模态大推理模型的测试时间扩展

Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Amazon(亚马逊) Physion Labs(Physion实验室)

AI总结 VisRef通过视觉再聚焦提升多模态大推理模型测试时间扩展性能,有效解决视觉依赖任务中推理性能下降问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21189 2026-02-27 cs.LG cs.AI

Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training

为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰

Anas Barakat, Souradip Chakraborty, Khushbu Pahwa, Amrit Singh Bedi

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Central Florida(佛罗里达中央大学)

AI总结 该研究揭示了在LLM微调中,pass@k优化可能损害pass@1的原因,通过梯度冲突和提示干扰机制,提出了理论解释并验证了实验结果。

Comments updated related work discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22597 2026-02-27 cs.SD eess.AS eess.SP

Relating the Neural Representations of Vocalized, Mimed, and Imagined Speech

将发声、模仿和想象性言语的神经表示联系起来

Maryam Maghsoudi, Rupesh Chillale, Shihab A. Shamma

机构 * University of Maryland - College Park(马里兰大学-学院公园)

AI总结 该研究通过训练线性模型发现,不同语音条件下的神经表示存在共享结构,线性模型在刺激层面的可区分性优于非线性模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20574 2026-02-25 cs.LG cs.CL

GATES: Self-Distillation under Privileged Context with Consensus Gating

GATES: 在特权上下文中通过共识门进行自我蒸馏

Alex Stein, Furong Huang, Tom Goldstein

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

AI总结 GATES通过在特权上下文中利用共识门进行自我蒸馏,提升无文档学生在问题回答任务中的性能。

Comments 10 Pages of main text with an additional 7 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07717 2026-02-25 cs.CV cs.ET

All-Optical Segmentation via Diffractive Neural Networks for Autonomous Driving

全光学分割 via 光学神经网络用于自动驾驶

Yingjie Li, Daniel Robinson, Weilu Gao, Cunxi Yu

机构 * Simon Fraser University(西蒙·弗雷泽大学) Massachusetts Institute of Technology(麻省理工学院) University of Utah(犹他大学) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文提出了一种全光学计算框架,利用衍射光学神经网络实现自动驾驶中的图像分割和车道检测,展示了其在CityScapes数据集和模拟场景中的有效性及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01012 2026-02-25 cs.AI

AutoEDA: Enabling EDA Flow Automation through Microservice-Based LLM Agents

AutoEDA:通过基于微服务的LLM代理实现EDA流程自动化

Yiyi Lu, Hoi Ian Au, Junyao Zhang, Jingyu Pan, Guanglei Zhou, Yiting Wang, Jingwei Sun, Ang Li, Jianyi Zhang, Hai Li, Yiran Chen

机构 * Duke University(杜克大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Florida(佛罗里达大学)

AI总结 AutoEDA通过基于微服务的LLM代理实现EDA流程自动化,利用MCP协议提升交互可靠性,并通过本地微调模型和定制评估方法提高准确性与保密性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01149 2026-02-24 cs.AI cs.LG

A Benchmark of Causal vs. Correlation AI for Predictive Maintenance

因果与相关性AI在预测性维护中的基准测试

Shaunak Dhande, Chutian Ma, Giacinto Paolo Saggese, Paul Smith, Krishna Taduri

机构 * Causify AI Department of Computer Science, University of Maryland, College Park, MD, USA(计算机科学系,马里兰大学,学院公园,MD,美国)

AI总结 本研究通过对比因果与相关性AI方法,发现因果模型在预测性维护中能提供更好的成本节约和故障归因能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00578 2026-02-24 cs.CV cs.GR

Speedy-Splat: Fast 3D Gaussian Splatting with Sparse Pixels and Sparse Primitives

Speedy-Splat: 通过稀疏像素和稀疏原语实现快速3D高斯点播

Alex Hanson, Allen Tu, Geng Lin, Vasu Singla, Matthias Zwicker, Tom Goldstein

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

AI总结 Speedy-Splat通过优化渲染管线和引入剪枝技术,显著提升了3D高斯点播的渲染速度,模型大小和训练时间也得到优化。

Comments CVPR 2025, Project Page: https://speedysplat.github.io/

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025, pp. 21537-21546

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18434 2026-02-23 cs.CV

Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory

回溯记忆:通过动态KV缓存内存扩展令牌实现视频流理解

Vatsal Agarwal, Saksham Suri, Matthew Gwilliam, Pulkit Kumar, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

AI总结 MemStream通过扩展令牌预算和自适应选择策略,提升视频流理解的准确性和细粒度信息保留能力。

Comments Project page: see https://vatsalag99.github.io/memstream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17951 2026-02-23 cs.CV cs.AI

ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models

ROCKET:基于残差的多层对齐用于空间感知的视觉-语言-动作模型

Guoheng Sun, Tingting Du, Kaixi Feng, Chenxiang Luo, Xingguo Ding, Zheyu Shen, Ziyao Wang, Yexiao He, Ang Li

机构 * University of Maryland, College Park University of Wisconsin, Madison City University of Hong Kong St.\ Paul's School

AI总结 ROCKET通过共享投影器和稀疏激活方案实现多层对齐,提升3D空间理解能力,在LIBERO等任务中达到98.5%的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11461 2026-02-20 cs.HC cs.AI

CareerPooler: AI-Powered Metaphorical Pool Simulation Improves Experience and Outcomes in Career Exploration

CareerPooler: 基于人工智能的隐喻池模拟提升职业探索的经历与成果

Ziyi Wang, Ziwen Zeng, Yuan Li, Zijian Ding

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Alabama(阿拉巴马大学)

AI总结 CareerPooler通过台球隐喻模拟职业发展,利用空间和叙述互动提升职业探索的参与度、信息获取和满意度,减少心理负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16711 2026-02-19 cs.CV

TeCoNeRV: Leveraging Temporal Coherence for Compressible Neural Representations for Videos

TeCoNeRV:利用时间一致性实现可压缩的视频神经表示

Namitha Padmanabhan, Matthew Gwilliam, Abhinav Shrivastava

机构 * Department of Computer Science, University of Maryland, College Park, USA(计算机科学系,马里兰大学,College Park)

AI总结 TeCoNeRV通过时间一致性正则化和残差存储方案,实现高效视频压缩,比基线提升PSNR并降低比特率和编码速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15766 2026-02-18 cs.SD

TAC: Timestamped Audio Captioning

TAC:带时间戳的音频描述

Sonal Kumar, Prem Seetharaman, Ke Chen, Oriol Nieto, Jiaqi Su, Zhepei Wang, Rithesh Kumar, Dinesh Manocha, Nicholas J. Bryan, Zeyu Jin, Justin Salamon

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Adobe Research, USA(Adobe 研究院) OpenAI, USA (work done while at Adobe)(OpenAI, USA)

AI总结 TAC通过生成时间接地的音频描述提升复杂声音场景的理解,结合TAC-V实现音频-视觉语义桥梁,提升文本推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏