arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Maryland, College Park(马里兰大学帕克分校)

共收录 580
2603.27513 2026-03-31 cs.CV cs.AI

Understanding Semantic Perturbations on In-Processing Generative Image Watermarks

理解生成图像水印在处理过程中的语义扰动

Anirudh Nakra, Min Wu

机构 * University of Maryland, College Park, MD, USA(马里兰大学帕克分校)

AI总结 研究探讨了生成图像水印在处理过程中对语义扰动的鲁棒性,提出多阶段框架进行系统压力测试,发现语义编辑会显著降低水印检测能力,揭示当前水印评估存在的关键缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27332 2026-03-31 cs.CV

Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models

因互惠而不安全:生成-理解耦合如何在统一多模态模型中损害安全性

Kaishen Wang, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 研究探讨了统一多模态模型中生成与理解之间的互惠关系可能成为安全漏洞的根源,提出RICE攻击方法,揭示了跨功能互惠对安全性的负面影响。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11483 2026-03-31 cs.CV cs.AI

ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation

ImAgent:一种统一的多模态代理框架,用于测试时间可扩展的图像生成

Kaishen Wang, Ruibo Chen, Tong Zheng, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 ImAgent通过统一的多模态代理框架,在测试时间实现高效的图像生成扩展,通过内部推理、生成和自评估模块提升图像质量和语义一致性。

Comments 8 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09472 2026-03-30 cs.CV

Zero-Shot Personalized Camera Motion Control for Image-to-Video Synthesis

零样本个性化摄像机运动控制用于图像到视频合成

Pooja Guhan, Divya Kothandaraman, Geonsun Lee, Tsung-Wei Huang, Guan-Ming Su, Dinesh Manocha

机构 * University of Maryland College Park(马里兰大学帕克分校) Dolby Laboratories(杜比实验室)

AI总结 本文提出零样本扩散框架,实现从单参考视频向静态图像转移电影级运动,提升非专家创作者的创意表达与视频制作可及性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05321 2026-03-30 cs.CV

Wid3R: Wide Field-of-View 3D Reconstruction via Camera Model Conditioning

Wid3R:通过相机模型条件化实现宽视角三维重建

Dongki Jung, Jaehoon Choi, Adil Qureshi, Somi Jeong, Dinesh Manocha, Suyong Yeon

机构 * University of Maryland, College Park(马里兰大学帕克分校) NAVER LABS

AI总结 Wid3R是一种多视角视觉几何重建的前馈神经网络,支持宽视角相机模型。该方法通过球谐函数的射线表示和新型相机模型标记实现抗畸变重建,首次支持360影像的多帧前馈3D重建,提升性能达33.67%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25707 2026-03-27 cs.CV

TRACE: Object Motion Editing in Videos with First-Frame Trajectory Guidance

TRACE: 视频中基于首帧轨迹引导的对象运动编辑

Quynh Phung, Long Mai, Cusuh Ham, Feng Liu, Jia-Bin Huang, Aniruddha Mahapatra

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院)

AI总结 本文提出TRACE框架,通过单帧锚点设计轨迹并合成一致的编辑视频,解决对象运动路径编辑问题,实现更协调、真实且可控的视频编辑。

Comments webpage: https://trace-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14023 2026-03-27 cs.CV

High-speed Imaging through Turbulence with Event-based Light Fields

通过湍流高速成像的事件基光场

Yu-Hsiang Huang, Levi Burner, Sachin Shah, Ziyuan Qu, Adithya Pediredla, Christopher A. Metzler

机构 * University of Maryland, College Park MD 20742, USA(马里兰大学 College Park 分校) Dartmouth College, Hanover NH 03755, USA(达特茅斯学院)

AI总结 本文提出首个能通过强大气湍流以高速率成像快速移动非刚性物体的系统,利用事件基光场相机与机器学习算法区分运动与湍流动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23973 2026-03-26 cs.CV cs.GR cs.RO

SLAT-Phys: Fast Material Property Field Prediction from Structured 3D Latents

SLAT-Phys:从结构化3D潜在特征快速预测材料属性场

Rocktim Jyoti Das, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 SLAT-Phys通过单张RGB图像直接预测3D资产的空间变化材料属性场,利用预训练的3D资产生成模型的结构化潜在特征,结合轻量级神经解码器,高效估计杨氏模量、密度和泊松比,实现比传统方法更快的材料属性预测。

Comments 8 page, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23753 2026-03-26 cs.RO

Task-Space Singularity Avoidance for Control Affine Systems Using Control Barrier Functions

任务空间奇点避免:使用控制屏障函数控制仿射系统

Kimia Forghani, Suraj Raval, Lamar Mair, Axel Krieger, Yancy Diaz-Mercado

机构 * Department of Mechanical Engineering, University of Maryland, College Park(马里兰大学机械工程系,College Park分校) Division of Magnetic Manipulation and Particle Research, Weinberg Medical Physics, Inc.(Weinberg医学物理公司磁操控与粒子研究部) Department of Mechanical Engineering, Johns Hopkins University(约翰霍普金斯大学机械工程系)

AI总结 本文提出利用控制屏障函数避免控制仿射系统中任务空间奇点,通过分析输入输出映射矩阵的特征值识别奇异配置,并构建屏障函数以保持安全距离,实验表明可实现平滑轨迹跟踪并显著降低控制输入尖峰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13119 2026-03-26 cs.CV cs.AI

Geometry-Guided Camera Motion Understanding in VideoLLMs

基于几何的视频LLMs中相机运动理解

Haoan Feng, Sri Harsha Musunuri, Guan-Ming Su

机构 * University of Maryland, College Park(马里兰大学College Park分校) Dolby Laboratories Inc.(杜比实验室)

AI总结 本文提出通过基准测试、诊断和注入框架,解决视频LLMs中相机运动表示不足的问题,通过CameraMotionDataset和CameraMotionVQA基准,提升模型对相机运动的识别能力。

Comments 10 pages, 7 figures, supplementary included CVPR2026 PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23311 2026-03-25 cs.CV cs.LG

ARGENT: Adaptive Hierarchical Image-Text Representations

ARGENT:自适应层次图像-文本表示

Chuong Huynh, Hossein Souri, Abhinav Kumar, Vitali Petsiuk, Deen Dayal Mohan, Suren Kumar

机构 * University of Maryland, College Park(马里兰大学 College Park分校) Samsung Research America, AI Center(三星美国研究院人工智能中心)

AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02098 2026-03-25 cs.IR cs.CL cs.CV

Efficient and High-Fidelity Omni Modality Retrieval

高效且高保真的多模态检索

Chuong Huynh, Manh Luong, Abhinav Shrivastava

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Monash University(墨尔本大学)

AI总结 本文提出OmniRet模型,解决多模态检索中的计算效率与表示保真度问题,通过注意力机制和改进的池化方法提升三模态(文本、视觉、音频)检索性能,并引入新的音频中心多模态基准测试。

Comments CVPR 2026. Project page: https://hmchuong.github.io/omniret

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20896 2026-03-24 cs.LG cs.AI

Beyond the Birkhoff Polytope: Spectral-Sphere-Constrained Hyper-Connections

超越Birkhoff多面体:谱球约束超连接

Zhaoyi Liu, Haichuan Zhang, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) University of Utah(犹他大学)

AI总结 本文提出Spectral-Sphere-Constrained Hyper-Connections (sHC),通过将可行集从刚性多面体转换为谱范数球,允许负数条目,从而解锁选择性特征多样化,解决传统Birkhoff多面体约束的三个局限。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19221 2026-03-20 cs.LG cs.CL cs.GT

Online Learning and Equilibrium Computation with Ranking Feedback

在线学习与排名反馈下的均衡计算

Mingyang Liu, Yongshan Chen, Zhiyuan Fan, Gabriele Farina, Asuman Ozdaglar, Kaiqing Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学 College Park 分校) Northeastern University(东北大学)

AI总结 本文研究了在仅获得动作排名反馈的在线学习模型,探讨了不同排名机制下的子线性遗憾算法,并在特定条件下实现近似粗相关均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18480 2026-03-20 cs.CV cs.AI cs.HC

Do Vision Language Models Understand Human Engagement in Games?

视觉语言模型是否能理解游戏中的玩家参与度?

Ziyi Wang, Qizan Guo, Rishitosh Singh, Xiyang Hu

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

AI总结 研究评估了三种视觉语言模型在不同提示策略下的表现,发现零样本预测效果差,而基于理论的提示策略难以有效提升参与度预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18402 2026-03-20 cs.CV

Inst4DGS: Instance-Decomposed 4D Gaussian Splatting with Multi-Video Label Permutation Learning

Inst4DGS:基于多视频标签排列学习的实例分解4D高斯点划法

Yonghan Lee, Dinesh Manocha

机构 * University of Maryland, College Park, USA(马里兰大学学院公园分校)

AI总结 本文提出Inst4DGS,通过引入视频标签排列潜在变量,解决多视角视频中实例标签不一致的问题,实现实例分解与跟踪,并在渲染和分割质量上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16923 2026-03-19 cs.CV

Generative Refocusing: Flexible Defocus Control from a Single Image

生成聚焦:从单张图像实现灵活的模糊控制

Chun-Wei Tuan Mu, Cheng-De Fan, Jia-Bin Huang, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University University of Maryland, College Park(马里兰大学 College Park 分校)

AI总结 本文提出生成聚焦方法,通过DeblurNet恢复清晰图像和BokehNet生成可控的模糊效果,实现精准的模糊控制并保持真实光学特性,实验显示在模糊去模糊、模糊合成和聚焦评估中表现优异。

Comments Project website: https://generative-refocusing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16777 2026-03-18 cs.AI

Anticipatory Planning for Multimodal AI Agents

多模态AI代理的前瞻性规划

Yongyuan Liang, Shijie Zhou, Yu Gu, Hao Tan, Gang Wu, Franck Dernoncourt, Jihyung Kil, Ryan A. Rossi, Ruiyi Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究) State University of New York at Buffalo(纽约州立大学布法罗分校)

AI总结 本文提出TraceR1框架,通过前瞻性轨迹推理提升多模态代理的规划能力,实现更稳定的执行和泛化性能。

Comments Published at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14621 2026-03-18 eess.IV cs.CV

A Heterogeneous Ensemble for Multi-Center COVID-19 Classification from Chest CT Scans

一种异构集成用于多中心基于胸部CT扫描的新冠分类

Aadit Nilay, Bhavesh Thapar, Anant Agrawal, Mohammad Nayeem Teli

机构 * University of Maryland, College Park(马里兰大学,学院公园分校)

AI总结 本文提出异构集成模型,结合三种不同方法,提升多中心CT图像分类性能,通过领域感知增强和阈值优化,实现平均宏F1值达0.9280。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16642 2026-03-18 cs.AI cs.CL cs.CY

When AI Navigates the Fog of War

当AI穿越战争的迷雾

Ming Li, Xirui Li, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) University of Maryland, College Park(马里兰大学学院市分校)

AI总结 本文研究AI在战争初期预测能力,通过2026年中东冲突案例,测试模型在无训练数据泄露情况下分析危机的能力,揭示模型在不同领域中的策略现实性和叙事演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15847 2026-03-18 cs.CV cs.LG cs.RO

FEEL (Force-Enhanced Egocentric Learning): A Dataset for Physical Action Understanding

FEEL(力增强的自我中心学习):一个用于物理动作理解的数据集

Eadom Dessalene, Botao He, Michael Maynord, Yonatan Tussa, Pavan Mantripragada, Yianni Karabati, Nirupam Roy, Yiannis Aloimonos

机构 * University of Maryland, College Park, USA(马里兰大学 College Park 分校)

AI总结 FEEL数据集结合了自定义压阻手套收集的力测量与自我中心视频,通过力驱动物理交互,用于接触理解与动作表征学习,取得最佳分割结果并提升跨任务迁移性能。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13359 2026-03-17 cs.AI

From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

从拒绝标记到拒绝控制:发现并引导类别特定的拒绝方向

Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen, Zhen Wu, Ashwinee Panda

机构 * Algoverse AI Research(Algoverse AI研究院) School of Computer Science, University of Maryland, College Park, United States(美国马里兰大学计算机科学学院) School of Computer Science, Carnegie Mellon University, Pittsburgh, United States(美国卡内基梅隆大学计算机科学学院)

AI总结 本文通过训练模型生成类别化拒绝标记,实现推理时对细粒度拒绝行为的控制,提升安全性和可靠性,通过提取残差流方向构建类别引导向量,并引入低秩组合实现多类拒绝控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21662 2026-03-16 cs.CV

Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following

多标准:在多元标准下评估多模态裁判

Tianyi Xiong, Yi Ge, Ming Li, Zuolong Zhang, Pranav Kulkarni, Kaishen Wang, Qi He, Zeying Zhu, Chenxi Liu, Ruibo Chen, Tong Zheng, Yanshuo Chen, Xiyao Wang, Renrui Zhang, Wenhu Chen, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Waterloo(滑铁卢大学)

AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09194 2026-03-11 cs.RO

WESPR: Wind-adaptive Energy-Efficient Safe Perception & Planning for Robust Flight with Quadrotors

WESPR:风适应的节能安全感知与规划用于四旋翼机稳健飞行

Khuzema Habib, Pranav Deshakulkarni Manjunath, Kasra Torshizi, Troi Williams, Pratap Tokekar

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 WESPR通过预测环境几何对局部风的影响,实现四旋翼无人机的风适应性路径规划与控制优化,显著提升飞行稳定性与路径精度。

Comments 8 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08706 2026-03-10 cs.AI cs.CL cs.LG

Agentic Critical Training

代理批判训练

Weize Liu, Minghui Liu, Sy-Tuyen Ho, Souradip Chakraborty, Xiyao Wang, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院公园分校)

AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。

Comments Project page: https://attention-is-all-i-need.github.io/ACT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07698 2026-03-10 cs.LG

Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization

具有神经批评者和通用策略参数化的约束马尔可夫决策过程的全局收敛性

Anirudh Satheesh, Pankaj Kumar Barman, Washim Uddin Mondal, Vaneet Aggarwal

机构 * Department of Computer Science University of Maryland College Park(计算机科学系大学马里兰大学学院公园) Indian Institute of Technology, Kanpur(印度理工学院坎浦尔) Department of Electrical Engineering Indian Institute of Technology, Kanpur(电气工程系印度理工学院坎浦尔) Department of Industrial Engineering Purdue University West Lafayette(工业工程系普渡大学威斯康星拉法叶)

AI总结 本文提出了一种基于神经批评者和通用策略参数化的算法,实现了约束马尔可夫决策过程的全局收敛性保障,突破了传统线性批评者方法的限制。

Comments Submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07437 2026-03-10 cs.LG cs.SY eess.SY math.OC stat.ML

Cost-Driven Representation Learning for Linear Quadratic Gaussian Control: Part II

基于成本驱动的线性二次高斯控制表示学习:第二部分

Yi Tian, Kaiqing Zhang, Russ Tedrake, Suvrit Sra

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(大学公园大学) Technical University Munich(慕尼黑技术大学)

AI总结 本文提出了一种基于成本驱动的线性二次高斯控制表示学习方法,通过隐式学习潜在动态来改进控制器性能。

Comments 38 pages; preliminary version appeared in IEEE CDC 2023; this is the extended journal version, with an end-to-end guarantee added

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05694 2026-03-10 cs.LG

Distributionally Robust Self Paced Curriculum Reinforcement Learning

分布鲁棒自适应课程强化学习

Anirudh Satheesh, Keenan Powell, Vaneet Aggarwal

机构 * University of Maryland College Park(马里兰大学学院公园分校) Purdue University West Lafayette(普渡大学西拉法叶分校)

AI总结 分布鲁棒自适应课程强化学习通过动态调整鲁棒性预算,平衡性能与鲁棒性,提升在分布偏移下的稳定性与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07365 2026-03-10 cs.SD cs.AI cs.CL cs.MM eess.AS

Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning

多领域音频问答基准:面向声音内容推理

Chao-Han Huck Yang, Sreyan Ghosh, Qing Wang, Jaeyeon Kim, Hengyi Hong, Sonal Kumar, Guirui Zhong, Zhifeng Kong, S Sakshi, Vaibhavi Lokegaonkar, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha, Gunhee Kim, Jun Du, Rafael Valle, Bryan Catanzaro

机构 * NVIDIA University of Maryland, College Park(马里兰大学 College Park 分校) University of Science and Technology of China(中国科学技术大学) Seoul National University(首尔国立大学) Adobe

AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。

Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.14511 2026-03-10 cs.LG cs.SY eess.SY math.OC stat.ML

Cost-Driven Representation Learning for Linear Quadratic Gaussian Control: Part I

基于成本驱动的线性二次高斯控制的状态表示学习:第一部分

Yi Tian, Kaiqing Zhang, Russ Tedrake, Suvrit Sra

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学 College Park 分校) Technical University Munich(慕尼黑技术大学)

AI总结 本文提出了一种基于成本驱动的方法,用于学习状态表示以解决线性二次高斯控制问题,并建立了有限样本下的保证。

Comments 51 pages; preliminary version appeared in L4DC 2023; this is the extended journal version, with an end-to-end guarantee added

详情

展开后加载摘要…

URL PDF HTML 收藏