arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Maryland, College Park(马里兰大学帕克分校)

共收录 579
2503.07557 2026-05-05 cs.RO

AutoSpatial: Visual-Language Reasoning for Social Robot Navigation through Efficient Spatial Reasoning Learning

AutoSpatial: 通过高效空间推理学习实现社交机器人导航的视觉-语言推理

Yangzhe Kong, Daeun Song, Jing Liang, Dinesh Manocha, Ziyu Yao, Xuesu Xiao

机构 * George Mason University(乔治·马歇尔大学) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文提出AutoSpatial方法,通过结构化空间接地和大规模VQA对自动生成标签,提升VLMs在社交导航中的空间推理能力,实现更准确的空间感知、运动预测、推理、行动和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00798 2026-05-04 cs.LG cs.CL cs.MA

RunAgent: Interpreting Natural-Language Plans with Constraint-Guided Execution

RunAgent:通过约束引导执行解释自然语言计划

Arunabh Srivastava, Mohammad A., Khojastepour, Srimat Chakradhar, Sennur Ulukus

机构 * University of Maryland, College Park(马里兰大学学院公园分校) NEC Laboratories America, Inc.(NEC美国实验室)

AI总结 RunAgent通过约束引导执行解释自然语言计划,结合代理语言的显式控制构造,提升结构化工作流执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28193 2026-05-01 cs.CV

Generalizable Sparse-View 3D Reconstruction from Unconstrained Images

可泛化稀疏视角3D重建从无约束图像

Vinayak Gupta, Chih-Hao Lin, Shenlong Wang, Anand Bhattad, Jia-Bin Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出GenWildSplat框架,通过学习几何先验在无场景优化情况下实现稀疏视角户外3D重建,利用外观适配器和语义分割处理光照和遮挡,实现跨不同光照和遮挡模式的泛化。

Comments Project Page: https://genwildsplat.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03664 2026-04-30 eess.SY cs.LG cs.MA cs.SY math.OC

Principled Learning-to-Communicate with Quasi-Classical Information Structures

基于准经典信息结构的原理化学习-通信

Xiangyu Liu, Haoyi You, Kaiqing Zhang

机构 * University of Maryland, College Park, MD, USA(马里兰大学)

AI总结 本文通过信息结构框架,探讨了在部分可观测环境中学习通信的原理,提出准经典学习-通信的条件和算法,建立了准多项式时间复杂度的规划与学习方法。

Comments Preliminary version appeared at IEEE CDC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25076 2026-04-29 cs.LG

Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings

稀疏奖励任务中具有多样化奖励塑造的零 shot 协调

Keenan Powell, Peihong Yu, Pratap Tokekar

机构 * Department of Computer Science(计算机科学系) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文提出了一种基于随机奖励塑造的多智能体强化学习方法,通过4种算法选择策略训练多个方法,提升在Overcooked环境中的稀疏奖励表现,改进率达62.2%-119.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24877 2026-04-29 cs.CV cs.AI cs.LG eess.IV

Learning Illumination Control in Diffusion Models

在扩散模型中学习光照控制

Nishit Anand, Manan Suri, Christopher Metzler, Dinesh Manocha, Ramani Duraiswami

机构 * University of Maryland College Park(马里兰大学学院公园分校)

AI总结 本文提出一个完全开源的管道,通过生成光照控制训练三元组来改进扩散模型的光照控制,实验显示在感知相似性、结构相似性和身份保持方面优于基线模型。

Comments Accepted to ICLR 2026 ReALM-GEN Workshop on Diffusion Models. Project Website: https://nishitanand.github.io/relighting-diffusion-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23860 2026-04-28 cs.CV cs.AI

Exploring Audio Hallucination in Egocentric Video Understanding

探索第一人称视频理解中的音频幻觉

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

机构 * Meta University Of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18774 2026-04-28 cs.CL

AI use in American newspapers is widespread, uneven, and rarely disclosed

美国报纸中AI的使用普遍存在、不均衡且很少披露

Jenna Russell, Marzena Karpinska, Destiny Akinode, Katherine Thai, Bradley Emi, Max Spero, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Simon Fraser University(西蒙 Fraser大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校) Pangram Labs(Pangram实验室)

AI总结 研究通过分析18.6万篇文章发现,约9%的新闻文章包含AI生成内容,且在小型本地报纸和特定主题中更常见,但AI使用情况很少被披露,凸显了对透明度和编辑标准更新的迫切需求。

Comments ACL Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23001 2026-04-28 cs.RO cs.AI

Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines

机器人中的视觉-语言-动作:数据集、基准和数据引擎的综述

Ziyao Wang, Bingying Wang, Hanrong Zhang, Tingting Du, Tianyang Chen, Guoheng Sun, Yexiao He, Zheyu Shen, Wanghao Ye, Ang Li

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Utah(犹他大学) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文综述了视觉-语言-动作研究中数据基础设施的关键挑战,指出未来进展依赖于数据引擎与评估协议的协同设计,揭示了数据集、基准和数据引擎的四大开放挑战。

Comments This is a survey paper. The survey is already accepted by TMLR after peer-review. The OpenReview link is here: https://openreview.net/forum?id=tAaWFpvnmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19035 2026-04-28 cs.CV

OpenVO: Open-World Visual Odometry with Temporal Dynamics Awareness

OpenVO:具有时间动态意识的开放世界视觉里程计

Phuc D. A. Nguyen, Anh N. Nhu, Ming C. Lin

机构 * University of Maryland, College Park, USA(马里兰大学帕克分校)

AI总结 OpenVO通过时间动态信息编码和3D几何先验,提升在有限输入条件下对单目行车记录仪视频的现实尺度自我运动估计,实现鲁棒轨迹数据集构建。

Comments Main paper CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14549 2026-04-28 cs.CR cs.AI

Can Large Language Models Really Recognize Your Name?

大语言模型真的能识别你的名字吗?

Dzung Pham, Peter Kairouz, Niloofar Mireshghallah, Eugene Bagdasarian, Chau Minh Pham, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Google Research(谷歌研究) Carnegie Mellon University(卡内基梅隆大学) Google Research, University of Massachusetts Amherst(谷歌研究,马萨诸塞大学阿默斯特分校) University of Maryland, College Park(马里兰大学学院市分校)

AI总结 本文研究大语言模型在短文本中处理模糊人名的可靠性问题,构建AmBench基准测试集,发现模型对模糊人名的识别率下降20-40%,揭示隐私保护中的公平性问题。

Comments ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17656 2026-04-24 cs.SD cs.AI cs.CL cs.CV cs.LG

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

Video-Robin:基于意图的视频到音乐生成的自回归扩散规划

Vaibhavi Lokegaonkar, Aryan Vijay Bhosale, Vishnu Raj, Gouthaman KV, Ramani Duraiswami, Lie Lu, Sreyan Ghosh, Dinesh Manocha

机构 * University of Maryland College Park(马里兰大学College Park分校) Dolby Laboratories(杜比实验室) NVIDIA(英伟达)

AI总结 Video-Robin通过结合自回归规划与扩散合成,实现高质量的语义对齐音乐生成,相比传统方法在速度和质量上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15313 2026-04-24 cs.CL

Capabilities and Evaluation Biases of Large Language Models in Classical Chinese Poetry Generation: A Case Study on Tang Poetry

大型语言模型在古典汉语诗歌生成中的能力与评估偏差:以唐诗为例

Bolei Ma, Yina Yao, Anna-Carolina Haensch

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Maryland, College Park(马里兰大学College Park分校)

AI总结 本文通过三步评估框架,分析了六个先进LLM在唐诗生成中的表现,揭示了LLM在模仿统计模式时对机器生成诗歌的系统性高估问题,强调了需要混合人类-模型验证框架的重要性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19907 2026-04-23 cs.CV

SceneOrchestra: Efficient Agentic 3D Scene Synthesis via Full Tool-Call Trajectory Generation

SceneOrchestra: 通过完整工具调用轨迹生成实现高效的代理3D场景合成

Yun He, Kelin Yu, Matthias Zwicker

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 SceneOrchestra通过训练可调的 orchestration 框架优化工具调用流程,消除逐步审查循环,提升效率和输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19685 2026-04-22 cs.CL

An Answer is just the Start: Related Insight Generation for Open-Ended Document-Grounded QA

答案只是开始:面向开放性文档引导问答的相关洞察生成

Saransh Sharma, Pritika Ramu, Aparna Garimella, Koyel Mukherjee

机构 * Adobe Research(Adobe研究) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文提出文档引导相关洞察生成任务,通过构建主题表示和选择相关上下文生成多样化洞察,提升开放性问答体验。

Comments Paper accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09953 2026-04-22 cs.CL

Take Out Your Calculators: Estimating the Real Difficulty of Question Items with LLM Student Simulations

拿出计算器:利用LLM学生模拟估算问题的真实难度

Christabel Acquaye, Yi Ting Huang, Marine Carpuat, Rachel Rudinger

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文探讨利用开源大语言模型评估数学选择题难度的方法,通过模拟不同年级学生角色扮演,利用IRT模型对比预测难度与实际难度,发现模型性能受学生命名策略和数学能力影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09905 2026-04-22 cs.RO cs.CV

Personalized Embodied Navigation for Portable Object Finding

面向便携物品寻找的个性化具身导航

Vishnu Sashank Dorbala, Bhrij Patel, Amrit Singh Bedi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Central Florida(中央佛罗里达大学)

AI总结 本文提出了一种面向动态环境的个性化习惯学习方法,通过引入Transit-Aware Planning算法提升便携物品寻找的性能,在模拟和现实环境中均取得显著效果。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18122 2026-04-21 cs.CL

Decisive: Guiding User Decisions with Optimal Preference Elicitation from Unstructured Documents

Decisive: 通过从非结构化文档中最优偏好引导用户决策

Akriti Jain, Anish Mulay, Divyansh Verma, Aishani Pandey, Pritika Ramu, Aparna Garimella

机构 * Adobe Research, India(Adobe印度研究实验室) IIT Madras(印度理工学院马德拉斯分校) IIT Roorkee(印度理工学院罗尔基分校) IIIT Hyderabad(Hyderabad印度理工学院) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 Decisive结合文档基础推理与贝叶斯偏好推断,通过主动引导用户回答成对权衡问题,提高决策准确性,实验表明其在多个领域优于传统方法和大语言模型。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17622 2026-04-21 cs.LG

STRIKE: Additive Feature-Group-Aware Stacking Framework for Credit Default Prediction

STRIKE:加性特征组感知的堆叠框架用于信用违约预测

Swattik Maiti, Ritik Pratap Singh, Fardina Fathmiul Alam

机构 * Science Academy, University of Maryland, College Park MD, USA(科学学院,马里兰大学,哥伦比亚公园MD,美国) Department of Computer Science, University of Maryland, College Park MD, USA(计算机科学系,马里兰大学,哥伦比亚公园MD,美国)

AI总结 STRIKE通过将特征空间划分为语义相干组,训练独立学习器,提升信用违约预测的鲁棒性和可解释性,优于传统基线方法。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17219 2026-04-21 stat.ML cs.LG

PAC-Bayes Bounds for Gibbs Posteriors via Singular Learning Theory

通过奇异学习理论为吉布斯后验推导PAC-Bayes界

Chenyang Wang, Yun Yang

机构 * Department of Statistics, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校统计系) Department of Mathematics, University of Maryland, College Park(马里兰大学学院市数学系)

AI总结 本文通过奇异学习理论推导了吉布斯后验的非渐近PAC-Bayes泛化界,适用于过参数化模型并适应数据结构与内在模型复杂度,结果在低秩矩阵补全和ReLU神经网络回归分类中表现更紧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01486 2026-04-21 cs.CL

Human-Centered Supervision for Sentiment Analysis in Telugu: A Systematic Inquiry Beyond Accuracy

面向泰卢格语情感分析的人本监督:超越准确性的系统探究

Vallabhaneni Raj Kumar, Ashwin S, Supriya Manna, Niladri Sett, Cheedella V S N M S Hema Harshitha, Kurakula Harshitha, Anand Kumar Sharma, Basina Deepakraj, Tanuj Sarkar, Bondada Navaneeth Krishna, Samanthapudi Shakeer

机构 * SRM University AP, India(印度AP SRM大学) University of Maryland, College Park, USA(美国马里兰大学 College Park分校) GITAM University, Bangalore, India(印度班加罗尔GITAM大学)

AI总结 本文提出TeSent数据集,通过人类选择的解释进行模型对齐,探讨在低资源语言中监督学习对预测性能和公平性的影响。

Comments Camera-ready version; ACL Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18128 2026-04-21 cs.CL

Frankentext: Stitching random text fragments into long-form narratives

Frankentext:将随机文本片段拼接成长篇叙述

Chau Minh Pham, Jenna Russell, Dzung Pham, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

AI总结 Frankentext通过将大量随机文本片段拼接成连贯故事,挑战LLM生成质量与原创性,同时引发作者权属问题。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17052 2026-04-20 cs.LG

Dynamic Tool Dependency Retrieval for Lightweight Function Calling

轻量级函数调用的动态工具依赖检索

Bhrij Patel, Davide Belli, Amir Jalalirad, Maximilian Arnold, Aleksandr Ermolov, Bence Major

机构 * Qualcomm AI Research(高通人工智能研究) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文提出动态工具依赖检索方法,通过结合初始查询和逐步展开的工具调用计划,提升函数调用的准确性和效率,实验表明其在多个数据集和模型上均优于现有静态检索方法。

Comments 24 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15322 2026-04-20 cs.HC cs.CL cs.LG

Acoustic and Facial Markers of Perceived Conversational Success in Spontaneous Speech

语音与面部特征在自发言语中感知对话成功的标志

Thanushi Withanage, Elizabeth Redcay, Carol Espy-Wilson

机构 * Department of Electrical and Computer Engineering, University of Maryland College Park, MD, USA(电气与计算机工程系,马里兰大学学院市分校) Department of Psychology, University of Maryland College Park, MD, USA(心理学系,马里兰大学学院市分校)

AI总结 研究通过分析自发Zoom对话,探讨对话动态与感知互动质量的关系,发现同步现象能可靠检测并预测更高的对话成功感知。

Comments Accepted for presentation at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10446 2026-04-20 cs.RO cs.AI

VeriGraph: Scene Graphs for Execution Verifiable Robot Planning

VeriGraph:用于可验证机器人规划的场景图

Daniel Ekpo, Mara Levy, Saksham Suri, Chuong Huynh, Archana Swaminathan, Abhinav Shrivastava

机构 * University of Maryland, College Park, MD USA(马里兰大学学院公园分校)

AI总结 VeriGraph通过整合视觉语言模型和场景图,提升机器人任务规划的可行性验证与修正,显著提高任务完成率。

Comments Accepted to ICRA 2026. Project website: https://verigraph-agent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09665 2026-04-17 cs.LG cs.AI

Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model

深度对齐但不确定性依然存在:通过将不安全行为归因于基础模型来改进推理时间的安全性

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院市)

AI总结 本文研究了对齐对语言模型安全性和通用性的影响,提出BoN采样方法将不安全行为归因于基础模型,减少多个安全基准的攻击成功率,同时保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23853 2026-04-17 cs.CL

Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time Perception

你的LLM代理是时间盲的:工具使用决策与人类时间感知之间的不一致

Yize Cheng, Arshia Soltani Moakhar, Chenrui Fan, Parsa Hosseini, Kazem Faghih, Zahra Sodagar, Wenxiao Wang, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 研究揭示LLM代理在动态环境中因时间感知不足导致的工具调用偏差,通过TicToc数据集分析发现现有模型与人类时间感知对齐率低,提出通过后训练对齐提升多轮对话中工具使用与人类时间感知的一致性。

Comments ACL 2026 (findings), Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01433 2026-04-17 cs.RO cs.AI

AFFORD2ACT: Affordance-Guided Automatic Keypoint Selection for Generalizable and Lightweight Robotic Manipulation

AFFORD2ACT:基于 affordance 的自动关键点选择用于通用且轻量的机器人操作

Anukriti Singh, Kasra Torshizi, Khuzema Habib, Kelin Yu, Ruohan Gao, Pratap Tokekar

机构 * Department of Computer Science, University of Maryland, College Park, MD, USA(马里兰大学计算机科学系,College Park, MD, USA)

AI总结 本文提出 AFFORD2ACT 框架,通过文本提示和单张图像生成最小化语义 2D 关键点,实现轻量级机器人操作,提升数据效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00361 2026-04-17 cs.LG

Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach

基于原始能力的分层强化学习的直接偏好优化:双层方法

Utsav Singh, Souradip Chakraborty, Wesley A. Suttle, Brian M. Sadler, Derrik E. Asher, Anit Kumar Sahu, Mubarak Shah, Vinay P. Namboodiri, Amrit Singh Bedi

机构 * IIT Kanpur(印度理工学院坎浦尔分校) University of Maryland, College Park(马里兰大学学院公园分校) U.S. Army Research Laboratory(美国陆军研究实验室) University of Texas, Austin(德克萨斯大学奥斯汀分校) Oracle(Oracle公司) University of Central Florida(中央佛罗里达大学) University of Bath(巴斯大学)

AI总结 本文提出DIPPER框架,通过双层优化解决分层强化学习中的非平稳性和不可行子目标问题,采用直接偏好优化提升高层策略性能,实验证明在机器人导航和操作任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13452 2026-04-16 cs.CL

CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

CANVAS:通过视觉代理脚本实现连续性叙事

Ishani Mondal, Yiwen Song, Mihir Parmar, Palash Goyal, Jordan Boyd-Graber, Tomas Pfister, Yale Song

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Google(谷歌)

AI总结 CANVAS通过多代理框架实现多镜头叙事中的视觉连续性,提升背景、角色和道具的一致性,优于现有基准,背景连续性提升21.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏