CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding
CANVAS:通过视觉代理脚本实现连续性叙事
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; Google(谷歌)
AI总结 CANVAS通过多代理框架实现多镜头叙事中的视觉连续性,提升背景、角色和道具的一致性,优于现有基准,背景连续性提升21.6%。
高校专区
CANVAS:通过视觉代理脚本实现连续性叙事
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; Google(谷歌)
AI总结 CANVAS通过多代理框架实现多镜头叙事中的视觉连续性,提升背景、角色和道具的一致性,优于现有基准,背景连续性提升21.6%。
三值逻辑的时间行为树编码及其在控制综合中的应用
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 本文提出基于三值信号时序逻辑的三值逻辑时间行为树编码,用于构建线性动态系统的正确-by-设计控制策略,通过混合整数优化解决最优控制问题。
Comments 8 pages, 4 figures. This work has been submitted to the IEEE for possible publication
自动可执行过程建模中的歧义检测与消除
机构 * Fujitsu Research of America(富士通美国研究院) ; University of Maryland, College Park(马里兰大学帕克分校) ; Fujitsu Limited(富士通株式会社)
AI总结 本文提出一种基于诊断的框架,通过分析关键性能指标的分布检测行为不一致,定位逻辑分歧并修复文本,以减少生成模型行为的变异。
可复制组合
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Google Research(谷歌研究院)
AI总结 研究解决如何在保持可复制性的同时联合解决多个问题,提出新的组合定理并改进样本复杂度。
Comments Abstract shortened due to Arxiv requirements
GaNI:全局和近场照明感知的神经逆渲染
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 本文提出GaNI,一种能从共位光相机拍摄的场景图像中重建几何、反照率和粗糙度参数的神经逆渲染技术。通过两阶段方法解决多物体场景中全局和近场照明建模问题,改进神经体积渲染和逆神经辐射度算法,提升反射率和几何重建效果。
基于目录的LLM:以更少的纠缠进行推荐的口语化项ID表达
机构 * University of Maryland - College Park(马里兰大学帕克分校) ; Roblox ; University of Cambridge(剑桥大学)
AI总结 本文提出IDIOMoE模型,通过将物品交互历史视为语言空间中的本地方言,结合预训练LLM的文本理解和协作信号,提升推荐性能。
CodeScout: 为软件代理提供上下文化的问题陈述增强
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Amazon Web Services (AWS)(亚马逊云服务(AWS)) ; Databricks
AI总结 CodeScout通过轻量级预探索将模糊请求转化为完整问题陈述,提升软件代理性能,实验表明其在解决率上提升20%。
结构不确定性引导的LLM代理澄清
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Adobe Research(Adobe研究院)
AI总结 本文提出结构不确定性框架,通过量化潜在问题的澄清价值,提升LLM代理在模糊任务中的推理效率和训练效率,展示了其在SAGE-Agent和ClarifyBench中的有效性。
是什么驱动了表示引导?对引导拒绝的机制性案例研究
机构 * University of Maryland, College Park(马里兰大学帕克分校)
AI总结 研究通过机制性案例分析,探讨引导向量如何通过注意力机制影响模型输出,揭示引导向量主要作用于OV电路而非QK电路,并发现引导向量可被稀疏化而不影响性能。
Comments 9 pages + appendix, 7 figures
通过LLM生成的声明性规范桥接自然语言与交互式假设分析接口
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Adobe Research(Adobe研究院) ; Microsoft Research(微软研究院) ; AWS AI Labs(AWS人工智能实验室) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
AI总结 本文提出一种两阶段工作流,通过Praxa规范语言将自然语言假设分析问题转化为交互式可视化界面,提升假设分析工具的交互性和准确性。
Comments 17 pages 17 figures
流匹配适应于流形结构
机构 * Booth School of Business, University of Chicago(芝加哥大学布斯商学院) ; Department of Statistics, University of Michigan(密歇根大学统计系) ; Department of Mathematics, University of Maryland, College Park(马里兰大学帕克分校数学系)
AI总结 本文研究流匹配在流形支持下的收敛性,证明其在高维数据中适应数据几何并避免维度灾难。
LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; NEC Labs America(NEC美国实验室) ; UC San Diego(加州大学圣迭戈分校)
AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。
Comments Project Page: https://yunhe24.github.io/langdrivectrl/
在人类加入团队之前:医疗机器人团队模拟中的协调失败诊断
机构 * Cornell Tech(康奈尔科技校区) ; Department of Information Science, Cornell University(康奈尔大学信息科学系) ; University of Maryland, College Park(马里兰大学帕克分校) ; Imperial College London(伦敦帝国学院)
AI总结 本文通过模拟方法研究医疗机器人团队的协调失败问题,发现团队结构是协调的主要瓶颈,并提出安全的人机协作设计方法。
Comments Revised version incorporating new analysis and restructuring
Splatblox:面向户外机器人导航的可通行性感知高斯点绘制
机构 * University of Maryland, College Park(马里兰大学帕克分校)
AI总结 Splatblox通过融合RGB图像和LiDAR点云,构建了具有几何和语义信息的可通行性感知ESDF,实现户外复杂环境下的实时自主导航,实验表明其在可通行性判断和路径规划方面优于现有方法。
人工智能与数学的结构
机构 * Meta Superintelligence Labs, Fundamental AI Research(Meta超级智能实验室,基础人工智能研究) ; Department of Physics and Joint Quantum Institute, University of Maryland, College Park(马里兰大学帕克分校物理系与联合量子研究所) ; Center for Mathematical Sciences and Applications, Harvard University(哈佛大学数学科学与应用中心)
AI总结 本文探讨人工智能如何通过构建新的路径,补充数学逻辑,揭示数学的全球结构。提出AI在数学发现中的关键要素及标准,并反思数学的本质。
Comments 45 pages
SABER:一种针对视觉-语言-动作模型的隐秘代理黑盒攻击框架
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; University of Southern California(南加州大学) ; University of Central Florida(中佛罗里达大学)
AI总结 SABER通过生成最小有效指令修改,评估VLA模型的鲁棒性,展示小幅度指令扰动可显著降低机器人执行效果,且代理黑盒方法在红队测试中表现高效且可扩展。
在潜在不确定性下安全控制的风险约束信念空间优化
机构 * Institute for Systems Research, University of Maryland, College Park(马里兰大学帕克分校系统研究所)
AI总结 本文提出一种风险敏感的信念空间MPPI控制器,通过在信念分布下规划并施加CVaR约束,以确保轨迹安全边际。该方法在物理仿真中实现了高风险规避下的高成功率。
Comments 8 pages, 4 figures
通过服务器学习增强联邦学习的鲁棒性
机构 * National Institute of Standards and Technology (NIST)(美国国家标准与技术研究院) ; University of Maryland, College Park(马里兰大学帕克分校) ; Tata Consultancy Services Research(塔塔咨询服务公司研究院) ; University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
AI总结 本文提出结合服务器学习与客户端更新过滤的启发式算法,通过几何中位数聚合提升联邦学习在恶意攻击下的模型准确率,即使在恶意客户端比例高达50%且服务器数据集较小的情况下也有效。
Kimi K2.5 的独立安全性评估
机构 * Constellation ; Anthropic Fellows Program(Anthropic研究员项目) ; Brown University(布朗大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Imperial College London(伦敦帝国学院) ; University of Maryland, College Park(马里兰大学帕克分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Bar Ilan University(巴伊兰大学) ; University of Toronto(多伦多大学) ; University of Oxford(牛津大学)
AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。
音频视觉大语言模型真的能看见和听见吗?
机构 * University of Maryland, College Park(马里兰大学帕克分校)
AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。
Comments CVPR Findings
弥合鸿沟:端到端序列图学习
机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Maryland, College Park(马里兰大学帕克分校)
AI总结 本文提出BRIDGE模型,通过整合序列与图学习,解决实体间序列与关系数据的联合建模问题,在关系预测和欺诈检测中优于传统方法。
代码理解后审计用于无监督LLM评估
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Princeton University(普林斯顿大学) ; University of Central Florida(中佛罗里达大学)
AI总结 本文提出CoCoA框架,通过先理解代码功能再评估任务对齐,提升无监督LLM评估的准确性与F1分数。
Comments 19 pages
基于MILP-MPC和Minkowski基础CBF的多面体间长周期几何感知导航
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; KAUST(阿卜杜拉国王科技大学)
AI总结 本文提出一种分层规划控制框架,结合MILP-MPC生成轨迹并利用Minkowski差空间的符号距离CBF确保几何安全,实验证明在复杂环境中实现安全实时导航。
Comments 8 pages, 3 figures
流形上的主原型分析用于可解释的强化学习
机构 * University of Maryland College park(马里兰大学帕克分校)
AI总结 本文提出一种自动选择最优原型的方法,用于增强强化学习的可解释性,无需人工定义原型,实验显示其性能与现有方法相当。
SIMPACT:基于视觉-语言模型的仿真增强动作规划
机构 * UMD(马里兰大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Harvard(哈佛大学) ; Amazon FAR(亚马逊FAR) ; UPenn(宾夕法尼亚大学)
AI总结 SIMPACT通过仿真循环世界建模赋予视觉-语言模型物理推理能力,实现高效动作规划,优于现有通用机器人操作模型,在五个复杂真实世界任务中表现优异。
Comments Accepted to CVPR 2026; camera-ready version
TransFIRA: 用于人脸图像可识别性评估的迁移学习
机构 * Systems and Technology Research(系统与技术研究公司) ; University of Maryland, College Park(马里兰大学帕克分校) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 TransFIRA提出一种轻量且无需标注的框架,通过嵌入空间定义可识别性,改进了人脸和身体识别的可识别性评估,实现了高准确性和解释性。
Comments Project Page: https://transfira.github.io/
Journal ref Proceedings of the IEEE International Conference on Automatic Face and Gesture Recognition (FG), 2026
音频幻觉攻击:测试大型音频语言模型的可靠性
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Adobe Research(Adobe研究院)
AI总结 本文提出Audio Hallucination Attacks,通过6500个问答对测试大型音频语言模型是否真实基于音频输入生成响应,发现其可靠性与基准性能存在差距,并提出AHA-Guard数据集降低攻击成功率。
可微初始化加速的CPU-GPU混合组合调度
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; University of Colorado, Boulder(科罗拉多大学博尔德分校)
AI总结 本文提出一种混合CPU-GPU框架,用于解决以整数线性规划(ILP)形式化的组合调度问题。通过结合可微优化与经典ILP求解,利用可微预处理快速生成高质量部分解,作为商业ILP求解器的热启动,从而显著提升早期剪枝效果。
Comments 7 pages, 4 figures, 8 equations, 3 tables
SonoWorld:从一张图像到一个三维音频视觉场景
机构 * University of Maryland, College Park(马里兰大学帕克分校)
AI总结 本文提出Image2AVScene任务,通过SonoWorld框架生成三维音频视觉场景,结合图像生成全景、三维场景构建、语言引导声音锚点和空间音频渲染,实现沉浸式体验。
Comments Accepted by CVPR 2026, project page: https://humathe.github.io/sonoworld/
NARVis:神经加速渲染用于实时科学点云可视化
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) ; NASA(美国国家航空航天局) ; Hampton University(汉普顿大学)
AI总结 NARVis通过神经后处理提升大规模点云渲染效率,实现高速高保真可视化,适用于多维流场和地形扫描。