Understanding Semantic Perturbations on In-Processing Generative Image Watermarks
理解生成图像水印在处理过程中的语义扰动
机构 * University of Maryland, College Park, MD, USA(马里兰大学帕克分校)
AI总结 研究探讨了生成图像水印在处理过程中对语义扰动的鲁棒性,提出多阶段框架进行系统压力测试,发现语义编辑会显著降低水印检测能力,揭示当前水印评估存在的关键缺口。
高校专区
理解生成图像水印在处理过程中的语义扰动
机构 * University of Maryland, College Park, MD, USA(马里兰大学帕克分校)
AI总结 研究探讨了生成图像水印在处理过程中对语义扰动的鲁棒性,提出多阶段框架进行系统压力测试,发现语义编辑会显著降低水印检测能力,揭示当前水印评估存在的关键缺口。
因互惠而不安全:生成-理解耦合如何在统一多模态模型中损害安全性
机构 * University of Maryland, College Park(马里兰大学帕克分校)
AI总结 研究探讨了统一多模态模型中生成与理解之间的互惠关系可能成为安全漏洞的根源,提出RICE攻击方法,揭示了跨功能互惠对安全性的负面影响。
Comments 7 figures, 3 tables
ImAgent:一种统一的多模态代理框架,用于测试时间可扩展的图像生成
机构 * University of Maryland, College Park(马里兰大学帕克分校)
AI总结 ImAgent通过统一的多模态代理框架,在测试时间实现高效的图像生成扩展,通过内部推理、生成和自评估模块提升图像质量和语义一致性。
Comments 8 tables, 8 figures
零样本个性化摄像机运动控制用于图像到视频合成
机构 * University of Maryland College Park(马里兰大学帕克分校) ; Dolby Laboratories(杜比实验室)
AI总结 本文提出零样本扩散框架,实现从单参考视频向静态图像转移电影级运动,提升非专家创作者的创意表达与视频制作可及性。
Wid3R:通过相机模型条件化实现宽视角三维重建
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; NAVER LABS
AI总结 Wid3R是一种多视角视觉几何重建的前馈神经网络,支持宽视角相机模型。该方法通过球谐函数的射线表示和新型相机模型标记实现抗畸变重建,首次支持360影像的多帧前馈3D重建,提升性能达33.67%。
TRACE: 视频中基于首帧轨迹引导的对象运动编辑
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Adobe Research(Adobe研究院)
AI总结 本文提出TRACE框架,通过单帧锚点设计轨迹并合成一致的编辑视频,解决对象运动路径编辑问题,实现更协调、真实且可控的视频编辑。
Comments webpage: https://trace-motion.github.io/
通过湍流高速成像的事件基光场
机构 * University of Maryland, College Park MD 20742, USA(马里兰大学 College Park 分校) ; Dartmouth College, Hanover NH 03755, USA(达特茅斯学院)
AI总结 本文提出首个能通过强大气湍流以高速率成像快速移动非刚性物体的系统,利用事件基光场相机与机器学习算法区分运动与湍流动态。
SLAT-Phys:从结构化3D潜在特征快速预测材料属性场
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 SLAT-Phys通过单张RGB图像直接预测3D资产的空间变化材料属性场,利用预训练的3D资产生成模型的结构化潜在特征,结合轻量级神经解码器,高效估计杨氏模量、密度和泊松比,实现比传统方法更快的材料属性预测。
Comments 8 page, 4 figures
任务空间奇点避免:使用控制屏障函数控制仿射系统
机构 * Department of Mechanical Engineering, University of Maryland, College Park(马里兰大学机械工程系,College Park分校) ; Division of Magnetic Manipulation and Particle Research, Weinberg Medical Physics, Inc.(Weinberg医学物理公司磁操控与粒子研究部) ; Department of Mechanical Engineering, Johns Hopkins University(约翰霍普金斯大学机械工程系)
AI总结 本文提出利用控制屏障函数避免控制仿射系统中任务空间奇点,通过分析输入输出映射矩阵的特征值识别奇异配置,并构建屏障函数以保持安全距离,实验表明可实现平滑轨迹跟踪并显著降低控制输入尖峰。
基于几何的视频LLMs中相机运动理解
机构 * University of Maryland, College Park(马里兰大学College Park分校) ; Dolby Laboratories Inc.(杜比实验室)
AI总结 本文提出通过基准测试、诊断和注入框架,解决视频LLMs中相机运动表示不足的问题,通过CameraMotionDataset和CameraMotionVQA基准,提升模型对相机运动的识别能力。
Comments 10 pages, 7 figures, supplementary included CVPR2026 PVUW
ARGENT:自适应层次图像-文本表示
机构 * University of Maryland, College Park(马里兰大学 College Park分校) ; Samsung Research America, AI Center(三星美国研究院人工智能中心)
AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。
高效且高保真的多模态检索
机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) ; Monash University(墨尔本大学)
AI总结 本文提出OmniRet模型,解决多模态检索中的计算效率与表示保真度问题,通过注意力机制和改进的池化方法提升三模态(文本、视觉、音频)检索性能,并引入新的音频中心多模态基准测试。
Comments CVPR 2026. Project page: https://hmchuong.github.io/omniret
超越Birkhoff多面体:谱球约束超连接
机构 * University of Maryland, College Park(马里兰大学 College Park 分校) ; University of Utah(犹他大学)
AI总结 本文提出Spectral-Sphere-Constrained Hyper-Connections (sHC),通过将可行集从刚性多面体转换为谱范数球,允许负数条目,从而解锁选择性特征多样化,解决传统Birkhoff多面体约束的三个局限。
Comments 16 pages
在线学习与排名反馈下的均衡计算
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Maryland, College Park(马里兰大学 College Park 分校) ; Northeastern University(东北大学)
AI总结 本文研究了在仅获得动作排名反馈的在线学习模型,探讨了不同排名机制下的子线性遗憾算法,并在特定条件下实现近似粗相关均衡。
视觉语言模型是否能理解游戏中的玩家参与度?
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; University of Southern California(南加州大学) ; Arizona State University(亚利桑那州立大学)
AI总结 研究评估了三种视觉语言模型在不同提示策略下的表现,发现零样本预测效果差,而基于理论的提示策略难以有效提升参与度预测能力。
Inst4DGS:基于多视频标签排列学习的实例分解4D高斯点划法
机构 * University of Maryland, College Park, USA(马里兰大学学院公园分校)
AI总结 本文提出Inst4DGS,通过引入视频标签排列潜在变量,解决多视角视频中实例标签不一致的问题,实现实例分解与跟踪,并在渲染和分割质量上达到最优。
生成聚焦:从单张图像实现灵活的模糊控制
机构 * National Yang Ming Chiao Tung University ; University of Maryland, College Park(马里兰大学 College Park 分校)
AI总结 本文提出生成聚焦方法,通过DeblurNet恢复清晰图像和BokehNet生成可控的模糊效果,实现精准的模糊控制并保持真实光学特性,实验显示在模糊去模糊、模糊合成和聚焦评估中表现优异。
Comments Project website: https://generative-refocusing.github.io/
多模态AI代理的前瞻性规划
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; The Ohio State University(俄亥俄州立大学) ; Adobe Research(Adobe研究) ; State University of New York at Buffalo(纽约州立大学布法罗分校)
AI总结 本文提出TraceR1框架,通过前瞻性轨迹推理提升多模态代理的规划能力,实现更稳定的执行和泛化性能。
Comments Published at CVPR 2026 Findings Track
一种异构集成用于多中心基于胸部CT扫描的新冠分类
机构 * University of Maryland, College Park(马里兰大学,学院公园分校)
AI总结 本文提出异构集成模型,结合三种不同方法,提升多中心CT图像分类性能,通过领域感知增强和阈值优化,实现平均宏F1值达0.9280。
当AI穿越战争的迷雾
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; University of Maryland, College Park(马里兰大学学院市分校)
AI总结 本文研究AI在战争初期预测能力,通过2026年中东冲突案例,测试模型在无训练数据泄露情况下分析危机的能力,揭示模型在不同领域中的策略现实性和叙事演变。
FEEL(力增强的自我中心学习):一个用于物理动作理解的数据集
机构 * University of Maryland, College Park, USA(马里兰大学 College Park 分校)
AI总结 FEEL数据集结合了自定义压阻手套收集的力测量与自我中心视频,通过力驱动物理交互,用于接触理解与动作表征学习,取得最佳分割结果并提升跨任务迁移性能。
Comments 14 pages, 7 figures
从拒绝标记到拒绝控制:发现并引导类别特定的拒绝方向
机构 * Algoverse AI Research(Algoverse AI研究院) ; School of Computer Science, University of Maryland, College Park, United States(美国马里兰大学计算机科学学院) ; School of Computer Science, Carnegie Mellon University, Pittsburgh, United States(美国卡内基梅隆大学计算机科学学院)
AI总结 本文通过训练模型生成类别化拒绝标记,实现推理时对细粒度拒绝行为的控制,提升安全性和可靠性,通过提取残差流方向构建类别引导向量,并引入低秩组合实现多类拒绝控制。
多标准:在多元标准下评估多模态裁判
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; University of Waterloo(滑铁卢大学)
AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。
Comments Accepted to CVPR 2026
WESPR:风适应的节能安全感知与规划用于四旋翼机稳健飞行
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 WESPR通过预测环境几何对局部风的影响,实现四旋翼无人机的风适应性路径规划与控制优化,显著提升飞行稳定性与路径精度。
Comments 8 pages, 9 Figures
代理批判训练
机构 * University of Maryland College Park(马里兰大学学院公园分校)
AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。
Comments Project page: https://attention-is-all-i-need.github.io/ACT/
具有神经批评者和通用策略参数化的约束马尔可夫决策过程的全局收敛性
机构 * Department of Computer Science University of Maryland College Park(计算机科学系大学马里兰大学学院公园) ; Indian Institute of Technology, Kanpur(印度理工学院坎浦尔) ; Department of Electrical Engineering Indian Institute of Technology, Kanpur(电气工程系印度理工学院坎浦尔) ; Department of Industrial Engineering Purdue University West Lafayette(工业工程系普渡大学威斯康星拉法叶)
AI总结 本文提出了一种基于神经批评者和通用策略参数化的算法,实现了约束马尔可夫决策过程的全局收敛性保障,突破了传统线性批评者方法的限制。
Comments Submitted to UAI 2026
基于成本驱动的线性二次高斯控制表示学习:第二部分
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Maryland, College Park(大学公园大学) ; Technical University Munich(慕尼黑技术大学)
AI总结 本文提出了一种基于成本驱动的线性二次高斯控制表示学习方法,通过隐式学习潜在动态来改进控制器性能。
Comments 38 pages; preliminary version appeared in IEEE CDC 2023; this is the extended journal version, with an end-to-end guarantee added
分布鲁棒自适应课程强化学习
机构 * University of Maryland College Park(马里兰大学学院公园分校) ; Purdue University West Lafayette(普渡大学西拉法叶分校)
AI总结 分布鲁棒自适应课程强化学习通过动态调整鲁棒性预算,平衡性能与鲁棒性,提升在分布偏移下的稳定性与表现。
多领域音频问答基准:面向声音内容推理
机构 * NVIDIA ; University of Maryland, College Park(马里兰大学 College Park 分校) ; University of Science and Technology of China(中国科学技术大学) ; Seoul National University(首尔国立大学) ; Adobe
AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。
Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026
基于成本驱动的线性二次高斯控制的状态表示学习:第一部分
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Maryland, College Park(马里兰大学 College Park 分校) ; Technical University Munich(慕尼黑技术大学)
AI总结 本文提出了一种基于成本驱动的方法,用于学习状态表示以解决线性二次高斯控制问题,并建立了有限样本下的保证。
Comments 51 pages; preliminary version appeared in L4DC 2023; this is the extended journal version, with an end-to-end guarantee added