arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

2026-04-16 至 2026-04-16 共收录 7
2604.14129 2026-04-16 cs.CV

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments Project page: https://vision.cs.utexas.edu/projects/acpo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13950 2026-04-16 cs.CL

Causal Drawbridges: Characterizing Gradient Blocking of Syntactic Islands in Transformer LMs

因果桥梁:Transformer语言模型中语法岛屿的梯度阻塞特性

Sasha Boguraev, Kyle Mahowald

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究通过Transformer模型的因果干预揭示语法岛屿的提取机制,发现其与wh依赖关系机制相似但受阻程度不同,提出'and'在可提取与不可提取结构中表示方式不同。

Comments 19 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13905 2026-04-16 cs.CV

Rethinking Image-to-3D Generation with Sparse Queries: Efficiency, Capacity, and Input-View Bias

重新思考基于稀疏查询的图像到3D生成:效率、容量和输入视角偏差

Zhiyuan Xu, Jiuming Liu, Yuxin Chen, Masayoshi Tomizuka, Chenfeng Xu, Chensheng Peng

机构 * UC Berkeley(伯克利大学) University of Cambridge(剑桥大学) UT Austin(奥斯汀大学)

AI总结 本文提出SparseGen框架,通过稀疏查询实现高效的图像到3D生成,降低输入视角偏差并提升效率。模型采用紧凑的稀疏学习3D锚点查询和解码器,减少内存和推理时间,保持多视角保真度。

Comments Code is available at https://github.com/Pixtella/SparseGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02417 2026-04-16 stat.ML cs.LG math.OC

Mini-Batch Covariance, Diffusion Limits, and Oracle Complexity in Stochastic Gradient Descent: A Sampling-Design Perspective

小批量协方差、扩散极限与随机梯度下降的Oracle复杂度:从采样设计视角

Daniel Zantedeschi, Kumar Muthuraman

机构 * Muma College of Business, University of South Florida(佛罗里达州立大学马纳学院) McCombs School of Business, University of Texas at Austin(德克萨斯大学奥斯汀分校麦克纳学院)

AI总结 本文从采样设计角度研究了随机梯度下降中最小批量梯度噪声的协方差特性,推导了扩散极限与Oracle复杂度的理论边界,并通过数值实验验证了相关结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13645 2026-04-16 cs.RO cs.AI cs.LG

A Mechanistic Analysis of Sim-and-Real Co-Training in Generative Robot Policies

生成机器人策略中模拟与现实联合训练的机制分析

Yu Lei, Minghuan Liu, Abhiram Maddukuri, Zhenyu Jiang, Yuke Zhu

机构 * Department of Computer Science, The University of Texas at Austin(得克萨斯大学计算机科学系) Amazon FAR(亚马逊FAR) NVIDIA(英伟达)

AI总结 本文通过理论分析和实验研究,揭示了联合训练中结构表示对齐和重要性再加权效应,为生成机器人策略的联合训练提供了统一解释和改进方法。

Comments 24 pages, 18 figure. Project page: https://science-of-co-training.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13418 2026-04-16 cs.CL cs.AI cs.CV

MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments

MERRIN:一种多模态证据检索与推理的基准,用于噪声网络环境

Han Wang, David Wan, Hyunji Lee, Thinh Pham, Mikaela Cankosyan, Weiyuan Chen, Elias Stengel-Eskin, Tu Vu, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Virginia Tech(弗吉尼亚理工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 MERRIN基准评估搜索增强代理在噪声网络环境中的多模态证据检索与推理能力,通过自然语言查询和多模态证据检索测试,发现现有模型在复杂任务中表现有限,需进一步提升多模态处理能力。

Comments First three authors contributed equally. Project Page: https://merrin-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05757 2026-04-16 eess.SY cs.LG cs.SY

Zero-Shot Function Encoder-Based Differentiable Predictive Control

基于零样本函数编码器的可微预测控制

Hassan Iqbal, Xingjian Li, Tyler Ingebrand, Adam Thorpe, Krishna Kumar, Ufuk Topcu, Ján Drgoňa

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出一种可微框架,用于零样本自适应控制非线性动态系统参数族。通过结合函数编码器神经ODE和可微预测控制,实现高效的自监督学习显式控制策略,无需重新训练即可适应新系统。

详情

展开后加载摘要…

URL PDF HTML 收藏