arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

共收录 1213
2604.02580 2026-04-06 cs.LG

VoxelCodeBench: Benchmarking 3D World Modeling Through Code Generation

VoxelCodeBench:通过代码生成进行3D世界建模的基准测试

Yan Zheng, Florian Bordes

机构 * FAIR at Meta(Meta FAIR) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出VoxelCodeBench基准,通过代码生成评估3D空间推理能力,发现生成可执行代码易,但生成空间正确输出难,尤其在几何构造和多物体组合上挑战大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02457 2026-04-06 cs.CV cs.CR

Street-Legal Physical-World Adversarial Rim for License Plates

符合道路法规的物理世界对抗环

Nikhil Kalidasu, Sahana Ganapathy

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究探讨低资源威胁者能否针对现代开源ALPR系统实施成功对抗攻击,提出符合法律的物理对抗环SPAR,证明其在德克萨斯州的合法性,并展示其对ALPR准确率的显著影响。

Comments 20 pages, 8 figures, 5 tables, submitted to Security in Machine Learning Applications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17180 2026-04-06 cs.CV cs.AI

We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback

事后修复:通过神经符号反馈改进文本到视频生成

Minkyu Choi, S P Sharan, Harsh Goel, Sahil Shah, Sandeep Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出NeuS-E框架,通过神经符号反馈提升文本到视频生成的语义和时间一致性,实验显示其在多种提示下提升了40%的对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02221 2026-04-03 cs.HC cs.AI

Impact of Multimodal and Conversational AI on Learning Outcomes and Experience

多模态和对话式AI对学习成果和体验的影响

Karan Taneja, Anjali Singh, Ashok K. Goel

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究比较了三种生物学学习方法,发现多模态对话式AI在学习成果和体验上表现最佳,但文本仅对话式AI虽易用但效果最差,揭示了认知负荷理论下的学习效果与感知之间的差异。

Comments 16 pages, 3 figures, Accepted to AIED 2026 (Seoul, South Korea)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02102 2026-04-03 cs.CL cs.LG cs.SD eess.AS

Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations

语调ABX:一种语言无关的语音对比度测量方法

Haitong Sun, Stephen McIntosh, Kwanghee Choi, Eunjung Yeo, Daisuke Saito, Nobuaki Minematsu

机构 * The University of Tokyo(东京大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出语调ABX方法,用于评估语音表示中的语调对比度,通过少量示例和无显式标签进行测试,展示了其在英语重音、日语声调和汉语声调中的有效性。

Comments Submitted to Interspeech 2026; 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00388 2026-04-03 cs.LG

Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode

扩散模型更安全,但受上下文影响而失效:扩散大语言模型的安全祝福及其失效模式

Zeyuan He, Yupeng Chen, Lang Lin, Yihan Wang, Shenxu Chang, Eric Sommerlade, Philip Torr, Junchi Yu, Adel Bibi, Jialin Yu

机构 * Torr Vision Group, University of Oxford(牛津大学Torr视觉组) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft(微软)

AI总结 研究探讨了扩散大语言模型(D-LLMs)在生成效率上的优势及其安全特性,发现其扩散生成方式增强了对对抗攻击的抵抗力,但存在上下文嵌套等失效模式,首次成功突破Gemini Diffusion的安全防线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13714 2026-04-03 eess.IV cs.AI cs.CV cs.LG

DeDelayed: Deleting Remote Inference Delay via On-Device Correction

DeDelayed:通过设备端校正删除远程推断延迟

Dan Jacobellis, Mateen Ulhaq, Fabien Racapé, Hyomin Choi, Neeraja J. Yadwadkar

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) InterDigital

AI总结 本文提出DeDelayed系统,通过设备端与远程模型协同推断,降低视频处理延迟,提升实时视频分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21681 2026-04-03 cs.CV

Seeing without Pixels: Perception from Camera Trajectories

无需像素的感知:从相机轨迹进行感知

Zihui Xue, Kristen Grauman, Dima Damen, Andrew Zisserman, Tengda Han

机构 * Google DeepMind(谷歌DeepMind) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文探讨通过相机轨迹而非像素感知视频内容的可能性,提出CamFormer框架,证明轨迹信息能有效用于视频内容理解及多种下游任务。

Comments Accepted by CVPR 2026, Project website: https://sites.google.com/view/seeing-without-pixels

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00433 2026-04-02 cs.MA cs.LG

Internal State-Based Policy Gradient Methods for Partially Observable Markov Potential Games

基于内部状态的策略梯度方法用于部分可观测马尔可夫势博弈

Wonseok Yang, Thinh T. Doan

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出基于内部状态的策略梯度方法,用于解决部分可观测马尔可夫势博弈中的多智能体强化学习问题,通过压缩累积信息以保证可扩展性,并建立非渐近收敛界。

Comments 6 pages, 2 figures. Submitted to IEEE Control Systems Letters (L-CSS) with CDC option

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00396 2026-04-02 cs.CV

VLM-in-the-Loop: A Plug-In Quality Assurance Module for ECG Digitization Pipelines

VLM-in-the-Loop:一种用于心电图数字化流程的插件质量保证模块

Jiachen Li, Shihao Li, Soovadeep Bakshi, Wei Li, Dongmei Chen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出VLM-in-the-Loop模块,通过闭环VLM反馈提升心电图数字化流程质量,显著提高判定一致性与保真度,适用于多种后端系统,实现高质量心电图数字化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00391 2026-04-02 cs.RO cs.SY eess.SY

Behavioral Score Diffusion: Model-Free Trajectory Planning via Kernel-Based Score Estimation from Data

行为得分扩散:通过核基得分估计实现无模型轨迹规划

Shihao Li, Jiachen Li, Jiamin Xu, Dongmei Chen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出行为得分扩散(BSD),通过核加权估计直接从轨迹数据中计算扩散得分函数,无需学习模型或动力学模型,在停车场景中实现高效轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00385 2026-04-02 cs.LG

GUIDE: Reinforcement Learning for Behavioral Action Support in Type 1 Diabetes

GUIDE:用于1型糖尿病行为动作支持的强化学习

Saman Khamesian, Sri Harini Balaji, Di Yang Shi, Stephanie M. Carpenter, Daniel E. Rivera, W. Bradley Knox, Peter Stone, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) School for Engineering of Matter Transport and Energy, Arizona State University(亚利桑那州立大学物质传输与能源工程学院) Institute for Foundation of Machine Learning, The University of Texas at Austin(德克萨斯大学奥斯汀分校机器学习基础研究所) Sony AI(索尼人工智能)

AI总结 GUIDE通过强化学习框架为1型糖尿病患者提供行为建议,结合实时血糖数据和离线在线算法,提升血糖控制效果,实现85.49%的时间在目标范围内。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00213 2026-04-02 cs.RO math.OC

A Player Selection Network for Scalable Game-Theoretic Prediction and Planning

一种用于可扩展博弈论预测与规划的玩家选择网络

Tianyu Qiu, Eric Ouano, Fernando Palafox, Christian Ellis, David Fridovich-Keil

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出PSN Game框架,通过学习玩家选择网络减少博弈规模,提升预测准确性和规划安全性,同时利用目标推断网络处理信息不完全场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01114 2026-04-02 cs.LG

Dense Dynamics-Aware Reward Synthesis: Integrating Prior Experience with Demonstrations

密集动态感知奖励合成:整合先验经验与演示

Cevahir Koprulu, Po-han Li, Tianyu Qiu, Ruihan Zhao, Tyler Westenbroek, David Fridovich-Keil, Sandeep Chinchali, Ufuk Topcu

机构 * University of Texas at Austin, USA(德克萨斯大学奥斯汀分校) University of Washington, USA(华盛顿大学)

AI总结 本文提出一种系统化的奖励塑造框架,结合先验数据集和少量专家演示,生成密集动态感知奖励,加速连续控制任务的学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00179 2026-04-02 eess.SY cs.LG cs.SY

Finite-Time Analysis of Projected Two-Time-Scale Stochastic Approximation

投影双时间尺度随机逼近的有限时间分析

Yitao Bai, Thinh T. Doan, Justin Romberg

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Georgia Tech(佐治亚理工学院)

AI总结 本文研究了具有固定步长和Polyak-Ruppert平均的投影线性双时间尺度随机逼近的有限时间收敛性,推导出均方误差界,并将其分解为子空间约束误差和统计误差两部分。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00055 2026-04-02 cs.RO cs.CV cs.LG

Generalizable Dense Reward for Long-Horizon Robotic Tasks

可泛化的密集奖励用于长周期机器人任务

Silong Yong, Stephen Sheng, Carl Qi, Xiaojie Wang, Evan Sheehan, Anurag Shivaprasad, Yaqi Xie, Katia Sycara, Yesh Dattatreya

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Robotics(亚马逊机器人) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出VLLR框架,结合外部奖励和内部奖励提升长周期机器人任务性能,通过任务分解和自信心引导实现无需人工奖励工程的高效训练。

Comments Project page: https://silongyong.github.io/vllr_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29315 2026-04-01 cs.RO cs.AI

IMPASTO: Integrating Model-Based Planning with Learned Dynamics Models for Robotic Oil Painting Reproduction

IMPASTO:整合基于模型的规划与学习的动力学模型用于机器人油画复现

Yingke Wang, Hao Li, Yifeng Zhu, Hong-Xing Yu, Ken Goldberg, Li Fei-Fei, Jiajun Wu, Yunzhu Li, Ruohan Zhang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

AI总结 IMPASTO通过整合学习的动力学模型与基于模型的规划,实现机器人基于目标油画图像的复现,无需人类示范或精确模拟,提升复现精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29288 2026-04-01 cs.CY cs.AI cs.CL cs.HC cs.SI

Sima AIunty: Caste Audit in LLM-Driven Matchmaking

Sima AIunty: LLM驱动的匹配中阶级审计

Atharva Naik, Shounok Kar, Varnika Sharma, Ashwin Rajadesingan, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究通过实世界婚姻资料审计LLM在匹配中的阶级偏见,发现同阶级匹配评分更高,揭示现有阶级体系在AI决策中的再现,需制定文化导向的评估与干预策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28900 2026-04-01 cs.RO cs.AI cs.LG cs.SY eess.SY

Robust Multi-Agent Reinforcement Learning for Small UAS Separation Assurance under GPS Degradation and Spoofing

针对GPS退化和欺骗的鲁棒多智能体强化学习用于小型无人机分离保障

Alex Zongo, Filippos Fotiadis, Ufuk Topcu, Peng Wei

机构 * George Washington University(乔治华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文通过多智能体强化学习解决小型无人机在GPS退化和欺骗下的鲁棒分离保障问题,提出闭式表达式对抗扰动,实现线性时间评估,并在高密度无人机模拟中取得近零碰撞率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23043 2026-04-01 cs.CV

HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling

HieraMamba:通过分层锚点-Mamba池化实现视频时间接地

Joungbin An, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 HieraMamba通过分层锚点-Mamba池化结构,在长视频中实现精确的时间定位,解决了视频时间接地中的全局上下文与细粒度时间细节捕捉难题。

Comments CVPR 2026. Project Page: https://vision.cs.utexas.edu/projects/hieramamba/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19582 2026-03-31 cs.CV

ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving

ScenePilot-4K:一个大规模第一视角数据集和基准,用于自动驾驶中视觉-语言模型的安全感知学习与评估

Yujin Wang, Yutong Zheng, Wenxian Fan, Tianyi Wang, Hongqing Chu, Li Zhang, Bingzhao Gao, Daxin Tian, Jianqiang Wang, Hong Chen

机构 * Tongji University(同济大学) UT Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 本文提出ScenePilot-4K数据集,包含3847小时视频和27.7亿帧图像,用于评估视觉-语言模型在自动驾驶中的场景理解、空间感知、运动规划和语义对齐能力,揭示模型在几何感知和规划推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11349 2026-03-31 cs.LG nlin.CD physics.comp-ph

Context parroting: A simple but tough-to-beat baseline for foundation models in scientific machine learning

上下文鹦鹉:一种简单但难以击败的基础模型基准,用于科学机器学习中的基础模型

Yuanzhao Zhang, William Gilpin

机构 * Santa Fe Institute(圣塔菲研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文指出基础模型常通过简单鹦鹉策略预测,而非鹦鹉时易出现收敛到均值等失败模式。简单鹦鹉模型在低维混沌、湍流等动态系统预测中表现优于主流模型,且计算成本低。

Comments International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03336 2026-03-31 cs.LG cs.AI stat.ML

Single-Round Scalable Analytic Federated Learning

单轮可扩展的分析联邦学习

Alan T. L. Bacellar, Mustafa Munir, Felipe M. G. França, Priscila M. V. Lima, Radu Marculescu, Lizy K. John

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Federal University of Rio de Janeiro(里约热内卢联邦大学) Instituto de Telecomunicações, Porto(波尔图电信研究所)

AI总结 本文提出SAFLe框架,通过引入分桶特征结构头部和稀疏分组嵌入,实现非线性可扩展性,证明其等价于高维线性回归,从而在单轮分析联邦学习中实现高效可扩展的联邦视觉解决方案。

Comments To appear in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05145 2026-03-31 cs.DC cs.AI cs.MA

Efficient Tree-Structured Deep Research with Adaptive Resource Allocation

高效树状深度研究与自适应资源分配

Lunyiu Nie, Nedim Lipka, Ryan A. Rossi, Swarat Chaudhuri

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(Adobe研究院)

AI总结 本文提出ParallelResearch框架,通过动态分解复杂查询为树状子任务,解决深度研究中序列处理的瓶颈问题,实现高效并行处理,实验显示性能提升达5倍。

Comments ICLR 2026 Workshop on Agents in the Wild (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26904 2026-03-31 quant-ph cs.AI

Are LLMs Good For Quantum Software, Architecture, and System Design?

大语言模型在量子软件、架构和系统设计中是否有效?

Sourish Wawdhane, Poulami Das

机构 * UT Austin(德克萨斯大学奥斯汀分校)

AI总结 本文探讨大语言模型在量子系统设计中的应用,评估了九种前沿模型与研究生在量子计算问题上的表现,提出未来研究方向。

Comments 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26730 2026-03-31 cs.RO

Why Cognitive Robotics Matters: Lessons from OntoAgent and LLM Deployment in HARMONIC for Safety-Critical Robot Teaming

为何认知机器人很重要:来自OntoAgent和HARMONIC中LLM部署的启示

Sanjay Oruganti, Sergei Nirenburg, Marjorie McShane, Jesse English, Michael Roberts, Christian Arndt, Ramviyas Parasuraman, Luis Sentis

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) University of Georgia(佐治亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究探讨了在物理世界部署具身体AI代理所需的认知能力,通过HARMONIC架构评估LLM是否能复制OntoAgent的认知能力,发现LLM在知识状态评估上存在缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25767 2026-03-30 cs.SD cs.AI eess.AS

Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods

解锁强监督:面向通用音频预训练方法的数据导向研究

Xuanru Zhou, Yiwen Shao, Wei-Cheng Tseng, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室) UT-Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出通过高质量数据构建强监督框架,对比不同预训练目标,发现数据质量和覆盖范围是性能关键因素,目标选择决定下游任务专精。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19669 2026-03-30 cs.AI

HeaRT: A Hierarchical Circuit Reasoning Tree-Based Agentic Framework for AMS Design Optimization

HeaRT:一种基于分层电路推理树的代理框架用于AMS设计优化

Souradip Poddar, Chia-Tung Ho, Ziming Wei, Weidong Cao, Haoxing Ren, David Z. Pan

机构 * ECE Department, The University of Texas at Austin(德克萨斯大学奥斯汀分校电子与计算机工程系) NVIDIA Corporation(英伟达公司) The George Washington University(乔治华盛顿大学)

AI总结 HeaRT提出了一种分层电路推理树的代理框架,通过提升F1(subcircuits)和F1(loops)指标,实现更高效的AMS设计优化,且在不同架构上表现出更好的适应性和收敛速度。

Comments Analog Design Automation, Hierarchical Circuit Reasoning, Context-Aware Design Adaptation, LLMs, Agentic Frameworks, Electronic Design Automation (EDA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25163 2026-03-27 cs.CV

SportSkills: Physical Skill Learning from Sports Instructional Videos

SportSkills: 从体育教学视频中学习身体技能

Kumar Ashutosh, Chi Hsuan Wu, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出SportSkills,首个针对身体技能学习的体育大规模数据集,包含36万+教学视频和63万+视觉演示,通过实验展示其在细粒度动作差异理解上的优势,并引入首个大规模错误条件教学视频检索任务。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24366 2026-03-26 cs.LG cs.RO

CoordLight: Learning Decentralized Coordination for Network-Wide Traffic Signal Control

CoordLight: 为网络级交通信号控制学习去中心化协调

Yifeng Zhang, Harsh Goel, Peizhuo Li, Mehul Damani, Sandeep Chinchali, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系) Chandra Department of Electrical and Computer Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校电子与计算机工程系) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系)

AI总结 本文提出CoordLight框架,通过改进单个交叉口决策和与邻近代理的协调,提升网络级交通优化。引入Queue Dynamic State Encoding和Neighbor-aware Policy Optimization算法,实现更高效的交通信号控制。

Comments \c{opyright} 20XX IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏