arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

共收录 1212
2607.13241 2026-07-16 cs.LG cs.AI 新提交

EMAGN: Efficient Multi-Attention Graph Network via Learned Clustering for Scalable Traffic Forecasting

EMAGN:基于学习聚类的高效多注意力图网络用于可扩展交通流量预测

Mingxing Xu, Rakesh Chowdary Machineni, Ke Liu, Xi Cheng, Chengqi Lu, Xin Hu, Lyuhao Chen, Xiangyu Li, Junwei You, Oliver Gao

机构 * Shanghai Jiao Tong University(上海交通大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of California, Berkeley(加利福尼亚大学伯克利分校) Cornell University(康奈尔大学) Technische Universität Dresden(德累斯顿工业大学) Carnegie Mellon University(卡内基梅隆大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 针对交通流量预测中自注意力机制扩展性有限的问题,提出EMAGN,通过学习聚类矩阵将空间注意力机制线性化,降低复杂度,实验表明其在准确性和效率上优于其他模型,扩展了可行模型配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27232 2026-07-16 cs.CL 版本更新

Targeted Linguistic Analysis of Sign Language Models with Minimal Translation Pairs

基于最小翻译对的手语语言模型目标语言分析

Serpil Karabüklü, Kanishka Misra, Shester Gueuwou, Diane Brentari, Greg Shakhnarovich, Karen Livescu

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Linguistics Department, The University of Texas at Austin(德克萨斯大学奥斯汀分校语言学系) Linguistics Department, The University of Chicago(芝加哥大学语言学系)

AI总结 针对手语翻译模型,通过构建美国手语最小翻译对数据集(ASL-MTP)并消融输入线索,分析模型对不同手语现象(尤其是非手动线索)的捕捉能力。

Comments It is accepted to CVPR 2026 Workshop GenSign: Generative AI for Sign Language

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12631 2026-07-15 cs.CL cs.AI 新提交

Can Induced Emotion Bias LLM Behaviors in Sequential Decision Making?

诱导情绪会影响大语言模型在序列决策中的行为吗?

Minh Khoi Ho, Zihao Zhu, Runchuan Zhu, Levina Li, Zhiwen Fan, Zhangyang Wang, Junyuan Hong

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Texas A&M University(德州农工大学) National University of Singapore(新加坡国立大学) UCLA(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Mass General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

AI总结 研究探讨诱导情绪对大语言模型在序列决策中行为的影响,采用爱荷华赌博任务结合情绪诱导程序,发现诱导情绪平均不显著影响其决策动态,但愤怒有条件地影响决策,揭示了与人类行为的差异,为相关研究提供工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12220 2026-07-15 cs.RO 新提交

Contract-Grounded Behavior Tree Synthesis via Coding Agents

通过编码代理实现基于契约的行为树合成

Jonathan Salfity, Robert Blake Anderson, Mitch Pryor

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究从自然语言合成机器人行为树时基础设定易出现的问题,提出基于契约的合成架构,编码代理查询服务器获取契约后合成行为树,经实验评估两个大语言模型,结果显示该架构能实现高验证率和成功率,且可转移到物理硬件。

Comments IEEE RA-L Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11918 2026-07-15 cs.DL cs.AI cs.CY cs.LG 新提交

AAAI-26 Dual Submissions: Novel Challenges

AAAI-26双重投稿:新挑战

Kiri L. Wagstaff, Joydeep Biswas, Erich Merrill, Bo An, Ida Camacho, David J. Crandall, Matthew E. Taylor

机构 * OSU Libraries(俄勒冈州立大学图书馆) University of Texas at Austin(德克萨斯大学奥斯汀分校) Nanyang Technological University(南洋理工大学) AAAI Washington, DC(AAAI华盛顿特区) Indiana University(印第安纳大学) University of Alberta(阿尔伯塔大学)

AI总结 AAAI-26评审中发现双重投稿问题严重,通过标题+摘要相似性评估等方法处理,导致141篇主赛道投稿被拒稿。提醒注意双重投稿增长,其因生成式AI工具加剧,还给出更新政策、设检查工具等应对建议。

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19387 2026-07-15 cs.SE cs.AI 版本更新

Interpretable and Verifiable Hardware Generation with LLM-Driven Stepwise Refinement

可解释且可验证的硬件生成:基于LLM驱动的逐步细化

You Li, Samuel Mandell, David Z. Pan

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) USA(美国)

AI总结 提出结合LLM创造力与形式化方法可解释性的硬件生成框架,通过迭代应用变换规则将设计规范转换为正确性有保证的RTL程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24372 2026-07-15 cs.LG cs.AI cs.NE 版本更新

Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning

大规模进化策略:超越强化学习的LLM微调

Xin Qiu, Yulu Gan, Conor F. Hayes, Qiyao Liang, Yinggan Xu, Roberto Dailey, Elliot Meyerson, Babak Hodjat, Risto Miikkulainen

机构 * University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校) Cognizant AI Lab, San Francisco, CA, USA(Cognizant AI实验室) The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院)

AI总结 本文提出使用进化策略进行大规模LLM微调,证明其在多个方面优于强化学习,为LLM微调提供了新的方法。

Comments Published at ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09932 2026-07-14 cs.CL cs.AI 新提交

Faithful by Design: Evaluating and Improving LLM-Generated Clinical Trial Summaries for Multi-Stakeholder Audiences

设计忠实性:评估和改进面向多利益相关方受众的大语言模型生成的临床试验摘要

Robert Williams

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究针对大语言模型生成的临床试验摘要的忠实性问题,引入基准评估框架,用特定数据库试验、提示模板和注释模式评估,对比多个模型的基线测量,开发知识图谱增强检索系统,结果显示该系统改进显著,且不同模型改进途径有别。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29042 2026-07-14 cs.CL cs.LG cs.SD eess.AS 版本更新

An Empirical Recipe for Universal Phone Recognition

一种通用电话识别的实证配方

Shikhar Bharadwaj, Chin-Jou Li, Kwanghee Choi, Eunjung Yeo, William Chen, Shinji Watanabe, David R. Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出PhoneticXEUS模型,通过大规模多语言数据训练,在多语言和口音英语语音任务中取得最佳性能,分析了SSL表示、数据规模和损失目标的影响。

Comments Accepted at Interspeech 2026. Code: https://github.com/changelinglab/PhoneticXeus

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11653 2026-07-14 cs.LG cs.RO 版本更新

Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning

简单配方有效:视觉-语言-动作模型通过强化学习成为自然持续学习者

Jiaheng Hu, Jay Shim, Chen Tang, Yoonchang Sung, Bo Liu, Peter Stone, Roberto Martin-Martin

机构 * University of Southern California(南加州大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过系统研究发现,对于大型预训练视觉-语言-动作模型,简单的顺序微调结合低秩适配在持续强化学习中表现出高可塑性、几乎无遗忘和强零样本泛化,优于复杂方法。

Comments Accepted at RLC 2026; Best paper award at ICRA26 RL4IL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06587 2026-07-14 cs.AI q-fin.CP q-fin.RM

Autonomous AI Agents for Option Hedging: Enhancing Financial Stability through Shortfall Aware Reinforcement Learning

自主AI代理用于期权对冲:通过意识短缺的强化学习增强金融稳定性

Minxuan Hu, Ziheng Chen, Jiayu Yi, Wenxi Sun

机构 * Cornell Ann S. Bowers College of Computing and Information Science, Cornell University(康奈尔大学安·索斯·博尔斯计算与信息科学学院) Department of Mathematics, University of Texas at Austin(德克萨斯大学奥斯汀分校数学系) School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院) Krieger School of Arts and Sciences, Johns Hopkins University(约翰霍普金斯大学克里eger艺术与科学学院)

AI总结 本文提出RLOP和QLBS两种强化学习框架,通过意识短缺的方法优化期权对冲,提升金融稳定性并改进风险预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14046 2026-07-14 cs.CL cs.SD 版本更新

PRiSM: Benchmarking Phone Realization in Speech Models

PRiSM:语音模型中电话实现的基准测试

Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, Kwanghee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero Jacome, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe, David R. Mortensen

机构 * CMU(卡内基梅隆大学) Gwangju Institute of Science and Technology(光州科学技术院) UT Austin(得克萨斯大学奥斯汀分校) LMU Munich(慕尼黑路德维希-马克西米利安大学) UC Berkeley(伯克利加州大学) NVIDIA(英伟达) UBC(不列颠哥伦比亚大学)

AI总结 该研究针对语音模型中电话实现进行基准测试,引入PRiSM开源基准用内在和外在评估揭示语音感知盲点,标准化评估并通过探针评估下游效用,发现训练语言接触对PR性能关键,编码器-CTC模型稳定,专门PR模型优于大型音频语言模型,还发布相关资源推动多语言语音模型发展。

Comments Presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17423 2026-07-14 cs.CV cs.HC cs.IT math.IT 版本更新

VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR

VIBE:用于TL;DR的无注释视频到文本信息瓶颈评估

Shenghui Chen, Po-han Li, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 针对决策任务中VLM输出冗长及现有评估依赖人工注释的问题,提出无注释的VIBE方法,用基础和效用指标对VLM输出评分并排序选择,在多个数据集上验证该方法能显著提升任务准确性、减少响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01624 2026-07-14 cs.CV cs.AI

Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling

Q-Sched: 推动少步扩散模型的边界,通过量化感知调度

Natalia Frumkin, Diana Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 Q-Sched通过量化感知调度器改进少步扩散模型,实现模型大小减少4倍并提升生成质量

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11251 2026-07-14 cs.LG cs.RO 版本更新

Disentangled Unsupervised Skill Discovery for Efficient Hierarchical Reinforcement Learning

用于高效分层强化学习的解缠无监督技能发现

Jiaheng Hu, Zizhao Wang, Peter Stone, Roberto Martín-Martín

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 针对现有无监督技能发现方法中技能缠结、下游任务链接难的问题,提出DUSDi方法,通过分解技能为解缠组件,定义基于互信息目标并利用值分解优化,能有效学习解缠技能并解决下游任务,优于先前方法。

Comments Published at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09655 2026-07-13 cs.CV 新提交

OpenLongTail: Generative Scaling of Long-Tail Driving Data

OpenLongTail:长尾驾驶数据的生成式扩展

Lulin Liu, Nuo Chen, Yan Wang, Bangya Liu, Wenyan Cong, Hezhen Hu, Boris Ivanovic, Hao Wang, Ziyao Zeng, Xinyu Gong, Yang Zhou, Zixiang Xiong, Dilin Wang, Zhangyang Wang, Weisong Shi, Ruohan Zhang, Marco Pavone, Zhiwen Fan

机构 * Texas A&M University(德克萨斯农工大学) NVIDIA(英伟达) UW–Madison(威斯康星大学麦迪逊分校) UT Austin(德克萨斯大学奥斯汀分校) Yale University(耶鲁大学) Adobe(奥多比公司) Meta University of Delaware(特拉华大学) Stanford University(斯坦福大学)

AI总结 研究针对长尾驾驶数据稀缺影响策略扩展的问题,提出开源生成数据引擎OpenLongTail,通过姿态外推视图合成管道及普吕克射线几何增强,合成异构数据提升闭环驾驶稳健性,验证了其多方面有效性。

Comments Project page: https://openlongtail.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09648 2026-07-13 cs.RO 新提交

B-spline Policy: Accelerating Manipulation Policies via B-spline Action Representations

B样条策略:通过B样条动作表示加速操纵策略

Xiaoshen Han, Haoyu Xiong, Haonan Chen, Chaoqi Liu, Antonio Torralba, Yuke Zhu, Yilun Du

机构 * Harvard(哈佛大学) MIT(麻省理工学院) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 研究提出B样条策略,将动作参数化为连续B样条曲线,可集成到标准策略学习管道,通过直接预测参数实现。实验表明该策略能显著减少任务完成时间,在模拟和现实任务中优于基线方法且成功率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08987 2026-07-13 cs.LG cs.NA math.NA math.ST stat.TH 新提交

Group Invariant Spectral Embedding

群不变谱嵌入

Yeari Vigder, Paulina Hoyos, David Thong, Joakim andén, Joe Kileel, Amit Moscovich

机构 * Tel Aviv University(特拉维夫大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) KTH Royal Institute of Technology(皇家理工学院)

AI总结 研究高维数据集降维和聚类问题,核心方法是将对称纳入谱嵌入的亲和核,通过分析具有对称的黎曼数据流形,证明相关图拉普拉斯算子收敛,在特定数据集验证后表明该方法能恢复数据内在几何,优于标准谱嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18043 2026-07-13 cs.CL cs.AI cs.CV 版本更新

GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs

GrAInS:基于梯度的大语言模型和视觉语言模型推理时引导方法

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究针对推理时引导LLMs和VLMs的方法局限,提出GrAInS。该方法基于梯度归因识别关键令牌构建引导向量,推理时调整激活。实验显示其性能优于微调及现有基线,能在保持模型流畅性和通用能力的同时提升多项指标。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11936 2026-07-13 physics.flu-dyn cond-mat.mtrl-sci cs.LG 版本更新

Transformer-Based Inverse Microrheology for Experimental Mechanics at Ultra-High Strain Rates

基于Transformer的超高应变率下实验力学的逆微流变学

Lehu Bu, Zhaohan Yu, Danila Frolkin, Junyoung Kim, Qihang Shi, Jan N. Fuhg, Shaoting Lin, Jin Yang

机构 * Materials Science Graduate Program, Texas Materials Institute, The University of Texas at Austin(材料科学研究生项目,德克萨斯材料研究所,德克萨斯大学奥斯汀分校) Department of Mechanical Engineering, Michigan State University(机械工程系,密歇根州立大学) Department of Aerospace Engineering and Engineering Mechanics, The University of Texas at Austin(航空航天工程与工程力学系,德克萨斯大学奥斯汀分校) The Oden Institute of Computational Science and Engineering, University of Texas at Austin(奥登计算科学与工程研究所,德克萨斯大学奥斯汀分校) Department of Mechanical Engineering, University of Wisconsin-Madison(机械工程系,威斯康星大学麦迪逊分校)

AI总结 研究针对传统流变工具在超高应变率下表征软材料的局限,提出基于Transformer的气泡动力学框架BDT,集成物理模拟与神经网络,从气泡动力学快速逆表征软材料粘弹性,无需迭代优化,加速参数推断并能表征多种材料行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01692 2026-07-13 cs.AI cs.LG 版本更新

A Descriptive and Normative Theory of Human Beliefs in RLHF

基于人类反馈强化学习中的人类信念描述性与规范性理论

Sylee Dandekar, Shripad Deshmukh, Frank Chiu, W. Bradley Knox, Scott Niekum

机构 * College of Information and Computer Sciences University of Massachusetts Amherst(信息与计算机科学学院 马萨诸塞大学阿姆赫斯特分校) Department of Computer Science The University of Texas at Austin(计算机科学系 德州大学奥斯汀分校)

AI总结 研究 RLHF 中人类信念作用,提出新偏好模型,通过人类和综合实验,证实人类对智能体能力信念影响偏好,指出减少信念与能力不匹配可提升 RLHF 并给出新实践方向。

Comments Published at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08489 2026-07-10 cs.CV cs.AI cs.HC 新提交

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

VEGAS:通过注视进行与人类对齐的视频字幕评估

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AMD(超威半导体公司)

AI总结 研究针对视觉语言模型视频字幕忽视观众注意力问题,提出VEGAS无需训练的度量标准,利用注视采样个性化文本,通过拒绝采样选字幕,实验表明其能使字幕更好对齐人类焦点,提升下游检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06649 2026-07-09 cs.CR cs.LG 新提交

POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking

POPS:通过提示优化参数抖动恢复多模态大语言模型中未学习的多模态知识

Zhangheng LI, Jianing Zhu, Junyuan Hong, Sungmin Eum, Shuowen Hu, Suya You, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

AI总结 研究针对多模态大语言模型中隐私敏感信息擦除不彻底问题,提出POPS对抗策略,通过提示后缀优化生成潜在私人示例并微调模型,实验揭示现有MMU算法弱点,POPS能近乎完全恢复敏感信息,暴露隐私保护漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07637 2026-07-09 cs.LG cs.NA math.NA math.OC 新提交

An optimal control approach for neural network architecture adaptation with a posteriori error estimation

一种基于后验误差估计的神经网络架构自适应最优控制方法

C G Krishnanunni, Thomas Scott, Tan Bui-Thanh

机构 * Department of Aerospace Engineering & Engineering Mechanics, UT Austin(德克萨斯大学奥斯汀分校航空航天工程与工程力学系) Oden Institute for Computational Engineering and Sciences, UT Austin(德克萨斯大学奥斯汀分校奥登计算工程与科学研究所)

AI总结 该研究基于后验误差估计提出神经网络架构自适应的最优控制方法,将训练视为连续时间最优控制问题,通过误差分解确定新层插入位置,引入新架构并利用有限元方法得出误差界,在科学数据集上验证其泛化性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29251 2026-07-09 cs.AI q-fin.CP 版本更新

When Summaries Distort Decisions: Information Fidelity in LLM-Compressed Financial Analysis

当摘要扭曲决策:LLM压缩财务分析中的信息保真度

Hoyoung Lee, Suhwan Park, Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, CheolWon Na, Zhangyang Wang, Zach Golkhou, Minkyu Kim, Sotirios Sabanis, Alejandro Lopez-Lira, Dhagash Mehta, Soonyoung Lee, Chanyeol Choi, Wonbin Ahn, Yongjae Lee

机构 * UNIST(全纳科学技术大学) LG AI Research(LG人工智能研究) Sungkyunkwan University(成均馆大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) J.P. Morgan Chase(摩根大通) State Street(州立银行) University of Edinburgh(爱丁堡大学) University of Florida(佛罗里达大学) BlackRock(黑石) LinqAlpha

AI总结 研究LLM压缩财务信息时因丢失决策相关上下文导致投资判断改变的问题,提出通过生成多个候选压缩并审计分歧的代理上下文压缩方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19859 2026-07-09 cs.LG eess.SP math.OC stat.CO stat.ML

An Overview of Low-Rank Structures in the Training and Adaptation of Large Models

大型模型训练与适应中低秩结构的综述

Laura Balzano, Tianjiao Ding, Benjamin D. Haeffele, Soo Min Kwon, Qing Qu, Peng Wang, Zhangyang Wang, Can Yaras

机构 * University of Michigan(密歇根大学) University of Pennsylvania(宾夕法尼亚大学) University of Macau(澳门大学) UT Austin(得克萨斯大学奥斯汀分校)

AI总结 本文综述了大型模型训练与适应中低秩结构的识别与利用,探讨了梯度下降动态和隐含正则化对低秩性的影响,并介绍了LoRA等技术的理论基础与应用。

Comments Authors are listed alphabetically; 37 pages, 15 figures; minor revision at IEEE Signal Processing Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28757 2026-07-08 cs.CV cs.RO 版本更新

A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models

基于物理的多智能体动力学世界模型基准

Nuo Chen, Lulin Liu, Zihao Li, Ziyao Zeng, Zihao Zhu, Wenyan Cong, Junyuan Hong, Yunhao Yang, Zhengzhong Tu, Yan Wang, Boris Ivanovic, Marco Pavone, Zhangyang Wang, Yang Zhou, Zhiwen Fan

机构 * Texas A&M University(德克萨斯大学) University of Minnesota(明尼苏达大学) Marquette University(马奎特大学) Yale University(耶鲁大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 提出CrashTwin框架,通过多智能体碰撞场景数据集和校准无关重建流程,从时空一致性、动量与动能守恒、世界动力学完整性三个维度评估世界模型的物理可信度。

Comments 34 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17143 2026-07-08 cs.CV 版本更新

Pro-Pose: Unpaired Full-Body Portrait Synthesis via Canonical UV Maps

Pro-Pose:通过规范UV映射实现无配对全身肖像合成

Sandeep Mishra, Yasamin Jafarian, Andreas Lugmayr, Yingwei Li, Varsha Ramakrishnan, Srivatsan Varadharajan, Alan C. Bovik, Ira Kemelmacher-Shlizerman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google(谷歌)

AI总结 本文提出通过规范UV映射实现无配对全身肖像合成,利用UV空间解耦姿态与外观,结合多图微调确保身份一致性,生成高质量肖像以提升虚拟试衣等应用的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04206 2026-07-07 cs.DC cs.LG 新提交

Sangam: Efficiently Serving Diffusion LLMs with the AR Stack

Sangam:使用AR堆栈高效服务扩散语言模型

Nitin Kedia, Saurabh Agarwal, Myungjin Lee, Aditya Akella

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco Research(思科研究)

AI总结 研究扩散语言模型服务问题,提出Sangam系统,用赤字令牌预算调度器实现摊还无停顿调度,采用混合服务策略缓解预填充资源不足,揭示服务设计空间受预填充-解码干扰等因素影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04057 2026-07-07 cs.CV cs.RO 新提交

PreSIST: Vision-Language-Informed Object Persistence Prediction in Open-World Scenes

PreSIST:开放世界场景中视觉-语言信息的对象持久性预测

Amanda Adkins, Tarunvidyut Ravisankar, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) National Science Foundation(美国国家科学基金会) ARO(美国陆军研究办公室) Amazon(亚马逊公司) JP Morgan(摩根大通公司)

AI总结 研究长期部署机器人对环境变化的推理,提出PreSIST方法,通过对象属性和场景上下文估计实例级持久性先验,结合概率持久性过滤器预测对象未来姿态,有两种变体,实验表明优于基线。

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏