arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

2026-04-06 至 2026-04-06 共收录 5
2604.02883 2026-04-06 cs.CV

Information-Regularized Constrained Inversion for Stable Avatar Editing from Sparse Supervision

信息正则化约束反演用于从稀疏监督稳定编辑可编辑的人形化身

Zhenxiao Liang, Qixing Huang

机构 * Department of Computer Science, University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系)

AI总结 本文提出信息正则化约束反演方法,通过在结构化的化身潜在空间中进行约束反演,限制更新到低维的部分特定编辑子空间,以防止身份泄漏和姿态依赖的时序闪烁,提升在稀疏监督下的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02787 2026-04-06 cs.CV cs.AI

LumaFlux: Lifting 8-Bit Worlds to HDR Reality with Physically-Guided Diffusion Transformers

LumaFlux:通过物理引导的扩散变压器将8位世界提升到HDR现实

Shreshth Saini, Hakan Gedik, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google, Inc.(谷歌公司)

AI总结 LumaFlux通过物理和感知引导的扩散变压器实现8位SDR到10位HDR的重建,引入PGA、PCM和HDR Residual Coupler模块,提升亮度和色彩保真度,同时构建大规模训练数据集和评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02580 2026-04-06 cs.LG

VoxelCodeBench: Benchmarking 3D World Modeling Through Code Generation

VoxelCodeBench:通过代码生成进行3D世界建模的基准测试

Yan Zheng, Florian Bordes

机构 * FAIR at Meta(Meta FAIR) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出VoxelCodeBench基准,通过代码生成评估3D空间推理能力,发现生成可执行代码易,但生成空间正确输出难,尤其在几何构造和多物体组合上挑战大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02457 2026-04-06 cs.CV cs.CR

Street-Legal Physical-World Adversarial Rim for License Plates

符合道路法规的物理世界对抗环

Nikhil Kalidasu, Sahana Ganapathy

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究探讨低资源威胁者能否针对现代开源ALPR系统实施成功对抗攻击,提出符合法律的物理对抗环SPAR,证明其在德克萨斯州的合法性,并展示其对ALPR准确率的显著影响。

Comments 20 pages, 8 figures, 5 tables, submitted to Security in Machine Learning Applications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17180 2026-04-06 cs.CV cs.AI

We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback

事后修复:通过神经符号反馈改进文本到视频生成

Minkyu Choi, S P Sharan, Harsh Goel, Sahil Shah, Sandeep Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出NeuS-E框架,通过神经符号反馈提升文本到视频生成的语义和时间一致性,实验显示其在多种提示下提升了40%的对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏