arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-05-04 至 2026-05-04 共收录 7
2605.00658 2026-05-04 cs.CV

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成

Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao

机构 * Beihang University(北京航空航天大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。

Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)

Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00634 2026-05-04 cs.RO cs.CV

Paired-CSLiDAR: Height-Stratified Registration for Cross-Source Aerial-Ground LiDAR Pose Refinement

Paired-CSLiDAR:基于高度分层的跨源空地LiDAR姿态精修

Montana Hoover, Jing Liang, Tianrui Guan, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Stanford University(斯坦福大学)

AI总结 本文提出Paired-CSLiDAR基准,通过高度分层ICP、反向注册方向和置信度门控选择,实现空地LiDAR姿态精修,优于现有方法,验证了RMSE基于姿态选择的有效性。

Comments 8 pages, 4 figures. Dataset and code are being prepared for public release

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00503 2026-05-04 cs.CV cs.LG

End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

端到端自回归图像生成与1D语义分词器

Wenda Chu, Bingliang Zhang, Jiaqi Han, Yizhuo Li, Linjie Yang, Yisong Yue, Qiushan Guo

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

AI总结 本文提出端到端训练 pipeline,结合重建与生成优化,改进1D分词器,实现自回归图像生成的高FID分数结果。

Comments In ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00497 2026-05-04 cs.HC cs.AI cs.CL

"What Are You Really Trying to Do?": Co-Creating Life Goals from Everyday Computer Use

你真正想做什么?

Shardul Sapkota, Matthew Jörke, Zane Sabbagh, Omar Shaikh, Grace Wang, James A. Landay

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种从日常计算机使用中推断更广泛生活目标的共创建过程,通过活动理论和Emmons的个人追求框架,构建分层表示,并支持编辑界面以增强用户对自身理解的控制。

Comments 20 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00080 2026-05-04 cs.RO cs.CV

World Model for Robot Learning: A Comprehensive Survey

机器人学习的世界模型:全面综述

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) The University of Tokyo(东京大学) University of Oxford(牛津大学) Microsoft(微软公司) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00022 2026-05-04 cs.CL cs.AI cs.SD

Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment

让人类优先:高效LAM评估的人类偏好对齐

Woody Haosheng Gan, William Held, Diyi Yang

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学) OpenAthena

AI总结 本文研究了如何通过最小子集高效评估LAM,发现50个样本即可达到高相关性,并通过回归模型提升预测效果,提出HUMANS基准作为高效评估代理。

Comments Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07475 2026-05-04 cs.CL cs.AI cs.CY cs.LG

Laissez-Faire Harms: Algorithmic Biases in Generative Language Models

放任的伤害:生成语言模型中的算法偏见

Evan Shieh, Faye-Marie Vassel, Cassidy Sugimoto, Thema Monroe-White

机构 * Young Data Scientists League(年轻数据科学家联盟) Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) Schar School of Policy and Government & Department of Computer Science(政策与政府学院及计算机科学系) George Mason University(乔治·马歇尔大学)

AI总结 研究通过开放性提示分析生成语言模型的偏见,发现五种主流模型对少数族裔、性别和性取向群体存在排除、从属和刻板印象的伤害,强调需保护消费者免受语言模型歧视性影响。

Comments 16 pages (43 if including supplementals), 8 figures (23 if including supplementals)

Journal ref Nat Commun 17, 1243 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏