arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-05-04 至 2026-05-04 共收录 10
2605.00667 2026-05-04 cs.LG cs.AI

Augmented Lagrangian Multiplier Network for State-wise Safety in Reinforcement Learning

增强拉格朗日乘子网络用于强化学习中的状态级安全性

Jiaming Zhang, Yujie Yang, Yao Lyu, Shengbo Eben Li, Liping Zhang

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) School of Vehicle and Mobility & College of AI, Tsinghua University(清华大学车辆与移动系统学院 & 清华大学人工智能学院)

AI总结 本文提出增强拉格朗日乘子网络框架,通过二次惩罚和监督回归稳定状态级乘子学习,提升安全强化学习的性能与稳定性。

Comments 13 pages, 41 figures, 1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00658 2026-05-04 cs.CV

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成

Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao

机构 * Beihang University(北京航空航天大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。

Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)

Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00438 2026-05-04 cs.AI cs.RO

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

文本与图像思考:用于长周期机器人操作的交错视觉-语言推理轨迹

Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Xiaomi Group(小米集团)

AI总结 本文提出IVLR框架,通过显式轨迹表示交替文本子目标与视觉关键帧,提升长周期机器人操作的逻辑与几何一致性,实验显示在LIBERO和SimplerEnv-WidowX上取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00345 2026-05-04 cs.CV

Pose-Aware Diffusion for 3D Generation

姿态感知扩散用于3D生成

Zihan Zhou, Luxi Chen, Jingzhi Zhou, Yuhao Wan, Min Zhao, Baoyu Fan, Chongxuan Li

机构 * Gaoling School of AI, Renmin University of China(中国人民大学 Gallagher人工智能学院) VCIP, School of Computer Science, Nankai University(南开大学计算机学院 VCIP) THU-Bosch MLCenter, Tsinghua University(清华大学 THU-Bosch 机器学习中心) Inspur Group(Inspur集团)

AI总结 本文提出Pose-Aware Diffusion,通过直接在观测空间生成3D几何,解决姿态对齐难题,实现高保真姿态一致的3D资产生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00051 2026-05-04 cs.CV cs.LG

Learning from the Unseen: Generative Data Augmentation for Geometric-Semantic Accident Anticipation

预见未见:生成式数据增强用于几何-语义事故预见

Yanchen Guan, Haicheng Liao, Chengyue Wang, Xingcheng Liu, Jiaxun Zhang, Keqiang Li, Zhenning Li

机构 * State Key Laboratory of Internet of Things for Smart City(物联网智能城市国家重点实验室) University of Macau(澳门大学) Department of Civil Engineering(土木工程系) Department of Computer and Information Science(计算机与信息科学系) Department of Automotive Engineering(汽车工程系) Tsinghua University(清华大学)

AI总结 本文提出双路径框架,通过视频合成和语义图神经网络提升事故预见能力,发布新基准数据集验证方法有效性,提升自动驾驶系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15830 2026-05-04 cs.LG

Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning

将拼图碎片放在关键位置:一种用于强化学习的问题增强框架

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学)

AI总结 本文提出PieceHint框架,通过战略性提供关键推理步骤,解决强化学习中训练易问题过拟合和训练难问题奖励稀疏的问题,实验表明其在数学推理基准上性能优异且保持pass@k多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17205 2026-05-04 astro-ph.IM astro-ph.CO astro-ph.GA cs.AI

Deeper detection limits in astronomical imaging using self-supervised spatiotemporal denoising

利用自监督时空去噪实现天文成像更深层的检测限

Yuduo Guo, Hao Zhang, Mingyu Li, Fujiang Yu, Yunjing Wu, Yuhan Hao, Song Huang, Yongming Liang, Xiaojing Lin, Xinyang Li, Jiamin Wu, Zheng Cai, Qionghai Dai

机构 * Department of Automation, Beijing National Research Center for Information Science and Technology, Tsinghua University, Beijing, China(自动化系,北京信息科学与技术国家研究中心,清华大学,北京,中国) Department of Astronomy, Tsinghua University, Beijing, China(天文系,清华大学,北京,中国) Institute for Brain and Cognitive Sciences, Tsinghua University, Beijing, China(脑与认知科学研究院,清华大学,北京,中国) Kavli Institute for the Physics and Mathematics of the Universe (WPI), The University of Tokyo, Kashiwa, Japan(宇宙物理与数学科学研究所(WPI),东京大学,日光,日本) National Astronomical Observatory of Japan, Tokyo, Japan(日本国家天文台,东京,日本) Institute for Cosmic Ray Research, The University of Tokyo, Kashiwa, Japan(宇宙射线研究所,东京大学,日光,日本) College of AI, Tsinghua University, Beijing, China(人工智能学院,清华大学,北京,中国) School of Mathematics and Physics, Qinghai University, Xining, China(数学与物理学院,青海大学,西宁,中国) Tsinghua Wuxi Institute of Applied Technology, Wuxi, China(清华大学无锡应用技术研究院,无锡,中国)

AI总结 本文提出ASTERIS算法,通过整合多曝光的时空信息,提升天文成像检测限,实现更清晰的天体识别与发现。

Comments Published in Science. This is the author's version of the work. It is posted here by permission of the AAAS for personal use, not for redistribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14201 2026-05-04 cs.CR cs.AI cs.CL

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

ExCyTIn-Bench:评估LLM代理在网络安全调查中的表现

Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Security AI Research(微软安全AI研究) Tsinghua University(清华大学)

AI总结 ExCyTIn-Bench是首个评估LLM代理在网络安全调查任务中的基准,通过从调查图中生成的安全问题进行测试。该基准利用Azure租户中的SQL环境和Microsoft Sentinel日志构建威胁调查图,并生成问题以评估LLM代理的能力。

Comments Accepted By ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06698 2026-05-04 cs.CL

SCAN: Structured Capability Assessment and Navigation for LLMs

SCAN:面向大语言模型的结构化能力评估与导航

Zongqi Wang, Tianle Gu, Chen Gong, Xin Tian, Siqi Bao, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) School of Cyber Engineering, Xidian University(西安电子科技大学电子工程学院) Baidu, Inc(百度公司)

AI总结 本文提出SCAN框架,通过细粒度评估实现对LLM能力的深入分析,揭示了同一类别下不同子能力的显著性能差异,强调了细粒度评估的重要性。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏