arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-04-16 至 2026-04-16 共收录 18
2604.14016 2026-04-16 cs.LG cs.AI

MAny: Merge Anything for Multimodal Continual Instruction Tuning

MAny:为多模态连续指令微调合并任何内容

Zijian Gao, Wangwang Jia, Xingxing Zhang, Pengfei Qian, Tao Sun, Bo Ding, Yong Dou, Huaimin Wang, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology(国防科技大学并行与分布式计算国家重点实验室) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Tsinghua University(清华大学计算机科学与技术系)

AI总结 针对多模态连续指令微调中感知漂移和推理崩溃问题,提出MAny框架,通过跨模态投影合并和低秩参数合并实现任务知识融合,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13942 2026-04-16 cs.RO

Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection

Goal2Skill:基于自适应规划与反思的长时程操作

Zhen Liu, Xinyu Ning, Zhe Hu, Xinxin Xie, Weize Li, Zhipeng Tang, Chongyu Wang, Zejun Yang, Hanlin Wang, Yitong Liu, Zhongzhu Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 本文提出双系统框架,通过分离高层语义推理与低层运动执行,提升长时程操作的鲁棒性和适应性,实验表明其在RMBench任务中显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13863 2026-04-16 cs.CV

PostureObjectstitch: Anomaly Image Generation Considering Assembly Relationships in Industrial Scenarios

姿态物体拼接:考虑装配关系的异常图像生成

Zebei Tong, Hongchang Chen, Yujie Lei, Gang Chen, Yushi Liu, Zhi Zheng, Hao Chen, Jieming Zhang, Ying Li, Dongpu Cao

机构 * Beijing Institute of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学)

AI总结 本文提出PostureObjectStitch方法,通过解耦多视角图像特征和引入条件损失与几何先验,实现工业场景中考虑装配关系的准确异常图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13841 2026-04-16 cs.CV

DiffMagicFace: Identity Consistent Facial Editing of Real Videos

DiffMagicFace: 实现实时视频中人脸的恒定身份编辑

Huanghao Yin, Shenkun Xu, Kanle Shi, Junhai Yong, Bin Wang

机构 * Tsinghua University(清华大学)

AI总结 本文提出DiffMagicFace框架,通过整合文本和图像控制模型,实现视频中人脸编辑时保持身份一致性和内容一致性,无需依赖视频数据集,效果在视觉和量化指标上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13817 2026-04-16 cs.LG

RPS: Information Elicitation with Reinforcement Prompt Selection

RPS: 通过强化提示选择进行信息获取

Tao Wang, Jingyao Lu, Xibo Wang, Haonan Huang, Su Yao, Zhiqiang Hu, Xingyan Chen, Enmao Diao

机构 * Department of Computer Science, Southwestern University of Finance and Economics(西南财经大学计算机科学学院) China Telecom Corporation Limited(中国电信有限公司) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Eindhoven University of Technology(埃因霍温理工大学)

AI总结 本文提出RPS框架,通过强化学习实现对话中自适应的信息获取,引入IELegal数据集验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13800 2026-04-16 cs.RO

EmbodiedClaw: Conversational Workflow Execution for Embodied AI Development

EmbodiedClaw:基于对话的多任务多场景多模型具身AI开发流程执行

Xueyang Zhou, Yihan Sun, Xijie Gong, Guiyao Tie, Pan Zhou, Lichao Sun, Yongchao Chen

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学信息科学与工程学院) School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Lehigh University(莱斯大学) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 本文提出EmbodiedClaw,通过对话实现具身AI开发流程的自动规划与执行,减少人工工程工作量,提升可执行性、一致性和可重复性。

Comments 13 pages, 7 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13016 2026-04-16 cs.LG cs.AI cs.CL

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

重新思考大型语言模型的在线策略蒸馏:现象、机制和配方

Yaxuan Li, Yuxin Zuo, Bingxiang He, Jinqian Zhang, Chaojun Xiao, Cheng Qian, Tianyu Yu, Huan-ang Gao, Wenkai Yang, Zhiyuan Liu, Ning Ding

机构 * Tsinghua University(清华大学) ShanghaiTech University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Renmin University of China(中国人民大学)

AI总结 本文系统研究了在线策略蒸馏的动态和机制,发现成功关键在于师生思维模式兼容及教师提供新能力,提出两种恢复失败蒸馏的策略,并指出密集奖励的表面优势背后存在代价。

Comments 30 pages, 23 figures. Code: https://github.com/thunlp/OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01773 2026-04-16 cs.RO

IGen: Scalable Data Generation for Robot Learning from Open-World Images

IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成

Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Beijing University of Chemical Technology(北京化工大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen University of Infomation Technology(深圳信息大学)

AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。

Comments 8 pages, 8 figures; Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07019 2026-04-16 cs.CL cs.AI cs.LG

Native Hybrid Attention for Efficient Sequence Modeling

原生混合注意力机制用于高效序列建模

Jusen Du, Jiaxi Hu, Tao Zhang, Weigao Sun, Yu Cheng

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出原生混合注意力机制,结合线性与全注意力,通过滑动窗口和线性RNN实现长上下文保留与短上下文增强,提升效率与召回率。

Comments Accepted by ACL 2026, 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13133 2026-04-16 cs.LG

Automated co-design of high-performance thermodynamic cycles via graph-based hierarchical reinforcement learning

基于图的分层强化学习的高性能热力学循环自动协同设计

Wenqing Li, Xu Feng, Peixue Jiang, Yinhai Zhu

机构 * Key Laboratory for Thermal Science and Power Engineering of Ministry of Education, Beijing Key Laboratory of CO2 Utilization and Reduction Technology, Department of Energy and Power Engineering, Tsinghua University(教育部热科学与能源工程重点实验室,北京二氧化碳利用与减排技术重点实验室,清华大学能源与动力工程系) Shanxi Research Institute for Clear Energy Tsinghua University(清华大学清能研究院山西分院)

AI总结 本文提出基于图的分层强化学习方法,用于自动设计热力学循环结构参数,通过图表示、热物性代理和管理者-工人学习,实现高效自动编码、解码和协同优化,发现新型热泵和热机循环并提升性能。

Comments 21 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11064 2026-04-16 cs.LG cs.CV

A Faster Path to Continual Learning

连续学习的更快路径

Wei Li, Hangjie Yuan, Zixiang Zhao, Borui Kang, Ziwei Liu, Tao Feng

机构 * College of Computer Science, Sichuan University, China(四川大学计算机学院) College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院) Photogrammetry and Remote Sensing Lab, ETH Zürich, Switzerland(苏黎世联邦理工学院摄影测量与遥感实验室) School of Computer Science, Nanjing University, China(南京大学计算机科学系) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系)

AI总结 本文提出C-Flat Turbo,通过优化梯度计算减少连续学习的训练成本,提升效率并保持性能。

Comments Update Author Affiliations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05096 2026-04-16 cs.CL

RAG or Learning? Understanding the Limits of LLM Adaptation under Continuous Knowledge Drift in the Real World

RAG还是学习?在现实世界中连续知识漂移下理解LLM适应的极限

Hanbing Liu, Lang Cao, Yang Li

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) School of Artificial Intelligence, Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(深圳 ubiquitous 数据赋能重点实验室,清华大学深圳国际研究生院,清华大学)

AI总结 本文提出一个现实世界动态事件基准,评估模型在连续知识漂移下的适应能力,揭示现有方法如RAG和学习方法的局限性,并提出时间感知检索基线Chronos以提升时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10946 2026-04-16 cs.CV

Abstract 3D Perception for Spatial Intelligence in Vision-Language Models

抽象3D感知用于视觉-语言模型中的空间智能

Yifan Liu, Fangneng Zhan, Kaichen Zhou, Yilun Du, Paul Pu Liang, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出SandboxVLM框架,通过抽象边界框编码几何结构和物理动力学,提升视觉-语言模型在3D任务中的空间智能,实验证明其在零样本设置下显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07717 2026-04-16 cs.RO cs.CV

RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph

RoboTAG: 通过拓扑对齐图实现端到端的机器人配置估计

Yifan Liu, Fangneng Zhan, Wanhua Li, Haowen Sun, Katerina Fragkiadaki, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出RoboTAG,通过结合3D和2D分支,利用拓扑对齐图缓解对标签的依赖,提升机器人姿态估计的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26491 2026-04-16 cs.LG

Data-Efficient RLVR via Off-Policy Influence Guidance

通过离策略影响指导实现数据高效的RLVR

Erle Zhu, Dazhi Jiang, Yuan Wang, Xujun Li, Jiale Cheng, Yuxian Gu, Yilin Niu, Aohan Zeng, Jie Tang, Minlie Huang, Hongning Wang

机构 * CoAI Group, Tsinghua University(联合人工智能组,清华大学)

AI总结 本文提出基于影响函数的理论方法,通过离策略影响估计和稀疏随机投影提升RLVR的数据效率,实验显示CROPI框架在训练加速方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06687 2026-04-16 cs.CV cs.AI

Geometry-Aware Cross Modal Alignment for Light Field-LiDAR Semantic Segmentation

面向几何的多模态对齐用于光场-激光雷达语义分割

Jie Luo, Yuxuan Jiang, Xin Jin, Mingyu Liu, Yihui Fan

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出融合光场数据和点云数据的多模态语义分割网络,通过特征补全和深度感知模块提升复杂场景下的分割性能,优于单模态方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21823 2026-04-16 cs.AI

ProRe: A Proactive Reward System for GUI Agents via Reasoner-Actor Collaboration

ProRe:通过推理器-执行器协作的GUI代理前瞻性奖励系统

Gaole Dai, Shiqi Jiang, Ting Cao, Yuqing Yang, Yuanchun Li, Rui Tan, Mo Li, Lili Qiu

机构 * NTU(国立新加坡大学) Microsoft Research(微软研究院) Tsinghua University(清华大学) HKUST(香港理工大学)

AI总结 ProRe通过推理器与领域特定评估器协作,提升GUI代理奖励准确性与F1分数,实验显示奖励准确性和F1分数提升达5.3%和19.4%。

Comments 23 pages, 12 figures, ICLR'2026

Journal ref The Fourteenth International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19378 2026-04-16 cs.CL

TableMaster: A Recipe to Advance Table Understanding with Language Models

TableMaster: 一种提升语言模型表格理解能力的方案

Lang Cao, Hanbing Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

AI总结 本文提出TableMaster方案,通过提取表格内容并增强语义上下文,结合自适应推理方法,提升语言模型对表格数据的理解能力,实验表明其在WikiTQ数据集上准确率达78.13%。

详情

展开后加载摘要…

URL PDF HTML 收藏