arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-04-30 至 2026-04-30 共收录 15
2604.26934 2026-04-30 cs.CV

World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning

World2VLM: 将世界模型的想象能力蒸馏到VLM中以实现动态空间推理

Wanyue Zhang, Wenxiang Wu, Wang Xu, Jiaxin Luo, Helu Zhi, Yibin Huang, Shuo Ren, Zitao Liu, Jiajun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Wuhan AI Research(武汉人工智能研究院)

AI总结 本文提出World2VLM框架,通过蒸馏生成式世界模型的空间想象能力到VLM中,提升动态空间推理性能,优于基线模型和测试时世界模型耦合方法。

Comments The code is available at https://github.com/WanyueZhang-ai/World2VLM. The dataset is available at https://huggingface.co/datasets/WanyueZhang/World2VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26839 2026-04-30 cs.RO

Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance

带我走:面向以人为本的户外助行的长周期社交导航

Lingfeng Zhang, Xiaoshuai Hao, Xizhou Bu, Yingbo Tang, Hongsheng Li, Jinghui Lu, Xiu-shen Wei, Jiayi Ma, Yu Liu, Jing Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Hefei University of Technology(合肥工业大学)

AI总结 本文提出Walk with Me框架,通过高阶视觉语言模型和轻量级兴趣点,实现无地图的长周期社交导航,结合语义意图定位、安全推理和低层动作生成,提升户外助行的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26768 2026-04-30 cs.CL

Decoupling Knowledge and Task Subspaces for Composable Parametric Retrieval Augmented Generation

解耦知识与任务子空间以实现可组合的参数检索增强生成

Weihang Su, Hanwen Zhang, Qingyao Ai, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出通过正交子空间分解分离任务行为与文档知识,提升多文档参数RAG的组合鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23758 2026-04-30 cs.LG cond-mat.mtrl-sci

Agentic Fusion of Large Atomic and Language Models to Accelerate Superconductors Discovery

代理融合大规模原子和语言模型以加速超导体发现

Mingze Li, Yu Rong, Songyou Li, Lihong Wang, Jiacheng Cen, Liming Wu, Anyi Li, Zongzhao Li, Qiuliang Liu, Rui Jiao, Tian Bian, Pengju Wang, Hao Sun, Jianfeng Zhang, Ji-Rong Wen, Deli Zhao, Shifeng Jin, Tingyang Xu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) DAMO Academy, Alibaba Group, Hangzhou, China(阿里巴巴集团达摩院,杭州,中国) Hupan Lab, Hangzhou, China(虎扑实验室,杭州,中国) Institution of Physics, University of the Chinese Academy of Sciences, Beijing, China(中国科学院物理研究所,北京,中国) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国)

AI总结 本文提出ElementsClaw框架,结合大规模原子模型与语言模型,通过自主协作加速超导体发现,筛选240万晶体识别6.8万高置信度候选,发现四个新实验验证超导体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16496 2026-04-30 cs.CL

AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents

AdaMem:面向长时对话代理的自适应用户导向记忆

Shannan Yan, Jingchen Ni, Leqi Zheng, Jiajun Zhang, Peixi Wu, Dacheng Yin, Jing Lyu, Chun Yuan, Fengyun Rao

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

AI总结 AdaMem通过自适应用户导向记忆框架提升长时对话代理的长时推理与用户建模能力,采用统一框架整合工作记忆、事件记忆、人格记忆和图记忆,实现高效信息组织与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26573 2026-04-30 cs.LG

PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners

PAINT:部分解适应插值训练用于自蒸馏推理器

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航)

AI总结 PAINT通过部分解适应插值训练,在自蒸馏推理器中提升大语言模型的推理能力,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26363 2026-04-30 cs.CV cs.LG

CO-EVO: Co-evolving Semantic Anchoring and Style Diversification for Federated DG-ReID

CO-EVO: 用于联邦域泛化的语义锚定与风格多样化协同进化

Fengchun Zhang, Qiang Ma, Liuyu Xiang, Jinshan Lai, Tingxuan Huang, Jianwei Hu

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件学院) QiYuan Lab(启元实验室) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) School of Software, Tsinghua University(清华大学软件学院)

AI总结 本文提出CO-EVO框架,通过语义净化与风格扩展的协同机制,解决联邦域泛化中因客户端风格差异导致的语义冲突问题,实现跨域泛化性能提升。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26261 2026-04-30 cs.CV

Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding

多一致的2D-3D映射用于鲁棒的零样本3D视觉定位

Yufei Yin, Jie Zheng, Qianke Meng, Zhou Yu, Minghao Chen, Jiajun Ding, Min Tan, Yuling Xi, Zhiwen Chen, Chengfei Lv

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(Inria巴黎-鲁克蒙特研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室)

AI总结 本文提出MCM-VG框架,通过建立多一致的2D-3D映射实现鲁棒的零样本3D视觉定位,解决开放词汇3D提案质量差的问题,提升目标定位和推理的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26218 2026-04-30 cs.CV

ViBE: Visual-to-M/EEG Brain Encoding via Spatio-Temporal VAE and Distribution-Aligned Projection

ViBE:通过时空VAE和分布对齐投影实现视觉到M/EEG脑编码

Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Shuyan Zhou, Guoxu Zhou, Boyu Wang, Jian Zhu, Jinyi Long

机构 * Jinan University(济南大学) The First Affiliated Hospital of Jinan University(济南大学第一附属医院) Western University(西方大学) Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学)

AI总结 本文提出ViBE框架,通过时空卷积变分自编码器和分布对齐投影,实现从视觉刺激生成高质量M/EEG信号,解决跨模态对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25937 2026-04-30 eess.AS cs.AI cs.SD

SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment

SongBench: 一个细粒度多维度歌曲质量评估基准

Dapeng Wu, Shun Lei, Wei Tan, Guangzheng Li, Yunzhe Wang, Huaicheng Zhang, Lishi Zuo, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Tencent(腾讯)

AI总结 本文提出SongBench,通过七个关键维度评估歌曲质量,构建专家标注数据库,揭示当前模型的细粒度性能差距,推动更专业且音乐连贯的歌曲生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03260 2026-04-30 cs.CL cs.AI

Why Attend to Everything? Focus is the Key

为何关注一切?关注是关键

Hengshuai Yao, Xing Chen, Ahmed Murtadha, Jin Li, Yasin Abbasi Yadkori, Shuai Shao, Changling Liu, Guan Wang, Mingli Yuan, William Chen, Sen Song

机构 * Sapient Intelligence University of Alberta(阿尔伯塔大学) Tsinghua University(清华大学)

AI总结 本文提出Focus方法,通过学习重要token对来优化注意力机制,实验证明在不同模型规模和架构下均无性能下降,并在速度和质量上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02731 2026-04-30 cs.SD cs.CV cs.MM

Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Omni2Sound:迈向统一的视频-文本到音频生成

Yusheng Dai, Zehua Chen, Yuxuan Jiang, Baolong Gao, Qiuhong Ke, Jianfei Cai, Jun Zhu

机构 * Tsinghua University(清华大学) Monash University(莫纳什大学) Shengshu AI(盛数人工智能)

AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08547 2026-04-30 cs.RO cs.CV

R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation

R2RGEN:用于空间通用操作的实现实体3D数据生成

Xiuwei Xu, Angyuan Ma, Hankun Li, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Key Laboratory of Embodied Intelligence Systems(北京智能体智能系统重点实验室) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学智能体与机器人研究院) GigaAI

AI总结 本文提出R2RGen框架,通过实现实体3D数据生成提升空间通用操作的鲁棒性,采用统一三阶段方法增强数据效率,适用于移动操作场景。

Comments Accepted to RSS 2026. Project page: https://r2rgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05907 2026-04-30 cs.RO

EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks

EvolvingAgent: 基于持续世界模型的课程自进化代理用于长周期任务

Tongtong Feng, Xin Wang, Zekai Zhou, Ren Wang, Yuwei Zhan, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Beijing National Research Center for Information Science and Technology, Tsinghua University(计算机科学与技术系,北京信息科学与技术国家研究中心,清华大学) Department of Computer Science, University of Sydney(计算机科学系,悉尼大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

AI总结 本文提出EvolvingAgent,通过持续世界模型实现自主完成长周期任务,采用任务规划、动作控制和反思模块,提升Minecraft和Atari环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13729 2026-04-30 cs.LG cs.AI cs.CV cs.GR

ComboStoc: Combinatorial Stochasticity for Diffusion Generative Models

ComboStoc: 差分生成模型中的组合随机性

Rui Xu, Jiepeng Wang, Hao Pan, Yang Liu, Xin Tong, Shiqing Xin, Changhe Tu, Taku Komura, Wenping Wang

机构 * The University of Hong Kong Work partially done at MSRA. † Corresponding authors. China The University of Hong Kong China Tsinghua University China Microsoft Research Asia China Shandong University China Texas A\&M University USA The University of Hong Kong Tsinghua University Microsoft Research Asia Shandong University Texas A\&M University

AI总结 本文研究了差分生成模型中未被充分探索但重要的组合复杂性问题,提出 ComboStoc 方法通过构建随机过程充分利用组合结构,提升训练效率并实现测试时生成的灵活控制。

Comments ACM Transactions on Graphics, SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏