arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-07-28 至 2026-07-28 共收录 26
2607.24591 2026-07-28 cs.CV 新提交

CameraAnything: Refilming Videos with Arbitrary Camera Control

CameraAnything:使用任意相机控制重新拍摄视频

Yixuan Li, Yanhong Zeng, Ka Leong Cheng, Jiayi Zhu, Hanlin Wang, Wen Wang, Yihao Meng, Hao Ouyang, Qiuyu Wang, Yue Yu, ZiDong Wang, Yiyuan Zhang, Yujun Shen, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 CameraAnything是用于相机控制视频编辑的统一框架,采用逐像素普吕克光线注入等方法联合控制相机参数,开发合成管道克服数据稀缺,能在单过程中实现多种视频编辑操作,为视频制作提供实用价值。

Comments Project page: https://yixuanli98.github.io/cameraanything/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24507 2026-07-28 cs.LG cs.AI 新提交

UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective

统一融合:在统一反向速率目标下将自回归语言模型适配到离散扩散

Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院) Wuhan University(武汉大学) MathonAI(未知(暂未找到合适中文翻译))

AI总结 研究旨在将预训练的自回归语言模型适配到均匀噪声扩散。通过建立不同模型间联系并推导转换,提出UNIFUSION方法。经实验评估,该方法能改善生成困惑度与单字熵权衡,在相同规模模型中多项指标表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24280 2026-07-28 cs.AI 新提交

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

从专有模型到开源模型:通过智能体搜索中的多智能体协议蒸馏弥合分布差距

Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu, Kailin Jiang, Jinyang Wu, Bohan Yu, Chenxi Zhou

机构 * Beijing Institute of Technology(北京理工大学) East China Normal University(华东师范大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究旨在弥合专有与开源模型分布差距,提出多智能体协议蒸馏(MAPD)框架,利用结构化协议作中间表示,结合蒸馏与强化学习,在问答基准测试中表现出色,有效减轻学生策略问题,优于其他竞争方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24135 2026-07-28 cs.CV 新提交

LoTA-N2N: Local Trace Adaptation for Zero-Shot Self-Supervised Image Denoising

LoTA-N2N:用于零样本自监督图像去噪的局部迹线自适应

Jintong Hu, Bin Xia, Junlin Liu, Jiayue Liu, Wenming Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) University of Southern California(南加州大学) Peking University(北京大学)

AI总结 研究针对单图像自监督去噪问题,提出LoTA-N2N两阶段零样本自适应框架,通过估计局部相互作用和控制空间抵消,在多种噪声下实验效果优于仅基于MSE的方法,为无配对干净目标等情况的自监督去噪提供有效设计原则。

Comments 22pages, 9 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23722 2026-07-28 cs.AI 新提交

E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

E-Bench:在现实世界产品场景中对多步工具使用智能体进行基准测试

Weihuang Zheng, Tianyuan Zou, Eileen Ye, Alphet Liu, Youyong Kong, Ya-Qin Zhang, Duran Zheng, Maxm Pan

机构 * Hunyuan Team, Tencent(腾讯混元团队) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

AI总结 研究针对大语言模型多步工具使用能力,介绍E-Bench基准测试,通过解耦环境与任务合成构建可扩展可控测试平台,对11个前沿模型测试发现多步工具使用仍具挑战,即便结合代码执行可靠性也不高。

Comments 29 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23702 2026-07-28 cs.RO 新提交

Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization

一试即优:用于跨情节探索摊销的去冗余过程记忆

Haizhou Ge, Haochen Ouyang, Zhixing Chen, Yufei Jia, Yue Li, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics(DISCOVER机器人公司) Northeast Agricultural University(东北农业大学)

AI总结 研究如何让机器人避免重复探测隐藏状态物体,提出面向实例的记忆框架IOM,用视觉语言模型实例化,在多任务中减少操纵操作,提升效率且不降低成功率,即使过程错误也能成功。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23684 2026-07-28 cs.RO 新提交

Towards Ultrafast Depth Sensing Via Active Event-based Stereo Vision

通过基于主动事件的立体视觉实现超快速深度感知

Jianing Li, Yunjian Zhang, Haiqian Han, Kangyao Huang, Xiangyang Ji

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Peng Cheng Laboratory(鹏城实验室) Department of Automation, Tsinghua University(清华大学自动化系) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 针对传统主动立体系统在快速运动场景的问题,提出基于主动事件的立体视觉,构建数据集,创新设计ActiveEventNet+网络,性能优于现有方法,降低计算复杂度,能实现高速实时处理,为高速深度感知相机系统设计提供新思路。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23648 2026-07-28 cs.CL 新提交

EmoTrace: An Emotion Trajectory-Centered Framework for Psychological Support Dialogue Generation

EmoTrace:一种以情感轨迹为中心的心理支持对话生成框架

Kaitong Weng, Lixin Liu, Zihao Liu, Bo Wang, Shiguang Ni

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 该研究针对现有心理支持对话数据生成方法的局限,提出EmoTrace框架,通过构建求助者认知概况及相关模块,以模拟其情感轨迹,增强情感表达层次性,实验证明该方法在情感丰富度和共情质量上优于现有方法。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23108 2026-07-28 cs.RO 新提交

The Curse of Precision: A Data Scaling Law for High-Precision Robotic Manipulation

精度的诅咒:高精度机器人操作的数据缩放定律

Cuijie Xu, Yuanfan Xu, Min Xue, Jianjie Lin, Jian Wang, Xudong Zhang, Yu Wang, Jincheng Yu

机构 * Tsinghua University(清华大学) OpenMind (WuHu) Robotics Co., Ltd.(芜湖悟灵机器人有限公司)

AI总结 研究机器人装配等封闭世界任务中数据与精度的关系,提出新缩放定律log(N) ∝ 1/(P - c),揭示极限精度c是系统涌现属性,经实验验证,为精度提供理论框架和评估指标,指导高精度操作系统开发调试。

Comments 8 pages, 4 figures. Accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22769 2026-07-28 cs.LG cs.AI 新提交

DomainPilot: Domain-Level Loss-Guided Two-Stage Data Mixture Optimization for Efficient Language Model Fine-Tuning

DomainPilot:用于高效语言模型微调的域级损失引导两阶段数据混合优化

He Zhang

机构 * Tsinghua University(清华大学)

AI总结 研究针对大语言模型训练数据问题,提出DomainPilot框架,通过域级损失引导两阶段数据混合优化,经令牌级监测、缩放与混合定律引导优化,在Qwen3-1.7B模型微调中验证,有效提升指标且不增成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22655 2026-07-28 cs.AI 新提交

EventOD: Event-Aware OD Flow Generation via LLM-Guided Semantic Modulation

EventOD:通过大语言模型引导的语义调制实现事件感知的OD流生成

Jie Zhao, Jie Feng, Can Rong, Zhihan Hou, Peng Lu, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Zhongguancun Academy(中关村科学城研究院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工学院科研与技术联盟) Xiuzhong College, Tsinghua University(清华大学致理书院) Department of Automation, Central South University(中南大学自动化学院)

AI总结 研究在破坏性事件下估计OD流的问题,提出EventOD框架,利用大语言模型和轻量级适应模块,通过输入级调制实现事件感知适应,实验表明该方法能提高重建精度和分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22571 2026-07-28 cs.AI 新提交

SCAIR: Schema-Conditioned Agentic Iterative Reasoning for Enterprise Knowledge Graphs

SCAIR:用于企业知识图谱的模式条件代理迭代推理

Prateek Chaturvedi, Yuqicheng Zhu, Hongkuan Zhou, Dongzhuoran Zhou, Yunjie He, Steffen Staab, Fei Du, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学) University of Southampton(南安普顿大学) BSH Home Applications Holding (China) Co., Ltd(博西华家用电器有限公司(中国)) Tsinghua University(清华大学)

AI总结 针对现有方法在企业知识图谱应用的局限,提出SCAIR无训练框架,集成结构化规划与受控迭代推理,通过模式条件结构先验等提升性能,强调企业图推理要结合领域约束,与业务逻辑对齐可增效。

Comments Accepted at ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20033 2026-07-28 cs.RO 版本更新

Robots Acquire Manipulation Skills in Seconds from a Single Human Video

机器人从单个人类视频中在数秒内获取操作技能

Guangyan Chen, Meiling Wang, Te Cui, Zichen Zhou, Qi Shao, Shalfun Li, Hang Su, Roy Gan, Hao Wang, Mengyin Fu, Yi Yang, Yufeng Yue

机构 * Beijing Institute of Technology(北京理工大学) X SQUARE ROBOT(X方块机器人) Tsinghua University(清华大学)

AI总结 研究提出HOST框架,通过自定位预测,使机器人能从单个人类视频数秒内获取操作技能,保留先前技能,相比零样本基线及任务50次机器人示范微调的基线,在示范次数和获取速度上优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16692 2026-07-28 cs.SE cs.CL 版本更新

Dependency-Guided Code Generation: Structured Matrix Decomposition and Consistency-Guided Refinement

依赖引导的代码生成:结构化矩阵分解与一致性引导的细化

Mingqiao Mo, Yangchen Zeng, Zikai Xiao, Xin Xiao, Wenhua Nie, Zhaolu Kang, Guangyuan Dong, Kai Shu, Hao Zhang, Xiaodong Fan

机构 * University of the Chinese Academy of Sciences(中国科学院大学) ByteDance Inc.(字节跳动公司) Zhejiang University(浙江大学) National Taiwan University(台湾国立大学) Peking University(北京大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Liaoning Technical University(辽宁技术大学)

AI总结 针对现有代码生成方法无法充分捕捉代码实体依赖关系的问题,提出依赖感知代码生成框架,通过结构化矩阵分解和一致性引导细化生成代码,经实验验证该方法能生成语义对齐和结构保真度更高的代码。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09133 2026-07-28 cs.CV cs.AI 版本更新

IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

IB-Flow:用于少步文本到图像生成的信息瓶颈引导的CFG蒸馏

Yiting Wang, Jingyi Zhang, Wenhu Zhang, Ke Chao, Yves Liang, Kun Cheng, Kang Zhao

机构 * Tsinghua University(清华大学) Wan Team, Alibaba Group(万团队,阿里巴巴集团) HKUST(香港科技大学) Beijing Normal University(北京师范大学)

AI总结 研究针对少步文本到图像生成中推理延迟问题,通过信息论将蒸馏建模为信息瓶颈引导的动态互信息博弈,提出双轨自适应框架,消除过度条件化伪影,在2步配置下实现SOTA生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04498 2026-07-28 cs.CV cs.SD 版本更新

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

UniSkip-Mamba:用于视听时间伪造定位的频率感知状态空间模型

Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

AI总结 针对视听时间伪造定位,通过频域分析发现伪造特征集中在低中频,提出融合多模态序列与新颖扫描机制的UniSkip-Mamba框架,实现性能提升和推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28828 2026-07-28 cs.CV 版本更新

Ground4D: Consistency-Aware 4D Reconstruction from Monocular Video

Ground4D: 从单目视频进行一致性感知的四维重建

Qing Zhao, Weijian Deng, Pengxu Wei, Liang Lin

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

AI总结 提出Ground4D框架,结合3D基础模型进行几何初始化与动态高斯泼溅进行一致性优化,实现从单目视频的高保真4D重建与新视角渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24118 2026-07-28 cs.CV 版本更新

An LMM for Precisely Grounding Elements in Documents

一种用于精确文档元素定位的大型多模态模型

Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Ji Qi, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 提出PreciseDoc,一种通过合成数据与强化学习联合训练实现文档元素精确定位的大型多模态模型,显著提升文档理解与视觉定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22876 2026-07-28 cs.LG 版本更新

WeCon: An Efficient Weight-Conditioned Neural Solver for Multi-Objective Combinatorial Optimization Problems

WeCon: 一种高效的权重条件神经求解器用于多目标组合优化问题

Xuan Wu, Jinbiao Chen, Yang Li, Lijie Wen, Chunguo Wu, Yuanshu Li, Yubin Xiao, Chunyan Miao, You Zhou, Di Wang

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) College of Software, Jilin University(吉林大学软件学院) School of Software, Tsinghua University(清华大学软件学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院 computing and information systems 系)

AI总结 提出一种权重条件神经求解器WeCon,通过编码器中的门控残差融合和解码器中的残差融合模块增强权重-特征交互,并采用高效偏好优化构建高质量解对,在多个多目标组合优化问题上达到与最先进方法相当的HV值并减少40%推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16008 2026-07-28 cs.LG 版本更新

Corner Reflector Array Jamming Discrimination Using Multi-Dimensional Micro-Motion Features with Frequency Agile Radar

利用多维微运动特征的频率敏捷雷达角反射阵干扰鉴别

Jie Yuan, Lei Wang, Yanhao Wang, Yimin Liu

机构 * Department of Electronic Engineering, Tsinghua University Beijing, China(电子工程系,清华大学北京,中国)

AI总结 本文提出一种鲁棒的鉴别方法,通过多维微运动特征区分真实船舶目标与非刚性诱饵,结合手工特征与深度学习特征提升识别性能。

Comments Submition at the 2026 CIE International Conference on Radar

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14896 2026-07-28 cs.CL 版本更新

Language-Coupled Reinforcement Learning for Multilingual Retrieval-Augmented Generation

多语言耦合强化学习用于多语言检索增强生成

Rui Qi, Fengran Mo, Yufeng Chen, Xue Zhang, Shuo Wang, Hongliang Li, Jinan Xu, Jian-Yun Nie, Kaiyu Huang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) University of Montreal(蒙特利尔大学) Tsinghua University(清华大学) University of Notre Dame(Notre Dame 大学)

AI总结 本文提出LcRL框架,通过语言耦合组相对策略优化减少知识偏差和冲突,提升多语言检索增强生成的性能,适用于受限训练数据和多语言大规模集合的场景。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07539 2026-07-28 q-bio.NC cs.CL

Training-Driven Representational Geometry Modularization Predicts Brain Alignment in Language Models

训练驱动的表征几何模块化预测语言模型中的脑对齐

Yixuan Liu, Zhiyuan Ma, Likai Tang, Runmin Gan, Xinche Zhang, Jinhao Li, Chao Xie, Sen Song

机构 * School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) Tsinghua Laboratory of Brain and Intelligence, Tsinghua University, Beijing, China(脑与智能实验室,清华大学,北京,中国) School of Basic Medical Sciences, Tsinghua University, Beijing, China(基础医学学院,清华大学,北京,中国) Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国)

AI总结 本研究通过训练驱动的表征几何模块化,发现语言模型中的低复杂度模块能更准确预测人类大脑语言网络活动,揭示了表征平滑对神经样语言处理的作用。

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 48 (2026), 167-174

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04266 2026-07-28 eess.SP cs.LG 版本更新

Aortic Valve Disease Screening from PPG via Physiology-Guided Self-Supervised Learning

通过生理引导的自监督学习检测PPG中的主动脉瓣疾病

Jiaze Wang, Qinghao Zhao, Zizheng Chen, Zhejun Sun, Deyun Zhang, Yuxi Zhou, Shenda Hong

机构 * Department of Computer Science, Tianjin University of Technology(天津理工大学计算机科学系) National Institute of Health Data Science, Peking University(北京大学国家健康数据科学研究院) Department of Cardiology, Peking University People’s Hospital(北京大学人民医院心内科) HeartVoice Medical Technology(心声医疗科技) DCST, BNRist, RIIT, Institute of Internet Industry, Tsinghua University(清华大学计算机科学与技术系、北京人工智能研究所、互联网产业研究所) Institute of Medical Technology, Peking University Health Science Center(北京大学健康科学中心医学技术研究所) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究所) State Key Laboratory of Vascular Homeostasis and Remodeling, NHC Key Laboratory of Cardiovascular Molecular Biology and Regulatory Peptides, Peking University(北京大学血管稳态与重塑国家重点实验室、国家心血管分子生物学与调节肽重点实验室)

AI总结 本文提出基于生理引导的自监督学习方法,利用大量未标记PPG数据高效筛查主动脉狭窄和反流,实现优于传统监督学习的检测性能。

Comments 33 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01856 2026-07-28 cs.CV 版本更新

GCR: Geometry-Consistent Routing for Task-Agnostic Continual Anomaly Detection

GCR:面向任务无关持续异常检测的几何一致性路由

Joongwon Chae, Lihui Luo, Yang Liu, Runming Wang, Dongmei Yu, Zeming Liang, Xi Yuan, Dayan Zhang, Zhenglin Chen, Peiwu Qin, Ilmoon Chae

机构 * Tsinghua University Shenzhen International Graduate School(清华大学深圳国际研究生院) Ratel Soft Affiliated Fifth Hospital, Wenzhou Medical University(温州医学院附属第五医院) Chinese Medicine Guangdong Laboratory(广东中医药实验室)

AI总结 GCR通过几何一致性路由提升持续异常检测的稳定性,减少遗忘并保持检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01031 2026-07-28 cs.RO cs.AI cs.LG 版本更新

VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference

VLASH: 通过未来状态感知的异步推断实现实时VLAs

Jiaming Tang, Yufei Sun, Yilong Zhao, Shang Yang, Yujun Lin, Zhuoyang Zhang, James Hou, Yao Lu, Zhijian Liu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) UCSD(加州大学圣地亚哥分校) Caltech(加州理工学院)

AI总结 VLASH通过未来状态感知的异步推断框架,实现高效、准确的实时VLAs控制,显著提升反应速度和任务执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16909 2026-07-28 cs.CV cs.RO 版本更新

SLAM-Former: Putting SLAM into One Transformer

SLAM-Former:将同步定位与地图构建集成于一个Transformer

Yijun Yuan, Zhuoguang Chen, Kenan Li, Weibang Wang, Minghui Qin, Zhijian Fang, Weicheng Zheng, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能系统研究所)

AI总结 研究将SLAM功能集成于单个Transformer的方法,核心是SLAM-Former由协同的前后端组成,前端实时处理单目图像用于增量映射和跟踪,后端全局优化,实验证明该方法相比现有密集SLAM方法性能优越。

Comments Published on ECCV 2026, Project Page:https://tsinghua-mars-lab.github.io/SLAM-Former

详情

展开后加载摘要…

URL PDF HTML 收藏