arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-07-28 至 2026-07-28 共收录 12
2607.24591 2026-07-28 cs.CV 新提交

CameraAnything: Refilming Videos with Arbitrary Camera Control

CameraAnything:使用任意相机控制重新拍摄视频

Yixuan Li, Yanhong Zeng, Ka Leong Cheng, Jiayi Zhu, Hanlin Wang, Wen Wang, Yihao Meng, Hao Ouyang, Qiuyu Wang, Yue Yu, ZiDong Wang, Yiyuan Zhang, Yujun Shen, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 CameraAnything是用于相机控制视频编辑的统一框架,采用逐像素普吕克光线注入等方法联合控制相机参数,开发合成管道克服数据稀缺,能在单过程中实现多种视频编辑操作,为视频制作提供实用价值。

Comments Project page: https://yixuanli98.github.io/cameraanything/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24507 2026-07-28 cs.LG cs.AI 新提交

UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective

统一融合:在统一反向速率目标下将自回归语言模型适配到离散扩散

Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院) Wuhan University(武汉大学) MathonAI(未知(暂未找到合适中文翻译))

AI总结 研究旨在将预训练的自回归语言模型适配到均匀噪声扩散。通过建立不同模型间联系并推导转换,提出UNIFUSION方法。经实验评估,该方法能改善生成困惑度与单字熵权衡,在相同规模模型中多项指标表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24280 2026-07-28 cs.AI 新提交

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

从专有模型到开源模型:通过智能体搜索中的多智能体协议蒸馏弥合分布差距

Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu, Kailin Jiang, Jinyang Wu, Bohan Yu, Chenxi Zhou

机构 * Beijing Institute of Technology(北京理工大学) East China Normal University(华东师范大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究旨在弥合专有与开源模型分布差距,提出多智能体协议蒸馏(MAPD)框架,利用结构化协议作中间表示,结合蒸馏与强化学习,在问答基准测试中表现出色,有效减轻学生策略问题,优于其他竞争方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24135 2026-07-28 cs.CV 新提交

LoTA-N2N: Local Trace Adaptation for Zero-Shot Self-Supervised Image Denoising

LoTA-N2N:用于零样本自监督图像去噪的局部迹线自适应

Jintong Hu, Bin Xia, Junlin Liu, Jiayue Liu, Wenming Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) University of Southern California(南加州大学) Peking University(北京大学)

AI总结 研究针对单图像自监督去噪问题,提出LoTA-N2N两阶段零样本自适应框架,通过估计局部相互作用和控制空间抵消,在多种噪声下实验效果优于仅基于MSE的方法,为无配对干净目标等情况的自监督去噪提供有效设计原则。

Comments 22pages, 9 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23722 2026-07-28 cs.AI 新提交

E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

E-Bench:在现实世界产品场景中对多步工具使用智能体进行基准测试

Weihuang Zheng, Tianyuan Zou, Eileen Ye, Alphet Liu, Youyong Kong, Ya-Qin Zhang, Duran Zheng, Maxm Pan

机构 * Hunyuan Team, Tencent(腾讯混元团队) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

AI总结 研究针对大语言模型多步工具使用能力,介绍E-Bench基准测试,通过解耦环境与任务合成构建可扩展可控测试平台,对11个前沿模型测试发现多步工具使用仍具挑战,即便结合代码执行可靠性也不高。

Comments 29 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23702 2026-07-28 cs.RO 新提交

Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization

一试即优:用于跨情节探索摊销的去冗余过程记忆

Haizhou Ge, Haochen Ouyang, Zhixing Chen, Yufei Jia, Yue Li, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics(DISCOVER机器人公司) Northeast Agricultural University(东北农业大学)

AI总结 研究如何让机器人避免重复探测隐藏状态物体,提出面向实例的记忆框架IOM,用视觉语言模型实例化,在多任务中减少操纵操作,提升效率且不降低成功率,即使过程错误也能成功。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23684 2026-07-28 cs.RO 新提交

Towards Ultrafast Depth Sensing Via Active Event-based Stereo Vision

通过基于主动事件的立体视觉实现超快速深度感知

Jianing Li, Yunjian Zhang, Haiqian Han, Kangyao Huang, Xiangyang Ji

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Peng Cheng Laboratory(鹏城实验室) Department of Automation, Tsinghua University(清华大学自动化系) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 针对传统主动立体系统在快速运动场景的问题,提出基于主动事件的立体视觉,构建数据集,创新设计ActiveEventNet+网络,性能优于现有方法,降低计算复杂度,能实现高速实时处理,为高速深度感知相机系统设计提供新思路。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23648 2026-07-28 cs.CL 新提交

EmoTrace: An Emotion Trajectory-Centered Framework for Psychological Support Dialogue Generation

EmoTrace:一种以情感轨迹为中心的心理支持对话生成框架

Kaitong Weng, Lixin Liu, Zihao Liu, Bo Wang, Shiguang Ni

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 该研究针对现有心理支持对话数据生成方法的局限,提出EmoTrace框架,通过构建求助者认知概况及相关模块,以模拟其情感轨迹,增强情感表达层次性,实验证明该方法在情感丰富度和共情质量上优于现有方法。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23108 2026-07-28 cs.RO 新提交

The Curse of Precision: A Data Scaling Law for High-Precision Robotic Manipulation

精度的诅咒:高精度机器人操作的数据缩放定律

Cuijie Xu, Yuanfan Xu, Min Xue, Jianjie Lin, Jian Wang, Xudong Zhang, Yu Wang, Jincheng Yu

机构 * Tsinghua University(清华大学) OpenMind (WuHu) Robotics Co., Ltd.(芜湖悟灵机器人有限公司)

AI总结 研究机器人装配等封闭世界任务中数据与精度的关系,提出新缩放定律log(N) ∝ 1/(P - c),揭示极限精度c是系统涌现属性,经实验验证,为精度提供理论框架和评估指标,指导高精度操作系统开发调试。

Comments 8 pages, 4 figures. Accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22769 2026-07-28 cs.LG cs.AI 新提交

DomainPilot: Domain-Level Loss-Guided Two-Stage Data Mixture Optimization for Efficient Language Model Fine-Tuning

DomainPilot:用于高效语言模型微调的域级损失引导两阶段数据混合优化

He Zhang

机构 * Tsinghua University(清华大学)

AI总结 研究针对大语言模型训练数据问题,提出DomainPilot框架,通过域级损失引导两阶段数据混合优化,经令牌级监测、缩放与混合定律引导优化,在Qwen3-1.7B模型微调中验证,有效提升指标且不增成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22655 2026-07-28 cs.AI 新提交

EventOD: Event-Aware OD Flow Generation via LLM-Guided Semantic Modulation

EventOD:通过大语言模型引导的语义调制实现事件感知的OD流生成

Jie Zhao, Jie Feng, Can Rong, Zhihan Hou, Peng Lu, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Zhongguancun Academy(中关村科学城研究院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工学院科研与技术联盟) Xiuzhong College, Tsinghua University(清华大学致理书院) Department of Automation, Central South University(中南大学自动化学院)

AI总结 研究在破坏性事件下估计OD流的问题,提出EventOD框架,利用大语言模型和轻量级适应模块,通过输入级调制实现事件感知适应,实验表明该方法能提高重建精度和分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22571 2026-07-28 cs.AI 新提交

SCAIR: Schema-Conditioned Agentic Iterative Reasoning for Enterprise Knowledge Graphs

SCAIR:用于企业知识图谱的模式条件代理迭代推理

Prateek Chaturvedi, Yuqicheng Zhu, Hongkuan Zhou, Dongzhuoran Zhou, Yunjie He, Steffen Staab, Fei Du, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学) University of Southampton(南安普顿大学) BSH Home Applications Holding (China) Co., Ltd(博西华家用电器有限公司(中国)) Tsinghua University(清华大学)

AI总结 针对现有方法在企业知识图谱应用的局限,提出SCAIR无训练框架,集成结构化规划与受控迭代推理,通过模式条件结构先验等提升性能,强调企业图推理要结合领域约束,与业务逻辑对齐可增效。

Comments Accepted at ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏