arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-04-13 至 2026-04-13 共收录 17
2604.09511 2026-04-13 cs.CV

RIRF: Reasoning Image Restoration Framework

RIRF:图像修复推理框架

Wending Yan, Rongkai Zhang, Kaihua Tang, Yu Cheng, Qiankun Liu

机构 * Southwest Jiaotong University(西南交通大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 本文提出RIRF框架,通过整合结构化推理流程提升图像修复的可解释性与修复质量,结合推理与修复任务实现统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09473 2026-04-13 cs.CV

Realizing Immersive Volumetric Video: A Multimodal Framework for 6-DoF VR Engagement

实现沉浸式体积分量视频:一种多模态框架用于6自由度VR互动

Zhengxian Yang, Shengqi Wang, Shi Pan, Hongshuai Li, Haoxiang Wang, Lin Li, Guanjun Li, Zhengqi Wen, Borong Lin, Jianhua Tao, Tao Yu

机构 * Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Migu Beijing Research Institute(咪咕北京研究院) School of Architecture, Tsinghua University(清华大学建筑学院) Department of Automation, Tsinghua University(清华大学自动化系) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

AI总结 本文提出了一种多模态框架,用于构建沉浸式体积分量视频,通过多视角多模态数据集和动态光场重建框架,实现高分辨率、高帧率的动态内容,支持6自由度VR交互。

Comments Journal extension of CVPR 2025. See also arXiv:2503.14359 . Project page and code: https://github.com/Metaverse-AI-Lab-THU/ImViD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09309 2026-04-13 stat.ML cs.LG stat.CO

Iterative Identification Closure: Amplifying Causal Identifiability in Linear SEMs

迭代识别闭合:在线性SEM中放大因果可识别性

Ziyi Ding, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出迭代识别闭合框架,通过迭代反馈机制提升线性SEM中因果效应系数的可识别性,有效解决传统HTC方法无法处理的' inconclusive'因果效应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09285 2026-04-13 cs.AI

SAGE: A Service Agent Graph-guided Evaluation Benchmark

SAGE:基于服务代理图的评估基准

Ling Shi, Yuqin Dai, Ziyin Wang, Ning Gao, Wei Zhang, Chaozheng Wang, Yujie Wang, Wei He, Jinpeng Wang, Deiyi Xiong

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Independent Researcher(独立研究员)

AI总结 本文提出SAGE基准,通过动态对话图验证逻辑合规性,解决现有基准无法评估多维度用户行为和SOP的问题,揭示模型在意图分类与后续动作推导间的执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06734 2026-04-13 cs.CL

TEC: A Collection of Human Trial-and-error Trajectories for Problem Solving

TEC:一个问题解决过程中的人类试错轨迹集合

Xinkai Zhang, Jingtao Zhan, Yiqun Liu, Qingyao Ai

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Quancheng Laboratory(泉城实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Institute of Data and Information, Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院数据与信息研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出TEC数据集,通过记录人类在问题解决中的试错轨迹和反思,展示了人类在试错任务中优于LLM的准确性,为理解人类试错行为和开发更强大的AI系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09206 2026-04-13 cs.CV

Long-SCOPE: Fully Sparse Long-Range Cooperative 3D Perception

Long-SCOPE:完全稀疏的长距离协作3D感知

Jiahao Wang, Zikun Xu, Yuner Zhang, Zhongwei Jiang, Chenyang Lu, Shuocheng Yang, Yuxuan Wang, Jiaru Zhong, Chuang Zhang, Shaobing Xu, Jianqiang Wang

机构 * Tsinghua University(清华大学) University of Pennsylvania(宾夕法尼亚大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出Long-SCOPE框架,通过几何引导查询生成模块和上下文感知关联模块,解决远距离协作3D感知中的计算复杂性和特征关联问题,实现高精度低开销的长距离感知。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09167 2026-04-13 cs.CV cs.MA

MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding

MAG-3D:多智能体基础推理用于3D理解

Henry Zheng, Chenyue Fang, Rui Huang, Siyuan Wei, Xiao Liu, Gao Huang

机构 * Tsinghua University(清华大学) Pico, ByteDance(字节跳动Pico)

AI总结 本文提出MAG-3D,一种无需训练的多智能体框架,通过动态协调专家代理实现灵活的3D基础推理,解决复杂场景中的空间和几何关系推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09038 2026-04-13 cs.RO cs.CV cs.LG

Towards Lifelong Aerial Autonomy: Geometric Memory Management for Continual Visual Place Recognition in Dynamic Environments

迈向终身空中自主:面向动态环境的几何记忆管理用于连续视觉地点识别

Xingyu Shao, Zhiqiang Yan, Liangzheng Sun, Mengfan He, Chao Chen, Jinhui Zhang, Chunyu Li, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) College of Instrument Science and Opto-electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) Key Laboratory of Complex System Intelligent Control and Decision Making, Beijing Institute of Technology(北京理工大学复杂系统智能控制与决策重点实验室) School of Aerospace Engineering, Beijing Institute of Technology(北京理工大学宇航学院)

AI总结 本文提出一种异构记忆框架,通过静态卫星锚点和动态经验回放缓冲区,提升动态环境中连续视觉地点识别的鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09023 2026-04-13 cs.CV

CAD 100K: A Comprehensive Multi-Task Dataset for Car Related Visual Anomaly Detection

CAD 100K:一个全面的多任务数据集用于汽车相关视觉异常检测

Jiahua Pang, Ying Li, Dongpu Cao, Jingcai Luo, Yanuo Zheng, Bao Yunfan, Yujie Lei, Rui Yuan, Yuxi Tian, Guojin Yuan, Hongchang Chen, Zhi Zheng, Yongchun Liu

机构 * Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) China Agricultural University(中国农业大学) Beijing Jiaotong University(北京交通大学) The Hong Kong Polytechnic University(香港理工大学) Li Auto(理想汽车)

AI总结 本文提出CAD 100K数据集,用于汽车相关多任务视觉异常检测,包含100万张图像,涵盖7个车辆领域和3个任务,通过合成数据增强实现少样本异常检测,验证了多任务学习在任务交互和知识迁移中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08945 2026-04-13 cs.CV cs.RO

TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches

TouchAnything: 从稀疏机器人触碰引导的3D重建

Langzhe Gu, Hung-Jui Huang, Mohamad Qadri, Michael Kaess, Wenzhen Yuan

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出TouchAnything框架,利用预训练的2D视觉扩散模型作为语义和几何先验,从稀疏触觉测量中实现准确的3D重建,优于现有基线方法,支持开放世界中未见过的物体实例重建。

Comments Project Page: https://grange007.github.io/touchanything

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08926 2026-04-13 cs.LG

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

弥合SFT与RL:面向鲁棒推理的动态策略优化

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)

AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08865 2026-04-13 cs.AI

SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks

SPPO:用于长时间 horizon 推理任务的序列级 PPO

Tianyi Wang, Yixia Li, Long Li, Yibiao Chen, Shaohan Huang, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) INFLY TECH Beijing University of Posts and Telecommunications(北京邮电大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学)

AI总结 本文提出 SPPO,一种结合 PPO 的样本效率与结果稳定性的序列级算法,通过将推理过程转化为序列级上下文老虎机问题,实现低方差优势信号生成,提升推理 LLM 的对齐性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08669 2026-04-13 cond-mat.quant-gas cs.LG quant-ph

An Algorithm for Fast Assembling Large-Scale Defect-Free Atom Arrays

一种快速组装大规模无缺陷原子阵列的算法

Tao Zhang, Xiaodi Li, Hui Zhai, Linghui Chen

机构 * Institute for Advanced Study, Tsinghua University(清华大学高等研究院) Intelligent Quantum Inception Inc.(智能量子启创公司) iFLYTEK Research(科大讯飞研究院)

AI总结 本文提出一种统一框架,通过监督学习和改进的拍卖解码器进行路径规划,结合相位和轮廓感知的加权Gerchberg-Saxton算法,实现快速组装10^4个量子比特的无缺陷原子阵列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05529 2026-04-13 cs.AI

ActivityEditor: Learning to Synthesize Physically Valid Human Mobility

ActivityEditor: 学习合成物理有效的行人移动

Chenjie Yang, Yutian Jiang, Anqi Liang, Wei Qi, Chenyu Wu, Junbo Zhang

机构 * Southwest Jiaotong University(西南交通大学) HKUST (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) JD Technology(京东科技)

AI总结 本文提出ActivityEditor,一种双LLM代理框架,用于零样本跨区域轨迹生成。通过意图生成代理和编辑代理协同工作,结合强化学习和物理约束,实现高保真轨迹生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01400 2026-04-13 cs.CV

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

通过局部和全局上下文优化实现高效视频大语言模型的token缩减

Jinlong Li, Liyuan Jiang, Haonan Zhang, Nicu Sebe

机构 * University of Trento(特伦托大学) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出AOT方法,通过局部-全局最优传输优化视频大语言模型中的token,实现高效的token缩减,保持时间与视觉保真度。

Comments CVPR2026, Project webpage: https://tyroneli.github.io/AOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03107 2026-04-13 cs.CL

The Mask of Civility: Benchmarking Chinese Mock Politeness Comprehension in Large Language Models

礼貌的面具:在大型语言模型中基准测试中文虚伪礼貌理解

Yitong Zhang, Yuhan Xiang, Mingxuan Liu

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文从语用学角度评估大型语言模型在识别中文礼貌、不礼貌和虚伪礼貌现象中的表现差异,构建了结合真实和模拟中文话语的三类数据集,并通过六种代表性模型在四种提示条件下进行测试。

Comments Preprint

Journal ref International Conference in Applied Language Sciences (ALS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14756 2026-04-13 cs.LG cs.AI

Task-Distributionally Robust Data-Free Meta-Learning

任务分布鲁棒数据免费元学习

Zixuan Hu, Yongxian Wei, Li Shen, Zhenyi Wang, Baoyuan Wu, Chun Yuan, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Computer Science and AI Institute, University of Central Florida(中佛罗里达大学计算机科学系与人工智能研究所) School of Data Science, the Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen) and Secure Computing Lab of Big Data, Shenzhen Research Institute of Big Data (SBRID)(香港中文大学(深圳)数据科学学院与深圳市大数据研究院大数据安全计算实验室)

AI总结 本文研究数据免费元学习的鲁棒性,发现任务分布偏移和任务分布污染两种漏洞,并提出可信DFML框架以缓解这些问题。

详情

展开后加载摘要…

URL PDF HTML 收藏