arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-04-22 至 2026-04-22 共收录 19
2604.19734 2026-04-22 cs.RO cs.AI

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言

Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。

Comments Project page: https://xpeng-robotics.github.io/unit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19636 2026-04-22 cs.CV

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation

CoInteract:通过空间结构化共生成实现物理一致的人-物体交互视频合成

Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

AI总结 CoInteract通过空间结构化共生成方法,在人-物体交互视频合成中提升结构稳定性与物理合理性,采用扩散变换器框架结合人类感知混合专家和双流训练策略,实现更真实的交互效果。

Comments The project page: https://xinxiaozhe12345.github.io/CoInteract_Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19392 2026-04-22 cs.CV

HarmoniDiff-RS: Training-Free Diffusion Harmonization for Satellite Image Composition

HarmoniDiff-RS:无训练扩散谐调用于卫星图像合成

Xiaoqi Zhuang, Jefersson A. Dos Santos, Jungong Han

机构 * The University of Sheffield(谢菲尔德大学) Tsinghua University(清华大学)

AI总结 本文提出HarmoniDiff-RS,一种无训练的扩散框架,用于在不同领域条件下谐调合成卫星图像。通过潜在均值偏移操作对齐源域和目标域,结合时间步的潜在融合策略生成候选合成图像,并利用轻量级和谐分类器选择最一致的结果。

Comments 8 pages, 6 figures, CVPR 2026 findings. Code is available at https://github.com/XiaoqiZhuang/HarmoniDiff-RS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17390 2026-04-22 cs.CV cs.AI cs.GR

MESA: A Training-Free Multi-Exemplar Deep Framework for Restoring Ancient Inscription Textures

MESA:一种无需训练的多示例深度框架,用于恢复古代铭文纹理

Vasileios Toulatzis, Sofia Theodoridou, Ioannis Fudos

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Ioannina(伊奥安纳大学) Inria Paris-Rocquencourt(巴黎-罗克琴堡研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

AI总结 MESA通过多示例和风格感知方法,利用保存良好的铭文示例指导损坏文本的重建,通过编码VGG19卷积特征为Gram矩阵捕捉纹理和笔画结构,并结合OCR估计的字符宽度优化滤波器尺度,实现高效修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02384 2026-04-22 cs.CV

SMART-Ship: A Comprehensive Synchronized Multi-modal Aligned Remote Sensing Targets Dataset and Benchmark for Berthed Ships Analysis

SMART-Ship:一个综合的同步多模对齐遥感目标数据集和基准,用于靠泊船舶分析

Chen-Chen Fan, Peiyao Guo, Linping Zhang, Kehan Qi, Haolin Huang, Yong-Qiang Mao, Yuxi Suo, Zhizhuo Jiang, Yu Liu, You He

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

AI总结 本文提出SMART-Ship数据集,包含多模遥感图像,用于靠泊船舶分析,通过精细标注支持多模遥感任务,并评估了代表性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19135 2026-04-22 cs.CV

Diff-SBSR: Learning Multimodal Feature-Enhanced Diffusion Models for Zero-Shot Sketch-Based 3D Shape Retrieval

Diff-SBSR: 学习多模态特征增强的扩散模型用于零样本素描基础3D形状检索

Hang Cheng, Fanhe Dong, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出利用文本到图像扩散模型解决零样本素描基础3D形状检索问题,通过多模态特征增强策略提升语义上下文捕捉能力,实验表明方法在公开基准上优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19071 2026-04-22 cs.CL

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

HoWToBench: LLM在人类水平写作能力的综合评估方法:写作树

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出Tree-of-Writing方法,通过树状流程结构评估LLM写作能力,构建包含12类文体和1302条指令的中文写作基准,实现与人类判断的高相关性。

Comments 49 pages, 6 figures, 19 tables, ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18791 2026-04-22 cs.LG cs.AI

HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation

HELM:增强型长时程记忆用于视觉-语言-动作操控

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学)

AI总结 HELM通过解决记忆、验证和恢复三大缺陷,提升长时程视觉-语言-动作任务性能,其核心贡献是学习的State Verifier在任务成功率上显著优于传统方法。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18616 2026-04-22 cs.DC cs.AI cs.PL

ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants

ARGUS:通过数据流不变量指导的代理GPU优化

Haohui Mai, Xiaoyan Guo, Xiangyun Ding, Daifeng Li, Qiuchu Yu, Chenzhun Guo, Cong Wang, Jiacheng Zhao, Christos Kozyrakis, Binhang Yuan

机构 * CausalFlow Inc.(CausalFlow公司) HKUST(香港科技大学) Tsinghua University(清华大学) Stanford University(斯坦福大学) UCAS UC Riverside(UC河滨分校)

AI总结 ARGUS通过数据流不变量指导代理生成高效GPU内核,解决传统代理在关键计算任务中的性能不足问题,实现接近人工优化的性能和广泛的任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18509 2026-04-22 cs.CL

MASS-RAG: Multi-Agent Synthesis Retrieval-Augmented Generation

MASS-RAG:多代理合成检索增强生成

Xingchen Xiao, Heyan Huang, Runheng Liu, Jincheng Xie

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系)

AI总结 MASS-RAG通过多代理结构处理证据,提升检索增强生成在噪声、不完整或异质证据下的表现,实验显示其在相关证据分散于检索结果时性能更优。

Comments ACL 2026 Findings, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17736 2026-04-22 cs.CV

IncreFA: Breaking the Static Wall of Generative Model Attribution

IncreFA: 破解生成模型归因的静态壁垒

Haotian Qin, Dongliang Chang, Yueying Gao, Yuexuan Tan, Lei Chen, Zhanyu Ma

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Tsinghua University(清华大学)

AI总结 IncreFA将归因重新定义为结构化增量学习问题,通过层级约束和潜在记忆库机制,在28个生成模型上实现最先进的归因准确率和未见检测率。

Comments Accepted to CVPR 2026, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21298 2026-04-22 cs.CL cs.AI

More Than Sum of Its Parts: Deciphering Intent Shifts in Multimodal Hate Speech Detection

不止是部分之和:解码多模态仇恨言论检测中的意图转变

Runze Sun, Yu Zheng, Zexuan Xiong, Zhongjin Qu, Lei Chen, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出H-VLI基准和ARCADE框架,通过模拟法庭辩论解码多模态仇恨言论中的隐含意图转变,提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01455 2026-04-22 cs.CV cs.AI cs.CL cs.IR cs.MM

From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents

从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体

Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。

Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20182 2026-04-22 cs.CL cs.AI

FaithLens: Detecting and Explaining Faithfulness Hallucination

FaithLens:检测并解释忠实性幻觉

Shuzheng Si, Qingyi Wang, Haozhe Zhao, Yuzhuo Bai, Guanqiao Chen, Kangyang Luo, Gang Chen, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun

机构 * Tsinghua University(清华大学) DeepLang AI Fudan University(复旦大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Peking University(北京大学)

AI总结 本文提出FaithLens模型,通过合成训练数据和规则强化学习,有效检测并解释大语言模型中的忠实性幻觉,优于GPT-5.2和o3模型,提升可信度与效率。

Comments ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10074 2026-04-22 cs.AI

StepFly: Agentic Troubleshooting Guide Automation for Incident Diagnosis

StepFly: 用于事件诊断的代理自动化故障排查指南

Jiayi Mao, Liqun Li, Yanjie Gao, Zegang Peng, Shilin He, Chaoyun Zhang, Si Qin, Samia Khalid, Qingwei Lin, Saravan Rajmohan, Sitaram Lanka, Dongmei Zhang

机构 * Tsinghua University(清华大学) Microsoft(微软) Microsoft Research(微软研究院) Renmin University of China(中国人民大学)

AI总结 StepFly通过三阶段框架实现故障排查指南自动化,提升TSG质量并支持并行执行,实测在GPT-4.1上达到94%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08145 2026-04-22 cs.CL

Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling

通过基于群体的轮询缓解大语言模型中的判断偏好偏差

Shuliang Liu, Zhipeng Xu, Zhenghao Liu, Yukun Yan, Minghe Yu, Yu Gu, Chong Chen, Huiyuan Xie, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,中国北京) Software College, Northeastern University, Shenyang, China(东北大学软件学院,中国沈阳) Huawei, China(华为,中国)

AI总结 本文提出Genii框架,通过多智能体协作优化缓解LLM判断偏好偏差,无需人工标注数据,提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05608 2026-04-22 cs.CL

A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Tasks

没有计划的愿望只是愿望:为长周期智能体任务高效且有效的全局规划器训练

Shuzheng Si, Haozhe Zhao, Kangyang Luo, Gang Chen, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun

机构 * Tsinghua University(清华大学) Peking University(北京大学) DeepLang AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出EAGLET方法,通过两步流程训练高效规划器,提升智能体规划能力,实验显示其在长周期任务中优于现有方法,且训练成本降低8倍。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12052 2026-04-22 cs.CV

FluentAvatar: Flicker-Free Talking-Head Animation via Phoneme-Guided Autoregressive Modeling

FluentAvatar: 通过音素引导的自回归建模实现无闪烁的说话头动画

Yuchen Deng, Xiuyang Wu, Hai-Tao Zheng, Suiyang Zhang, Yi He, Yuxing Han

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出FluentAvatar,通过音素引导的自回归模型解决现有扩散模型中帧间闪烁问题,实现了高质量的说话头动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21526 2026-04-22 cs.CL

Accelerating Prefilling via Decoding-time Contribution Sparsity

通过解码时贡献稀疏性加速预填

Zhiyuan He, Yike Zhang, Chengruidong Zhang, Huiqiang Jiang, Yuqing Yang, Lili Qiu

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

AI总结 本文提出TriangleMix方法,利用解码时贡献稀疏性减少注意力计算开销,实现显著加速,同时与动态稀疏方法结合进一步提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏