arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-04-10 至 2026-04-10 共收录 23
2604.08370 2026-04-10 cs.CV

SurfelSplat: Learning Efficient and Generalizable Gaussian Surfel Representations for Sparse-View Surface Reconstruction

SurfelSplat: 学习高效且可泛化的高斯Surfel表示以进行稀疏视图表面重建

Chensheng Dai, Shengjun Zhang, Min Chen, Yueqi Duan

机构 * Tsinghua University(清华大学)

AI总结 本文提出SurfelSplat框架,通过稀疏视图图像生成高效且可泛化的高斯Surfel表示,利用Nyquist采样定理解决传统方法在几何属性恢复中的不足,实验表明其在DTU基准上表现优异且速度提升显著。

Comments Code is available at https://github.com/Simon-Dcs/Surfel_Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08333 2026-04-10 cs.CV cs.AI cs.LG

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

迷失在喧嚣中:揭示并剖析医学多模态大语言模型在图像分类中的性能退化

Xun Zhu, Fanbin Mo, Xi Chen, Kaili Zheng, Shaoshuai Yang, Yiming Shi, Jian Gao, Miao Li, Ji Wu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 本文研究了医学多模态大语言模型在图像分类中的性能退化问题,通过实验和特征探查揭示了四个失败模式,并提出了量化评分用于评估特征演变的健康状况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08301 2026-04-10 cs.CV

GroundingAnomaly: Spatially-Grounded Diffusion for Few-Shot Anomaly Synthesis

GroundingAnomaly: 基于空间的扩散用于少样本异常合成

Yishen Liu, Hongcang Chen, Pengcheng Zhao, Yunfan Bao, Yuxi Tian, Jieming Zhang, Hao Chen, Zheng Zhi, Yongchun Liu, Ying Li, Dongpu Cao

机构 * Beijing Institute of Technology(北京理工大学) Beijing Jiaotong University(北京交通大学) Li Auto(理想汽车) Tsinghua University(清华大学)

AI总结 本文提出GroundingAnomaly框架,通过空间条件模块和门控自注意力模块实现精准异常合成,提升少样本异常检测性能。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08258 2026-04-10 cs.RO

EvoGymCM: Harnessing Continuous Material Stiffness for Soft Robot Co-Design

EvoGymCM:利用连续材料刚度进行软机器人协同设计

Le Shen, Kangyao Huang, Wentao Zhao, Huaping Liu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出EvoGymCM平台,通过将连续材料刚度作为第一类设计变量,解决传统平台对材料维度的离散化限制,提升软机器人性能与协同效应。

Comments 8 pages, 11 figures. Preprint. Under review at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08203 2026-04-10 cs.CV cs.AI

MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning

MedVR:通过代理强化学习实现无标注的医学视觉推理

Zheng Jiang, Heng Guo, Chengyu Fang, Changchen Xiao, Xinyang Hu, Lifeng Sun, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室) Zhejiang University(浙江大学)

AI总结 MedVR通过代理强化学习实现无标注的医学视觉推理,利用熵引导的视觉重定位和基于共识的信用分配机制,在多个公开医学VQA基准上取得最佳性能,提升医疗AI的鲁棒性和透明度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23727 2026-04-10 cs.SD cs.AI

AudioMoG: Guiding Audio Generation with Mixture-of-Guidance

AudioMoG:通过混合指导引导音频生成

Junyou Wang, Zehua Chen, Binjie Yuan, Kaiwen Zheng, Chang Li, Yuxuan Jiang, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu AI(生数科技) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出AudioMoG,一种改进的采样方法,在无需大量训练资源的情况下提升文本到音频和视频到音频生成质量,同时在多样性保持和生成质量上优于单一指导方法。

Comments Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13551 2026-04-10 cs.CL cs.AI

Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models

面向增强大语言模型推理能力的分层多步奖励模型

Teng Wang, Zhangyi Jiang, Zhenqi He, Shenyang Tong, Wenhan Yang, Yanan Zheng, Zeyu Li, Zifan He, Hailei Gong, Zewen Ye, Shengjie Ma, Jianping Zhang

机构 * the University of Hong Kong(香港大学) Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) the Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出分层奖励模型和轻量数据增强策略,解决大语言模型推理中奖励黑客问题,提升多步推理评估的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07973 2026-04-10 cs.AI

How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace

大型多模态模型距离人类水平的空间行动还有多远?一个面向城市空域目标导向的具身导航基准测试

Baining Zhao, Ziyou Wang, Jianjie Fang, Zile Zhou, Yanggang Xu, Yatai Ji, Jiacheng Xu, Qian Zhang, Weichen Zhang, Chen Gao, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northeastern University(东北大学) National University of Defense Technology(国防科技大学) Shandong University(山东大学) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

AI总结 本文通过构建包含5037个高质量目标导向导航样本的数据集,评估17种代表性模型在城市3D空间中具身空间行动的能力,发现尽管LMMs展现出新兴行动能力,但仍远未达到人类水平,并揭示导航误差在关键决策分歧后迅速发散的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07957 2026-04-10 cs.AI cs.CV cs.RO

WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models

WorldMAP: 通过生成世界模型提升视觉-语言导航轨迹预测

Hongjin Chen, Shangyun Jiang, Tonghua Su, Chen Gao, Xinlei Chen, Yong Li, Zhibo Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院)

AI总结 WorldMAP通过生成世界模型与教师-学生框架,将生成的未来场景转化为语义空间结构和规划监督,提升导航轨迹预测的稳定性与准确性,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07882 2026-04-10 cs.CV

ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video

ReconPhys:从单个视频中重建外观和物理属性

Boyuan Wang, Xiaofeng Wang, Yongkang Li, Zheng Zhu, Yifan Chang, Angen Ye, Guosheng Zhao, Chaojun Ni, Guan Huang, Yijie Ren, Yueqi Duan, Xingang Wang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学)

AI总结 本文提出ReconPhys,首个能从单目视频联合学习物理属性估计和3D高斯点云重建的端到端框架,实现快速高效的目标检测与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07879 2026-04-10 cs.CV cs.AI

FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding

FlowGuard: 通过线性潜在解码实现扩散模型生成过程中的轻量级安全检测

Jinghan Yang, Yihe Fan, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

AI总结 FlowGuard通过线性近似和课程学习方法,在生成过程中检测不安全内容,提升扩散模型的安全性和效率,F1分数优于现有方法30%以上,同时显著降低GPU内存占用和投影时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07775 2026-04-10 cs.AI cs.CL cs.CR

ACIArena: Toward Unified Evaluation for Agent Cascading Injection

ACIArena:迈向多智能体系统统一评估

Hengyu An, Minxi Li, Jinghuai Zhang, Naen Xu, Chunyi Zhou, Changjiang Li, Xiaogang Xu, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学网络架构国家重点实验室) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

AI总结 本文提出ACIArena框架,用于评估多智能体系统(MAS)的鲁棒性,通过多攻击面和目标的系统化测试,揭示单纯依赖拓扑结构评估不足,强调需通过角色设计和受控交互提升系统安全性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07712 2026-04-10 cs.LG

CausalVAE as a Plug-in for World Models: Towards Reliable Counterfactual Dynamics

CausalVAE作为世界模型的插件:迈向可靠的反事实动力学

Ziyi Ding, Xianxin Lai, Weiyu Chen, Xiao-Ping Zhang, Jiayu Chen

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) INFIFORCE Intelligent Technology(INFIFORCE智能科技)

AI总结 本文提出CausalVAE作为潜在世界模型的插件模块,通过增强事实预测和反事实检索,提升模型在分布偏移和干预下的鲁棒性,尤其在物理基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07146 2026-04-10 cs.CV

Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering

学习搜索:一种基于决策的知识增强视觉问答代理

Zhuohong Chen, Zhenxian Wu, Yunyao Yu, Hangrui Xu, Zirui Liao, Zhifang Liu, Xiangwen Deng, Pen Jiao, Haoqian Wang

机构 * Tsinghua University(清华大学) University of Arizona(亚利桑那大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出基于决策的KB-VQA代理,通过多步骤决策过程解决视觉问答问题,改进检索与推理整合,提升对稀有实体和长尾事实的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18472 2026-04-10 cs.AI cs.CV

Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding

多模态大语言模型在离散符号理解中的认知不匹配

Yinghui Li, Jiayi Kuang, Peng Xing, Daixian Liu, Yongheng Zhang, Junnan Dong, Shu-Yu Guo, Yangning Li, Qingyu Zhou, Wenhao Jiang, Hai-Tao Zheng, Ying Shen, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Independent Researcher(独立研究员) The Hong Kong Polytechnic University(香港理工大学) Guangdong Laboratory of AI and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究发现多模态大语言模型在离散符号识别上表现欠佳,而在复杂推理任务上表现较好,揭示了当前系统依赖语言先验而非稳健视觉基础的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04791 2026-04-10 cs.AI

Timer-S1: A Billion-Scale Time Series Foundation Model with Serial Scaling

Timer-S1: 一种十亿级时间序列基础模型与串行扩展

Yong Liu, Xingjian Su, Shiyu Wang, Haoran Zhang, Haixuan Liu, Yuxuan Wang, Zhou Ye, Yang Xiang, Jianmin Wang, Mingsheng Long

机构 * Tsinghua University(清华大学)

AI总结 Timer-S1通过三维串行扩展提升时间序列预测能力,采用稀疏TimeMoE块和通用TimeSTP块,实现长周期预测并减少误差积累,基于TimeBench数据集取得最佳MASE和CRPS分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13235 2026-04-10 cs.AI cs.CV

Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains

Lang2Act: 通过自涌现语言工具链实现细粒度视觉推理

Yuqi Xiong, Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Alibaba Group, Hangzhou, China(阿里巴巴集团)

AI总结 Lang2Act通过自涌现语言工具链提升视觉感知与推理能力,采用强化学习框架优化VLMs的视觉感知和下游任务性能,实验显示其在视觉感知能力上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12710 2026-04-10 cs.RO

Reflection-Based Task Adaptation for Self-Improving VLA

基于反射的任务适应用于自我改进的VLA

Baicheng Li, Dong Wu, Zike Yan, Xinchen Liu, Lusong Li, Zecui Zeng, Hongbin Zha

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) JD Explore Academy(京东探索研究院) AIR, Tsinghua University(清华大学智能产业研究院)

AI总结 本文提出反射式自我适应框架,通过双路径架构实现快速自主任务适应,结合失败驱动的强化学习与成功驱动的质量引导微调,提升机器人在复杂任务中的适应效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07809 2026-04-10 cs.CR cs.AI

Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents

对人类不可见,由智能体触发:针对移动视觉-语言智能体的隐秘劫持攻击

Renhua Ding, Xiao Yang, Zhengwei Fang, Jun Luo, Kun He, Jun Zhu

机构 * School of Computer Science, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、清华-博世机器学习联合中心、清华脑与智能实验室、北京国家信息科学与技术研究中心)

AI总结 本文提出了一种隐秘的劫持攻击方法,通过智能体交互时的感知注入,避免被人类察觉,同时在移动设备上有效绕过安全过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13993 2026-04-10 cs.CL cs.AI

Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization

片段作为手臂:多臂老虎机引导的长上下文LLM偏好优化采样

Shaohua Duan, Pengcheng Huang, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Microsoft Research Asia, China(微软亚洲研究院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系及人工智能研究院)

AI总结 本文提出LongMab框架,利用多臂老虎机策略从长上下文中选择最有信息量的片段,生成高质量多样化的响应,用于直接偏好优化训练,提升长上下文推理能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17209 2026-04-10 cs.RO cs.AI

LiloDriver: A Lifelong Learning Framework for Closed-loop Motion Planning in Long-tail Autonomous Driving Scenarios

LiloDriver:一种面向长尾自动驾驶场景闭环运动规划的终身学习框架

Huaiyuan Yao, Pengfei Li, Bu Jin, Yupeng Zheng, An Liu, Lisen Mu, Qing Su, Qian Zhang, Yilun Chen, Peng Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Horizon Robotics(地平线机器人)

AI总结 LiloDriver通过结合大语言模型与记忆增强的规划生成系统,实现了在长尾自动驾驶场景中闭环运动规划的持续适应,优于传统规则和学习方法。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13015 2026-04-10 cs.CV

Hierarchical Feature Learning for Medical Point Clouds via State Space Model

通过状态空间模型进行医疗点云的分层特征学习

Guoqing Zhang, Jingyun Yang, Yang Li

机构 * Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院深圳市普适数据赋能重点实验室) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出基于状态空间模型的分层特征学习框架,用于医疗点云理解,通过多级下采样和KNN查询聚合多尺度结构信息,并引入坐标顺序和内向外扫描策略提升处理效率,最终在MedPointS数据集上验证了方法的优越性。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09369 2026-04-10 eess.IV cs.CV

Flemme: A Flexible and Modular Learning Platform for Medical Images

Flemme:一种灵活且模块化的医学图像学习平台

Guoqing Zhang, Jingyun Yang, Yang Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出Flemme平台,通过分离编码器与模型架构,支持多种编码器和架构组合,提升医学图像处理的灵活性和效率,实验表明其在分割和重建任务中均取得显著性能提升。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏