arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4556
2510.10223 2026-03-26 cs.CL cs.AI cs.LG

You only need 4 extra tokens: Synergistic Test-time Adaptation for LLMs

你只需要4个额外的标记:用于LLM的协同测试时间适应

Yijie Xu, Huizai Yao, Zhiyu Guo, Pengteng Li, Aiwei Liu, Xuming Hu, Weiyu Guo, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

AI总结 本文提出SyTTA框架,通过输入侧困惑度和输出侧预测熵的协同作用,实现无需标注数据的LLM测试时间适应,显著提升农业问答任务的性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14181 2026-03-26 cs.LG cs.AI

Bridging Past and Future: Distribution-Aware Alignment for Time Series Forecasting

连接过去与未来:面向时间序列预测的分布感知对齐

Yifan Hu, Jie Yang, Tian Zhou, Peiyuan Liu, Yujin Tang, Rong Jin, Liang Sun

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里集团 DAMO 院) University of Illinois Chicago(伊利诺伊大学香槟分校) Dartmouth College(达特茅斯学院)

AI总结 本文提出TimeAlign框架,通过简单重建任务对齐辅助特征,提升时间序列预测性能,理论分析证明重建改善泛化能力,对齐增强表示与预测目标的互信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23497 2026-03-25 cs.CV

WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG

WildWorld: 一个大规模动态世界建模数据集,包含动作和显式状态,面向生成式ARPG

Zhen Li, Zian Meng, Shuwei Shi, Wenshuo Peng, Yuwei Wu, Bo Zheng, Chuanhao Li, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,Shanda AI东京研究院) Beijing Institute of Technology(北京理工大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Tsinghua University(清华大学)

AI总结 本文提出WildWorld数据集,通过AAA动作角色扮演游戏Monster Hunter: Wilds自动收集,包含1.08亿帧视频和450多种动作,包含骨骼、世界状态、相机姿态和深度图标注,用于评估动作跟随和状态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16740 2026-03-25 cs.CV

Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation

面向任务的数据合成与控制-校正采样用于遥感语义分割

Yunkai Yang, Yudong Zhang, Kunquan Zhang, Jinxiao Zhang, Xinying Chen, Haohuan Fu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出TODSynth框架,结合多模态扩散变换器和任务反馈驱动的采样策略,提升遥感语义分割数据合成效果,尤其在少样本和复杂场景中表现优异。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23246 2026-03-25 cs.CV

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染

Zekai Gu, Shuoxuan Feng, Yansong Wang, Hanzhuo Huang, Zhongshuo Du, Chengfeng Zhao, Chengwei Ren, Peng Wang, Yuan Liu

机构 * HKUST(香港科技大学) VAST(中国航空无线电电子研究所) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) ShanghaiTech University(上海交通大学)

AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。

Comments Project page: https://igl-hkust.github.io/GO-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22915 2026-03-25 cs.CV

When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse

当AVSR遇见视频会议:数据集、退化及性能崩溃的隐藏机制

Yihuan Huang, Jun Xue, Liu Jiajun, Daixian Li, Tong Zhang, Zhuolin Yi, Yanzhen Ren, Kai Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education(航空航天信息安全部与可信计算教育部重点实验室) School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全科学与工程学院) Tsinghua University(清华大学)

AI总结 本文系统评估了主流视频会议平台上的最新AVSR模型,发现传输失真和人类超表达导致性能退化,通过构建MLD-VC数据集揭示语音增强算法引起分布偏移,细调模型可降低17.5%的CER。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22874 2026-03-25 cs.CV

Template-Based Feature Aggregation Network for Industrial Anomaly Detection

基于模板的特征聚合网络用于工业异常检测

Wei Luo, Haiming Yao, Wenyong Yu

机构 * State Key Laboratory of Precision Measurement Technology and Instruments(精密测量技术与仪器国家重点实验室) Tsinghua University(清华大学) State Key Laboratory of Digital Manufacturing Equipment and Technology(数字制造装备与技术国家重点实验室) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出TFA-Net,通过模板特征聚合过滤异常特征,提升工业异常检测性能,实现高效率和实时性。

Comments Accepted by Engineering Applications of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22861 2026-03-25 cs.CV

A Feature Shuffling and Restoration Strategy for Universal Unsupervised Anomaly Detection

一种用于通用无监督异常检测的特征洗牌与恢复策略

Wei Luo, Haiming Yao, Zhenfeng Qiang, Xiaotian Zhang, Weihang Zhang

机构 * State Key Laboratory of Precision Measurement Technology and Instruments(精密测量技术与仪器国家重点实验室) Tsinghua University(清华大学) School of Medical Technology(医学技术学院) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出FSR框架,通过多尺度特征洗牌与恢复缓解相同捷径问题,提升模型在不同场景下的通用性和效率。

Comments Accepted by Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22840 2026-03-25 cs.CV cs.AI

URA-Net: Uncertainty-Integrated Anomaly Perception and Restoration Attention Network for Unsupervised Anomaly Detection

URA-Net:一种集成不确定性异常感知与恢复注意力网络用于无监督异常检测

Wei Luo, Peng Xing, Yunkang Cao, Haiming Yao, Weiming Shen, Zechao Li

机构 * State Key Laboratory of Precision Measurement Technology and Instruments, Department of Precision Instrument, Tsinghua University(精密测量技术与仪器国家重点实验室,清华大学精密仪器系) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(智能制造装备与技术国家重点实验室,华中科技大学) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

AI总结 URA-Net通过引入不确定性集成的异常感知模块和恢复注意力机制,有效解决传统方法在异常检测中的过泛化问题,提升检测性能。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22796 2026-03-25 cs.CV cs.AI cs.RO

PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding

PhotoAgent:一种具有空间与审美理解的机器人摄影师

Lirong Che, Zhenfeng Gan, Yanbo Chen, Junbo Tan, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)

AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22728 2026-03-25 cs.SD eess.AS

The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models

2026年国际语音处理大会大型音频语言模型音频编码能力挑战

Heinrich Dinkel, Jiahao Zhou, Guanbo Wang, Yadong Niu, Junbo Zhang, Yufeng Hao, Ying Liu, Ke Li, Wenwu Wang, Zhiyong Wu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., Beijing, China(小米公司,北京) DataoceanAI Inc., USA(DataoceanAI公司,美国) Centre for Vision Speech and Signal Processing, University of Surrey, Guildford, UK(视觉语音与信号处理中心, Surrey大学, Guildford,英国) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国)

AI总结 本文提出Interspeech 2026音频编码能力挑战,旨在评估和提升预训练音频编码器在大型音频语言模型中的性能,通过统一的生成评估框架XARES-LLM,评估编码器在多种下游任务中的表现。

Comments Interspeech 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22701 2026-03-25 cs.CV

TimeWeaver: Age-Consistent Reference-Based Face Restoration with Identity Preservation

TimeWeaver: 基于参考的年龄一致面部修复与身份保持

Teer Song, Yue Zhang, Yu Tian, Ziyang Wang, Xianlin Zhang, Guixuan Zhang, Xuan Liu, Xueming Li, Yasen Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Minzu University of China(民族大学) Xiaomi Corporation(小米公司)

AI总结 TimeWeaver通过分离身份与年龄条件,在训练和推理中实现年龄一致的面部修复,支持跨年龄参考,提升视觉质量与身份保持性。

Comments This is an improved version based on arXiv:2603.18645

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21289 2026-03-25 cs.CV cs.AI

When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning

当模型自我评判:多模态推理的无监督自进化

Zhengxian Wu, Kai Shi, Chuanrui Zhang, Zirui Liao, Jun Yang, Ni Yang, Qiuying Peng, Luyuan Zhang, Hangrui Xu, Tianhuang Su, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出一种无监督自进化框架,通过自一致性信号和动态调节机制,在无需人工标注或外部奖励模型的情况下提升多模态推理性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08174 2026-03-25 cs.CV

MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signals

MERLIN:构建低信噪比鲁棒的多模态大语言模型以电磁信号

Junyu Shen, Zhendong She, Chenghanyu Zhang, Yuchuang Sun, Luqing Luo, Dingwei Tan, Zonghao Guo, Bo Guo, Zehua Han, Wupeng Xie, Yaxin Mu, Peng Zhang, Peipei Li, Fengxiang Wang, Yangang Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所) HKUST (Guangzhou)(香港科技大学(广州)) National University of Defense Technology(国防科技大学) Beihang University(北航) Beijing Information Science and Technology University(北京信息科技大学) Artificial Intelligence Institute of China Electronics Technology Group Corporation(中国电子科技集团人工智能研究院)

AI总结 本文提出MERLIN框架,通过构建EM-100k数据集和EM-Bench基准,解决电磁信号多模态大语言模型在低信噪比环境下的鲁棒性问题,验证了方法在EM-Bench上的领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04951 2026-03-25 cs.AI

Retrieval-Augmented Generation with Covariate Time Series

增强检索生成与协变量时间序列

Kenny Ye Liang, Zhongyi Pei, Huan Zhang, Yuhui Liu, Shaoxu Song, Jianmin Wang

机构 * Tsinghua University(清华大学)

AI总结 本文提出RAG4CTS框架,解决时间序列基础模型在数据稀缺、短暂序列和协变量耦合动态下的预测问题,通过层级时间序列知识库和双阶段加权检索机制提升预测精度。

Comments 12 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01976 2026-03-25 cs.LG cs.AI cs.CV

FlyPrompt: Brain-Inspired Random-Expanded Routing with Temporal-Ensemble Experts for General Continual Learning

FlyPrompt: 基于大脑启发的随机扩展路由与时间-集成专家的通用持续学习

Hongwei Yan, Guanglong Sun, Kanglei Zhou, Qian Li, Liyuan Wang, Yi Zhong

机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University(生命科学学院,IDG/麦克格雷文脑科学研究院,清华大学) Department of Psychological and Cognitive Sciences, Tsinghua University(心理学与认知科学系,清华大学) School of Medicine, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区医学学院)

AI总结 FlyPrompt通过分解通用持续学习为专家路由和专家能力提升两个子问题,提出了一种脑启发框架,利用随机扩展分析路由器和时间集成输出头,提升持续学习性能,实验显示在CIFAR-100、ImageNet-R和CUB-200上分别取得11.23%、12.43%和7.62%的提升。

Comments 34 pages. Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25066 2026-03-25 cs.CV

From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping

从修复到编辑:通过生成性自举解锁鲁棒的无掩膜视觉配音

Xu He, Haoxian Zhang, Hejia Chen, Changyuan Zheng, Liyang Chen, Songlin Tang, Jiehui Huang, Xiaoqiang Liu, Pengfei Wan, Zhiyong Wu

机构 * Tsinghua University(清华大学) Hong Kong University of Science(香港科学大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出X-Dub框架,通过生成性自举实现无掩膜视觉配音,解决传统掩膜修复方法在时空上下文破坏和鲁棒性差的问题,提升唇形同步和视觉质量。

Comments Project Page: https://github.com/KlingAIResearch/X-Dub

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19703 2026-03-25 eess.AS cs.IR cs.LG cs.MM cs.SD

ASK: Adaptive Self-improving Knowledge Framework for Audio Text Retrieval

ASK:适应性自改进知识框架用于音频文本检索

Siyuan Fu, Xuchen Guo, Mingjun Liu, Hongxiang Li, Boyin Tan, Gongxi Zhu, Xianwei Zhuang, Jinghan Ru, Yuxin Xie, Yuguo Yin

机构 * University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 ASK框架通过多粒度知识注入和动态精修策略解决音频文本检索中的梯度局部瓶颈和表示漂移不匹配问题,提升稀有长尾概念学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18933 2026-03-25 cs.CV cs.RO

Point What You Mean: Visually Grounded Instruction Policy

指出你的意图:基于视觉的指令策略

Hang Yu, Juntu Zhao, Yufeng Liu, Kaiyu Li, Cheng Ma, Di Zhang, Yingdong Hu, Guang Chen, Junyuan Xie, Junliang Guo, Junqiao Zhao, Yang Gao

机构 * Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Spirit AI Tsinghua University(清华大学)

AI总结 本文提出Point-VLA,通过结合视觉提示提升物体指称能力,在复杂场景中实现更精准的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22815 2026-03-25 cs.CV

Captain Safari: A World Engine with Pose-Aligned 3D Memory

Captain Safari: 一种具有姿态对齐3D记忆的世界引擎

Yu-Cheng Chou, Xingrui Wang, Yitong Li, Jiahao Wang, Hanting Liu, Cihang Xie, Alan Yuille, Junfei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) UC Santa Cruz(加州大学圣克ruz分校)

AI总结 本文提出Captain Safari,一种基于姿态条件的世界引擎,通过持久化世界记忆生成视频,提升了复杂场景下的3D一致性与轨迹跟踪能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16105 2026-03-25 cs.LG

Data-Efficient and Robust Trajectory Generation through Pathlet Dictionary Learning

通过路径片段字典学习实现高效且鲁棒的轨迹生成

Yuanbo Tang, Yan Tang, Zixuan Zhang, Zihui Zhao, Yang Li

机构 * Tsinghua University International Campus Phase I(清华大学国际校区第一期) College of Software, Northeastern University(东北大学软件学院)

AI总结 本文提出基于路径片段表示的深度生成模型,通过学习轨迹片段字典提升轨迹生成的鲁棒性和可解释性,实验显示在噪声数据下效果优于基线模型,且在效率上具有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03334 2026-03-25 cs.CV

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05656 2026-03-25 cs.RO cs.MA

Small-Scale Testbeds for Connected and Automated Vehicles and Robot Swarms: Challenges and a Roadmap

连接与自动化车辆及机器人群的小规模测试平台:挑战与路线图

Jianye Xu, Johannes Betz, Armin Mokhtarian, Archak Mittal, Mengchi Cai, Rahul Mangharam, Omar M. Shehata, Catherine M. Elias, Jan-Nico Zaech, Patrick Scheffe, Felix Jahncke, Sangeet Sankaramangalam Ulhas, Kaj Munhoz Arfvidsson, Bassam Alrifaee

机构 * RWTH Aachen University(亚琛工业大学) Indian Institute of Technology Bombay(印度班加罗尔理工学院) Tsinghua University(清华大学) the German University in Cairo(埃及亚历山大大学) INSAIT KTH Royal Institute of Technology(皇家理工学院) KU Leuven(鲁汶大学)

AI总结 本文提出了一条路线图,以解决连接与自动化车辆及机器人群小规模测试平台当前的挑战,涵盖提升可及性与多样性、共享最佳实践及通过抽象层连接测试平台。

Comments Published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19843 2026-03-25 eess.SY cs.LG cs.SY

Artificial intelligence for partial differential equations in computational mechanics: A review

计算力学中的偏微分方程人工智能:综述

Yizheng Wang, Jinshuai Bai, Zhongya Lin, Qimin Wang, Cosmin Anitescu, Jia Sun, Mohammad Sadegh Eshaghi, Yuantong Gu, Xi-Qiao Feng, Xiaoying Zhuang, Timon Rabczuk, Yinghua Liu

机构 * Department of Engineering Mechanics, Tsinghua University, Beijing 100084, China(清华大学工程力学系) Simulation Technology, Institute of Photonics, Leibniz University Hannover, Hannover 30167, Germany(汉诺威莱布尼茨大学光子研究所仿真技术部) Drilling Mechanical Department, CNPC Engineering Technology RD Company Limited, Beijing 102206, China(中石油工程科技研发有限公司钻探机械部) School of Mechanical, Medical and Process Engineering, Queensland University of Technology, Brisbane, QLD 4000, Australia(昆士兰科技大学机械、医疗与加工工程学院) ARC Industrial Transformation Training Centre—Joint Biomechanics, Queensland University of Technology, Brisbane, QLD 4000, Australia(昆士兰科技大学 ARC 工业转型培训中心—联合生物力学)

AI总结 本文综述了人工智能求解偏微分方程在计算力学中的应用,包括固体力学、流体力学和生物力学,总结了基于物理信息神经网络、深度能量方法等算法及理论贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22264 2026-03-24 cs.RO

UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos

UniDex:一种机器人基础套件,用于从第一人称人类视频中实现通用灵巧手控制

Gu Zhang, Qicheng Xu, Haozhe Zhang, Jianhan Ma, Long He, Yiming Bao, Zeyu Ping, Zhecheng Yuan, Chenhao Lu, Chengbo Yuan, Tianhai Liang, Xiaoyu Tian, Maanping Shao, Feihong Zhang, Mingyu Ding, Yang Gao, Hao Zhao, Hang Zhao, Huazhe Xu

机构 * Tsinghua University(清华大学) Shanghai Qizhi Institute(上海启智研究院) Sun Yat-sen University(中山大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出UniDex,通过机器人中心数据集、统一视觉-语言-动作策略和实用人类数据采集设置,实现通用灵巧手控制。UniDex-VLA在两项不同手的挑战性工具使用任务中达到81%的平均任务进度,优于现有VLA基线。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21925 2026-03-24 cs.AI

Guideline-grounded retrieval-augmented generation for ophthalmic clinical decision support

基于指南的检索增强生成用于眼科临床决策支持

Shuying Chen, Sen Cui, Zhong Cao

机构 * University of International Business and Economics(国际商务经济大学) Tsinghua University(清华大学) Heidelberg Institute of Global Health(海德堡全球健康研究院)

AI总结 本文提出Oph-Guid-RAG系统,通过多模态视觉RAG方法提升眼科临床问答与决策支持,通过可控检索框架和多模态推理提升证据基础和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21669 2026-03-24 cs.RO cs.CV

PRM-as-a-Judge: A Dense Evaluation Paradigm for Fine-Grained Robotic Auditing

PRM-as-a-Judge:细粒度机器人审计的密集评估范式

Yuheng Ji, Yuyang Liu, Huajie Tan, Xuchuan Huang, Fanding Huang, Yijie Xu, Cheng Chi, Yuting Zhao, Huaihai Lyu, Peterson Co, Mingyu Cao, Qiongyu Zhang, Zhe Li, Enshen Zhou, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang, Xiaolong Zheng

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学系,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) University of Sydney(悉尼大学) Beihang University(北航大学)

AI总结 本文提出PRM-as-a-Judge方法,通过过程奖励模型对轨迹视频进行密集评估,引入OPD指标系统,验证了宏一致性与微分辨率特性,揭示了主流策略在长周期任务中的行为特征与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21577 2026-03-24 cs.AI

Mind over Space: Can Multimodal Large Language Models Mentally Navigate?

心灵超越空间:多模态大语言模型能否进行心理导航?

Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang, Shiji Zhao, Hanwei Fan, Hang Su, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系) School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院) college of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出Video2Mental基准测试,评估多模态大语言模型的空间导航能力,发现标准预训练模型无法自然生成空间表示,NavMind通过显式认知地图提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21574 2026-03-24 cs.AI

Adaptive Robust Estimator for Multi-Agent Reinforcement Learning

自适应稳健估计器用于多智能体强化学习

Zhongyi Li, Wan Tian, Jingyu Chen, Kangyao Huang, Huiming Zhang, Hui Yang, Tao Ren, Jinyang Jiang, Yijie Peng, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北京理工大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

AI总结 本文提出自适应稳健估计器和双智能体回答-批判-重写框架,解决多智能体协作中的信用分配和奖励噪声问题,提升训练稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16666 2026-03-24 cs.CV cs.AI

Fast-WAM: Do World Action Models Need Test-time Future Imagination?

Fast-WAM: 世界动作模型是否需要测试时的未来想象?

Tianyuan Yuan, Zibin Dong, Yicheng Liu, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能技术学院) Galaxea AI

AI总结 本文探讨了世界动作模型是否需要在测试时进行显式未来想象,通过提出Fast-WAM架构,发现训练时的视频共训练对性能影响更大,且Fast-WAM在模拟和现实任务中表现出色,实现实时运行。

详情

展开后加载摘要…

URL PDF HTML 收藏