arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4517
2606.29287 2026-06-30 cs.LG cs.CV

Beyond Trajectory Matching: Reflow with Marginal Distribution Alignment

超越轨迹匹配:基于边缘分布对齐的Reflow方法

Chen Wang, Peiran Yun, Pan Xie, Ke Deng

机构 * Department of Statistics and Data Science, Tsinghua University(统计与数据科学系,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Bytedance Inc(字节跳动公司)

AI总结 针对扩散模型加速生成中轨迹匹配导致学生模型边缘分布不确定的问题,提出边缘对齐正则化,通过跟踪ODE对数密度变化并利用冻结教师模型评分计算,无需额外网络,有效提升少步生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29286 2026-06-30 cs.CV

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving

ASTAD:自动驾驶中合成到真实适应的非对称风格迁移

Dingyi Yao, Xinqi Zhang, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 提出ASTAD任务,针对合成数据有标注而真实数据无标注的不对称性,设计无训练两阶段框架ASTModel,通过粗语义先验提取和动态精炼实现类一致风格迁移,显著提升下游感知性能并加速推理。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29259 2026-06-30 cs.RO

PL-LIT: A LiDAR-Inertial-Thermal SLAM Using Point-Line Features and Thermographic Mapping

PL-LIT:一种使用点线特征和热成像的LiDAR-惯性-热SLAM系统

Jiawei Xia, Yixiao Feng, Yongliang Shi, Chao Gao, Renjing Xu, Weining Lu, Bin Liang

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California, Berkeley(加州大学伯克利分校) Xinchen Qihang Co., Ltd.(新晨启航有限公司)

AI总结 提出PL-LIT系统,结合光度校准与点线特征提取网络,通过ESIKF紧耦合LiDAR、惯性和热数据,实现鲁棒的热SLAM,并构建概率热强度体素地图用于热异常检测。

Comments 8 pages,International Conference on Intelligent Robots and Systems 2026 (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29023 2026-06-30 cs.CV cs.AI

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification

基于二级跟踪和强化学习验证的多模态大模型高效时空定位

Tianshu Zhang, Yan Wang, Ji Qi, Lijie Wen

机构 * Tsinghua University(清华大学)

AI总结 提出一种从帧级到秒级跟踪的流水线,结合跨秒平滑、链式思维轨迹合成和强化学习优化,在长视频中实现高效且准确的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28971 2026-06-30 cs.CV

Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution

自进化智能体图像恢复:通过深思熟虑的规划与直觉执行

Shuang Cui, Fan Ji, Guanglong Sun, Yufei Guo, Xiongxin Tang, Jiangmeng Li, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Life Sciences, Tsinghua University(清华大学生命科学学院) Intelligent Science & Technology Academy of CASIC(中国科学院 CASIC 智能科学与技术学院)

AI总结 提出SEAR框架,将图像恢复建模为序列决策问题,采用直觉执行器与深思熟虑规划器,结合剪枝感知蒙特卡洛树搜索和自进化情景记忆,解决贪婪搜索和信息利用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28926 2026-06-30 cs.IT cs.LG math.IT

A Theoretical Interpretation of In-Context Learning via Probabilistic Modeling

通过概率建模对上下文学习的理论解释

Zhenyu Liu, Huaze Tang, Shao-Lun Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国)

AI总结 本文提出上下文学习的概率模型,推导其在一般参数分布和指数族下的性能,并解释示例数量、模型参数敏感性和示例-查询相似性对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28719 2026-06-30 cs.AI

ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models

ComMem:视觉语言模型测试时自适应的互补记忆系统

Guanglong Sun, Shuang Cui, Bo Lei, Liyuan Wang, Zihan Zhai, Hongwei Yan, Hang Su, Jun Zhu, Yi Zhong

机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(生命科学学院,IDG/麦克戈文脑科学研究院,清华大学,北京,中国) Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所,北京,中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,中国)

AI总结 提出受生物互补记忆系统启发的ComMem方法,通过快速适应细节记忆和慢速整合抽象记忆协同工作,实现视觉语言模型在测试时的跨模态一致自适应,在15个基准数据集上显著优于现有方法。

Comments A brain-inspired complementary memory framework leveraging fast visual caching and slow textual refinement for VLM test-time adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28434 2026-06-30 cs.SE cs.AI

SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents

SWE-MeM:面向长周期编码代理的自适应内存管理学习

Shuzheng Gao, Wenhao Zeng, Zhaojian Yu, Jianqiao Wangni, Chaozheng Wang, Kai Cai, Shilin He, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) Shanghai Jiao Tong University, China(上海交通大学) Tsinghua University, China(清华大学) ByteDance, China(字节跳动)

AI总结 提出SWE-MeM训练框架,通过灵活的内存工具和Memory-aware GRPO优化,让代理在有限上下文预算下自主决定压缩时机、内容和方式,在SWE-Bench Verified上以4B和30B模型分别达到43.4%和60.2%的解决率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03895 2026-06-30 cs.OS cs.AI cs.CR

Agent libOS: A Runtime Substrate for Capability-Controlled Self-Evolving LLM Agents

Agent libOS: 一种受库操作系统启发的运行时,用于长时间运行、能力受控的LLM智能体

Yingqi Zhang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 提出Agent libOS运行时,将LLM智能体建模为具有进程标识、生命周期、能力控制和审计记录的AgentProcess,通过类似libc的工具包装和运行时原语边界实现安全调度与资源控制。

Comments 12 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31603 2026-06-30 cs.CV cs.AI

Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models

Lumos-Nexus: 面向视频统一模型的高效频率桥接与同质潜在空间

Jiazheng Xing, Hangjie Yuan, Lingling Cai, Xinyu Liu, Yujie Wei, Fei Du, Tao Feng, Hai Ci, Jiasheng Tang, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 提出Lumos-Nexus框架,通过两阶段训练和渐进频率桥接,在保持推理能力的同时显著提升视频生成保真度。

Comments ECCV 2026 Camera-Ready Version. Project page (https://jiazheng-xing.github.io/nexus-lumos-home/) and Code (https://github.com/alibaba-damo-academy/Lumos-Custom/) are available

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26790 2026-06-30 cs.LG physics.space-ph

Pretrained Approximators for Low-Thrust Trajectory Cost and Reachability

低推力轨迹成本与可达性的预训练近似器

Zhong Zhang, Giacomo Acciarini, Dario Izzo, Hexi Baoyin, Francesco Topputo

机构 * Politecnico di Milano(米兰理工大学) European Space Agency(欧洲航天局) Tsinghua University(清华大学)

AI总结 提出使用机器学习代理模型精确近似低推力轨迹的燃料消耗和转移可行性,通过同伦射线策略和自相似变换实现跨任务泛化,并开源模型与数据集。

Comments Submitted to the Journal of Guidance, Navigation and Control. Zenodo entry: https://doi.org/10.5281/zenodo.18769170

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17980 2026-06-30 cs.CV

Learning to Balance: Decoupled Siamese Diffusion Transformer for Reference-Based Remote Sensing Image Super-Resolution

学习平衡:用于基于参考的遥感图像超分辨率的解耦孪生扩散变换器

Bin Luo, Runmin Dong, Zhaoyang Luo, Jinxiao Zhang, Jiyao Zhao, Fan Wei, Haohuan Fu

机构 * Tsinghua Shenzhen International Graduate School, Shenzhen, China(清华大学深圳国际研究生院) Sun Yat-sen University, Zhuhai, China(中山大学) National Supercomputing Center in Shenzhen, Shenzhen, China(深圳国家超算中心) Tsinghua University, Beijing, China(清华大学)

AI总结 本文提出DS-DiT解耦孪生扩散变换器,通过在注意力层面解耦低分辨率和参考信息交互,解决参考基于超分辨率中参考信息依赖过重和利用不足的问题,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28123 2026-06-30 cs.CV cs.AI cs.CL

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL

Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02734 2026-06-30 cs.AI cs.CL

CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents

CostBench:评估LLM工具使用代理在动态环境中的多轮成本最优规划与适应

Jiayu Liu, Cheng Qian, Zhaochen Su, Qing Zong, Shijue Huang, Bingxiang He, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

AI总结 本文提出CostBench,一个以成本为中心的可扩展基准,用于评估LLM代理在动态环境中的经济推理和重新规划能力,揭示现有模型在成本感知规划方面的显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21802 2026-06-30 cs.AI cs.CV

MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE

MixGRPO: 通过混合ODE-SDE解锁基于流的GRPO效率

Junzhe Li, Yutao Cui, Tao Huang, Weijie Kong, Yiming Cheng, Chuxuan Zeng, Yinping Ma, Chun Fan, Miles Yang, Zhao Zhong, Liefeng Bo

机构 * Hunyuan, Tencent(腾讯混元) School of Computer Science, Peking University(北京大学计算机学院) Computer Center, Peking University(北京大学计算中心) Department of Engineering Physics, Tsinghua University(清华大学工程物理系)

AI总结 本文提出MixGRPO框架,通过结合ODE和SDE混合采样策略,优化流匹配模型的效率与性能,采用滑动窗口机制减少优化开销,提升收敛速度,其中MixGRPO-Flash进一步降低训练时间达71%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19054 2026-06-30 cs.CV cs.AI

Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding

Em-Garde:一种用于主动流视频理解的提出-匹配框架

Yikai Zheng, Xin Ding, Yifan Yang, Shiqi Jiang, Hao Wu, Qianxi Zhang, Weijun Wang, Ting Cao, Yunxin Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息研究院(IIIS)) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出Em-Garde框架,通过解耦语义理解与流感知,提升主动响应的准确性和效率,实验验证其在严格计算约束下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06133 2026-06-30 math.OC cs.AI cs.LG

LLM Serving Optimization with Variable Prefill and Decode Lengths

具有可变预填和解码长度的LLM服务优化

Meixuan Wang, Yinyu Ye, Zijie Zhou

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) Department of Industrial Engineering and Decision Analytics, HKUST(香港科技大学工业工程与决策分析系)

AI总结 研究在固定KV缓存内存预算下,异构提示和响应长度的离线调度问题,提出Sorted-F算法以平衡批次大小与下游解码成本,实现常数因子近似保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20117 2026-06-30 cs.CV cs.SD eess.AS

Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation

通过解耦音频语义实现延迟双向对齐的音频视觉分割

Jingqi Tian, Yiheng Du, Haoji Zhang, Yuji Wang, Isaac Ning Lee, Xulong Bai, Tianrui Zhu, Jingxuan Niu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peking University(北京大学)

AI总结 本文提出DDAVS方法,通过解耦音频语义和延迟双向对齐解决音频视觉分割中的多源纠缠和视听错位问题,实验表明其在多种场景下均取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10359 2026-06-30 cs.CV cs.AI

Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task

增强工具的时空推理用于视频问答任务的优化

Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心)

AI总结 本文提出STAR框架和视频工具包,提升多模态大语言模型的时空推理能力,在VideoMME和LongVideoBench上分别提升8.2%和4.6%。

Comments Accepted by NeurIPS 2025 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03142 2026-06-30 cs.RO cs.CV

MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning

MM-Nav:基于多专家学习的多视角VLA模型用于鲁棒视觉导航

Tianyu Xu, Jiawei Chen, Jiazhao Zhang, Wenyao Zhang, Zekun Qi, Minghan Li, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出MM-Nav模型,通过多专家学习从合成数据中学习多样化的导航能力,展示模型在合成环境中的强泛化能力,并在现实世界实验中验证其有效性。

Comments Project page: https://pku-epic.github.io/MM-Nav-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12078 2026-06-30 cs.MA cs.AI cs.CL cs.CY cs.SI

Modeling Earth-Scale Human-Like Societies with One Billion Agents

用十亿个智能体建模地球尺度的人类社会

Haoxiang Guan, Jiyan He, Liyang Fan, Zhenzhen Ren, Shaobin He, Xin Yu, Yuan Chen, Xueyin Xu, Shuxin Zheng, Yan Gao, Enhong Chen, Tie-Yan Liu, Zhen Liu

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Shenzhen University(深圳大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 本文提出Light Society框架,通过结合大语言模型与优化算法,实现高效模拟十亿级智能体的社会现象,验证了其在信任游戏和意见扩散中的高保真度与效率。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08319 2026-06-30 eess.SY cs.RO cs.SY

Differentiable Physics-Informed Adaptive Koopman Control for Stable Flight under Unknown Disturbances

可微物理信息自适应柯普曼控制:在未知干扰下稳定飞行

Ao Jin, Qiujin Liang, Tao Zhang, Panfeng Huang, Fan Zhang

机构 * Research Center for Intelligent Robotics, School of Astronautics, Northwestern Polytechnical University(西北工业大学航天学院智能机器人研究中心) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出DEKC框架,结合物理模型与深度神经网络,通过学习干扰的动态演化来预测并补偿未来干扰,提升机器人在未知干扰下的控制精度。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17421 2026-06-30 cs.LG cs.AI

Towards Harnessing the Collaborative Power of Large and Small Models for Domain Tasks

向利用大模型和小模型的协作力量进行领域任务

Yang Liu, Kejia Zhang, Bingjie Yan, Tianyuan Zou, Jianqing Zhang, Zixuan Gu, Xiangsen Chen, Jianbing Ding, Xidong Wang, Jingyi Li, Xiaozhou Ye, Ye Ouyang, Qiang Yang, Ya-Qin Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Institute for AI Industry Research, Tsinghua University(清华大学智能产业研究院) Shanghai Jiao Tong University(上海交通大学) School of Software, Tsinghua University(清华大学软件学院) AsiaInfo Technologies(亚信科技)

AI总结 本文探讨了大模型与小模型协作在领域适应中的应用,分析了跨边界环境中的数据隐私、模型安全和效率挑战,并提出多目标优化问题以指导实际部署。

Comments For ongoing updates and a curated list of recent advances in this area, we maintain a public repository: https://github.com/KejiaZhang-Robust/Awesome-LM-SM-Domain-Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28226 2026-06-29 cs.CV cs.AI 新提交

Exposure Bias Can Alleviate Itself via Directional and Frequency Rectification in Flow Matching

暴露偏差可以通过流匹配中的方向和频率校正自我缓解

Guanbo Huang, Jingjia Mao, Fanding Huang, Fengkai Liu, Xiangyang Luo, Yaoyuan Liang, Jiasheng Lu, Xiaoe Wang, Pei Liu, Ruiliu Fu, Ruqi Huang, Shao-Lun Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

AI总结 提出DEFAR框架,利用暴露偏差自身的方向和频率自适应信号进行校正,通过抗漂移校正和频率补偿增强模型鲁棒性,在多个数据集上优于现有方法。

Comments arXiv admin note: text overlap with arXiv:2512.04904

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28144 2026-06-29 cs.CV 新提交

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

基于级联扩散先验和UV空间可微分着色的单目虚拟人重建

Hong Li, Minqi Meng, Yanjun Liang, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Xianda Guo, Guojun Lei, Xuhui Liu, Chaojie Yang, Yanlun Peng, Hao Zhao, Baochang Zhang

机构 * Beihang University(北航) Great Wall Motors(长城汽车) CUHK-Shenzhen(香港科技大学深圳研究院) HKUST(香港科技大学) Nanjing University(南京大学) Wuhan University(武汉大学) Zhejiang University(浙江大学) KAUST(王国 Abdullah 基础科学研究院) Tsinghua University(清华大学)

AI总结 提出数据高效框架,利用统一预训练扩散模型的鲁棒先验,通过级联LoRA依次处理纹理补全、去光照和材质分解,结合UV空间可微分BRDF着色损失,从单张野外图像重建高保真可重光照3D虚拟人。

Comments Accepted by ECCV 2026. Project page: https://luh1124.github.io/MARCUS-Avatar-Projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28094 2026-06-29 cs.CV cs.AI 新提交

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28089 2026-06-29 cs.CV 新提交

RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement

RPM-Distill:生理引导的自适应跨模态蒸馏用于鲁棒的远程生理测量

Jiyao Wang, Qingyong Hu, Duoxun Tang, Xiao Yang, Kaishun Wu, Jiangbo Yu

机构 * McGill University(麦吉尔大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

AI总结 提出RPM-Distill框架,利用训练时的雷达信号通过频域蒸馏指导视频模型,提升光照、肤色和运动变化下的远程心率估计鲁棒性,在挑战性条件下MAE降低81%,相关性提升21%。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28049 2026-06-29 cs.CV 新提交

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

AirGroundBench: 异构多视角具身协作下多模态大模型的空间智能探测

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) QiYuanLab(启元实验室) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出AirGroundBench基准,通过异构无人机-无人车协作的多视角任务(10类、约6.2万道视觉问答和115个导航任务),系统评估多模态大模型在空间感知、跨视角对齐、空间变换推理和具身决策中的几何一致性,发现模型在跨视角对齐和变换推理上存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28026 2026-06-29 cs.CV 新提交

EMOSH: Expressive Motion and Shape Disentanglement for Human Animation

EMOSH:用于人体动画的表现性运动与形状解耦

Dongbin Zhang, Hao Liu, Binquan Dai, Kangjie Chen, Chuming Wang, Chen Li, Jing Lyu, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) WeChat Vision, Tencent Inc.(腾讯微信视觉)

AI总结 提出EMOSH框架,通过可表现人体模型解耦形状与姿态,结合粗细混合运动注入和空间对齐条件机制,实现高保真、可控的人体视频生成,解决运动-形状纠缠问题。

Comments Accepted to ECCV 2026, Project Page: https://eastbeanzhang.github.io/EMOSH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27974 2026-06-29 cs.CV cs.AI 新提交

ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

ProMSA: 渐进式多模态搜索智能体用于基于知识的视觉问答

ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center, OPPO Inc. China(OPPO AI中心,OPPO公司) The Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 提出渐进式多模态搜索智能体ProMSA,通过迭代选择图像搜索、文本搜索或停止,在显式工具调用预算和去重机制下,结合序列级强化学习优化,提升基于知识的视觉问答的检索和端到端准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏