arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3042
2511.19368 2025-11-25 cs.LG cs.NI

LLM-Driven Stationarity-Aware Expert Demonstrations for Multi-Agent Reinforcement Learning in Mobile Systems

基于大语言模型的站稳意识专家示范的多智能体强化学习在移动系统中的应用

Tianyang Duan, Zongyuan Zhang, Zheng Lin, Songxiao Guo, Xiuxian Guan, Guangyu Wu, Zihan Fang, Haotian Meng, Xia Du, Ji-Zhe Zhou, Heming Cui, Jun Luo, Yue Gao

机构 * Division of Computer Science, The University of Hong Kong(计算机科学系,香港大学) Department of Electrical and Electronic Engineering, The University of Hong Kong(电气电子工程系,香港大学) Department of Computer Science and Technology, Peking University(计算机科学与技术系,北京大学) Department of Computer Science, City University of Hong Kong(计算机科学系,城市大学) China Unicom Digital Technology, China Unicom co.,Ltd(中国联合数字技术,中国联合有限公司) School of Computer and Information Engineering, Xiamen University of Technology(计算机与信息工程学院,厦门理工学院) School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(计算机科学学院,机器学习与工业智能工程研究中心,四川大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Institute of Space Internet, Fudan University(空间互联网研究院,复旦大学) School of Computer Science, Fudan University(计算机科学学院,复旦大学)

AI总结 本文提出RELED框架,通过大语言模型驱动的专家示范与自主探索相结合,提升多智能体强化学习在移动系统中的性能和稳定性。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19236 2025-11-25 cs.RO cs.AI

SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control

SENTINEL:一种用于人形机器人全身控制的端到端语言-动作模型

Yuxuan Wang, Haobin Jiang, Shiqing Yao, Ziluo Ding, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

AI总结 SENTINEL是一种端到端语言-动作模型,通过直接映射语言指令和本体感觉输入到低层动作,实现人形机器人全身控制,并支持多模态扩展。

Comments 23 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19023 2025-11-25 cs.LG cs.AI

OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs

OrdMoE:通过多模态混合专家模型中的层次专家小组排名实现偏好对齐

Yuting Gao, Weihao Chen, Lan Wang, Ruihan Xu, Qingpei Guo

机构 * AntGroup(蚂蚁集团) Peking University(北京大学)

AI总结 OrdMoE通过利用混合专家架构中的内在信号,实现多模态混合专家语言模型的零成本偏好对齐,无需人工标注数据即可提升模型对齐和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18926 2025-11-25 cs.AI cs.HC

MoodBench 1.0: An Evaluation Benchmark for Emotional Companionship Dialogue Systems

MoodBench 1.0: 一种用于情感陪伴对话系统的评估基准

Haifeng Jing, Yujie Hou, Junfei Liu, Rui Xie, alan Xu, Jinlong Ma, Qichun Deng

机构 * School of Software Microelectronics,Peking University QingDao Institute of Software, Colledge of Computer Science Technology,China University of Petroleum (East China) BeiJing BeiJing China QingDao Institute of Software, Colledge of Computer Science Technology,China University of Petroleum (East China) QingDao ShanDong China Microelectronics,Peking University BeiJing BeiJing China R\&D Center,Quwan Guangzhou Guangdong China Technology,China University of Petroleum (East China) Microelectronics,Peking University R\&D Center,Quwan

AI总结 MoodBench 1.0 是首个用于评估情感陪伴对话系统能力的基准,通过评估30种主流模型,揭示了当前模型在深层次情感陪伴方面的不足,指导未来技术优化。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18902 2025-11-25 cs.LG cs.AI

VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL

VADE:基于在线样本级难度估计的方差感知动态采样用于多模态强化学习

Zengjie Hu, Jiantao Qiu, Tianyi Bai, Haojin Yang, Binhang Yuan, Qi Jing, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室) HKUST(香港科技大学)

AI总结 VADE通过在线样本级难度估计实现方差感知动态采样,提升多模态强化学习的性能与样本效率,减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18673 2025-11-25 cs.CV

Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers

Edit2Perceive: 图像编辑扩散模型是强大的密集感知器

Yiqing Shi, Yiren Song, Mike Zheng Shou

机构 * Peking University(北京大学) Show Lab, National University of Singapore(新加坡国立大学Show实验室)

AI总结 Edit2Perceive通过统一的扩散框架,利用图像编辑模型实现更高效的密集感知任务,展示了在深度、法线和磨边任务上的最新成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14208 2025-11-25 cs.CV

InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior

InstantViR: 基于蒸馏扩散先验的实时视频逆问题求解器

Weimin Bai, Suzhe Xu, Yiwei Ren, Jinhua Hao, Ming Sun, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) Huaqiao University(华侨大学) Kuaishou Technology(快手科技)

AI总结 InstantViR通过蒸馏扩散先验实现高效实时视频重建,以35 FPS速度在NVIDIA A100 GPU上达到与基线相当的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18337 2025-11-25 eess.AS cs.AI cs.SD

Warm Chat: Diffuse Emotion-aware Interactive Talking Head Avatar with Tree-Structured Guidance

Warm Chat: 一种具有树状引导的情感感知交互式对话头虚拟形象

Haijie Yang, Zhenyu Zhang, Hao Tang, Jianjun Qian, Jian Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 Warm Chat提出一种基于树状结构引导的情感感知对话头生成框架,利用大语言模型生成时序一致且情感丰富的虚拟形象,提升双向交互的自然度与情感适应性。

Comments The submission is withdrawn at the request of the authors due to internal reasons within the research team

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10510 2025-11-25 cs.NI cs.AI cs.HC cs.MM

Chat with AI: The Surprising Turn of Real-time Video Communication from Human to AI

与AI聊天:从人类到AI的实时视频通信惊人转变

Jiangkai Wu, Zhiyuan Ren, Liming Liu, Xinggong Zhang

机构 * Peking University(北京大学)

AI总结 本文提出了一种面向AI的实时视频通信方法,通过上下文感知视频流技术降低延迟并提升AI理解视频的准确性。

Comments 9 pages, 10 figures, Proceedings of the 24th ACM Workshop on Hot Topics in Networks (HotNets 2025), College Park, Maryland, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20613 2025-11-25 cs.CL cs.AI cs.LG cs.LO

REAL-Prover: Retrieval Augmented Lean Prover for Mathematical Reasoning

REAL-Prover:基于检索的Lean证明器用于数学推理

Ziju Shen, Naohao Huang, Fanyi Yang, Yutong Wang, Guoxiong Gao, Tianyi Xu, Jiedong Jiang, Wanyi He, Pu Yang, Mengzhou Sun, Haocheng Ju, Peihao Wu, Bryan Dai, Bin Dong

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) Ubiquant(Ubiquant公司) Beijing International Center for Mathematical Research(北京国际数学研究中心)

AI总结 REAL-Prover基于检索增强的Lean证明器,通过微调大型语言模型和检索系统,在数学推理任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18464 2025-11-25 stat.ML cs.LG

Reliable Selection of Heterogeneous Treatment Effect Estimators

可靠选择异质处理效应估计器

Jiayi Guo, Zijun Gao

机构 * Peking University(北京大学) Marshall School of Business, University of Southern California(南加州大学马歇尔商学院)

AI总结 本文提出一种无需真实值的可靠方法,用于在异质处理效应估计中选择最佳估计器,并在多个基准测试中展示了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18423 2025-11-25 cs.CL cs.AI cs.IR cs.LG

General Agentic Memory Via Deep Research

通用代理记忆 via 深度研究

B. Y. Yan, Chaofan Li, Hongjin Qian, Shuqi Lu, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Renmin University of China(中国人民大学) Peking University(北京大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出通用代理记忆框架GAM,通过即时编译原则结合记忆器和研究者组件,利用大语言模型实现高效记忆管理和任务完成优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18367 2025-11-25 cs.CV

Alias-free 4D Gaussian Splatting

无别名的4D高斯散射

Zilong Chen, Huan-ang Gao, Delin Qu, Haohan Chi, Hao Tang, Kai Zhang, Hao Zhao

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Beijing Academy of Artificial Intelligence, BAAI(北京人工智能研究院,BAAI) Fudan University(复旦大学) Peking University(北京大学)

AI总结 本研究提出了一种无别名的4D高斯散射方法,通过引入最大采样频率公式和尺度自适应滤波器,有效减少渲染伪影并提升多视角视频重建效率。

Comments Project page: https://4d-alias-free.github.io/4D-Alias-free/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18346 2025-11-25 cs.CV

FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacement

FlowPortal: 基于残差校正的无训练视频重照明与背景替换流动

Wenshuo Gao, Junyi Fan, Jiangyue Zeng, Shuai Yang

机构 * Wangxuan Institute of Computer Technology, State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China(王轩计算机技术研究所,多媒体信息处理国家重点实验室,北京大学,北京,中国)

AI总结 FlowPortal通过残差校正流动机制实现无训练视频重照明与背景替换,提升时间一致性、结构保持和照明真实感。

Comments Project Page: https://gaowenshuo.github.io/FlowPortalProject/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18287 2025-11-25 cs.LG cs.CV q-bio.QM

TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis

TRIDENT: 一种用于药物和RNA条件细胞形态合成的三模态级联生成框架

Rui Peng, Ziru Liu, Lingyuan Ye, Yuxing Lu, Boxin Shi, Jinzhuo Wang

机构 * Department of Big Data and Biomedical AI, College of Future Technology, Peking University(大数据与生物医学人工智能系,未来技术学院,北京大学) Center for BioMed-X Research, Academy for Advanced Interdisciplinary Studies, Peking University(BioMed-X研究中心,先进跨学科研究学院,北京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(视觉技术国家工程研究中心,计算机科学学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) School of Life Sciences, Tsinghua University(生命科学学院,清华大学) Peking University-Tsinghua University-National Institute of Biological Sciences Joint Graduate Program (PTN), Tsinghua University(北京大学-清华大学-国家生物医学科学研究院联合研究生项目(PTN),清华大学)

AI总结 TRIDENT通过三模态级联生成框架,结合药物和RNA条件,实现了对细胞形态的高保真合成,显著提升了虚拟细胞的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18055 2025-11-25 cs.CV cs.AI cs.CL

IE-Critic-R1: Advancing the Explanatory Measurement of Text-Driven Image Editing for Human Perception Alignment

IE-Critic-R1: 推动文本驱动图像编辑的解释性测量以实现人类感知对齐

Bowen Qu, Shangkun Sun, Xiaoyu Liang, Wei Gao

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Peng Cheng Laboratory, China(鹏城实验室,中国)

AI总结 IE-Critic-R1通过强化学习从可验证奖励提升文本驱动图像编辑的解释性评估,实现与人类感知的对齐。

Comments 18 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18036 2025-11-25 cs.AI cs.CL cs.IR

Paper2SysArch: Structure-Constrained System Architecture Generation from Scientific Papers

Paper2SysArch: 从科学论文生成结构约束的系统架构图

Ziyi Guo, Zhou Liu, Wentao Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

AI总结 Paper2SysArch通过多智能体协作从科学论文生成结构化的系统架构图,建立首个大规模基准以推动自动化科学可视化的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18012 2025-11-25 cs.CV

State and Scene Enhanced Prototypes for Weakly Supervised Open-Vocabulary Object Detection

状态与场景增强的原型用于弱监督开放词汇目标检测

Jiaying Zhou, Qingchao Chen

机构 * National Institute of Health Data Science Peking University(健康数据科学国家研究院 北京大学)

AI总结 本文提出状态增强和场景增强原型方法,用于提升弱监督开放词汇目标检测中语义原型的丰富性和视觉-文本对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17943 2025-11-25 cs.CV

SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System

SciEducator: 基于Deming循环多智能体系统的科学视频理解与教育

Zhiyu Xu, Weilong Yan, Yufei Shi, Xin Meng, Tao He, Huiping Zhuang, Ming Li, Hehe Fan

机构 * Jinan University(济南大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) South China University of Technology(华南理工大学) Guangming Laboratory(光明实验室) Zhejiang University(浙江大学)

AI总结 SciEducator通过Deming循环多智能体系统实现科学视频的自演化理解与教育,生成多模态教学内容并超越现有大语言模型和视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17889 2025-11-25 cs.RO cs.CV

MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots

MobileVLA-R1: 为移动机器人强化视觉-语言-动作

Ting Huang, Dongjian Li, Rui Yang, Zeyu Zhang, Zida Yang, Hao Tang

机构 * Peking University(北京大学)

AI总结 MobileVLA-R1通过结合监督CoT对齐与GRPO强化学习,提升四足机器人在复杂环境中的视觉-语言-动作控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14169 2025-11-25 cs.CV cs.AI

AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs

AdaTok: 一种基于对象感知表示的自适应令牌压缩方法,用于高效多模态大语言模型

Xinliang Zhang, Lei Zhu, Hangzhou He, Shuang Zeng, Ourui Fu, Jiakui Hu, Zhengjian Yao, Yanye Lu

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) Department of Biomedical Engineering, Peking University(北京大学生物医学工程系) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)

AI总结 AdaTok通过自适应令牌压缩方法,利用对象感知表示提升多模态大语言模型的效率,实现高压缩比与高性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07473 2025-11-25 cs.LG cs.CY

RELEAP: Reinforcement-Enhanced Label-Efficient Active Phenotyping for Electronic Health Records

RELEAP: 通过强化学习增强的标签高效主动表型分析用于电子健康记录

Yang Yang, Kathryn I. Pollak, Bibhas Chakraborty, Molei Liu, Doudou Zhou, Chuan Hong

机构 * Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) Cancer Prevention and Control Research Program, Duke Cancer Institute(癌症预防与控制研究计划,杜克癌症研究所) Department of Population Health Sciences, Duke University School of Medicine(流行病学与公共卫生科学系,杜克大学医学院) Centre for Quantitative Medicine, Duke-NUS Medical School(定量医学中心,杜克-新加坡医学学校) Programme in Health Services and Systems Research, Duke-NUS Medical School(健康服务与系统研究计划,杜克-新加坡医学学校) Department of Statistics and Data Science, National University of Singapore(统计与数据科学系,新加坡国立大学) Department of Biostatistics, Peking University Health Science Center(生物统计学系,北京大学医学部) Beijing International Center for Mathematical Research, Peking University(北京国际数学研究中心,北京大学)

AI总结 RELEAP通过强化学习增强标签效率,利用下游预测性能反馈优化电子健康记录表型修正,提升风险预测可靠性。

Comments 20 pages, 5 figures, 1 table. Includes supplementary material. Submitted to JAMIA Open. † These authors contributed equally. *Corresponding author: Chuan Hong

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17991 2025-11-25 cs.CV cs.CL

VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format

VideoLLM 知何时言:通过视频-文本双人对话交互格式增强时间敏感视频理解

Yueqian Wang, Xiaojun Meng, Yuxuan Wang, Jianxin Liang, Jiansheng Wei, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(王炫计算机技术研究所,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

AI总结 本文提出视频-文本双人对话交互格式,通过MMDuetIT数据集和MAGQA任务提升VideoLLM在时间敏感任务中的表现,实现高效实时响应。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17366 2025-11-24 cs.RO cs.CV

METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model

METIS:多源自体训练用于集成的灵巧视觉-语言-动作模型

Yankai Fu, Ning Chen, Junkai Zhao, Shaozhe Shan, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 METIS通过多源自体训练构建集成的视觉-语言-动作模型,提升灵巧操作的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17106 2025-11-24 cs.CV

ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better

ChainV: 原子视觉提示使多模态推理更短更优

Yuan Zhang, Ming Lu, Junwen Pan, Tao Huang, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 ChainV通过动态整合视觉提示,提升多模态推理的效率和准确性,尤其在数学密集型基准测试中表现突出。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17094 2025-11-24 cs.CV

Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models

稀疏推理已足够:基于生物启发的视频异常检测大预训练模型框架

He Huang, Zixuan Hu, Dongxiao Li, Yao Xiao, Ling-Yu Duan

机构 * School of Computer Science Peking University(北京大学计算机科学学院)

AI总结 ReCoVAD通过生物启发的双通路框架实现视频异常检测,利用稀疏推理降低计算成本,取得最佳无训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16951 2025-11-24 cs.CV

FingerCap: Fine-grained Finger-level Hand Motion Captioning

FingerCap:细粒度指尖级手部动作描述

Xin Shen, Rui Zhu, Lei Shen, Xinyu Wang, Kaihao Zhang, Tianqing Zhu, Shuchen Wu, Chenxi Miao, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang, Xin Yu

机构 * Baidu Inc.(百度公司) The University of Queensland(昆士兰大学) Nanjing University(南京大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所) Peking University(北京大学) Australian National University(澳大利亚国立大学) City University of Macau(澳门城市大学)

AI总结 FingerCap通过FiGOP技术提升细粒度手部动作描述的准确性,解决视频大语言模型在指尖运动识别中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16651 2025-11-21 cs.RO

InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy

InternData-A1:开创高保真合成数据用于预训练通用策略

Yang Tian, Yuyin Yang, Yiman Xie, Zetao Cai, Xu Shi, Ning Gao, Hangxu Liu, Xuekun Jiang, Zherui Qiu, Feng Yuan, Yaping Li, Ping Wang, Junhao Cai, Jia Zeng, Hao Dong, Jiangmiao Pang

机构 * Shanghai AI Laboratory Peking University(北京大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 InternData-A1通过高保真合成数据实现与最强$π$-数据集相当的VLA模型预训练性能,展示了大规模模拟在机器人任务中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16602 2025-11-21 cs.AI

Bridging VLMs and Embodied Intelligence with Deliberate Practice Policy Optimization

通过刻意练习策略优化弥合视觉语言模型与具身智能之间的鸿沟

Yi Zhang, Che Liu, Xiancong Ren, Hanchu Ni, Yingji Zhang, Shuai Zhang, Zeyuan Ding, Jiayu Hu, Haozhe Shan, Junbo Qi, Yan Bai, Dengjie Li, Jiachen Luo, Yidong Wang, Yong Dai, Zenglin Xu, Bin Shen, Qifan Wang, Jian Tang, Xiaozhu Ju

机构 * X-Humanoid Imperial College London(帝国理工学院) Peking University(北京大学) University of Manchester(曼彻斯特大学) Westlake University(西湖大学) Fudan University(复旦大学) Waseda University(早稻田大学) Nvidia Queen Mary University of London(伦敦大学玛丽女王学院) Celonis AI Meta AI

AI总结 本文提出DPPO框架,通过监督微调与强化学习交替训练,提升具身智能系统在稀疏数据下的学习效率,并在性能和参数规模上取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20470 2025-11-21 cs.CV

Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence

Conan:基于多尺度视觉证据的逐步学习以像侦探一样推理

Kun Ouyang, Yuanxin Liu, Linli Yao, Yishuo Cai, Hao Zhou, Jie Zhou, Fandong Meng, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

AI总结 Conan通过多阶段渐进冷启动策略和AIR RLVR框架,实现证据基础的多步视频推理,超越基线模型,达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏