arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2510.16344 2026-03-20 cs.RO cs.AI

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配

Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) University of Toronto(多伦多大学) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02460 2026-03-20 cs.CV

GenCompositor: Generative Video Compositing with Diffusion Transformer

GenCompositor:基于扩散变换器的生成视频合成

Shuzhou Yang, Xiaoyu Li, Xiaodong Cun, Guangzhi Wang, Lingen Li, Ying Shan, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) GVC Lab, Great Bay University(Great Bay大学GVC实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出GenCompositor,通过扩散变换器实现自动化视频合成,解决传统方法劳动强度大、成本高的问题,提出轻量背景保存分支、动态元素融合块和ERoPE位置嵌入等创新方法,构建VideoComp数据集并验证方法有效性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09109 2026-03-20 cs.RO cs.CV

FoldNet: Learning Generalizable Closed-Loop Policy for Garment Folding via Keypoint-Driven Asset and Demonstration Synthesis

FoldNet:通过关键点驱动的资产和演示合成学习通用的闭环策略用于服装折叠

Yuxing Chen, Bowen Xiao, He Wang

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

AI总结 本文提出一种合成服装数据集,通过关键点驱动的资产和演示合成,学习通用的服装折叠闭环策略,提升现实世界成功率25%。

Comments Project: https://pku-epic.github.io/FoldNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18000 2026-03-19 cs.AI

AgentFactory: A Self-Evolving Framework Through Executable Subagent Accumulation and Reuse

AgentFactory: 通过可执行子代理积累与重用实现自我进化框架

Zhang Zhang, Shuqi Lu, Hongjin Qian, Di He, Zheng Liu

机构 * Peking University(北京大学) Hong Kong Polytechnic University(香港理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出AgentFactory,通过保存可执行子代理代码而非文本经验实现自我进化,使子代理在反馈中持续优化,提升任务执行效率和鲁棒性,实现能力持续积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17771 2026-03-19 cs.LG cs.AI

Attention Sinks Induce Gradient Sinks

注意力沉底引发梯度沉底

Yihong Chen, Quanming Yao

机构 * Tsinghua University(清华大学) Peking University(北京大学)

AI总结 研究从反向传播角度探讨注意力沉底与梯度沉底的关系,发现因果掩码下注意力沉底会引发梯度集中,且在预归一化架构中,大规模激活是训练时对梯度压力的适应性响应。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15363 2026-03-19 cs.LG math.DS

Deep learning and the rate of approximation by flows

深度学习与流的逼近速率

Jingpu Cheng, Qianxiao Li, Ting Lin, Zuowei Shen

机构 * Department of Mathematics, National University of Singapore(新加坡国立大学数学系) Institute for Functional Intelligent Materials, National University of Singapore(新加坡国立大学功能智能材料研究所) School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 研究深度残差网络深度对逼近能力的影响,通过连续动力系统设定量化由给定向量场族驱动的流逼近微分同胚所需的最小时间 horizon,揭示学习效率与架构选择兼容性的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09233 2026-03-19 cs.LG cs.AI cs.CL

GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization

GIFT:通过有限温度吉布斯初始化调和后训练目标

Zhengyang Zhao, Lu Ma, Yizhen Jiang, Xiaochen Ma, Zimo Meng, Chengyu Shen, Lexiang Tang, Haoze Sun, Peng Pei, Wentao Zhang

机构 * Peking University(北京大学) Meituan(美团)

AI总结 本文提出GIFT方法,通过将监督视为有限温度能量势,解决后训练阶段目标不一致问题,实验表明其在强化学习初始化中优于传统SFT及其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22977 2026-03-19 cs.CV

HyperMotionX: The Dataset and Benchmark with DiT-Based Pose-Guided Human Image Animation of Complex Motions

HyperMotionX:基于DiT的Pose引导人体图像动画的Dataset和Benchmark

Shuolin Xu, Siming Zheng, Ziyi Wang, HC Yu, Jinwei Chen, Huaqi Zhang, Daquan Zhou, Tong-Yee Lee, Bo Li, Peng-Tao Jiang

机构 * Bournemouth University(伯恩茅斯大学) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd(vivo 蓝影实验室,vivo 通信有限公司) Peking University(北京大学) National Cheng-Kung University(国立成功大学)

AI总结 本文提出基于DiT的高效人体动画生成基线和改进的RoPE模块,构建了HyperMotionX数据集和基准,提升了复杂人体运动动画的结构稳定性和外观一致性。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17633 2026-03-19 q-bio.BM cs.LG

Atomic Trajectory Modeling with State Space Models for Biomolecular Dynamics

基于状态空间模型的原子轨迹建模用于生物分子动力学

Liang Shi, Jiarui Lu, Junqi Liu, Chence Shi, Zhi Yang, Jian Tang

机构 * School of Computer Science, Peking University Mila - Qu\'ebec AI Institute CIFAR AI Chair

AI总结 本文提出ATMOS框架,结合状态空间模型和Pairformer机制,生成生物分子原子级轨迹,实现高效建模和药物发现应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17492 2026-03-19 cs.CV

UAV-CB: A Complex-Background RGB-T Dataset and Local Frequency Bridge Network for UAV Detection

UAV-CB: 一种复杂背景RGB-T数据集和局部频率桥梁网络用于UAV检测

Shenghui Huang, Menghao Hu, Longkun Zou, Hongyu Chi, Zekai Li, Feng Gao, Fan Yang, Qingyao Wu, Ke Chen

机构 * Pengcheng Laboratory(鹏城实验室) South China University of Technology(南方科技大学) Peking University(北京大学) Xinjiang University(新疆大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出UAV-CB数据集和LFBNet网络,针对低空环境中的UAV检测复杂背景和伪装问题,通过局部频率空间建模提升RGB-T融合性能,实验证明其在伪装和杂乱背景下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17354 2026-03-19 cs.LG cs.CL

Beyond Outliers: A Data-Free Layer-wise Mixed-Precision Quantization Approach Driven by Numerical and Structural Dual-Sensitivity

超越异常值:一种无需数据的分层混合精度量化方法,由数值和结构双敏感性驱动

Hengyuan Zhang, Xinrong Chen, Zunhai Su, Xiao Liang, Jing Xiong, Wendong Xu, He Xiao, Chaofan Tao, Wei Zhang, Ruobing Xie, Lei Jiang, Hayden Kwok-Hay So, Ngai Wong

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Tsinghua University(清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Tencent(腾讯)

AI总结 本文提出NSDS方法,通过数值和结构双敏感性驱动分层混合精度量化,无需校准数据,在不同模型和任务中均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17324 2026-03-19 cs.AI cs.LG

ShuttleEnv: An Interactive Data-Driven RL Environment for Badminton Strategy Modeling

ShuttleEnv:一种用于羽毛球策略建模的交互式数据驱动RL环境

Ang Li, Xinyang Gong, Bozhou Chen, Yunlong Lu, Jiaming Ji, Yongyi Wang, Yaodong Yang, Wenxin Li

机构 * School of Computer Science, Peking University(北京大学计算机学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 本文介绍ShuttleEnv,一种基于精英球员比赛数据的交互式数据驱动RL环境,通过显式概率模型模拟比赛动态,支持强化学习和战略行为分析,提供实时可视化以探索不同打法和策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10489 2026-03-19 cs.LG cs.AI

Learning Adaptive Distribution Alignment with Neural Characteristic Function for Graph Domain Adaptation

基于神经特征函数的自适应分布对齐用于图域适应

Wei Chen, Xingyu Guo, Shuang Li, Zhao Zhang, Yan Zhong, Fuzhen Zhuang, Deqing wang

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) School of Mathematical Sciences, Peking University(北大数学系) Zhongguancun Laboratory(中关村实验室)

AI总结 本文提出ADAlign框架,通过自适应分布对齐解决图域适应中的分布偏移问题,利用神经谱差异衡量跨图偏移,实现灵活且鲁棒的域适应。

Comments Accepted by ICLR 2026, 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09259 2026-03-19 cs.CL cs.AI cs.LG

Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models

在大型语言模型后训练强化学习中检测数据污染

Yongding Tao, Tian Wang, Yihong Dong, Huanyu Liu, Kechi Zhang, Xiaolong Hu, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机学院) New H3C Technologies Co., Ltd(新华H3C技术有限公司)

AI总结 本文提出Self-Critique方法,通过分析LLM后强化学习阶段输出熵分布的变化来检测数据污染,实验表明其在多个模型和污染任务中显著优于基线方法,AUC提升达30%。

Comments Accepted to ICLR 2026. Code is available at https://github.com/yongding-tao/RL-Data-Contamination

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16866 2026-03-18 cs.RO cs.AI cs.GR cs.LG cs.SE

ManiTwin: Scaling Data-Generation-Ready Digital Object Dataset to 100K

ManiTwin:将数据生成-ready的数字对象数据集扩展到10万

Kaixuan Wang, Tianxing Chen, Jiawei Liu, Honghao Su, Shaolong Zhu, Minxuan Wang, Zixuan Li, Yue Chen, Huan-ang Gao, Yusen Qin, Jiawei Wang, Qixuan Zhang, Lan Xu, Jingyi Yu, Yao Mu, Ping Luo

机构 * The University of Hong Kong(香港大学) Xspark AI Deemos Tech Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) D-Robotics Peking University(北京大学) Tsinghua University(清华大学) Shenzhen University(深圳大学)

AI总结 本文提出ManiTwin,一种高效生成数据生成-ready数字对象双胞胎的自动化流程,构建了包含10万高质量标注3D资产的ManiTwin-100K数据集,为大规模仿真数据合成和策略学习提供基础。

Comments Website: https://manitwin.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16542 2026-03-18 cs.RO

Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting

通过后过渡重加权实现保守的离线机器人策略学习

Wanpeng Zhang, Hao Luo, Sipeng Zheng, Yicheng Feng, Haiweng Xu, Ziheng Xi, Chaoyi Xu, Haoqi Yuan, Zongqing Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) BeingBeyond

AI总结 本文提出PTR方法,通过后验过渡重加权实现保守的离线机器人策略学习,根据样本后作用后果的可归因性分配信用,提升对异质机器人数据的适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16445 2026-03-18 cs.AI

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

视觉干扰削弱了视觉语言模型中的道德推理

Xinyi Yang, Chenheng Xu, Weijun Hong, Ce Mo, Qian Wang, Fang Fang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Yuanpei College, Peking University(北京大学元培学院) Department of Psychology, Sun Yat-sen University(中山大学心理学系) State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)

AI总结 研究揭示视觉输入会改变视觉语言模型的道德决策,超越文本安全机制,提出多模态基准MDS以分析视觉与上下文变量对道德决策的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16161 2026-03-18 cs.AI

SQL-ASTRA: Alleviating Sparse Feedback in Agentic SQL via Column-Set Matching and Trajectory Aggregation

SQL-ASTRA: 缓解代理SQL中的稀疏反馈 via 列集匹配和轨迹聚合

Long Li, Zhijian Zhou, Jiangxuan Long, Peiyang Liu, Weidi Xu, Zhe Wang, Shirui Pan, Chao Qu

机构 * Griffith University(格里菲斯大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Peking University(北京大学) InFly Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

AI总结 本文提出SQL-ASTRA框架,通过列集匹配和轨迹聚合解决代理SQL中的稀疏反馈问题,引入轨迹奖励和列集匹配奖励,提升多轮任务的奖励分配效率与稳定性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15618 2026-03-18 cs.CV

Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models

先看再行动:增强视觉基础表示以用于视觉-语言-动作模型

Yulin Luo, Hao Chen, Zhuangzhe Wu, Bowen Sui, Jiaming Liu, Chenyang Gu, Zhuoyang Liu, Qiuxuan Feng, Jiale Yu, Shuo Gu, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人公司) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出DeepVision-VLA框架,通过视觉-语言混合变压器提升视觉表示,引入动作引导视觉剪枝技术,实现在模拟和现实任务中提升9.0%和7.5%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15228 2026-03-18 cs.CV

HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization

HYDRA:通过表征协调的标记化统一多模态生成与理解

Xuerui Qiu, Yutao Cui, Guozhen Zhang, Junzhe Li, JiaKui Hu, Xiao Zhang, Yang Li, Songtao Liu, Miles Yang, Yu Shi, Zhao Zhong, Liefeng Bo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文英) Zhongguancun Academy(中关村学院) Nanjing University(南京大学) Peking University(北京大学)

AI总结 HYDRA通过表征协调的标记化统一多模态生成与理解,提出了一种新的统一框架,在单一参数空间内整合感知与生成,实验表明其在视觉重建和生成任务中均取得新突破。

Comments Work in progress: We are actively scaling up the models. More updates coming soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15011 2026-03-18 cs.CV

Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing

分子标识视觉提示与可验证强化学习用于化学反应图解析

Jiahe Song, Chuang Wang, Yinfan Wang, Hao Zheng, Rui Nie, Bowen Jiang, Xingjian Wei, Junyuan Gao, Yubin Wang, Bin Wang, Lijun Wu, Jiang Wu, Qian Yu, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Peking University(北京大学) South China Normal University(华南师范大学)

AI总结 本文提出IdtVP和Re3-DAPO方法,通过视觉提示和强化学习提升化学反应图解析的准确性和泛化能力,同时发布ScannedRxn基准数据集以评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23592 2026-03-18 cs.RO cs.AI cs.SE

KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning

KEEP: 一种面向高效具身规划的KV缓存中心化内存管理系统

Zebin Yang, Tong Xie, Baotong Lu, Shaoshan Liu, Bo Yu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究院) Microsoft Research(微软研究院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进创新中心)

AI总结 本文提出KEEP系统,通过静态动态内存构建算法、多跳内存重计算算法和层平衡内存加载,提升具身规划效率,实验表明在ALFRED数据集上速度提升2.68倍,优于CacheBlend方法。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22896 2026-03-18 cs.RO

DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation

DySL-VLA:通过动态-静态层跳过实现高效的视觉-语言-动作模型推理以用于机器人操作

Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究所) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

AI总结 本文提出DySL-VLA框架,通过动态跳过视觉-语言-动作层来降低计算成本,提升机器人操作任务的实时性能,实验表明在Calvin数据集上成功长度提升2.1%,参数减少85.7倍,速度提升3.75倍。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15190 2026-03-18 cs.LG cs.AI

Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning

遮蔽自回归变分加速:快速推理使强化学习实用

Yuxuan Gu, Weimin Bai, Yifei Wang, Weijian Luo, He Sun

机构 * Peking University(北京大学) Rice University(Rice大学) hi-lab, Xiaohongshu Inc(小红书实验室,小红书公司)

AI总结 本文提出MARVAL框架,通过压缩扩散链为单步自回归生成,提升推理效率并使强化学习实用化,实现了生成模型的快速采样和偏好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18546 2026-03-18 cs.RO cs.AI

EfficientNav: Towards On-Device Object-Goal Navigation with Navigation Map Caching and Retrieval

EfficientNav: 面向设备端目标物体导航的导航地图缓存与检索

Zebin Yang, Sunjian Zheng, Tong Xie, Tianshi Xu, Bo Yu, Fan Wang, Jie Tang, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

AI总结 本文提出EfficientNav,通过语义感知记忆检索和离散记忆缓存技术,在设备端实现零样本目标物体导航,提升成功率并降低规划延迟。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23359 2026-03-18 cs.CV

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

VideoReasonBench: 大规模语言模型能否进行以视觉为中心的复杂视频推理?

Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Moonshot AI Nanjing University(南京大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学)

AI总结 VideoReasonBench评估了基于视觉的复杂视频推理能力,发现大多数先进多模态语言模型在复杂视频推理任务上表现不佳,而增强推理能力的Gemini-2.5-Pro表现突出。

Comments Project Page: https://llyx97.github.io/video_reason_bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15186 2026-03-17 cs.RO

NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation

NavGSim: 高保真度高斯点扩散模拟器用于大规模导航

Jiahang Liu, Yuanxing Duan, Jiazhao Zhang, Minghan Li, Shaoan Wang, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot BAAI(中国人工智能研究院)

AI总结 NavGSim基于高斯点扩散框架,生成高保真度大规模导航环境,通过高斯点扩散切片技术提取可导航区域,提供多GPU支持的API,提升视觉-语言-动作模型的场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14989 2026-03-17 cs.CV

MMSpec: Benchmarking Speculative Decoding for Vision-Language Models

MMSpec:用于视觉-语言模型的推测解码基准测试

Hui Shen, Xin Wang, Ping Zhang, Yunta Hsieh, Qi Han, Zhongwei Wan, Ziheng Zhang, Jingxuan Zhang, Jing Xiong, Ziyuan Liu, Yifan Zhang, Hangrui Cao, Chenyang Zhao, Mi Zhang

机构 * University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学) Independent(独立) Indiana University(印第安纳大学) The University of Hong Kong(香港大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织)

AI总结 本文提出MMSpec基准,评估视觉-语言模型中的推测解码方法,发现文本模型在多模态场景下表现下降,视觉意识在大批次中更关键,且吞吐量提升不等于延迟降低,提出ViSkip方法实现最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13348 2026-03-17 cs.AI

AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints

AutoTool: 通过解耦熵约束实现强化学习中工具使用能力的自动扩展

Yirong Zeng, Xiao Ding, Yufei Liu, Yuxian Wang, Qunyao Du, Yutai Hou, Wu Ning, Haonan Song, Duyu Tang, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology, SCIR Lib(哈尔滨工业大学,SCIR实验室) Peking University(北京大学) Huawei Technologies Ltd(华为技术有限公司)

AI总结 本文提出AutoTool方法,通过解耦熵约束实现强化学习中工具使用能力的自动扩展,提升模型在复杂问题上的表现,同时减少计算开销。

Comments ICLR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏