arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-06-25 至 2026-06-25 共收录 10
2606.26006 2026-06-25 cs.RO cs.AI 新提交

FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation

FORCE: 通过值校准预热和自蒸馏实现高效的VLA强化学习微调

Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu, Yaoxu Lyu, Xiaojie Zhang, Haoran Li, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)

AI总结 提出FORCE框架,通过值校准预热和自蒸馏解决VLA模型RL微调中的样本效率低和初始遗忘问题,在仿真和真实任务中成功率提升79%,训练加速32.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25985 2026-06-25 cs.RO 新提交

Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

Action ControlNet: 一种轻量级延迟感知适配器,用于视觉-语言-动作模型中的平滑异步控制

Tiecheng Guo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

AI总结 提出Action ControlNet,一种轻量级延迟感知适配器,通过将已执行的动作后缀作为残差条件,在不重新训练骨干网络的情况下,减少异步执行中的动作不连续和抖动,提升机器人操控的鲁棒性和平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25960 2026-06-25 cs.AI 新提交

Agentic System as Compressor: Quantifying System Intelligence in Bits

智能体系统作为压缩器:用比特数衡量系统智能

Zihan Qin, Hongrui Zhang

机构 * Peking University(北京大学)

AI总结 提出将智能体系统视为压缩器,通过算术编码等方法以比特数衡量系统智能,在五个任务中验证智能体组件能减少编码长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25757 2026-06-25 cs.CL 新提交

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

OPERA: 通过基于客观困惑度的强化学习对齐开放式推理

Wenxuan Jiang, Zining Fan, Zijian Zhang, Xuecheng Wu, Hongming Tan, Haoyang Dai, Xiaoyu Li, Xuezhi Cao, Ninghao Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Meituan Longcat Team(美团龙猫团队) Peking University(北京大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 提出OPERA方法,利用困惑度动态作为内在奖励信号,结合冷启动数据合成和困惑度优先的推理轨迹选择,实现开放式任务中对齐,在Qwen3-8B上达到开源模型最优。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25295 2026-06-25 cs.RO 新提交

DynaMOMA: Instantaneous Prediction of Grasp Poses for Mobile Manipulation of Dynamic Objects

DynaMOMA:动态物体移动操作的抓取姿态瞬时预测

Zhinan Yu, Junyan Xu, Jiazhao Zhang, Zheng Qin, Yijie Tang, Yuhang Huang, Yihan Cao, Zhiyuan Yu, Yongjun Wang, Renjiao Yi, Chenyang Zhu, Kai Xu

机构 * National University of Defense Technology(国防科技大学) CFCS, Peking University(北京大学前沿计算研究中心) Defense Innovation Institute, Academy of Military Sciences(军事科学院国防科技创新研究院) Wuhan University(武汉大学) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院产业人工智能研究院)

AI总结 提出DynaMOMA框架,结合基于锚点的扩散模型预测瞬时抓取轨迹与全身控制策略,实现动态物体移动操作,在仿真和真实实验中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25661 2026-06-25 cs.CV 版本更新

DRM: Diffusion-based Reward Model With Step-wise Guidance

DRM: 基于扩散的奖励模型与逐步引导

Jaxon Zhang, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20183 2026-06-25 cs.CV 版本更新

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

MSAVBench:面向多镜头音频-视频生成的全面可靠评估

Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02596 2026-06-25 cs.CL 版本更新

An Empirical Study of Many-Shot In-Context Learning for Machine Translation of Low-Resource Languages

面向低资源语言机器翻译的多示例上下文学习的实证研究

Yinhan Lu, Gaganpreet Jhajj, Chen Zhang, Anietie Andy, David Ifeoluwa Adelani

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Athabasca University(阿特拉斯大学) Peking University(北京大学) Howard University(霍华德大学)

AI总结 本研究实证分析多示例上下文学习在低资源语言机器翻译中的效果,发现BM25检索可大幅提升数据效率,且ICL能在微调基础上带来额外增益。

Comments 24 pages, 3 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00585 2026-06-25 cs.AI 版本更新

Exploring Information Seeking Agent Consolidation

探索信息寻求智能体整合

Guochen Yan, Jialong Wu, Zhengwei Tao, Bo Li, Qintong Zhang, Jiahao Xu, Haitao Mi, Yuejian Fang, Qingni Shen, Wentao Zhang, Zhonghai Wu

机构 * Peking University(北京大学) Tencent(腾讯)

AI总结 通过系统实证研究,比较数据级混合与参数级合并两种范式,发现参数级合并能以更低成本达到数据混合的性能,并保留跨域能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16863 2026-06-25 cs.CV cs.AI cs.CL 版本更新

Position: Reasoning After Perception Means Reasoning Without Vision

立场:感知之后推理意味着无视觉推理

Hongcheng Gao, Zihao Huang, Jingyi Tang, Lin Xu, Xinhao Li, Haoyang Li, Yue Liu, Minhua Lin, Xinlong Yang, Taihang Hu, Ge Wu, Balong Bi, Hongyu Chen, Olive Huang, Wentao Zhang

机构 * Tsinghua University(清华大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Nanjing University(南京大学) Nankai University(南开大学)

AI总结 本文质疑多模态研究中语言推理能弥补视觉缺陷的假设,提出“感知-推理”范式导致视觉推理退化为文本空间推理,并通过图灵眼测试验证文本推理无法修复感知失败,主张转向感知内的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏