arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 382
2606.27739 2026-06-29 cs.LG 新提交

The Weakest Link Tells It All: Outcome-Supervised Process Reward Modeling via Learnable Credit Assignment

最薄弱的环节说明一切:通过可学习信用分配的结果监督过程奖励建模

Tianyu Jia, Yue Fang, Hongxin Ding, Rihong Qiu, Zhibang Yang, Zhijing Wu, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) GRG Banking Equipment Co., Ltd.(广电运通金融电子股份有限公司) Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学(天津滨海)信息技术研究院)

AI总结 提出LCA框架,通过可学习信用分配解决结果监督过程奖励模型中的信用分配问题,在多个任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27161 2026-06-26 cs.AI 新提交

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

TOPS:通过构建令牌最优保留集实现高效多模态大语言模型推理的第一性原理视觉令牌剪枝

Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

AI总结 提出TOPS方法,基于信息论分析确立任务相关性、信息覆盖和语义多样性三大原则,无训练且模型无关地剪枝视觉令牌,在LLaVA-NeXT上剪除77.8%令牌仍保持甚至提升性能。

Comments 27 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27014 2026-06-26 cs.LG 新提交

A Generalization Theory for JEPA-Based World Models

基于JEPA的世界模型的泛化理论

Jingyi Cui, Qi Zhang, Hongwei Wen, Yisen Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) University of Sydney(悉尼大学)

AI总结 本文首次为JEPA世界模型建立泛化理论,将其预训练表述为条件谱图学习问题,并证明JEPA目标等价于动作条件共现矩阵的低秩分解,进而推导出有限样本泛化界,揭示了潜在维度在近似误差与样本误差之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26916 2026-06-26 cs.CV 新提交

PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation

PhysRAG: 通过检索增强生成提升视频生成中的物理感知

Kexu Cheng, Zicheng Liu, Mingju Gao, Chunhe Song, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

AI总结 提出PhysRAG管道,利用检索增强生成(RAG)和可学习查询注入物理知识,在7K高质量视频上训练,在PhyGenBench和VBench上达到最优视觉质量和物理规则遵从性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26899 2026-06-26 cs.AI 新提交

Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization

基于扩散Transformer的生成式检索:度量有序序列训练与混合策略偏好优化

Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

机构 * Peking University(北京大学)

AI总结 针对模式保持的属性检索任务,提出MO-DiT+HPPO框架,通过度量有序训练和混合策略偏好优化,在八个领域分割中七个取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26602 2026-06-26 cs.CV 新提交

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

DiCoBench: 通过差异性和共性视觉线索进行多图像细粒度感知的基准测试

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

AI总结 提出DiCoBench,一个包含765个样本的高分辨率多图像基准,通过差异性和共性视觉线索评估多模态大模型的细粒度感知能力,发现顶尖模型与人类准确率(98.3%)差距显著。

Comments Accepted by ECCV 2026. Project page with code: https://github.com/PKU-ICST-MIPL/DICO_Bench_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26455 2026-06-26 cs.CV cs.AI cs.LG 新提交

Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking

主动对抗扰动驱动的关联记忆检索用于RGB-事件视觉目标跟踪

Xiao Wang, Xufeng Lou, Zikang Yan, Lan Chen, Sibao Chen, Yaowei Wang, Yonghong Tian, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Electronic and Information Engineering, Anhui University(安徽大学电子信息工程学院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) School of Computer Science, Peking University(北京大学计算机学院) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)

AI总结 提出APRTrack框架,通过分层对抗扰动模拟模态退化与局部缺失,并设计足迹引导的通道校准Hopfield检索实现鲁棒的历史信息补偿,在多个数据集上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26196 2026-06-26 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

从结构到协同:多模态大语言模型中视觉-语言感知范式演进综述

Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(北京大学深圳研究生院电子与计算机工程学院) Institute of Artificial Intelligence (TeleAI), China Telecom and Northwestern Polytechnical University(中国电信与西北工业大学人工智能研究院(TeleAI))

AI总结 本文系统综述多模态大语言模型中统一视觉-语言感知的范式演进,提出五阶段分类法,梳理各阶段代表性方法,并指出开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26171 2026-06-26 cs.CV cs.AI 新提交

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

LCG: 基于稀疏关系注意力的一致长上下文图像生成

Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出LCG框架,利用稀疏关系注意力(SRA)和路由一致性约束(RCC),在长序列图像生成中保持语义和外观一致性,并构建了大规模数据集LCCD进行训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26006 2026-06-25 cs.RO cs.AI 新提交

FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation

FORCE: 通过值校准预热和自蒸馏实现高效的VLA强化学习微调

Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu, Yaoxu Lyu, Xiaojie Zhang, Haoran Li, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)

AI总结 提出FORCE框架,通过值校准预热和自蒸馏解决VLA模型RL微调中的样本效率低和初始遗忘问题,在仿真和真实任务中成功率提升79%,训练加速32.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25985 2026-06-25 cs.RO 新提交

Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

Action ControlNet: 一种轻量级延迟感知适配器,用于视觉-语言-动作模型中的平滑异步控制

Tiecheng Guo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

AI总结 提出Action ControlNet,一种轻量级延迟感知适配器,通过将已执行的动作后缀作为残差条件,在不重新训练骨干网络的情况下,减少异步执行中的动作不连续和抖动,提升机器人操控的鲁棒性和平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25960 2026-06-25 cs.AI 新提交

Agentic System as Compressor: Quantifying System Intelligence in Bits

智能体系统作为压缩器:用比特数衡量系统智能

Zihan Qin, Hongrui Zhang

机构 * Peking University(北京大学)

AI总结 提出将智能体系统视为压缩器,通过算术编码等方法以比特数衡量系统智能,在五个任务中验证智能体组件能减少编码长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25757 2026-06-25 cs.CL 新提交

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

OPERA: 通过基于客观困惑度的强化学习对齐开放式推理

Wenxuan Jiang, Zining Fan, Zijian Zhang, Xuecheng Wu, Hongming Tan, Haoyang Dai, Xiaoyu Li, Xuezhi Cao, Ninghao Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Meituan Longcat Team(美团龙猫团队) Peking University(北京大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 提出OPERA方法,利用困惑度动态作为内在奖励信号,结合冷启动数据合成和困惑度优先的推理轨迹选择,实现开放式任务中对齐,在Qwen3-8B上达到开源模型最优。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25295 2026-06-25 cs.RO 新提交

DynaMOMA: Instantaneous Prediction of Grasp Poses for Mobile Manipulation of Dynamic Objects

DynaMOMA:动态物体移动操作的抓取姿态瞬时预测

Zhinan Yu, Junyan Xu, Jiazhao Zhang, Zheng Qin, Yijie Tang, Yuhang Huang, Yihan Cao, Zhiyuan Yu, Yongjun Wang, Renjiao Yi, Chenyang Zhu, Kai Xu

机构 * National University of Defense Technology(国防科技大学) CFCS, Peking University(北京大学前沿计算研究中心) Defense Innovation Institute, Academy of Military Sciences(军事科学院国防科技创新研究院) Wuhan University(武汉大学) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院产业人工智能研究院)

AI总结 提出DynaMOMA框架,结合基于锚点的扩散模型预测瞬时抓取轨迹与全身控制策略,实现动态物体移动操作,在仿真和真实实验中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24742 2026-06-24 cs.RO 新提交

World Value Models for Robotic Manipulation

机器人操作的世界价值模型

Zhihao Wang, Jianxiong Li, Yu Cui, Yuan Gao, Xianyuan Zhan, Junzhi Yu, Xiao Ma

机构 * Peking University(北京大学) Tsinghua University(清华大学)

AI总结 提出世界价值模型(WVM),融合世界模型与价值估计,通过时序建模评估数据质量,在标准基准和次优轨迹基准上达到SOTA,提升策略学习性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24561 2026-06-24 cs.CV 新提交

Quantum CT via Dynamic Interval Encoding and Prior-Balanced QUBO Reconstruction

基于动态区间编码和先验平衡QUBO重建的量子CT

Ao Wang, Yikuang Yuluo, Yujie Liu, Shuangyang Zhong, Yuwen Zhang, Zihao Wang, Fenglin Liu, Andreas Maier, Haijun Yu, Yixing Huang

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究院) Pattern Recognition Lab (LME), Department of Computer Science, Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU)(埃尔朗根-纽伦堡大学计算机科学系模式识别实验室) Key Lab of Optoelectronic Technology and Systems and the Engineering Research Center of Industrial Computed Tomography Nondestructive Testing, Ministry of Education, Chongqing University(重庆大学光电技术及系统教育部重点实验室和工业计算机断层成像无损检测工程研究中心)

AI总结 提出一种基于QUBO的灰度CT重建框架,通过动态区间编码和先验平衡优化,在稀疏视角和有限角度实验中优于多种基线方法,并可在混合量子-经典后端执行。

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24510 2026-06-24 cs.AI cs.CL 新提交

A specialized reasoning large language model for accelerating rare disease diagnosis: a randomized AI physician assistance trial

一种用于加速罕见病诊断的专用推理大语言模型:随机AI辅助医生试验

Haichao Chen, Songchi Zhou, Zhengyun Zhao, Shikai Hu, Xianghong Jin, Hongwei Ji, Li He, Shuli Li, Yiming Qin, Xin Tan, Runfeng Shi, Yih Chung Tham, Jiaye Zhu, Ye Li, Ye Jin, Longhao Cao, Dawei Li, Honghan Wu, Hongqiu Gu, Guanqiao Li, Tudor Groza, Chunying Li, Dian Zeng, Weihong Yu, Gareth Baynam, Saumya Shekhar Jamuar, Min Shen, Shuyang Zhang, Bin Sheng, Sheng Yu, Tien Yin Wong

机构 * Tsinghua Medicine, Tsinghua University(清华大学医学部,清华大学) Department of Ophthalmology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院眼科,中国医学科学院 & 北京大学医学部) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) Department of Rheumatology and Clinical Immunology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院风湿免疫科,中国医学科学院 & 北京大学医学部) Department of Rare Diseases, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院罕见病科,中国医学科学院 & 北京大学医学部) Department of Dermatology, Xijing Hospital, Air Force Medical University(西安空军军医大学西京医院皮肤科) School of Computer Science and Technology, East China Normal University (ECNU)(东华大学计算机科学与技术学院) Department of Neurosurgery, Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院神经外科) Department of Ophthalmology, National University of Singapore(新加坡国立大学眼科) Singapore Eye Research Institute, Singapore National Eye Centre(新加坡眼科学研究所,新加坡国家眼科中心) Ophthalmology and Visual Science Academic Clinical Program, Duke-NUS Medical School(杜克-国立新加坡大学医学学校眼科与视觉科学学术临床项目) Department of Pediatrics, The First Hospital of Tsinghua University(清华大学第一医院儿科) College of Future Technology, Peking University(北京大学未来技术学院) School of Health and Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院)

AI总结 提出开源推理大模型RaDaR(32B参数),通过增强推理训练和合成数据,在罕见病诊断中超越DeepSeek-R1等模型,随机试验显示其辅助使医生诊断准确率提升21.44个百分点。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24479 2026-06-24 cs.CV 新提交

MambaRaw: Selective State Space Modeling for Efficient 4K Raw Image Reconstruction

MambaRaw: 基于选择性状态空间建模的高效4K原始图像重建

Peize Li, Fanhu Zeng, Tongda Xu, Xingguo Xu, Xinjie Zhang, Xingtong Ge, Haotian Zhang, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Dalian University of Technology(大连理工大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 提出MambaRaw框架,利用状态空间模型高效估计熵参数,通过TileMambaBlock和能量感知精化模块实现4K原始图像的高效重建,在三个相机数据集上达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23238 2026-06-24 cs.AI 新提交

HOLMES: Evaluating Higher-Order Logical Reasoning in LLMs

HOLMES: 评估大语言模型中的高阶逻辑推理

Yucheng Wu, Jundong Xu, Mingzhen Ju, Yue Yu, Chenpeng Wang, Haoxuan Li, Liangming Pan

机构 * State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) YiXin-AILab, YIXIN(YiXin-AILab,YIXIN)

AI总结 提出HOLMES基准,基于高阶逻辑评估LLM在规则、谓词和约束上的推理能力,发现当前模型平均准确率仅50.64%,揭示高阶符号推理是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23685 2026-06-23 cs.RO 新提交

LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation

LaST-HD:从可扩展人类数据中学习潜在物理推理以进行机器人操作

Jiaming Liu, Yinxi Wang, Chenyang Gu, Siyuan Qian, Xiangju Mi, Hao Chen, Jiawei Chen, Qingpo Wuwu, Xiaoqi Li, Nuowei Han, Yiming Zhang, Xuheng Zhang, Yang Yue, Yeqing Yang, Lei Wang, Peng Jia, Hao Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Aether Tech

AI总结 提出LaST-HD框架,通过将人手与机器人演示在共享潜在推理空间中对齐,利用未配对轨迹训练世界模型合成统一潜在目标,实现跨形态物理动力学内化,并开发低成本数据手套OOL Glove,结合混合训练策略,仅用少量人类数据即可达到高泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23626 2026-06-23 cs.LG cs.AI 新提交

DiT-Reward: Generative Representations for Text-to-Image Reward Modeling

DiT-Reward:文本到图像奖励建模的生成式表示

Yuanming Yang, Guoqing Ma, Bo Wang, Yuan Zhang, Wei Tang, Chenyi Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy, JD.com(京东探索研究院,京东) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Peking University(北京大学)

AI总结 提出DiT-Reward,利用预训练文本到图像扩散Transformer的生成表示进行奖励预测,在多个偏好基准上超越HPSv3,并实现1.65倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23449 2026-06-23 cs.AI cs.OS 新提交

AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction

AOHP:一个用于个性化、高效和安全交互的开源操作系统级Agent框架

Shanhui Zhao, Jiacheng Liu, Guohong Liu, Jichao Yan, Jialei Ye, Yuhao Yang, Hao Wen, Shizuo Tian, Yizhen Yuan, Yuxuan Chen, Yunxin Liu, Ju Ren, Ya-Qin Zhang, Chao Huang, Yao Guo, Yuanchun Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) The University of Hong Kong(香港大学)

AI总结 提出AOHP,一个基于AOSP的操作系统级Agent框架,通过将Agent视为一等OS参与者,实现个性化服务组合、高效Agent接口和安全信息流,在任务完成率、令牌成本和策略合规性上优于现有系统。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23296 2026-06-23 cs.RO 新提交

IOI: Decoupling Kinematics and Physics for Interactive World Models

IOI: 解耦运动学与物理学的交互式世界模型

Chengyu Bai, Peidong Jia, Tiecheng Guo, Yukai Wang, Rui Ma, Fangyuan Zhao, Chunkai Fan, Xiaobao Wei, Jintao Chen, Hao Wang, Ying Li, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Peking University(北京大学)

AI总结 提出IOI混合交互式世界模型,通过显式运动学先验与学习物理动力学解耦,实现精确控制对齐和物理合理视觉反馈,在RoboTwin基准上达到最优仿真性能与零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23254 2026-06-23 cs.CV cs.AI 新提交

SteerVTE: Seamless Video Text Editing with Style and Glyph Control

SteerVTE: 具有风格和字形控制的无缝视频文本编辑

Kai Zeng, Moran Li, Zhengwei Wang, Yingchen Yu, Yiheng Lin, Ruichuan An, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University(北京大学)

AI总结 提出SteerVTE框架,通过风格编码器和双粒度字形编码器控制冻结视频扩散模型,结合字形感知空间焦点损失和三阶段渐进训练,实现精确、连贯的视频文本编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23038 2026-06-23 cs.LG cs.AI 新提交

EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

EvoRubrics:通过对抗性协同进化为LLM强化学习提供动态评分准则作为奖励

Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Zheng Li, Jinyang Zhang, Zhijing Wu, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Peking University Information Technology Institute, Tianjin Binhai(北京大学滨海信息技术研究院) Research Institute, GRGBanking Equipment Co., Ltd.(广电运通金融电子股份有限公司研究院)

AI总结 提出EvoRubrics框架,通过策略LLM与评分准则生成器的对抗性协同进化,在训练中动态调整奖励标准,解决静态评分准则导致的奖励饱和与策略欺骗问题,实验表明其优于静态和动态基线,且自监督变体也能有效提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23023 2026-06-23 cs.CV 新提交

Boosting Neural Video Codec via Scale-Driven Online Flow Refinement

通过尺度驱动的在线光流细化提升神经视频编解码器

Tiange Zhang, Rongqun Lin, Haocheng Tang, Xiandong Meng, Weijia Jiang, Zhimeng Huang, Siwei Ma

机构 * Peking University Shenzhen Graduate School(北京大学深圳研究生院) Pengcheng Laboratory(鹏城实验室) City University of Hong Kong(香港城市大学) School of Computer Science, Peking University(北京大学计算机学院) Migu Interactive Entertainment Co., Ltd(咪咕互动娱乐有限公司)

AI总结 提出一种无需训练的尺度驱动在线光流细化方法(SOFR),通过多尺度运动信息动态融合来修正运动估计误差,在多种NVC框架上平均节省2.84%和4.05%码率。

Comments Accepted to ICME 2026 as an oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22995 2026-06-23 cs.LG cs.AI cs.CL 新提交

Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

组图策略优化用于长程智能体强化学习

Yunan Wang, Minghui Song, Zihan Zhang, Shaohan Huang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Peking University(北京大学) Microsoft Corporation(微软公司)

AI总结 提出G2PO算法,通过构建全局状态转移图并引入组聚合状态值估计和边中心优势估计,解决长程智能体强化学习中的奖励稀疏和信用分配粗粒度问题,在WebShop等基准上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22948 2026-06-23 cs.AI cs.CV 新提交

ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents

ENVS:面向长程GUI智能体的环境原生验证搜索

Yincheng Zhou, Athena Zhuoming Zhong, Shijie Zhang, Kevin Zhang, Teresa Xiaotao Shang, Shanghang Zhang

机构 * University of Pennsylvania(宾夕法尼亚大学) Peking University(北京大学)

AI总结 提出ENVS方法,利用环境在训练时构建验证监督,通过分支搜索和全局平衡训练提升长程GUI任务性能,并引入OSWorld-Noisy基准测试抗干扰能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22835 2026-06-23 cs.CV cs.AI 新提交

OrthoMotion:Disentangling Camera and Subject Motion via Geometry Semantics Orthogonal Attention

OrthoMotion:通过几何语义正交注意力解耦相机与主体运动

Zijie Meng

机构 * Peking University(北京大学)

AI总结 提出OrthoMotion方法,通过将相机运动编码为几何通道(旋转位置嵌入相位旋转)和主体运动编码为语义通道(门控值注入交叉注意力),并利用正交正则化保证解耦,实现可控视频生成中相机与主体运动的独立控制,将串扰降低2.4倍以上。

Comments Accepted by SCA2026(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22525 2026-06-23 cs.CV 新提交

Projection-Volume Fidelity Divergence: Diagnosing and Controlling Optimization Drift in Sparse-View 3D Gaussian Tomography

投影-体积保真度散度:稀疏视角三维高斯层析成像中优化漂移的诊断与控制

Yikuang Yuluo, Ao Wang, Shen Kuan, Yujie Liu, Wang Liao, Ying Chen, Shuangyang Zhong, Yixing Huang, Fuquan Wang

机构 * Chongqing University(重庆大学) Peking University Health Science Center(北京大学医学部)

AI总结 针对稀疏视角CT重建中投影域优化导致体积退化的问题,提出LADES控制器,通过线性退火丢弃和结构感知早停抑制高斯变形与共适应,提升体积保真度并减少训练时间。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏