arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3042
2601.08133 2026-03-03 cs.CV cs.AI

How Do Optical Flow and Textual Prompts Collaborate to Assist in Audio-Visual Semantic Segmentation?

光学流和文本提示如何协作以辅助音频视觉语义分割?

Yujian Lee, Peng Gao, Yongqi Xu, Wentao Fan

机构 * Hong Kong Baptist University(香港 Baptist 大学) Guangdong Provincial/Zhuhai Key Laboratory IRADS(广东省级/珠海关键实验室 IRADS) Department of Computer Science, Beijing Normal-Hong Kong Baptist University, Zhuhai, China(计算机科学系,北京师范大学-香港 Baptist 大学,珠海,中国) Peking University, Shenzhen Graduate School, Shenzhen, China(北京大学,深圳研究生院,深圳,中国)

AI总结 SSP通过整合光学流和文本提示,提升音频视觉语义分割的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01694 2026-03-03 cs.CV cs.AI cs.LG

MVR: Multi-view Video Reward Shaping for Reinforcement Learning

MVR:多视图视频奖励塑造用于强化学习

Lirui Luo, Guoxi Zhang, Hongming Xu, Yaodong Yang, Cong Fang, Qing Li

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)

AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01639 2026-03-03 cs.CL

Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning

学习草稿:基于强化学习的自适应推测解码

Jiebin Zhang, Zhenghan Yu, Liang Wang, Nan Yang, Eugene J. Yu, Zheng Li, Yifan Song, Dawei Zhu, Xingxing Zhang, Furu Wei, Sujian Li

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(多媒体信息处理国家级重点实验室,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 LTD通过强化学习优化草稿-验证循环的吞吐量,实现比现有方法更高的解码效率。

Comments 22pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01416 2026-03-03 cs.AI

Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search Agents

保障地板,提升天花板:一种基于合并的多模态搜索代理范式

Zhixiang Wang, Jingxuan Xu, Dajun Chen, Yunfang Wu, Wei Jiang, Yong Li

机构 * Peking University, Beijing, China(北京大学)

AI总结 本文提出一种无需训练的多模态搜索代理范式,通过跨模态模型合并提升VLMs的自主搜索能力,OBM算法在搜索任务中表现出更高的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01083 2026-03-03 cs.CV

Can Vision Language Models Assess Graphic Design Aesthetics? A Benchmark, Evaluation, and Dataset Perspective

视觉语言模型能否评估图形设计的审美?一个基准、评估和数据集的视角

Arctanx An, Shizhao Sun, Danqing Huang, Mingxi Cheng, Yan Gao, Ji Li, Yu Qiao, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院) Microsoft(微软) Central South University(中南大学)

AI总结 本文提出AesEval-Bench基准,系统评估视觉语言模型在图形设计审美评估中的性能,并构建训练数据集以提升模型在该领域的表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23893 2026-03-03 cs.CV cs.RO

AoE: Always-on Egocentric Human Video Collection for Embodied AI

AoE: 始终在线的以自身为中心的人类视频采集用于具身AI

Bowen Yang, Zishuo Li, Yang Sun, Changtao Miao, Yifan Yang, Man Luo, Xiaotong Yan, Feng Jiang, Jinchuan Shi, Yankai Fu, Ning Chen, Junkai Zhao, Pengwei Wang, Guocai Yao, Shanghang Zhang, Hao Chen, Zhe Li, Kai Zhu

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhejiang University(浙江大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 AoE系统通过利用人类和智能手机低成本采集以自身为中心的现实世界交互数据,解决具身AI的数据稀缺问题,提升现实世界泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09463 2026-03-03 cs.AI

SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning

SpotAgent:通过代理推理在大视觉语言模型中实现视觉地理定位

Furong Jia, Ling Dai, Wenjin Deng, Fan Zhang, Chen Hu, Daxin Jiang, Yu Liu

机构 * Peking University(北京大学) StepFun

AI总结 SpotAgent通过代理推理提升大视觉语言模型在地理定位中的表现,结合外部工具验证和强化学习优化,实现更精确和可靠的定位结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19473 2026-03-03 cs.LG cs.AI

WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning

WavefrontDiffusion: 动态解码调度以提升推理性能

Haojin Yang, Rui Hu, Zequn Sun, Rui Zhou, Yujun Cai, Yiwei Wang

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) The University of Queensland(昆士兰大学) University of California, Merced(加州大学梅尔德分校)

AI总结 WavefrontDiffusion通过动态解码调度提升推理和代码生成的性能与语义连贯性。

Comments 19 pages. 3 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19400 2026-03-03 cs.CV

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力

Zhiyuan Feng, Zhaolu Kang, Qijie Wang, Zhiying Du, Jiongrui Yan, Shubin Shi, Chengbo Yuan, Huizhi Liang, Yu Deng, Qixiu Li, Rushuai Yang, Arctanx An, Leqi Zheng, Weijie Wang, Shawn Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。

Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13888 2026-03-03 cs.CL cs.AI

Reliable Fine-Grained Evaluation of Natural Language Math Proofs

自然语言数学证明的可靠细粒度评估

Wenjie Ma, Andrei Cojocaru, Neel Kolhe, Bradley Louie, Robin Said Sharif, Haihan Zhang, Vincent Zhuang, Matei Zaharia, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Peking University(北京大学) Allen Institute for AI(人工智能研究院)

AI总结 本研究提出ProofGrader,通过结合强推理模型、丰富上下文和简单集成方法,实现对LLM生成数学证明的细粒度评估,有效提升证明生成任务的可靠性。

Comments 40 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21057 2026-03-03 cs.CR cs.CL

PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints

PMark: 向鲁棒且无失真语义级水印技术迈进:在通道约束下

Jiahao Huo, Shuliang Liu, Bin Wang, Junyan Zhang, Yibo Yan, Aiwei Liu, Xuming Hu, Mingxun Zhou

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 PMark通过代理函数框架实现鲁棒且无失真的语义级水印技术,提升对改写攻击的鲁棒性并优化采样效率。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15281 2026-03-03 cs.IR cs.LG

MMQ: Multimodal Mixture-of-Quantization Tokenization for Semantic ID Generation and User Behavioral Adaptation

MMQ: 多模态混合量化标记化用于语义ID生成和用户行为适应

Yi Xu, Moyu Zhang, Chenxuan Li, Zhihao Liao, Haibo Xing, Hao Deng, Jinxin Hu, Yu Zhang, Xiaoyi Zeng, Jing Zhang

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Wuhan University, School of Computer Science(武汉大学计算机学院)

AI总结 MMQ通过多模态混合量化标记化方法,解决推荐系统中多模态协同、特定性和行为适应的挑战,提升语义ID生成和用户行为适应能力。

Journal ref Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16145 2026-03-03 cs.AI cs.CL

SpiroLLM: Finetuning Pretrained LLMs to Understand Spirogram Time Series with Clinical Validation in COPD Reporting

SpiroLLM:通过临床验证在COPD报告中微调预训练大语言模型以理解肺功能时间序列

Shuhao Mei, Yongchao Long, Xiaoyu Xiao, Shan Cao, Xiaobo Han, Shijia Geng, Jinbo Sun, Yuxi Zhou, Shenda Hong

机构 * Guangzhou Institute of Technology, Xidian University, Xi’an, China(广州科技研究院,西安电子科技大学,中国) Department of Computer Science, Tianjin University of Technology, Tianjin, China(天津理工大学计算机学院,天津,中国) Department of Respiratory, The Second Hospital of Tianjin Medical University, China(天津医科大学第二医院呼吸科,中国) College of Pulmonary and Critical Care Medicine, Chinese PLA General Hospital, Beijing, China(中国人民解放军总医院呼吸与危重症医学科,北京,中国) HeartVoice Medical Technology, Hefei, China(合肥心声医疗技术有限公司,中国) School of Life Science and Technology, Xidian University, Xi’an, China(西安电子科技大学生命科学与技术学院,中国) National Institute of Health Data Science, Peking University, Beijing, China(北京大学国家健康数据科学研究院,北京,中国) Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院,北京,中国)

AI总结 SpiroLLM通过融合生理信号与大语言模型,实现对肺功能时间序列的解读,并在COPD诊断中展现出高准确性和稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16395 2026-03-03 cs.CL

OJBench: A Competition Level Code Benchmark For Large Language Models

OJBench: 一个面向大语言模型的竞赛级代码基准

Zhexu Wang, Yiping Liu, Yejie Wang, Wenyang He, Bofei Gao, Muxi Diao, Yanxu Chen, Kelin Fu, Flood Sung, Zhilin Yang, Tianyu Liu, Weiran Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Moonshot AI

AI总结 OJBench是一个用于评估大语言模型竞赛级代码推理能力的基准,通过232个编程竞赛问题揭示了现有模型在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12988 2026-03-03 cs.AR cs.AI

ROMA: a Read-Only-Memory-based Accelerator for QLoRA-based On-Device LLM

ROMA: 一种基于只读存储器的QLoRA加速器

Wenqiang Wang, Yijia Zhang, Zikai Zhang, Guanting Huo, Hao Liang, Shijie Cao, Ningyi Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Huixi Intelligence(汇溪智能) Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 ROMA是一种基于只读存储器的QLoRA加速器,通过混合存储架构和B-ROM设计,实现高效存储和加速LLM在边缘设备上的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04490 2026-03-03 cs.CL q-bio.GN

Large Language Models in Bioinformatics: A Survey

大语言模型在生物信息学中的应用:综述

Zhenyu Wang, Zikang Wang, Jiyue Jiang, Pengan Chen, Xiangyu Shi, Yu Li

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University Third Hospital(北京大学第三医院) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学)

AI总结 本文综述了大语言模型在生物信息学中的应用,涵盖基因组序列建模、RNA结构预测等核心方法,并探讨了数据稀缺和跨组学整合等挑战及未来发展方向。

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00985 2026-03-03 cs.CV

The Texture-Shape Dilemma: Boundary-Safe Synthetic Generation for 3D Medical Transformers

纹理-形状困境:面向3D医学变换器的边界安全合成生成

Jiaqi Tang, Weixuan Xu, Shu Zhang, Fandong Zhang, Qingchao Chen

机构 * Peking University(北京大学) Central South University(中南大学) Deepwise Ltd.(深域科技)

AI总结 本文提出一种物理启发式的空间解耦合成框架,解决3D医学变换器中纹理与形状之间的矛盾,提升模型对真实解剖边缘的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00979 2026-03-03 cs.CV

Fake It Right: Injecting Anatomical Logic into Synthetic Supervised Pre-training for Medical Segmentation

伪造正确:将解剖学逻辑注入合成监督预训练以进行医学分割

Jiaqi Tang, Mengyan Zheng, Shu Zhang, Fandong Zhang, Qingchao Chen

机构 * Peking University(北京大学) Beihang University(北航) Deepwise Ltd.(深睿科技)

AI总结 本文提出了解剖学指导的合成监督预训练框架,通过结合FDSL与解剖学现实,提升医学分割的性能和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00977 2026-03-03 cs.AI cs.LG

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents

HiMAC:用于长视界LLM代理的分层宏微学习

Hongbo Jin, Rongpeng Zhu, Jiayu Ding, Wenhao Zhang, Ge Li

机构 * School of Electronic and Computer Engineering(电子与计算机工程学院) Peking University(北京大学)

AI总结 HiMAC通过分层宏微学习框架,提升LLM代理在长视界任务中的规划与执行能力,实现更高效的强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00792 2026-03-03 cs.LG cs.AI

Neural Latent Arbitrary Lagrangian-Eulerian Grids for Fluid-Solid Interaction

神经潜在任意拉格朗日-欧拉网格用于流固耦合

Shilong Tao, Zhe Feng, Shaohan Chen, Weichen Zhang, Zhanxing Zhu, Yunhuai Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) School of Electrical and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院)

AI总结 Fisale通过多尺度潜在ALE网格和分区耦合模块,实现复杂双向流固耦合问题的高效建模与学习。

Comments Proceedings of the 14th International Conference on Learning Representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00724 2026-03-03 cs.CL

RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models

RLAR:一种用于大型语言模型多任务强化学习的代理奖励系统

Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen, Yidong Wang, Yu Luo, Hongning Wang, Minlie Huang

机构 * Tsinghua Univeristy(清华大学) Peking University(北京大学)

AI总结 RLAR通过动态生成奖励函数提升大型语言模型在多任务强化学习中的性能和泛化能力。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00716 2026-03-03 cs.LG stat.ML

Frozen Policy Iteration: Computationally Efficient RL under Linear $Q^π$ Realizability for Deterministic Dynamics

冻结策略迭代:在确定性动态下线性$Q^π$可实现性下的计算高效强化学习

Yijing Ke, Zihan Zhang, Ruosong Wang

机构 * School of EECS, Peking University(北京大学电子工程系) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) CFCS and School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出冻结策略迭代算法,在确定性动态下实现计算高效的强化学习,通过在线策略迭代和冻结策略技术,达到最优 regrets bound。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00560 2026-03-03 cs.CV cs.AI

Geometry OR Tracker: Universal Geometric Operating Room Tracking

几何手术室跟踪器:通用几何手术室跟踪

Yihua Shao, Kang Chen, Feng Xue, Siyu Chen, Long Bai, Hongyuan Yu, Hao Tang, Jinlin Wu, Nassir Navab

机构 * Centre for Artificial Intelligence and Robotics(人工智能与机器人中心) Hong Kong Institute of Science and Innovation Chinese Academy of Sciences(香港科学与创新研究院中国科学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation Chinese Academy of Sciences (CASIA)(自动化研究所中国科学院(CASIA)) Peking University(北京大学) University of Trento, Trento, Italy(意大利特伦特大学) Alibaba DAMO Academy(阿里达摩院) Xiaomi Inc.(小米公司) Technische Universität München(慕尼黑技术大学)

AI总结 Geometry OR Tracker通过多视角几何校正和鲁棒3D点跟踪提升手术室多视角3D跟踪的几何一致性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00532 2026-03-03 cs.AI

DenoiseFlow: Uncertainty-Aware Denoising for Reliable LLM Agentic Workflows

DenoiseFlow:面向可靠LLM代理工作流的不确定性感知去噪

Yandong Yan, Junwei Peng, Shijie Li, Chenxi Li, Yifei Shang, Can Deng, Ruiting Dai, Yongqiang Zhao, Jiaqi Zhu, Yu Huang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) SKLCCSE, School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Key Laboratory of High Confidence Software Technologies(PKU), MOE(北京大学高可信软件技术重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心)

AI总结 DenoiseFlow通过闭环框架实现多步推理的不确定性感知去噪,提升LLM代理工作流的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00458 2026-03-03 cs.CV

Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution

改进的对抗扩散压缩用于现实世界视频超分辨率

Bin Chen, Weiqi Li, Shijie Zhao, Xuanyu Zhang, Junlin Li, Li Zhang, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) ByteDance Inc(字节跳动公司)

AI总结 本文提出改进的对抗扩散压缩方法,通过蒸馏和轻量化设计,实现现实世界视频超分辨率的高效模型压缩,显著提升效率并保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00397 2026-03-03 cs.LG

TENG-BC: Unified Time-Evolving Natural Gradient for Neural PDE Solvers with General Boundary Conditions

TENG-BC:用于具有通用边界条件的神经PDE求解器的统一时间演进自然梯度

Hongjie Jiang, Di Luo

机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) Department of Physics, Tsinghua University, Beijing, China(清华大学物理系) Institute of Advanced Study, Tsinghua University, Beijing, China(清华大学advanced study研究所)

AI总结 TENG-BC通过统一时间演进自然梯度方法,实现对具有通用边界条件的神经PDE求解器的高精度求解,优于传统方法和PINN基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19691 2026-03-03 stat.ML cs.LG cs.NA math.NA

Smoothness Adaptivity in Constant-Depth Neural Networks: Optimal Rates via Smooth Activations

常深神经网络中的平滑适应性:通过平滑激活函数实现最优速率

Yuhao Liu, Zilin Wang, Lei Wu, Shaobo Zhang

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) AI for Science Institute, Beijing(北京人工智能科学研究院)

AI总结 本研究证明,使用平滑激活函数的常深神经网络能够通过增加宽度实现最优的平滑适应性,而非平滑激活函数如ReLU则受限于深度增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02108 2026-03-03 cs.CL

Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts

突破内存瓶颈:支持百万级上下文的高效训练系统

Wenhao Li, Daohai Yu, Gen Luo, Yuxin Zhang, Fei Chao, Rongrong Ji, Yifan Wu, Jiaxin Liu, Ziyang Gong, Zimu Liao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing Ministry of Education of China(教育部多媒体可信感知与高效计算重点实验室) Xiamen University(厦门大学) Peking University(北京大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 OOMB通过高效内存管理实现百万级上下文LLM训练,显著降低内存开销,提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08427 2026-03-03 cs.CL cs.LG

Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering

沉默法官:通过潜在几何聚类的自我验证强化学习

Nonghai Zhang, Weitao Ma, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu

机构 * Meituan(美团) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出Latent-GRPO框架,通过潜在空间几何聚类生成内在奖励,提升大语言模型推理性能并加速训练过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06267 2026-03-03 cs.RO

Robust Differentiable Collision Detection for General Objects

鲁棒可微碰撞检测用于通用物体

Jiayi Chen, Wei Zhao, Liangwang Ruan, Baoquan Chen, He Wang

机构 * Peking University(北京大学) Galbot Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出了一种鲁棒且高效的可微碰撞检测框架,支持凸和凹物体,通过基于距离的随机平滑、自适应采样和等价梯度传输提升梯度计算的鲁棒性和信息性,并在复杂网格上实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏