arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2605.08129 2026-05-12 cs.LG

Towards Customized Multimodal Role-Play

迈向定制化的多模态角色扮演

Chao Tang, Jianzong Wu, Qingyu Shi, Ye Tian, Aixi Zhang, Hao Jiang, Jiangning Zhang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 本文提出定制化多模态角色扮演任务,通过统一模型和两阶段训练框架实现角色个性化,实验表明方法在角色扮演任务中优于现有方法。

Comments Code available at https://github.com/Tangc03/UniCharacter Project page available at https://tangc03.github.io/UniCharacter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07877 2026-05-11 cs.RO

Melding LLM and temporal logic for reliable human-swarm collaboration in complex scenarios

将大语言模型与时序逻辑融合以实现复杂场景中可靠的人-群智协作

Junfeng Chen, Yuxiao Zhu, An Zhuo, Xintong Zhang, Shuo Zhang, Guanghui Wen, Xiwang Dong, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然与应用科学学院) School of Automaton, Southeast University(东南大学自动化学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

AI总结 本文提出一种神经符号框架,结合时序逻辑与大语言模型,实现长周期人-群智协作,通过形式化任务规划与上下文感知推理,提升动态环境中任务规划的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07872 2026-05-11 cs.CV cs.AI

Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models

视频理解奖励建模:一个稳健的基准和高效的奖励模型

Yuancheng Wei, Linli Yao, Lei Li, Haojie Zhang, Hao Zhou, Fandong Meng, Xu Sun

机构 * South China University of Technology(华南理工大学) Peking University(北京大学) The University of Hong Kong(香港大学) Tencent(腾讯)

AI总结 本文提出Video Understanding Reward Bench基准和VideoDRM/VideoGRM模型,通过大规模高质量数据提升视频理解奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07794 2026-05-11 cs.RO

NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models

NoiseGate: 在世界动作模型中学习每潜在时间步的调度作为信息门控

Wen Huang, Haoran Sun, Yongjian Guo, Yunxuan Ma, Haoran Li, Jing Long, Zhouying Mo, Zhong Guan, Yucheng Guo, Shuai Di, Junwu Xiong

机构 * Tsinghua University(清华大学) Peking University(北京大学) JDT AI Infra(JDT AI 基础设施) Tianjin University(天津大学)

AI总结 本文提出NoiseGate,通过学习每潜在时间步的调度作为信息门控策略,改进世界动作模型中的动作生成与未来观察建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07660 2026-05-11 cs.CL

Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning

并非所有令牌都以相同方式学习:注意力熵揭示了强化学习推理中的异质信号

Gengyang Li, Zheng-Fan Wu, Siqi Bao, Yunfang Wu

机构 * Baidu(百度) School of Computer Science, Peking University(北京大学计算机科学系) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

AI总结 研究通过注意力熵揭示强化学习推理中令牌层面的异质性,发现高熵令牌(探索者)与低熵令牌(锚点)在学习信号上有显著差异,动态熵感知的软重加权干预提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07593 2026-05-11 cs.CV

TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

TraceAV-Bench: 多跳轨迹推理长音频视频基准测试

Hengyi Feng, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhengyang Zhao, Zimo Meng, Zeang Sheng, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

AI总结 TraceAV-Bench首次评估多跳轨迹推理和多模态幻觉鲁棒性,包含2200道多选题,覆盖4个维度15个子任务,揭示多模态推理与幻觉鲁棒性脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05848 2026-05-11 cs.CV cs.AI

VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding

VideoRouter: 为高效长视频理解的查询适应双路由

Kuanwei Lin, Wenhao Zhang, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

AI总结 VideoRouter通过双路由框架实现高效长视频理解,通过语义路由和图像路由动态分配证据,减少冗余token,提升压缩效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04712 2026-05-11 cs.LG

SPHERE: Mitigating the Loss of Spectral Plasticity in Mixture-of-Experts for Deep Reinforcement Learning

SPHERE: 缓解混合专家在深度强化学习中的频谱可塑性损失

Lirui Luo, Guoxi Zhang, Hongming Xu, Cong Fang, Qing Li

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

AI总结 本文提出SPHERE,通过引入Parseval惩罚来缓解混合专家策略在持续学习中的频谱可塑性损失,提升了MetaWorld和HumanoidBench的持续强化学习性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03327 2026-05-11 cs.LG cs.AI

DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

DGPO:基于分布的策略优化用于细粒度信用分配

Hongbo Jin, Rongpeng Zhu, Zhongjing Du, Xu Jiang, Jingqi Tian, Qiaoman Zhang, Jiayu Ding

机构 * Peking University(北京大学) SJTU(上海交通大学) Tsinghua University(清华大学)

AI总结 DGPO通过引入分布引导的策略优化框架,解决传统方法在细粒度信用分配中的不足,通过Hellinger距离和熵门机制实现安全探索与有效区分真实推理突破,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19697 2026-05-11 cs.CV

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

揭示细粒度视觉痕迹:评估多模态交错推理链在多模态STEM任务中的表现

Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

机构 * Tsinghua University(清华大学) Meituan Inc(美团公司) Central South University(中南大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出StepSTEM基准,通过严格筛选的283个STEM问题,评估多模态大语言模型的跨模态推理能力,发现现有模型仍依赖文本推理,揭示了真实跨模态STEM推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07499 2026-05-11 cs.CV

Cloud-top infrared observations reveal the four-dimensional precipitation structure

积云红外观测揭示四维降水结构

Tianchi Xu, Ziqiang Ma, Andrea Marinoni, Yuanpeng He, Xiaoqing Li, Chuanfeng Zhao, Kang He, Jintao Xu, Bohan Zhou, Wenbo Zhao, Haoshuang Chen, Tun Wang, Dongdong Wang, Yang Hong

机构 * Institute of Remote Sensing and Geographical Information Systems, School of Earth and Space Sciences, Peking University(遥感与地理信息系统研究所,地球与空间科学学院,北京大学) Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Key Laboratory of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术重点实验室(北京大学),教育部;计算机科学学院,北京大学) School of Computer Science, Peking University(风云气象卫星创新中心,国家气象中心,中国气象局) Innovation Center for Fengyun Meteorological Satellite, National Meteorological Centre, China Meteorological Administration(大气与海洋科学系,物理学院,北京大学) Department of Atmospheric and Oceanic Sciences, School of Physics, Peking University(山地灾害环境研究所,中国科学院) Institute of Mountain Hazards and Environment, Chinese Academy of Sciences(土木工程与环境科学学院,俄克拉荷马大学) School of Civil Engineering and Environmental Science, University of Oklahoma

AI总结 本文提出4DPrecipNet框架,利用积云红外数据重建四维降水结构,揭示亚云降水的可观测性,通过物理约束深度学习方法实现降水垂直和时间演变的重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07398 2026-05-11 cs.CV cs.AI

Exposing and Mitigating Temporal Attack in Deepfake Video Detection

揭示并缓解深度伪造视频检测中的时间攻击

Zheyuan Gu, Minghao Shao, Zhen Wang, Yusong Wang, Mingkun Xu, Shijie Zhang, Hao Jiang

机构 * Peking University(北京大学) New York University(纽约大学) Huzhou University(湖州大学) Institute of Science Tokyo(东京科学研究院) Guangdong Institute of Intelligence Science and Technology(广东省智能科学与技术研究院)

AI总结 本文提出SpInShield框架,通过分离语义运动与可操控频谱特征,缓解深度伪造检测器对逃避攻击的脆弱性,并在模拟频谱攻击中提升AUC性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07346 2026-05-11 cs.CV

SoLAR: Error-Resilient Streamable Long-Horizon Free-Viewpoint Video Reconstruction with Anchor Activation and Latent Recalibration

SoLAR:基于锚点激活和潜在重构的抗误差流式长时自由视角视频重建

Haotian Zhang, Xu Mo, Yixin Yu, Guanhua Zhu, Jian Xue, Tongda Xu, Yan Wang, Jiaqi Zhang, Siwei Ma, Wen Gao

机构 * National Engineering Laboratory for Video Technology, School of Computer Science, Peking University(国家视频技术工程实验室,计算机科学学院,北京大学) School of Computer Science, Jilin University(吉林大学计算机科学学院) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

AI总结 SoLAR提出一种抗误差流式长时自由视角视频重建框架,通过动态锚点激活和潜在重构机制,在无需分组图像分区的情况下维持稳定重建质量,实现高效存储和实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07020 2026-05-11 cs.LG cs.AI

FlashMol: High-Quality Molecule Generation in as Few as Four Steps

FlashMol:在四步内生成高质量分子构象

Xinyuan Wei, Zian Li, Shaoheng Yan, Cai Zhou, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Yuanpei College, Peking University(北京大学元培学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

AI总结 FlashMol通过改进分布匹配蒸馏方法,在四步内生成高质量分子构象,实验表明其在速度和质量上优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06747 2026-05-11 cs.CV cs.RO

HumanNet: Scaling Human-centric Video Learning to One Million Hours

HumanNet: 将以人为中心的视频学习扩展到一百万小时

Yufan Deng, Daquan Zhou

机构 * Peking University(北京大学)

AI总结 HumanNet通过构建大规模人类活动视频数据集,探索以人为中心的视频在扩展具身基础模型中的潜力,展示其在动作生成和人机转移中的优势。

Comments Github: https://github.com/DAGroup-PKU/HumanNet Project website: https://dagroup-pku.github.io/HumanNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05949 2026-05-11 cs.AI cs.SE

MAS-Algorithm: A Workflow for Solving Algorithmic Programming Problems with a Multi-Agent System

MAS-Algorithm: 一个基于多智能体系统的算法问题求解工作流

Yuliang Xu, Xiang Xu, Yao Wan, Hu Wei, Tong Jia

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出MAS-Algorithm,通过多智能体工作流提升算法问题求解能力,实验显示在多个模型上均取得显著提升,包括接受率提升6.48%和LiveCodeBench-Pro上的4.72%提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05693 2026-05-11 cs.AI cs.LG

Saliency-Aware Regularized Quantization Calibration for Large Language Models

具有显著性感知的正则化量化校准用于大语言模型

Yanlong Zhao, Xiaoyuan Cheng, Huihang Liu, Baihua He, Xinyu Zhang, Harrison Bo Hua Zhu, Wenlong Chen, Li Zeng, Zhuo Sun

机构 * University of Science and Technology of China(中国科学技术大学) University College London(伦敦大学学院) Shanghai University of Finance and Economics(上海财经大学) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Copenhagen(哥本哈根大学) Imperial College London(伦敦帝国学院) Technical University of Denmark(丹麦技术大学) Peking University(北京大学)

AI总结 本文提出SARQC,通过引入显著性感知正则化改进量化校准,提升大语言模型的泛化能力,实验表明在密集和专家混合模型中提升了困惑度和零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18636 2026-05-11 cs.CV

Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering

注意力稀疏性是输入稳定的:通过离线稀疏性分析和在线QK共聚类实现训练自由的视频生成稀疏注意力

Jiayi Luo, Jiayu Chen, Jiankun Wang, Cong Wang, Hanxin Zhu, Qingyun Sun, Chen Gao, Zhibo Chen, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering, Beihang University(软件学院,北京航空航天大学) Beihang University(北京航空航天大学) School of Computer Science, Peking University(北京大学计算机学院) the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) BNRist, Tsinghua University(北京理工大学,清华大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出SVOO框架,通过离线层间稀疏性分析和在线双向共聚类实现训练自由的视频生成稀疏注意力,解决传统方法中层异质性和查询-键耦合问题,提升生成质量与速度的平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21858 2026-05-11 cs.AI

ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

ProactiveMobile: 一个全面的基准,用于提升移动设备上的主动智能

Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(小米公司HyperAI团队) Zhejiang University(浙江大学) Peking University(北京大学) Northeastern University(东北大学)

AI总结 本文提出ProactiveMobile基准,通过多模态大语言模型在移动代理中实现主动智能,通过63个API生成可执行函数序列,实验表明Qwen2.5-VL-7B-Instruct在主动智能任务中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10371 2026-05-11 cs.AI

AgentProg: Empowering Long-Horizon GUI Agents with Program-Guided Context Management

AgentProg: 通过程序引导的上下文管理赋能长周期GUI代理

Shizuo Tian, Hao Wen, Yuxuan Chen, Jiacheng Liu, Shanhui Zhao, Guohong Liu, Ju Ren, Yunxin Liu, Yuanchun Li

机构 * Tsinghua University(清华大学) Peking University(北京大学)

AI总结 本文提出AgentProg,通过将交互历史重构为程序结构,实现长周期GUI任务的高效上下文管理,实验表明其在AndroidWorld和扩展任务集上达到最优性能,并在长周期任务中保持稳健表现。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17656 2026-05-11 q-bio.QM cs.AI cs.LG

Pretraining a Foundation Model for Small-Molecule Natural Products

为小分子天然产物预训练一个基础模型

Yuheng Ding, Bo Qiang, Shaoning Li, Yiran Zhou, Jie Yu, Qi Li, Cheng Shi, Liangren Zhang, Yusong Wang, Nanning Zheng, Zhenming Liu

机构 * State Key Laboratory of Natural and Biomimetic Drugs(天然与仿生药物国家重点实验室) School of Pharmaceutical Sciences, Peking University(北京大学药学院)

AI总结 本文提出基于天然产物独特性质的预训练基础模型,通过对比学习和掩码图学习目标,提升分子骨架和侧链信息的表征能力,在天然产物挖掘和药物发现任务中取得SOTA成果。

Comments Accepted by Nature Machine Intelligence(2026)

Journal ref Nature Machine Intelligence(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06660 2026-05-08 cs.LG cs.AI cs.CL

Verifier-Backed Hard Problem Generation for Mathematical Reasoning

基于验证器的数学推理硬问题生成

Yuhang Lai, Jiazhan Feng, Yee Whye Teh, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究所) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Department of Statistics, University of Oxford(牛津大学统计系)

AI总结 本文提出VHG框架,通过引入独立验证器约束问题生成器的奖励,提升生成问题的有效性和难度,实验显示其在不定积分和数学推理任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06548 2026-05-08 cs.CL cs.AI cs.CV

Continuous Latent Diffusion Language Model

连续潜在扩散语言模型

Hongcan Guo, Qinyu Zhao, Yian Zhao, Shen Nie, Rui Zhu, Qiushan Guo, Feng Wang, Tao Yang, Hengshuang Zhao, Guoqiang Wei, Yan Zeng

机构 * The University of Hong Kong(香港大学) The Australian National University(澳大利亚国立大学) Peking University(北京大学) Renmin University of China(中国人民大学)

AI总结 本文提出Cola DLM,通过层次化信息分解实现文本生成,结合文本到潜在空间的映射、连续潜在空间中的全局语义先验建模及条件解码,提升生成效率和语义建模能力。

Comments 99 pages, 31 figures, 9 tables. Project page: https://hongcanguo.github.io/Cola-DLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06487 2026-05-08 cs.CV cs.AI

3D MRI Image Pretraining via Controllable 2D Slice Navigation Task

通过可控的2D切片导航任务进行3D MRI图像预训练

Yu Wang, Qingchao Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

AI总结 本文提出通过可控2D切片导航任务预训练3D MRI图像,利用动作轨迹控制生成视频动作序列,提升解剖和空间表示学习能力。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06407 2026-05-08 eess.AS cs.AI cs.CL

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

WavCube:通过语义-声音联合建模统一语音表示以实现理解和生成

Guanrou Yang, Tian Tan, Qian Chen, Zhikang Niu, Yakun Song, Ziyang Ma, Yushen Chen, Zeyu Xie, Tianrui Wang, Yifan Yang, Wenxi Chen, Qi Chen, Wenrui Liu, Shan Yang, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Tencent(腾讯) Independent Researcher(独立研究员) Peking University(北京大学) Tianjin University(天津大学) Zhejiang University(浙江大学)

AI总结 WavCube通过语义-声音联合建模统一语音表示,解决语音理解和生成的表示兼容问题,实现压缩后的高性能语音任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06326 2026-05-08 cs.CL

Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning

教授思考模型进行工具推理:一种完整的全管道配方用于工具集成推理

Qianjia Cheng, Yuchen Zhang, Zhilin Wang, Yuxin Zuo, Shunkai Zhang, Yuchen Fan, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng, Yun Luo, Ganqu Cui

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种全管道配方,通过注入自然工具使用行为提升强思考模型的工具集成推理能力,同时保持文本推理能力,展示在Qwen3模型上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06112 2026-05-08 cs.CV cs.AI

Dynamic Pondering Sparsity-aware Mixture-of-Experts Transformer for Event Stream based Visual Object Tracking

动态考虑稀疏性的事件混合专家变换器用于基于事件流的视觉目标跟踪

Shiao Wang, Xiao Wang, Duoqing Yang, Wenhao Zhang, Bo Jiang, Lin Zhu, Yonghong Tian, Bin Luo

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Beijing Institute of Technology(北京理工大学) Peng Cheng Laboratory(鹏城实验室) National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)

AI总结 本文提出一种动态稀疏性考虑的事件混合专家变换器,用于基于事件流的视觉目标跟踪,通过多时间尺度建模事件密度变化,提升跟踪精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06104 2026-05-08 cs.LG cs.AI

Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer

超越自回归RTG:通过在序列建模外注入条件进行决策变换

Yongyi Wang, Hanyu Liu, Lingfeng Li, Bozhou Chen, Ang Li, Qirui Zheng, Xionghui Yang, Chucai Wang, Wenxin Li

机构 * School of Computer Science Peking University(计算机科学学院,北京大学)

AI总结 本文提出SlimDT,通过在序列建模前将RTG信息注入状态表示,减少序列长度并提升效率,在D4RL基准上优于标准DT并达到现有最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06036 2026-05-08 cs.LG cs.AI

Optimal Transport for LLM Reward Modeling from Noisy Preference

基于噪声偏好的LLM奖励建模中的最优传输

Licheng Pan, Haochen Yang, Haoxuan Li, Yunsheng Lu, Yongqi Tong, Yinuo Wang, Shijian Wang, Zhixuan Chu, Lei Shen, Yuan Lu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文提出SelectiveRM框架,利用最优传输对噪声偏好进行去噪,通过联合一致性差异对齐模型预测分布与偏好数据,并引入质量放松机制以排除矛盾样本,提升奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05980 2026-05-08 cs.AI

TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering

TACT: 通过激活引导缓解编码代理中的过度思考与过度行动

Yuan Sui, Yulin Chen, Yibo Li, Xue Jiang, Yufei He, Yihong Dong, Xiaoxin He, Tianyu Gao, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Meta

AI总结 本文提出TACT方法,通过激活引导检测并缓解编码代理中的过度思考和过度行动问题,提升任务解决效率和准确性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏