arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3020
2606.21329 2026-06-23 cs.LG 新提交

MedTS-TTT: Test-Time Training for Medical Time Series Classification

MedTS-TTT:医学时间序列分类的测试时训练

Mingzhi Chen, Yiyu Gui, Guibo Luo

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院)

AI总结 提出MedTS-TTT框架,通过闭环自对齐测试时训练和门控卷积骨干网络,实现无需迭代内循环优化的快速样本自适应,在4个公开数据集上取得11/12的top-1排名。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21119 2026-06-23 cs.CV cs.AI 新提交

MammoExpert: Benchmarking Chain-of-Thought Reasoning in Mammography Diagnosis

MammoExpert:乳腺X线诊断中的思维链推理基准测试

Di Dai, Bo Liu, Youcheng Li, Haojun Yu, Zhouhang Bian, Quanlin Wu, Dong Wang, Sichen Meng, Hongye Xuan, Zijie Lan, Shenda Hong, Liwei Wang

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) School of Computer Science and Engineer, Beijing University of Aeronautics and Astronautics(北京航空航天大学计算机科学与工程学院) Center for Data Science, Peking University(北京大学数据科学中心) Yizhun co. ltd(医准有限公司) International School, Beijing University of Post and Telecommunications(北京邮电大学国际学院) School of Public Health, University of Michigan, Ann Arbor(密歇根大学安娜堡分校公共卫生学院) Future Technology College, Xi'an Jiaotong University(西安交通大学未来技术学院) Peking University(北京大学)

AI总结 提出首个包含思维链推理标注的乳腺X线数据集MammoExpert,覆盖2379张图像和67种病理亚型,通过三阶段推理提升病灶分类准确率,在多个数据集上验证了有效性。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21088 2026-06-23 cs.RO 新提交

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

MV-WAM: 具有价值增强的流形感知世界动作模型

Jintao Chen, Peidong Jia, Qingpo Wuwu, Jiaming Liu, Mengfei Du, Chun-Kai Fan, Xiaowei Chi, Hao Chen, Chengyu Bai, Zezhong Qian, Hao Wang, Jiajun Cao, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

AI总结 提出MV-WAM框架,通过跨模态因果掩码、流形感知优化和进度价值调节机制,联合建模视觉预测、动作生成和价值估计,在分布外场景中提升动作泛化能力,在仿真和真实机器人任务上显著优于基线。

Comments 20 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20698 2026-06-23 cs.RO 新提交

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model

SafeDojo:基于交互世界模型的安全强化学习用于视觉-语言-动作模型

Kai Tang, Peidong Jia, Zhong Chu, Jixian Wu, Rui Ma, Jiajun Cao, Fangyuan Zhao, Sixiang Chen, Yichen Guo, Xiaowei Chi, Chun-Kai Fan, Kevin Zhang, Jinchang Xu, Fubing Yang, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出SafeDojo,首个基于模型的安全强化学习框架,通过交互式视频世界模型进行想象学习安全动作,结合解耦的任务奖励和安全代价信号,在SafeLIBERO和真实机器人上取得最佳安全成功率。

Comments 20 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20684 2026-06-23 cs.CV 新提交

Shear-Free Viewport Magnification for 360-Degree via Spherical Mobius Boosts

基于球面Mobius提升的无剪切视口放大用于360度图像

Boyang Li, Hezhao Xu

机构 * Peking University(北京大学)

AI总结 提出球面Mobius提升作为共形映射,在固定预算下实现无剪切视口放大,通过保持局部角度避免各向异性拉伸,在SUN360数据集上视口PSNR中位数提升3.23 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20683 2026-06-23 cs.AI cs.CL 新提交

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

从问答到任务完成:智能体系统与执行框架设计综述

Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yunhe Wang

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学) Peking University(北京大学) TokenRhythm Technologies(TokenRhythm 科技公司)

AI总结 本文从模型-执行框架视角综述LLM智能体,分析模型瓶颈与执行框架设计,提出六组件分解法,并探讨任务完成、效率与可靠性的影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20904 2026-06-23 eess.IV cs.LG 版本更新

ECGFlowCMR: Pretraining with ECG-Generated Cine CMR Helps Cardiac Disease Classification and Phenotype Prediction

ECGFlowCMR: 利用心电图生成电影心脏磁共振的预训练助力心脏病分类和表型预测

Xiaocheng Fang, Zhengyao Ding, Guangkun Nie, Jieyi Cai, Yujie Xiao, Bo Liu, Jiarui Jin, Haoyu Wang, Shun Huang, Ting Chen, Hongyan Li, Shenda Hong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Polytechnic Institute of Zhejiang University, Zhejiang University(浙江大学 polytechnic 院) Institute of Computing Technology, University of the Chinese Academy of Sciences(中国科学院计算技术研究所) National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) Institute of Microelectronics, University of the Chinese Academy of Sciences(中国科学院微电子研究所) Department of Cardiology, Zhejiang University(浙江大学心内科部)

AI总结 提出ECGFlowCMR框架,通过相位感知掩码自编码器和解剖运动解耦流解决ECG与CMR的跨模态时序错配和解剖可观测性差距,生成逼真电影CMR序列,提升下游心脏病分类和表型预测性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03448 2026-06-23 cs.CV cs.AI 版本更新

Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation

多主体图像生成的层次化概念到外观引导

Yijia Xu, Zihao Wang, Haokun Gui, Jinshi Cui

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 提出层次化概念到外观引导框架(CAG),通过VAE dropout训练和对应感知掩码注意力模块,实现多主体图像生成中身份一致性和精确组合控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20209 2026-06-23 cs.LG cs.CL 版本更新

Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning

Spark: 通过动态分支进行战略性策略感知探索以实现长周期智能体学习

Jinyang Wu, Shuo Yang, Changpeng Yang, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 提出Spark框架,通过关键状态动态分支实现资源高效探索,在长周期任务中以更少样本取得更高成功率和泛化能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05890 2026-06-23 cs.AI 版本更新

StackPlanner: A Centralized Hierarchical Multi-Agent System with Task-Experience Memory Management

StackPlanner: 一种具有任务经验记忆管理的集中式分层多智能体系统

Ruizhe Zhang, Xinke Jiang, Zhibang Yang, Zhixin Zhang, Jiaran Gao, Yuzhen Xiao, Tao Feng, Yue Fang, Yuxuan Liu, Ruiqing Li, Hongbin Lai, Huheng Huang, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * School of Computer Science, Peking University(北京大学计算机学院) National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Public Affaris, Zhejiang University(浙江大学公共管理学院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院) GRG Banking Equipment Co., Ltd.(GRG银行设备有限公司) Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海))

AI总结 提出StackPlanner分层多智能体框架,通过显式记忆控制解耦高层协调与子任务执行,并利用结构化经验记忆和强化学习复用协调经验,解决长期协作中的记忆膨胀和错误累积问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04687 2026-06-23 cs.CV 版本更新

WebCryptoAgent: Agentic Crypto Trading with Web Informatics

WebCryptoAgent: 基于网络信息学的智能加密货币交易

Ali Kurban, Wei Luo, Liangyu Zuo, Zeyu Zhang, Renda Han, Zhaolu Kang, Hao Tang, Yang Zhao

机构 * AI Geeks CUHK Peking University(北京大学) TJU(天津大学) La Trobe(拉特罗布大学)

AI总结 提出WebCryptoAgent框架,通过模态专用代理整合异构网络信息与市场信号,并采用解耦控制架构实现快速风险响应,提升交易稳定性与尾部风险处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19468 2026-06-23 cs.LG 版本更新

Learning Expressive Random Feature Models via Parametrized Activations

通过参数化激活函数学习表达性随机特征模型

Zailin Ma, Jiansheng Yang, Yaodong Yang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 提出RFLAF模型,将激活函数参数化为基函数加权和,扩展函数空间,理论证明样本和随机特征数量需求,实验显示RBF和样条基优于其他模型且RBF计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17125 2026-06-23 cs.RO 版本更新

Imagine2Act: Leveraging Object-Action Motion Consistency from Imagined Goals for Robotic Manipulation

Imagine2Act:利用想象目标中的物体-动作运动一致性进行机器人操作

Liang Heng, Jiadong Xu, Yiwen Wang, Xiaoqi Li, Muhe Cai, Yan Shen, Juan Zhu, Guanghui Ren, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) PrimeBot AGIBOT

AI总结 提出Imagine2Act框架,通过生成想象目标点云并引入物体-动作一致性策略,将语义和几何约束融入策略学习,解决高精度物体重排任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13514 2026-06-23 cs.CL cs.AI 版本更新

ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs

ProMed:基于Shapley信息增益引导的强化学习用于主动式医疗大语言模型

Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Xinke Jiang, Jinyang Zhang, Yinghao Zhu, Zheng Li, Liantao Ma, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University, China(软件工程国家工程研究中心,北京大学,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Peking University Information Technology Institute, Tianjin Binhai, China(北京大学信息技术研究所,天津滨海,中国) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

AI总结 提出ProMed框架,通过Shapley信息增益奖励引导强化学习,使医疗大语言模型从被动回答转向主动提问,在部分信息医疗基准上平均提升6.29%。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08262 2026-06-23 cs.RO cs.AI cs.CV 版本更新

CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment

CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示

Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carnegie Mellon University(卡内基梅隆大学) Galbot CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)

AI总结 提出CLAR框架,融合掩码自编码与全局跨模态对比学习,并引入基于可变形注意力的局部自适应对齐机制,解决3D预训练中空间几何与语义细节的权衡问题,在视觉运动策略学习中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18276 2026-06-23 cs.RO cs.AI 版本更新

GAPartManip: A Large-scale Part-centric Dataset for Material-Agnostic Articulated Object Manipulation

GAPartManip:面向材料无关铰接物体操作的大规模部件中心数据集

Wenbo Cui, Chengyang Zhao, Songlin Wei, Jiazhao Zhang, Haoran Geng, Yaran Chen, Haoran Li, He Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机科学系) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Galbot

AI总结 提出大规模部件中心数据集GAPartManip,结合照片级材质随机化和部件级交互姿态标注,通过模块化框架提升深度估计与交互姿态预测,在仿真和真实场景中实现鲁棒的铰接物体操作。

Comments Accepted by ICRA 2025. Project page: https://pku-epic.github.io/GAPartManip/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16000 2026-06-23 cs.CV 版本更新

SenseExpo: Spatial Exploration and Navigation via Scene Estimation from Expeditious Predictive Operators

SenseExpo: 通过快速预测算子的场景估计进行空间探索与导航

Haojia Gao, Haohua Que, Mingkai Liu, Jiayue Xie, Hoiian Au, Yusen Qin, Qian Zhang, Jiajun Sun, Weihao Shan, Tianle Zhu, Handong Yao, Fei Qiao

机构 * Tsinghua University(清华大学) University of Georgia(佐治亚大学) Peking University(北京大学) D-Robotics(D-机器人) Infinity Robotics(Infinity机器人)

AI总结 提出轻量级单机器人探索框架SenseExpo,结合紧凑地图预测网络与前沿策略,以709K参数实现优于U-Net和LaMa的预测性能,并在探索实验中显著加速目标覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14792 2026-06-23 cs.CY cs.AI cs.CL 版本更新

Measuring Human Contribution in AI-Assisted Content Generation

衡量AI辅助内容生成中的人类贡献

Yueqi Xie, Tao Qi, Jingwei Yi, Xiyuan Yang, Ryan Whalen, Junming Huang, Qian Ding, Yu Xie, Xing Xie, Fangzhao Wu

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Hong Kong(香港大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学)

AI总结 针对AI辅助内容生成中人类贡献度难以量化的问题,提出基于信息论的框架,通过互信息与自信息之比计算人类信息贡献比例,实验证明能有效区分不同创意领域的人类贡献程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06190 2026-06-23 cs.CV 版本更新

Category-Adaptive Cross-Modal Semantic Refinement and Transfer for Open-Vocabulary Multi-Label Recognition

类别自适应跨模态语义精炼与迁移用于开放词汇多标签识别

Haijing Liu, Tao Pu, Hefeng Wu, Keze Wang, Feng Gao, Fan Yang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peking University(北京大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

AI总结 提出C²SRT框架,通过类别内语义精炼(ISR)和类别间语义迁移(IST)模块,自适应建模类别内和跨类别语义相关性,提升开放词汇多标签识别性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07724 2026-06-23 cs.LG math.OC 版本更新

Convergence Rate Analysis of LION

LION优化器的收敛速率分析

Yiming Dong, Huan Li, Zhouchen Lin

机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(国家一般人工智能实验室,智能科学与技术学院,北京大学) Institute of Robotics and Automatic Information Systems, College of Artificial Intelligence, Nankai University(机器人与自动信息系统研究所,人工智能学院,南开大学) Pazhou Laboratory (Huangpu)(黄埔实验室(琶洲))

AI总结 本文分析LION优化器的收敛速率,证明其在约束和无约束问题中达到KKT点或临界点的速率为O(√d K^{-1/4}),该速率在维度d上最优且匹配非凸随机优化下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20545 2026-06-19 cs.CV 新提交

Current World Models Lack a Persistent State Core

当前世界模型缺乏持久状态核心

Jinpeng Lu, Dexu Zhu, Haoyuan Shi, Linghan Cai, Guo Tang, Yinda Chen, Jie Cao, Duyu Tang, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京人形机器人创新中心) NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) Independent Researcher(独立研究者) Dresden University of Technology(德累斯顿工业大学) Peking University(北京大学)

AI总结 提出WRBench基准测试,发现现有世界模型在观测中断时无法维持世界状态演化,强调物理状态核稳定性应成为世界模型设计首要目标。

Comments 39 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20135 2026-06-19 cs.RO cs.AI 新提交

Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation

频率感知流匹配用于连续且一致的机器人动作生成

Jianing Guo, Fangzheng Chen, Zihao Mao, Wong Lik Hang Kenny, Zhenhong Wu, Yu Li, Yishuai Cai, Yuanpei Chen, Yikun Ban, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Simin Li

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) PKU-Psibot Lab(北大-智源机器人实验室) Zhongguancun Laboratory(中关村实验室) Hefei Comprehensive National Science Center(合肥综合性国家科学中心)

AI总结 提出频率感知流匹配(FAFM),通过离散余弦变换将离散动作序列转换到频域进行流匹配,并正则化一阶时间导数以生成平滑连续的动作,提升成功率、多模态表达性和运动平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20122 2026-06-19 cs.AI cs.MA 新提交

ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep Research

ScaffoldAgent: 面向开放式深度研究的效用引导动态大纲优化

Zhibang Yang, Xinke Jiang, Yuzhen Xiao, Ruizhe Zhang, Yue Fang, XinFei Wan, Zhengxing Song, Yuxuan Liu, Yuheng Huang, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) GRG Banking Equipment Co., Ltd.(广电运通金融电子股份有限公司) Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学(天津滨海)信息技术研究院)

AI总结 提出ScaffoldAgent框架,通过效用引导的动态大纲优化(扩展、收缩、修订操作)解决开放式深度研究中大纲漂移问题,在DeepResearch Bench和Gym上提升长报告生成与事实准确性。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20092 2026-06-19 cs.CV 新提交

EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies

EventVLA: 面向长程视觉-语言-动作策略的事件驱动视觉证据记忆

Ganlin Yang, Zhangzheng Tu, Yuqiang Yang, Sitong Mao, Junyi Dong, Tianxing Chen, Jiaqi Peng, Jing Xiong, Jiafei Cao, Jifeng Dai, Wengang Zhou, Yao Mu, Tai Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Dalian University of Technology(大连理工大学) Huawei Technologies Co., Ltd.(华为技术有限公司) The University of Hong Kong(香港大学) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 针对长程机器人操作中记忆瓶颈问题,提出EventVLA框架,通过动态关键帧证据记忆模块自主捕获任务关键视觉事件,在17个模拟和4个真实任务中平均成功率提升40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19992 2026-06-19 cs.SE cs.AI 新提交

Beyond Static Endpoints: Tool Programs as an Interface for Flexible Agentic Web Services

超越静态端点:工具程序作为灵活智能体网络服务的接口

Mugeng Liu, Shuoqi Li, Yixuan Zhang, Yun Ma

机构 * School of Computer Science, Peking University, Beijing, China School of Software \& Microelectronics, Peking University, Beijing, China Institute for Artificial Intelligence, Peking University, Beijing, China

AI总结 提出ToolPro,将工具意图表示为可执行程序,通过约束引导构建、效应感知重放和策略决策,在MCP服务上实现最高53.4%的延迟降低和96.1%的流量减少。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19970 2026-06-19 cs.CV 新提交

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

CrossFlow: 跨潜在空间与像素空间的单步生成

Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Tencent(腾讯) Fudan University(复旦大学)

AI总结 提出CrossFlow,一种跨空间流模型,将噪声潜在输入直接映射到像素图像,通过无速度单步目标实现潜在到像素的生成,并替代潜在扩散中的解码器,在ImageNet-1k上达到1.62 FID。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19818 2026-06-19 cs.LG cs.AI 新提交

Uncertainty-Aware Reward Modeling for Stable RLHF

不确定性感知的奖励建模用于稳定的RLHF

Licheng Pan, Haocheng Yang, Haoxuan Li, Yichen Sun, Yunsheng Lu, Shijian Wang, Lei Shen, Yuan Lu, Zhixuan Chu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 提出不确定性感知奖励建模(UARM),通过分位数保形预测校准不确定性并利用异方差方差分解重加权GRPO优势,以缓解奖励黑客问题,提升对齐质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19805 2026-06-19 cs.CV cs.AI 新提交

ParaScale: Scale-Calibrated Camera-Motion Transfer via a Gauge-Invariant Parallax Number

ParaScale: 通过规范不变视差数进行尺度校准的相机运动迁移

Zijie Meng

机构 * Peking University(北京大学)

AI总结 提出ParaScale模块,通过规范不变的视差数Pi实现尺度忠实相机运动迁移,无需重新训练,在四个数量级尺度上降低视差一致性误差3倍以上。

Comments Accepted by SCA2026(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19658 2026-06-19 cs.AI cs.IR cs.MM 新提交

Denoising Implicit Feedback for Cold-start Recommendation

去噪隐式反馈用于冷启动推荐

Gaode Chen, Shicheng Wang, Shikun Li, Rui Huang, Xinghua Zhang, Yunze Luo, Shipeng Li, Shiming Ge, Ruina Sun, Yinjie Jiang, Jun Zhang

机构 * Hong Kong Baptist University(香港浸会大学) Independent Researcher(独立研究员) Peking University(北京大学) Nanjing University(南京大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

AI总结 针对冷启动推荐中隐式反馈噪声问题,提出模型无关的去噪方法DIF,通过内容相似性推断伪标签并建模置信度与不确定性,在快手应用中显著提升冷启动场景商业指标。

Comments Accepted by KDD 2026 ADS Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19534 2026-06-19 cs.CV cs.AI cs.CL 新提交

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

PerceptionDLM:基于多模态扩散语言模型的并行区域感知

Yueyi Sun, Yuhao Wang, Jason Li, Ye Tian, Tao Zhang, Jacky Mai, Yihan Wang, Haochen Wang, Jinbin Bai, Ling Yang, Yunhai Tong

机构 * Peking University(北京大学) MSALab ByteDance(字节跳动)

AI总结 提出PerceptionDLM,利用扩散语言模型的并行解码特性,通过高效提示和结构化注意力掩码实现多区域并行感知,显著提升推理效率,并构建ParaDLC-Bench基准进行评估。

Comments Code available at https://github.com/MSALab-PKU/PerceptionDLM

详情

展开后加载摘要…

URL PDF HTML 收藏