arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 382
2607.05394 2026-07-09 cs.LG cs.AI cs.CL 新提交

Weak-to-Strong Generalization via Direct On-Policy Distillation

通过直接在线策略蒸馏实现弱到强泛化

Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR and ByteDance Seed(清华-字节跳动联合研究中心SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Peking University(北京大学)

AI总结 针对可验证奖励RL在大模型上成本高的问题,提出Direct-OPD方法迁移小模型RL的策略偏移,无需在大模型上跑RL即可实现性能提升。

Comments Project Page: https://bytedtsinghua-sia.github.io/Direct-OPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06564 2026-07-08 cs.RO cs.CV 新提交

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * Peking University(北京大学) CUHK(香港中文大学) AI² Robotics(智平方科技)

AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。

Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06323 2026-07-08 cs.RO 新提交

LAMP: Latent Motion Prior-Guided Real-World Learning for Dexterous Hand Manipulation

LAMP:用于灵巧手部操作的潜在运动先验引导的现实世界学习

Xinye Yang, Zhiyuan Ma, Hongze Yu, Yuanpei Chen, Yaodong Yang, Xiaojie Chai, Xinlei Chen, Chao Yu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) PsiBot

AI总结 研究针对灵巧手部现实世界学习易出错的问题,提出含潜在运动先验模块的三阶段学习框架LAMP,先预训练模块,再训练视觉运动策略并通过在线残差RL改进,在真实机器人任务中取得高成功率,提升了学习效果。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06234 2026-07-08 cs.CV 新提交

WING: A Window-Prior-Based Generative Network with Gated Inception for Cross-Modality CT Synthesis

WING:一种基于窗口先验的带门控inception的生成网络用于跨模态CT合成

Siyuan Mei, Yan Xia, Yipeng Sun, Siming Bayer, Zirong Li, Chengze Ye, Daiqi Liu, Fuxin Fan, Yixing Huang, Andreas Maier

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(模式识别实验室,埃尔朗根-纽伦堡弗里德里希-亚历山大大学) Department of Orthodontics and Orofacial Orthopaedics, Friedrich-Alexander-Universität Erlangen-Nürnberg(正畸与口腔颌面正畸科,埃尔朗根-纽伦堡弗里德里希-亚历山大大学) Siemens Healthineers(西门子医疗) Institute of Medical Technology, Peking University(北京大学医学技术研究所)

AI总结 研究旨在从MRI和CBCT生成CT体积改善放疗计划。核心方法是将回归目标重构成窗口表示,引入WING网络,含门控inception生成器、融合与细化变压器及联合对抗训练目标。主要贡献是在相关基准上达最优性能且支持单模型多解剖合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05794 2026-07-08 cs.AI 新提交

From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space

从被动检索到主动记忆导航:学习将记忆用作结构化动作空间

Yue Xu, Yutao Sun, Yihao Liu, Mengyu Zhou, Jiayi Qiao, Lu Ma, Kai Tang, Wenjie Wang, Xiaoxi Jiang, Guanjun Jiang

机构 * Alibaba(阿里巴巴) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对个性化对话代理中记忆系统的被动性问题,提出NapMem框架,将用户记忆组织成多粒度金字塔并通过工具暴露层次,经记忆工具强化学习训练智能体,在多任务实验中具竞争力,还进行了多方面分析,证明结构化存储与策略结合对长期用户记忆有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05708 2026-07-08 cs.AI 新提交

Akashic: A Low-Overhead LLM Inference Service with MemAttention

Akashic:一种基于内存注意力机制的低开销大语言模型推理服务

Yang Liu, Zhaokai Luo, Huayi Jin, Ruozhou He, Chenchen Hong, Zhiyong Wang, Yifei Liu, Yunfei Gu, Chentao Wu, Junhao Hu

机构 * Xiaohongshu Inc.(小红书公司) ShangHai JiaoTong University(上海交通大学) Peking University(北京大学)

AI总结 针对大语言模型推理中重放完整历史记录不切实际的问题,提出基于内存注意力机制的低开销内存系统Akashic,通过组织上下文成有界块、建模块间语义关系及应用软硬件协同设计内存放置,提升了任务准确率、吞吐量和可持续请求率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20023 2026-07-08 cs.SE cs.AI cs.CL 新提交

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

当较低权限足够时:探究LLM代理中的过度权限工具选择

Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。

Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05377 2026-07-07 cs.RO cs.AI cs.CV 新提交

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation

Cortex:一种用于长视距操作的双向对齐具身智能体框架

Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) USTC(中国科学技术大学)

AI总结 针对现有VLA模型长视距任务短板及分层方法语义-运动鸿沟问题,提出双向对齐框架Cortex,标准化技能原语、优化数据与采样策略,提升长视距操作性能与零样本泛化能力。

Comments Project website: https://steinate.github.io/cortex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05251 2026-07-07 cs.CR cs.AI cs.LG cs.LO 新提交

Privacy-Preserving Robustness Verification for Neural Networks

神经网络的隐私保护鲁棒性验证

Nianyun Song, Xiaokun Luan, Yu Guo, Rongfang Bie, Meng Sun, Xiyue Zhang

机构 * School of Artificial Intelligence, Beijing Key Laboratory of Artificial Intelligence for Education, Engineering Research Center of Intelligent Technology and Educational Application (Ministry of Education), Beijing Normal University, Beijing, China(人工智能学院,北京人工智能教育重点实验室,智能技术与教育应用工程研究中心(教育部),北京师范大学,北京,中国) School of Computer Science University of Bristol(计算机科学学院,布里斯托大学) School of Mathematical Sciences Peking University(数学科学学院,北京大学)

AI总结 针对神经网络验证与数据隐私的固有矛盾,提出基于安全两方计算的SecureCROWN框架,将条件逻辑转化为连续运算消除分支,实现隐私保护下的鲁棒性验证,效率与精度表现优异。

Comments Accepted by UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05174 2026-07-07 cs.AI 新提交

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

AgentGym2:在去理想化真实世界环境中评测大语言模型智能体

Zhiheng Xi, Dingwen Yang, Jiaqi Liu, Jixuan Huang, Honglin Guo, Baodai Huang, Tinggang Chen, Qi Zhang, Zhonghang Lu, Chenyu Liu, Jiajun Sun, Jiazheng Zhang, Dingwei Zhu, Xin Guo, Junzhe Wang, Zhihao Zhang, Yuming Yang, Junjie Ye, Minghe Gao, Dongrui Liu, Jiaming Ji, Guohao Li, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghaijiaotong University(上海交通大学) Peking University(北京大学)

AI总结 针对现有LLM智能体基准过于理想化的问题,提出去理想化评测框架AgentGym2,可全面测查智能体实操能力,实验显示当前SOTA模型仍存在明显性能缺口。

Comments Accepted as a main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05147 2026-07-07 cs.AI cs.CL 新提交

DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation

DSpark:结合半自回归生成的置信度调度投机解码框架

Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

机构 * Peking University(北京大学) DeepSeek-AI(深势科技人工智能)

AI总结 针对现有投机解码接受率衰减、高并发下吞吐量劣化问题,DSpark采用半自回归架构与置信度调度验证,在实测中显著提升大模型推理速度与系统性能边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05009 2026-07-07 cs.LG cs.AI 新提交

ImputeECG: Deep Learning Reconstruction of Complete 12-Lead Electrocardiograms from Incomplete Recordings for Cardiac Assessment

ImputeECG:用于心脏评估的从不完整记录中深度学习重建完整12导联心电图

Xiaocheng Fang, Haoyu Wang, Jieyi Cai, Qinghao Zhao, Jun Li, Shanwei Zhang, Guangkun Nie, Yujie Xiao, Shun Huang, Jiarui Jin, Hongmin Liu, Guodong Wang, Shuohua Chen, Liming Lin, Shouling Wu, Hongyan Li, Shenda Hong

机构 * National Institute of Health Data Science, Peking University(北京大学健康医疗大数据国家研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) University of the Chinese Academy of Sciences(中国科学院大学) Department of Cardiology, Peking University People’s Hospital(北京大学人民医院心内科) Department of Computer Science, Tianjin University of Technology(天津理工大学计算机科学与工程学院)

AI总结 研究针对不完整心电图记录,开发掩码条件下的一维Transformer自动编码器ImputeECG,在模拟不完整设置下训练并评估,证明其能有效完成心电图重建,提升下游诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04740 2026-07-07 cs.CV 新提交

DriftST: One-Step Generative Inference of Spatial Transcriptomics from H\&E Histology

DriftST:从苏木精和伊红(H&E)组织学进行空间转录组学的一步生成推理

Yuhang Yang, Yonggan Bu, Shengyuan Zhou, Yiming Luo, Kai Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Peking University Cancer Hospital(北京大学肿瘤医院)

AI总结 研究旨在从H&E图像推断空间解析基因表达。提出DriftST框架,基于细胞漂移生成模型,引入STransformer捕捉基因结构,能处理不同层级数据,实验表明其在两种分辨率下均达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04674 2026-07-07 cs.CV 新提交

Video Generation Models Are Inherent Lighting Estimators

视频生成模型是内在的光照估计器

Ziqi Cai, Shuchen Weng, Kaiqi Liu, Zifeng Wang, Zhiquan Zhang, Minggui Teng, Han Jiang, Boxin Shi

机构 * Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京智谱华章科技有限公司)

AI总结 研究从单张自然视频恢复动态环境图的问题,核心方法是将光照估计重构为引导视频修复任务,贡献是提出V-LITE框架,能生成连贯HDR环境图,证明视频扩散模型可估计物理场景光照。

Comments Project Page: https://caiziqi.com/research/vlite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04378 2026-07-07 cs.RO 新提交

SurgAM: Surgical Affordance Map Prediction with Multimodal Feature Fusion for Robot Autonomy

SurgAM:用于机器人自主的多模态特征融合手术能力地图预测

Lei Song, Yonghao Long, Mengya Xu, Jiayi Geng, Xiuyuan Chen, Qi Dou

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Department of Thoracic Surgery, Peking University People’s Hospital(北京大学人民医院胸外科) Thoracic Oncology Institute, Peking University People’s Hospital(北京大学人民医院胸部肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer, Chinese Academy of Medical Sciences(中国医学科学院早期非小细胞肺癌智能诊断与治疗研究组) Institute of Advanced Clinical Medicine, Peking University(北京大学先进临床医学院) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer, Peking University People’s Hospital(北京大学人民医院肺癌大数据创新应用北京市重点实验室)

AI总结 研究如何通过视觉数据识别手术可操作区域,提出自适应特征融合框架、分层提示学习机制和场景引导注意力解码器,建立新数据集验证,在真实模型上验证框架对下游自动化的适用性。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04242 2026-07-07 cs.AI 新提交

Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning

面向进度和可靠性的智能体强化学习组策略优化

Mingxuan Fan, Peiyang Liu

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

AI总结 研究基于组的强化学习,针对步级优势估计对组形成方式敏感的问题,提出ProGPO方法,通过精确前缀动作比较及结合语义扩展与逆方差融合估计势,在任务中改进了基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04199 2026-07-07 cs.CV 新提交

Topology-Driven Transferability Estimation for 3D Medical Vision Foundation Models

用于3D医学视觉基础模型的拓扑驱动可迁移性估计

Jiaqi Tang, Shaoyang Zhang, Fandong Zhang, Shu Zhang, Yang Liu, Qingchao Chen

机构 * National Institute of Health Data Science, Peking University(北京大学健康数据科学研究所) Institute of Medical Technology, Peking University(北京大学医学技术研究所) Deepwise Co., Ltd.(深度智医科技有限公司) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

AI总结 针对医学视觉基础模型选择难题,提出非参数、拓扑驱动框架,通过最小生成树从密集特征与语义标签的稀疏1-骨架图对齐中估计可迁移性,包含局部和全局互补尺度,提升评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04189 2026-07-07 cs.LG 新提交

SpecGradFilter: A Spectral Gradient Filtering Framework for Taming Federated Heterogeneity

SpecGradFilter:用于驯服联邦异构性的谱梯度滤波框架

Liyang Yuan, Yibo Yang, Dandan Guo, Peter Richtarik, Zhouchen Lin

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

AI总结 研究联邦学习中统计异构性问题,从频域视角发现漂移谱偏差,提出SpecGradFilter框架,通过抑制低频信号驯服异构性,实验证明其在高非IID设置下性能优且通信开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04163 2026-07-07 cs.CV cs.AI 新提交

SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering

SeeMe:通过有效的视觉令牌工程减轻大型视觉语言模型中的幻觉

Kai Tang, Jinhao You, Bohua Zhang, Yichen Guo, Yiding Sun, Dongxu Zhang, Chenxi Li, Xiande Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) University of Pennsylvania(宾夕法尼亚大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) De Artificial Intelligence Lab(德人工智能实验室)

AI总结 研究大型视觉语言模型易产生幻觉问题,提出无训练框架SeeMe,引入传统机器学习特征工程概念,经三阶段令牌工程重组视觉令牌抑制幻觉源,实验证明其能减轻幻觉并提高输出一致性。

Comments 12 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03839 2026-07-07 cs.LG 新提交

Adversarial LassoNet: Robust Feature Selection via Stability-Driven Sparse Learning

对抗拉索网络:通过稳定性驱动的稀疏学习进行鲁棒特征选择

Zhen Huang, Peicheng Xu, Junbiao Pang, Yulong Zheng

机构 * Beijing University of Technology(北京工业大学) The First Affiliated Hospital of Zhejiang University School of Medicine(浙江大学医学院附属第一医院) Peking University First Hospital(北京大学第一医院)

AI总结 针对高维机器学习中传统方法在噪声下不稳定的问题,提出对抗拉索网络,集成对抗扰动与拉索网络分层稀疏机制及一阶近似,实验表明其提升了分布外鲁棒性与特征支持再现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03780 2026-07-07 cs.SE cs.AI 新提交

SkillFab: An Agent-Native Skill Production Platform

SkillFab:一个原生代理技能生产平台

Anjie Xu, Yifeng Cai, Yi Li, Zixing Wang, Zhiyu Zhang, Jingfan Chen, Ruohan Xu, Leye Wang

机构 * Peking University(北京大学) Huawei(华为) Northwestern Polytechnical University(西北工业大学) Zhongguancun Academy(中关村学院)

AI总结 SkillFab是原生代理平台,将缺失能力转化为可复用技能。运行时代理先找技能,无则提需求,经SkillFab管理库等流程开发,通过多界面暴露相同生命周期,使工作可审查可恢复,还介绍了平台及案例。

Comments 12 pages, 7 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03006 2026-07-07 cs.CV cs.AI cs.SE 新提交

PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark

PosterHarness:将科学海报生成转变为可审计的指令跟随基准

Tianyi Yang, Dawei Fu, Youpeng Wu, Zixun Kou, Linrui Chen, Ruobing Jiang, Zijian Wang, Qiang Li

机构 * School of Physics, Peking University(北京大学物理学院)

AI总结 研究针对文本丰富图像模型,缺乏衡量其是否遵循科学传播规范的方法这一问题,提出PosterHarness,将海报生成变为可审计任务,介绍核心方法,展示了相关实验发现及与其他方法的对比结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02907 2026-07-07 cs.CV cs.CL 新提交

ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维

Peiming Li, Yifan Wang, Xiaotian Zhang, Zhiyuan Hu, Shiyu Li, Zheng Wei, Yang Tang

机构 * Basic Algorithm Center, PCG, Tencent(腾讯PCG基础算法中心) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 针对多模态大语言模型在复杂视觉推理任务中的不足,ProLaViT框架利用内生自蒸馏机制等,设计两种推理范式及损失函数,使其能在潜在空间进行结构化视觉推导,实验证明效果优于基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02840 2026-07-07 cs.RO 新提交

TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training

TACO:作为可扩展VLA训练后自校正器的触觉世界模型

Shengbang Liu, Yueru Jia, Yuyang Yan, Jiaming Liu, Xinran Zhang, Qiuxuan Feng, Yandong Guo, Shiji Zhou, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) AI 2 Robotics(人工智能与机器人研究所) Sun Yat-sen University(中山大学) Beihang University(北京航空航天大学)

AI总结 研究VLA模型在接触丰富任务中的问题,提出TACO框架,通过触觉感知世界模型驱动可扩展VLA训练后校正,结合多种方法提升策略,实验表明其能显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04278 2026-07-07 q-fin.CP cs.LG econ.EM math.OC stat.ML 新提交

Deep Learning for Dynamic Programming with Recursive Utility

用于具有递归效用的动态规划的深度学习

Xianhua Peng, Wu Guo

机构 * HSBC Business School, Peking University(汇丰商学院,北京大学)

AI总结 提出确定性等价学习(CEL)算法解决高维离散时间含递归效用的动态规划问题,直接用神经网络学习确定性等价值,联合逼近价值、策略和确定性等价函数,适用于多种相关问题,效果良好。

Comments 93 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03948 2026-07-07 cs.AI cs.LG math.OC 新提交

Online Linear Programming for Multi-Objective Routing in LLM Serving

大语言模型服务中多目标路由的在线线性规划

Zixi Chen, Yinyu Ye, Zijie Zhou

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 研究大语言模型服务在线路由问题,引入多目标优化框架将路由设为在线线性规划,应用高效出价控制策略,开发热启动投影一阶更新,集成路由器到模拟器,结果表明基于科学方法优于启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03339 2026-07-07 cs.LG cs.NA math.NA physics.comp-ph 新提交

CSympNet-ID: conformal-symplectic map learning for linearly damped Hamiltonian systems

CSympNet-ID:用于线性阻尼哈密顿系统的共形辛映射学习

Jiale Gong, Pengzhan Jin, Dongyang Kuang, Lu Li, Yifa Tang

机构 * School of Mathematics (Zhuhai), Sun Yat-sen University(中山大学数学学院(珠海)) National Engineering Laboratory for Big Data Analysis and Applications, Peking University(北京大学大数据分析与应用国家工程实验室) State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院数学科学国家重点实验室)

AI总结 针对线性阻尼哈密顿系统,提出CSympNet-ID框架,直接从快照对学习一步流映射,通过构建保证离散共形辛性,其架构含辛神经核心与缩放层,给出相关因式分解及密度结果,实验效果良好。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏