arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3020
2607.08221 2026-07-10 cs.CV 新提交

LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression

LUMI:基于语言模型的与分词器无关的无损图像压缩

Chris Xing Tian, Chengkai Wu, Ziyu Wang, Rongqun Lin, Kecheng Chen, Xiandong Meng, Haoliang Li, Shiqi Wang, Siwei Ma

机构 * Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Department of Electrical Engineering, City University of Hong Kong, Hong Kong SAR(香港城市大学电子工程系,香港特别行政区) Department of Computer Science, City University of Hong Kong, Hong Kong SAR(香港城市大学计算机科学系,香港特别行政区) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国)

AI总结 研究基于LLM的无损图像压缩问题,提出LUMI框架,用像素嵌入模块取代像素即文本分词,引入位置编码,仅训练部分参数,LLM主干固定。实验表明其提供统一接口,压缩率有竞争力且跨域鲁棒性强。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10180 2026-07-10 cs.DC cs.LG 版本更新

Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation

Tessera:通过内核粒度解耦解锁异构GPU

Tiancheng Hu, Jin Qin, Zheng Wang, Junhao Hu, Yuzheng Wang, Lei Chen, Yizhou Shan, Mingxing Zhang, Ting Cao, Chunwei Xia, Huimin Cui, Tao Xie, Chenxi Wang

机构 * Peking University(北京大学) Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) University of Chinese Academy of Sciences(中国科学院大学) Institute for AI Industry Research, Tsinghua University(清华大学人工智能研究院) Tsinghua University(清华大学) University of Leeds(利兹大学) Huawei Cloud(华为云)

AI总结 Tessera通过内核粒度解耦提升异构GPU上的大模型推理性能和成本效率,利用离线分析与在线适应结合,实现计算与硬件能力的匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08763 2026-07-10 quant-ph cs.LG cs.NA math.NA 版本更新

Weak Adversarial Neural Pushforward Method for the Wigner Transport Equation

弱对抗神经推前方法用于威金方程

Andrew Qing He, Wei Cai, Sihong Shao

机构 * Department of Mathematics, Southern Methodist University(南卫理公会大学数学系) School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 本文提出弱对抗神经推前方法用于求解威金传输方程,通过结构观察将非局部伪微分势能算子与平面波测试函数积分转化为狄拉克δ函数,实现对威金势能核的精确反转,无需截断莫伊尔级数且能处理量子系统相空间动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12478 2026-07-10 cs.CV cs.LG 版本更新

Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning

数据更少,收敛更快:面向多模态指令微调的目标驱动数据优化

Rujie Wu, Haozhe Zhao, Hai Ci, Yizhou Wang

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

AI总结 本文提出目标驱动数据优化框架GDO,通过优化训练样本实现更快收敛和更高精度,适用于多模态指令微调任务。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12999 2026-07-10 cs.CV cs.AI 版本更新

Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs

概念树:一个可控的合成数据框架助力更强的个性化视觉语言模型

Ruichuan An, Kai Zeng, Ming Lu, Sihan Yang, Renrui Zhang, Huitong Ji, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) CUHK MMLab(香港中文大学MMLab) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security(北京数据智能与安全重点实验室)

AI总结 研究提升VLM个性化能力问题,提出概念树(CaT)框架,以树结构表示概念生成多样正负样本,经数据过滤策略确保质量,实验证明该框架显著增强VLM在个性化基准测试中的能力,是首个可控合成数据管道。

Comments ECCV26 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07527 2026-07-09 stat.ML cs.LG 新提交

A Unified Detection Framework for AI-Related Content and Artifacts

人工智能相关内容和工件的统一检测框架

Xifeng Zhang, Tao Hu, Yijie Peng, Wan Tian

机构 * School of Mathematical Sciences, Capital Normal University, Beijing 100048, China(数学学院,首都师范大学,北京100048,中国) School of Management and Engineering, Nanjing University, Nanjing 210008, China(管理工程学院,南京大学,南京210008,中国) Advanced Institute of Information Technology, Peking University(信息科技高级研究院,北京大学) Wangxuan Institute of Computer Technology, Peking University, Beijing 100871, China(王炫计算机技术研究院,北京大学,北京100871,中国)

AI总结 研究针对人工智能相关内容和工件检测问题,提出基于马氏距离分数的统一检测框架。通过开发联合估计方法、提供优化算法并证明收敛性等,有效刻画正类,经实证评估验证了该检测框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07173 2026-07-09 cs.CV 新提交

Stage-Aware Adaptation and Distribution Calibration for Subject-Driven Personalized Text-to-Image Generation

用于主题驱动的个性化文本到图像生成的阶段感知适应与分布校准

Wenyan Xu, Alizer Wong

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) School of Computer Science, Peking University(北京大学计算机学院) ManXis(未知)

AI总结 研究主题驱动的个性化文本到图像生成问题,提出将其分解为训练端的 SPaRa 和推理端的 DCAL 两个互补组件的框架 SPaRa-DCAL,通过理论分析和实验表明该框架能提升相关指标,并指出应综合多方面评估个性化生成。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06929 2026-07-09 cs.SD cs.AI 新提交

MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations

MADB:一个具有专业和多维度注释的大规模音乐美学数据集

Sirui Zhang, Tianle Wang, Xinyi Tong, Peiyang Yu, Jishang Chen, Liangke Zhao, Haoxin Zhang, Duo Xu, Xin Jin, Feng Yu, Songchun Zhu

机构 * Central Conservatory of Music, China(中央音乐学院) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Tianjin Conservatory of Music(天津音乐学院) Beijing Electronic Science and Technology Institute(北京电子科技研究所) Peking University(北京大学)

AI总结 研究音乐美学评估问题,引入含9999首曲目、由30名注释者标注的MADB数据集,通过多预训练模型建立统一评估框架,揭示模型与人类判断差距,为音乐理解提供新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06678 2026-07-09 cs.RO 新提交

NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

NativeMEM:用于长期机器人操作的原生内存压缩

Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

机构 * The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Horizon Robotics(地平线机器人)

AI总结 研究如何让预训练VLA模型高频更新时保留长期视觉历史且高效。提出NativeMEM策略,用原生内存压缩编码,通过开发分词器对齐内存令牌与策略,该方法在模拟和真实机器人实验中效果好,数据效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07338 2026-07-09 quant-ph cs.AI physics.flu-dyn 新提交

Quantum simulation of real-world nonlinear dynamics via Koopman method

通过库普曼方法对现实世界非线性动力学进行量子模拟

Baoyang Zhang, Dong An, Zhaoyuan Meng, Yefei Yu, Xiaoxiao Xiao, Zhen Lu, Yue Yang

机构 * State Key Laboratory for Turbulence and Complex Systems, School of Mechanics and Engineering Science, Peking University(turbulence and Complex Systems Laboratory, Mechanics and Engineering Science School, Peking University) Beijing International Center for Mathematical Research, Peking University Institute of Mechanics, State Key Laboratory of Nonlinear Mechanics, Chinese Academy of Sciences(Mechanics Institute, Nonlinear Mechanics State Key Laboratory, Chinese Academy of Sciences) Beijing Academy of Quantum Information Sciences

AI总结 研究针对量子计算机模拟非线性动力学受限于量子演化酉性的问题,提出量子库普曼方法,通过学习库普曼可观测量等实现模拟,在超导处理器上模拟三个系统,揭示性能限制转变,确定量子适用非线性动力学实际边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06447 2026-07-09 cs.AI cs.CL cs.MA 新提交

Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory

Danus:利用事实图内存编排数学推理智能体

Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Zhang, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Research Institute for Mathematical Sciences, Kyoto University(京都大学数理解析研究所) School of Mathematics, Tianjin University(天津大学数学学院) Zhongguancun Academy(中关村科学院) Department of Mathematics, Stanford University(斯坦福大学数学系) Westlake Institute for Advanced Study, Westlake University(西湖大学西湖高等研究院) School of Mathematical Sciences, Key Laboratory of Intelligent Computing and Applications (Ministry of Education), Tongji University(同济大学数学科学学院(教育部智能计算与应用重点实验室)) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学北京国际数学研究中心与新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾区大学高等研究院智能计算中心)

AI总结 本文针对基于大语言模型的数学推理智能体扩展和编排难题,提出以共享事实图为全局内存管理机制的Danus系统,由主智能体、工作智能体和验证器构成,通过案例研究评估,展示其构建长证明的能力,为长期研究问题提供有效编排途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05750 2026-07-09 cs.AI cs.GR 新提交

ArtisanCAD: An Industrial-Level CAD Agent with Expert-Grounded Knowledge Distillation

ArtisanCAD:一个具有专家基础知识蒸馏的工业级CAD智能体

Yunhan Xu, Qifeng Wu, Xunjin Li, Yuanwei Bin, Qingsong Yao, Jianghang Gu, Guan Wang, Weihao Lv, Huiyu Yang, Wenfa Luo, Jiao Xiang, Yuntian Chen, Shiyi Chen

机构 * Peking University(北京大学) Eastern Institute of Technology(东方理工学院) Renmin University of China(中国人民大学) TenFong Technology Co., Ltd.(十方科技有限公司) IM Motors Technology Co., Ltd.(智己汽车科技有限公司)

AI总结 研究针对工业部件CAD中现有方法的不足,提出ArtisanCAD智能体,利用专家基础知识蒸馏,以CAD中间表示为核心,能弥合文本意图与CAD构建差距,在基准测试和汽车部件设计中表现良好,可生成可编辑模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05394 2026-07-09 cs.LG cs.AI cs.CL 新提交

Weak-to-Strong Generalization via Direct On-Policy Distillation

通过直接在线策略蒸馏实现弱到强泛化

Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR and ByteDance Seed(清华-字节跳动联合研究中心SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Peking University(北京大学)

AI总结 针对可验证奖励RL在大模型上成本高的问题,提出Direct-OPD方法迁移小模型RL的策略偏移,无需在大模型上跑RL即可实现性能提升。

Comments Project Page: https://bytedtsinghua-sia.github.io/Direct-OPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16943 2026-07-09 cs.RO cs.AI 版本更新

LHM-Humanoid: Long-Horizon Human Motion Control for Continuous Object Transport in Cluttered Scenes

LHM-Humanoid:学习一种统一的政策以在多样化的混乱环境中实现长视距人形全身体术操作

Haozhuo Zhang, Jingkai Sun, Michele Caprio, Angelo Cangelosi, Jian Tang, Shanghang Zhang, Qiang Zhang, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) X-Humanoid Peking University(北京大学) University of Hong Kong(香港大学)

AI总结 LHM-Humanoid通过统一政策实现人形在复杂环境中长视距全身体术操作,结合强化学习与知识蒸馏,提升跨场景泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06564 2026-07-08 cs.RO cs.CV 新提交

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * Peking University(北京大学) CUHK(香港中文大学) AI² Robotics(智平方科技)

AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。

Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06323 2026-07-08 cs.RO 新提交

LAMP: Latent Motion Prior-Guided Real-World Learning for Dexterous Hand Manipulation

LAMP:用于灵巧手部操作的潜在运动先验引导的现实世界学习

Xinye Yang, Zhiyuan Ma, Hongze Yu, Yuanpei Chen, Yaodong Yang, Xiaojie Chai, Xinlei Chen, Chao Yu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) PsiBot

AI总结 研究针对灵巧手部现实世界学习易出错的问题,提出含潜在运动先验模块的三阶段学习框架LAMP,先预训练模块,再训练视觉运动策略并通过在线残差RL改进,在真实机器人任务中取得高成功率,提升了学习效果。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06234 2026-07-08 cs.CV 新提交

WING: A Window-Prior-Based Generative Network with Gated Inception for Cross-Modality CT Synthesis

WING:一种基于窗口先验的带门控inception的生成网络用于跨模态CT合成

Siyuan Mei, Yan Xia, Yipeng Sun, Siming Bayer, Zirong Li, Chengze Ye, Daiqi Liu, Fuxin Fan, Yixing Huang, Andreas Maier

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(模式识别实验室,埃尔朗根-纽伦堡弗里德里希-亚历山大大学) Department of Orthodontics and Orofacial Orthopaedics, Friedrich-Alexander-Universität Erlangen-Nürnberg(正畸与口腔颌面正畸科,埃尔朗根-纽伦堡弗里德里希-亚历山大大学) Siemens Healthineers(西门子医疗) Institute of Medical Technology, Peking University(北京大学医学技术研究所)

AI总结 研究旨在从MRI和CBCT生成CT体积改善放疗计划。核心方法是将回归目标重构成窗口表示,引入WING网络,含门控inception生成器、融合与细化变压器及联合对抗训练目标。主要贡献是在相关基准上达最优性能且支持单模型多解剖合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05794 2026-07-08 cs.AI 新提交

From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space

从被动检索到主动记忆导航:学习将记忆用作结构化动作空间

Yue Xu, Yutao Sun, Yihao Liu, Mengyu Zhou, Jiayi Qiao, Lu Ma, Kai Tang, Wenjie Wang, Xiaoxi Jiang, Guanjun Jiang

机构 * Alibaba(阿里巴巴) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对个性化对话代理中记忆系统的被动性问题,提出NapMem框架,将用户记忆组织成多粒度金字塔并通过工具暴露层次,经记忆工具强化学习训练智能体,在多任务实验中具竞争力,还进行了多方面分析,证明结构化存储与策略结合对长期用户记忆有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05708 2026-07-08 cs.AI 新提交

Akashic: A Low-Overhead LLM Inference Service with MemAttention

Akashic:一种基于内存注意力机制的低开销大语言模型推理服务

Yang Liu, Zhaokai Luo, Huayi Jin, Ruozhou He, Chenchen Hong, Zhiyong Wang, Yifei Liu, Yunfei Gu, Chentao Wu, Junhao Hu

机构 * Xiaohongshu Inc.(小红书公司) ShangHai JiaoTong University(上海交通大学) Peking University(北京大学)

AI总结 针对大语言模型推理中重放完整历史记录不切实际的问题,提出基于内存注意力机制的低开销内存系统Akashic,通过组织上下文成有界块、建模块间语义关系及应用软硬件协同设计内存放置,提升了任务准确率、吞吐量和可持续请求率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20023 2026-07-08 cs.SE cs.AI cs.CL 新提交

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

当较低权限足够时:探究LLM代理中的过度权限工具选择

Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。

Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25451 2026-07-08 cs.LG 版本更新

BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

BigMac: 打破多模态大语言模型训练中的计算与内存帕累托前沿

Zili Zhang, Chengxu Yang, Shenglong Zhang, Chenyu Wang, Yufan Zhang, Tuo Dai, Zhouyang Li, Yuhong Ge, Chao Jin, Xin Jin, Yuliang Liu

机构 * Peking University(北京大学) Independent Researcher(独立研究员) Xiaohongshu, Inc(小红书公司)

AI总结 提出BigMac训练流水线,通过嵌套编码器和生成器计算到LLM流水线中,同时优化计算效率和内存使用,打破帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23192 2026-07-08 cs.LG 版本更新

PGOT: A Physics-Geometry Operator Transformer for Complex PDEs

PGOT:用于复杂偏微分方程的物理-几何运算变换器

Zhuo Zhang, Xi Yang, Ying Miao, Xiaobin Hu, Yifu Gao, Yong Yang, Canqun Yang, Boocheong Khoo

机构 * National University of Defense Technology(国防科技大学) National SuperComputer Center in Tianjin(天津国家超算中心) National University of Singapore(新加坡国立大学) Tiangong University(天工大学) Peking University(北京大学)

AI总结 PGOT通过显式几何意识重建物理特征学习,利用SpecGeo-Attention机制在保持线性计算复杂度的同时,保留多尺度几何特征,实现高精度物理场建模。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00860 2026-07-08 cs.LG 版本更新

Policy Improvement Reinforcement Learning

策略改进强化学习

Huaiyang Wang, Xiaojie Li, Xiaohan Wang, Zhixia Zhang, Xiaodong Lu, Zixuan Huang, Jiajun Chai, Guojun Yin, Deqing Wang, Haoyi Zhou, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航) Peking University(北京大学)

AI总结 提出策略改进强化学习(PIRL)框架,通过最大化跨迭代的累积策略改进来替代替代奖励最大化,并基于此设计策略改进策略优化(PIPO)算法,实现闭环优化,在数学推理基准上提升稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02401 2026-07-08 cs.CV 版本更新

Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

超人:统一骨骼与视觉用于人体运动感知与生成

Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(通用人工智能国家重点实验室,北京大学深圳研究生院) Sony R&D Center(索尼研发中心) Nanyang Technological University(南洋理工大学)

AI总结 针对人体运动分析范式碎片化问题,提出Superman统一框架,通过视觉引导运动分词器创建跨模态运动词汇,训练单一MLLM架构处理多任务,实验表明该方法在运动任务中性能领先或具竞争力,为运动分析提供高效可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06521 2026-07-08 cs.CV cs.CL 版本更新

BabyVision: Visual Reasoning Beyond Language

BabyVision:超越语言的视觉推理

Liang Chen, Weichu Xie, Yiyan Liang, Hongfeng He, Hans Zhao, Zhibo Yang, Zhiqi Huang, Haoning Wu, Haoyu Lu, Y. charles, Yiping Bao, Yuantao Fan, Guopeng Li, Haiyang Shen, Xuanzhong Chen, Wendong Xu, Shuzheng Si, Zefan Cai, Wenhao Chai, Ziqi Huang, Fangfu Liu, Tianyu Liu, Baobao Chang, Ming Wu, Xiaobo Hu, Kaiyuan Chen, Yixin Ren, Yang Liu, Yuan Gong, Kuan Li

机构 * UniPat AI xbench Alibaba Group(阿里巴巴集团) MoonShot AI StepFun Peking University(北京大学) Tsinghua University(清华大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学) G Labs Equal Core Contributors(0G Labs 等核心贡献者)

AI总结 研究发现当代多模态语言模型依赖语言先验,在基本视觉任务上表现差。为此引入BabyVision基准评估其核心视觉能力,涵盖多任务。结果显示模型缺乏基本视觉原语,BabyVision的进展迈向人类水平视觉能力,还探索了用生成模型解决视觉推理的方法。

Comments 26 pages, Homepage at https://unipat.ai/blog/BabyVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05377 2026-07-07 cs.RO cs.AI cs.CV 新提交

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation

Cortex:一种用于长视距操作的双向对齐具身智能体框架

Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) USTC(中国科学技术大学)

AI总结 针对现有VLA模型长视距任务短板及分层方法语义-运动鸿沟问题,提出双向对齐框架Cortex,标准化技能原语、优化数据与采样策略,提升长视距操作性能与零样本泛化能力。

Comments Project website: https://steinate.github.io/cortex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05251 2026-07-07 cs.CR cs.AI cs.LG cs.LO 新提交

Privacy-Preserving Robustness Verification for Neural Networks

神经网络的隐私保护鲁棒性验证

Nianyun Song, Xiaokun Luan, Yu Guo, Rongfang Bie, Meng Sun, Xiyue Zhang

机构 * School of Artificial Intelligence, Beijing Key Laboratory of Artificial Intelligence for Education, Engineering Research Center of Intelligent Technology and Educational Application (Ministry of Education), Beijing Normal University, Beijing, China(人工智能学院,北京人工智能教育重点实验室,智能技术与教育应用工程研究中心(教育部),北京师范大学,北京,中国) School of Computer Science University of Bristol(计算机科学学院,布里斯托大学) School of Mathematical Sciences Peking University(数学科学学院,北京大学)

AI总结 针对神经网络验证与数据隐私的固有矛盾,提出基于安全两方计算的SecureCROWN框架,将条件逻辑转化为连续运算消除分支,实现隐私保护下的鲁棒性验证,效率与精度表现优异。

Comments Accepted by UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏