arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3042
2602.04337 2026-02-05 cs.CV cs.AI

Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner

无需人工标注的预训练视觉-语言模型微调

Qian-Wei Wang, Guanghao Meng, Ren Cai, Yaguang Song, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) Peking University Shenzhen Graduate School, Peking University(北京大学深圳研究生院,北京大学)

AI总结 CoFT通过双模型跨模态协作机制和双提示学习策略,在无需人工标注的情况下提升预训练视觉-语言模型的下游任务适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04315 2026-02-05 cs.RO cs.CV

GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning

GeneralVLA:具备知识引导轨迹规划的通用视觉-语言-动作模型

Guoqing Ma, Siheng Wang, Zeyu Zhang, Shan Yu, Hao Tang

机构 * CASIA(中国科学院自动化研究所) Peking University(北京大学)

AI总结 GeneralVLA通过知识引导轨迹规划,实现无需真实数据或示范的通用视觉-语言-动作模型,提升机器人零样本操作和数据生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04294 2026-02-05 cs.CL cs.AI cs.CR

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

少样本演示如何影响基于提示的对抗LLM劫持攻击防御

Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

机构 * Peking University(北京大学)

AI总结 本文研究少样本演示对基于提示的LLM防御策略的影响,发现其对RoP和ToP产生相反效果,提出实用部署建议。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04290 2026-02-05 cs.CL

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

引导验证器:通过动态过程监督实现协作多模态推理

Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) The University of Hong Kong(香港大学)

AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04246 2026-02-05 cs.CL

CoLT: Reasoning with Chain of Latent Tool Calls

CoLT:基于链式潜在工具调用的推理

Fangwei Zhu, Zhifang Sui

机构 * School of Computer Science, State Key Laboratory of Multimedia Information Processing, Peking University(计算机学院、多媒体信息处理国家重点实验室、北京大学)

AI总结 CoLT通过将潜在推理转化为工具调用,实现高效推理,提升模型效率与准确性,适用于多种解码器结构和强化学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04228 2026-02-05 cs.RO

Reshaping Action Error Distributions for Reliable Vision-Language-Action Models

重塑动作误差分布以实现可靠的视觉-语言-动作模型

Shuanghao Bai, Dakai Wang, Cheng Chi, Wanqi Zhou, Jing Lyu, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Lei Xing, Shanghang Zhang, Badong Chen

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation(自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Artificial Intelligence(人工智能学院) Peking University(北京大学)

AI总结 本研究通过重塑动作误差分布,提出基于最小误差熵的VLA模型训练方法,提升模型在不同任务中的成功率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03893 2026-02-05 cs.CV

GPAIR: Gaussian-Kernel-Based Ultrafast 3D Photoacoustic Iterative Reconstruction

GPAIR: 基于高斯核的超快三维光电声迭代重建

Yibing Wang, Shuang Li, Tingting Huang, Yu Zhang, Chulhong Kim, Seongwook Choi, Changhui Li

机构 * Department of Biomedical Engineering, College of Future Technology, Peking University(生物医学工程系,未来技术学院,北京大学) Department of Electrical Engineering, Pohang University of Science and Technology(电气工程系,POSTECH) Department of Convergence IT Engineering, Pohang University of Science and Technology(融合IT工程系,POSTECH) Department of Mechanical Engineering, Pohang University of Science and Technology(机械工程系,POSTECH) Department of Medical Science and Engineering, Pohang University of Science and Technology(医学科学与工程系,POSTECH) Medical Device Innovation Center, Pohang University of Science and Technology(医疗设备创新中心,POSTECH) National Biomedical Imaging Center, Peking University(国家生物医学成像中心,北京大学)

AI总结 GPAIR通过基于高斯核的超快迭代重建方法,实现大规模三维光电声成像的亚秒级重建速度,显著提升了3D PACT的临床应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03887 2026-02-05 eess.IV cs.CV

To What Extent Do Token-Level Representations from Pathology Foundation Models Improve Dense Prediction?

病理基础模型的标记级表示在密集预测中有多大的提升作用?

Weiming Chen, Xitong Ling, Xidong Wang, Zhenyang Cai, Yijia Guo, Mingxi Fu, Ziyi Zeng, Minxi Ouyang, Jiawen Li, Yizhi Wang, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua University, Shenzhen, China(清华大学深圳研究院) Peking University, Beijing, China(北京大学)

AI总结 本文提出PFM-DenseBench,通过评估17个病理基础模型在18个数据集上的表现,揭示不同模型和调优策略在异构数据集上的性能差异及适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13928 2026-02-05 cs.CV cs.IR

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

LoVR:一种多模态背景下长视频检索的基准

Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

机构 * East China Normal University Shanghai China Peking University \& Zhongguancun Academy Beijing China Huazhong University of Science Beihang University Beijing China Peking University Beijing China East China Normal University Peking University \& Zhongguancun Academy Beihang University Peking University

AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03690 2026-02-04 cs.LG cs.AI

LLM-Inspired Pretrain-Then-Finetune for Small-Data, Large-Scale Optimization

受大语言模型启发的小数据、大规模优化的预训练-微调方法

Zishi Zhang, Jinhui Han, Ming Hu, Yijie Peng

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

AI总结 本文提出一种受大语言模型启发的预训练-微调方法,用于解决小数据下的大规模决策优化问题,通过预训练注入领域知识并利用合成数据,微调提升与真实数据的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03529 2026-02-04 cs.NI cs.AI cs.MM

Morphe: High-Fidelity Generative Video Streaming with Vision Foundation Model

Morphe: 基于视觉基础模型的高保真生成视频流媒体

Tianyi Gong, Zijian Cao, Zixing Zhang, Jiangkai Wu, Xinggong Zhang, Shuguang Cui, Fangxin Wang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Shenzhen Future Network of Intelligence Institute(深圳未来网络智能研究院) Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

AI总结 Morphe基于视觉基础模型,通过联合训练和智能分组丢弃技术,实现高保真度、低带宽的实时视频流媒体传输。

Comments Accepted by NSDI 2026 Fall

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20272 2026-02-04 cs.CV

Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning

Ground-R1: 通过强化学习激励基于地面的视觉推理

Meng Cao, Haoze Zhao, Can Zhang, Xiaojun Chang, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Sun Yat-sen University(中山大学)

AI总结 Ground-R1 通过 Scale Relative Policy Optimization 方法,解决 LVLM 在视觉证据 grounding 方面的偏差问题,提升推理准确性和证据 grounding 能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03510 2026-02-04 cs.CV

Semantic Routing: Exploring Multi-Layer LLM Feature Weighting for Diffusion Transformers

语义路由:探索多层LLM特征加权用于扩散变换器

Bozhou Li, Yushuo Guan, Haolin Li, Bohan Zeng, Yiyan Ji, Yue Ding, Pengfei Wan, Kun Gai, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanjing University(南京大学) Fudan University(复旦大学)

AI总结 本文提出深度-wise语义路由方法,通过多层LLM特征加权提升文本到图像生成的准确性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03496 2026-02-04 cs.LG

Lookahead Path Likelihood Optimization for Diffusion LLMs

前瞻路径似然优化用于扩散大语言模型

Xuejie Liu, Yap Vit Chun, Yitao Liang, Anji Liu

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学)

AI总结 本文提出POKE-SMC方法,通过优化路径似然提升扩散大语言模型的解屏蔽路径准确性,实验表明在同等计算开销下,平均提升2%-3%的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03371 2026-02-04 cs.CV

Multi-Resolution Alignment for Voxel Sparsity in Camera-Based 3D Semantic Scene Completion

基于体素稀疏性的多分辨率对齐方法用于基于摄像头的3D语义场景补全

Zhiwen Yang, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)

AI总结 本文提出多分辨率对齐方法,通过多分辨率特征对齐和关键分布一致性损失缓解基于摄像头的3D语义场景补全中的体素稀疏性问题。

Comments 15 pages, 6 figures, accepted by TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03207 2026-02-04 cs.GR cs.CV cs.PF

WebSplatter: Enabling Cross-Device Efficient Gaussian Splatting in Web Browsers via WebGPU

WebSplatter: 通过WebGPU实现跨设备高效高斯溅射

Yudong Han, Chao Xu, Xiaodan Ye, Weichen Bi, Zilong Dong, Yun Ma

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究所) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

AI总结 WebSplatter通过WebGPU实现跨设备高效高斯溅射,采用无等待分层基数排序和不透明度感知的几何裁剪,提升渲染效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02548 2026-02-04 cs.LG cs.AI cs.CV cs.MA

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

ToolTok: 为高效且通用的GUI代理的工具标记化

Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

机构 * Department of Computer Science, Tsinghua University, Beijing, China(清华大学计算机科学系) Guangming Laboratory, Shenzhen, China(光明实验室) National University of Singapore, Singapore(新加坡国立大学) Peking University, Beijing, China(北京大学) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU–BIT University(MSU-BIT-SMBU应用数学联合研究中心)

AI总结 ToolTok通过多步路径寻找范式,利用语义锚定机制和易到难课程,实现高效且通用的GUI代理,以较少数据获得优异性能。

Comments 8 pages main paper, 18 pages total, 8 figures, 5 tables, code at https://github.com/ZephinueCode/ToolTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02545 2026-02-04 cs.LG cs.AI

Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization

超越对齐:通过流形重塑策略优化扩展推理能力

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

AI总结 本文提出流形重塑策略优化方法,通过几何干预扩展LLM的推理能力,实验证明其在数学任务中优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17878 2026-02-04 cs.CR cs.AI

Crypto-ncRNA: a bio-inspired post-quantum cryptographic primitive exploiting RNA folding complexity

Crypto-ncRNA:一种受生物启发的后量子密码原语,利用非编码RNA折叠复杂性

Xu Wang, Yiquan Wang, Tin-yeh Huang, Zhaorui Jiang, Kai Wei

机构 * Tsinghua University-Peking University Joint Center for Life Sciences, Tsinghua University(清华大学-北京大学联合生命科学中心,清华大学) Xinjiang Key Laboratory of Biological Resources and Genetic Engineering, College of Life Science and Technology, Xinjiang University(新疆生物资源与基因工程重点实验室,新疆大学生命科学与技术学院) College of Mathematics and System Science, Xinjiang University(新疆大学数学与系统科学学院) Department of Industrial and Systems Engineering, Faculty of Engineering, The Hong Kong Polytechnic University(工程学院工业与系统工程系,香港理工大学) School of Environment and Energy, Shenzhen Graduate School, Peking University(环境与能源学院,北京大学深圳研究生院)

AI总结 Crypto-ncRNA利用非编码RNA折叠的热力学复杂性,提出一种基于生物启发的后量子密码原语,具备高安全性和高效性。

Comments Accepted at the AI4NA workshop at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12992 2026-02-04 cs.CL

MemoryFormer: Minimize Transformer Computation by Removing Fully-Connected Layers

MemoryFormer: 通过移除全连接层来减少Transformer计算

Ning Ding, Yehui Tang, Haochen Qin, Zhenli Zhou, Chao Xu, Lin Li, Kai Han, Heng Liao, Yunhe Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei HiSilicon(华为海思)

AI总结 MemoryFormer通过移除全连接层,利用内存查找表和哈希算法替代线性投影,显著降低Transformer计算复杂度并提升效率。

Comments NeurIPS 2024. Code available at https://github.com/ningding-o/MemoryFormer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02458 2026-02-03 cs.LG cs.NI

Conflict-Aware Client Selection for Multi-Server Federated Learning

多服务器联邦学习中的冲突感知客户端选择

Mingwei Hong, Zheng Lin, Zehang Lin, Lin Li, Miao Yang, Xia Du, Zihan Fang, Zhaolu Kang, Dianxin Luan, Shunzhi Zhu

机构 * 1 School of Computer Information Engineering, Xiamen University of Technology, Xiamen, China 2 Department of Electrical Electronic Engineering, The University of Hong Kong, Hong Kong, China 3 Department of Computer Science, City University of Hong Kong, Hong Kong, China 4 School of Software \& Microelectronics, Peking University, Beijing, China 5 Institute for Imaging, Data Communications, University of Edinburgh, UK

AI总结 本文提出RL CRP方法,通过预测冲突风险优化多服务器联邦学习中的客户端选择,减少资源竞争并提升训练效率。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02222 2026-02-03 cs.CV cs.CR

MIRROR: Manifold Ideal Reference ReconstructOR for Generalizable AI-Generated Image Detection

MIRROR:基于流形理想参考的通用AI生成图像检测器

Ruiqi Liu, Manni Cui, Ziheng Qin, Zhiyuan Yan, Ruoxin Chen, Yi Han, Zhiheng Li, Junkai Chen, ZhiJin Chen, Kaiqing Lin, Jialiang Shen, Lubin Weng, Jing Dong, Yan Wang, Shu Wu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉信息学院) Huazhong University of Science and Technology(华中科技大学) Tencent YouTu Lab(腾讯YouTu实验室) Southwest University(西南大学) Peking University(北京大学) The University of Sydney(悉尼大学) Shenzhen University(深圳大学) Tsinghua University(清华大学)

AI总结 MIRROR通过流形理想参考重建器,利用现实先验和残差信号,实现对AI生成图像的高效检测,超越现有方法并接近人类感知极限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01775 2026-02-03 cs.AI cs.LG

Efficient Cross-Architecture Knowledge Transfer for Large-Scale Online User Response Prediction

高效跨架构知识迁移用于大规模在线用户响应预测

Yucheng Wu, Yuekui Yang, Hongzheng Li, Anan Liu, Jian Xiao, Junjie Zhai, Huan Yu, Shaoping Ma, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education \& School of Computer Science, Peking University Beijing China Department of Computer Science Technology, Tsinghua University \& Advertising Engineering Department, CDG, Tencent Corporation Beijing China Advertising Engineering Department, CDG, Tencent Corporation Beijing China Technology, Tsinghua University Beijing China Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education \& School of Computer Science, Peking University Technology, Tsinghua University \& Advertising Engineering Department, CDG, Tencent Corporation Advertising Engineering Department, CDG, Tencent Corporation Technology, Tsinghua University

AI总结 CrossAdapt通过两阶段框架实现高效跨架构知识迁移,提升AUC并降低训练时间,适用于大规模在线用户响应预测。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01675 2026-02-03 cs.AI cs.LG

TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios

TRIP-Bench:面向现实场景的长周期交互智能体基准

Yuanzhe Shen, Zisu Huang, Zhengyuan Wang, Muzhao Tian, Zhengkang Guo, Chenyang Zhang, Shuaiyu Zhou, Zengjie Hu, Dailin Li, Jingwen Xu, Kaimin Wang, Wenhao Liu, Tianlong Li, Fengpeng Yue, Feng Hong, Cao Liu, Ke Zeng

机构 * Xiaohongshu Inc.(小红书公司) School of Computer Science, Fudan University(复旦大学计算机学院) Dalian University of Technology(大连理工大学) Peking University(北京大学) Wuhan University(武汉大学)

AI总结 TRIP-Bench是一个面向现实场景的长周期交互智能体基准,通过真实旅行规划场景测试多工具推理与约束满足,提出GTPO方法提升智能体鲁棒性与性能。

Comments 40 pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01630 2026-02-03 cs.CV

Research on World Models Is Not Merely Injecting World Knowledge into Specific Tasks

世界模型的研究并非仅仅是将世界知识注入特定任务

Bohan Zeng, Kaixin Zhu, Daili Hua, Bozhou Li, Chengzhuo Tong, Yuran Wang, Xinyi Huang, Yifan Dai, Zixiang Zhang, Yifan Yang, Zhou Liu, Hao Liang, Xiaochen Ma, Ruichuan An, Tianyi Bai, Hongcheng Gao, Junbo Niu, Yang Shi, Xinlong Chen, Yue Ding, Minglei Shi, Kai Zeng, Yiwen Tang, Yuanxing Zhang, Pengfei Wan, Xintao Wang, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出统一的世界模型设计规范,强调其应整合交互、感知、符号推理和空间表示,以实现更通用和稳健的世界模型。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01611 2026-02-03 cs.LG

What Do Agents Learn from Trajectory-SFT: Semantics or Interfaces?

轨迹SFT中智能体学习了语义还是接口?

Weizheng Gu, Chengze Li, Zhuohao Yu, Mengyuan Sun, Zhibang Yang, Wei Wang, Hongrui Jia, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University, Beijing, China(软件工程国家工程研究中心,北京大学,北京,中国) Nanjing University, Nanjing, China(南京大学,南京,中国) Tongji University, Shanghai, China(同济大学,上海,中国)

AI总结 本文提出PIPE协议用于评估智能体在轨迹SFT中对接口的依赖性,发现轨迹SFT显著放大了接口捷径,且引入了接口依赖性指标以量化训练时接口的偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01519 2026-02-03 cs.LG cs.AI

You Need an Encoder for Native Position-Independent Caching

你需要为原生位置无关缓存添加编码器

Shiju Zhao, Junhao Hu, Jiaqi Zheng, Guihai Chen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Computer Science, Peking University, China(计算机学院,北京大学,中国)

AI总结 本文提出原生PIC方法,通过在解码器-only LLMs中引入编码器并训练其支持PIC,开发了COMB缓存系统,显著提升了TTFT和吞吐量,同时保持精度。

Comments 12 pages, 10 figures. Welcome back, Encoder

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18352 2026-02-03 cs.CL cs.AI

Code over Words: Overcoming Semantic Inertia via Code-Grounded Reasoning

基于代码的词:通过代码引导的推理克服语义惯性

Manjie Xu, Isabella Yin, Xinyi Tu, Chi Zhang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) School of Psychological and Cognitive Sciences, Peking University(心理与认知科学学院,北京大学) Tsinghua International School(清华大学国际学校) University of California, Berkeley(加州大学伯克利分校) State Key Lab of General AI, Peking University(通用人工智能国家重点实验室,北京大学) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学) Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,北京大学-武汉人工智能研究院)

AI总结 通过代码引导的推理(LCV)克服语义惯性,表明表示形式影响模型在动态场景中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02649 2026-02-03 cs.RO cs.AI

Effective Online 3D Bin Packing with Lookahead Parcels Using Monte Carlo Tree Search

有效在线三维装箱使用蒙特卡洛树搜索和前瞻性包裹

Jiangyi Fang, Bowen Zhou, Haotian Wang, Xin Zhu, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education China(高可信软件技术重点实验室(北京大学)) Faculty of Computing, Harbin Institute of Technology, Harbin, China(计算机学院,哈尔滨工业大学,哈尔滨,中国) JD Logistic, Beijing, China(京东物流,北京,中国) School of Computer Science, Peking University, Beijing, China(计算机科学学院,北京大学,北京,中国)

AI总结 本文提出了一种基于蒙特卡洛树搜索和前瞻性包裹的在线三维装箱方法,通过动态探索先验平衡强化学习策略与稳健随机策略,有效应对物流中的短期分布变化,实现显著的装箱效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18595 2026-02-03 cs.LG

Benchmarking neural surrogates on realistic spatiotemporal multiphysics flows

在现实时空多物理场流中评估神经替代模型

Runze Mao, Rui Zhang, Xuan Bai, Tianhao Wu, Teng Zhang, Zhenyi Chen, Minqi Lin, Bocheng Zeng, Yangchen Xu, Yingxuan Xiang, Haoze Zhang, Shubham Goswami, Pierre A. Dawe, Yifan Xu, Zhenhua An, Mengtao Yan, Xiaoyi Lu, Yi Wang, Rongbo Bai, Haobu Gao, Xiaohang Fang, Han Li, Hao Sun, Zhi X. Chen

机构 * State Key Laboratory for Turbulence and Complex Systems, School of Mechanics and Engineering Science, Peking University(湍流与复杂系统国家重点实验室,力学与工程科学学院,北京大学) Gaoling School of Artificial Intelligence, Renmin University of China(Gallagher人工智能学院,中国人民大学) AI for Science Institute(人工智能科学研究院) University of Calgary(卡尔加里大学) Kyoto University(京都大学) FM Global(FM全球) LandSpace Technology Corporation Ltd.(陆地方向技术有限公司) Aero Engine Academy of China(中国航空发动机学院)

AI总结 REALM通过严谨的基准测试框架评估神经替代模型在现实多物理场流中的表现,揭示了模型在复杂环境中的局限性及改进方向。

Comments 52 pages, 20 figures. Code and data available at https://github.com/deepflame-ai/REALM. Companion website and leaderboard at https://realm-bench.org

详情

展开后加载摘要…

URL PDF HTML 收藏