arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2604.14922 2026-04-17 cs.LG cs.CL

LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

LongAct:利用内在激活模式促进长上下文强化学习

Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出LongAct方法,通过利用长上下文推理中的稀疏结构,改进大语言模型的训练,提升长上下文处理能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12389 2026-04-17 cs.AI cs.CL

Evolving Beyond Snapshots: Harmonizing Structure and Sequence via Entity State Tuning for Temporal Knowledge Graph Forecasting

超越快照:通过实体状态调谐实现结构与序列的和谐统一以进行时间知识图谱预测

Siyuan Li, Yunjia Wu, Yiyong Xiao, Pingyang Huang, Peize Li, Ruitong Liu, Yan Wen, Te Sun

机构 * Dalian University of Technology(大连理工大学) Shenzhen University of Advanced Technology(深圳先进技术大学) King’s College London(伦敦大学国王学院) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Entity State Tuning框架,通过维持全局状态缓冲区和闭环设计,实现时间知识图谱预测中的持久化和持续进化实体状态,提升长周期预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08310 2026-04-17 cs.LG cs.AI

ORBIT: On-policy Exploration-Exploitation for Controllable Multi-Budget Reasoning

ORBIT:可控多预算推理的在线探索-利用

Kun Liang, Clive Bai, Xin Xu, Chenming Tang, Sanwoo Lee, Weijie Liu, Saiyong Yang, Yunfang Wu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) LLM Department, Tencent(腾讯LLM部门) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 ORBIT提出可控多预算推理框架,通过多阶段强化学习发现帕累托最优推理行为,并通过在线蒸馏融合行为,实现可控推理行为、高推理密度和统一模型集成。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07449 2026-04-17 cs.IR cs.AI

RLPO: Residual Listwise Preference Optimization for Long-Context Review Ranking

RLPO:长上下文评论排序的残差列表偏好优化

Hao Jiang, Zhi Yang, Annan Wang, Yichi Zhang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Independent Researcher(独立研究员)

AI总结 本文提出RLPO,通过残差列表级优化提升长上下文评论排序,解决传统方法在长上下文下的效率与准确性矛盾,实验显示其在NDCG@k上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20214 2026-04-17 cs.AI

When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning

当慢并非真:多模态推理中真理性的反比例定律

Sitong Fang, Wenjing Cao, Jiahao Li, Xuyao Wang, Juntao Dai, Chi-Min Chan, Sirui Han, Yike Guo, Yaodong Yang, Jiaming Ji

机构 * Institute for AI(人工智能研究院) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究探讨了多模态推理中慢思考模式的反比例定律,发现慢思考模型在面对不完整或误导性视觉输入时更易生成虚假细节,揭示了推理模型在处理模糊输入时的脆弱性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14806 2026-04-17 cs.SD cs.MM

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

倾听、暂停与推理:迈向基于感知的混合推理以实现音频理解

Jieyi Wang, Yazhe Niu, Dexuan Xu, Zhongyu Wei

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) CUHK MMLab(香港中文大学多媒体实验室) Fudan University(复旦大学)

AI总结 本文提出HyPeR框架,通过感知-推理混合方法提升音频理解能力,通过PAQA数据集训练模型并引入PAUSE标记和一致性奖励,实验表明其在复杂音频场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14709 2026-04-17 cs.AI

HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks

HWE-Bench:在真实世界硬件Bug修复任务上评估LLM代理的基准测试

Fan Cui, Hongyuan Hou, Zizhang Luo, Chenyun Yin, Yun Liang

机构 * Peking University(北京大学)

AI总结 HWE-Bench是首个大规模仓库级基准,用于评估LLM代理在真实世界硬件Bug修复任务中的表现,通过417个任务实例验证代理在不同项目中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14632 2026-04-17 cs.CV

High-Speed Full-Color HDR Imaging via Unwrapping Modulo-Encoded Spike Streams

通过解调编码脉冲流实现高速全彩HDR成像

Chu Zhou, Siqi Yang, Kailong Zhang, Heng Guo, Zhaofei Yu, Boxin Shi, Imari Sato

机构 * Digital Content and Media Sciences Research Division, National Institute of Informatics(国家信息研究所数字内容与媒体科学研究中心) Pattern Recognition and Intelligent System Laboratory, School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, the National Engineering Research Center of Visual Technology, School of Computer Science, and the PKU-AI 2 Robotics Joint Lab of Embodied AI, Peking University(多媒体信息处理国家重点实验室,计算机学院,视觉技术国家工程研究中心,计算机学院,北京大学PKU-AI 2机器人联合实验室) Institute for Artificial Intelligence, the State Key Laboratory of Multimedia Information Processing, School of Computer Science, and the National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(人工智能研究院,多媒体信息处理国家重点实验室,计算机学院,视觉技术国家工程研究中心,计算机学院,北京大学) Institute for Artificial Intelligence, and the National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(人工智能研究院,视觉技术国家工程研究中心,计算机学院,北京大学)

AI总结 本文提出一种基于模运算的HDR成像系统,通过改进传感模型和解调算法实现高速全彩HDR成像,有效克服了传统方法在运动伪影与信息损失之间的权衡问题。

Comments TPAMI under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14200 2026-04-17 q-bio.NC cs.AI

Retina gap junctions support the robust perception by warping neural representational geometries along the visual hierarchy

视网膜间隙连接支持通过视觉层级中神经表征几何的变形实现的鲁棒感知

Yang Yue, Shenjian Zhang, Yonghong Tian, Kai Du, Tiejun Huang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 本文通过结合视网膜间隙连接过滤器与DNN,构建生物混合模型,研究视网膜间隙连接的去噪功能及其对脑流形的影响,发现其具有更高的鲁棒性和非线性决策边界。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12407 2026-04-17 cs.CR cs.CL cs.LG

De-Anonymization at Scale via Tournament-Style Attribution

通过竞赛式归因实现大规模去匿名化

Lirui Zhang, Huishuai Zhang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学)

AI总结 研究利用LLM链接匿名文档与其作者,提出大规模去匿名化方法DAS,通过分组筛选和多数投票提升鲁棒性和精度,实验显示在匿名平台存在现实隐私风险。

Comments 14 pages, ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14010 2026-04-16 cs.LG cs.CL

Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning

参数重要性并非静态:为监督微调设计的演进参数隔离

Zekai Lin, Chao Xue, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng

机构 * Tencent Hunyuan(腾讯文言) Tencent Yuanbao(腾讯元宝) Peking University(北京大学) UESTC University of New South Wales(新南威尔士大学)

AI总结 本文提出EPI框架,通过动态调整参数隔离策略,减少训练中的任务干扰和遗忘,提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13824 2026-04-16 cs.LG

Beyond State Consistency: Behavior Consistency in Text-Based World Models

超越状态一致性:文本基础世界模型中的行为一致性

Youling Huang, Guanqiao Chen, Junchi Yao, Lu Wang, Fangkai Yang, Chao Du, ChenZhuo Zhao, Pu Zhao, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Dalian University of Technology(大连理工大学) MBZUAI Peking University(北京大学) Microsoft(微软)

AI总结 本文提出行为一致性训练方法,通过改进世界模型与真实环境的功能一致性,提升长期对齐效果,实验显示在WebShop和TextWorld中表现优异,同时保持单步预测质量。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13791 2026-04-16 cs.CV

PBE-UNet: A light weight Progressive Boundary-Enhanced U-Net with Scale-Aware Aggregation for Ultrasound Image Segmentation

PBE-UNet:一种轻量级的渐进边界增强U-Net,具有尺度感知聚合,用于超声图像分割

Chen Wang, Yixin Zhu, Yongbin Zhu, Fengyuan Shi, Qi Li, Jun Wang, Zuozhu Liu, Keli Hu

机构 * Department of Computer Science, Shaoxing University(绍兴大学计算机科学系) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Northeastern University(工业智能化与系统优化国家级前沿科学中心,东北大学) College of Computer Science, Chongqing University(重庆大学计算机学院) School of Computer and Computing Science, Hangzhou City University(杭州市大学计算机与计算科学学院) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) Information Technology R&D Innovation Center of Peking University(北京大学信息技术研发创新中心)

AI总结 本文提出PBE-UNet,通过引入尺度感知聚合模块和边界引导特征增强模块,解决超声图像分割中边界模糊和尺度变化的问题,实验表明其在四个数据集上优于现有方法。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05991 2026-04-16 cs.AI

3D Instruction Ambiguity Detection

三维指令歧义检测

Jiayu Ding, Haoran Tang, Hongbo Jin, Wei Gao, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

AI总结 本文提出三维指令歧义检测任务,构建了大规模基准Ambi3D,发现现有3D大语言模型难以判断指令歧义,提出AmbiVer框架解决该问题,提升具身AI的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13786 2026-04-16 cs.CL

QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs

QuantileMark:一种消息对称的多比特水印用于大语言模型

Junlin Zhu, Baizhou Huang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

AI总结 QuantileMark通过在连续累积概率区间[0,1)内嵌入信息,实现消息对称的多比特水印,提升水印检测的鲁棒性和生成质量的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13746 2026-04-16 cs.CV

ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction

ClipGStream: 用于任意长度和任意运动多视角动态场景重建的Clip-Stream高斯点云法

Jie Liang, Jiahao Wu, Chao Wang, Jiayu Yang, Xiaoyun Zheng, Kaiqiang Xiong, Zhanke Wang, Jinbo Yan, Feng Gao, Ronggang Wang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东超高清沉浸式媒体技术省重点实验室) Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Pengcheng Laboratory(鹏城实验室) Peking University(北京大学) MIGU Video Co., Ltd.(MIGU视频有限公司)

AI总结 本文提出ClipGStream框架,通过clip级流优化实现长动态视频的高斯点云重建,兼顾可扩展性和时间一致性。

Comments CVPR 2026, Project pages: https://liangjie1999.github.io/ClipGStreamWeb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13688 2026-04-16 cs.CV cs.AI

Beyond Voxel 3D Editing: Learning from 3D Masks and Self-Constructed Data

超越体素3D编辑:从3D掩码和自构造数据中学习

Yizhao Xu, Hongyuan Zhu, Caiyun Liu, Tianfu Wang, Keyu Chen, Sicheng Xu, Jiaolong Yang, Nicholas Jing Yuan, Qi Zhang

机构 * The Peking University(北京大学) HKUST(GZ)(香港科技大学(广州)) Microsoft AI(微软人工智能) Microsoft Research(微软研究院)

AI总结 本文提出BVE框架,通过自构造的大规模3D编辑数据集,结合轻量可训练模块,实现高效的文本语义注入,保留局部不变性,生成高质量的文本对齐3D资产。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13654 2026-04-16 cs.RO

Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap

面向无人机的视觉与语言导航:进展、挑战与研究路线图

Hanxuan Chen, Jie Zheng, Siqi Yang, Tianle Zeng, Siwei Feng, Songsheng Cheng, Ruilong Ren, Hanzhong Guo, Shuai Yuan, Xiangyue Wang, Kangli Wang, Ji Pei

机构 * Autel Robotics, Shenzhen, China(大疆创新,深圳,中国) School of Intelligent Software and Engineering, Nanjing University, Nanjing, China(南京大学智能软件与工程学院,南京,中国) School of Computer, Data & Information Sciences, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机、数据与信息科学学院,麦迪逊,WI,美国) Southern University of Science and Technology, Shenzhen, China(南方科技大学,深圳,中国) The University of Hong Kong, Hong Kong SAR, China(香港大学,香港特别行政区,中国) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院,北京,中国)

AI总结 本文综述了无人机视觉与语言导航领域,分析了从早期模块化方法到基于大模型的智能系统的发展,探讨了现实部署中的挑战,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13425 2026-04-16 cs.CV

VibeFlow: Versatile Video Chroma-Lux Editing through Self-Supervised Learning

VibeFlow:通过自监督学习实现多功能视频色光编辑

Yifan Li, Pei Cheng, Bin Fu, Shuai Yang, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

AI总结 本文提出VibeFlow框架,通过自监督学习实现视频色光编辑,解决光照和颜色修改的同时保持结构和时间保真的问题,无需昂贵训练资源,支持零样本应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02709 2026-04-16 cs.CL cs.AI cs.LG cs.SE

Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy

通过乔姆斯基层级评估大语言模型的正式推理能力

Yihong Dong, Jianha Xiao, Xue Jiang, Xuyuan Guo, Zhiyuan Fan, Jiaru Qian, Kechi Zhang, Jia Li, Zhi Jin, Ge Li

机构 * Peking University(北京大学) Wuhan University(武汉大学)

AI总结 本文提出ChomskyBench基准,通过乔姆斯基层级系统评估大语言模型的正式推理能力,揭示其在结构化语言处理中的性能分层及效率瓶颈。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05957 2026-04-16 cs.DC cs.AI

Domain-Adaptive Model Merging Across Disconnected Modes

跨断开模式的领域适应性模型合并

Junming Liu, Yusen Zhang, Rongchao Zhang, Wenkai Zhu, Tian Wu

机构 * Tongji University(同济大学) Peking University(北京大学) Southeast University(东南大学) Nanchang University(南昌大学)

AI总结 本文提出DMM框架,通过独立训练领域模型、合并相似模型及生成伪数据精炼知识,实现无需数据的模型合并,提升性能。

Comments 5 pages, 1 figure, 3 tables; Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07422 2026-04-16 cs.CL cs.AI

Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations

通往真实性的两条路径:关于LLM幻觉内在编码的研究

Wen Luo, Guangyue Peng, Wei Li, Shaohang Wei, Feifan Song, Liang Wang, Nan Yang, Xingxing Zhang, Jing Jin, Furu Wei, Houfeng Wang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机科学学院,北京大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文探讨LLM幻觉的内在编码机制,通过两种信息路径揭示真实性信号的来源,发现其与知识边界和内部表示密切相关,并提出改进幻觉检测的应用。

Comments Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11334 2026-04-16 cs.CL

LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models

LaoBench:一种大规模多维老挝语基准测试用于大语言模型

Jian Gao, Richeng Xuan, Zhaolu Kang, Dingshi Liao, Wenxin Huang, Zongmou Huang, Yangdi Xu, Bowen Qin, Zheqi He, Xi Yang, Changjin Li, Yonghua Lin

机构 * China-ASEAN Information Harbor Co., Ltd.(中国-东盟信息港有限公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)

AI总结 本文提出LaoBench,首个大规模多维老挝语基准测试,包含17000+样本,涵盖文化知识应用、K12教育和双语翻译,评估LLM在老挝语的理解与推理能力,发现多语言模型在文化推理和翻译准确性上仍落后于人类专家。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06477 2026-04-16 cs.AI

MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents

MAS-Bench:一种统一的快捷键增强混合移动GUI代理基准测试

Pengxiang Zhao, Guangyi Liu, YaoZhen Liang, Weiqing He, Zhengxi Lu, WenHao Wang, Yuehao Huang, Yuxiang Chai, Zhaolu Kang, Yaxuan Guo, Hao Wang, Kexin Zhang, Liang Liu, Yong Liu

机构 * Zhejiang University(浙江大学) vivo AI Lab(vivo AI实验室) Peking University(北京大学)

AI总结 本文提出MAS-Bench,用于评估结合GUI和快捷键的混合移动自动化代理,包含139个任务和9个评估指标,实验显示混合代理在效率上优于纯GUI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00222 2026-04-16 cs.AI cs.CL cs.LG

RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization

RL-PLUS: 通过混合策略优化对抗LLMs在强化学习中的能力边界崩溃

Yihong Dong, Xue Jiang, Yongding Tao, Huanyu Liu, Kechi Zhang, Lili Mou, Rongyu Cao, Yingwei Ma, Jue Chen, Binhua Li, Zhi Jin, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 RL-PLUS通过混合策略优化解决LLMs在强化学习中的能力边界崩溃问题,结合内部利用与外部数据提升推理能力,实验表明其在数学推理和分布外任务中表现优异。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21751 2026-04-16 cs.SE cs.CL

CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation

CodeFlowBench: 一个用于复杂代码生成的多轮迭代基准

Sizhe Wang, Zhengren Wang, Dongsheng Ma, Yongan Yu, Rui Ling, Zhiyu Li, Feiyu Xiong, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Shanghai University of Finance and Economics(上海财经大学) McGill University(麦吉尔大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

AI总结 CodeFlowBench通过多轮迭代重用现有代码评估LLM在复杂代码生成中的能力,包含5000+编程问题和真实GitHub仓库,揭示多轮代码流程中模型性能下降与依赖复杂度负相关的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00601 2026-04-16 cs.LG

AutoPV: Automatically Design Your Photovoltaic Power Forecasting Model

AutoPV:自动设计你的光伏功率预测模型

Dayin Chen, Xiaodan Shi, Mingkun Jiang, Haoran Zhang, Dongxiao Zhang, Yuntian Chen, Jinyue Yan

机构 * Department of Building Environment and Energy Engineering, The Hong Kong Polytechnic University(香港理工大学建筑环境与能源工程系) International Centre of Urban Energy Nexus, The Hong Kong Polytechnic University(香港理工大学城市能源 nexus 中心) Research Institute for Smart Energy, The Hong Kong Polytechnic University(香港理工大学智能能源研究院) Eastern Institute for Advanced Study, Eastern Institute of Technology(东院高级研究机构) School of Business, Society and Technology, Mälardalens University(马尔默大学商学院、社会与技术学院) Center for Spatial Information Science, the University of Tokyo(东京大学空间信息科学中心) PV Industry Innovation Center, State Power Investment Corporation(国家电力投资集团光伏产业创新中心) School of Urban Planning and Design, Peking University, Shenzhen(北京大学深圳校区城市规划与设计学院) Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究所)

AI总结 本文提出AutoPV框架,利用神经架构搜索技术自动设计光伏功率预测模型,通过新颖的搜索空间提升预测性能,实验表明其在短时间內构建出优于现有模型的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12630 2026-04-15 cs.CV cs.CL

GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning

GeoAlign:用于MLLM空间推理的几何特征重定位

Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang

机构 * National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学) Meituan Inc.(美团公司) National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)

AI总结 本文提出GeoAlign框架,通过动态聚合多层几何特征以解决MLLM在空间推理中的任务对齐偏差问题,实验表明其紧凑模型在多个基准测试中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12626 2026-04-15 cs.RO cs.CV

Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting

Habitat-GS:一种高保真导航仿真器与动态高斯点云

Ziyuan Xia, Jingyi Xu, Chong Cui, Yuanhong Yu, Jiazhao Zhang, Qingsong Yan, Tao Ni, Junbo Chen, Xiaowei Zhou, Hujun Bao, Ruizhen Hu, Sida Peng

机构 * Zhejiang University(浙江大学) Peking University(北京大学) XGRIDS UDeer AI Shenzhen University(深圳大学)

AI总结 本文提出Habitat-GS,通过整合3D高斯点云渲染和可驾驶高斯化身,提升导航仿真的视觉真实性和动态人类建模能力,实验表明其在跨领域泛化和人类感知导航中表现优异。

Comments Project page: https://zju3dv.github.io/habitat-gs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12565 2026-04-15 cs.RO cs.CV

Scalable Trajectory Generation for Whole-Body Mobile Manipulation

可扩展的全身体态移动操作轨迹生成

Yida Niu, Xinhai Chang, Xin Liu, Ziyuan Jiao, Yixin Zhu

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) Institute of Unmanned System, Beihang University(无人系统研究院,北航) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学) Yuanpei College, Peking University(元培学院,北京大学) Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,PKU-武汉人工智能研究所)

AI总结 本文提出AutoMoMa框架,通过GPU加速整合运动学模型与并行轨迹优化,生成大规模物理有效轨迹数据,解决全身体态移动操作中规模、多样性和运动学精度的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏