arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2603.13341 2026-03-17 cs.CV cs.AI

Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning

注意源无关跨域少样本学习中的判别性陷阱

Zhenyu Zhang, Yixiong Zou, Yuhua Li, Ruixuan Li, Guangyao Chen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13289 2026-03-17 cs.LG cs.AI

RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse

RelayCaching: 通过解码KV缓存重用加速LLM协作

Yingsheng Geng, Yuchong Gao, Weihong Wu, Guyue Liu, Jiang Liu

机构 * Beijing University of Posts(北京邮电大学) Tsinghua University, Beijing, China(清华大学) University of Electronic Science(电子科学大学) Peking University, Beijing, China(北京大学)

AI总结 本文提出RelayCaching方法,通过重用前序代理的解码阶段KV缓存,在多代理LLM系统中减少冗余预填充计算,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13028 2026-03-16 cs.CR cs.AI

Purify Once, Edit Freely: Breaking Image Protections under Model Mismatch

一次净化,自由编辑:在模型不匹配下突破图像保护

Qichen Zhao, Shengfang Zhai, Xinjian Bai, Qingni Shen, Qiqi Lin, Yansong Gao, Zhonghai Wu

机构 * Peking University(北京大学) National University of Singapore(国立新加坡大学) The University of Western Australia(西澳大学)

AI总结 研究提出统一的后期净化框架,评估模型不匹配下的保护有效性,提出VAE-Trans和EditorClean两种实用净化器,显著提升图像编辑质量,揭示一次净化后保护信号失效的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13019 2026-03-16 cs.DC cs.AI cs.LG

ARL-Tangram: Unleash the Resource Efficiency in Agentic Reinforcement Learning

ARL-Tangram:释放代理强化学习中的资源效率

Bangjun Xiao, Yihao Zhao, Xiangwei Deng, Shihua Yu, Yuxing Xiang, Huaqiu Liu, Qiying Wang, Liang Zhao, Hailin Zhang, Xuanzhe Liu, Xin Jin, Fuli Luo

机构 * School of Computer Science, Peking University(北京大学计算机科学系) LLM-Core Xiaomi(小智LLM核心)

AI总结 ARL-Tangram通过动作级 orchestration 实现细粒度外部资源共享与弹性调度,提升代理强化学习的资源利用效率,实验表明其在平均动作完成时间、训练步长速度和外部资源节约方面均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12811 2026-03-16 cs.CV

OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution

OARS:面向生成真实世界图像超分辨率的在线对齐

Shijie Zhao, Xuanyu Zhang, Bin Chen, Weiqi Li, Qunliang Xing, Kexin Zhang, Yan Wang, Junlin Li, Li Zhang, Jian Zhang, Tianfan Xue

机构 * ByteDance Inc.(字节跳动公司) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 OARS通过过程感知的在线对齐框架,结合COMPASS奖励模型,在线优化图像超分辨率模型,实现感知与保真度的平衡,提升真实世界图像超分辨率性能。

Comments Super-Resolution, Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12730 2026-03-16 cs.RO

AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation

AnchorVLA4D: 一种基于锚点的时空视觉-语言-动作模型用于机器人操作

Juan Zhu, Zhanying Shao, Xiaoqi Li, Ethan Morgan, Jiadong Xu, Hongwei Fan, Hao Dong

机构 * PrimeBot School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出AnchorVLA4D,通过引入锚点图像和轻量级空间编码器,提升机器人操作中的时空推理能力,实现在Simpler WidowX基准测试中提升13.6%,并在真实任务中达到80%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12686 2026-03-16 cs.RO

Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data

从不完美的人类运动数据中学习竞技型人形网球技能

Zhikai Zhang, Haofei Lu, Yunrui Lian, Ziqing Chen, Yun Liu, Chenghuai Lin, Han Xue, Zicheng Zeng, Zekun Qi, Shaolin Zheng, Qing Luan, Jingbo Wang, Junliang Xing, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Peking University(北京大学) Galbot Inc.(Galbot公司) Shanghai Qi Zhi Institute(上海启智研究所) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出LATENT系统,通过不完美的网球运动数据学习人形机器人网球技能,提升真实场景中的网球表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11647 2026-03-16 cs.MM cs.CV cs.SD

OmniForcing: Unleashing Real-time Joint Audio-Visual Generation

OmniForcing:释放实时联合音频视觉生成

Yaofeng Su, Yuming Li, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Ying Li, Zezhong Qian, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索学院) Fudan University(复旦大学) Peking University(北京大学) The University of Hong Kong(香港大学)

AI总结 本文提出OmniForcing框架,通过因果蒸馏将双向扩散模型转化为高保真流式自回归生成器,解决双流架构中的训练不稳定问题,实现25FPS的实时生成性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06688 2026-03-16 cs.CV cs.AI

Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

叙事编织者:迈向多模态可控的长程视觉一致性

Zhengjian Yao, Yongzhi Li, Xinyuan Gao, Quan Chen, Peng Jiang, Yanye Lu

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15418 2026-03-16 cs.LG cs.AI cs.RO

Guided Policy Optimization under Partial Observability

部分可观察环境下指导策略优化

Yueheng Li, Guangming Xie, Zongqing Lu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 本文提出GPO框架,通过联合训练指导器和学习器,在部分可观察环境中实现与直接RL相当的最优性能,有效解决现有方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12238 2026-03-13 cs.CV

SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation

SceneAssistant: 一种用于开放词汇3D场景生成的视觉反馈代理

Jun Luo, Jiaxiang Tang, Ruijie Lu, Gang Zeng

机构 * Peking University(北京大学) NVIDIA(英伟达)

AI总结 SceneAssistant通过视觉反馈驱动代理实现开放词汇3D场景生成,结合3D物体生成模型和视觉-语言模型的空间推理能力,生成高质量且多样化的3D场景。

Comments Code: https://github.com/ROUJINN/SceneAssistant

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12193 2026-03-13 cs.RO cs.CV

SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics

SaPaVe:迈向视觉-语言-动作模型中的主动感知与操作

Mengzhen Liu, Enshen Zhou, Cheng Chi, Yi Han, Shanyu Rong, Liming Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机科学学院,北京大学) School of Software, Beihang University(软件学院,北航) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 SaPaVe通过解耦相机与操作动作,结合自下而上训练策略,实现高效且可推广的主动感知与操作,在现实任务中成功率达31.25%。

Comments Accepted to CVPR 2026. See project page at https://lmzpai.github.io/SaPaVe

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11620 2026-03-13 cs.LG

Personalized Federated Learning via Gaussian Generative Modeling

通过高斯生成建模实现个性化联邦学习

Peng Hu, Jianwei Ma

机构 * School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) Institute for Artificial Intelligence and the School of Earth and Space Sciences, Peking University(北京大学人工智能研究所和地球和空间科学学院) Institute for Artificial Intelligence and the School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学人工智能研究所和数学学院)

AI总结 pFedGM通过高斯生成建模实现个性化联邦学习,结合全局优化导航器和本地分布统计提取器,利用双尺度融合框架提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08064 2026-03-13 cs.CV

Evaluating Generative Models via One-Dimensional Code Distributions

通过一维代码分布评估生成模型

Zexi Jia, Pengcheng Luo, Yijia Zhong, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc.(腾讯微信AI) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

AI总结 本文提出基于离散视觉令牌空间的生成模型评估方法,引入CHD和CMMS两个度量标准,并构建VisForm基准以验证其在不同数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07949 2026-03-13 cs.DC cs.RO

RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA Models

RAPID: 为多样化VLA模型设计的冗余感知且兼容最优的边缘-云分区推理

Zihao Zheng, Sicheng Tian, Hangyu Cao, Chenyue Li, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

AI总结 RAPID框架通过优化边缘-云分区策略,有效解决VLA模型在边缘计算中的冗余问题和噪声干扰,实现高效推理与低开销的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20299 2026-03-13 cs.RO cs.AI cs.CV

KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System

KnowVal: 一种知识增强且价值引导的自动驾驶系统

Zhongyu Xia, Wenhao Chen, Yongtao Wang, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) University of California, Merced(加州大学默塞德分校)

AI总结 KnowVal通过整合开放世界感知与知识检索,构建驾驶知识图谱并训练价值模型,实现价值对齐的自动驾驶系统,提升了规划性能并降低了碰撞率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07791 2026-03-13 cs.CV

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

GTR-Bench:评估视觉-语言模型中的地理时间推理

Qinghongbing Xie, Zhaoyuan Xia, Feng Zhu, Lijun Gong, Ziyue Li, Rui Zhao, Long Zeng

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Peking University(北京大学) Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)

AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。

Comments ICLR 2026, 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17778 2026-03-13 cs.CV

TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis

TextFlux:一种无需OCR的DiT模型用于高保真多语言场景文本合成

Yu Xie, Jielei Zhang, Pengyu Chen, Weihang Wang, Longwen Gao, Peiyi Li, Qian Qiao, Zhouhui Lian

机构 * bilibili Inc.(哔哩哔哩公司) OpenWPLab(开放WPLab) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

AI总结 TextFlux是一种无需OCR的DiT模型,通过简化架构和训练流程,实现高保真多语言场景文本合成。

Comments Accepted to Eurographics 2026 (Computer Graphics Forum)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13903 2026-03-13 cs.CL cs.AI

Let's Verify Math Questions Step by Step

逐步验证数学问题

Chengyu Shen, Zhen Hao Wong, Runming He, Hao Liang, Meiyi Qiang, Zimo Meng, Zhengyang Zhao, Bohan Zeng, Zhengzhou Zhu, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学)

AI总结 ValiMath是一个包含2147个经过人类验证的数学问题的基准测试集,MathQ-Verify是用于验证数学问题正确性的流程,能有效提升数学数据集的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07527 2026-03-12 cs.AI cs.LG

Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions

学习强化学习无法做到的:用于最难问题的交错在线微调

Lu Ma, Hao Liang, Meiyi Qiang, Lexiang Tang, Xiaochen Ma, Zhen Hao Wong, Junbo Niu, Chengyu Shen, Runming He, Yanhao Li, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京软件与硬件协同人工智能系统重点实验室)

AI总结 ReLIFT通过结合强化学习和在线微调,提升模型在复杂问题上的推理能力,实现超过5.2分的性能提升。

Comments 12 pages, 5 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10677 2026-03-12 cs.AI cs.CL

Emulating Clinician Cognition via Self-Evolving Deep Clinical Research

通过自演化深度临床研究模拟医生认知

Ruiyang Ren, Yuhao Wang, Yunsen Liang, Lan Luo, Jing Liu, Haifeng Wang, Cong Feng, Yinan Zhang, Chunyan Miao, Ji-Rong Wen, Wayne Xin Zhao

机构 * Gaoling School of Artificial Intelligence(首都经济贸易大学人工智能学院) Renmin University of China(中国人民大学) Peking University Third Hospital(北京大学第三医院) Baidu Inc.(百度公司) Chinese PLA General Hospital(中国人民解放军总医院) Joint NTU-UBC Research Centre of Excellence in Active Living for the Elderly(联合NTU-UBC老年积极生活方式卓越研究中心) Nanyang Technological University(南洋理工大学)

AI总结 DxEvolve通过自演化深度临床研究工作流,提升临床诊断准确性,实现可追溯的AI持续改进

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10588 2026-03-12 cs.AI cs.CL cs.LG

Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning

LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究

Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Microsoft Research(微软研究院) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) CUHKSZ(香港中文大学(深圳)) THU(清华大学)

AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10397 2026-03-12 cs.LG cs.AI

On the Learning Dynamics of Two-layer Linear Networks with Label Noise SGD

关于带有标签噪声的两层线性网络学习动态的研究

Tongcheng Zhang, Zhanpeng Zhou, Mingze Wang, Andi Han, Wei Huang, Taiji Suzuki, Junchi Yan

机构 * Sch. of Computer Science and Zhiyuan College, Shanghai Jiao Tong University(上海交通大学计算机科学学院和智远学院) Peking University(北京大学) University of Sydney(悉尼大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) The Institute of Statistical Mathematics(统计数学研究所) The University of Tokyo(东京大学)

AI总结 研究揭示了带有标签噪声的两层线性网络学习动态的两阶段行为,展示了标签噪声在促进模型从懒惰范式向丰富范式过渡中的关键作用,并扩展至更广泛的优化算法。

Comments Accepted to AAAI 2026(oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19442 2026-03-12 cs.CV

UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment

UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准

Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi

机构 * Tsinghua University(清华大学) University College London(伦敦大学学院) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学) Zhejiang University(浙江大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Renmin University of China(中国人民大学) Southeast University(东南大学)

AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12566 2026-03-12 cs.AI

To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models

混合还是合并:为大语言模型的多领域强化学习而努力

Haoqing Wang, Xiang Long, Ziheng Li, Yilong Xu, Tingguang Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

AI总结 本研究提出M2RL框架,通过混合多任务训练或模型合并策略,提升大语言模型在多领域任务中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04472 2026-03-12 math.ST cs.LG math.PR stat.ML stat.TH

Universality of General Spiked Tensor Models

一般尖峰张量模型的普遍性

Yanjin Xiang, Zhihua Zhang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 本文研究了高维不对称尖峰张量模型的普遍性,证明了在非高斯噪声下,最大似然平稳点的谱行为和统计极限的稳健性。

Comments 115pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13043 2026-03-12 cs.CV cs.AI

GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

GTR-Turbo:合并的检查点实际上是为代理VLM训练提供免费的教师

Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文生) Peking University(北京大学)

AI总结 GTR-Turbo通过合并检查点作为免费教师,提升了多模态代理训练的效率和效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20034 2026-03-12 cs.CV

Clair Obscur: an Illumination-Aware Method for Real-World Image Vectorization

Clair Obscur: 一种面向现实图像矢量化的照明感知方法

Xingyue Lin, Shuai Peng, Xiangyu Xie, Jianhua Zhu, Yuxuan Zhou, Liangcai Gao

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国)

AI总结 COVec通过引入内在图像分解和光照感知,提升现实图像矢量化在视觉保真度和编辑性上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19498 2026-03-12 cs.LG cs.AI cs.CR

Hierarchical Dual-Strategy Unlearning for Biomedical and Healthcare Intelligence Using Imperfect and Privacy-Sensitive Medical Data

层次化双策略去学习用于生物医学与医疗智能的不完美和隐私敏感医疗数据

Yi Zhang, Chao Zhang, Zijian Li, Tianxiang Xu, Kunyu Zhang, Zhan Gao, Meinuo Li, Xiaohan Zhang, Qichao Qi, Bing Chen

机构 * Department of Neurosurgery, Qilu Hospital of Shandong University and Institute of Brain and Brain-Inspired Science(齐鲁医院山东大学神经外科和脑科学与脑启发科学研究院) Department of Neurosurgery, The Affiliated Hospital of Qingdao University(青岛大学附属医院神经外科) Department of Neurosurgery, Peking Union Medical College Hospital(北京地坛医院神经外科) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) College of Artificial Intelligence, Dalian Maritime University(大连海事大学人工智能学院) University of Colorado Boulder(科罗拉多大学波尔德分校) Zhengzhou University(郑州大学) The University of Hong Kong(香港大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出层次化双策略去学习框架,用于在医疗数据中精确移除专业性知识并保留基本医疗能力,同时保障隐私并满足合规要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16410 2026-03-12 cs.CV

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

REALM:一种用于高斯点划法上开放世界3D推理分割和编辑的MLLM-代理框架

Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Peking University(北京大学)

AI总结 REALM通过MLLM-代理框架实现开放世界3D推理分割和编辑,支持多种3D交互任务。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏