arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Peking University(北京大学)

2026-03-13 至 2026-03-13 共收录 9
2603.12238 2026-03-13 cs.CV

SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation

SceneAssistant: 一种用于开放词汇3D场景生成的视觉反馈代理

Jun Luo, Jiaxiang Tang, Ruijie Lu, Gang Zeng

机构 * Peking University(北京大学) NVIDIA(英伟达)

AI总结 SceneAssistant通过视觉反馈驱动代理实现开放词汇3D场景生成,结合3D物体生成模型和视觉-语言模型的空间推理能力,生成高质量且多样化的3D场景。

Comments Code: https://github.com/ROUJINN/SceneAssistant

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12193 2026-03-13 cs.RO cs.CV

SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics

SaPaVe:迈向视觉-语言-动作模型中的主动感知与操作

Mengzhen Liu, Enshen Zhou, Cheng Chi, Yi Han, Shanyu Rong, Liming Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机科学学院,北京大学) School of Software, Beihang University(软件学院,北航) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 SaPaVe通过解耦相机与操作动作,结合自下而上训练策略,实现高效且可推广的主动感知与操作,在现实任务中成功率达31.25%。

Comments Accepted to CVPR 2026. See project page at https://lmzpai.github.io/SaPaVe

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11620 2026-03-13 cs.LG

Personalized Federated Learning via Gaussian Generative Modeling

通过高斯生成建模实现个性化联邦学习

Peng Hu, Jianwei Ma

机构 * School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) Institute for Artificial Intelligence and the School of Earth and Space Sciences, Peking University(北京大学人工智能研究所和地球和空间科学学院) Institute for Artificial Intelligence and the School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学人工智能研究所和数学学院)

AI总结 pFedGM通过高斯生成建模实现个性化联邦学习,结合全局优化导航器和本地分布统计提取器,利用双尺度融合框架提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08064 2026-03-13 cs.CV

Evaluating Generative Models via One-Dimensional Code Distributions

通过一维代码分布评估生成模型

Zexi Jia, Pengcheng Luo, Yijia Zhong, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc.(腾讯微信AI) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

AI总结 本文提出基于离散视觉令牌空间的生成模型评估方法,引入CHD和CMMS两个度量标准,并构建VisForm基准以验证其在不同数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07949 2026-03-13 cs.DC cs.RO

RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA Models

RAPID: 为多样化VLA模型设计的冗余感知且兼容最优的边缘-云分区推理

Zihao Zheng, Sicheng Tian, Hangyu Cao, Chenyue Li, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

AI总结 RAPID框架通过优化边缘-云分区策略,有效解决VLA模型在边缘计算中的冗余问题和噪声干扰,实现高效推理与低开销的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20299 2026-03-13 cs.RO cs.AI cs.CV

KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System

KnowVal: 一种知识增强且价值引导的自动驾驶系统

Zhongyu Xia, Wenhao Chen, Yongtao Wang, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) University of California, Merced(加州大学默塞德分校)

AI总结 KnowVal通过整合开放世界感知与知识检索,构建驾驶知识图谱并训练价值模型,实现价值对齐的自动驾驶系统,提升了规划性能并降低了碰撞率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07791 2026-03-13 cs.CV

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

GTR-Bench:评估视觉-语言模型中的地理时间推理

Qinghongbing Xie, Zhaoyuan Xia, Feng Zhu, Lijun Gong, Ziyue Li, Rui Zhao, Long Zeng

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Peking University(北京大学) Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)

AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。

Comments ICLR 2026, 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17778 2026-03-13 cs.CV

TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis

TextFlux:一种无需OCR的DiT模型用于高保真多语言场景文本合成

Yu Xie, Jielei Zhang, Pengyu Chen, Weihang Wang, Longwen Gao, Peiyi Li, Qian Qiao, Zhouhui Lian

机构 * bilibili Inc.(哔哩哔哩公司) OpenWPLab(开放WPLab) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

AI总结 TextFlux是一种无需OCR的DiT模型,通过简化架构和训练流程,实现高保真多语言场景文本合成。

Comments Accepted to Eurographics 2026 (Computer Graphics Forum)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13903 2026-03-13 cs.CL cs.AI

Let's Verify Math Questions Step by Step

逐步验证数学问题

Chengyu Shen, Zhen Hao Wong, Runming He, Hao Liang, Meiyi Qiang, Zimo Meng, Zhengyang Zhao, Bohan Zeng, Zhengzhou Zhu, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学)

AI总结 ValiMath是一个包含2147个经过人类验证的数学问题的基准测试集,MathQ-Verify是用于验证数学问题正确性的流程,能有效提升数学数据集的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏