arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2407.01111 2026-03-26 cs.LG cs.AI stat.ML

Proximity Matters: Local Proximity Enhanced Balancing for Treatment Effect Estimation

近邻重要性:局部近邻增强的平衡方法用于处理效应估计

Hao Wang, Zhichao Chen, Zhaoran Liu, Xu Chen, Haoxuan Li, Zhouchen Lin

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

AI总结 本文提出CFR-Pro方法,通过引入基于最优传输的成对近邻正则化来增强HTE估计中的表示平衡,有效缓解处理选择偏差,并在实验中优于其他方法。

Comments Accepted as a poster in SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11039 2026-03-26 cs.LG cs.AI stat.ML

Entire Space Counterfactual Learning for Reliable Content Recommendations

全空间反事实学习用于可靠的内容推荐

Hao Wang, Zhichao Chen, Zhaoran Liu, Haozhe Li, Degui Yang, Xinggao Liu, Haoxuan Li

机构 * State Key Laboratory of Industrial Control Technology, College of Control Science and Engineering, Zhejiang University(工业控制技术国家重点实验室,控制科学与工程学院,浙江大学) School of Automation, Central South University(自动化学院,中南大学) Center for Data Science, Peking University(数据科学中心,北京大学)

AI总结 本文提出全空间反事实多任务模型ESCM²,通过引入反事实风险最小化模块,解决推荐系统中点击转化率估计的内在偏差和虚假独立性问题,提升推荐性能。

Comments This submission is an extension of arXiv:2204.05125

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11167 2026-03-25 cs.CV cs.LG

Towards a general-purpose foundation model for fMRI analysis

面向fMRI分析的通用基础模型

Cheng Wang, Yu Jiang, Zhihao Peng, Chenxin Li, Changbae Bang, Lin Zhao, Wanyi Fu, Jinglei Lv, Jorge Sepulcre, Carl Yang, Lifang He, Tianming Liu, Xue-Jun Kong, Quanzheng Li, Daniel S. Barron, Anqi Qiu, Randy Hirschtick, Byung-Hoon Kim, Hongbin Han, Xiang Li, Yixuan Yuan

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) Yonsei University, Seoul, South Korea(延世大学) University of Georgia, Athens, GA(佐治亚大学) Peking University Health Science Center, Beijing, China(北京大学医学部) University of Sydney, Sydney, Australia(悉尼大学) Yale School of Medicine, New Haven, CT(耶鲁医学院) Emory University, Atlanta, GA(埃默里大学) Lehigh University, Bethlehem, PA(莱斯利大学) Boston Children’s Hospital, Boston, MA(波士顿儿童医院) Massachusetts General Hospital, Boston, MA(麻省总医院) Brigham and Women’s Hospital, Boston, MA(布里奇沃特医院) Hong Kong Polytechnic University, Hong Kong(香港理工大学) Kempner Institute for Natural and Artificial Intelligence, Cambridge, MA(Kempner自然与人工智能研究所)

AI总结 本文提出NeuroSTORM模型,通过直接学习4D fMRI数据的通用表示,实现跨任务高效迁移,优于现有方法在五类下游任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23184 2026-03-25 cs.CL cs.AI stat.AP

ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment

ImplicitRM: 从隐式偏好数据中无偏奖励建模以实现语言模型对齐

Hao Wang, Haocheng Yang, Licheng Pan, Lei Shen, Xiaoxi Li, Yinuo Wang, Zhichao Chen, Yuan Lu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 本文提出ImplicitRM,通过隐式反馈数据学习无偏奖励模型,解决隐式偏好数据中缺乏明确负样本和用户偏好偏差的问题,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22998 2026-03-25 cs.CV

VQ-Jarvis: Retrieval-Augmented Video Restoration Agent with Sharp Vision and Fast Thought

VQ-Jarvis:具备锐利视觉与快速思考的检索增强视频修复代理

Xuanyu Zhang, Weiqi Li, Qunliang Xing, Jingfen Xie, Bin Chen, Junlin Li, Li Zhang, Jian Zhang, Shijie Zhao

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院,深圳,中国) ByteDance Inc., Shenzhen, China(字节跳动公司,深圳,中国)

AI总结 本文提出VQ-Jarvis,一种具备锐利视觉与快速思考的视频修复代理,通过构建大规模视频配对增强数据集和分层操作调度策略,提升视频修复的准确性和效率。

Comments Video restoration, Agent-based restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22935 2026-03-25 cs.AI cs.HC

Ran Score: a LLM-based Evaluation Score for Radiology Report Generation

Ran Score:一种基于大语言模型的放射学报告生成评估分数

Ran Zhang, Yucong Lin, Zhaoli Su, Bowen Liu, Danni Ai, Tianyu Fu, Deqiang Xiao, Jingfan Fan, Yuanyuan Wang, Mingwei Gao, Yuwan Hu, Shuya Gao, Jingtao Li, Jian Yang, Hong Song, Hongliang Sun

机构 * School of Optics and Photonics, Beijing Institute of Technology(光学与光子学学院,北京理工大学) School of Medical Technology, Beijing Institute of Technology(医学技术学院,北京理工大学) Department of Radiology, China-Japan Friendship Hospital (Institute of Clinical Medical Sciences), Beijing 100029, China(日本友谊医院放射科(临床医学科学院),北京100029,中国) Chinese Academy of Medical Science & Peking Union Medical College, Beijing 100730, China(中国医学科学院 & 首都医科大学,北京100730,中国) Department of Radiology, Peking University China-Japan Friendship School of Clinical Medicine, Beijing 100029, China(北京大学日本友谊学校临床医学系放射科,北京100029,中国) Department of Gastroenterology, China-Japan Friendship Hospital, Beijing 100029, China(日本友谊医院消化内科,北京100029,中国) NHC Key Laboratory of Clinical Big Data Standardization & Integration, Beijing 100029, China(国家卫生健康委员会临床大数据标准化与整合关键实验室,北京100029,中国)

AI总结 本文提出Ran Score,一种基于大语言模型的放射学报告生成评估指标,通过结合人类专业知识和大型语言模型,改进多标签发现提取,并在多个数据集中验证其有效性。

Comments 4 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22824 2026-03-25 cs.LG math.OC stat.ML

Towards The Implicit Bias on Multiclass Separable Data Under Norm Constraints

多类可分数据下范数约束下的隐式偏置研究

Shengping Xie, Zekun Wu, Quan Chen, Kaixu Tang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 本文通过NSD框架探讨了优化几何对多类可分数据解的影响,提出NucGD优化器以核范数约束 enforcing 低秩结构,并连接低秩投影方法,通过异步幂迭代实现高效SVD-free更新,分析了随机优化动态对收敛的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22648 2026-03-25 cs.HC cs.AI

AwesomeLit: Towards Hypothesis Generation with Agent-Supported Literature Research

AwesomeLit: 向基于代理支持的文献研究进行假设生成

Zefei Xie, Yuhan Guo, Kai Xu

机构 * School of Computer Science, University of Nottingham, UK(诺丁汉大学计算机科学学院) School of Intelligence Science and Technology, Peking University, China(北京大学智能科学与技术学院)

AI总结 本文提出AwesomeLit系统,通过可视化工具帮助用户探索未知领域,识别研究方向并提升信心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22458 2026-03-25 cs.CV

MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding

MinerU-Diffusion:通过扩散解码重新思考文档OCR作为逆向渲染

Hejun Dong, Junbo Niu, Bin Wang, Weijun Zeng, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Peking University(北京大学)

AI总结 本文提出MinerU-Diffusion,通过扩散解码替代自回归解码,提升文档OCR的鲁棒性和效率,实验表明其在长序列推理中速度提升3.2倍,且在视觉OCR能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01047 2026-03-25 cs.CV cs.AI

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23265 2026-03-25 cs.CL cs.CV

PaperBanana: Automating Academic Illustration for AI Scientists

PaperBanana:为AI科学家自动化学术插图

Dawei Zhu, Rui Meng, Yale Song, Xiyu Wei, Sujian Li, Tomas Pfister, Jinsung Yoon

机构 * Peking University(北京大学) Google Cloud AI Research(谷歌云AI研究)

AI总结 PaperBanana通过整合先进视觉语言模型和图像生成模型,自动化生成出版级学术插图,提升了科研流程中插图制作的效率与质量。

Comments Add Citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19703 2026-03-25 eess.AS cs.IR cs.LG cs.MM cs.SD

ASK: Adaptive Self-improving Knowledge Framework for Audio Text Retrieval

ASK:适应性自改进知识框架用于音频文本检索

Siyuan Fu, Xuchen Guo, Mingjun Liu, Hongxiang Li, Boyin Tan, Gongxi Zhu, Xianwei Zhuang, Jinghan Ru, Yuxin Xie, Yuguo Yin

机构 * University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 ASK框架通过多粒度知识注入和动态精修策略解决音频文本检索中的梯度局部瓶颈和表示漂移不匹配问题,提升稀有长尾概念学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03044 2026-03-25 cs.RO

Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling

Video2Act:一种双系统视频扩散策略,具有机器人空间-运动建模

Yueru Jia, Jiaming Liu, Shengbang Liu, Rui Zhou, Wanhe Yu, Yuyang Yan, Xiaowei Chi, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,北京大学计算机学院) AI 2 Robotics(AI与机器人) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 Video2Act通过整合空间和运动感知表示,提升机器人动作学习效率,其双系统设计在仿真和现实任务中均取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01248 2026-03-25 cs.CV

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21732 2026-03-25 cs.CL cs.AI

HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation

HUMORCHAIN: 基于理论的多阶段推理用于可解释的多模态幽默生成

Jiajun Zhang, Shijia Luo, Ruikang Zhang, Qi Su

机构 * Peking University(北京大学) Ocean University of China(海洋大学)

AI总结 本文提出HUMORCHAIN框架,通过整合视觉语义解析、基于幽默和心理学的推理及细调判别器,实现可解释的多模态幽默生成,实验表明其在人类幽默偏好、Elo/BT评分和语义多样性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22102 2026-03-24 cs.CV cs.GR cs.RO

FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario

FreeArtGS: 自由移动场景下的关节高斯溅射重建

Hang Dai, Hongwei Fan, Han Zhang, Duojin Wu, Jiyao Zhang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机科学系,北京大学CFCS) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) PrimeBot

AI总结 FreeArtGS通过自由移动部分分割、关节估计和端到端优化,实现高可扩展性的自由移动关节物体重建,实验表明其在真实资产生成中具有实用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21864 2026-03-24 cs.CV cs.AI

Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation

自适应视频蒸馏:缓解少步生成中的过饱和与时间崩溃

Yuyang You, Yongzhi Li, Jiahui Li, Yadong Mu, Quan Chen, Peng Jiang

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

AI总结 本文提出针对视频扩散模型的自适应蒸馏框架,通过动态回归损失、时间正则化损失和推理时帧插值策略,提升少步视频生成的稳定性和感知真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21695 2026-03-24 cs.CV cs.GR

RefracGS: Novel View Synthesis Through Refractive Water Surfaces with 3D Gaussian Ray Tracing

RefracGS:通过折射水表面进行新颖视图合成

Yiming Shao, Qiyu Dai, Chong Gao, Guanbin Li, Yeqiang Wang, He Sun, Qiong Zeng, Baoquan Chen, Wenzheng Chen

机构 * Shandong University, China(山东大学) Peking University, Beijing, China(北京大学) Sun Yat-sen University, China(中山大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院)

AI总结 RefracGS通过3D高斯射线追踪方法,结合折射水面与底层场景的重建,实现高保真新颖视图合成,实验表明其在视觉质量和效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21679 2026-03-24 cs.RO

BiPreManip: Learning Affordance-Based Bimanual Preparatory Manipulation through Anticipatory Collaboration

BiPreManip: 通过预见性协作学习基于 affordance 的双臂预备操作

Yan Shen, Feng Jiang, Zichen He, Xiaoqi Li, Yuchen Liu, Zhiyu Li, Ruihai Wu, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

AI总结 本文提出BiPreManip框架,通过预见性协作学习双臂预备操作,提升任务成功率和泛化能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21669 2026-03-24 cs.RO cs.CV

PRM-as-a-Judge: A Dense Evaluation Paradigm for Fine-Grained Robotic Auditing

PRM-as-a-Judge:细粒度机器人审计的密集评估范式

Yuheng Ji, Yuyang Liu, Huajie Tan, Xuchuan Huang, Fanding Huang, Yijie Xu, Cheng Chi, Yuting Zhao, Huaihai Lyu, Peterson Co, Mingyu Cao, Qiongyu Zhang, Zhe Li, Enshen Zhou, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang, Xiaolong Zheng

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学系,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) University of Sydney(悉尼大学) Beihang University(北航大学)

AI总结 本文提出PRM-as-a-Judge方法,通过过程奖励模型对轨迹视频进行密集评估,引入OPD指标系统,验证了宏一致性与微分辨率特性,揭示了主流策略在长周期任务中的行为特征与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21574 2026-03-24 cs.AI

Adaptive Robust Estimator for Multi-Agent Reinforcement Learning

自适应稳健估计器用于多智能体强化学习

Zhongyi Li, Wan Tian, Jingyu Chen, Kangyao Huang, Huiming Zhang, Hui Yang, Tao Ren, Jinyang Jiang, Yijie Peng, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北京理工大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

AI总结 本文提出自适应稳健估计器和双智能体回答-批判-重写框架,解决多智能体协作中的信用分配和奖励噪声问题,提升训练稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21557 2026-03-24 cs.CV

From Part to Whole: 3D Generative World Model with an Adaptive Structural Hierarchy

从部分到整体:具有自适应结构层次的3D生成世界模型

Bi'an Du, Daizong Liu, Pufan Li, Wei Hu

机构 * Wangxuan Institute of \ Technology, Peking University Beijing, China Institute for Math \& AI, Wuhan University Wuhan, China

AI总结 本文提出了一种自适应部分-整体层次的3D生成世界模型,通过直接从图像令牌推断出软且组合性的掩码,自主发现潜在结构槽,实现跨类别的形状共享和去噪。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21541 2026-03-24 cs.LG cs.AI

Sharper Generalization Bounds for Transformer

更精确的Transformer泛化界限

Yawen Li, Tao Hu, Zhouhui Lian, Wan Tian, Yijie Peng, Huiming Zhang, Zhongyi Li

机构 * School of Mathematical Sciences, Capital Normal University, 100048 Beijing, China(首都师范大学数学学院) Advanced Institute of Information Technology, Peking University(北京大学信息科学技术高级研究院) Wangxuan Institute of Computer Technology, Peking University, China, 100871(北京大学王先计算机技术研究所) PKU-Wuhan Institute for Artificial Intelligence(北大-武汉人工智能研究所) Xiangjiang Laboratory, Changsha 410000, China(湘江实验室) Guanghua School of Management, Peking University, Beijing, China, 100871(北京大学光华管理学院) School of Artificial Intelligence, Beihang University, 100191 Beijing, China(北航人工智能学院)

AI总结 本文基于偏移Rademacher复杂性,推导了不同Transformer架构的更精确泛化界限,通过覆盖数和矩阵秩推导出最优收敛率的泛化界限,并扩展到无界特征分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21522 2026-03-24 cs.SE cs.AI

Efficient Failure Management for Multi-Agent Systems with Reasoning Trace Representation

多代理系统中基于推理轨迹表示的高效故障管理

Lingzhe Zhang, Tong Jia, Mingyu Wang, Weijie Hong, Chiming Duan, Minghua He, Rongqian Wang, Xi Peng, Meiling Wang, Gong Zhang, Renhai Chen, Ying Li

机构 * Peking University(北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文提出EAGER框架,通过无监督对比学习编码代理内部推理和协调,实现实时故障检测与缓解,提升多代理系统可靠性。

Comments Accepted by FSE'26-IVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21495 2026-03-24 cs.SE cs.AI

RuntimeSlicer: Towards Generalizable Unified Runtime State Representation for Failure Management

RuntimeSlicer:迈向通用统一运行时状态表示的失败管理

Lingzhe Zhang, Tong Jia, Weijie Hong, Mingyu Wang, Chiming Duan, Minghua He, Rongqian Wang, Xi Peng, Meiling Wang, Gong Zhang, Renhai Chen, Ying Li

机构 * Peking University(北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 RuntimeSlicer通过统一运行时状态表示模型实现通用失败管理,通过统一运行时对比学习和状态感知任务导向微调提升跨模态对齐和时序一致性,实验证明其在系统状态建模和故障管理中的有效性。

Comments Accepted by FSE'26-IVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19735 2026-03-24 cs.LG

Improving Fairness of Large Language Model-Based ICU Mortality Prediction via Case-Based Prompting

通过基于案例的提示提升基于大语言模型的ICU死亡预测公平性

Gangxiong Zhang, Yongchao Long, Yuxi Zhou, Yong Zhang, Shenda Hong

机构 * School of Computer Science and Engineering, Tianjin University of Technology, Tianjin, China(天津理工大学计算机科学与工程学院) Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院) DCST, BNRist, RIIT, Institute of Internet Industry, Tsinghua University, Beijing, China(清华大学信息产业研究院) National Institute of Health Data Science, Peking University, Beijing, China(北京大学健康数据科学国家研究院)

AI总结 本文提出一种临床适应性提示框架,通过整合去偏策略和历史误判案例,提升ICU死亡预测的公平性和性能,实验显示AUROC和AUPRC显著提升,预测差异大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17495 2026-03-24 cs.CV

GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation

GroundingME:通过多维评估揭示MLLMs中的视觉 grounding 隙

Rang Li, Lei Li, Shuhuai Ren, Hao Tian, Shuhao Gu, Shicheng Li, Zihao Yue, Yudong Wang, Wenhan Ma, Zhe Yang, Jingyuan Ma, Zhifang Sui, Fuli Luo

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) LLM-Core Xiaomi(小米LLM-Core) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

AI总结 本文提出GroundingME基准,通过四个维度评估MLLMs的视觉 grounding 能力,揭示其在区分相似物体、理解空间关系、处理遮挡和拒绝无解查询方面的不足,发现最佳模型仅达到45.1%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02833 2026-03-24 cs.LG

TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback

TIC-GRPO:基于人类反馈的强化学习优化的可证明和高效方法

Lei Pang, Jun Luo, Ruinan Jin

机构 * Peking University, Beijing, China(北京大学) The Ohio State University, Columbus, USA(俄亥俄州立大学) Shugu Yuntai Technology Co., Ltd.(舒guard云泰科技有限公司)

AI总结 本文提出TIC-GRPO算法,通过改进重要性采样方法,提升GRPO在人类反馈强化学习中的性能与收敛速度。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09935 2026-03-24 cs.CV

LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning

LEO-VL:面向可扩展3D视觉-语言学习的高效场景表示

Jiangyong Huang, Xiaojian Ma, Xiongkun Linghu, Junchao He, Qing Li, Song-Chun Zhu, Yixin Chen, Baoxiong Jia, Siyuan Huang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出LEO-VL,一种基于高效场景表示CFG的3D视觉-语言模型,通过改进训练数据和引入SceneDPO提升鲁棒性,在多个3D-VL基准测试中取得最佳性能。

Comments Project page: https://leo-vl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12352 2026-03-24 cs.CV

Point-In-Context: Understanding Point Cloud via In-Context Learning

点在上下文:通过上下文学习理解点云

Mengyuan Liu, Zhongbin Fang, Xia Li, Joachim M. Buhmann, Deheng Ye, Xiangtai Li, Chen Change Loy

机构 * State Key Laboratory of General Artificial Intelligence(国家一般人工智能重点实验室) Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) School of Intelligent Systems Engineering(智能系统工程学院) Sun Yat-sen University(中山大学) ETH Zurich(苏黎世联邦理工学院) Tencent Inc.(腾讯公司) S-Lab(S实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Point-In-Context框架,利用上下文学习实现多任务处理,通过联合采样模块和创新训练策略提升点云分割性能,无需微调即可泛化到新领域。

Comments Project page: https://fanglaosi.github.io/Point-In-Context_Pages. arXiv admin note: text overlap with arXiv:2306.08659

详情

展开后加载摘要…

URL PDF HTML 收藏