arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2605.11974 2026-05-13 cs.LG

Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization

迈向顺序公平性:通过双组优势优化缓解大语言模型的顺序敏感性

Xu Chu, Guanyu Wang, Zhijie Tan, Xinrong Chen, Ziyu Li, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(软件与微电子学院,北京大学)

AI总结 本文提出双组优势优化(DGAO),通过平衡组内准确性优势和组间稳定性优势,缓解LLM的顺序敏感性,提升模型在RAG、数学推理和分类任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11922 2026-05-13 cs.SE cs.CL

StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning

StepCodeReasoner: 通过强化学习对齐代码推理与分步执行轨迹

Hao Wang, Rui Li, Lei Sha, Jie M. Zhang

机构 * Beihang University, Beijing, China(北京航空航天大学) Peking University, Beijing, China(北京大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) King's College London, United Kingdom(伦敦国王学院)

AI总结 本文提出StepCodeReasoner框架,通过引入显式的中间执行状态监督,将代码推理转化为可验证的分步执行建模问题,并通过Bi-Level GRPO算法提升结构化信用分配,实验表明其在代码推理和生成任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11901 2026-05-13 cs.CR cs.AI

AccLock: Unlocking Identity with Heartbeat Using In-Ear Accelerometers

AccLock:利用耳内加速度计的心跳信号实现身份解锁

Lei Wang, Jiangxuan Shen, Xi Zhang, Dalin Zhang, Jingyu Li, Haipeng Dai, Chenren Xu, Daqing Zhang, He Huang

机构 * Soochow University(苏州大学) Macquarie University(麦考瑞大学) Aalborg University(奥尔堡大学) Peking University(北京大学) Nanjing University(南京大学)

AI总结 本文提出AccLock系统,通过耳内BCG信号提取用户特定特征,实现无交互的被动身份验证,具有零参与、环境噪声鲁棒性强等优势,实验表明其在33名参与者中达到3.13%的FAR和2.99%的FRR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10288 2026-05-13 cs.LG math.OC

BROS: Bias-Corrected Randomized Subspaces for Memory-Efficient Single-Loop Bilevel Optimization

BROS: 偏差校正的随机子空间用于内存高效的单循环双层优化

Hengrui Zhang, Boao Kong, Engao Zhang, Kun Yuan

机构 * Sichuan University(四川大学) Peking University(北京大学)

AI总结 本文提出BROS,一种内存高效的单循环双层优化方法,具有与精确单循环方法相同的收敛率。通过随机子空间和Rademacher双探针校正,BROS在标准假设下保持样本复杂度,并在多个任务中减少内存峰值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09587 2026-05-13 cs.CV cs.AI

MieDB-100k: A Comprehensive Dataset for Medical Image Editing

MieDB-100k:用于医学图像编辑的综合数据集

Yongfan Lai, Wen Qian, Bo Liu, Hongyan Li, Hao Luo, Fan Wang, Bohan Zhuang, Shenda Hong

机构 * State Key Laboratory of General Artificial Intelligence, Beijing, China(1 国家一般人工智能重点实验室,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(2 智能科学与技术学院,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(3 国家健康数据科学研究院,北京大学,北京,中国) DAMO Academy, Alibaba Group, Zhejiang, China(4 阿里巴巴集团 DAMO 院,浙江,中国) hupan lab, zhejiang province(5 鹏元实验室,浙江省) Zhejiang University, Zhejiang, China(6 浙江大学,浙江,中国)

AI总结 本文提出MieDB-100k数据集,通过数据筛选流程结合专家模型与规则生成方法,解决医学图像编辑中数据质量、多样性与可扩展性不足的问题,实验表明其在医学图像编辑任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18152 2026-05-13 cs.CV cs.AI

UnfoldLDM: Degradation-Aware Unfolding with Iterative Latent Diffusion Priors for Blind Image Restoration

UnfoldLDM: 基于迭代潜在扩散先验的退化感知展开网络用于盲图像恢复

Chunming He, Rihan Zhang, Zheng Chen, Bowen Yang, Chengyu Fang, Yunlong Lin, Yulun Zhang, Fengyang Xiao, Sina Farsiu

机构 * Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tsinghua University(清华大学) Xiamen University(厦门大学)

AI总结 本文提出UnfoldLDM,结合深度展开网络与潜在扩散模型,解决盲图像恢复中的退化依赖和过平滑偏差问题,通过多粒度退化感知模块和退化抗性LDM提取先验,提升恢复质量与视觉效果。

Comments 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03206 2026-05-13 cs.AI cs.CL

Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner

连续离散扩散:使你的扩散语言模型成为潜在推理器

Cai Zhou, Chenxiao Yang, Yi Hu, Chenyu Wang, Chubin Zhang, Muhan Zhang, Lester Mackey, Tommi Jaakkola, Stephen Bates, Dinghuai Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院) Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥)) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出CCDD模型,结合连续和离散空间,提升扩散语言模型的表达能力和训练效果,通过联合多模态扩散过程实现高质量的生成与推理。

Comments 29 pages. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11738 2026-05-13 cs.AI

OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling

OptArgus:一种多智能体系统用于检测基于大语言模型的优化建模中的幻觉

Zhong Li, Zihan Guo, Xiaohan Lu, Juntao Wang, Jie Song, Chao Shen, Jiageng Wu, Mingyang Sun

机构 * Great Bay University(大湾大学) Peking University(北京大学) Jilin University(吉林大学) Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出OptArgus多智能体系统,通过细粒度幻觉分类法检测优化建模中的错误,通过三部分基准测试验证其在清洁、控制和自然生成 artifact 上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11712 2026-05-13 cs.AI

Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

迈向稳定的值对齐:引入独立模块以实现一致的价值引导

Wenhao Chen, Sirui Sun, Shengyuan Bai, Guojie Song

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) Yuanpei College, Peking University(北京大学元培学院) State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室)

AI总结 本文提出SVGT模型,通过独立的价值模块解决大语言模型与人类价值观对齐的问题,采用独立价值建模和显式行为引导,提升价值表达的稳定性,实验显示有效降低有害评分。

Comments Accepted to ICML 2026 (Spotlight). 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11711 2026-05-13 cs.LG cs.AI

Debiased Model-based Representations for Sample-efficient Continuous Control

去偏的基于模型的表示用于样本高效的连续控制

Jiafei Lyu, Zichuan Lin, Scott Fujimoto, Kai Yang, Yangkun Chen, Saiyong Yang, Zongqing Lu, Deheng Ye

机构 * Tencent Hunyuan(腾讯文言) McGill University(麦吉尔大学) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出DR.Q算法,通过最大化当前状态-动作对表示与下一状态之间的互信息,并采用衰减优先经验回放,以减少表示和actor-critic学习中的偏差,从而在连续控制任务中取得优于现有方法的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11363 2026-05-13 cs.CV cs.CL

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

PresentAgent-2: 向通用多模态展示代理迈进

Wei Wu, Ziyang Xu, Zeyu Zhang, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) La Trobe University(拉特罗布大学)

AI总结 PresentAgent-2通过多模态资源收集与生成,实现基于用户查询的交互式展示视频生成,支持单人叙述、多人讨论及观众互动三种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11354 2026-05-13 cs.CV

Lite3R: A Model-Agnostic Framework for Efficient Feed-Forward 3D Reconstruction

Lite3R: 一种高效的端到端3D重建模型无关框架

Haoyu Zhang, Zeyu Zhang, Zedong Zhou, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) La Trobe University(拉特罗布大学)

AI总结 本文提出Lite3R框架,通过稀疏线性注意力和FP8-aware量化训练,提升3D重建效率,降低延迟和内存使用,同时保持重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10780 2026-05-13 cs.CV cs.AI

Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

超越最后一层:多层表示融合用于视觉标记化

Xuanyu Zhu, Yan Bai, Yang Shi, Yihang Lou, Yuanxing Zhang, Jing Jin, Yuan Zhou

机构 * Peking University(北京大学) Meituan Inc(美团公司) Tsinghua University(清华大学) IGDL

AI总结 本文提出DRoRAE,通过多层特征融合恢复丢失的视觉信息,提升图像生成质量,并揭示了表示丰富性与重建质量的log-linear关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10201 2026-05-13 cs.RO cs.AI

HeteroGenManip: Generalizable Manipulation For Heterogeneous Object Interactions

HeteroGenManip:异构物体交互的通用操作

Zhenhao Shen, Zeming Yang, Yue Chen, Yuran Wang, Shengqiang Xu, Mingleyang Li, Hao Dong, Ruihai Wu

机构 * Peking University(北京大学) Tianjin University(天津大学)

AI总结 本文提出HeteroGenManip框架,通过两阶段方法解决机器人异构物体交互中的接触点定位和轨迹规划问题,实现跨类型物体的鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22586 2026-05-13 cs.LG cs.AI cs.CL

TabDLM: Free-Form Tabular Data Generation via Joint Numerical-Language Diffusion

TabDLM:通过联合数值-语言扩散生成自由形式表格数据

Donghong Cai, Jiarui Feng, Yanbo Wang, Da Zheng, Yixin Chen, Muhan Zhang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Peking University(北京大学) Ant Group(蚂蚁集团)

AI总结 本文提出TabDLM,通过联合数值-语言扩散模型生成包含文本、分类和数值特征的自由形式表格数据,有效解决多模态数据生成难题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02280 2026-05-13 cs.SE cs.AI cs.CL cs.CR cs.LG

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing

RACC:面向LLM安全测试的表示感知覆盖标准

Zeming Wei, Zhixin Zhang, Chengcan Wu, Yihao Zhang, Xiaokun Luan, Meng Sun

机构 * Peking University(北京大学)

AI总结 本文提出RACC,一种专为LLM安全测试设计的覆盖标准,通过提取安全表示并评估测试提示的激活情况,有效提升测试套件质量,同时对冗余输入不敏感,适用于大规模神经网络的安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01103 2026-05-13 cs.AI

Probing RLVR training instability through the lens of objective-level hacking

通过目标层面黑客的视角探查RLVR训练不稳定性

Yiming Dong, Kun Fu, Haoyu Li, Xinyuan Zhu, Yurou Liu, Lijing Shao, Jieping Ye, Zheng Wang

机构 * School of Physics, Peking University(北京大学物理学院) Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团) Kavli Institute for Astronomy and Astrophysics, Peking University(北京大学天文与天体物理研究院) National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台)

AI总结 本文通过目标层面黑客视角揭示RLVR训练不稳定性的根源,分析MoE模型中训练-推理差异异常增长的机制,为设计稳定的RLVR算法提供指导。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15103 2026-05-13 cs.MA cs.AI

Vulnerable Agent Identification in Large-Scale Multi-Agent Reinforcement Learning

大规模多智能体强化学习中的脆弱智能体识别

Simin Li, Zihao Mao, Zheng Yuwei, Linhao Wang, Ruixiao Xu, Chengdong Ma, Zhiqian Liu, Xin Yu, Yuqing Ma, Xin Wang, Jie Luo, Bo An, Yaodong Yang, Weifeng Lv, Xianglong Liu

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文研究大规模多智能体强化学习中的脆弱智能体识别问题,提出通过分层对抗性去中心化均值场控制框架,结合Fenchel-Rockafellar变换和强化学习算法,有效识别脆弱智能体并降低计算复杂度。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10833 2026-05-12 cs.CV cs.AI

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10663 2026-05-12 cs.AI

Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

Evolving-RL: 端到端优化经验驱动的自我进化能力

Zhiyuan Fan, Wenwei Jin, Feng Zhang, Bin Li, Yihong Dong, Yao Hu, Jiawei Li

机构 * Xiaohongshu Inc.(小红书公司) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出Evolving-RL框架,通过联合优化经验提取与利用能力,提升大模型在新型任务中的适应能力,实验显示在ALFWorld和Mind2Web任务中取得显著性能提升。

Comments 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10485 2026-05-12 cs.RO

VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models

VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型

Hao Wang, Xiaobao Wei, Jingyang He, Chengyu Bai, Chun-Kai Fan, Jiajun Cao, Jintao Chen, Ying Li, Shanyu Rong, Ming Lu, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10470 2026-05-12 cs.CV

Adaptive Context Matters: Towards Provable Multi-Modality Guidance for Super-Resolution

适应性上下文至关重要:迈向可证明的多模态引导超分辨率

Jinyi Luo, Minghao Liu, Yifan Li, Zejia Fan, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究院)

AI总结 本文提出M$^3$ESR框架,通过动态模态融合提升超分辨率的泛化和语义一致性,理论分析揭示了多模态SR的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10445 2026-05-12 cs.CV

Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning

Uni-Synergy:通过协作强化学习实现个性化推理的理解与生成弥合

Zijun Shen, Sihan Yang, Ruichuan An, Ziyu Guo, Hao Liang, Ming Lu, Renrui Zhang, Wentao Zhang

机构 * Peking University(北京大学) Nanjing University(南京大学) CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出Sync-R1框架,通过协作强化学习统一优化个性化理解和生成,结合Sync-GRPO和DGS方法提升双任务协同效率,实验证明其在跨任务推理和鲁棒个性化方面的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10386 2026-05-12 cs.AI

GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs

Tianyuan Zhang, Peng Yue, Zihao Peng, Jiangfan Liu, Zonghao Ying, Jiakai Wang, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学)

AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10365 2026-05-12 cs.AI

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

Agent-ValueBench: 一个全面的评估代理价值观的基准

Haonan Dong, Qiguan Feng, Kehan Jiang, Haoran Ye, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院) Peking University School of Psychological and Cognitive Sciences(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室)

AI总结 本文提出Agent-ValueBench,首个专门评估代理价值观的基准,包含394个环境和4335个价值冲突任务,揭示代理价值观与基础LLM的差异及Harness和技能对价值观的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10335 2026-05-12 cs.LG cs.AI cs.CL cs.NA math.NA math.OC

PowerStep: Memory-Efficient Adaptive Optimization via $\ell_p$-Norm Steepest Descent

PowerStep: 通过ℓp-范数最速下降实现内存高效的自适应优化

Yao Lu, Dengdong Fan, Shixun Zhang, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Peking University(北京大学)

AI总结 PowerStep是一种内存高效的自适应优化器,通过非线性变换直接作用于动量缓冲区实现坐标自适应,无需存储二阶统计量,具有最优收敛速度和更低的内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10275 2026-05-12 cs.CV

PolarVSR: A Unified Framework and Benchmark for Continuous Space-Time Polarization Video Reconstruction

PolarVSR:连续时空极化视频重建的统一框架和基准

Chenggong Li, Yidong Luo, Junchao Zhang, Boxin Shi, Degui Yang

机构 * School of Automation, Central South University(中南大学自动化学院) Hunan Provincial Key Laboratory of Optic-Electronic Intelligent Measurement and Control(湖南省光学电子智能测量控制重点实验室) Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(视觉技术国家工程研究中心,北京大学计算机学院)

AI总结 本文提出首个时空极化视频重建框架,通过极化感知隐式神经表示实现高保真重建,并建立首个大规模彩色DoFP极化视频基准,验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10268 2026-05-12 cs.CL cs.AI

MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading

MemReread: 通过记忆引导重读增强代理长上下文推理

Baibei Ji, Xiaoyang Weng, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

机构 * Soochow University(苏州大学) Peking University(北京大学)

AI总结 MemReread通过记忆引导重读机制,在线性处理文档片段时避免二次检索,实现非线性推理并保持文档理解的逻辑流,通过强化学习框架提升长上下文推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10230 2026-05-12 cs.LG

FORGE: Fragment-Oriented Ranking and Generation for Context-Aware Molecular Optimization

FORGE:面向上下文的分子优化片段排序与生成

Qingchuan Zhang, He Cao, Hao Li, Yanjun Shao, Zhiyuan Liu, Shihang Wang, Shufang Xie, Shenghua Gao, Xinwu Ye

机构 * University of Science and Technology of China(中国科学技术大学) International Digital Economy Academy(国际数字经济学院) Peking University(北京大学) Yale University(耶鲁大学) National University of Singapore(新加坡国立大学) Macao Polytechnic University(澳门理工学院) Zhongguancun Academy(中关村学院) University of Hong Kong(香港大学)

AI总结 FORGE通过上下文感知的局部编辑方法改进分子结构,在保持起始化合物相似性的同时,利用自动挖掘的低到高编辑对进行片段排序与生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07574 2026-05-12 cs.CV

PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models

PolarVLM:弥合视觉语言模型中的语义-物理差距

Yuliang Li, Chu Zhou, Heng Guo, Boxin Shi, Imari Sato, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) National Institute of Informatics, Japan(日本国立信息机构) Peking University, China(北京大学) The University of Tokyo, Japan(东京大学)

AI总结 PolarVLM通过引入极化物理参数,解决视觉语言模型在反射和透明物体等光学模糊问题中的局限,提出双流架构和分阶段训练策略,构建首个极化感知的VQA基准,实现25.4%的总体提升。

Comments 23 pages, 12 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏