arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-03 至 2026-03-03 共收录 163 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 9 篇

2603.00913 2026-03-03 cs.RO 50%

Minimalist Compliance Control

极简合规控制

Haochen Shi, Songbo Hu, Yifan Hou, Weizhuo Wang, Karen Liu, Shuran Song

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 极简合规控制通过仅使用电机电流或电压信号实现无需力传感器的合规控制,适用于多种机器人和规划方法。

Comments Project website: https://minimalist-compliance-control.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. VLM训练与架构 30 篇

2603.00479 2026-03-03 cs.CV 88%

U-VLM: Hierarchical Vision Language Modeling for Report Generation

U-VLM:用于报告生成的分层视觉语言模型

Pengcheng Shi, Minghui Zhang, Kehan Song, Jiaqi Liu, Yun Gu, Xinglin Zhang

机构 * Medical Image Insights Co. Ltd.(医疗影像洞察有限公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 U-VLM通过分层视觉语言建模在CT-RATE和AbdomenAtlas 3.0上实现了最先进的报告生成性能,展示了精心设计的视觉编码器预训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19424 2026-03-03 cs.CV 86%

Hepato-LLaVA: An Expert MLLM with Sparse Topo-Pack Attention for Hepatocellular Pathology Analysis on Whole Slide Images

Hepato-LLaVA:一种基于稀疏拓扑包注意力机制的专家多模态大语言模型,用于肝细胞病理分析的整张图像

Yuxuan Yang, Zhonghao Yan, Yi Zhang, Bo Yun, Muxi Diao, Guowei Zhao, Kongming Liang, Wenbin Li, Zhanyu Ma

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) Department of Pathology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(pathology department, 国家癌症中心/国家癌症临床研究中心/癌症医院, 中国医学科学院和北京协和医学院)

专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(title);分类 cs.CV

AI总结 Hepato-LLaVA通过稀疏拓扑包注意力机制和HepatoPathoVQA数据集,实现肝细胞病理分析的高精度诊断与描述。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11999 2026-03-03 cs.CV cs.AI cs.IR cs.LG 85%

MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding

MOON: 基于生成式多模态大语言模型的电商产品理解多模态表示学习

Daoze Zhang, Chenghan Fu, Zhanheng Nie, Jianyu Liu, Wanxian Guan, Yuan Gao, Jun Song, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MOON通过生成式多模态大语言模型改进电商产品理解的多模态表示学习,引入引导的MoE模块、核心语义区域检测和负采样策略,提升零样本性能和泛化能力。

Comments Accepted by WSDM 2026 (oral). 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04097 2026-03-03 cs.LG 83%

Do Vision-Language Models Leak What They Learn? Adaptive Token-Weighted Model Inversion Attacks

视觉-语言模型是否会泄露所学内容?基于自适应令牌加权的模型逆向攻击

Ngoc-Bao Nguyen, Sy-Tuyen Ho, Koh Jun Hao, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.LG

AI总结 本研究提出SMI-AW攻击方法,揭示视觉-语言模型在隐私泄露方面的脆弱性,通过自适应令牌加权提升图像重建效果,验证了VLMs在敏感领域中的隐私风险。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00515 2026-03-03 cs.CV 83%

MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence

MLLM-4D: 向基于视觉的空间-时间智能迈进

Xingyilang Yin, Chengzhengxu Li, Jiahao Chang, Chi-Man Pun, Xiaodong Cun

机构 * University of Macau(澳门大学) Xi'an Jiaotong University(西安交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) GVC Lab, Great Bay University(大湾大学GVC实验室)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MLLM-4D通过改进的数据筛选和训练策略,实现了从2D输入中强大的空间-时间理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04395 2026-03-03 cs.CV 83%

Fourier-Attentive Representation Learning: A Fourier-Guided Framework for Few-Shot Generalization in Vision-Language Models

傅里叶-注意力表示学习:一种引导少样本泛化的视觉-语言模型框架

Hieu Dinh Trung Pham, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese German University(越南德语大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出FARL框架,通过傅里叶分析解缠视觉表示,提升视觉-语言模型在少样本场景下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01096 2026-03-03 cs.CV cs.AI cs.CL cs.LG 82%

Unified Vision-Language Modeling via Concept Space Alignment

通过概念空间对齐实现统一的视觉-语言建模

Yifu Qiu, Paul-Ambroise Duquenne, Holger Schwenk

机构 * University of Edinburgh(爱丁堡大学) FAIR at Meta(Meta公司FAIR团队)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 通过概念空间对齐实现统一的视觉-语言建模,V-SONAR在多语言和多模态任务中超越现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01260 2026-03-03 cs.LG cs.AI 81%

MOSAIC: A Unified Platform for Cross-Paradigm Comparison and Evaluation of Homogeneous and Heterogeneous Multi-Agent RL, LLM, VLM, and Human Decision-Makers

MOSAIC:一个用于跨范式比较和评估同质和异质多智能体RL、LLM、VLM和人类决策者的统一平台

Abdulhamid M. Mousa, Yu Fu, Rakhmonberdi Khajiev, Jalaledin M. Azzabi, Abdulkarim M. Mousa, Peng Yang, Yunusa Haruna, Ming Liu

机构 * School of Optics and Photonics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学光学工程学院) School of Automation Science and Electrical Engineering, Beihang University, Beijing 100191, China(北京航空航天大学自动化科学与电气工程学院) Faculty of Science, Ain Shams University, Cairo, Egypt(爱思唯命大学科学学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 MOSAIC是一个开源平台,通过统一接口和跨范式评估框架,支持在相同环境中比较不同决策范式的智能体,促进可重复的跨领域研究。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01236 2026-03-03 cs.CV cs.LG 81%

AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

AgilePruner: 一种针对大视觉-语言模型中自适应视觉标记剪枝的实证研究

Changwoo Baek, Jouwon Song, Sohyeon Kim, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学) LG Electronics(LG电子)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 AgilePruner通过实证研究揭示了基于注意力和多样性的视觉标记剪枝方法的优劣,并提出了一种改进的自适应剪枝机制。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13305 2026-03-03 cs.CV 79%

Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving

Prune2Drive: 一种用于自动驾驶中加速视觉-语言模型的即插即用框架

Minhao Xiong, Zichen Wen, Zhuangcheng Gu, Xuyang Liu, Rui Zhang, Hengrui Kang, Jiabing Yang, Junyuan Zhang, Weijia Li, Conghui He, Yafei Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) Sichuan University(四川大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 Prune2Drive通过视觉令牌修剪框架在自动驾驶中加速视觉-语言模型,实现显著速度提升和内存节省,性能影响小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00482 2026-03-03 cs.CV cs.IT math.IT 79%

TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications

TokenCom: 一种用于多模态和多任务令牌通信的视觉-语言模型

Feibo Jiang, Siwei Tu, Li Dong, Xiaolong Li, Kezhi Wang, Cunhua Pan, Zhu Han, Jiangzhou Wang

机构 * Hunan Provincial Key Laboratory of Intelligent Computing and Language Information Processing, Hunan Normal University(湖南省级智能计算与语言信息处理重点实验室,湖南师范大学) School of Information Science and Engineering, Hunan Normal University(信息科学与工程学院,湖南师范大学) Changsha Social Laboratory of Artificial Intelligence, Hunan University of Technology and Business(长沙人工智能社会实验室,湖南工业大学) School of Computer Science, Hunan University of Technology and Business(计算机科学学院,湖南工业大学) Department of Computer Science, Brunel University London(伦敦布鲁内尔大学计算机科学系) National Mobile Communications Research Laboratory, Southeast University(东南大学国家移动通信研究中心) Department of Electrical and Computer Engineering, University of Houston(电子与计算机工程系,休斯顿大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV

AI总结 TokenCom提出了一种新的视觉-语言模型框架TaiChi,通过双视觉分词器和双向注意力网络提升多模态和多任务令牌通信的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00412 2026-03-03 cs.CV 79%

PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Models

PointAlign:用于3D视觉-语言模型的特征级对齐正则化

Yuanhao Su, Shaofeng Zhang, Xiaosong Jia, Qi Fan

机构 * University of Science and Technology of China(中国科学技术大学) Fuzhou University(福州大学) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 PointAlign通过特征级对齐正则化提升3D视觉-语言模型的几何信息保留与任务性能

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17132 2026-03-03 cs.CV cs.CL 79%

Dynamic Token Reweighting for Robust Vision-Language Models

动态令牌重加权用于鲁棒的视觉-语言模型

Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang

机构 * Stony Brook University(石溪大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 DTR通过优化KV缓存动态调整视觉令牌权重,提升视觉-语言模型对多模态劫持攻击的鲁棒性,同时保持模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20089 2026-03-03 cs.CV cs.AI 76%

StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues

StructXLIP: 通过多模态结构线索增强视觉-语言模型

Zanxi Ruan, Songqun Gao, Qiuyu Kong, Yiming Wang, Marco Cristani

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 StructXLIP通过引入多模态结构线索提升视觉-语言模型的跨模态检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02026 2026-03-03 cs.CV cs.CL cs.LG 73%

Learning to Read Where to Look: Disease-Aware Vision-Language Pretraining for 3D CT

学习如何注视:面向3D CT的疾病感知视觉-语言预训练

Simon Ging, Philipp Arnold, Sebastian Walter, Hani Alnahas, Hannah Bast, Elmar Kotter, Jiancheng Yang, Behzad Bozorgtabar, Thomas Brox

机构 * Computer Vision Group, University of Freiburg, Germany Adaptive \& Agentic AI (A3) Lab, Aarhus University, Denmark Department of Radiology, Medical Center -- University of Freiburg, Germany Chair of Algorithms Data Structures, University of Freiburg, Germany ELLIS Institute Finland School of Electrical Engineering, Aalto University, Finland

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种面向3D CT的疾病感知视觉-语言预训练模型,通过对比预训练和基于提示的疾病监督,实现了文本到图像检索、疾病分类及内扫描片段定位的统一模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00938 2026-03-03 cs.CV cs.AI 73%

Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos

超越8位:HDR-UGC视频的主观和客观质量评估

Shreshth Saini, Bowen Chen, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * Laboratory for Image and Video Engineering (LIVE), UT Austin(图像与视频工程实验室(LIVE),得克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HDR-Q,首个针对HDR-UGC视频的多模态大语言模型,通过HDR感知编码器和HAPO框架实现超越8位的高质量视频评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00483 2026-03-03 cs.CV cs.AI 73%

RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment

RAISE:基于需求的进化精炼用于无训练文本到图像对齐

Liyao Jiang, Ruichen Chen, Chao Gao, Di Niu

机构 * Department of ECE, University of Alberta, Canada(阿尔伯塔大学电子工程系) Huawei Technologies, Canada(华为技术有限公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 RAISE是一种无训练、需求驱动的进化框架,通过动态调整生成过程实现高效且通用的文本到图像对齐。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17702 2026-03-03 cs.CV cs.AI 73%

Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek

Seek-CAD: 一种基于局部推理的自优化生成模型用于3D参数化CAD设计

Xueyang Li, Jiahao Li, Yu Song, Yunzhong Lou, Xiangdong Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Seek-CAD通过结合视觉和链式思维反馈,利用本地开源模型生成3D参数化CAD模型,提升生成效率和实用性。

Comments Accepted to ICLR 2026. The datatset has been released publicly and can be acessed in https://github.com/Sunny-Hack/Seek-CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06764 2026-03-03 cs.CV cs.AI 73%

SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation

SemHiTok:一种通过语义引导的层次代码本实现的统一图像分词器,用于多模态理解和生成

Zisheng Chen, Chunwei Wang, Runhui Huang, Hongbin Xu, Xiuwei Chen, Jun Zhou, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Hong Kong(香港大学) South China University of Technology(华南理工大学)

专题命中 VLM训练与架构 :LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SemHiTok通过语义引导的层次代码本实现统一图像分词器,提升多模态理解和生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00983 2026-03-03 cs.CV 70%

Event-Anchored Frame Selection for Effective Long-Video Understanding

基于事件的帧选择用于有效长视频理解

Wang Chen, Yongdong Luo, Yuhui Zeng, Luojun Lin, Tianyu Xie, Fei Chao, Rongrong Ji, Xiawu Zheng

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出基于事件的帧选择方法,通过分层事件感知流程提升长视频理解的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00720 2026-03-03 cs.LG 70%

MARS: Harmonizing Multimodal Convergence via Adaptive Rank Search

MARS: 通过自适应排名搜索实现多模态收敛的统一

Minkyoung Cho, Insu Jang, Shuowei Jin, Zesen Zhao, Adityan Jothi, Ethem F. Can, Min-Hung Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 MARS通过自适应排名搜索优化多模态大语言模型微调,平衡训练动态并提升性能。

Comments 17 pages; Project Page: this https URL: https://minkyoungcho.github.io/mars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04932 2026-03-03 cs.CV 70%

UniView: Enhancing Novel View Synthesis From A Single Image By Unifying Reference Features

UniView: 通过统一参考特征从单张图像增强新颖视角合成

Haowang Cui, Rui Chen, Jiaze Wang, Tao Guo, Zheng Qin

机构 * Tianjin University(天津大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 UniView通过统一参考特征提升单张图像新颖视角合成性能,采用检索增强系统和多模态大语言模型选择参考图像,并结合解耦三重注意力机制提高合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22283 2026-03-03 cs.CV 70%

Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment

重新审视在跨模态不匹配下的LVLMs视觉标记减少

Rui Xu, Yunke Wang, Yong Luo, Bo Du

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出VisionDrop方法,通过视觉-only修剪框架减少LVLMs中的视觉标记,无需额外训练,提升推理效率并保持性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01477 2026-03-03 cs.RO 67%

SFCo-Nav: Efficient Zero-Shot Visual Language Navigation via Collaboration of Slow LLM and Fast Attributed Graph Alignment

SFCo-Nav: 通过慢LLM与快速属性图对齐的协作实现高效的零样本视觉语言导航

Chaoran Xiong, Litao Wei, Xinhao Hu, Kehui Ma, Ziyi Xia, Zixin Jiang, Zhen Sun, Ling Pei

机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与位置基于服务重点实验室,上海交通大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 SFCo-Nav通过慢LLM与快速属性图对齐的协作,实现了高效的零样本视觉语言导航,显著提升效率并降低计算成本。

Comments Accepted by 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02253 2026-03-03 cs.CV cs.AI cs.LG 67%

DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing

DragFlow: 通过基于区域的监督释放DiT先验以实现拖拽编辑

Zihan Zhou, Shilin Lu, Shuli Leng, Shaocong Zhang, Zhuming Lian, Xinlei Yu, Adams Wai-Kin Kong

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 DragFlow通过基于区域的监督利用FLUX先验,改进基于拖拽的图像编辑效果,实现对点式和区域式基线的超越。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26346 2026-03-03 cs.CV cs.AI cs.CL 62%

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

EditReward:一种用于指令引导图像编辑的人类对齐奖励模型

Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) McGill University(麦吉尔大学) Independent(独立研究者)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 EditReward是一种基于人类偏好的奖励模型,通过大规模标注数据提升图像编辑任务的质量与性能,展示了在指令引导图像编辑中的卓越对齐能力。

Comments Accepted by ICLR 2026. Project Page: https://tiger-ai-lab.github.io/EditReward

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18453 2026-03-03 cs.AI cs.CL 57%

Reason Like a Radiologist: Chain-of-Thought and Reinforcement Learning for Verifiable Report Generation

像放射科医生一样推理:用于可验证报告生成的推理链和强化学习

Peiyuan Jing, Kinhei Lee, Zhenxuan Zhang, Huichi Zhou, Zhengqing Yuan, Zhifan Gao, Lei Zhu, Giorgos Papanastasiou, Yingying Fang, Guang Yang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 BoxMed-RL通过推理链和强化学习生成可验证的放射科报告,提升报告的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09285 2026-03-03 cs.CV 57%

Spotlight on Token Perception for Multimodal Reinforcement Learning

多模态强化学习中的token感知聚焦

Siyuan Huang, Xiaoye Qu, Yafu Li, Yun Luo, Zefeng He, Daizong Liu, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Wuhan University(武汉大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。

Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00805 2026-03-03 cs.CV cs.MA 57%

NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code

NERFIFY:一个将NeRF论文转化为代码的多智能体框架

Seemandhar Jain, Keshav Gupta, Kunal Gupta, Manmohan Chandraker

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 NERFIFY通过多智能体框架将NeRF论文转化为可训练的代码,提升复现效率和质量。

Comments Accepted to CVPR 2026. Project page: https://seemandhar.github.io/NERFIFY/

详情

展开后加载摘要…

URL PDF HTML 收藏