arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-22 至 2026-05-22 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 5 篇

2605.21572 2026-05-22 cs.CV cs.RO 70%

PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects

PhysX-Omni: 为刚体、变形体和关节物体统一的模拟准备物理3D生成

Ziang Cao, Yinghao Liu, Haitian Li, Runmao Yao, Fangzhou Hong, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 其他VLM :vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出PhysX-Omni,一种统一的模拟准备物理3D生成框架,通过开发针对视觉-语言模型的高效几何表示和首个通用模拟准备3D数据集PhysXVerse,以及评估生成和理解能力的PhysX-Bench,显著提升了生成和理解性能,推动下游应用如具身AI和物理模拟的发展。

Comments Project page: https://physx-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22645 2026-05-22 cs.AI 57%

AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters

AtelierEval: 人类与LLM作为文本到图像提示器的代理评估

Hanjun Luo, Zhimu Huang, Sylvia Chung, Yiran Wang, Yingbin Jin, Jialin Li, Jiang Li, Xinfeng Li, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出AtelierEval,首个统一基准,通过360个专家设计的任务量化提示能力,引入技能基于的记忆增强代理评估器,实现与人类专家的高相关性,验证了提示器在图像增强方向的优越性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22552 2026-05-22 cs.CV cs.MM 57%

FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning

FashionLens:通过任务自适应学习实现多功能时尚图像检索

Haokun Wen, Xuemeng Song, Xinghao Xie, Xiaolin Chen, Xiangyu Zhao, Weili Guan

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出FashionLens框架,通过任务自适应学习实现多功能时尚图像检索,解决现有方法无法处理多样检索需求的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22366 2026-05-22 cs.CV 57%

AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture

AgroTools: 一个用于农业中增强工具的多模态代理基准

Zi Ye, Yibin Wen, Xiaoya Fan, Xinyu Zhang, Jing Wu, Kun Zeng, Zurong Mai, Jiarui Zhang, Bohan Shi, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) Southwest University(西南大学) Northeastern University(东北大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Southwest Jiaotong University(西南交通大学) China Agricultural University(中国农业大学) Tsinghua University(清华大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出AgroTools基准,用于评估农业中增强工具的多模态代理,通过539个问题-答案实例和1097张异构农业图像,评估模型在工具使用中的执行质量和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01334 2026-05-22 cs.CV 57%

What Does Vision Tool-Use Reinforcement Learning Really Learn? Disentangling Tool-Induced and Intrinsic Effects for Crop-and-Zoom

视觉工具使用强化学习究竟在学习什么?解构工具诱导效应与内在效应以实现作物和缩放

Yan Ma, Weiyu Zhang, Tianle Li, Linge Du, Xuyang Shen, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 本文研究了视觉工具使用强化学习在作物和缩放任务中的学习机制,通过引入MED框架解耦内在能力变化与工具诱导效应,发现改进主要由内在学习驱动,而工具使用强化学习主要减少工具诱导的负面影响,而非掌握工具。

Comments ICML 2026 camera ready. Code: https://github.com/GAIR-NLP/Med

详情

展开后加载摘要…

URL PDF HTML 收藏