arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-10 至 2026-06-10 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2606.10803 2026-06-10 cs.CL cs.AI cs.CV 新提交 62%

Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

超越API:探索多模态大语言模型在物理工具使用中的极限

Zhixin Ma, Yutong Zhou, Yongqi Li, Chong-Wah Ngo, Wenjie Li

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出PhysTool-Bench基准,评估多模态大语言模型在真实场景中识别物理工具并规划使用的能力,发现最强模型仅完成21%任务,揭示感知与规划双重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09868 2026-06-10 cs.LG cs.AI 新提交 62%

SPACE: Source-free Proxy Anchor Concept Erasure for MLLMs

SPACE: 面向多模态大语言模型的无源代理锚点概念擦除

Zhijing Zhang, Jiaqi Ding, Qianshan Wei, Nan Zhou, Jiaqi Li, Yongliang Wu, Tongxin Zhu, Xiaolin Fang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SPACE框架,首个针对多模态大语言模型的无源机器遗忘方法,通过文本引导的代理锚点选择和双约束语义隔离,在不访问目标数据的情况下擦除概念,并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10253 2026-06-10 physics.optics physics.app-ph 新提交 50%

Multi-channel Optical Vision Model

多通道光学视觉模型

Ali Momeni, Guillaume Noetinger, Tim Tuuva, Romain Fleury

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文利用光学神经网络中的空间复用,将通道作为可训练表示坐标,通过在线物理前向/代理反向训练,在图像分类和回归任务中实现多通道功能,并构建了混合光电视觉语言模型。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏