arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-04 至 2026-03-04 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2603.02959 2026-03-04 cs.CV 79%

Semi-Supervised Few-Shot Adaptation of Vision-Language Models

视觉-语言模型的半监督少样本适应

Julio Silva-Rodríguez, Ender Konukoglu

机构 * Computer Vision Lab, ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院计算机视觉实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种半监督方法,通过传播文本引导的伪标签来提升视觉-语言模型在极低样本情况下的适应性能,减少标注工作量超过50%。

Comments Code: https://github.com/jusiro/SS-Text-U

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03278 2026-03-04 cs.RO cs.AI cs.CV 62%

Tether: Autonomous Functional Play with Correspondence-Driven Trajectory Warping

Tether: 基于对应驱动轨迹扭曲的自主功能性玩耍

William Liang, Sam Wang, Hung-Ju Wang, Osbert Bastani, Yecheng Jason Ma, Dinesh Jayaraman

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校) Dyna Robotics(Dyna机器人技术)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Tether通过基于对应驱动的轨迹扭曲,实现从少量演示开始的自主多任务玩耍,生成高质量数据集并提升模仿策略性能。

Comments International Conference on Learning Representations (ICLR), 2026. Project website and code: https://tether-research.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15008 2026-03-04 cs.LG cs.AI stat.ML 62%

Know When to Abstain: Optimal Selective Classification with Likelihood Ratios

知何时退避:基于似然比的最优选择性分类

Alvin Heng, Harold Soh

机构 * Department of Computer Science, National University of Singapore(计算机科学系,国立新加坡大学) Smart Systems Institute, National University of Singapore(智能系统研究所,国立新加坡大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于似然比的最优选择性分类方法,通过 Neyman-Pearson 引理统一并改进了选择性分类在协变量偏移下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏