arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

作者

Trevor Darrell

Computer Vision

2026-04-07 至 2026-04-07 共收录 2
2601.11109 2026-04-07 cs.CV cs.AI cs.GR

Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning

通过交错多模态推理的视觉-反图形代理

Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang, Chenyang Wang, Xiuyu Li, Michael J. Black, Trevor Darrell, Angjoo Kanazawa, Haiwen Feng

机构 * University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Impossible, Inc.(Impossible公司)

AI总结 本文提出VIGA框架,通过符号逻辑与视觉感知的交叉验证,解决视觉语言模型在单次设置中重建图像的挑战,支持2D文档生成、3D重建等任务。

Comments Project page: https://fugtemypt123.github.io/VIGA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12866 2026-04-07 cs.RO cs.CV

Learning to Grasp Anything by Playing with Random Toys

通过随机玩具学习抓取任何物体

Dantong Niu, Yuvan Sharma, Baifeng Shi, Rachel Ding, Matteo Gioia, Haoru Xue, Henry Tsai, Konstantinos Kallidromitis, Anirudh Pai, Caitlin Regan, Shankar Sastry, Trevor Darrell, Jitendra Malik, Roei Herzig

机构 * University of California, Berkeley(加州大学伯克利分校) Sapienza University of Rome(罗马大学) ItalAI Panasonic(松下)

AI总结 本文通过随机组装的简单玩具训练机器人,使其具备泛化抓取能力,采用对象中心视觉表示实现零样本性能,实现在YCB数据集上的67%抓取成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏