arXivDaily arXiv每日学术速递 周一至周五更新

作者

Trevor Darrell

Computer Vision

共收录 357
2511.19418 2026-08-06 cs.CV cs.AI cs.LG 版本更新

Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens

链式视觉思维:通过连续视觉标记教学VLMs更好地看到和思考

Yiming Qin, Bomin Wei, Jiaxin Ge, Konstantinos Kallidromitis, Stephanie Fu, Trevor Darrell, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) UCLA(洛杉矶大学) Panasonic AI Research(松下人工智能研究)

AI总结 COVT通过连续视觉标记提升VLMs的视觉推理能力,使模型在多个基准测试中性能提升3%-16%。

Comments Project page: https://wakalsprojectpage.github.io/covt-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25860 2026-07-29 cs.CV 新提交

Open-Ended CT Volume Segmentation with Weak Supervision from Language

基于语言弱监督的开放式CT体积分割

Sanjay Subramanian, Junwei Yu, Zirui Wang, Rohil Malpani, Maggie Chung, Adam Yala, Dan Klein, Trevor Darrell

机构 * Department of Electrical Engineering and Computer Science, UC Berkeley(加州大学伯克利分校电气工程与计算机科学系) Voio Department of Radiology and Biomedical Imaging, UC San Francisco(加州大学旧金山分校放射学与生物医学成像系) Computational Precision Health, UC Berkeley and UC San Francisco(加州大学伯克利分校和加州大学旧金山分校计算精准健康中心)

AI总结 研究基于语言弱监督训练CT扫描文本条件分割模型,通过结合体素级与切片级监督,从扫描-报告对提取信息,微调通用2D图像分割模型SAM3,在ReXGroundingCT数据集上提升了分割骰子分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26182 2026-07-22 cs.CV cs.AI cs.LG 版本更新

Lifting Embodied World Models for Planning and Control

提升具身世界模型用于规划与控制

Alex N. Wang, Trevor Darrell, Pavel Izmailov, Yutong Bai, Amir Bar

机构 * Computer Science, New York University(纽约大学计算机科学系) BAIR, UC Berkeley(伯克利大学BAIR)

AI总结 本文提出一种轻量级策略,将高层动作映射到低层关节动作序列,结合冻结的世界模型,实现预测未来观察的提升世界模型,有效降低规划复杂度。

Comments Accepted to ECCV2026. Edited policy masking

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07847 2026-07-10 cs.LG 新提交

When Does Continual Learning Require Learning

持续学习何时需要学习

Anne Harrington, Nayan Saxena, Michael Murphy, Anastasia Borovykh, Zeyu Yun, Sridhar Kamath, Ara Eindra Kyi, Trevor Darrell, Jitendra Malik, Yutong Bai

机构 * UC Berkeley(加州大学伯克利分校) Capital Fund Management(资本基金管理公司)

AI总结 研究大语言模型持续学习问题,从空间和时间轴分解变化,通过重新设置基准和引入协议评估多种方法,发现持续学习非单一能力,不同环境变化需不同更新行为,为设计更强持续学习系统提供指导。

Comments Code: https://github.com/anneharrington/studying-cl. Project page: https://anneharrington.github.io/studying-cl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07843 2026-07-03 cs.LG cs.AI cs.CL 版本更新

ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models

ThreadWeaver:自适应线程化实现语言模型高效并行推理

Long Lian, Sida Wang, Felix Juefei-Xu, Tsu-Jui Fu, Xiuyu Li, Adam Yala, Trevor Darrell, Alane Suhr, Yuandong Tian, Xi Victoria Lin

机构 * UC Berkeley(伯克利大学) UCSF(旧金山大学)

AI总结 提出ThreadWeaver框架,通过两阶段并行轨迹生成、基于trie的展开设计和并行化感知强化学习,在保持与顺序推理模型相当准确率的同时,显著降低推理延迟。

Comments Accepted as an oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07295 2026-06-26 cs.CV cs.AI cs.LG 版本更新

Reconstruction Alignment Improves Unified Multimodal Models

重建对齐改进统一多模态模型

Ji Xie, Trevor Darrell, Luke Zettlemoyer, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Duke University(杜克大学)

AI总结 提出重建对齐(RECA),一种资源高效的后训练方法,利用视觉理解编码器嵌入作为密集文本提示,通过自监督重建损失对齐理解与生成,显著提升多种统一多模态模型的生成和编辑性能。

Comments 43 pages, 36 figures and 14 tables; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17055 2026-06-23 cs.RO 新提交

T-Rex: Tactile-Reactive Dexterous Manipulation

T-Rex: 触觉反应灵巧操作

Dantong Niu, Zhuoyang Liu, Zekai Wang, Boning Shao, Zhao-Heng Yin, Anirudh Pai, Yuvan Sharma, Stefano Saravalle, Ruijie Zheng, Jing Wang, Ryan Punamiya, Mengda Xu, Yuqi Xie, Yunfan Jiang, Letian Fu, Konstantinos Kallidromitis, Matteo Gioia, Junyi Zhang, Jiaxin Ge, Haiwen Feng, Fabio Galasso, Wei Zhan, David M. Chan, Yutong Bai, Roei Herzig, Jiahui Lei, Li Fei-Fei, Ken Goldberg, Jitendra Malik, Pieter Abbeel, Yuke Zhu, Danfei Xu, Linxi Fan, Trevor Darrell

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达) Stanford(斯坦福大学) Panasonic(松下) La Sapienza University(罗马大学) ItalAI

AI总结 提出大规模触觉数据集和可变速率混合Transformer架构,在12项精细操作任务上平均成功率提升超30%。

Comments Project page: https://tactile-rex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19419 2026-06-19 cs.RO cs.AI 新提交

Playful Agentic Robot Learning

趣味性具身机器人学习

Junyi Zhang, Jiaxin Ge, Hanjun Yoo, Letian Fu, Zihan Yang, Yaowei Liu, Raj Saravanan, Shaofeng Yin, Justin Yu, Dantong Niu, Zirui Wang, Roei Herzig, Ken Goldberg, Yutong Bai, David M. Chan, Ion Stoica, Angjoo Kanazawa, Jiahui Lei, Haiwen Feng, Trevor Darrell

机构 * University of California, Berkeley(加州大学伯克利分校) Impossible Research

AI总结 提出RATs框架,让机器人通过自主探索学习可复用技能,在LIBERO-PRO和MolmoSpaces上分别提升20.6和17.0个百分点。

Comments Project page: https://playful-rats.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18153 2026-06-17 cs.CV 新提交

Neural Tree Reconstruction for the Open Forest Observatory

开放森林观测站的神经树重建

Marissa Ramirez de Chanlatte, Arjun Rewari, Trevor Darrell, Derek J. N. Young

机构 * Berkeley AI Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究) Department of Plant Sciences, University of California, Davis(加州大学戴维斯分校植物科学系)

AI总结 针对开放森林观测站中经典运动恢复结构方法重建质量差的问题,提出引入神经辐射场提升3D树重建的细节与鲁棒性,并展望未来工作。

Comments Published as a workshop paper at "Tackling Climate Change with Machine Learning", ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17256 2026-06-17 cs.RO cs.CV 新提交

Contrastive Action-Image Pre-training for Visuomotor Control

对比动作-图像预训练用于视觉运动控制

Yuvan Sharma, Dantong Niu, Anirudh Pai, Zekai Wang, Zhuoyang Liu, Baifeng Shi, Stefano Saravalle, Boning Shao, Ruijie Zheng, Jing Wang, Konstantinos Kallidromitis, Yusuke Kato, Fabio Galasso, Yuke Zhu, Danfei Xu, Linxi "Jim" Fan, Jitendra Malik, Trevor Darrell, Roei Herzig

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达) Sapienza University of Rome(罗马大学) Panasonic(松下) ItalAI

AI总结 提出CAIP方法,利用大规模第一人称视频中3D手部关键点作为代理动作信号,通过对比学习统一动作-图像表示,在少量机器人数据下显著提升灵巧操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21218 2026-06-05 cs.CV

Latent Implicit Visual Reasoning

潜在隐式视觉推理

Kelvin Li, Chuyi Shang, Leonid Karlinsky, Rogerio Feris, Trevor Darrell, Roei Herzig

机构 * University of California, Berkeley(加州大学伯克利分校) Xero MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室)

AI总结 本文提出了一种任务无关的机制,训练大规模多模态模型(LMMs)在无需显式中间监督的情况下发现和使用潜在视觉推理标记,从而在多种视觉中心任务中优于直接监督微调,并在不使用辅助图像、边界框、图像裁剪、深度图或思维链注释的情况下,与或优于先前基于文本和显式视觉中间推理方法相媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10897 2026-06-05 cs.CV

Can Language Models Learn to Listen?

语言模型能否学会倾听?

Evonne Ng, Sanjay Subramanian, Dan Klein, Angjoo Kanazawa, Trevor Darrell, Shiry Ginosar

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种基于说话人话语生成适当面部回应的框架,通过将量化后的面部动作元素作为额外语言token输入到基于transformer的大型语言模型中,从而提升监听响应的质量。

Comments ICCV 2023; Project page: https://people.eecs.berkeley.edu/~evonne_ng/projects/text2listen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04433 2026-06-04 cs.CV cs.CL cs.LG

Stateful Visual Encoders for Vision-Language Models

用于视觉-语言模型的有状态视觉编码器

Zirui Wang, Junwei Yu, Adam Yala, David M. Chan, Joseph E. Gonzalez, Trevor Darrell

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

AI总结 提出有状态视觉编码器,通过将每个视觉表示条件于先前的视觉特征,增强视觉-语言模型在多图像、多轮交互中的视觉变化感知能力,在跨图像空间聚合、多目标视觉差异和轨迹行为克隆等任务上取得一致改进。

Comments Project page: https://statefulvisualencoders.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11713 2026-06-02 cs.CL cs.LG

Are Large Reasoning Models Interruptible?

大型推理模型是否可中断?

Tsung-Han Wu, Mihran Miroyan, David M. Chan, Trevor Darrell, Narges Norouzi, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 研究大型推理模型在中断和动态上下文两种现实动态场景下的鲁棒性,发现静态评估高估了鲁棒性,并揭示了推理泄漏、恐慌和自我怀疑等新故障模式。

Comments ICML 2026; Project Page: http://dynamic-lm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00090 2026-05-04 cs.CV cs.LG

It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models

迟到也不晚:通过噪声优化在训练好的扩散模型中恢复崩溃

Anne Harrington, A. Sophia Koepke, Shyamgopal Karthik, Trevor Darrell, Alexei A. Efros

机构 * UC Berkeley(加州大学伯克利分校) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) TU Munich, MCML(慕尼黑工业大学,MCML)

AI总结 本文通过噪声优化提升扩散模型生成多样性,减少模式崩溃,同时保持基础模型的保真度。

Comments CVPR 2026. Project page at https://akoepke.github.io/divgen/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03269 2026-04-28 cs.CV cs.LG

LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory

LoGeR:长上下文几何重建与混合记忆

Junyi Zhang, Charles Herrmann, Junhwa Hur, Chen Sun, Ming-Hsuan Yang, Forrester Cole, Trevor Darrell, Deqing Sun

AI总结 LoGeR通过混合记忆模块实现长序列的高精度3D重建,无需后优化,有效解决长视频中的上下文一致性问题,优于现有方法。

Comments Project page: https://LoGeR-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11109 2026-04-07 cs.CV cs.AI cs.GR

Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning

通过交错多模态推理的视觉-反图形代理

Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang, Chenyang Wang, Xiuyu Li, Michael J. Black, Trevor Darrell, Angjoo Kanazawa, Haiwen Feng

机构 * University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Impossible, Inc.(Impossible公司)

AI总结 本文提出VIGA框架,通过符号逻辑与视觉感知的交叉验证,解决视觉语言模型在单次设置中重建图像的挑战,支持2D文档生成、3D重建等任务。

Comments Project page: https://fugtemypt123.github.io/VIGA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12866 2026-04-07 cs.RO cs.CV

Learning to Grasp Anything by Playing with Random Toys

通过随机玩具学习抓取任何物体

Dantong Niu, Yuvan Sharma, Baifeng Shi, Rachel Ding, Matteo Gioia, Haoru Xue, Henry Tsai, Konstantinos Kallidromitis, Anirudh Pai, Caitlin Regan, Shankar Sastry, Trevor Darrell, Jitendra Malik, Roei Herzig

机构 * University of California, Berkeley(加州大学伯克利分校) Sapienza University of Rome(罗马大学) ItalAI Panasonic(松下)

AI总结 本文通过随机组装的简单玩具训练机器人,使其具备泛化抓取能力,采用对象中心视觉表示实现零样本性能,实现在YCB数据集上的67%抓取成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03721 2026-03-31 cs.CV cs.CL cs.CY cs.LG

Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models

针对LAION-400M的人为中心标注:审查偏见及其在模型中的转移

Leander Girrbach, Stephan Alaniz, Genevieve Smith, Trevor Darrell, Zeynep Akata

机构 * Technical University of Munich, Munich Center for Machine Learning (MCML), MDSI(慕尼黑工业大学,慕尼黑机器学习中心(MCML),MDSI) LTCI, Télécom Paris, Institut Polytechnique de Paris, France(法国巴黎理工学院,巴黎电信学院,LTCI) Helmholtz Munich(亥姆霍兹慕尼黑中心) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过创建LAION-400M的人为中心标注,揭示了训练数据中存在的人口统计学偏见,并展示了这些偏见如何转移到视觉-语言模型中。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12254 2026-03-13 cs.CV

Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing

先关注再注意:通过自回归注视实现高效的可扩展视频理解

Baifeng Shi, Stephanie Fu, Long Lian, Hanrong Ye, David Eigen, Aaron Reite, Boyi Li, Jan Kautz, Song Han, David M. Chan, Pavlo Molchanov, Trevor Darrell, Hongxu Yin

机构 * UC Berkeley(伯克利大学) MIT(麻省理工学院) Clarifai(Clarifai公司) NVIDIA(英伟达公司)

AI总结 AutoGaze通过自回归选择视频中的关键块,减少冗余并提升处理效率,使大语言模型能处理长视频并取得更优表现。

Comments CVPR 2026. Project page: https://autogaze.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05334 2026-03-04 cs.CL cs.IR cs.LG

Search Arena: Analyzing Search-Augmented LLMs

Search Arena: 分析增强搜索的大型语言模型

Mihran Miroyan, Tsung-Han Wu, Logan King, Tianle Li, Jiayi Pan, Xinyan Hu, Wei-Lin Chiang, Anastasios N. Angelopoulos, Trevor Darrell, Narges Norouzi, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 Search Arena 是一个大规模众包数据集,用于分析增强搜索的LLMs,揭示用户偏好受引用数量影响,并发现不同来源的可靠性差异。

Comments Accepted to ICLR 2026. Code: https://github.com/lmarena/search-arena. Dataset: https://huggingface.co/datasets/lmarena-ai/search-arena-24k

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16710 2026-02-19 cs.RO

EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data

EgoScale:利用多样化的视点人类数据进行规模化灵巧操作

Ruijie Zheng, Dantong Niu, Yuqi Xie, Jing Wang, Mengda Xu, Yunfan Jiang, Fernando Castañeda, Fengyuan Hu, You Liang Tan, Letian Fu, Trevor Darrell, Furong Huang, Yuke Zhu, Danfei Xu, Linxi Fan

机构 * NVIDIA University of California, Berkeley(加州大学伯克利分校) University of Maryland(马里兰大学)

AI总结 EgoScale通过大规模视点人类数据训练视觉语言动作模型,实现高效的灵巧操作转移,提升机器人任务成功率54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09322 2026-02-10 cs.CV

Fast Image-based Neural Relighting with Translucency-Reflection Modeling

基于图像的快速神经光照与透明-反射建模

Shizhan Zhu, Shunsuke Saito, Aljaz Bozic, Carlos Aliaga, Trevor Darrell, Christoph Lassner

AI总结 本文提出了一种快速神经3D重建和光照模型,能够利用IBL重新照明复杂材料,如透明和光泽反射,实现逼真效果。

Comments v2: Major revision and bug fix: New method with significantly improved results. Corrects an error in v1 (arXiv:2306.09322v1) in the evaluation of baseline NRTF due to an implementation bug. Results in v2 supersede those in v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06964 2026-02-09 cs.LG cs.AI cs.CL

Learning a Generative Meta-Model of LLM Activations

学习大语言模型激活的生成元模型

Grace Luo, Jiahai Feng, Trevor Darrell, Alec Radford, Jacob Steinhardt

AI总结 本研究通过训练扩散模型学习大语言模型激活的分布,提出生成元模型以提升干预保真度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17875 2026-01-14 cs.CV cs.LG

Visually Prompted Benchmarks Are Surprisingly Fragile

通过视觉提示的基准测试出人意料地脆弱

Haiwen Feng, Long Lian, Lisa Dunlap, Jiahao Shu, XuDong Wang, Renhao Wang, Trevor Darrell, Alane Suhr, Angjoo Kanazawa

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 研究发现视觉提示基准测试对细节敏感,通过创建VPBench减少不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10927 2025-12-12 cs.CV

FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos

FoundationMotion: 自动标注与视频中空间运动的推理

Yulu Gan, Ligeng Zhu, Dandan Shan, Baifeng Shi, Hongxu Yin, Boris Ivanovic, Song Han, Trevor Darrell, Jitendra Malik, Marco Pavone, Boyi Li

机构 * MIT(麻省理工学院) NVIDIA(英伟达) UMich(密歇根大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 FoundationMotion通过自动数据整理管道生成大规模细粒度运动数据集,提升开源模型在运动理解与空间推理任务中的性能。

Comments Code is available at https://github.com/Wolfv0/FoundationMotion/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05094 2025-12-12 cs.RO cs.CV

From Generated Human Videos to Physically Plausible Robot Trajectories

从生成的人类视频到物理上合理的机器人轨迹

James Ni, Zekai Wang, Wei Lin, Amir Bar, Yann LeCun, Trevor Darrell, Jitendra Malik, Roei Herzig

机构 * University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学) Johannes Kepler University(约翰·凯撒大学)

AI总结 本文提出GenMimic方法,通过物理感知强化学习策略,从生成的视频中实现零样本的人形机器人动作模仿,并建立了评估零样本泛化能力的基准。

Comments For project website, see https://genmimic.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22697 2025-12-01 cs.RO cs.CL cs.CV

Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations

通过少样本示范机制性微调视觉-语言-动作模型

Chancharik Mitra, Yusen Luo, Raj Saravanan, Dantong Niu, Anirudh Pai, Jesse Thomason, Trevor Darrell, Abrar Anwar, Deva Ramanan, Roei Herzig

AI总结 本研究提出Robotic Steering方法,通过少样本示范机制性微调视觉-语言-动作模型,提升其在机器人任务中的适应性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17803 2025-11-25 cs.CV cs.AI

Pillar-0: A New Frontier for Radiology Foundation Models

Pillar-0:放射学基础模型的新前沿

Kumar Krishna Agrawal, Longchao Liu, Long Lian, Michael Nercessian, Natalia Harguindeguy, Yufu Wu, Peter Mikhael, Gigin Lin, Lecia V. Sequist, Florian Fintelmann, Trevor Darrell, Yutong Bai, Maggie Chung, Adam Yala

AI总结 Pillar-0通过预训练大量医学影像数据和RATE框架,在放射学任务中实现高性能表现,超越现有模型并扩展至新任务。

详情

展开后加载摘要…

URL PDF HTML 收藏