arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

2026-07-24 至 2026-07-24 共收录 6
2607.21155 2026-07-24 cs.CV cs.AI 新提交

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) MIT(麻省理工学院)

AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20940 2026-07-24 cs.CV 新提交

Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention

Ms. Forcing:通过多尺度分块和注意力实现高效流视频生成

Zekun Li, Xiaoyan Cong, Hongyu Li, Zhiyang Dou, Chuan Guo, Abhay Mittal, Sizhe An, Srinath Sridhar

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) Meta

AI总结 研究针对流视频生成中传统方法的不足,提出Ms. Forcing范式,通过多尺度分块和注意力调整空间粒度,引入均匀噪声水平DMD减少不匹配,该方法提升了效率,在单个H200 GPU上性能显著优于Rolling Forcing。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20903 2026-07-24 cs.CV cs.HC 新提交

Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos

人行道时刻:更丰富的表示总是更符合人类认知吗?来自城市漫步视频的证据

Liu Liu, Freya Huying Tan, Fábio Duarte

机构 * Massachusetts Institute of Technology(麻省理工学院) City Form Lab, MIT(麻省理工学院城市形态实验室) Senseable City Lab, MIT(麻省理工学院可感知城市实验室)

AI总结 研究借助多种模态表示的城市漫步视频,探讨更丰富视觉表示与人类认知的关系。通过相关性分析等方法,发现不同模态在不同场景表现有别,挑战了丰富表示更符合人类认知的假设,提出时间压缩可替代全视频编码。

Comments 35 pages, 18 figures. Under review at Scientific Reports

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20665 2026-07-24 cs.RO cs.MA cs.SY eess.SY 新提交

Safe and Scalable Multi-Drone Payload Transport via CBF-based Reinforcement Learning with Zero-Shot Sim-to-Real Transfer

通过基于CBF的强化学习实现安全且可扩展的多无人机载荷运输及零样本模拟到现实的迁移

Jaeyoun Choi, Oswin So, Songyuan Zhang, Cooper Taylor, Chuchu Fan

机构 * Reliable Autonomous Systems Lab, Massachusetts Institute of Technology(可靠自主系统实验室,麻省理工学院)

AI总结 研究多无人机载荷运输问题,提出基于学习的框架,引入二维抽象,用离散图控制障碍函数近端策略优化训练全分布式策略,实现零样本模拟到现实的迁移,能在不同团队规模和任务场景泛化,在动态环境安全运行。

Comments Published in IEEE Robotics and Automation Letters (Early Access), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01363 2026-07-24 cs.AI econ.GN q-fin.EC 版本更新

Crashing Waves vs. Rising Tides: Findings on AI Automation from Thousands of Worker Evaluations of Labor Market Tasks

巨浪与潮汐:来自数千名工人对劳动力市场任务评估的初步发现

Matthias Mertens, Adam Kuzee, Brittany S. Harris, Harry Lyu, Wensu Li, Jonathan Rosenfeld, Meiri Anto, Martin Fleming, Neil Thompson

机构 * MIT FutureTech(麻省理工学院未来科技)

AI总结 本文通过分析超过3000项基于文本的任务评估,发现AI自动化主要表现为持续上升的浪潮而非突发的巨浪,AI在广泛任务上的表现迅速提升,预计到2029年将能以80%-95%的成功率完成大部分文本任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10092 2026-07-24 cs.AI cs.LG 版本更新

Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit

使用稀疏自动编码器的可解释嵌入:一种数据分析工具包

Nick Jiang, Xiaoqing Sun, Lisa Dunlap, Lewis Smith, Neel Nanda

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究针对大规模文本语料库分析难题,提出用稀疏自动编码器创建SAE嵌入,经四个任务验证其比大语言模型更具性价比、比密集嵌入更可控,通过案例研究展示其在研究模型行为上的作用,是用于非结构化数据分析的通用工具。

Comments ICML 2026. Project page and code: https://interp-embed.com

详情

展开后加载摘要…

URL PDF HTML 收藏