arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

2026-08-20 至 2026-08-20 共收录 5
2608.19197 2026-08-20 cs.CL cs.AI 新提交

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19161 2026-08-20 cs.AI cs.CR 新提交

Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication

超越文本记录:检测潜在多智能体通信中的隐蔽协同

Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban Roy

机构 * MIT Media Lab(麻省理工学院媒体实验室) Westtown School(韦斯顿镇学校) University of Florida(佛罗里达大学) SRI International(SRI国际公司)

AI总结 本研究针对语言模型智能体通过不可见潜在状态进行隐蔽协同的问题,提出可验证潜在对齐(VLA)框架,设计三层监控器与可引导性框架,在多智能体拍卖基准上实现了高效的隐蔽协同检测与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18881 2026-08-20 cs.CV 新提交

Falcon Perception-HD: High Density Perception via Reinforcement Learning

Falcon Perception-HD:基于强化学习的高密度感知

Sofian Chaybouti, Yasser Dahou, Ngoc Dung Huynh, Reda Alami, Hilde Kuehne

机构 * Tübingen AI Center(蒂宾根人工智能中心) University of Tübingen(蒂宾根大学) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室) Technology Innovation Institute(技术创新研究院)

AI总结 该研究针对开放词汇自回归感知模型的目标错位问题,基于Falcon Perception设计RL框架,采用GRPO优化,在指代表达分割任务上提升了极密集场景性能,减少冗余需求并保留物体存在性知识。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-08-20 cs.CV 新提交

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18602 2026-08-20 cs.CV 新提交

Teach a Molmo2Fish: Towards interactive fish tracking with natural language guidance

Teach a Molmo2Fish:面向自然语言引导的交互式鱼类追踪

Kai Van Brunt (1), Justin Kay (1), Sara Beery (1) ((1) Massachusetts Institute of Technology)

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 本研究针对声呐鱼类追踪数据集定制了多模态大语言模型工具Molmo2Fish,通过交互式预测修正工作流开展实验,发现其在鱼类追踪和轨迹修正上性能良好,但自然语言引导的融入仍需提升。

Comments 29 pages, 6 figures, to be published in Third Workshop on Computer Vision for Ecology at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏