arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

2026-04-22 至 2026-04-22 共收录 9
2604.19670 2026-04-22 cs.RO cs.AI

Multi-Cycle Spatio-Temporal Adaptation in Human-Robot Teaming

人类-机器人协同中的多周期空间-时间适应

Alex Cuellar, Michael Hagenow, Julie Shah

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) UW Madison Department of Computer Science(威斯康星大学麦迪逊分校计算机科学系)

AI总结 本文提出RAPIDDS框架,通过联合适应任务调度和机器人运动扩散模型,提升人类-机器人协同的效率与空间适应性,通过仿真和物理机器人实验验证了其有效性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19473 2026-04-22 cs.CV

TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation

TS-Attn:多事件视频生成的时序可分离注意力

Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Zhejiang University(浙江大学) Nankai University(南开大学) Massachusetts Institute of Technology(麻省理工学院) Nanjing University(南京大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

AI总结 本文提出TS-Attn机制,解决多事件视频生成中时序不一致与注意力冲突问题,提升生成质量,实验表明在两个数据集上效果显著。

Comments ICLR 2026, code available at: https://github.com/Hong-yu-Zhang/TS-Attn

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12942 2026-04-22 cs.RO

RMGS-SLAM: Real-time Multi-sensor Gaussian Splatting SLAM

RMGS-SLAM:基于3D高斯散射的实时多传感器SLAM

Dongen Li, Yi Liu, Junqi Liu, Zewen Sun, Zefan Huang, Shuo Sun, Jiahui Liu, Chengran Yuan, Hongliang Guo, Francis E. H. Tay, Marcelo H. Ang

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) School of Aeronautics and Astronautics, Shanghai Jiao Tong University(上海交通大学航空宇航学院) College of Computer Science, Sichuan University(四川大学计算机学院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟)

AI总结 本文提出一种实时多传感器SLAM框架,结合激光雷达、惯性导航和视觉数据,通过高斯散射实现高精度定位与真实感映射,解决了大规模环境中的实时SLAM挑战。

Comments The manuscript has been improved, with refined content and updated and corrected experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16822 2026-04-22 cs.CV cs.AI

ReefNet: A Large-Scale Dataset and Benchmark for Fine-Grained Coral Reef Recognition

ReefNet:一个大规模数据集和基准,用于细粒度珊瑚礁识别

Abdulwahab Felemban, Yahia Battach, Faizan Farooq Khan, Yuqian Fu, Xuhui Liu, Yesmeen M. Khattab, Yousef A. Radwan, Xiang Li, Fabio Marchese, Sara Beery, Burton H. Jones, Francesca Benzoni, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(国王阿卜杜勒·阿齐兹科技大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

AI总结 本文提出ReefNet,一个大规模珊瑚礁图像数据集,用于细粒度识别。通过专家验证和过滤,构建了高置信度基准子集,揭示了多模态模型在生物多样性监测中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18942 2026-04-22 cs.CL

Disparities In Negation Understanding Across Languages In Vision-Language Models

多语言中否定理解差异在视觉-语言模型中的表现

Charikleia Moraitaki, Sarah Pan, Skyler Pulling, Gwendolyn Flusche, Kumail Alhamoud, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究探讨了视觉-语言模型在不同语言中对否定理解的差异,通过多语言基准测试发现,CLIP在非拉丁文字语言表现不佳,而MultiCLIP在多语言中表现更优,SpaceVLM在部分语言中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21794 2026-04-22 cs.GT cs.AI cs.LG cs.MA econ.TH

Multi-agent Adaptive Mechanism Design

多智能体自适应机制设计

Qiushi Han, David Simchi-Levi, Renfei Tan, Zishuo Zhao

机构 * Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学)

AI总结 本文提出一种自适应机制框架DRAM,通过结合机制设计和在线学习,在未知代理人信念的情况下实现 truthful 报告和成本最优,证明了其在累积遗憾上的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18333 2026-04-22 cs.CR cs.CL

Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption

位置:LLM水印应使所有相关方的利益一致以实现实际应用

Yepeng Liu, Xuandong Zhao, Dawn Song, Gregory W. Wornell, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文探讨了LLM水印技术中利益相关方激励不一致的问题,提出通过设计激励一致的水印方法,如上下文水印,来解决实际应用中的障碍,强调在特定领域内实现可靠工具的重要性。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06211 2026-04-22 cs.CL cs.AI cs.CV

PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts

PuzzleWorld: 一个用于谜题 hunt 中多模态、开放式推理的基准

Hengzhi Li, Justin Zhang, Brendon Jiang, Alexander Naehu, Regan Song, Megan Tjandrasuwita, Chanakya Ekbote, Steven-Shine Chen, Adithya Balachandran, Wei Dai, Rebecca Chang, Paul Pu Liang

机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)

AI总结 PuzzleWorld 是一个包含667个谜题 hunt 风格问题的基准,用于评估逐步、开放式和创造性多模态推理。每个谜题都标注了最终答案、详细推理轨迹和认知技能标签,揭示了当前模型在推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01782 2026-04-22 cs.CV cs.AI

Uncertainty Quantification in Detection Transformers: Object-Level Calibration and Image-Level Reliability

检测变换器中的不确定性量化:对象级校准与图像级可靠性

Young-Jin Park, Carson Sobolewski, Navid Azizan

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文研究检测变换器中预测的可靠性问题,提出对象级校准误差作为评估模型和识别可靠预测子集的新指标。

详情

展开后加载摘要…

URL PDF HTML 收藏