arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-05-05 至 2026-05-05 共收录 9
2605.01662 2026-05-05 cs.CV

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

视频主动感知:基于视觉-语言模型的高效推理时长视频理解

Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。

Comments ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01657 2026-05-05 cs.CV

Act2See: Emergent Active Visual Perception for Video Reasoning

Act2See:面向视频推理的涌现式主动视觉感知

Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

AI总结 本文提出Act2See框架,通过使VLMs在文本推理中主动交错视频帧,实现视频推理中的主动视觉感知,提升了推理质量并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01104 2026-05-05 cs.SE cs.CL cs.HC

RECAP: An End-to-End Platform for Capturing, Replaying, and Analyzing AI-Assisted Programming Interactions

RECAP:一个端到端的平台,用于捕捉、回放和分析AI辅助编程交互

Keyu He, Qianou Ma, Valerie Chen, Wayne Chi, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 RECAP通过记录和回放开发者与AI编程助手的交互,分析其行为模式和策略演变,为软件工程教育提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01069 2026-05-05 cs.RO

Online Safety Filter for Deformable Object Manipulation with Horizon Agnostic Neural Operators

面向可变形物体操作的在线安全过滤器:无时间 horizon 神经算子

Jiaxing Li, Hanjiang Hu, Zhuoyuan Wang, Yorie Nakahira, Changliu Liu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种基于约束的在线安全过滤器,通过最小修改控制策略,实时强制任务级安全约束,结合无时间 horizon 神经算子和边界控制屏障函数,提升柔体操作的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00977 2026-05-05 cs.CV cs.AI cs.CL

Democratizing the medieval English legal tradition

让中世纪英国法律传统民主化

Michael Zhang, Elise Wang, Charlotte Whatley, Seth Strickland, Dylan Bannon

机构 * University of Chicago(芝加哥大学) California State University(加州州立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Unaffiliated(无隶属机构)

AI总结 本文通过构建包含193个中世纪案件的文本数据集,训练端到端转录管道,利用神经网络和后处理技术提升手写文本识别准确率,最终展示TrOCR与CNN+LSTM的性能对比。

Comments Submitted to International Conference on Document Analysis and Recognition (ICDAR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12964 2026-05-05 cs.CV

Cross-Scale Pretraining: Enhancing Self-Supervised Learning for Low-Resolution Satellite Imagery for Semantic Segmentation

跨尺度预训练:增强低分辨率卫星图像的自监督学习以用于语义分割

John Waithaka, Gustave Bwirayesu, Moise Busogi

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

AI总结 本文提出跨尺度预训练方法,利用高分辨率数据提升低分辨率图像的表示学习和分割性能,通过设计空间亲和组件改进自监督学习框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02439 2026-05-05 cs.LG cs.CV

WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks

WebGym: 通过现实任务扩大视觉网络代理的训练环境

Hao Bai, Alexey Taymanov, Tong Zhang, Aviral Kumar, Spencer Whitehead

机构 * Microsoft(微软) UIUC(伊利诺伊大学香槟分校) CMU(卡内基梅隆大学)

AI总结 WebGym通过大规模现实任务和异步轨迹采样系统提升视觉网络代理训练效果,使基座模型在分布外测试集上的成功率显著提升。

Comments Completed acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10580 2026-05-05 cs.RO

From Fold to Function: Simulation-Driven Design of Origami Mechanisms

从折叠到功能:基于仿真的折纸机制设计

Tianhui Han, Shashwat Singh, Sarvesh Patil, Zeynep Temel

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出一种基于仿真的折纸机制设计框架,利用MuJoCo的可变形体能力,通过直观的图形用户界面实现折纸结构的仿真与优化,验证了其在折纸弹射装置中的应用效果。

Comments IEEE RoboSoft 2026 (8 Pages, 9 Figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00204 2026-05-05 cs.LG cs.GT

Nearly-Optimal Bandit Learning in Stackelberg Games with Side Information

在有侧信息的Stackelberg博弈中近最优的探索学习

Maria-Florina Balcan, Martino Bernasconi, Matteo Castiglioni, Andrea Celli, Keegan Harris, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Bocconi University(博科尼大学) Politecnico di Milano(米兰理工学院) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文研究了在有侧信息的Stackelberg博弈中在线学习问题,提出算法在Bandit反馈下达到O(T^{1/2})的 regret,优于之前的O(T^{2/3})。方法通过将问题转化为效用空间的线性上下文带宽问题,扩展到未知效用函数和拍卖、贝叶斯说服等场景。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏