arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2342
2602.15031 2026-04-02 cs.CV

EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing

EditCtrl: 解耦的局部和全局控制用于实时生成视频编辑

Yehonathan Litman, Shikun Liu, Dario Seyb, Nicholas Milef, Yang Zhou, Carl Marshall, Shubham Tulsiani, Caleb Leak

机构 * Meta Reality Labs(Meta现实实验室) Carnegie Mellon University(卡内基梅隆大学) Meta AI

AI总结 本文提出EditCtrl,通过局部和全局控制模块实现高效视频修复,提升编辑质量和计算效率,支持多区域编辑和内容传播。

Comments Project page: https://yehonathanlitman.github.io/edit_ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08225 2026-04-02 cs.CL cs.AI cs.CY cs.HC

Benchmarking Educational LLMs with Analytics: A Case Study on Gender Bias in Feedback

用分析方法评估教育LLM:关于反馈中性别偏见的案例研究

Yishan Du, Conrad Borchers, Mutlu Cukurova

机构 * University College London, UCL Knowledge Lab(伦敦大学学院,UCL知识实验室) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过600篇真实学生作文,利用嵌入式基准框架检测LLM在形成性反馈中的偏见,发现隐性性别提示比显性提示更易引发语义偏移,揭示了LLM在反馈中持续存在的性别偏见。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00120 2026-04-02 cs.SE cs.AI

From Domain Understanding to Design Readiness: a playbook for GenAI-supported learning in Software Engineering

从领域理解到设计准备:一种支持生成式AI学习的软件工程教学指南

Rafal Wlodarski

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文探讨了利用生成式AI辅助学习在软件工程领域理解与建模方法中的应用,通过实验发现AI tutor在准确性与相关性方面表现优异,但支持性不足,提出17项教学实践以优化AI辅助学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00055 2026-04-02 cs.RO cs.CV cs.LG

Generalizable Dense Reward for Long-Horizon Robotic Tasks

可泛化的密集奖励用于长周期机器人任务

Silong Yong, Stephen Sheng, Carl Qi, Xiaojie Wang, Evan Sheehan, Anurag Shivaprasad, Yaqi Xie, Katia Sycara, Yesh Dattatreya

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Robotics(亚马逊机器人) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出VLLR框架,结合外部奖励和内部奖励提升长周期机器人任务性能,通过任务分解和自信心引导实现无需人工奖励工程的高效训练。

Comments Project page: https://silongyong.github.io/vllr_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18807 2026-04-02 cs.HC cs.AI cs.CY

Chat-Based Support Alone May Not Be Enough: Comparing Conversational and Embedded LLM Feedback for Mathematical Proof Learning

基于对话的支持可能并不足够:比较对话式和嵌入式LLM反馈在数学证明学习中的比较

Eason Chen, Sophia Judicke, Kayla Beigh, Xinyi Tang, Isabel Wang, Nina Yuan, Zimo Xiao, Chuangji Li, Shizhuo Li, Reed Luttmer, Shreya Singh, Maria Yampolsky, Naman Parikh, Yvonne Zhao, Meiyi Chen, Scarlett Huang, Anishka Mohanty, Gregory Johnson, John Mackey, Jionghao Lin, Ken Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

AI总结 研究评估了GPTutor系统对大学离散数学课程的影响,发现对话式反馈单独使用可能无法有效提升考试成绩,而嵌入式反馈与学习表现相关性较低。

Comments 9 pages, 4 figures. Accepted at AIED 2026. Camera-ready version with updated references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30002 2026-04-01 cs.LG cs.CL

Tracking Equivalent Mechanistic Interpretations Across Neural Networks

在神经网络中跨机制解释的等价性追踪

Alan Sun, Mariya Toneva

机构 * Carnegie Mellon University(卡内基梅隆大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

AI总结 本文提出通过机制等价性确定不同模型是否共享共同解释,发展算法并分析Transformer模型,为MI评估和自动解释发现提供基础。

Comments 32 pages, 5 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29950 2026-04-01 cs.AI cs.CL

Physiological and Semantic Patterns in Medical Teams Using an Intelligent Tutoring System

医疗团队中的生理与语义模式:基于智能教学系统

Xiaoshan Huang, Conrad Borchers, Jiayi Zhang, Susanne P. Lajoie

机构 * McGill University(麦吉尔大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 研究通过智能教学系统分析医疗团队在诊断虚拟患者时的生理和对话动态,发现语义变化与生理同步峰值相关,且高生理同步伴随低语义相似性,揭示了团队协作中的关键时刻。

Comments Accepted as short paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28021 2026-04-01 cs.SD

Audio Language Model for Deepfake Detection Grounded in Acoustic Chain-of-Thought

基于声学推理的深度伪造检测音频语言模型

Runkun Chen, Yixiong Fang, Pengyu Chang, Yuante Li, Massa Baali, Bhiksha Raj

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)

AI总结 本文提出CoLMbo-DF,通过整合深度伪造检测与显式的声学推理,利用结构化文本表示提升检测准确性,实验表明其在解释性深度伪造语音检测中取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06968 2026-04-01 cs.CL cs.LO

A dependently-typed calculus of event telicity and culminativity

一种具有依赖类型的事件终态与终极性的演算

Pavel Kovalev, Carlo Angiuli

机构 * Department of Mathematical Sciences, Carnegie Mellon University(卡内基梅隆大学数学科学系) Department of Computer Science, Indiana University(印第安纳大学计算机科学系)

AI总结 本文提出一种具有依赖类型的跨语言框架,用于分析事件的终态与终极性,结合实例展示如何用该框架建模英语句子。框架分为名词域和动词域,分别处理名词短语的界限性及其与子类型、限定量词和形容词修饰的关系,以及定义依赖事件演算,区分终态事件和终极事件,并考虑副词修饰。

Comments 54 pages, to appear in Mathematical Structures in Computer Science, Agda formalization available at https://doi.org/10.5281/zenodo.15602617

Journal ref Math. Struct. Comp. Sci. 36 (2026) e9

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29094 2026-04-01 cs.HC cs.AI

Evaluating a Data-Driven Redesign Process for Intelligent Tutoring Systems

评估面向智能教学系统的数据驱动重设计过程

Qianru Lyu, Conrad Borchers, Meng Xia, Karen Xiao, Paulo F. Carvalho, Kenneth R. Koedinger, Vincent Aleven

机构 * Carnegie Mellon University(卡内基梅隆大学) Texas A&M University(德克萨斯农工大学) Wellesley College(韦尔斯利学院)

AI总结 本研究测试了数据驱动重设计方法在非预期改进的中学数学教学单元中的有效性,发现重设计系统在任务时间、技能练习和知识掌握方面表现更优。

Comments Accepted as short paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28952 2026-04-01 cs.RO

World2Rules: A Neuro-Symbolic Framework for Learning World-Governing Safety Rules for Aviation

World2Rules: 一种用于航空领域学习世界治理安全规则的神经符号框架

Haichuan Wang, Jay Patrikar, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 World2Rules通过结合神经网络和符号方法,从航空多模态数据中学习安全规则,提升规则的准确性和可解释性,实验显示其在F1得分上优于纯神经和单步神经符号基线。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28522 2026-04-01 cs.RO cs.AI cs.CV cs.LG

RAD-LAD: Rule and Language Grounded Autonomous Driving in Real-Time

基于规则和语言的实时自动驾驶:RAD-LAD

Anurag Ghosh, Srinivasa Narasimhan, Manmohan Chandraker, Francesco Pittaluga

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

AI总结 本文提出RAD-LAD,结合规则和语言的实时自动驾驶系统,通过中断架构实现高效路径规划与文本推理,提升自动驾驶性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10938 2026-04-01 cs.LG cs.AI cs.CL cs.CV

Stronger Normalization-Free Transformers

更强的无归一化变换器

Mingzhi Chen, Taiming Lu, Jiachen Zhu, Mingjie Sun, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Derf函数,通过大规模搜索找到更有效的归一化替代方案,其在视觉识别、语音表示和DNA序列建模中均优于LayerNorm、RMSNorm和DyT。

Comments Published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10388 2026-04-01 cs.CV

VT-Intrinsic: Physics-Based Decomposition of Reflectance and Shading using a Single Visible-Thermal Image Pair

VT-Intrinsic: 基于物理的单可见-热图像对的反光与阴影分解

Zeqing Yuan, Mani Ramanagopal, Aswin C. Sankaranarayanan, Srinivasa G. Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种基于物理的单可见-热图像对的反光与阴影分解方法,通过利用热成像仪检测吸收的热量来关联可见和热图像的强度顺序,实现反光和阴影的自监督恢复。

Comments Accepted by CVPR 2026. Project webpage: https://vt-intrinsic.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28718 2026-03-31 cs.LG cs.AI cs.CV

Stepwise Credit Assignment for GRPO on Flow-Matching Models

分步信用分配用于流匹配模型中的GRPO

Yash Savani, Branislav Kveton, Yuchen Liu, Yilin Wang, Jing Shi, Subhojyoti Mukherjee, Nikos Vlassis, Krishna Kumar Singh

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究院)

AI总结 本文提出分步流GRPO,通过分步奖励改进提升样本效率和收敛速度,引入DDIM启发的SDE提升奖励质量。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026 Project page: https://stepwiseflowgrpo.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07732 2026-03-31 cs.RO cs.AI cs.CL cs.CV cs.LG

ViPRA: Video Prediction for Robot Actions

ViPRA:用于机器人动作的视频预测

Sandeep Routray, Hengkai Pan, Unnat Jain, Shikhar Bahl, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Skild AI University of California, Irvine(加州大学尔湾分校)

AI总结 ViPRA通过预训练和微调框架,从无标注视频中学习连续机器人控制,利用视频语言模型预测视觉观察和运动中心潜在动作,支持跨机器人形态的泛化和高频率连续控制。

Comments In ICLR 2026. Website: https://vipra-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28135 2026-03-31 cs.AI

CoT2-Meta: Budgeted Metacognitive Control for Test-Time Reasoning

CoT2-Meta:预算化的元认知控制用于测试时推理

Siyuan Ma, Bo Gao, Zikai Xiao, Hailong Wang, Xinlei Yu, Rui Qian, Jiayu Qian, Luqi Gong, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Sun Yat-Sen University(中山大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Zhejiang Lab(之江实验室)

AI总结 CoT2-Meta通过元认知控制优化测试时推理,提升多个基准测试的性能,包括MATH、GSM8K等,相比基线方法有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28079 2026-03-31 cs.RO

Control Without Control: Defining Implicit Interaction Paradigms for Autonomous Assistive Robots

无需控制:为自主助行机器人定义隐式交互范式

Janavi Gupta, Kavya Puthuveetil, Dimitra Tsakona, Akhil Padmanabha, Yiannis Demiris, Zackory Erickson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Imperial College London(伦敦帝国理工学院)

AI总结 本文探讨隐式控制范式,通过两个设计案例展示如何通过自然行为线索调整机器人行为,减少用户感知负荷并保持控制感,提出隐式交互设计指南。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28038 2026-03-31 cs.AI cs.LG

Beyond the Answer: Decoding the Behavior of LLMs as Scientific Reasoners

超越答案:解码LLM作为科学推理者的行为

Rohan Pandey, Eric Ye, Michael Li

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过定制遗传Pareto算法优化提示,研究提示对科学推理行为的影响,揭示模型特定的局部逻辑,并探讨其可迁移性和脆弱性。

Comments Accepted at the Post-AGI Science and Society Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27806 2026-03-31 cs.CL cs.CY

Understanding Teacher Revisions of Large Language Model-Generated Feedback

理解大型语言模型生成反馈的教师修订

Conrad Borchers, Luiz Rodrigues, Newarney Torrezão da Costa, Cleon Xavier, Rafael Ferreira Mello

机构 * Carnegie Mellon University(卡内基梅隆大学) Federal Technological University of Paraná – UTFPR(巴拉那联邦理工大学) Instituto Federal Goiano – IF Goiano(戈亚斯联邦学院) Federal Rural University of Pernambuco – UFRPE(伯南布哥联邦农村大学)

AI总结 研究探讨教师如何修订AI生成的反馈,发现80%的反馈未修改,编辑反馈通常更长且被缩短,机器学习模型能预测修订决策,修订常简化反馈内容,使其更简洁纠正性。

Comments Accepted as full paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22601 2026-03-31 cs.LG cs.CV

$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models

$ϕ$-DPO:面向大多模态模型持续学习的公平性直接偏好优化方法

Thanh-Dat Truong, Huu-Thien Tran, Jackson Cothren, Bhiksha Raj, Khoa Luu

机构 * CVIU Lab, University of Arkansas(阿肯色大学 CVIU 实验室) Dep. of Geosciences, University of Arkansas(阿肯色大学地球科学系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出$ϕ$-DPO框架,通过直接偏好优化缓解持续学习中的灾难性遗忘问题,并解决数据不平衡导致的公平性问题,实验表明其在多个基准上表现优异。

Comments Accepted to CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19413 2026-03-31 cs.LG cs.AI cs.CV

UniGame: Turning a Unified Multimodal Model Into Its Own Adversary

UniGame: 将统一多模态模型转变为自身对手

Zhaolong Su, Wang Lu, Hao Chen, Sharon Li, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Independent(独立研究者) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 UniGame通过自对抗框架提升多模态模型的一致性与鲁棒性,显著增强理解、生成和对抗鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18174 2026-03-31 cs.CV

Unified Spherical Frontend: Learning Rotation-Equivariant Representations of Spherical Images from Any Camera

统一球面前端:从任何相机学习旋转等变的球面图像表示

Mukai Yu, Mosam Dabhi, Liuyue Xie, Sebastian Scherer, László A. Jeni

机构 * Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所)

AI总结 本文提出USF框架,通过射线方向对应将任意相机图像映射到单位球面,实现旋转等变的球面卷积,提升宽视场图像处理性能。

Comments Accepted to CVPR 2026. Camera-ready version. Added computation benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13044 2026-03-31 cs.CV cs.AI

SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion

SceneAdapt: 人类运动扩散的场景感知适应

Jungbin Cho, Minsu Kim, Jisoo Kim, Ce Zheng, Laszlo A. Jeni, Ming-Hsuan Yang, Youngjae Yu, Seonjoo Kim

机构 * Yonsei University(延世大学) Carnegie Mellon University(卡内基梅隆大学) UC Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind) Seoul National University(首尔国立大学)

AI总结 本文提出SceneAdapt框架,通过运动插值和场景感知插值生成语义丰富的场景感知人类运动,无需大规模配对文本-场景-运动数据。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11334 2026-03-31 cs.CV

Dual Band Thermal Videography: Separating Time-Varying Reflection and Emission Near Ambient Conditions

双频热成像:在近环境条件下分离时间变化的反射和发射

Sriram Narayanan, Mani Ramanagopal, Srinivasa G. Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出双频热成像方法,通过光谱和时间线索分离近环境条件下物体和背景的温度,解决热成像中反射和发射信号分离难题。

Comments CVPR 2026. Project Page: https://dual-band-thermal.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05689 2026-03-31 cs.LG math.OC math.PR

Unichain and Aperiodicity are Sufficient for Asymptotic Optimality of Average-Reward Restless Bandits

Unichain 和 非周期性是平均奖励疲软带机问题渐进最优性的充分条件

Yige Hong, Qiaomin Xie, Yudong Chen, Weina Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出了一种新政策,通过逐步将更多臂推向最优分布,证明在Unichain和非周期性假设下,该政策具有O(1/√N)的渐进最优性。

Comments 68 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27725 2026-03-31 cs.RO

TerraSkipper: A Centimeter-Scale Robot for Multi-Terrain Skipping and Crawling

TerraSkipper: 一种用于多地形跳跃和爬行的厘米级机器人

Shashwat Singh, Sheri Zhang, Spencer Matonis, Zeynep Temel

机构 * Carnegie Mellon University(卡内基梅隆大学) Edulis Therapeutics

AI总结 受泥蛙启发,设计了一种厘米级多地形跳跃和爬行机器人,通过侧鳍和旋转弹簧尾实现多种地形移动,实验表明跳跃在黏性及颗粒介质中速度更优。

Comments 8 pages, 9 figures, Accepted - IEEE International Conference on Robotics & Automation (ICRA), Vienna, Austria, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27693 2026-03-31 cs.CV cs.AI cs.LG cs.MA cs.MM

LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation

LVRPO:基于GRPO的语言-视觉对齐用于多模态理解和生成

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系,美国) Department of Machine Learning, MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学机器学习系,阿联酋) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(汉阳大学ERICA校区人工智能系,韩国)

AI总结 本文提出LVRPO框架,通过GRPO显式对齐语言和视觉表示,提升多模态理解和生成性能,无需辅助编码器或人工目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27651 2026-03-31 cs.CL

Budget-Xfer: Budget-Constrained Source Language Selection for Cross-Lingual Transfer to African Languages

Budget-Xfer: 为非洲语言的跨语言迁移进行预算约束的源语言选择

Tewodros Kederalah Idris, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲校区) North-West University(西北大学)

AI总结 本文提出Budget-Xfer框架,通过预算约束资源分配问题优化多源跨语言迁移,验证多源迁移在命名实体识别和情感分析中的优越性,揭示嵌入相似性在不同任务中的表现差异。

Comments 5 pages, 5 tables. Submitted to SIGIR 2026 Short Paper track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27520 2026-03-31 cs.CV

TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets

TokenDial: 通过时空token偏移实现文本到视频的连续属性控制

Zhixuan Liu, Peter Schaldenbrand, Yijun Li, Long Mai, Aniruddha Mahapatra, Cusuh Ham, Jean Oh, Jui-Hsien Wang

机构 * Adobe Research(Adobe研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 TokenDial通过在中间时空视觉patch-token空间中添加偏移实现文本到视频生成模型的连续属性控制,通过调整偏移量实现外观和运动动态的可预测编辑,优于现有基线。

Comments Project page: https://tokendial.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏