arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2338
2606.16262 2026-06-16 cs.SE cs.AI 新提交

UXBench: Measuring the Actionability of LLM-Generated UX Critiques

UXBench: 衡量LLM生成的UX评论的可操作性

Wenjie Wang, Yue Huang, Zipeng Ling, Han Bao, Hang hua, Xiaonan Luo, Yu Jiang, Shiyi Du, Yuexing Hao, Xiaomin Li, Yuchen Ma, Dianzhuo Wang, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Pennsylvania(宾夕法尼亚大学) University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) LMU Munich(慕尼黑路德维希-马克西米利安大学)

AI总结 提出UXBench基准,通过下游修复代理能否基于评论改进界面来评估LLM作为UX评判者的可操作性,发现不同模型在报告可操作性、修复特征和可靠性上存在显著差异。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16168 2026-06-16 cs.CV 新提交

Fi-Gaussian: Frequency-Aware Implicit Gaussian Splatting for Single Image Dehazing

Fi-Gaussian:面向单图像去雾的频率感知隐式高斯泼溅

Yuhan Chen, Ying Fang, Guofa Li, Wenxuan Yu, Yicui Shi, Kunyang Huang, Wenbo Chu, Keqiang Li

机构 * College of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) National Innovation Center of Intelligent and Connected Vehicles(国家智能网联汽车创新中心) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

AI总结 提出Fi-Gaussian网络,利用频率感知隐式高斯泼溅模块解耦高低频信息并自适应聚合,结合物理散射重归一化机制,实现单图像去雾的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16163 2026-06-16 cs.CV 新提交

Dehaze-GaussianImage: Zero-Shot Dehazing via Efficient 2D Gaussian Splatting Representation

Dehaze-GaussianImage:基于高效2D高斯泼溅表示的零样本去雾

Yuhan Chen, Wenxuan Yu, Guofa Li, Kunyang Huang, Ying Fang, Yicui Shi, Wenbo Chu, Keqiang Li

机构 * College of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) National Innovation Center of Intelligent and Connected Vehicles(国家智能网联汽车创新中心) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

AI总结 提出首个将2D高斯泼溅引入图像去雾的零样本框架,通过重建-解耦学习策略嵌入大气散射模型,实现几何级解耦和清晰纹理重建,以最少参数达到无监督SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16045 2026-06-16 cs.LG cs.DS 新提交

Active Learning with Low-Rank Structure for Data Selection

基于低秩结构的数据选择主动学习

Vincent Cohen-Addad, Sasidhar Kunapuli, Vahab Mirrokni, Mahdi Nikdan, David P. Woodruff, Samson Zhou

机构 * Google Research(谷歌研究院) University of California, Berkeley(加州大学伯克利分校) Institute of Science and Technology Austria (ISTA)(奥地利科学技术研究所) Carnegie Mellon University(卡内基梅隆大学) Texas A&M University(德克萨斯农工大学)

AI总结 提出基于低秩近似和残差采样的数据选择框架,在温和正则条件下选择加权子集,使平均损失近似全数据集平均损失,相对误差(1+ε)加性项εΦ_k,实验优于均匀采样和聚类敏感采样。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16022 2026-06-16 cs.RO 新提交

$λ$-Reachability: Geometric-Horizon Safety Bellman Equations for Humanoid Safety

$λ$-可达性:面向人形机器人安全性的几何视界安全贝尔曼方程

Rui Chen, Shangtao Li, Yifan Sun, Changliu Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

AI总结 提出$λ$-可达性方法,通过几何分布视界和随机吸收终端的随机多步估计,实现高维机器人系统的Hamilton-Jacobi安全性分析,显著提升安全边界分类和裕度估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15815 2026-06-16 cs.CL 新提交

On Defining Erasure Harms for NLP

论NLP中擦除伤害的定义

Yu Lu Liu, Arnav Goel, Jackie Chi Kit Cheung, Alexandra Olteanu, Ziang Xiao, Su Lin Blodgett

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) Mila – Québec Artificial Intelligence Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Canada CIFAR AI Chair, Mila(加拿大CIFAR人工智能主席,Mila)

AI总结 针对NLP系统部署中擦除伤害概念模糊的问题,提出结构化定义,明确建立和测量擦除所需的必要组件,促进跨场景应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15716 2026-06-16 cs.LG 新提交

How to Score Experts for One-Shot MoE Expert Pruning: A Unified Formulation and Selection Principle

如何为一次性MoE专家剪枝评分:统一公式与选择原则

Zongfang Liu, Jinghui Zhang, Zijian Ma, Guangyi Chen, Xin Yuan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一次性MoE专家剪枝的统一公式,基于路由频率、门控权重和激活强度三个因素,推导出任务无关剪枝应使用基于激活的准则,任务特定剪枝可保留路由频率和门控信息,并据此提出两种新准则MAN和MSAN,在多个模型和基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15568 2026-06-16 cs.RO 新提交

SAPS: Shared Autonomy for Policy Steering by Blending Teleoperation with a Pretrained VLA

SAPS: 通过混合遥操作与预训练VLA的策略引导共享自主性

Crystal Zhou, Jehan Yang, Douglas J. Weber, Zackory Erickson

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出SAPS框架,在动作层面混合人类遥操作命令与预训练策略动作,无需重训练或辅助模型,通过动态余弦相似度仲裁策略提升任务成功率高达82%,并减少人工干预。

Comments 23 pages, 15 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15422 2026-06-16 cs.CL q-bio.BM 新提交

Pepti-Agent: An AI Agent for Peptide Design and Optimization

Pepti-Agent: 一种用于肽设计与优化的人工智能代理

Houxu Chen, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Biomedical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(生物医学工程系,卡内基梅隆大学,匹兹堡,PA 15213,美国) Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA 15213,美国)

AI总结 提出Pepti-Agent,一种基于模型上下文协议(MCP)的闭环肽设计框架,通过可独立检查的生成、预测和突变工具,结合大语言模型控制器和实时属性预测,实现多目标优化与可复现基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15162 2026-06-16 cs.CV 新提交

GeoStream: Toward Precise Camera Controlled Streaming Video Generation

GeoStream:迈向精确相机控制的流式视频生成

Yizhou Zhao, Yifan Wang, Xiaoyuan Wang, Yushu Wu, Hao Zhang, Moayed Haji-Ali, Rameen Abdal, Ashkan Mirzaei, Yanyu Li, Willi Menapace, Laszlo Jeni, Sergey Tulyakov, Peter Wonka, Chaoyang Wang

机构 * CMU(卡内基梅隆大学) Northeastern University(东北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Rice University(莱斯大学) Snap Inc.(Snap公司) KAUST(阿卜杜拉国王科技大学)

AI总结 提出GeoStream框架,通过自刷新3D缓存和在线策略蒸馏,实现自回归流式视频生成中的精确度量级相机控制,解决了现有方法在视角移动时控制失效和分布偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15044 2026-06-16 cs.CL 新提交

Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models

公平与效率:多语言大语言模型分词器的实证研究

Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学) Carnegie Mellon University(卡内基梅隆大学) SAP

AI总结 本文系统比较了11种东南亚语言上的公平分词器,发现Parity-aware BPE在效率与公平的权衡中处于帕累托前沿,而Morphology-Driven Byte Encoding在语义推理上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14981 2026-06-16 cs.RO cs.AI cs.LG 新提交

Inference-time Policy Steering via Vision and Touch

通过视觉和触觉进行推理时策略引导

Yilin Wu, Zilin Si, Zeynep Temel, Oliver Kroemer, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出ViTaL框架,通过视觉采样验证和触觉引导扩散编辑的双层优化,在推理时引导机器人策略,显著提升接触丰富操作任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14095 2026-06-16 cs.LG math.OC math.PR stat.ML 新提交

Lyapunov-Based Sample Complexity Analysis for Weakly-Coupled MDPs

基于Lyapunov的弱耦合MDP样本复杂度分析

Tianhao Wu, Matthew Zurek, Weina Wang, Qiaomin Xie

机构 * Department of Industrial and Systems Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校工业与系统工程系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Computer Science Department, Carnegie Mellon University(卡内基梅隆大学计算机科学系)

AI总结 针对平均奖励弱耦合MDP和Restless Bandits,提出基于Lyapunov的分析框架,实现样本和计算复杂度关于臂数N的多项式级界限,并给出首个有限样本PAC保证。

Comments Accepted for presentation at the Conference on Learning Theory (COLT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13608 2026-06-16 cs.AI cs.LG 新提交

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化

Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Purdue University(普渡大学) University of Ljubljana(卢布尔雅那大学) University of Washington(华盛顿大学) Oasis Labs University of Maryland(马里兰大学) IBM Research(IBM研究院) Mila McGill University(麦吉尔大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学) National Institute of Standards and Technology(美国国家标准与技术研究院) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

AI总结 提出代理化智能体评估(AAA)框架,通过标准化协议(A2A和MCP)统一评估接口,实现开放、可复现的多智能体评估,并基于AgentBeats系统通过大规模竞赛和案例研究验证其覆盖性、实用性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12688 2026-06-16 cs.LG cs.AI cs.DC 新提交

M*: A Modular, Extensible, Serving System for Multimodal Models

M*: 一个模块化、可扩展的多模态模型服务系统

Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出M*系统,通过将模型表示为数据流图并引入Walk Graph抽象,支持多模态复合模型的高效服务,在多个任务上降低延迟并提升吞吐量。

Comments The codebase is available at https://github.com/mstar-project/mstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09329 2026-06-16 cs.LG 版本更新

MacrOData: New Benchmarks of Thousands of Datasets for Tabular Outlier Detection

MacrOData:用于表格异常检测的数千个数据集的新基准

Xueying Ding, Simon Klüttermann, Haomin Wen, Yilong Chen, Leman Akoglu

机构 * Carnegie Mellon University(卡内基梅隆大学) Technical University of Dortmund(多特蒙德技术大学)

AI总结 提出大规模表格异常检测基准MacrOData,包含2446个数据集,覆盖真实与合成异常,支持全面鲁棒的评估。

Comments 29 pages, KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12670 2026-06-16 cs.AI 版本更新

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

SkillsBench: 基准测试智能体技能在不同任务中的有效性

Xiangyi Li, Yimin Liu, Wenbo Chen, Bingran You, Zonglin Di, Yifeng He, Shenghan Zheng, Kyoung Whan Choe, Jiankai Sun, Shuyi Wang, Chujun Tao, Binxu Li, Xuandong Zhao, Hejia Geng, Xiaojun Wu, Junwei Zhou, Xiaokun Chen, Hanwen Xing, Yubo Li, Qunhong Zeng, Di Wang, Yuanli Wang, Roey Ben Chaim, Penghao Jiang, Haotian Shen, Luyang Kong, Xinyi Liu, Runhui Wang, Xuanqing Liu, Jiachen Li, Xin Lan, Yueqian Lin, Wengao Ye, Junwei He, Songlin Li, Yue Zhang, Yipeng Gao, Yijiang Li, Ze Ma, Liqiang Jing, Tianyu Wang, Kaixin Li, Yiqi Xue, Haoran Lyu, Yizhuo He, Yuchen Tian, Shutong Wu, Bowei Wang, Yixuan Gao, Bo Chen, Litong Liu, Sikai Cheng, Jiajun Bao, Shuaicheng Tong, Shuwen Xu, Terry Yue Zhuo, Tinghan Ye, Qi Qi, Miao Li, Longtai Liao, Zelin Tan, Chang Shi, Xilin Tang, Srinath Tankasala, Boqin Yuan, Yaoyao Qian, Jianhong Tu, Chenguang Wang, Yizhou Sun, Wei Wang, Aaron Taylor, Ziyue Yang, Changkun Guan, Zhikang Dong, Xinyu Zhang, Steven Dillmann, Han-chung Lee, Dawn Song

机构 * BenchFlow OSU Amazon UC Berkeley UC Santa Cruz UC Davis Dartmouth RLWRLD Independent Princeton University Oxford University Stanford University USC CMU Foxconn Zenity UNSW UT Austin MSU Duke University ByteDance UT Dallas UC San Diego Columbia University University of Rochester Cornell Tech Georgia Tech Cornell University NEU UCLA Snap Inc. Fanshawe College University of Science and Technology of China HKUST(GZ) Anyscale

AI总结 提出SkillsBench基准,包含8领域87个任务,通过配对评估证明技能提升平均通过率16.6个百分点,小模型配备技能可匹敌大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20668 2026-06-16 cs.RO cs.LG 版本更新

DemoDiffusion: One-Shot Human Imitation using pre-trained Diffusion Policy

DemoDiffusion: 使用预训练扩散策略的一次性人类模仿

Sungjae Park, Homanga Bharadhwaj, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出DemoDiffusion方法,通过单次人类演示和预训练扩散策略,无需任务特定训练即可使机器人执行操作任务,在8项任务中平均成功率达83.8%。

Comments 11 pages. Published at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22777 2026-06-16 cs.CL 版本更新

RASST: Retrieval-Augmented Simultaneous Speech Translation

RASST:检索增强的同声传译

Jiaxuan Luo, Siqi Ouyang, Jiaxing Xu, Lei Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对同声传译中罕见术语翻译不准的问题,提出检索增强方法RASST,通过轻量级语音-文本检索器提供分块术语提示,并合成训练数据教会模型何时应用检索术语,在ACL 60/60和ESO测试集上术语准确率提升近40%,BLEU提升最多3点。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24987 2026-06-16 q-bio.QM cs.LG q-bio.GN

scMRDR: A scalable and flexible framework for unpaired single-cell multi-omics data integration

scMRDR:一种可扩展且灵活的无配对单细胞多组学数据整合框架

Jianle Sun, Chaoqi Liang, Ran Wei, Peng Zheng, Lei Bai, Wanli Ouyang, Hongliang Yan, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) Guangzhou Laboratory(广州实验室)

AI总结 scMRDR通过β-VAE架构解耦细胞潜在表示,结合等距正则化、对抗目标和掩码重建损失,实现无配对多组学数据整合,有效提升大规模数据处理能力。

Comments Accepted at NeurIPS 2025 (Spotlight)

Journal ref Advances in Neural Information Processing Systems 38 (2025): 154538-154565

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22827 2026-06-16 cs.SE cs.AI 版本更新

FasterPy: An LLM-based Code Execution Efficiency Optimization Framework

FasterPy:基于大语言模型的代码执行效率优化框架

Yue Wu, Minghao Han, Ruiyin Li, Peng Liang, Amjed Tahir, Zengyang Li, Qiong Feng, Mojtaba Shahin

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) School of Computer Science, Central China Normal University(中央中国师范大学计算机学院) School of Computer Science, Nanjing University of Science and Technology(南京理工大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

AI总结 提出FasterPy框架,结合检索增强生成(RAG)和低秩适应(LoRA)技术,利用大语言模型自动优化Python代码执行效率,在PIE基准上超越现有方法。

Comments 38 pages, 5 images, 14 tables, Manuscript revision submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22888 2026-06-16 cs.AI cs.CL 版本更新

JE-IRT: A Geometric Lens on LLM Abilities through Joint Embedding Item Response Theory

JE-IRT: 通过联合嵌入项目反应理论审视LLM能力的几何视角

Louie Hong Yao, Nicholas Jarvis, Tiffany Zhan, Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang

机构 * Independent Researcher(独立研究者) University of Cincinnati(辛辛那提大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出JE-IRT几何框架,将LLM和问题嵌入共享空间,通过方向编码语义、范数编码难度,揭示主题专长和分布外行为,支持新模型高效扩展,并发现与人类分类部分对齐的内部结构。

Comments 35 pages, 17 figures, 9 tables, accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14658 2026-06-15 cs.CV cs.AI 新提交

Giving AI a Headache: Acoustic Adversarial Attacks to Computer Vision Applications

给AI带来头痛:针对计算机视觉应用的声学对抗攻击

Nicole Villavicencio-Garduño, Maksim Ekin Eren, Milo Prisbrey, Ben Migliori, Michael Teti

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究利用低频声波(<20 kHz)引起相机物理振动,导致AI视觉模型(如YOLO11)误分类、漏检或产生幻觉,并分析了影响攻击效果的因素。

Comments 9 pages, 7 figures, SPIE Defense + Security

Journal ref Proc. SPIE 14046, Assurance and Security for AI-enabled Systems 2026, 1404609 (10 Jun 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14626 2026-06-15 cs.CL 新提交

Characterizing Cultural Localization in AI-Generated Stories

表征AI生成故事中的文化本地化

Shaily Bhatt, Supriti Vijay, Jeremiah Milbauer, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种方法,通过识别区分国籍的词汇标记并移除后测量叙事相似性,检测AI生成故事中的模板化本地化,发现仅9-17%词汇解释国籍差异,且部分文化标记具有冒犯性。

Comments Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) Co-located with ACL 2026, San Diego, USA (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14199 2026-06-15 cs.CL cs.AI cs.LG 新提交

OdysSim: Building Foundation Models for Human Behavior Simulation

OdysSim: 构建人类行为模拟的基础模型

Xuhui Zhou, Weiwei Sun, Weihua Du, Jiarui Liu, Haojia Sun, Qianou Ma, Tongshuang Wu, Yiming Yang, Maarten Sap

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

AI总结 提出OdysSim,通过SOUL分类法统一62个数据集和23个基准任务,采用混合训练、任务特定强化学习和专家蒸馏,构建8B参数行为基础模型OSim,在多数任务上超越前沿模型,并实现更类人输出和零样本迁移。

Comments 34 pages. Code: https://github.com/sunnweiwei/OdysSim ; Models and data: https://huggingface.co/collections/cmu-lti/odyssim

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14010 2026-06-15 cs.CV cs.LG cs.RO 新提交

RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation

RT-VLA:通过知识蒸馏实现实时视觉-语言-动作模型

Xiangyu Huang, Zhenlin Hua, Han Zhou, Shounak Sural, Ragunathan Rajkumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出RT-VLA,通过多级监督蒸馏将SimLingo模型的能力压缩至轻量学生模型,在保持竞争性能的同时将推理时间降低44.8倍(纯视觉模式)和7.9倍(视觉+语言模式),实现实时可解释的VLA自动驾驶。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13994 2026-06-15 cs.CR cs.AI cs.LG 新提交

Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH

隐于无形:使用DECOMPBENCH基准测试代理安全对抗分解攻击

Vikhyath Kothamasu, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

AI总结 提出DeCompBench基准,通过分解攻击将有害任务拆分为良性子任务,揭示现有代理安全机制在对抗分解攻击时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13931 2026-06-15 cs.CL 新提交

DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

DLawBench: 通过多轮法律咨询评估大语言模型

Li Zhang, Yuzhen Shi, Yiran Hu, Jingwen Zhang, Wenbo Lv, Yubo Ma, Wei Wang, Rongyao Shi, Yuanyang Qiu, Xinran Xu, Yuemeng Qi, Linlin Miao, Jaromir Savelka, Yun Liu, Kevin Ashley, Bing Zhao, Hu Wei, Lin Qu

机构 * University of Pittsburgh(匹兹堡大学) Alibaba Group(阿里巴巴集团) University of Waterloo(滑铁卢大学) Shandong University(山东大学) Skylenage China University of Political Science and Law(中国政法大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队) Fordham University(福特汉姆大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

AI总结 提出DLawBench基准,通过模拟四种客户类型(合作、依赖、退缩、对抗)的多轮对话,评估大语言模型在真实法律咨询中的交互能力。

Comments 37 pages, 8 figures, 26 tables. Code and data: https://github.com/SKYLENAGE-AI/DLawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13892 2026-06-15 cs.CR cs.AI 新提交

Crypto x AI, AI x Crypto: A Survey

Crypto x AI, AI x Crypto: 综述

Sarah Allen, Pranay Anchuri, James Austgen, Maryam Bahrani, Samuel Breckenridge, Aaron Buchwald, Christian Cachin, Andrés Fábrega, Jared Fernandez, James Hsin-yu Chiang, Marwa Mouallem, Roi Bar-Zur, Neil DeSilva, Ittay Eyal, Giulia Fanti, Ari Juels, Andrew Miller, Christian Sillaber, Dani Vilardell, Pramod Viswanath, Wenhao Wang, Matt Weinberg, Sen Yang, Jianzhu Yao, Fan Zhang

机构 * Initiative for CryptoCurrencies and Contracts (IC3)(加密货币与合同倡议(IC3)) Ava Labs(Ava实验室) Carnegie Mellon University(卡内基梅隆大学) Cornell Tech(康奈尔科技) Flashbots Offchain Labs(离链实验室) Ritual Labs(仪式实验室) Technion(技术学院) University of Bern(伯恩大学) Princeton University(普林斯顿大学) ETH Zurich(苏黎世联邦理工学院) Teleport(Teleport;Flashbots(X)) Flashbots(X)(特拉维夫大学) Tel Aviv University

AI总结 本综述系统梳理了AI与区块链(crypto)的交叉研究,总结了现有工作、关键发现、开放问题及行业误解,指出两者仍处于早期融合阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21363 2026-06-15 cs.CL 版本更新

"I Didn't Make the Micro Decisions": Measuring, Inducing, and Exposing Goal-Level AI Contributions in Collaboration

我没有做出微决策:在协作中测量、诱导和暴露目标级AI贡献

Eunsu Kim, Jessica R. Mindel, Kyungjin Kim, Sherry Tongshuang Wu

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) Seoul National University(首尔国立大学)

AI总结 本文提出CoTrace框架,用于测量和暴露协作中目标级AI贡献,发现模型在目标塑造中贡献有限,但在引入具体要求和间接影响方面作用显著,且交互设计影响模型行为。

详情

展开后加载摘要…

URL PDF HTML 收藏