iOSWorld: A Benchmark for Personally Intelligent Phone Agents
iOSWorld:个人智能手机代理的基准测试
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出首个基于持久用户身份的交互式原生iOS模拟器基准iOSWorld,包含26个新应用和133个任务,评估代理在单应用、多应用及记忆个性化任务上的表现,最佳配置整体准确率52%,多应用任务仅37%。
高校专区
iOSWorld:个人智能手机代理的基准测试
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出首个基于持久用户身份的交互式原生iOS模拟器基准iOSWorld,包含26个新应用和133个任务,评估代理在单应用、多应用及记忆个性化任务上的表现,最佳配置整体准确率52%,多应用任务仅37%。
(自动)形式化应该很简单:用于详细阐述严格证明的Trellis过程语义
机构 * Department of Mathematical Sciences, Carnegie Mellon University(卡内基梅隆大学数学科学系)
AI总结 提出Trellis系统,通过确定性约束工作流和LLM代理迭代细化自然语言证明,实现Lean自动形式化,强调严格证明的可细化性。
Comments 15 pages, 7 figures, 5 tables
通过对抗性黑客-修复者循环强化智能体基准测试
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Fewshot Corp(Fewshot公司) ; Independent Researcher(独立研究员)
AI总结 提出黑客-修复者循环方法,通过LLM代理交替攻击和修补验证器,自动生成抗利用的验证器,将KernelBench攻击成功率从62%降至0%。
PaperMentor:面向Overleaf的AI研究论文写作人本多智能体辅导系统
机构 * CMU(卡内基梅隆大学) ; Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学与向量研究所) ; EuroSafeAI ; ETHZ(苏黎世联邦理工学院) ; EPFL(洛桑联邦理工学院) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所,德国图宾根)
AI总结 提出PaperMentor,一种在Overleaf中提供内联建议的人本写作助手,通过专家技能库和12个专业智能体提供可操作反馈,用户研究中90.6%建议被认为可操作。
Comments Accepted to the ACL 2026 Demo Track
Video2Sim2Real:从单个人类视频实现全栈自主灵巧技能获取
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Pennsylvania(宾夕法尼亚大学) ; Toyota Research Institute(丰田研究所) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出Video2Sim2Real框架,从单个人类操作视频中重建数字孪生并提取运动先验,通过物体关键帧优化机器人配置,结合残差强化学习与碰撞感知规划,实现从仿真到真实世界的灵巧技能迁移。
Comments Website: https://video2sim2real.github.io/
TRADE: 换能器增强的语音大语言模型解码器
机构 * Hippocratic AI ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出TRADE模型,通过换能器分支增强多模态大语言模型,实现帧同步对齐与语言推理结合,支持流式和非流式解码,在多个基准上取得低词错误率。
Sparrow: 用于大语言模型稳定高效长上下文强化学习的稀疏 rollout
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Cornell University(康奈尔大学) ; Intel(英特尔) ; Amazon AGI(亚马逊AGI)
AI总结 针对RLVR中长上下文rollout计算昂贵的问题,提出Sparrow方法,通过动态稀疏度调度保持token级策略失配的下尾统计量稳定,在Qwen3系列模型上实现2.0-2.4倍加速,并推广到更大模型和编程领域。
理解阿拉伯语X社区中心理健康话语的社会文化维度
机构 * King Saud University(沙特国王大学) ; Cairo University(开罗大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 通过GPT-4.1识别个人披露的推特用户,分析边缘型人格障碍、双相障碍和ADHD相关话语,发现不同病症的词汇模式差异,提出可复用的LLM辅助披露流程和文化关键词框架。
Comments Accepted to the SMM4H-HeaRD Workshop, co-located with the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)
因果智能体回放:LLM智能体故障的反事实归因
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出Causal Agent Replay (CAR)方法,通过结构因果模型和干预操作,对LLM智能体失败步骤进行反事实归因,解决现有方法无法定位决策步骤的问题。
Comments Open-source: https://github.com/jaineet17/causal-agent-replay
SciTrace: 面向科学发现代理的轨迹感知安全推理
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Allen Institute(艾伦研究所)
AI总结 提出SciTrace框架,通过安全内在推理循环和组合工具链验证器,在科学代理管道的每个阶段融入安全推理,实现工具调用安全性和对抗鲁棒性的SOTA提升。
Comments 23 pages
IntentNav: 从人类演示中学习空间-视觉物体导航
机构 * Nanyang Technological University(南洋理工大学) ; Carnegie Mellon University(卡内基梅隆大学) ; The Chinese University of Hong Kong(香港中文大学) ; A*STAR Institute for Infocomm Research (I2R)(新加坡科技研究局资讯通信研究院)
AI总结 提出IntentNav框架,通过人类演示学习类人物体导航策略,利用前沿标注和意图对齐目标实现最优性能,并零样本迁移到多种机器人平台。
Comments 26 pages, 9 figures
基于基础模型先验的主动学习:类别不平衡下的高效学习
机构 * University of California, Riverside(加州大学河滨分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Worcester Polytechnic Institute(伍斯特理工学院)
AI总结 针对现实数据中的类别不平衡和噪声标注问题,提出一种利用基础模型先验的主动学习框架,通过不平衡感知的协同决策选择信息量最大的样本,在图像和文本数据集上实现超过50%的标注节省。
Comments To appear at ICML 2026
核聚变等离子体控制的离线强化学习:代码库与基准
机构 * Central South University(中南大学) ; Chongqing University(重庆大学) ; Carnegie Mellon University(卡内基梅隆大学) ; The University of Hong Kong(香港大学)
AI总结 提出RL4F基准,基于DIII-D托卡马克历史数据构建评估环境,比较多种离线RL方法在等离子体控制任务上的性能,发现基于模型的离线RL方法平均表现最佳。
Comments 23 pages (10 pages main text)
人类的ALMANAC:用于智能体协作的动作级心智模型标注的人类协作数据集
机构 * Northeastern University(东北大学) ; University of Notre Dame(Notre Dame 大学) ; University of Waterloo(滑铁卢大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Adobe(Adobe公司) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 为解决当前LLM智能体缺乏协作中心智模型能力的问题,构建了基于Map Task的ALMANAC数据集,包含2987个协作动作及其心智模型标注,并评估了六种LLM在预测人类行为和心智模型上的表现。
从批量基因表达数据中恢复因果关系的可能性
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽伊德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过形式化聚合下的一致性和推导充要条件,研究了从批量基因表达数据中恢复因果关系的可能性,并发现仅在线性聚合与仿射结构方程下可恢复,而实证数据偏离线性假设。
可扩展的推理时退火与代理似然估计器
机构 * CMU-Pitt PhD Program in Computational Biology Dept. of Computational & Systems Biology, University of Pittsburgh, Pittsburgh, PA 15260, USA(卡内基梅隆大学-匹兹堡联合博士项目 计算生物学部门 计算与系统生物学系,匹兹堡大学,匹兹堡,PA 15260,USA)
AI总结 提出可扩展推理时退火(SITA)方法,通过基于能量的模型实现快速代理似然,避免昂贵的散度计算,在丙氨酸二肽和三肽上取得最先进性能。
Comments 26 pages, 5 figures, submitted to JMLR 2026
FinTSB:一个全面且实用的金融时间序列预测基准
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen 518055, China(清华大学深圳国际研究生院,清华大学,深圳 518055,中国) ; School of Computer Science, Carnegie Mellon University, Pittsburgh 15213, Pennsylvania, United States(卡内基梅隆大学计算机科学学院,匹兹堡 15213,宾夕法尼亚州,美国) ; School of Computer Science and Technology, Tongji University, Shanghai 201804, China(同济大学计算机科学与技术学院,上海 201804,中国) ; College of Computer Science and Software Engineering, Shenzhen University, Shenzhen 518055, China(深圳大学计算机科学与软件工程学院,深圳 518055,中国) ; Shanghai Artificial Intelligence Laboratory, Shanghai 200030, China(上海人工智能实验室,上海 200030,中国)
AI总结 针对金融时间序列预测中多样性不足、评估标准缺失和现实匹配度低的问题,提出FinTSB基准,通过分类运动模式、标准化评估指标和模拟真实交易约束,提供全面的评估平台。
Journal ref Frontiers of Computer Science 2026
FieldWorkArena:面向真实作业任务的代理AI基准测试
机构 * Fujitsu Limited(富士通株式会社) ; Fujitsu Research of America(富士通美国研究部) ; Carnegie Mellon University(卡内基梅隆大学) ; Master’s Student, The University of Tokyo(东京大学硕士研究生) ; Agent Research Collective(代理研究集体)
AI总结 本文提出FieldWorkArena,用于评估代理AI在真实制造业和零售环境中的性能,通过现场采集的数据和实地访谈设计任务,验证多模态大语言模型的评估可行性。
Comments 27 pages, 10 figures, 7 tables [ICPR 2026 Accepted] Changes from previous version: added supplemental material
模型知晓其捷径:部署时的捷径缓解
机构 * Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(雷和斯蒂芬妮·兰德计算生物学系,计算机科学学院,卡内基梅隆大学)
AI总结 研究提出在部署时通过无监督梯度归因缓解预训练文本编码器的捷径学习,证明部署时的缓解在信息理论上受训练时缓解的限制,并在情感分类、毒性检测和自然语言推理中取得显著性能提升。
基于思维图的奖励进化:一种用于强化学习的双层语言模型框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Tokyo(东京大学)
AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。
Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)
CAD-Prompted SAM3: 用于工业物体的几何条件实例分割
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 本文提出基于CAD模型的SAM3分割框架,通过几何条件进行实例分割,解决工业环境中难以用语言或外观描述的对象问题。
解耦特征重要性
机构 * Department of Statistics and Actuarial Science, The University of Hong Kong, Hong Kong SAR, China(香港大学统计与精算科学系) ; Musketeers Foundation Institute of Data Science, The University of Hong Kong, Hong Kong SAR, China(香港大学数据科学穆斯克特基金会研究所) ; Department of Statistics and Data Science, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学统计与数据科学系) ; Computational Biology Department, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学计算生物学系) ; Machine Learning Department, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学机器学习系)
AI总结 本文提出解耦特征重要性(DFI),用于解释相关测量通道中的预测信号分配,通过独立潜在表示和熵最优传输几何计算特征重要性,实现稳定且可解释的归因。
Comments 29 main and 44 supplementary pages
LightTact: 一种用于变形无关接触感知的视觉-触觉指尖传感器
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))
AI总结 提出LightTact传感器,通过环境光阻断光学配置实现变形无关的接触检测,在无宏观变形下(如液体、超软材料)实现高对比度接触分割,并解锁轻接触机器人操作。
Comments Project website: https://linchangyi1.github.io/LightTact
大规模多语言联合分割与标注
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对现有神经标注模型缺乏形态边界预测导致可解释性差的问题,提出PolyGloss模型,通过联合分割与标注提升准确性和对齐度,并支持低秩适应快速迁移。
Comments 15 pages, 9 figures, accepted to ACL 2026 Long Papers
SPECTRA:通过分布化LLM推理揭示用户偏好的全频谱
机构 * Carnegie Mellon University(卡内基梅隆大学) ; TikTok Inc.(TikTok公司)
AI总结 提出SPECTRA方法,将微调后的LLM视为隐式概率模型,通过探测softmax层推断用户偏好的概率分布,有效恢复长尾偏好并提升公平性。
联邦大语言模型:当前进展与未来方向
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Duke University(杜克大学) ; University of California San Diego(加州大学圣地亚哥分校) ; The University of New South Wales(新南威尔士大学) ; Adobe Research(Adobe研究) ; University of Maryland College Park(马里兰大学学院公园分校) ; CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61)
AI总结 本文综述联邦学习与大语言模型结合(FedLLM)的最新进展,重点分析联邦微调和联邦提示学习如何应对效率、个性化和安全挑战,并展望联邦预训练和联邦智能体等方向。
Comments Accepted by PAKDD 2026
一种统一评估指导的查询相关提示优化框架
机构 * School of Information Sciences, University of Illinois Urbana-Champaign(信息科学学院,伊利诺伊大学厄巴纳-香槟分校) ; College of Engineering, Carnegie Mellon University(工程学院,卡内基梅隆大学)
AI总结 提出一个基于性能导向的提示评估框架,并开发一个无需执行的评估器来预测多维质量分数,进而指导一个度量感知优化器以可解释的查询相关方式重写提示,在多个数据集和骨干模型上优于现有方法。
潜在世界模型如何理解部分可观测的安全约束?
机构 * UC San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究潜在世界模型在部分可观测安全约束下的故障模式,提出互信息度量和滚动预测度量来诊断估计间隙和预测间隙,并通过多模态监督和共形风险校准缓解问题,提高机器人操作安全性。
Comments 10 tables 5 figures
全频谱神经表示的多分辨率增强
机构 * Linac Coherent Light Source, SLAC National Accelerator Laboratory(直线相干光源,SLAC国家加速器实验室) ; Stanford Institute for Materials and Energy Sciences, Stanford University(斯坦福大学材料与能源科学研究所) ; Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校机械工程系) ; Department of Mathematics, University of California Davis(加州大学戴维斯分校数学系) ; Department of Physics, Carnegie Mellon University(卡内基梅隆大学物理系)
AI总结 提出WIEN-INR框架,通过分层增强网络在不同分辨率尺度上建模,提升小网络对多尺度结构和高频细节的表示能力,实现紧凑高保真表示。