iOSWorld: A Benchmark for Personally Intelligent Phone Agents
iOSWorld:个人智能手机代理的基准测试
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出首个基于持久用户身份的交互式原生iOS模拟器基准iOSWorld,包含26个新应用和133个任务,评估代理在单应用、多应用及记忆个性化任务上的表现,最佳配置整体准确率52%,多应用任务仅37%。
高校专区
iOSWorld:个人智能手机代理的基准测试
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出首个基于持久用户身份的交互式原生iOS模拟器基准iOSWorld,包含26个新应用和133个任务,评估代理在单应用、多应用及记忆个性化任务上的表现,最佳配置整体准确率52%,多应用任务仅37%。
(自动)形式化应该很简单:用于详细阐述严格证明的Trellis过程语义
机构 * Department of Mathematical Sciences, Carnegie Mellon University(卡内基梅隆大学数学科学系)
AI总结 提出Trellis系统,通过确定性约束工作流和LLM代理迭代细化自然语言证明,实现Lean自动形式化,强调严格证明的可细化性。
Comments 15 pages, 7 figures, 5 tables
通过对抗性黑客-修复者循环强化智能体基准测试
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Fewshot Corp(Fewshot公司) ; Independent Researcher(独立研究员)
AI总结 提出黑客-修复者循环方法,通过LLM代理交替攻击和修补验证器,自动生成抗利用的验证器,将KernelBench攻击成功率从62%降至0%。
PaperMentor:面向Overleaf的AI研究论文写作人本多智能体辅导系统
机构 * CMU(卡内基梅隆大学) ; Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学与向量研究所) ; EuroSafeAI ; ETHZ(苏黎世联邦理工学院) ; EPFL(洛桑联邦理工学院) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所,德国图宾根)
AI总结 提出PaperMentor,一种在Overleaf中提供内联建议的人本写作助手,通过专家技能库和12个专业智能体提供可操作反馈,用户研究中90.6%建议被认为可操作。
Comments Accepted to the ACL 2026 Demo Track
Video2Sim2Real:从单个人类视频实现全栈自主灵巧技能获取
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Pennsylvania(宾夕法尼亚大学) ; Toyota Research Institute(丰田研究所) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出Video2Sim2Real框架,从单个人类操作视频中重建数字孪生并提取运动先验,通过物体关键帧优化机器人配置,结合残差强化学习与碰撞感知规划,实现从仿真到真实世界的灵巧技能迁移。
Comments Website: https://video2sim2real.github.io/
TRADE: 换能器增强的语音大语言模型解码器
机构 * Hippocratic AI ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出TRADE模型,通过换能器分支增强多模态大语言模型,实现帧同步对齐与语言推理结合,支持流式和非流式解码,在多个基准上取得低词错误率。
Sparrow: 用于大语言模型稳定高效长上下文强化学习的稀疏 rollout
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Cornell University(康奈尔大学) ; Intel(英特尔) ; Amazon AGI(亚马逊AGI)
AI总结 针对RLVR中长上下文rollout计算昂贵的问题,提出Sparrow方法,通过动态稀疏度调度保持token级策略失配的下尾统计量稳定,在Qwen3系列模型上实现2.0-2.4倍加速,并推广到更大模型和编程领域。
理解阿拉伯语X社区中心理健康话语的社会文化维度
机构 * King Saud University(沙特国王大学) ; Cairo University(开罗大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 通过GPT-4.1识别个人披露的推特用户,分析边缘型人格障碍、双相障碍和ADHD相关话语,发现不同病症的词汇模式差异,提出可复用的LLM辅助披露流程和文化关键词框架。
Comments Accepted to the SMM4H-HeaRD Workshop, co-located with the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)
因果智能体回放:LLM智能体故障的反事实归因
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出Causal Agent Replay (CAR)方法,通过结构因果模型和干预操作,对LLM智能体失败步骤进行反事实归因,解决现有方法无法定位决策步骤的问题。
Comments Open-source: https://github.com/jaineet17/causal-agent-replay
SciTrace: 面向科学发现代理的轨迹感知安全推理
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Allen Institute(艾伦研究所)
AI总结 提出SciTrace框架,通过安全内在推理循环和组合工具链验证器,在科学代理管道的每个阶段融入安全推理,实现工具调用安全性和对抗鲁棒性的SOTA提升。
Comments 23 pages
IntentNav: 从人类演示中学习空间-视觉物体导航
机构 * Nanyang Technological University(南洋理工大学) ; Carnegie Mellon University(卡内基梅隆大学) ; The Chinese University of Hong Kong(香港中文大学) ; A*STAR Institute for Infocomm Research (I2R)(新加坡科技研究局资讯通信研究院)
AI总结 提出IntentNav框架,通过人类演示学习类人物体导航策略,利用前沿标注和意图对齐目标实现最优性能,并零样本迁移到多种机器人平台。
Comments 26 pages, 9 figures
基于基础模型先验的主动学习:类别不平衡下的高效学习
机构 * University of California, Riverside(加州大学河滨分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Worcester Polytechnic Institute(伍斯特理工学院)
AI总结 针对现实数据中的类别不平衡和噪声标注问题,提出一种利用基础模型先验的主动学习框架,通过不平衡感知的协同决策选择信息量最大的样本,在图像和文本数据集上实现超过50%的标注节省。
Comments To appear at ICML 2026
核聚变等离子体控制的离线强化学习:代码库与基准
机构 * Central South University(中南大学) ; Chongqing University(重庆大学) ; Carnegie Mellon University(卡内基梅隆大学) ; The University of Hong Kong(香港大学)
AI总结 提出RL4F基准,基于DIII-D托卡马克历史数据构建评估环境,比较多种离线RL方法在等离子体控制任务上的性能,发现基于模型的离线RL方法平均表现最佳。
Comments 23 pages (10 pages main text)