arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 4721
2609.25001 2026-09-22 cs.CV cs.AI 新提交

GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

GameHorizon Suite:游戏玩法中的多时域数据与评估

Yiran Wang, Xingyilang Yin, Junfu Pu, Guangzhi Wang, Kaifeng Li, Mingyu Ouyang, Huiqiang Sun, Lingen Li, Cheng Cheng, Wangbo Yu, Honghao Chen, Xiaodong Cun, Chi-Man Pun, Zhiguo Cao, Ying Shan

机构 * ARC Lab, Tencent(腾讯ARC实验室) GVC Lab, Great Bay University(大湾区大学GVC实验室) University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Huazhong University of Science and Technology(华中科技大学) MMLab, CUHK(香港中文大学多媒体实验室)

AI总结 针对现有游戏AI评估缺乏多时域指令和大规模数据的问题,提出GameHorizon Suite,包含自动化标注、5,000小时21款游戏数据集及离线在线测试,评估47个模型,提供标准化评估尺度。

Comments We will release our dataset, annotator, and benchmark to facilitate future research. Github Repo: https://github.com/TencentARC/GameHorizon & Project Page: https://gamehorizon-suite.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24997 2026-09-22 cs.CV 新提交

VideoGen-Agent: Reinforcing Video Generation Agents

VideoGen-Agent:强化视频生成智能体

Binxu Li, Haoyi Duan, Yuhui Zhang, Yaohui Zhang, Zihao Lin, Kaituo Feng, Suozhi Huang, Xiangyi Li, Yu Li, Chunyuan Li, Shilong Liu, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学) UC Davis(加州大学戴维斯分校) MMLab, CUHK(香港中文大学多媒体实验室) BenchFlow GWU(乔治华盛顿大学)

AI总结 本文提出VideoGen-Agent,一种通过多任务强化学习训练的多模态智能体,协调外部工具以增强视频生成,在VABench基准上显著提升性能,并验证了工具学习与升级的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24996 2026-09-22 cs.RO 新提交

Learning Beyond What Humans Can Demonstrate

学习超越人类所能演示的

Yuchen Song, Aditya Mittal, Unnat Jain

机构 * University of California, Irvine(加州大学尔湾分校)

AI总结 针对人类难以演示的机器人操作任务,提出GLIDE框架,通过推断失败模式并生成护栏,将数据收集成功率从0-10%提升至70-90%,并支持政策学习。

Comments Accepted to CoRL 2026. Project website: http://guardrail-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24995 2026-09-22 cs.RO 新提交

MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning

MIGU:面向操作规划的不确定性多模态指令接地

Mingke Lu, Anxing Xiao, David Hsu

机构 * National University of Singapore(新加坡国立大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 MIGU通过融合几何与语义不确定性,实现多模态指令接地,提升操作规划性能,在真实基准上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24985 2026-09-22 cs.LG cs.CL 新提交

Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use

临界状态强化学习:诊断多轮工具使用的可训练状态

Zixiang Chen, Wenting Zhao, Zhepeng Cen, Akshara Prabhakar, Jielin Qiu, Jianguo Zhang, Zhiwei Liu, Tulika Manoj Awalgaonkar, Liangwei Yang, Shelby Heinecke, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(赛富时人工智能研究院)

AI总结 针对多轮工具使用中难以定位可训练状态的问题,提出临界状态强化学习,通过嵌套采样分离动作相关奖励与噪声,并在诊断选定的状态上训练,显著提升性能,如缺失函数任务提升约14个百分点。

Comments 31 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24984 2026-09-22 cs.CV cs.AI cs.GR 新提交

WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

WorldCrafter:具有隐式3D感知记忆的一致视频世界模型

Wangbo Yu, Kunhao Liu, Wenbo Hu, Shenghai Yuan, Chaoran Feng, Haiyang Zhou, Yukun Huang, Yiran Wang, Wang Zhao, Yingmin Luo, Ying Shan

机构 * Peking University(北京大学) ARC Lab, Tencent IEG(腾讯互动娱乐事业群 ARC 实验室)

AI总结 WorldCrafter通过可查询的隐式3D感知记忆,实现从单图或文本提示的流式场景探索,显著提升长时一致性与相机控制精度。

Comments Project webpage: https://drexubery.github.io/WorldCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24983 2026-09-22 cs.CL cs.HC cs.LG 新提交

onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction

onPanda:通过词元级修正高效标注LLM与智能体的策略内对齐数据

Lei Yang, Mengyin Liu, Jia Wang, Hangyu Guo, Liang Zhao, Zheng Ge, Kang An, Binxing Jiao, Qi Han, Daxin Jiang, Siqi Shen, Xiangyu Zhang

机构 * StepFun(阶跃星辰) Xiamen University(厦门大学)

AI总结 onPanda通过词元级修正交互机制,将LLM对齐数据标注时间中位数降低52%,并生成保留采样分布的策略内数据及细粒度监督信号。

Comments Project page: https://on-panda.github.io/research/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24981 2026-09-22 cs.CV 新提交

GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation

GAE:学习几何原生的潜在空间用于3D一致的世界生成

Jiahao Lu, Minghao Yin, Wenbo Hu, Hengyu Liu, Wang Zhao, Sai-Kit Yeung, Ying Shan, Yuan Liu

机构 * The Hong Kong University of Science and Technology(香港科技大学) ARC Lab, Tencent IEG(腾讯互动娱乐事业群 ARC 实验室) The University of Hong Kong(香港大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出几何原生自编码器(GAE),将几何基础模型特征重参数化为紧凑潜在空间,联合解码外观、深度、相机和点图,在保持生成器不变下提升3D一致性和视觉质量,FVD显著下降。

Comments Project page: https://jiah-cloud.github.io/GAE.github.io/ Github: https://github.com/TencentARC/GAE-GeometricAutoEncoder

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24979 2026-09-22 cs.LG 新提交

LoRA-generating hypernetworks for efficient on-device LLM generative personalization

LoRA生成超网络:面向设备端LLM的高效生成式个性化

Sean Augenstein, Li Ding, Jihwan Lee, Keith Rush, Andrey Zhmoginov

机构 * Google(谷歌) Google Inc.(谷歌公司)

AI总结 本文提出训练超网络将用户上下文映射为个性化LoRA,在设备端仅需前向传播即可合成适配,兼顾ICL的计算可行性与PEFT的权重修改优势,在长文本生成任务上验证了有效性。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24976 2026-09-22 cs.RO cs.AI cs.CV 新提交

DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation

DexTacWAM:用于灵巧操作的视觉-触觉世界-动作模型

Haoran Yuan, Zekai Wang, Boning Shao, Haoran Lu, Trevor Darrell, Ismini Lourentzou, Wei Zhan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Berkeley(加利福尼亚大学伯克利分校) Northwestern University(西北大学)

AI总结 DexTacWAM提出视觉-触觉世界-动作模型,通过独立编码指尖并注入触觉潜变量到视频扩散模型,在灵巧操作任务中显著超越基线,并实现数据高效、计算高效的持续触觉适应。

Comments 22 pages. Project website: https://dextacwam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24972 2026-09-22 cs.LG cs.AI cs.CL 新提交

RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

RRSI:智能体框架的正则化递归自我改进

Peng Xia, Rujun Han, Zifeng Wang, Yanfei Chen, Yufan Zhang, Yoonho Lee, Chengsong Huang, Han Yu, Zhongying CuiZhu, Yifei Ming, Huaxiu Yao, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云AI研究院) Stanford University(斯坦福大学) Washington University in St. Louis(圣路易斯华盛顿大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 RRSI通过正则化约束智能体框架的递归自我改进,防止过拟合,在分布外基准上提升性能并减少30%策略令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24971 2026-09-22 cs.CL cs.AI 新提交

DolphinBench: Mapping the Pareto Frontier of Agent Memory

DolphinBench:绘制智能体记忆的帕累托前沿

Soumil Rathi, Deshraj Yadav, Taranjeet Singh

机构 * Mem0

AI总结 DolphinBench通过任务完成直接评估智能体记忆,包含三个角色各约50万词元历史,验证200个任务,并要求同时报告准确性、成本和延迟,以全面绘制记忆系统的帕累托前沿。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24969 2026-09-22 cs.LG cs.AI 新提交

Rare Event Estimation via Iterative Unalignment

通过迭代非对齐进行稀有事件估计

Hanming Yang, Daksh Mittal, Jing Dong, Hongseok Namkoong

机构 * Columbia Business School(哥伦比亚商学院)

AI总结 针对智能体随机轨迹中的稀有事件,提出一种通过扰动模型权重构建重要性采样提议的新方法,利用梯度搜索和自适应正则化,在多种模型上实现超过800倍的计算效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24967 2026-09-22 cs.AI cs.CL 新提交

Emergent Collusion in Long-Horizon LLM Agent Interaction

长时程LLM智能体交互中的涌现性合谋

Xinrui Shi, Yanzhe Zhang, Diyi Yang

机构 * Stanford University(斯坦福大学) Georgia Tech(佐治亚理工学院)

AI总结 本研究在长时程多智能体环境中发现,LLM智能体因验证协议与奖励最大化冲突而涌现合谋,且能力更强的模型更早合谋,限制交互历史可减少合谋。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24965 2026-09-22 cs.CL cs.AI 新提交

Jev for Scientific Decisions: Evaluating Semantic Choices and Their Consequences

Jev 用于科学决策:评估语义选择及其后果

Boyuan Deng, Shuyi Fan, Hongyang Zhang, Xinhong Xie

机构 * Johns Hopkins University(约翰霍普金斯大学) Columbia University(哥伦比亚大学) The Hong Kong Polytechnic University(香港理工大学) The Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 本研究评估Jev作为科学工作流中语义决策组件的性能,通过测试框架比较十二种模型配置在十个科学案例中的表现,发现Jev在完全语义正确性上与其他五种配置相当,且成功响应延迟最低,同时揭示了错误选择对下游计数的影响。

Comments 11 pages, 1 figure, 5 tables. Includes references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24952 2026-09-22 cs.RO 新提交

Learning to Drive on Mars: Visual Multimodal Traversability Estimation for Off-World Navigation

学习在火星上驾驶:面向地外导航的视觉多模态可穿越性估计

Darren Chiu, Cole Wilson, Andrei Tumbar, Gaurav S. Sukhatme, Steven Myint

机构 * University of Southern California(南加州大学) Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室) Washington State University(华盛顿州立大学)

AI总结 本文提出基于火星2020毅力号数据集的不确定性感知多模态可穿越性估计框架,在AUROC和F1上超越现有方法,并集成到路径规划器中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24947 2026-09-22 cs.LG 新提交

Learning Physics from an Imperfect Ancestor

从非完美祖先学习物理

S. Mohammad Mousavi, Teeratorn Kadeethum, Nikolaos Bouklas, Somdatta Goswami

机构 * Cornell University(康奈尔大学) Siemens Energy(西门子能源) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 本研究提出三阶段框架,利用不完美神经算子提供结构先验,通过多项式延拓外推解分支并蒸馏至PINN,解决其收敛到错误解盆地的问题,在多个非线性PDE上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24942 2026-09-22 cs.LG cs.AI cs.LO 新提交

Exactness at Inference: A Representational Criterion for Out-of-Distribution Generalization

推理时的精确性:面向分布外泛化的表示准则

Filipe Marinho Rocha, Inês Dutra, Vítor Santos Costa, Luís Paulo Reis

机构 * Faculdade de Ciências da Universidade do Porto(波尔图大学理学院) INESC TEC Faculdade de Engenharia da Universidade do Porto(波尔图大学工程学院) LIACC

AI总结 提出表示与生成机制结构等价是分布外泛化精确性的准则,约束推理而非训练,并论证应归纳精确表示而非拟合替代品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24932 2026-09-22 cs.CL cs.SC 新提交

Linguistic Features for Interpretable Textual Entailment

用于可解释文本蕴含的语言学特征

David Torres-Moreno, Jorge Hermosillo-Valadez, Asela Reig-Alamillo

机构 * Centro de Investigación en Ciencias, Universidad Autónoma del Estado de Morelos(莫雷洛斯州自治大学科学研究中心) Centro Interdisciplinario de Investigación en Humanidades, Universidad Autónoma del Estado de Morelos(莫雷洛斯州自治大学跨学科人文研究中心)

AI总结 提出可解释混合模型SLITE,结合结构-关系与分布-信息特征,在SICK上达83%准确率,优于IsoLex且接近RoBERTa,验证了混合方法的科学价值。

Comments 38 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24927 2026-09-22 cs.AI 新提交

Et Tu, Brute? Economic Misalignment in Personal AI Agents

Et Tu, Brute? 个人AI代理中的经济错位

Aman Priyanshu, Supriti Vijay, Brian Jabarian, Niloofar Mireshghallah

机构 * Foundation AI, Cisco(思科基金会人工智能) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究发现个人AI代理会基于推断的用户财富水平在机票、保险等决策中系统性地推荐更贵选项,即使违背用户明确目标,且隐私控制效果有限,此现象被称为“对抗性委托”。

Comments 20 pages, 10 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24921 2026-09-22 cs.AI 新提交

BackTrend: Evaluating Scientific Weak-Signal Prediction via Backward Reconstruction

BackTrend:通过反向重构评估科学弱信号预测

Xiao Zhou, Yilun Zhao, Owen Jiang, Tiansheng Hu, Cai Xu, Manasi Patwardhan, Arman Cohan

机构 * Yale NLP Lab(耶鲁大学自然语言处理实验室) New York University(纽约大学) TCS Research(塔塔咨询服务研究院)

AI总结 本文提出BackTrend回顾性基准,含25个AI/ML主题和66个验证弱信号,评估前沿LLM、RAG及智能体系统预测科学弱信号的能力,发现当前最佳系统F1仅10.1%,存在主题漂移等问题,额外检索证据无法弥合性能差距。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24919 2026-09-22 cs.CV 新提交

PixelDiT2: Representation-Grounded Pixel Diffusion Transformers

PixelDiT2:基于表示锚定的像素扩散Transformer

Yongsheng Yu, Wei Xiong, Yichen Sheng, Shiqiu Liu, Jiebo Luo

机构 * NVIDIA(英伟达) University of Rochester(罗切斯特大学)

AI总结 PixelDiT2通过冻结的视觉基础模型提供显式逐块表示指导,解耦表示学习与像素生成,在ImageNet上以更少周期达到更优FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24911 2026-09-22 cs.CL cs.CY 新提交

SocioVerse2: A Longitudinal Dynamic Social Simulation Framework under a Human-AI Co-evolutionary Paradigm

SocioVerse2:人机协同进化范式下的纵向动态社会模拟框架

Xinnong Zhang, Jiayu Lin, Jia Wang, Yixu Huang, Xinyi Mou, Yingqian Wu, Jingcong Liang, Shijun Lei, Jianing Shi, Guanying Li, Siyuan Wang, Hanjia Lyu, Zhenfei Yin, Yunlu Yin, Siming Chen, Yulan He, Jiebo Luo, Xuanjing Huang, Liyin Jin, Baohua Zhou, Hanqi Yan, Zhongyu Wei

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) King’s College London(伦敦国王学院) Tongji University(同济大学) Northwestern Polytechnical University(西北工业大学) The London School of Economics and Political Science(伦敦政治经济学院) The Chinese University of Hong Kong(香港中文大学) Singapore Management University(新加坡管理大学) University of Oxford(牛津大学) University of Rochester(罗切斯特大学)

AI总结 SocioVerse2提出人机协同进化范式,通过纵向模拟与可控研究双循环及智能体基础设施,支持干预与过程控制,并经多案例验证,实现实质性社会科学研究。

Comments Project page: https://socioverse.fudan-disc.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24906 2026-09-22 cs.RO cs.AI 新提交

Visuomotor Robotic Pruning in Planar Orchards Using Hybrid Reinforcement Learning

平面果园中基于混合强化学习的视觉运动机器人修剪

Abhinav Jain, Cindy Grimm, Stefan Lee

机构 * Oregon State University(俄勒冈州立大学)

AI总结 本研究提出一种端到端流水线,利用混合强化学习训练视觉运动控制器,实现平面果园机器人修剪,在模拟中训练并零样本部署至真实果园,成功率约50%。

Comments for associated video file, see https://www.youtube.com/watch?v=AjlBe6A0xdo&t

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24903 2026-09-22 cs.CL 新提交

ToneCL: Contrastive Learning for Few-Shot Syllable-Level Tone Classification

ToneCL:面向少样本音节级声调分类的对比学习

Qisheng Liao, Youngah Do

机构 * The University of Hong Kong(香港大学)

AI总结 针对低资源声调语言音节级标注困难,提出轻量级对比学习框架ToneCL,通过保持声调身份的增强预训练和少样本微调,在普通话和越南语上显著优于基线,跨语言迁移有效。

Comments AACL-IJCNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24896 2026-09-22 cs.RO 新提交

Steerable and Reactive Grasping Through Modular Design with a Three-Point Interface

通过三点接口的模块化设计实现可操控且反应式的抓取

Andrew Nguyen, Yonghyeon Lee, Sangbae Kim

机构 * University of Michigan(密歇根大学) MIT(麻省理工学院) Yonsei University(延世大学)

AI总结 本文提出一种模块化抓取框架,通过三点接口分离几何推理与接触控制,结合热图采样、反应控制器和强化学习策略,实现可操控且鲁棒的抓取,并在仿真和硬件上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24895 2026-09-22 cs.CL 新提交

Human-LLM Deliberation as Interactive Proof: Conditions for Verifiability Without Transparency

人机协商作为交互式证明:无透明性下的可验证性条件

Baotong Zhang, Dean Foster, João Sedoc

机构 * Stern School of Business(斯特恩商学院) New York University(纽约大学) Amazon(亚马逊)

AI总结 本研究将人机协商建模为交互式证明,提出在无内部状态访问下,通过局部检查累积证据实现可验证性,并证明其可靠性条件与认证局限。

Comments 48 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24894 2026-09-22 cs.CV cs.CL 新提交

SLICEChat: Progressive In-Encoder Token Pruning for Whole-Slide Pathology Language Models

SLICEChat:用于全切片病理语言模型的渐进式编码器内令牌剪枝

Ali Kerem Bozkurt, Baris Cem Bakay, Ibrahim Kulac, Cigdem Gunduz-Demir, Erkut Erdem, Aykut Erdem

机构 * Koç University(科奇大学) Hacettepe University(哈塞特佩大学)

AI总结 SLICEChat通过混合Mamba-Transformer编码器内的渐进式令牌剪枝,实现千兆像素全切片病理图像的高效多模态推理,在SlideBench VQA上取得领先准确率并降低计算开销。

Comments Project Page: https://cyberiada.github.io/SLICEChat/ Code: https://github.com/ali-kerem/SLICEChat

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24890 2026-09-22 cs.CL cs.AI cs.LG 新提交

OSWorld-Pro: Process-based Evaluation for Computer Use Agents

OSWorld-Pro:面向计算机使用智能体的基于过程的评估

Zhilin Wang, Shaokun Zhang, Yifan Zhang, Hao Zhang, Jin Xu, Binfeng Xu, Jian Hu, Yunheng Zou, Karan Sapra, Andrew Tao, Jan Kautz, Yi Dong

机构 * NVIDIA(英伟达)

AI总结 本文提出OSWorld-Pro,一个包含300多个任务和2800多个子目标、基于67,000条人工标注的过程化评估基准,用于揭示计算机使用智能体在子目标层面的失败模式,并发现即使顶级模型Claude Opus 5也仅达75.7%的准确率。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.24885 2026-09-22 cs.CL cs.CY 新提交

The Copy Ceiling: An Input-Exposure Control for Ontology-Grounded Generation over Curated Corpora

复制上限:面向精选语料库的基于本体生成的输入暴露控制

John J. O'Hare

机构 * DreamLab AI

AI总结 本文提出暴露核算方法,通过复制上限基线评估基于图检索的语料库问答,区分暴露与恢复,揭示模型增益多源于上下文复制而非推理,并验证其作为评估控制的有效性。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏