arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 6082
2609.09158 2026-09-09 cs.RO cs.AI 新提交

TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

TANGO:基于全身视觉-语言-动作模型的类人机器人在杂乱环境中的导航

Anqi Li, Yuxin Chen, Zhaobo Li, Zhuo Cao, Junli Ren, Masayoshi Tomizuka, Dhruv Shah

机构 * University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学)

AI总结 TANGO提出首个全身视觉-语言导航框架,通过29自由度动作预测实现类人机器人在杂乱环境中的语言引导通行,仿真训练并零样本部署成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09157 2026-09-09 cs.LG cs.CL 新提交

Learning Length-Extrapolatable Recurrent Models

学习长度可外推的循环模型

Hanwen Jiang

机构 * Adobe Research(奥多比研究院)

AI总结 本文针对循环模型在长序列上训练失效的问题,提出时间信用稳定化(CST)方法,通过稳定状态信用信号提升模型在超出训练长度达128倍时的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09156 2026-09-09 cs.CL 新提交

ReCite: Agentic Reasoning for Faithful Citation

ReCite:用于忠实引用的智能体推理

Yuyang Huang, Bobo Li, Jiajia Song, Yuzhe Ding, Chong Teng, Fei Li, Donghong Ji

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全学院) National University of Singapore(新加坡国立大学)

AI总结 针对现有引用推荐系统易错误归属的问题,提出解耦智能体框架ReCite,通过位置感知、意图查询规划和反思验证实现主张级推理,在严格引用准确率上超越大规模生成模型。

Comments Findings of EMNLP 2026. Project page: https://hyy279.github.io/ReCite

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09155 2026-09-09 cs.CV 新提交

SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators

SyncWorld:视觉校准使世界模型成为零样本模拟器

Yuncong Yang, Zhengtao Han, Furkan Ozyurt, Zeyuan Yang, Han Yang, Junyi Cao, Haoyu Zhen, Yilun Du, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) UC Berkeley(加州大学伯克利分校) NYU(纽约大学) Harvard(哈佛大学)

AI总结 SyncWorld 通过视觉校准上下文训练动作条件世界模型,实现零样本模拟未见环境中的动作结果,并支持无需训练的测试时策略改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09153 2026-09-09 cs.AI cs.CL cs.MA 新提交

Procedural Graphs: Self-Evolving Execution Structures for LLM Agents

程序图:面向LLM智能体的自演化执行结构

Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık

机构 * Google(谷歌公司) Georgia Institute of Technology(佐治亚理工学院) Peking University(北京大学)

AI总结 提出程序图框架,将程序性知识组织为三元组图,通过引导模型提供步骤级情境引导并自演化编辑图结构,在多个数据集上超越记忆基线,提升LLM智能体长时程决策性能。

Comments 36 pages including references and appendices, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09145 2026-09-09 cs.CV 新提交

Point4D: Long-range 4D Motion Reconstruction

Point4D:长程4D运动重建

Minsik Jeon, Jay Karhade, Deva Ramanan, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 Point4D是一种前馈模型,通过3D查询运动解码器和视觉描述符重用,实现数百帧长视频的密集4D轨迹重建,性能超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09143 2026-09-09 cs.CV cs.CL 新提交

Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

研究统一多模态模型中的图像分词器作为视觉语言

Siting Li, Zhengyang Wang, Simon Shaolei Du, Xi Chen, Yang Liu

机构 * Amazon FAR(亚马逊FAR) University of Washington(华盛顿大学)

AI总结 本研究构建纯自回归测试平台,通过任务特定损失分析图像分词器在联合多模态训练中的行为,发现损失需按任务分析且I2T损失更一致,并揭示重建质量与性能非正相关及分词器选择影响文本建模。

Comments 27 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09140 2026-09-09 cs.LG cs.AI 新提交

NOAH: Learning the Full Patient Journey. A Longitudinal Multimodal Time-Aware Model for Representation and Forecasting

NOAH:学习完整患者旅程——用于表示与预测的纵向多模态时间感知模型

Tobias Susetzky, Raphael Rehms, Dmitrii Seletkov, Özgün Turgut, Michelle Espranita Liman, Lisa Steinhelfer, Rickmer Braren, Daniel Rueckert

机构 * TUM University Hospital and Technical University of Munich (TUM)(慕尼黑工业大学医院与慕尼黑工业大学) Institute for Diagnostic and Interventional Radiology, TUM University Hospital(慕尼黑工业大学医院诊断与介入放射学研究所) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Institute for Diagnostic and Interventional Neuroradiology, TUM University Hospital(慕尼黑工业大学医院诊断与介入神经放射学研究所) University Medical Center Hamburg-Eppendorf(汉堡埃彭多夫大学医学中心)

AI总结 NOAH是一种时间感知、任务无关的生成式Transformer模型,通过双向时间整合和变分潜在空间,在MIMIC数据上学习完整患者旅程,支持预测、零样本分类和反事实模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09137 2026-09-09 cs.AI cs.CL 新提交

A Data-Driven Framework for Identifying and Prioritizing RPA Opportunities in Healthcare Processes

一种数据驱动的框架,用于识别和优先排序医疗流程中的RPA机会

Maria Alejandra Gomez, Juan Manuel Castillo

机构 * Universidad de La Salle(拉萨尔大学)

AI总结 提出一个四模块数据驱动框架,通过流程分类、优先级排序、工具层级选择和投资回报预测,系统化识别和优先排序医院RPA机会,并验证其鲁棒性和财务可行性。

Comments 21 pages, 2 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09135 2026-09-09 cs.LG cs.CL 新提交

Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation

熵正则化排名掩码策略优化用于代码生成中的测试时强化学习

Jiacheng Xu, Feng Chen, Xiuneng Xu, Bo An

机构 * Nanyang Technological University(南洋理工大学)

AI总结 针对代码生成中测试时强化学习因程序不可比较而失效的问题,提出探针驱动TTRL与熵正则化排名掩码策略优化(ERPO),通过行为共识奖励和保守更新显著提升编码基准的pass@1和pass@k。

Comments Accepted to EMNLP 2026 Main Conference. 15 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09134 2026-09-09 cs.AI 新提交

Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails

协同进化工具包与模型:在策略校正帮助较弱模型在模仿失败处迎头赶上

Zhou Yu, Bin Bi, Shiva Kumar Pentyala, Shubham Mehrotra, Sougata Chaudhuri, Shilpa Bhagavath, Zeyuan Chen, Ran Xu, Phil Mui, James Zhu, Sitaram Asur

机构 * Salesforce AI(Salesforce人工智能部门)

AI总结 本研究提出在策略专家校正流水线,解决工具包进化与模型微调冲突,使较弱模型在七个企业任务上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09133 2026-09-09 cs.AI cs.CL cs.SE 新提交

ExecCritic: Learn to Test, Test to Improve for Coding Agents

ExecCritic: 学会测试,测试以改进编码智能体

Leitian Tao, Baolin Peng, Haorui Wang, Hang Wang, Hao Cheng, Wenlin Yao, Qianhui Wu, Tao Ge, Sharon Li, Jianfeng Gao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Georgia Tech(佐治亚理工学院)

AI总结 ExecCritic通过分离测试生成与代码修复,结合角色特定强化学习,在SWE-bench Verified上将编码智能体解决率从61.2%提升至72.6%。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09130 2026-09-09 cs.LG stat.ML 新提交

Nearly Tight Rademacher Bounds for Sparsely Activated Neural Networks

稀疏激活神经网络近紧的 Rademacher 界

Xiaoyu Li, Zhizhou Sha, Jiaojiao Jiang, Junbin Gao, Andi Han

机构 * University of New South Wales(新南威尔士大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Sydney(悉尼大学)

AI总结 研究单隐层 ReLU 网络中输入依赖稀疏性的统计复杂度,提出近紧的 Rademacher 界,并证明宽度依赖性与输入域的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09126 2026-09-09 cs.AI cs.LG stat.ML 新提交

A Generalization of Amari's Bayesian Duality

Amari贝叶斯对偶性的推广

Mohammad Emtiyaz Khan, Thomas Möllenhoff

机构 * RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Technische Universität Darmstadt(达姆施塔特工业大学) The Hessian Center for Artificial Intelligence(黑森人工智能中心)

AI总结 本文通过连接Amari贝叶斯对偶性与贝叶斯规则的凸对偶性,提出其推广形式,并探讨对现代AI的意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09124 2026-09-09 cs.CV cs.AI 新提交

Canonical Color as a Lens into Concept Decodability in Vision Encoders and VLMs

规范颜色作为视觉编码器与VLM中概念可解码性的透镜

Xiaofu Chen, Stella Frank, Yova Kementchedjhieva

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Technical University of Denmark(丹麦技术大学)

AI总结 本研究利用规范颜色作为受控测试案例,通过构建数据集和探测实验,发现视觉编码器能从灰度图像中解码规范颜色且与物体身份关联,并揭示VLM后训练显著影响颜色可解码性,为追踪概念语义信息提供新透镜。

Comments 12 pages, 7 figures. Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09123 2026-09-09 cs.CV 新提交

Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking Rollout

掩码强制:通过双噪声掩码展开改进自回归视频扩散蒸馏

Zhuoran Zhao, Shengju Qian, Tongtong Liang, Xianghao Kong, Songchun Zhang, Junchao Huang, Guian Fang, Xin Wang, Pan Hui, Anyi Rao

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) LIGHTSPEED UCSD(加利福尼亚大学圣地亚哥分校) CUHK(SZ)(香港中文大学(深圳)) NUS(新加坡国立大学)

AI总结 针对自回归视频扩散蒸馏中的模式坍缩问题,提出双噪声掩码展开策略,通过随机掩码注入干净信号扰动学生自展开,提升多种蒸馏方法的视觉质量。

Comments Project page: https://alicezrzhao.github.io/mask_forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09119 2026-09-09 cs.RO cs.AI 新提交

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

DeCAL:通过接触感知的潜在共同想象实现物理基础的灵巧视觉-语言-动作模型

Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * Beijing Academy of Artificial Intelligence(北京智源人工智能研究院)

AI总结 DeCAL提出了一种物理基础的灵巧视觉-语言-动作模型,通过接触感知门控融合和潜在共同想象整合触觉信息,在灵巧操作任务中达到71%平均成功率,并展现出强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09116 2026-09-09 cs.LG 新提交

When Does Scale-Invariant Optimization Become Unstable? An Exact Schedule Law with Weight Decay

尺度不变优化何时变得不稳定?带权重衰减的精确调度律

Hasan Amin, Wei-Kai Chang, Rajiv Khanna

机构 * Purdue University(普渡大学)

AI总结 本研究揭示了归一化网络中学习率调度与权重衰减通过参数范数相互作用的精确离散时间定律,该定律由单一标量控制,并预测了不稳定性边界,为尺度不变优化提供了统一解释和精确控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09115 2026-09-09 cs.AI cs.SE 新提交

MeClear: Cooperative Game-Theoretic Attribution and Risk-Aware Memory Clearance for Long-Horizon LLM Agents

MeClear:面向长程LLM智能体的合作博弈论归因与风险感知记忆清除

Boyu Yang, Jiazheng Sun, Zilong Lu, Zhi Qiu, Xin Peng, Jun Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院) School of Cyberspace Science and Technology, Beijing Institute of Technology(北京理工大学网络空间科学与技术学院)

AI总结 MeClear提出合作博弈归因与风险感知记忆清除框架,通过识别负效用记忆并选择性抑制,在长程LLM智能体中实现85.9%召回率和82.3%任务恢复率,较LOO基线提升25.5个百分点。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09113 2026-09-09 cs.AI cs.CL cs.LG 新提交

SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?

SAEScientist-Bench:AI智能体能否进行自主SAE可解释性研究?

Yuqiao Tan, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出SAEScientist-Bench基准,评估AI智能体利用稀疏自编码器进行自主机制可解释性研究的能力,实验显示前沿智能体具备真实发现能力但落后于专家,尤其在因果引导方面。研究确立了实验性模型理解作为自主AI研发的可衡量能力。

Comments Preprint. Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09099 2026-09-09 cs.LG 新提交

Curriculum Learning as Transport: Understanding Curricula with Wasserstein Geodesics

课程学习作为传输:用Wasserstein测地线理解课程

Changho Shin, David Alvarez-Melis

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院) Harvard University(哈佛大学)

AI总结 提出基于Wasserstein测地线的传输框架解耦课程学习因素,在合成套件上发现课程效应依赖上下文,从易到难排序提升困难层级表现。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09094 2026-09-09 cs.AI 新提交

The Surprising Effectiveness of Approximate Value Iteration in Self-Play

近似值迭代在自我对弈中的惊人有效性

Raphael Boige, Amine Boumaza, Bruno Scherrer

机构 * Université de Lorraine(洛林大学) CNRS(法国国家科学研究中心) Inria(法国国家信息与自动化研究所) LORIA(洛林计算机科学与应用实验室)

AI总结 本研究证明,在中等规模博弈中,简单的近似值迭代(AVI)自我对弈方法能学习到比AlphaZero更准确的价值函数,且其贪心策略在更低成本下与MCTS策略竞争力相当,挑战了复杂搜索方法的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09090 2026-09-09 cs.CL cs.AI 新提交

Measuring LLM Sycophancy under Sustained Multi-Turn Pressure

测量大型语言模型在持续多轮压力下的谄媚行为

Leyuan Tang, Kangda Wei, Tianyu Jiang, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) University of Cincinnati(辛辛那提大学)

AI总结 本研究提出SPINE基准,通过自适应多轮压力测试揭示LLM谄媚行为随对话长度增加而加剧,且正确立场常保留于推理轨迹中,表明谄媚源于取悦用户而非知识缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09085 2026-09-09 cs.CL 新提交

It's Not RoPE that Creates Sinks: The Role of Self-Concentration and Value-Non-Mixing in Attention

并非RoPE导致注意力汇聚:自集中与值非混合在注意力中的作用

Raito Kiya, Satoki Ohashi, Kosuke Sato, Go Kamoda, Ryosuke Takahashi, Yuji Yamamoto, Daiki Shiono, Keisuke Sakaguchi, Goro Kobayashi

机构 * Tohoku University(东北大学) SOKENDAI(综合研究大学院大学) NINJAL(日本国立国语研究所) MBZUAI(Mohamed bin Zayed 人工智能大学) RIKEN(日本理化学研究所) Preferred Networks, Inc.(Preferred Networks公司)

AI总结 本研究揭示注意力汇聚与大规模激活源于因果掩码引发的自集中和值非混合,而非RoPE,为量化策略提供新见解。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09082 2026-09-09 cs.CV cs.AI 新提交

GoDeep: Annotation-Free Open-Vocabulary 3D Scene Understanding via Language-Space Lifting

GoDeep:通过语言空间提升实现免标注的开放词汇3D场景理解

Thodoris Betsas, Anastasios Doulamis, Andreas Georgopoulos

机构 * School of Rural, Surveying and Geoinformatics Engineering, NTUA(希腊国家技术大学农村、测量与地理信息工程学院)

AI总结 GoDeep利用视觉-语言模型作为翻译器,在纯语言嵌入空间中直接聚合实体级描述,实现免标注的开放词汇3D场景理解,无需3D训练数据,性能优于CLIP基线并支持点级可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09076 2026-09-09 cs.CL 新提交

ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation

ActReview:基于反驳引导的训练数据与评分标准奖励用于可操作的同行评审生成

Yiling Ma, Yilun Zhao, Sihong Wu, Ziyu Chen, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学) University of Chicago(芝加哥大学) TCS Research(塔塔咨询服务研究中心)

AI总结 针对大模型预投稿自我审查中反馈缺乏可操作性的问题,提出ActReview框架,利用反驳引导构建训练数据并设计评分奖励,生成诊断与修改建议,优于现有模型。

Comments 50 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09075 2026-09-09 cs.LG cs.AI 新提交

ThinkPrior: Zero-Rollout Difficulty Priors for Cold-Start Prompt Selection in RLVR

ThinkPrior:RLVR中冷启动提示选择的零回滚难度先验

Tommy Sha, Skylar Zhai, Siqi Zhao

机构 * Stony Brook University(石溪大学) University of Minnesota Twin Cities(明尼苏达大学双城校区)

AI总结 ThinkPrior利用外部锚点构建零回滚难度先验,在RLVR中冷启动选择提示,减少早期静默组和浪费回滚,且不损害最终准确率。

Comments 13 pages, 3 figures, 5 tables. Project page: https://shatianming5.github.io/thinkprior/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09072 2026-09-09 cs.CL 新提交

ToolLoop: Closed-Loop Tool-Use Data Synthesis via Decomposed Generation and Dynamic Self-Feedback

ToolLoop:基于分解生成与动态自我反馈的闭环工具使用数据合成

Min Zeng, Yuzhou Liu, Zhenyu Cao, Hanxiu Chen, Heng Li, Caiquan Liu, Yafei Wen, Xiaoxin Chen

机构 * vivo AI Lab(vivo人工智能实验室)

AI总结 ToolLoop提出闭环工具使用数据合成框架,通过分解生成与动态自我反馈,以少量数据显著提升模型工具调用能力。

Comments Accepted at the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09070 2026-09-09 cs.CL cs.AI cs.HC 新提交

Performance of Clinical AI System and Physicians and Frontier Language Models in primary care diagnostics

临床AI系统、医生与前沿语言模型在初级保健诊断中的表现

Andy Nkansah, Hanna Plotnitskaya, Stanislau Salavei, Anna Kozlova, Piotr Gibas, Julian Milek, Viktar Harbachou, Aleksey Ropan, Pavel Satalkin

机构 * A.I. Doctor Medical Assist LTD(A.I. Doctor Medical Assist有限公司)

AI总结 本研究在150个合成初级保健咨询中比较了临床AI系统Doctorina、医生和前沿语言模型,发现Doctorina在诊断、检查及治疗评分上均优于医生,且结果可重复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09069 2026-09-09 cs.RO cs.CV 新提交

Rethinking Learned Occupancy in Autonomous Active Mapping with Observation-Gated Filtering

重新思考自主主动建图中的学习占用率:基于观测门控滤波

Jiahui Zhang, Bonian Han, Gongbo Liang, Yu Zhang

机构 * Boise State University(博伊西州立大学) Texas A&M University–San Antonio(德州农工大学圣安东尼奥分校)

AI总结 本研究通过闭环基准诊断学习占用率对主动建图规划的双重影响,提出观测门控滤波器以在观测不足时保留补全、重复暴露后抑制预测,无需重训即可改善易失败场景的覆盖率。

Comments Accepted to IROS 2026 Space Robotics Workshop (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏