arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
全部学科分类 共 2684 篇
2609.30264 2026-09-25 cs.AI cs.RO 新提交

AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control

AD-WM:用于反事实模型预测控制的动作判别世界模型

Jiabin Qiu, Zixuan Chen, Hongye Cao, Jieqi Shi, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学)

AI总结 AD-WM提出一种动作判别世界模型,通过残差动力学和动作恢复正则化保留动作信息,显著提升反事实MPC的规划性能,在模拟和真实迁移任务中均大幅提高成功率。

Comments 9 pages, 5 figures, 4 tables. Project page: https://ad-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30258 2026-09-25 cs.LG 新提交

Temporal Gradient Inversion for Private Trajectory Reconstruction in Embodied Reinforcement Learning

具身强化学习中用于私有轨迹重建的时间梯度反演

Sudip Bhujel, Shanghao Shi, Ruiquan Huang, Ning Zhang, Yang Xiao

机构 * University of Kentucky(肯塔基大学) ; Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 针对具身强化学习分布式训练,提出TRACE时间梯度反演攻击,利用跨时间相关性与闭式动作恢复,自回归重建私有轨迹,实现高PSNR与近完美动作恢复,且速度远超基线。

Comments Accepted at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30250 2026-09-25 cs.CL cs.LG 新提交

Agentic Detection of Online Conspiracies

在线阴谋论的智能体检测

Lior Biton, Oren Tsur

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

AI总结 本研究提出一个智能体框架,利用社会上下文和工具推理,在希伯来语推文中检测阴谋论意图,显著优于文本分类及其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30249 2026-09-25 cs.RO cs.AI cs.CV 新提交

RAPID: Robot Agentic Programming from Demonstrations

RAPID:从演示中进行机器人智能体编程

Yuyao Liu, Jiayuan Mao, David Hsu, Leslie Pack Kaelbling, Tomás Lozano-Pérez

机构 * Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学) ; University of Pennsylvania(宾夕法尼亚大学) ; NVIDIA(英伟达)

AI总结 RAPID从单个视觉演示自动生成、验证并改进机器人程序,采用以对象为中心的关系表示,在仿真和真实机器人上均表现优异,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30247 2026-09-25 cs.RO cs.AI cs.CV 新提交

Rolling-WAM: World Action Models with Rolling Imagination

Rolling-WAM:具有滚动想象的世界动作模型

Yinghua Zhou, Junjie Ye, Yiqi Zhao, Hao Dong, Celina Shiyu Wang, Ruohai Ge, Tingyi Yang, Basile Van Hoorick, Gaurav Sukhatme, Vitor Guizilini, Yue Wang

机构 * University of Southern California(南加州大学) ; Brown University(布朗大学) ; Fudan University(复旦大学) ; Toyota Research Institute(丰田研究院)

AI总结 Rolling-WAM通过滚动想象将联合去噪分布到连续重新规划周期,实现4.5倍稳态加速,并在LIBERO、RoboTwin和Unitree G1上保持竞争力。

Comments 10 pages, 7 figures, 5 tables. Under review. Project page: https://rolling-wam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30245 2026-09-25 cs.CV 新提交

Towards Practical Compression of 3D Gaussian Splatting

面向实用化的3D高斯泼溅压缩

Pengpeng Yu, Yueru Chen, Fei Song, Tai Qin, Qi Zhang, Jing Wang, Yulan Guo

机构 * Sun Yat-sen University(中山大学) ; Pengcheng Laboratory(鹏城实验室) ; Academy of Broadcasting Science, National Radio and Television Administration(国家广播电视总局广播电视科学研究院) ; Peking University Shenzhen Graduate School(北京大学深圳研究生院)

AI总结 提出COSA-GS,通过锚点级因果分解构建无空间聚合的上下文模型,结合量化感知训练和整数推理,实现跨平台比特级一致的3DGS高效压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30243 2026-09-25 cs.CL 新提交

JevOut: Natural Context Can Flip Decision Models

JevOut:自然上下文可使决策模型翻转

Zixiang Xu

机构 * University of Southern California(南加州大学)

AI总结 研究发现,简短自然上下文可使Jev等决策模型在61.4%的初始正确决策上翻转至高置信度错误选项,暴露了当前决策模型的显著脆弱性。

Comments 32 pages, 5 figures, 23 tables. Homepage: https://xzx34.github.io/jevout/ ; Code: https://github.com/xzx34/JevOut

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30238 2026-09-25 cs.CL cs.CV cs.MM 新提交

SemMSA: Latent Semantic-Aided Robust Multimodal Sentiment Analysis with Incomplete Data

SemMSA:基于潜在语义辅助的鲁棒多模态情感分析(数据不完整)

Wenhao Li, Zhibin Wu, Chong Xiao, Qiangchang Wang

机构 * Shandong University(山东大学) ; Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出SemMSA框架,利用大语言模型构建潜在语义,通过跨模态语义精炼与谱对齐处理不完整多模态数据,在SIMS、MOSI和MOSEI基准上取得最先进性能。

Comments Accepted by NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30234 2026-09-25 cs.CV 新提交

OmniFabric: Coherent UV Space Texture Synthesis for 3D Garment Reconstruction

OmniFabric:面向3D服装重建的相干UV空间纹理合成

Ding-Jiun Huang, Yuanhao Wang, Cheng Zhang, Hugo Bertiche, Alexandru-Eugen Ichim, Thabo Beeler, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学) ; Texas A&M University(德克萨斯A&M大学) ; Google(谷歌)

AI总结 针对单图3D服装重建的纹理合成瓶颈,提出OmniFabric方法,在缝纫版型空间利用VLM先验和扩散Transformer实现全局相干纹理生成,显著优于现有基线。

Comments Accepted to SIGGRAPH Asia 2026. Project Page: https://humansensinglab.github.io/OmniFabric/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30233 2026-09-25 cs.RO cs.AI 新提交

Coding Agents for Generalized Task and Motion Planning Problems

面向广义任务与运动规划问题的编码智能体

Matteo Merler, Bowen Li, Josh Roy, Yichao Liang, Qianwei Wang, Yixuan Huang, Tom Silver

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ; Carnegie Mellon University(卡内基梅隆大学) ; Princeton University(普林斯顿大学) ; University of Cambridge(剑桥大学)

AI总结 本文研究编码智能体能否通过合成程序自动化广义任务与运动规划,实验表明其成功率优于手工规划器,且计算量低一个数量级。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30227 2026-09-25 cs.LG cs.AI cs.CL cs.SD 新提交

To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech

信任还是不信任:语音中的检索增强事实核查

Debajyoti Mazumder, Mamta, Abhirama Subramanyam Penamakuri

机构 * IISER Bhopal(印度科学教育与研究学院博帕尔分校) ; King’s College London(伦敦国王学院) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 针对语音错误信息,提出VeriSpeak基准,发现文本到语音存在模态差距,检索加显式推理可提升语音事实核查准确率至86.1%。

Comments Accepted to EMNLP (Main) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30226 2026-09-25 cs.LG cs.AI cs.CL cs.CV 新提交

PoEM: Predicting RL Outcomes from Existing Policies

PoEM:从现有策略预测强化学习结果

Kimia Hamidieh, Giannis Daras, Antonio Torralba

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 PoEM框架利用现有策略预测新奖励函数下的强化学习结果,无需额外RL训练,通过线性组合对数策略实现,并在文本和图像任务上验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30223 2026-09-25 cs.CV 新提交

BiCC: Bidirectional Connected-Component Loss for Instance-Aware Segmentation

BiCC:面向实例感知分割的双向连通分量损失

Luc Bouteille, Frederic Jonske, Jens Kleesiek, Alexander Jaus

机构 * Institute for AI in Medicine (IKIM), University Hospital Essen(埃森大学医院人工智能医学研究所) ; Institute for Anthropomatics and Robotics (IAR), Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院人机交互与机器人研究所)

AI总结 提出双向连通分量损失(BiCC),从预测中派生实例以直接惩罚假阳性分量,平衡参数控制精确率-召回率权衡,在多个数据集上优于现有损失。

Comments 2 figures, 3 tables. Code: https://github.com/TIO-IKIM/BiCC-Loss

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30222 2026-09-25 cs.CV cs.AI cs.RO 新提交

TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations

TrackEverything:通过去重3D场景表示实现长时程密集追踪

Ayush Jain, Sreeharsha Paruchuri, Ishita Gupta, Fan Zhang, Tanner Schmidt, Jakob Engel, Katerina Fragkiadaki, Adam W. Harley

机构 * Carnegie Mellon University(卡内基梅隆大学) ; Meta

AI总结 TrackEverything通过将视频表示为世界坐标中的持久3D场景轨迹,结合体素化去重、端点与轨迹精化器及3D WAFT特征采样,在40GB内存内实现超1000帧全点密集追踪,短片段APD优于开源密集追踪器20%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30221 2026-09-25 cs.CV 新提交

WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation

WanPE:面向现代文生视频的电影级提示增强

Yubo Zhu, Yawen Shao, Ziyun Dai, Zixun Fang, Kai Zhu, Siyang Sun, Haolan Xue, Chuxin Wang, Tingyu Weng, Jingming Luo, Chen Shi, Lianghua Huang, Yufeng Ai, Yuzheng Wang, Wenyuan Zhang, Yu Shang, Yuxiang Bao, Zoubin Bi, Jie Xiao, Jinbo Xing, Jiaxing Zhao, Chongyang Zhong, Hengjian Chen, Chenwei Xie, Akide Liu, Zhehan Kan, Yu Liu, Wei Zhai, Sheng Zhong, Wei Tong

机构 * Nanjing University(南京大学) ; Wan Team, Alibaba Group(阿里巴巴集团万相团队) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)

AI总结 WanPE是一个397B参数的提示增强模型,通过视频锚定的反向构建和SC-GRPO实现导演级电影规划,在5-15秒内大幅提升人类偏好,并在30秒领域与Seedance 2.5竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30218 2026-09-25 cs.LG cs.AI 新提交

Minimally Invasive Steering of Language Models

语言模型的微创引导

Taha Entesari, Jingyu Zhang, Daniel Khashabi, Mahyar Fazlyab

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 提出微创引导向量优化(MISVO),通过局部KL几何惩罚干预,在不更新参数的情况下优化位置特定干预,在约1B-14B参数的偏好和代码生成任务中取得最高平均奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30214 2026-09-25 cs.RO cs.AI 新提交

Underwater C3-JEPA: An Object-Centric Cross-View World Model for ROV Salvage

水下C3-JEPA:面向ROV打捞的以对象为中心的跨视角世界模型

Yuncong Yang, Jinlong Li, Yulong Xue, Feng Wu, Chunwen Zhang, Lei Qiao, Xuyang Wang

机构 * Underwater Engineering Institute, Shanghai Jiao Tong University(上海交通大学水下工程研究所)

AI总结 本文提出水下C3-JEPA,一种以对象为中心的多视角预测世界模型,用于ROV打捞,通过跨视角注意力预测任务对象状态,支持MPC评估,并在真实视频中验证了其迁移能力。

Comments Submitted to the IEEE for possible publication. 12 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30213 2026-09-25 cs.RO 新提交

ReVAMP: Vector-Accelerated Motion Planning for Kinematically-Constrained Systems via Reparameterization

ReVAMP:通过重参数化实现运动学约束系统的向量加速运动规划

Shrutheesh R. Iyer, Thomas Cohn, Zachary Kingston

机构 * Purdue University(普渡大学) ; Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出ReVAMP,一种基于解析逆运动学重参数化规划空间的向量化运动规划方法,通过暴露并行性解决现有低效问题,在高达20维复杂约束系统中实现比最先进技术快10倍的微秒级规划,并促进顺序操作流程的重组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30210 2026-09-25 cs.CV cs.LG 新提交

The Alignment Illusion in Multimodal Large Language Models

多模态大语言模型中的对齐错觉

Hong-Han Wang, Yuntao Wang, Hu Ding

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本研究揭示多模态大语言模型中视觉-文本对齐分数可能仅反映权重诱导的伪相似性,并提出主角度间隙(PA gap)作为更可靠的几何诊断指标,以准确反映视觉流与任务表现的关系。

Comments Accepted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30205 2026-09-25 cs.AI 新提交

A Living Benchmark for Information Retrieval from Electronic Health Records

电子健康记录信息检索的活基准

Jordan L. Cahoon, Chloe O. Stanwyck, Sulaiman Somani, Philip Chung, Kevin R Keet, Kameron C. Black, Andrea T. Fisher, Sarita Khemani, Jerry Liu, Stephen Ma, Saloni K. Maharaj, Rita M. Pandya, Eduardo Perez-Guerrero, Priyanka Pillai, Lisa Shieh, David J. H. Wu, James Xie, James C. McAvoy, Teresa Nguyen, Jessica Tran, Lucy Yin, Bridget Lin, Alison Callahan, Jason A. Fries, Nigam H. Shah, Emily Alsentzer

机构 * Stanford University(斯坦福大学) ; Stanford Cancer Center(斯坦福癌症中心) ; Weill Cancer Hub West(威尔癌症中心西部分中心) ; Stanford School of Medicine(斯坦福医学院)

AI总结 提出可自动生成问答对的活基准BRIE,经临床医生验证,可持续更新,用于严格评估临床LLM在EHR信息检索中的性能,发现现有系统常遗漏重要信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30199 2026-09-25 cs.AI cs.CL 新提交

ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds

ExplorationBench:在可验证的外星世界中衡量AI系统的探索能力

Ming Zhang, Zhenghao Xiang, Peizhong Gao, Yujiong Shen, Yuhui Wang, Zhonghan Yue, Shihan Dou, Zhangyue Yin, Junjie Ye, Shichun Liu, Weihuang Zheng, Jiahao Chen, Jiayi Chen, Hongzhang Liu, Jiaqi Shao, Tao Gui, Qi Zhang, Xuanjing Huang, Suncong Zheng, Maxm Pan

机构 * Fudan University(复旦大学) ; Hunyuan Team Tencent(腾讯混元团队) ; Tsinghua University(清华大学)

AI总结 ExplorationBench通过可执行规则与冲突知识的外星世界沙盒,将科学探索评估转化为可验证任务,实验表明最强AI能获取新规则但性能波动且探索可能停滞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30192 2026-09-25 cs.AI 新提交

SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance

SAGE:通过拓扑引导缓解长程推理偏差

Xinyue Zeng, Jiawei Zhang, Yujun Yan, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) ; University of Wisconsin Madison(威斯康星大学麦迪逊分校) ; Dartmouth College(达特茅斯学院)

AI总结 SAGE通过代数稀疏化和双曲结构引导,统一缓解长程推理中的探索与复合偏差,在12个基准上超越基线,并在Andrews-Curtis问题上实现8倍改进。

Comments Accepted by NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30187 2026-09-25 cs.CV cs.RO 新提交

Ego-Exo4D Human Meshes Dataset: 4D Human Motion Reconstruction for Ego-Exo Captures

Ego-Exo4D 人体网格数据集:面向 Ego-Exo 捕捉的 4D 人体运动重建

Abhiram Maddukuri, Georgios Pavlakos

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 针对 Ego-Exo4D 仅含稀疏 3D 姿态标注的问题,提出 Ego-Exo4D-HM 大规模 4D 人体运动重建数据集及配套流程,促进技能学习与具身 AI 研究。

Comments Project website: https://abhiram824.github.io/egoexo4d_human_meshes

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30184 2026-09-25 cs.CL 新提交

ARGUS: Role-Aware Event Knowledge Graphs for U.S. Employment-Discrimination Complaints

ARGUS:面向美国就业歧视投诉的角色感知事件知识图谱

Sriram Kannan, Swetha Saseendran, Vishnu Vardhan Reddy Kandi, Leslie Barrett, Madhavan Seshadri, Enrico Santus

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Bloomberg(彭博)

AI总结 针对美国就业歧视投诉,提出ARGUS流水线,结合5W1H模式和法律模型构建文档级事件知识图谱,实验表明图结构分类优于基线,且EKG检索提升文档级问答。

Comments 9 pages, NLLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30177 2026-09-25 cs.AI 新提交

Search-Aware Reinforcement Learning for Multi-Component Query Understanding in Roblox Game Search

面向Roblox游戏搜索中多组件查询理解的搜索感知强化学习

Nayoung Choi, Shengjian Chen, Xiaokai Wei, Wenzheng Zhang, Daiyao Yi, Rachit Pareek, Vincent Su, Michelle Gong, Jinho D. Choi

机构 * Emory University(埃默里大学) ; Roblox Corporation(Roblox 公司)

AI总结 提出搜索感知强化学习框架,通过蒸馏-强化学习范式优化Roblox搜索中多组件查询理解,组件级奖励提升NDCG@20达8.9点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30167 2026-09-25 cs.CL cs.LG cs.SD stat.AP 新提交

Do Audio Language Models Hear and Read Distinctive Features Alike?

音频语言模型在听觉与阅读时是否以相同方式表征区别性特征?

Yuanhao Chen, Peter Chin

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院塞耶工程学院)

AI总结 本研究探究音频语言模型在语音和文本输入下是否以相同方向表征区别性特征,发现仅Qwen2.5-Omni模型的浊音特征显著,且模型家族而非规模决定模态差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30160 2026-09-25 cs.CL eess.AS 新提交

A Training Criterion with Token-Level Tolerance to Transcription Ambiguity for Automatic Speech Recognition

一种具有词元级转录歧义容忍度的自动语音识别训练准则

Saurabh Kumar, Diptiman Mohanta, Prasanta Kumar Ghosh

机构 * Indian Institute of Science (IISc)(印度科学研究院)

AI总结 针对转录歧义,提出词元级通配符弧的CTC变体OTC,结合词元与词级逃逸路径及熵索引调度,在19语言25任务上优于CTC,平均相对WER降低9.45%。

Comments 5 pages, 2 figures, 4 tables; submitted to ICASSP 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30150 2026-09-25 cs.LG 新提交

Graph-Based Inference and Topology-Aware Multi-Agent Reinforcement Learning for Large-Scale Railway Network Management

基于图推理与拓扑感知的多智能体强化学习用于大规模铁路网络管理

Giacomo Arcieri, Gregory Duthé, Christophe Muller, Konstantinos G. Papakonstantinou, Daniel Straub, Eleni Chatzi

机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Oxford(牛津大学) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Technical University of Munich(慕尼黑工业大学)

AI总结 针对大规模铁路网络管理,提出结合图推理与拓扑感知多智能体强化学习框架,实现零样本迁移,显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30147 2026-09-25 cs.AI cs.CL cs.LG cs.MA 新提交

GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI

GRASP:基于智能体AI的战略规划生成、修订与评估

Arunabh Srivastava, Mohammad A., Khojastepour, Srimat Chakradhar, Sennur Ulukus

机构 * University of Maryland, College Park(马里兰大学帕克分校) ; NEC Laboratories America, Inc.(NEC美国实验室公司)

AI总结 GRASP是一个策略感知的多阶段规划框架,通过解耦生成、修订和评估模块,显著提升了复杂任务中LLM的规划准确率,并在多任务场景下消除了性能下降。

Comments Accepted at the Second Workshop for Research on Agent Language Models (REALM) at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30140 2026-09-25 cs.RO 新提交

Contact as a Decision Variable: Capability-Tradeoff Contact Selection for Legged Loco-Manipulation

接触作为决策变量:腿式移动操作中能力权衡的接触选择

Al Jaber Mahmud, Shuai Li, Xuan Wang

机构 * George Mason University(乔治梅森大学) ; University of Florida(佛罗里达大学)

AI总结 本文提出能力权衡接触选择(CTCS)方法,用于腿式移动操作中联合选择支撑接触与全身配置,通过预测能力并加速优化,在仿真和硬件实验中优于固定接触方案。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
↑