arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 2467
2609.17524 2026-09-16 cs.RO 新提交

Modality-Autoregressive World-Action Models

模态自回归世界-动作模型

Adam Hung, Bardienus P. Duisterhof, Deva Ramanan, Jeffrey Ichnowski

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出ModAR,一种模态自回归世界-动作模型,通过序列去噪多种未来模态(如点轨迹、DINO特征、深度)来提升动作预测性能,在多个数据规模下取得最高平均成功率,且训练效率高,无需预训练。

Comments Project page: https://adamhung60.github.io/ModAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17521 2026-09-16 cs.CV cs.AI cs.GR 新提交

PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control

PhysStream:基于结构化场景记忆与细粒度运动控制的流式物理驱动视频生成

Chuhao Chen, Peter Wonka, Chaoyang Wang, Chen Wang, Qiao Feng, Sergey Tulyakov, Lingjie Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) Snap Inc.(Snap公司) KAUST(阿卜杜拉国王科技大学)

AI总结 PhysStream提出一种自回归视频生成模型,通过结构化场景记忆和稀疏速度增量信号实现物理驱动的细粒度运动控制,支持交互式生成中控制,显著降低运动分布距离和轨迹误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17516 2026-09-16 cs.CL cs.AI 新提交

When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control

大型语言模型何时应弃权(不执行)?自我提问链用于选择性风险控制

Ali Şenol

机构 * Tarsus University(塔尔苏斯大学)

AI总结 本文提出自我提问链框架,通过显式评估所需信息实现选择性风险控制,在TruthfulQA上使错误承诺率相对降低32.1%,准确率提升至89.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17515 2026-09-16 cs.CL 新提交

What Breaks Under Pruning in Smart Homes, and When? Evaluating LLM Degradation Across Architectures and Task Complexity

剪枝在智能家居中何时失效?评估LLM在不同架构和任务复杂度下的性能退化

Congjing Zhang, Vashishtha Patil, Henning Lange, Usman Aleem

机构 * Alexa Home AI, Amazon.com(亚马逊 Alexa 家庭人工智能) University of Washington(华盛顿大学)

AI总结 本研究系统评估剪枝对智能家居工具调用LLM的影响,发现密集模型安全剪枝区域窄且易急剧退化,MoE模型更鲁棒,并揭示剪枝先损害上下文特异性后损害意图,强调需超越总体准确率评估剪枝效果。

Comments Submitted to EACL Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17509 2026-09-16 cs.SD cs.AI cs.CL 新提交

LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs

LACE:用于动态帧率编解码器的分层压缩

Thanapat Trachu, Samuele Cornell, William Chen, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 LACE提出了一种层自适应动态帧率音频编解码器,通过每层独立压缩和联合对齐机制,在重建任务上取得更优的率-质量权衡,并提升TTS推理效率。

Comments Accepted to SLT 2026. 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17499 2026-09-16 cs.LG cs.AI cs.RO 新提交

ENCP: Episode-Normalized Conformal Prediction for Vision-and-Language Navigation

ENCP:面向视觉与语言导航的片段归一化共形预测

Vicky Feliren, A. Taufiq Asyhari, Muhamad Risqi U. Saputra

机构 * Monash University, Indonesia(蒙纳士大学印度尼西亚校区) SEACrowd

AI总结 针对VLN中标准共形预测无法在依赖且变长片段上提供覆盖保证的问题,提出ENCP,通过残差置信度重缩放非一致性分数并每片段校准一个最大分数,在R2R和REVERIE上达到所有步级覆盖目标,提供模型无关的不确定性估计。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17496 2026-09-16 cs.AI cs.CL 新提交

Verifiable Social Reasoning for LLM Assistants

LLM助手的可验证社会推理

Amir Taubenfeld, Zorik Gekhman, Avigail Grinstein-Dabush, Itay Laish, Ariel Goldstein, Marian Croak, Avinatan Hassidim, Yossi Matias, Amir Feder

机构 * Google Research(谷歌研究院) Hebrew University(希伯来大学) University of Cambridge(剑桥大学)

AI总结 本文提出Fuse多智能体模拟框架,通过构造可验证的真实答案评估LLM助手的社会推理能力,发现用户中介加剧难度、模型易受偏见影响且需更多细节,并开源了框架与数据集。

Comments First two authors contributed equally and the order between them was chosen randomly

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17488 2026-09-16 cs.AI 新提交

LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence

LimiX-2:面向通用结构化数据智能的上下文机制网络

Xingxuan Zhang, Gang Ren, Hao Yuan, Hao Zou, Hongze Tan, Hui Wang, Jianhao Song, Jiansheng Li, Jiayao Zhang, Jinghan Zhang, Kaifang Li, Lang Mo, Li Mao, Mingchao Hao, Nuo Xu, Rui Ding, Ruiji Zhang, Shuyang Li, Siyu Mei, Tianyang Zhang, Weiyang Mu, Yancheng Dong, Yongxian Wei, Yuan Xue, Yuanrui Wang, Yue He, Zijia Yang, Ziyun Li, Dongzhe Li, Fuqiang Wang, Jiandong Liu, Jiawei Chen, Jiaxin Du, Kaijie Cheng, Kehan Li, Lei Sun, Linjun Zhou, Ningbo Dai, Qi Wang, Renzhe Xu, Shaoxing Du, Shumeng Yang, Wang Lu, Wenjing Chu, Xiannan Huang, Xiaoyu Lin, Xing Ai, Xinyan Han, Xuanyue Li, Xuanyue Su, Xukun Zhang, Yan Lu, Yaxin Zhang, Yi Qin, Yifei Huang, Yihan Xu, Yongle Lv, Yuanyuan Jiang, Yushan Han, Peng Cui

机构 * Stable AI Tsinghua University(清华大学)

AI总结 LimiX-2采用上下文机制网络范式,通过联合建模和结构因果模型预训练,在多个基准上超越现有表格模型,并具备因果骨架恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17479 2026-09-16 cs.CV cs.AI 新提交

Det-LIME: Detector-Aware, Multi-Instance Local Interpretable Model-Agnostic Explanations for Automated Marine Mammal Detection

Det-LIME:面向自动化海洋哺乳动物检测的检测器感知、多实例局部可解释模型无关解释

Jiayi Zhou, David W. Johnston, Brinnae Bent

机构 * Duke University(杜克大学)

AI总结 Det-LIME通过检测器感知的多实例LIME方法,为海洋哺乳动物检测提供框对齐的实例级解释,显著提升多实例归因性能,支持调试与数据优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17463 2026-09-16 cs.RO 新提交

Gaussian Processes for Modelling Spatial Fields with Robot Swarms

高斯过程用于机器人集群空间场建模

Guillermo Legarda Herranz, Gianpiero Francesca, Mauro Birattari

机构 * IRIDIA, Université libre de Bruxelles(布鲁塞尔自由大学IRIDIA) Toyota Motor Europe(丰田汽车欧洲公司)

AI总结 针对机器人集群在无外部定位系统时建模空间场的问题,提出无位置感知高斯过程回归(LU-GPR),利用本地感知和通信推断场分布并达成共同参考系,实验表明其可扩展且鲁棒,并可用于人群流动估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17458 2026-09-16 cs.CV cs.LG 新提交

Tables Decoded: DELTA for Structure, TARQA for Understanding

表格解码:DELTA 用于结构,TARQA 用于理解

Jahanvi Rajput, Dhruv Kudale, Saikiran Kasturi, Utkarsh Verma, Ganesh Ramakrishnan

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) BharatGen

AI总结 针对表格理解,提出基于结构化文本的DELTA和TARQA,分别处理结构识别和问答,在多个基准上达到先进性能,并验证了多语言鲁棒性。

Comments Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17450 2026-09-16 cs.CV 新提交

ORCA: Occlusion-Aware Refinement and Completion for Novel View Synthesis

ORCA:面向新视角合成的遮挡感知细化与补全

Weronika Jakubowska, Maciej Zięba, Przemysław Spurek

机构 * Wrocław University of Science and Technology(弗罗茨瓦夫理工大学) Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所)

AI总结 ORCA提出一种遮挡感知的新视角合成方法,利用单目深度和RGB-D信息修复小间隙,仅在必要时使用生成式修复,减少幻觉并提升重建质量。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17443 2026-09-16 cs.CV 新提交

BrainFocus: EEG-Guided ROI Selection for Efficient Vision-Language Models

BrainFocus:用于高效视觉语言模型的EEG引导感兴趣区域选择

Yihui Peng, Guorui Lu, Qinyu Chen

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿大学高级计算机科学研究所(LIACS))

AI总结 提出BrainFocus框架,利用EEG信号引导VLM仅处理相关ROI,在40类基准上提升VQA准确率4.14-9.87pp并减少23.2%-39.5%计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17435 2026-09-16 cs.CL 新提交

Right Tool, Right Job: Native-Language Evaluation, Tokenizer Sensitivity, and Methodological Findings from a French-Only BabyLM

合适的工具,合适的工作:仅法语BabyLM的原生语言评估、分词器敏感性与方法论发现

Adam Zachary Wasserman, David Beauchemin

机构 * Open Honest Foundation(开放诚实基金会) Group for Research in Artificial Intelligence of Laval University (GRAIL)(拉瓦尔大学人工智能研究组(GRAIL)) Université Laval(拉瓦尔大学)

AI总结 本研究提交仅法语的MéTRON-FR模型至BabyLM,通过原生基准和跨语言评估验证其语法能力,并揭示分词器伪影对零样本评分的影响,提出标准诊断方法。

Comments Accepted at BabyLM Workshop at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17430 2026-09-16 cs.RO cs.SY eess.SY 新提交

Hamilton-Jacobi Reachability for Hybrid Systems: Unified Goal-Driven Control with Safety Guarantees

Hamilton-Jacobi可达性用于混合系统:具有安全保证的统一目标驱动控制

Javier Borquez, Shuang Peng, Somil Bansal

机构 * Universidad de Santiago de Chile(智利圣地亚哥大学) University of Southern California(南加州大学) Stanford University(斯坦福大学)

AI总结 本文扩展Hamilton-Jacobi可达性分析至混合系统,提出安全集刻画、最小限制安全滤波器及混合后向可达-避碰管,实现安全与目标驱动控制,并经四足机器人仿真与实验验证。

Journal ref Borquez J, Peng S, Bansal S. Hamilton-Jacobi reachability for hybrid systems: Unified goal-driven control with safety guarantees. The International Journal of Robotics Research. 2026;0(0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17429 2026-09-16 cs.LG cs.AI 新提交

Learning-Guided Planning in Large Dynamic Action Spaces: Budgeted Tree Search for One-to-Many Mobile Charging

大规模动态动作空间中的学习引导规划:用于一对多移动充电的预算树搜索

Liang-Ching Tao, Pi-Chung Wang

机构 * National Chung Hsing University(国立中兴大学)

AI总结 针对大规模动态动作空间中的一对多移动充电问题,提出LP-BTS学习引导规划架构,结合图提议策略、价值评论器和预算树搜索,在250传感器场景中实现最高存活率0.4545。

Comments 15 pages, 7 figures. Learning-guided planning, budgeted tree search, PUCT, and sequential decision-making in large dynamic action spaces

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17427 2026-09-16 cs.CV cs.AI 新提交

Tracking the Unseen: An Occlusion-Robust Framework for Target Tracking Under Full and Long-Term Occlusion

追踪未见之物:一种在全遮挡和长期遮挡下进行目标跟踪的遮挡鲁棒框架

Mais Mohammed, Sharifa Mohammed, Hanan Awadh, Haneen Bamaas, Raghad Bawazeer, Elham Alghamdi

机构 * University of Jeddah(吉达大学)

AI总结 提出一种遮挡鲁棒跟踪框架,集成YOLOv11n、卡尔曼滤波和遮挡感知重识别,在OVIS和军事数据集上显著提升MOTA和IDF1,减少身份切换。

Comments 25 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17422 2026-09-16 cs.AI eess.SP 新提交

Talking Head Synthesis with Facial Landmark Guidance via 3D Gaussian Splatting

基于3D高斯泼溅的面部关键点引导的说话头生成

Ziheng Yang, Yinfeng Yu, Yongming Li

机构 * Xinjiang University(新疆大学) Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)

AI总结 针对音频驱动说话头中嘴部运动不准确和表情细节弱的问题,提出基于3D高斯泼溅的面部关键点引导空间增强与全局补偿方法,提升视觉质量、真实感和唇同步。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17421 2026-09-16 cs.AI eess.SP 新提交

Transformer-Based Token Fusion and Dynamic Graph Planning for Audio-Visual Navigation

基于Transformer的令牌融合与动态图规划用于视听导航

Shaohang Wu, Yinfeng Yu

机构 * Xinjiang University(新疆大学)

AI总结 针对视听导航中视觉信息缺失导致规划低效的问题,提出TDGP模型,融合Transformer多模态令牌融合与动态图规划,通过碰撞惩罚强制重规划,在Replica和MP3D数据集上超越基线并提升泛化能力。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17419 2026-09-16 cs.AI 新提交

World Model Science: Self-Organized Criticality, Weak Chaos, and Metastable Belief Dynamics in Long-Horizon LLM Agents

世界模型科学:长时程LLM智能体中的自组织临界性、弱混沌与亚稳态信念动力学

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

AI总结 该研究通过自组织临界性、弱混沌和亚稳态信念动力学三个视角,分析长时程LLM智能体的轨迹,提出基于轨迹级动力学诊断的世界模型科学方法,并在22项实验中验证其有效性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17416 2026-09-16 cs.AI 新提交

Never Stop Thinking: Continuous-Time Language Agents

永不停思:连续时间语言智能体

Bojie Li, Noah Shi

机构 * Pine AI University of Washington(华盛顿大学)

AI总结 本文提出连续时间语言智能体,通过中断-恢复编排实现边听边思、边说边思,降低延迟,并引入ReactiveBench基准,证明可验证信号与在线RL优化使连续思考有益于任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17414 2026-09-16 cs.CV cs.RO 新提交

SlotDiT: Object-Centric Representations for Diffusion Transformers

SlotDiT:扩散Transformer的以对象为中心的表示

Gjergj Plepi, Sven Behnke

机构 * University of Bonn(波恩大学)

AI总结 SlotDiT提出以对象为中心的槽作为扩散Transformer的潜在表示,用于文本引导的机器人视频生成,在保持生成质量的同时提升任务完成率并降低计算成本。

Comments Accepted at BMVC 2026. Project page: https://slot-dit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17413 2026-09-16 cs.CV 新提交

SSC-Priors: Exploring Semantic and Visibility Priors to Boost Lidar Semantic Scene Completion

SSC-Priors:探索语义与可见性先验以提升激光雷达语义场景补全

Tetiana Martyniuk, Jonathan Seele, Alexandre Boulch, Gilles Puy, Renaud Marlet, Raoul de Charette

机构 * Inria(法国国家信息与自动化研究所) ETH Zürich(苏黎世联邦理工学院) LIGM, CNRS, Univ Gustave Eiffel, ENPC, IP Paris(法国国家科学研究中心、古斯塔夫·埃菲尔大学、巴黎高科路桥学校、巴黎综合理工学院LIGM实验室)

AI总结 本文提出利用语义伪标签和传感器可见性信息作为简单先验,无需复杂架构改动即可显著提升激光雷达语义场景补全性能,并在多个基准上验证了有效性。

Comments Extended version of arXiv:2606.03992

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17405 2026-09-16 cs.RO 新提交

Optimized Wrench Polytope Analysis for Real-Time Stability Control of Legged Robots in Complex Multi-Contact Configurations

优化扳手多面体分析用于复杂多接触配置下腿式机器人实时稳定性控制

Friedrich Graaf, Elias Birkefeld, Christian Eichmann, Elias Hofele, Tristan Schnell, Georg Heppner, Arne Roennau, Rüdiger Dillmann

机构 * FZI Research Center for Information Technology(FZI信息技术研究中心)

AI总结 针对腿式机器人在复杂多接触场景下的稳定性控制,提出优化扳手多面体分析算法,实现49Hz实时计算,并在仿真和实际硬件上验证了超越现有控制器的稳定性。

Comments 8 pages, 8 figures, submitted to the IEEE ROBIO 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17404 2026-09-16 cs.RO 新提交

Residual Fault Adaptation for Dexterous In-Hand Manipulation Under Runtime Joint Faults

残余故障自适应:运行时关节故障下的灵巧手内操作

Linan Deng, Xing Liu, Lin Hong, Feng Hua, Guijun Ma, Zuogong Yue, Fumin Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对灵巧手运行时关节故障,提出教师锚定的残余故障自适应框架,通过循环残差策略和故障注入域随机化训练,在仿真和真实机器人上提升操作性能并实现零样本部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17398 2026-09-16 cs.CL 新提交

Enhancing Accessibility of Medical Texts through Large Language Model-Driven Plain Language Adaptation

通过大语言模型驱动的平实语言适配增强医学文本的可及性

Ting-Wei Chang, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * National Taiwan University(国立台湾大学) Academia Sinica(中央研究院)

AI总结 本研究利用GPT-4o-mini等大语言模型及混合智能体技术实现医学文本的平实语言适配,通过提示策略比较、QLoRA微调和MoA集成,在简化医疗信息的同时保留核心内容。

Comments 10 pages, 3 figures, 6 tables. Published in the Proceedings of the Thirty-Third Text REtrieval Conference (TREC 2024), Plain Language Adaptation of Biomedical Abstracts (PLABA) track

Journal ref Proceedings of the Thirty-Third Text REtrieval Conference (TREC 2024), NIST Special Publication 1329, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17391 2026-09-16 cs.AI cs.PF 新提交

FlashVector: Agent for Hierarchical Model Serving Stack Optimization

FlashVector:用于分层模型服务栈优化的智能体

Qi Wu, Lohan Lemire, Kai Meng, Zhongmou Cai, Raphael Bargues, Petr Zhitnikov, Zeyuan Cao, Yao Wang, Shujun Bian, Wei Chen, Sean Sheng

机构 * Stanford University(斯坦福大学) Unity Vector AI Team(Unity Vector AI 团队)

AI总结 FlashVector是一个智能体系统,通过可扩展框架跨层优化模型服务栈,在Unity广告平台实现高达2倍吞吐量提升和1.98倍延迟加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17387 2026-09-16 cs.CV 新提交

PanoGS-SLAM: Panoramic 3D Gaussian Splatting SLAM

PanoGS-SLAM:全景3D高斯泼溅SLAM

Yongqi Mao, Hao Shi, Yufan Zhang, Zhonghua Yi, Xiangfei Guo, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) National University of Defense Technology(国防科技大学)

AI总结 针对窄视场相机SLAM位姿可观测性差的问题,提出首个基于3D高斯泼溅的全景稠密SLAM系统,通过球面域可微渲染和深度引导初始化,在PALVIO和SynPano基准上实现更优的跟踪精度与渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17386 2026-09-16 cs.LG 新提交

Bridging the Confidence Gap: Temperature Scaling for Calibrating Test-Time Prompt Tuning

弥合置信度差距:用于校准测试时提示调优的温度缩放

Yuwei Liang, Jian Liang, Dapeng Hu, Yinuo Xu, Ran He

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 针对测试时提示调优校准不佳的问题,提出基于温度缩放的CoTS及其集成版本E-CoTS,在降低校准误差的同时提升准确率,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.17384 2026-09-16 cs.RO cs.MA 新提交

Exact Fusion and Coordinated Exploration in Multi-Robot Active Inference

多机器人主动推断中的精确融合与协调探索

Peng Wu, Mohsen Imani, Amidu Kamara, Md Tamzeed Islam, Seyede Fatemeh Ghoreishi, Mahdi Imani

机构 * Northeastern University(东北大学) University of California, Irvine(加州大学尔湾分校) U.S. Department of Homeland Security(美国国土安全部) Oracle Corporation(甲骨文公司)

AI总结 针对多机器人主动推断中融合与规划阶段的重复计数误差,提出通过共享自然参数添加证据增量实现精确融合,并采用顺序承诺协调探索,以线性成本逼近集中式规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏