arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3100 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3100 篇

2601.08388 2026-01-14 cs.AI 57%

Creativity in AI as Emergence from Domain-Limited Generative Models

人工智能中的创造力作为领域受限生成模型的涌现

Corina Chutaux

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04791 2026-01-13 cs.AI 57%

What-If Analysis of Large Language Models: Explore the Game World Using Proactive Thinking

大型语言模型的What-If分析:通过前瞻性思维探索游戏世界

Yuan Sui, Yanming Zhang, Yi Liao, Yu Gu, Guohua Tang, Zhongqian Sun, Wei Yang, Bryan Hooi

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 WiA-LLM通过前瞻性思维提升大型语言模型在复杂游戏环境中的决策能力,实现74.2%的预测准确率和更接近专家玩家的策略行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15234 2026-01-06 q-bio.NC cs.AI 57%

Adaptive Intelligence: leveraging insights from adaptive behavior in animals to build flexible AI systems

自适应智能:借鉴动物适应性行为的洞察来构建灵活的AI系统

Mackenzie Weygandt Mathis

机构 * Biological intelligence is inherently adaptive(生物智能本质上是适应性的)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出通过借鉴动物适应性行为的洞察,构建能够在线学习、泛化和快速适应环境变化的自适应AI系统。

Comments 10 pages, 4 figures

Journal ref Nature Neuroscience Dec 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22973 2026-01-05 cs.CV 57%

YOLO-IOD: Towards Real Time Incremental Object Detection

YOLO-IOD:朝向实时增量物体检测

Shizhou Zhang, Xueqiang Lv, Yinghui Xing, Qirui Wu, Di Xu, Chen Zhao, Yanning Zhang

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 YOLO-IOD通过解决增量学习中的知识冲突问题,提出了一种基于预训练YOLO-World模型的实时增量物体检测框架,有效减少遗忘并提升检测性能。

Comments AAAI 2026 accepted. Code & models are available at: https://github.com/qiangzai-lv/YOLO-IOD

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18741 2025-12-24 cs.CV 57%

Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation

记忆与生成:迈向实时视频生成中的长期一致性

Tianrui Zhu, Shiyi Zhang, Zhirui Sun, Jingqi Tian, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 MAG通过分离内存压缩与帧生成任务,提升实时视频生成的长期一致性与效率。

Comments Code will be released at https://github.com/Xilluill/MAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18489 2025-12-23 cs.AI 57%

Large Language Models as Discounted Bayesian Filters

大语言模型作为折扣贝叶斯滤波器

Jensen Zhang, Jing Yang, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本研究提出了一种贝叶斯过滤框架,揭示大语言模型在动态环境中的信念更新机制,并提出提示策略以优化其先验校准。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07576 2025-12-23 cs.CV 57%

Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding

超级编码网络:多模态编码器的递归关联用于视频理解

Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出超级编码网络,通过递归关联多模态编码器提升视频理解性能,显著提升跟踪、识别、聊天和编辑等任务效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17250 2025-12-22 cs.AI 57%

Accelerating Multi-modal LLM Gaming Performance via Input Prediction and Mishit Correction

通过输入预测和误位修正加速多模态大语言模型游戏性能

Ziyang Lin, Zixuan Sun, Sanhorn Chen, Xiaoyang Chen, Roy Zhao

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 通过输入预测和误位修正方法,显著降低多模态大语言模型游戏性能的推理延迟,提升整体控制效果。

Comments UIUC 25 Fall CS 498

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16924 2025-12-19 cs.CV 57%

The World is Your Canvas: Painting Promptable Events with Reference Images, Trajectories, and Text

世界是你的画布:通过参考图像、轨迹和文本绘画可提示事件

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Yue Yu, Yihao Meng, Wen Wang, Ka Leong Cheng, Shuailei Ma, Qingyan Bai, Yixuan Li, Cheng Chen, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) NEU(南京大学) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 WorldCanvas通过结合文本、轨迹和参考图像,实现可提示的多代理交互事件生成,提升世界模型的交互性和可控性。

Comments Project page and code: https://worldcanvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15621 2025-12-18 cs.CV 57%

OccSTeP: Benchmarking 4D Occupancy Spatio-Temporal Persistence

OccSTeP:4D占用率时空持续性基准测试

Yu Zheng, Jie Hu, Kailun Yang, Jiaming Zhang

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 OccSTeP提出了一种4D占用率时空持续性基准,通过OccSTeP-WM模型实现对自动驾驶中未来行为的反应和前瞻性预测,实验结果显示其在语义和占用率指标上均有显著提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14020 2025-12-17 cs.CV 57%

Deep Learning Perspective of Scene Understanding in Autonomous Robots

自主机器人场景理解的深度学习视角

Afia Maham, Dur E Nayab Tashfa

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 本文从深度学习角度综述了自主机器人场景理解中的关键技术,包括目标检测、语义分割、深度估计等,探讨了其在动态环境中的应用与挑战。

Comments 11 pages. Review Paper on Deep Learning Perspective of Scene Understanding in Autonomous Robots

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13707 2025-12-17 physics.bio-ph cs.LG cs.NE stat.ML 57%

Modular connectivity in neural networks emerges from Poisson noise-motivated regularisation, and promotes robustness and compositional generalisation

神经网络中的模块化连接源于受泊松噪声启发的正则化,并促进鲁棒性和组合泛化

Daoyuan Qian, Qiyao Liang, Ila Fiete

机构 * McGovern Institute for Brain Research, Massachusetts Institute of Technology, MA 02139, U.S.A.(麦戈文脑科学研究所,麻省理工学院) K. Lisa Yang Integrative Computational Neuroscience Center in the Yang-Tan Collective(李嘉诚整合计算神经科学中心) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology, MA 02139, U.S.A.(脑科学与认知科学系,麻省理工学院) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology, MA 02139, U.S.A.(电气工程与计算机科学系,麻省理工学院)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本研究通过受泊松噪声启发的正则化方法,揭示了神经网络中模块化连接的形成机制,并展示了其在提升鲁棒性和泛化能力方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10400 2025-12-17 cs.MA cs.AI cs.CL 57%

Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance

重新思考多智能体系统可靠性:从拜占庭容错的角度出发

Lifan Zheng, Jiawei Chen, Qinghong Yin, Jingyuan Zhang, Xinyi Zeng, Yu Tian

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07733 2025-12-09 cs.CV 57%

SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery

SpatialDreamer: 通过主动心理意象激励空间推理

Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) Sun Yat-sen University(孙中山大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23008 2025-12-09 cs.CV 57%

ARSS: Taming Decoder-only Autoregressive Visual Generation for View Synthesis From Single View

ARSS: 通过单视角生成视图的解码器-only 自回归视觉生成的控制

Wenbin Teng, Gonglin Chen, Haiwei Chen, Yajie Zhao

机构 * Institute for Creative Technologies(创意技术研究所) University of Southern California(南加州大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 ARSS通过单视角生成视图,利用自回归模型和相机轨迹指导提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03418 2025-12-04 cs.CV cs.HC 57%

YOLOA: Real-Time Affordance Detection via LLM Adapter

YOLOA:通过LLM适配器实现实时的可及性检测

Yuqi Ji, Junjie Ke, Lihuo He, Jun Liu, Kaifan Zhang, Yu-Kun Lai, Guiguang Ding, Xinbo Gao

机构 * School of Electronic Engineering, Xidian University(电子工程学院,西安电子科技大学) School of Software, Tsinghua University(软件学院,清华大学) School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.CV

AI总结 YOLOA通过LLM适配器实现实时可及性检测,结合对象检测与可及性学习,取得高精度与高效率的平衡。

Comments 13 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03058 2025-12-04 cs.LG 57%

Dynamical Properties of Tokens in Self-Attention and Effects of Positional Encoding

自注意力机制中令牌的动力学特性及位置编码的影响

Duy-Tung Pham, An The Nguyen, Viet-Hoang Tran, Nhan-Phu Chung, Xin T. Tong, Tan M. Nguyen, Thieu N. Vo

机构 * FPT Software AI Center(FPT软件AI中心) National University of Singapore(国立新加坡大学) Ho Chi Minh University of Economics(胡志明经济大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文研究了Transformer中令牌的动力学特性,揭示了位置编码对模型性能的影响,并提出了改进方法以缓解收敛问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02457 2025-12-04 cs.CV 57%

Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation

听觉有助于视觉吗?研究音频视频联合去噪用于视频生成

Jianzong Wu, Hao Lian, Dachao Hao, Ye Tian, Qingyu Shi, Biaolong Chen, Hao Jiang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出通过音频视频联合去噪提升视频生成质量,验证了跨模态训练对构建更物理基础的世界模型的潜力。

Comments Project page at https://jianzongwu.github.io/projects/does-hearing-help-seeing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02016 2025-12-02 cs.CV 57%

Objects in Generated Videos Are Slower Than They Appear: Models Suffer Sub-Earth Gravity and Don't Know Galileo's Principle...for now

生成视频中的物体比看起来更慢:模型遭受次地球重力并目前还不知道伽利略原理...

Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan, Anand Bhattad

机构 * Indian Institute of Science(印度科学研究院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 研究发现视频生成器在重力表示上存在偏差,通过针对性适配可提升其重力模拟精度。

Comments https://gravity-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01878 2025-12-02 cs.AI 57%

Graph Distance as Surprise: Free Energy Minimization in Knowledge Graph Reasoning

图距离作为惊喜:知识图谱推理中的自由能最小化

Gaganpreet Jhajj, Fuhua Lin

机构 * School of Computing(计算学院) Information Systems(信息系统) Athabasca University(亚伯达大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出利用图距离最小化惊喜来改进知识图谱推理,通过连接自由能原理与KG系统,探索图距离在生成模型中的应用及其对语法结构的影响。

Comments Accepted to NORA Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10194 2025-12-02 cs.CV 57%

B2N3D: Progressive Learning from Binary to N-ary Relationships for 3D Object Grounding

B2N3D: 从二元关系到N元关系的3D物体接地的渐进式学习

Feng Xiao, Hongbin Xu, Hai Ci, Wenxiong Kang

机构 * School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) ByteDance Seed(字节跳动种子) Show Lab, National University of Singapore(Show Lab,新加坡国立大学)

专题命中 具身推理 :robotic(abstract);分类 cs.CV

AI总结 B2N3D通过引入N元关系学习提升3D物体接地的准确性,利用分组监督损失和混合注意力机制实现更精确的多模态关系建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11673 2025-12-01 cs.CV 57%

DINO-Foresight: Looking into the Future with DINO

DINO-Foresight: 用DINO展望未来

Efstathios Karypidis, Ioannis Kakogeorgiou, Spyros Gidaris, Nikos Komodakis

机构 * Archimedes, Athena Research Center(阿基米德研究所,雅典研究学院) National Technical University of Athens(雅典国立技术大学) University of Crete(克里特大学) IACM-Forth(福伊恩研究所)

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 DINO-Foresight通过在预训练视觉基础模型的语义特征空间中训练,实现了对未来动态的预测,提升了自动驾驶和机器人领域的环境理解能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21925 2025-12-01 cs.RO 57%

OpenTwinMap: An Open-Source Digital Twin Generator for Urban Autonomous Driving

OpenTwinMap: 一种用于城市自动驾驶的开源数字孪生生成器

Alex Richardson, Jonathan Sprinkle

机构 * Vanderbilt University(范德比大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 OpenTwinMap是一种基于Python的开源框架,用于生成高保真的3D城市数字孪生,通过整合LiDAR和OSM数据,支持自动驾驶模拟和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12718 2025-11-27 cs.CV 57%

EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer

EvoEmpirBench: 基于智能体经验的动态空间推理

Pukun Zhao, Longxiang Wang, Miaowei Wang, Chen Chen, Fanqing Zhou, Haojian Huang

机构 * Guangdong University of Finance and Economics(广东金融学院) Chongqing University(重庆大学) University of Edinburgh(爱丁堡大学) The University of Hong Kong(香港大学)

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 EvoEmpirBench通过动态空间基准评估模型在部分可观测和动态环境下的空间推理与记忆能力,揭示主流模型的限制并提供未来研究平台。

Comments Accepted by AAAI 2026, 29 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18922 2025-11-25 cs.CV 57%

One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control

One4D:通过解耦LoRA控制实现统一的4D生成与重建

Zhenxing Mi, Yuxin Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 One4D通过解耦LoRA控制实现4D生成与重建的统一框架,提升视频扩散模型在几何重建中的性能

Comments Project page: https://mizhenxing.github.io/One4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16567 2025-11-24 cs.CV 57%

POMA-3D: The Point Map Way to 3D Scene Understanding

POMA-3D:点地图方式的3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(伦敦帝国学院)

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 POMA-3D通过点地图实现3D场景理解,结合自监督学习和多视角对齐策略,提升3D任务表现。

Comments 11 pages, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16432 2025-11-21 cs.AI q-bio.NC 57%

From generative AI to the brain: five takeaways

从生成式AI到大脑:五点启示

Claudius Gros

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文探讨生成式AI与大脑之间的潜在联系,通过五个例子展示神经科学可能从机器学习研究中获得的启示。

Comments Frontiers in Computational Neuroscience, in press

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08978 2025-11-13 cs.MM cs.CV 57%

Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding

Jingtian Ma, Jingyuan Wang, Wayne Xin Zhao, Guoping Liu, Xiang Wen

机构 * School of Computer Science and Engineering, and the MOE Engineering Research Center of Advanced Computer Application Technology, Beihang University(计算机科学与工程学院,以及教育部先进计算机应用技术工程研究中心,北京航空航天大学) School of Computer Science and Engineering, the School of Economics and Management, and the MIIT Key Laboratory of Data Intelligence and Management, Beihang University(计算机科学与工程学院,经济管理学院,以及工信部数据智能与管理重点实验室,北京航空航天大学) Gaoling School of Artificial Intelligence, Renmin University of China(中关村人工智能学院,中国人民大学) DiDi Global Inc.(滴滴出行公司)

专题命中 具身推理 :navigation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17685 2025-11-12 cs.CV 57%

FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving

Shuang Zeng, Xinyuan Chang, Mengwei Xie, Xinran Liu, Yifan Bai, Zheng Pan, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团) DAMO Academy, Alibaba Group(阿里巴巴达摩院)

专题命中 具身推理 :world model(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 as Spotlight Presentation. Code: https://github.com/MIV-XJTU/FSDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04670 2025-11-07 cs.CV 57%

Cambrian-S: Towards Spatial Supersensing in Video

Shusheng Yang, Jihan Yang, Pinzhi Huang, Ellis Brown, Zihao Yang, Yue Yu, Shengbang Tong, Zihan Zheng, Yifan Xu, Muhan Wang, Daohan Lu, Rob Fergus, Yann LeCun, Li Fei-Fei, Saining Xie

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

Comments Website: https://cambrian-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏