Creativity in AI as Emergence from Domain-Limited Generative Models
人工智能中的创造力作为领域受限生成模型的涌现
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
人工智能中的创造力作为领域受限生成模型的涌现
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。
大型语言模型的What-If分析:通过前瞻性思维探索游戏世界
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 WiA-LLM通过前瞻性思维提升大型语言模型在复杂游戏环境中的决策能力,实现74.2%的预测准确率和更接近专家玩家的策略行为。
自适应智能:借鉴动物适应性行为的洞察来构建灵活的AI系统
机构 * Biological intelligence is inherently adaptive(生物智能本质上是适应性的)
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 本文提出通过借鉴动物适应性行为的洞察,构建能够在线学习、泛化和快速适应环境变化的自适应AI系统。
Comments 10 pages, 4 figures
Journal ref Nature Neuroscience Dec 2025
YOLO-IOD:朝向实时增量物体检测
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 YOLO-IOD通过解决增量学习中的知识冲突问题,提出了一种基于预训练YOLO-World模型的实时增量物体检测框架,有效减少遗忘并提升检测性能。
Comments AAAI 2026 accepted. Code & models are available at: https://github.com/qiangzai-lv/YOLO-IOD
记忆与生成:迈向实时视频生成中的长期一致性
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 MAG通过分离内存压缩与帧生成任务,提升实时视频生成的长期一致性与效率。
Comments Code will be released at https://github.com/Xilluill/MAG
大语言模型作为折扣贝叶斯滤波器
机构 * Sun Yat-sen University(中山大学)
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 本研究提出了一种贝叶斯过滤框架,揭示大语言模型在动态环境中的信念更新机制,并提出提示策略以优化其先验校准。
Comments Under submission
超级编码网络:多模态编码器的递归关联用于视频理解
机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 本文提出超级编码网络,通过递归关联多模态编码器提升视频理解性能,显著提升跟踪、识别、聊天和编辑等任务效果。
通过输入预测和误位修正加速多模态大语言模型游戏性能
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 通过输入预测和误位修正方法,显著降低多模态大语言模型游戏性能的推理延迟,提升整体控制效果。
Comments UIUC 25 Fall CS 498
世界是你的画布:通过参考图像、轨迹和文本绘画可提示事件
机构 * HKUST(香港科技大学) ; Ant Group(蚂蚁集团) ; ZJU(浙江大学) ; NEU(南京大学) ; CUHK(香港中文大学) ; NTU(南洋理工大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 WorldCanvas通过结合文本、轨迹和参考图像,实现可提示的多代理交互事件生成,提升世界模型的交互性和可控性。
Comments Project page and code: https://worldcanvas.github.io/
OccSTeP:4D占用率时空持续性基准测试
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 OccSTeP提出了一种4D占用率时空持续性基准,通过OccSTeP-WM模型实现对自动驾驶中未来行为的反应和前瞻性预测,实验结果显示其在语义和占用率指标上均有显著提升。
Comments 16 pages, 5 figures
自主机器人场景理解的深度学习视角
专题命中 具身推理 :navigation(abstract);分类 cs.CV
AI总结 本文从深度学习角度综述了自主机器人场景理解中的关键技术,包括目标检测、语义分割、深度估计等,探讨了其在动态环境中的应用与挑战。
Comments 11 pages. Review Paper on Deep Learning Perspective of Scene Understanding in Autonomous Robots
神经网络中的模块化连接源于受泊松噪声启发的正则化,并促进鲁棒性和组合泛化
机构 * McGovern Institute for Brain Research, Massachusetts Institute of Technology, MA 02139, U.S.A.(麦戈文脑科学研究所,麻省理工学院) ; K. Lisa Yang Integrative Computational Neuroscience Center in the Yang-Tan Collective(李嘉诚整合计算神经科学中心) ; Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology, MA 02139, U.S.A.(脑科学与认知科学系,麻省理工学院) ; Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology, MA 02139, U.S.A.(电气工程与计算机科学系,麻省理工学院)
专题命中 具身推理 :world model(abstract);分类 cs.LG
AI总结 本研究通过受泊松噪声启发的正则化方法,揭示了神经网络中模块化连接的形成机制,并展示了其在提升鲁棒性和泛化能力方面的优势。
重新思考多智能体系统可靠性:从拜占庭容错的角度出发
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。
SpatialDreamer: 通过主动心理意象激励空间推理
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) ; Sun Yat-sen University(孙中山大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。
ARSS: 通过单视角生成视图的解码器-only 自回归视觉生成的控制
机构 * Institute for Creative Technologies(创意技术研究所) ; University of Southern California(南加州大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 ARSS通过单视角生成视图,利用自回归模型和相机轨迹指导提升生成质量。
YOLOA:通过LLM适配器实现实时的可及性检测
机构 * School of Electronic Engineering, Xidian University(电子工程学院,西安电子科技大学) ; School of Software, Tsinghua University(软件学院,清华大学) ; School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)
专题命中 具身推理 :embodied AI(abstract);分类 cs.CV
AI总结 YOLOA通过LLM适配器实现实时可及性检测,结合对象检测与可及性学习,取得高精度与高效率的平衡。
Comments 13 pages, 9 figures, conference
自注意力机制中令牌的动力学特性及位置编码的影响
机构 * FPT Software AI Center(FPT软件AI中心) ; National University of Singapore(国立新加坡大学) ; Ho Chi Minh University of Economics(胡志明经济大学)
专题命中 具身推理 :world model(abstract);分类 cs.LG
AI总结 本文研究了Transformer中令牌的动力学特性,揭示了位置编码对模型性能的影响,并提出了改进方法以缓解收敛问题。
听觉有助于视觉吗?研究音频视频联合去噪用于视频生成
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 本文提出通过音频视频联合去噪提升视频生成质量,验证了跨模态训练对构建更物理基础的世界模型的潜力。
Comments Project page at https://jianzongwu.github.io/projects/does-hearing-help-seeing/
生成视频中的物体比看起来更慢:模型遭受次地球重力并目前还不知道伽利略原理...
机构 * Indian Institute of Science(印度科学研究院) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 研究发现视频生成器在重力表示上存在偏差,通过针对性适配可提升其重力模拟精度。
Comments https://gravity-eval.github.io/
图距离作为惊喜:知识图谱推理中的自由能最小化
机构 * School of Computing(计算学院) ; Information Systems(信息系统) ; Athabasca University(亚伯达大学)
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 本文提出利用图距离最小化惊喜来改进知识图谱推理,通过连接自由能原理与KG系统,探索图距离在生成模型中的应用及其对语法结构的影响。
Comments Accepted to NORA Workshop at NeurIPS 2025
B2N3D: 从二元关系到N元关系的3D物体接地的渐进式学习
机构 * School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) ; ByteDance Seed(字节跳动种子) ; Show Lab, National University of Singapore(Show Lab,新加坡国立大学)
专题命中 具身推理 :robotic(abstract);分类 cs.CV
AI总结 B2N3D通过引入N元关系学习提升3D物体接地的准确性,利用分组监督损失和混合注意力机制实现更精确的多模态关系建模。
DINO-Foresight: 用DINO展望未来
机构 * Archimedes, Athena Research Center(阿基米德研究所,雅典研究学院) ; National Technical University of Athens(雅典国立技术大学) ; University of Crete(克里特大学) ; IACM-Forth(福伊恩研究所)
专题命中 具身推理 :robotics(abstract);分类 cs.CV
AI总结 DINO-Foresight通过在预训练视觉基础模型的语义特征空间中训练,实现了对未来动态的预测,提升了自动驾驶和机器人领域的环境理解能力。
Comments NeurIPS 2025
OpenTwinMap: 一种用于城市自动驾驶的开源数字孪生生成器
机构 * Vanderbilt University(范德比大学)
专题命中 具身推理 :world model(abstract);分类 cs.RO
AI总结 OpenTwinMap是一种基于Python的开源框架,用于生成高保真的3D城市数字孪生,通过整合LiDAR和OSM数据,支持自动驾驶模拟和扩展性。
EvoEmpirBench: 基于智能体经验的动态空间推理
机构 * Guangdong University of Finance and Economics(广东金融学院) ; Chongqing University(重庆大学) ; University of Edinburgh(爱丁堡大学) ; The University of Hong Kong(香港大学)
专题命中 具身推理 :navigation(abstract);分类 cs.CV
AI总结 EvoEmpirBench通过动态空间基准评估模型在部分可观测和动态环境下的空间推理与记忆能力,揭示主流模型的限制并提供未来研究平台。
Comments Accepted by AAAI 2026, 29 pages, 3 figures, 7 tables
One4D:通过解耦LoRA控制实现统一的4D生成与重建
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 One4D通过解耦LoRA控制实现4D生成与重建的统一框架,提升视频扩散模型在几何重建中的性能
Comments Project page: https://mizhenxing.github.io/One4D
POMA-3D:点地图方式的3D场景理解
机构 * Imperial College London(伦敦帝国学院)
专题命中 具身推理 :navigation(abstract);分类 cs.CV
AI总结 POMA-3D通过点地图实现3D场景理解,结合自监督学习和多视角对齐策略,提升3D任务表现。
Comments 11 pages, 6 tables, 5 figures
从生成式AI到大脑:五点启示
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 本文探讨生成式AI与大脑之间的潜在联系,通过五个例子展示神经科学可能从机器学习研究中获得的启示。
Comments Frontiers in Computational Neuroscience, in press
机构 * School of Computer Science and Engineering, and the MOE Engineering Research Center of Advanced Computer Application Technology, Beihang University(计算机科学与工程学院,以及教育部先进计算机应用技术工程研究中心,北京航空航天大学) ; School of Computer Science and Engineering, the School of Economics and Management, and the MIIT Key Laboratory of Data Intelligence and Management, Beihang University(计算机科学与工程学院,经济管理学院,以及工信部数据智能与管理重点实验室,北京航空航天大学) ; Gaoling School of Artificial Intelligence, Renmin University of China(中关村人工智能学院,中国人民大学) ; DiDi Global Inc.(滴滴出行公司)
专题命中 具身推理 :navigation(abstract);分类 cs.CV
机构 * Xi’an Jiaotong University(西安交通大学) ; Amap, Alibaba Group(阿里巴巴集团) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院)
专题命中 具身推理 :world model(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025 as Spotlight Presentation. Code: https://github.com/MIV-XJTU/FSDrive
机构 * New York University(纽约大学) ; Stanford University(斯坦福大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
Comments Website: https://cambrian-mllm.github.io/