A Self-Supervised Auxiliary Loss for Deep RL in Partially Observable Settings
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
Comments Conference paper at ICLR 2021. Implementation: https://github.com/ivy-dl/memory Project page: https://djl11.github.io/ESM/
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
Comments EACL 2021
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
Comments This is a preprint / review version of an accepted contribution to be published as part of the Artificial Intelligence Journal (AIJ).? The article is an extended version of an IJCAI 2019 publication [74, arXiv:1906.00107]
专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG
Comments Project page: https://shivanshpatel35.github.io/multi-ON/ ; the first three authors contributed equally
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
Comments ICML 2020. Videos and code: https://sites.google.com/view/action-generalization
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted for publication as a long paper in EMNLP2020
专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG
Comments Accepted to IROS 2020. Added links to codes and video demo
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG
专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG
专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG
专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG
Comments 8 pages, accepted to IEEE/RSJ International Conference on Robots and Systems (IROS) 2019
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
Comments CVPR 2019 Oral
专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG
Comments Accepted at ICML 2018; camera-ready version
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
Comments In Proceedings of the Annual Meeting of the Cognitive Science Society (CogSci 2018)
专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG
Comments Published at International Conference on Learning Representations (ICLR) 2018. Project website at https://sites.google.com/view/SPTM
专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI
Comments Technical Report on Slow Thinking with LLMs: Visual Reasoning
图机:将边机制作为归纳偏置的探索
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究提出Graph Machine架构,含边增强注意力与以边为中心的引用两种边机制,在数独任务上优于Transformer基线,证明显式边机制是有前景的架构设计。
用于血管内导航多任务世界模型控制的渐进式经验融合
机构 * School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院) ; Surgical & Interventional Engineering(外科与介入工程)
专题命中 视觉空间推理 :planning(abstract);分类 cs.LG
AI总结 本研究提出渐进式经验融合(PEF)训练多任务TD-MPC2控制器,在血管内导航任务中提升了成功率,可实现跨血管结构迁移与患者特异性微调,为临床应用提供概念验证。
当安全覆盖视觉时:探索视觉语言模型中视觉影响与安全对齐之间的动态关系
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究探究对齐视觉语言模型中安全诱导弃权的内部解码动态,发现安全对齐未抑制感知接地,抑制拒绝相关表征可恢复接地回答,揭示了其一种新的失败模式。
VibeWorlding:多模态智能体能否端到端构建3D开放世界?
机构 * HKUST(GZ)(香港科技大学(广州)) ; Tencent(腾讯) ; AI Thrust ; TEG AIPD
专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI
AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。
Comments preprint
大型语言模型是否遵循六度分隔理论?测量长上下文流形中的拓扑压缩
机构 * BRAC University(BRAC大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究通过分析LLM隐藏状态流形的几何结构,发现深度推理层的语义锚点遵循六度分隔理论,该拓扑特性可用于RAG的零样本幻觉检测,为评估事实可靠性提供了几何指标。
第10届AI City挑战赛
机构 * Santa Clara University(圣克拉拉大学) ; University at Albany, SUNY(纽约州立大学奥尔巴尼分校) ; Iowa State University(爱荷华州立大学) ; Woven by Toyota(丰田编织公司) ; United Arab Emirates University(阿拉伯联合酋长国大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学) ; University of Macau(澳门大学) ; North Carolina State University(北卡罗来纳州立大学) ; Columbia University(哥伦比亚大学) ; Milestone Systems(里程碑系统公司) ; Xi’an Jiaotong University(西安交通大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。
Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026
VLCP:用于机器人操纵的视觉语言控制策略闭环代码重规划
机构 * University of Monastir(莫纳斯提尔大学) ; St. Mildred’s-Lightbourn School(圣米尔德雷德-莱特本学校) ; Cornell University(康奈尔大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Silverstream AI(银流人工智能公司) ; Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 VLCP是一种无需训练的机器人操纵策略,通过在单回合内每K步由VLM重写控制代码闭合循环,在57项任务的评估中综合成功率达35.1%,较开环策略提升十倍。
MUSE:一种用于理解和操控大语言模型驱动的数据科学系统的交互式元智能体
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出交互式元智能体MUSE,通过重构执行轨迹、支持上下文交互与混合意图操控,提升用户对大语言模型驱动的数据科学系统的理解与控制,经15人被试间研究验证可提高任务效率与用户信心。
Comments To appear in the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 2-5, 2026, Detroit, MI, USA
为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。
GraphLoom:面向多模态KG-RAG的可靠性校准图证据路由
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Aristotle University(亚里士多德大学) ; Dashub(达舒布)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出GraphLoom框架,通过可靠性校准的图证据路由实现多模态KG-RAG,在ScienceQA等数据集上提升了答案质量与证据忠实度。
大语言模型及其对力学与空间几何的认知能力
机构 * University of Innsbruck(因斯布鲁克大学) ; University of Augsburg(奥格斯堡大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究构建了全自动基准MecEng,评估32个开放权重及2个专有LLMs的机械工程认知,发现其刚体任务成功率达86.0%,但柔性多体任务仍具挑战,且该能力正快速提升但仍易出错。
当个人记忆没有唯一答案时:评估大语言模型智能体在不可约冲突下的表现
机构 * Ant Group(蚂蚁集团)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对大语言模型智能体的记忆冲突问题,提出了基准TANGLE并评估其表现,发现现有方法存在缺陷,进而提出冲突感知行动策略CAAP。