arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-21 至 2026-04-21 共收录 27 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 22 篇

2604.17896 2026-04-21 cs.LG cs.AI cs.RO 91%

Can Explicit Physical Feasibility Benefit VLA Learning? An Empirical Study

显式物理可行性能否促进VLA学习?一项实证研究

Yubai Wei, Chen Wu, Hashem Haghbayan

机构 * Department of Computing, University of Turku(图尔库大学计算机系)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文研究显式物理可行性监督对VLA学习的影响,提出几何基础可行性目标并集成到扩散基VLA策略训练中,实验证明其能提升物理可靠性和任务性能,增强低数据下的学习效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18000 2026-04-21 cs.RO 91%

Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models

揭示视觉-语言-动作模型中具身推理的幻觉

Haiweng Xu, Sipeng Zheng, Hao Luo, Wanpeng Zhang, Ziheng Xi, Zongqing Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) BeingBeyond

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本文通过BeTTER基准测试揭示现有VLA模型在动态场景中表现不佳,指出其根本问题在于架构瓶颈导致的语义表示退化,强调需解决高频率控制与高层推理间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09244 2026-04-21 cs.MM cs.CV cs.RO 91%

2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness

2D或3D:谁在VLA模型中主导显著性?——具有模态显著性意识的三阶段令牌剪枝框架

Zihao Zheng, Sicheng Tian, Zhihao Mao, Lingyue Zhang, Chenyue Li, Ziyun Zhang, Hong Gao, Yuchen Huang, Yutong Xu, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ZTE Corporation(中兴通讯) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出三阶段令牌剪枝框架,通过捕捉2D/3D模态显著性的差异与动态,提升VLA模型的推理效率,实验显示在最小精度损失下实现2.55倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03480 2026-04-21 cs.RO cs.AI 91%

SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning

SafeVLA: 通过约束学习实现视觉-语言-动作模型的安全对齐

Borong Zhang, Yuhao Zhang, Jiaming Ji, Yingshan Lei, Yishuai Cai, Josef Dai, Yuanpei Chen, Yaodong Yang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) PKU-PsiBot Joint Lab(北京大学PsiBot联合实验室) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出SafeVLA方法,通过约束学习整合安全约束,有效降低安全违规成本并提升任务成功率,同时确保安全性和泛化能力。

Comments Accepted by NeurIPS 2025 Spotlight Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18107 2026-04-21 cs.CV 90%

Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models

基于延迟反馈的测试时扰动学习用于视觉-语言-动作模型

Zehua Zang, Xi Wang, Fuchun Sun, Xiao Xu, Lixiang Lium, Jiahuan Zhou, Jiangmeng Li

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) National Defense University(国防大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出PDF框架,通过不确定性数据增强和动作投票缓解轨迹过拟合,提升决策性能,实验显示在LIBERO和Atari任务中取得显著成效。

Comments 12 pages, 7 figures, 5 tables

Journal ref CVPR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14732 2026-04-21 cs.RO cs.LG 90%

World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems

世界价值-动作模型:面向视觉-语言-动作系统的隐式规划

Runze Li, Hongyin Zhang, Junxi Jin, Qixin Zeng, Zifeng Zhuang, Yiqi Tang, Shangke Lyu, Donglin Wang

机构 * Westlake University(西湖大学) Nanjing University Suzhou Campus(南京大学苏州校区)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出World-Value-Action模型,通过隐式规划提升视觉-语言-动作系统在长时域决策中的性能,通过学习潜在表示和价值函数实现高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04052 2026-04-21 cs.RO cs.CL 89%

Stable Language Guidance for Vision-Language-Action Models

用于视觉-语言-动作模型的稳定语言引导

Zhihao Zhan, Yuhao Chen, Jiaying Zhou, Qinhan Lyu, Hao Liu, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出RSS框架,通过解耦物理 affordance 与语义执行,提升视觉-语言-动作模型在语言扰动下的鲁棒性,实验表明其在多种操作基准测试中达到最优性能。

Comments Accepted to ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17880 2026-04-21 cs.RO cs.CV 89%

ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation

ST-$π$: 结构化时空VLA用于机器人操作

Chuanhao Ma, Hanyu Zhou, Shihan Peng, Yan Li, Tao Gu, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出ST-$π$模型,通过结构化时空视觉语言模型和动作专家,解决机器人操作中精细时空推理问题,同时引入结构化时空标注数据集进行训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16677 2026-04-21 cs.RO cs.AI 86%

ReconVLA: An Uncertainty-Guided and Failure-Aware Vision-Language-Action Framework for Robotic Control

ReconVLA:一种基于不确定性和故障意识的视觉-语言-动作框架用于机器人控制

Lingling Chen, Zongyao Lyu, William J. Beksi

机构 * Department of Computer Science and Engineering, The University of Texas at Arlington(计算机科学与工程系,德克萨斯理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 ReconVLA通过引入符合预测方法,为视觉-语言-动作模型提供校准的不确定性估计和故障检测,提升机器人控制的可靠性与安全性。

Comments 17 pages, 9 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17915 2026-04-21 cs.CV 84%

OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models

OneDrive: 统一的多范式驾驶与视觉-语言-动作模型

Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA School of Artificial Intelligence, University of Chinese Academy of Sciences AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University Voyager Research, Didi Chuxing School of Information Science(多模态人工智能系统国家重点实验室,中国科学院自动化所人工智能学院,中国科学院大学,AutoLab,上海交通大学人工智能学院,Voyager Research,滴滴出行,信息科学与技术学院)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.CV

AI总结 本文提出基于预训练视觉语言模型的统一自动驾驶框架,通过单一Transformer解码器整合异构解码行为,实现多任务联合优化,实验表明在nuScenes和NAVSIM上取得最优性能,且推理效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17800 2026-04-21 cs.RO cs.CV 82%

ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning

ReFineVLA: 通过教师引导微调实现多模态推理感知的通用机器人策略

Tuan Van Vo, Tan Q. Nguyen, Khang Nguyen, Nhat Xuan Tran, Duy H. M. Nguyen, An T. Le, Ngo Anh Vien, Minh Nhat Vu

机构 * VinRobotics University of Texas at Arlington(德克萨斯大学阿灵顿分校) Max Planck Research School for Intelligent Systems (IMPRS-IS)(智能系统Max Planck研究学校) Intelligent Autonomous Systems Lab(智能自主系统实验室) TU Darmstadt(德累斯顿技术大学) Automation & Control Institute(自动化与控制研究所) TU Wien(维也纳技术大学) Austrian Institute of Technology (AIT)(奥地利技术研究所)

专题命中 VLA模型 :vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出ReFineVLA框架,通过教师引导的推理增强数据集微调机器人策略,提升多模态推理能力与泛化性能,在模拟任务中取得最佳表现。

Comments arXiv admin note: substantial text overlap with arXiv:2505.19080

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16391 2026-04-21 cs.RO cs.CV 79%

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

通过分离前向和逆向动力学预训练实现解耦的机器人学习

Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出DeFI框架,通过分离前向和逆向动力学预训练,利用不同数据源解决视觉-动作耦合问题,实现端到端微调,实验表明在CALVIN ABC-D和SimplerEnv上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22126 2026-04-21 cs.RO 78%

ROBOGATE: Adaptive Failure Discovery for Safe Robot Policy Deployment via Two-Stage Boundary-Focused Sampling

ROBOGATE:通过两阶段边界聚焦采样实现安全机器人策略部署的自适应故障发现

Azuki Kim

机构 * AgentAI Co., Ltd.(AgentAI公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出ROBOGATE框架,结合物理仿真与两阶段自适应采样策略,有效发现操作参数空间中的故障边界,通过大量实验验证了其在不同机器人上的有效性,并展示了在跨仿真器场景下的部署验证挑战。

Comments 15 pages, 5 figures, 8-entry VLA leaderboard, 4-robot cross-robot analysis (Franka Panda + UR3e + UR5e + UR10e), open-source code and 50K+ failure pattern dataset at https://github.com/liveplex-cpu/robogate. v4: added 8 references (LIBERO-PRO, LIBERO-Plus, vla-eval, FIPER, RoboMIND, RoboArena, RobotArena-Inf, RoboCasa365) + new Section 2.6 distinguishing intra-sim vs cross-sim collapse

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO 73%

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17651 2026-04-21 cs.CV cs.RO 73%

Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception

以基础设施为中心的世界模型:弥合时间深度与空间广度以实现道路感知

Siyuan Meng, Chengbo Ai

机构 * Department of Civil and Environmental Engineering, University of Massachusetts Amherst(土木与环境工程系,马萨诸塞大学阿默斯特分校)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出以基础设施为中心的世界模型,通过时空互补性提升道路感知能力,提出三阶段框架和双层架构,结合多模态数据引擎和开放源代码基础,推动基础设施理解交通。

Comments 18 pages, 7 tables, 1 figure, vision paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03964 2026-04-21 hep-ex 71%

The role of final-state interaction modeling in neutrino energy reconstruction and oscillation measurements

中微子能量重建与振荡测量中终态相互作用建模的作用

Yinrui Liu, Laura Munteanu, Stephen Dolan

专题命中 VLA模型 :action model(title)

AI总结 研究显示,终态相互作用建模的实变化可能显著影响中微子能量谱,可能与振荡参数变化产生混淆,强调需改进终态相互作用建模以提高约束精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17887 2026-04-21 cs.RO 70%

StableIDM: Stabilizing Inverse Dynamics Model against Manipulator Truncation via Spatio-Temporal Refinement

StableIDM:通过时空细化稳定逆动力学模型以对抗机械臂截断

Kerui Li, Zhe Jing, Xiaofeng Wang, Zheng Zhu, Yukun Zhou, Guan Huang, Dongze Li, Qingkai Yang, Huaibo Huang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所GigaAI研究院) Beijing Institute of Technology(北京理工大学) GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出StableIDM,通过时空细化框架提升逆动力学模型在机械臂截断场景下的稳定性,实验表明其在动作准确性和任务成功率上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17830 2026-04-21 cs.RO 57%

SYMBOLIZER: Symbolic Model-free Task Planning with VLMs

SYMBOLIZER:基于VLMs的符号模型无关任务规划

Sami Azirar, Zlatan Ajanovic, Hermann Blum

机构 * RWTH Aachen(亚琛理工大学) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 本文提出SYMBOLIZER框架,利用VLMs将图像转化为符号状态,结合启发式搜索实现跨领域任务规划,优于直接VLM规划并可与基于启发式的传统方法媲美。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17749 2026-04-21 cs.CV 57%

Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos

Ego-InBetween: 生成以自我为中心视频中的物体状态转换

Mengmeng Ge, Takashi Isobe, Xu Jia, Yanan Sun, Zetong Yang, Weinong Wang, Dong Zhou, Dong Li, Huchuan Lu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出EgoIn框架,通过TransitionVLM和Object-aware Auxiliary Supervision生成物体状态转换序列,实现以自我为中心视角下的视觉状态迁移。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00789 2026-04-21 cs.CV 57%

CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving

CogDriver:通过整合认知惯性实现自动驾驶中的时间一致规划

Pei Liu, Qingtian Ning, Xinyan Lu, Haipeng Liu, Weiliang Ma, Dangen She, Peng Jia, Xianpeng Lang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Li Auto Inc.(利汽车公司)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.CV

AI总结 本文提出CogDriver框架,通过引入认知惯性提升自动驾驶中的时间一致性规划能力,通过大规模视觉-语言-动作数据集和稀疏时间记忆架构,显著提升了闭环驾驶得分和模仿准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10775 2026-04-21 hep-ph hep-ex hep-lat nucl-ex nucl-th 50%

Unified Description of Pseudoscalar Meson Structure from Light to Heavy Quarks

从轻到重夸克的赝标量介子结构的统一描述

B. Almeida-Zamora, L. Albino, A. Bashir, J. J. Cobos-Martínez, J. Segovia

专题命中 VLA模型 :action model(abstract)

AI总结 本文基于代数模型研究赝标量介子的结构,统一描述部分子分布振幅、轻前波函数等,并探讨夸克质量不对称性和重夸克动力学的影响。

Comments 37 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20779 2026-04-21 cs.CL 50%

CHIMERA: A Knowledge Base of Scientific Idea Recombinations for Research Analysis and Ideation

CHIMERA:用于研究分析和构想的科学思想重组知识库

Noy Sternlicht, Tom Hope

机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(计算机科学与工程系,耶路撒冷希伯来大学) The Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 VLA模型 :action model(abstract)

AI总结 CHIMERA是首个基于科学文献自动挖掘的重组实例知识库,用于分析科学家如何跨领域重组概念,并训练生成跨学科研究方向的模型。

Comments Project page: https://noy-sternlicht.github.io/CHIMERA-Web

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 2 篇

2601.01943 2026-04-21 cs.LG 74%

SynRXN: An Open Benchmark and Curated Dataset for Computational Reaction Modeling

SynRXN:计算反应建模的开放基准和精心编纂的数据集

Tieu-Long Phan, Nhu-Ngoc Nguyen Song, Peter F. Stadler

机构 * Bioinformatics Group, Department of Computer Science \& Interdisciplinary Center for Bioinformatics \& School for Embedded Composite Artificial Intelligence (SECAI), Leipzig University, H \"a rtelstra e 16–18, D-04107 Leipzig, Germany School of Pharmacy, University of Medicine

专题命中 数据集与评测 :action model(title);分类 cs.LG

AI总结 SynRXN 提供了一个统一的基准框架和开放数据资源,用于计算机辅助合成规划。通过分解端到端合成规划为五个任务家族,提供透明的评估流程和定制化的评估指标,支持严谨的消融测试和压力测试。

Comments 31 pages (including references), 3 figures, 7 tables

Journal ref Scientific Data 13, 625 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16886 2026-04-21 cs.RO 70%

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

交互链基准(COIN):当推理遇见具身交互

Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数据集与评测 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 COIN基准通过设计日常场景下的50个交互任务,评估机器人在部分可观测环境下进行因果依赖推理的能力,揭示现有方法在交互推理任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 3 篇

2604.07562 2026-04-21 cs.CL cs.AI cs.CY cs.LG 62%

Reasoning-Based Refinement of Unsupervised Text Clusters with LLMs

基于推理的无监督文本聚类细化方法

Tunazzina Islam

机构 * Department of Computer Science(计算机科学系)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型作为语义评判者,对无监督聚类结果进行推理细化,通过三个阶段提升聚类的连贯性与可解释性,实验证明其在社交媒体数据中优于传统方法。

Comments Accepted to the Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16484 2026-04-21 cs.CV cs.AI 62%

DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks

DexWorldModel:基于因果潜在世界的建模以实现具身任务的自动化学习

Yueci Deng, Guiliang Liu, Kui Jia

机构 * DexForce AI

专题命中 部署与泛化 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CLWM模型,通过分离交互语义与视觉噪声提升领域泛化能力,采用双状态测试时训练机制和推测异步推理方法,实现高效长周期任务处理,并通过EmbodiChain框架提升策略鲁棒性,实验表明其在复杂双臂仿真和物理机器人零样本迁移中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17876 2026-04-21 cs.RO 57%

OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation

OFlow:注入对象感知的时间流匹配以实现稳健的机器人操作

Kuanning Wang, Ke Fan, Chenhao Qiu, Zeyu Shangguan, Yuqian Fu, Yanwei Fu, Daniel Seita, Xiangyang Xue

机构 * Fudan University(复旦大学) University of Southern California(南加州大学)

专题命中 部署与泛化 :VLA(abstract);分类 cs.RO

AI总结 OFlow通过统一时间预测和对象感知推理,提升机器人操作的鲁棒性,实验表明对象感知预测增强了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏