arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9819 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9146 篇

2607.28829 2026-08-03 cs.NI cs.LG 新提交 57%

When Unlearning Fails: Reliable Data Deletion under Post-Training in Agent Networks

当遗忘失效时:智能体网络后训练下的可靠数据删除

Zihao Ding, Jun Huang, Liang Dong

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.LG

AI总结 针对自改进联邦智能体网络后训练时数据删除易出现影响回声的问题,提出MUTE方法,经实验验证其可在保障任务效用的同时降低行为泄漏且通信开销更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27475 2026-08-03 cs.IR cs.LG 版本更新 57%

OneShot: Index-in-Ranking with Neural Scoring for Large-Scale Retrieval

OneShot:面向大规模检索的结合神经打分的排序内索引方法

Ziwei Li, Shuyao Li, Xufeng Cai, Xue Zou, Yiming Ma, Huiting Lu, Wujie Yan, Zhichen Zhao, Yang Lu, Zhe Wang, Rui Luo, Zhengyu Su, Dan Zhang, Yimin Tan, Ji Liu

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究针对推荐系统检索阶段排序目标与索引结构不一致的问题,提出OneShot框架,将索引学习与排序目标联合,突破点积瓶颈,部署于Instagram短视频推荐系统,提升了召回率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30544 2026-08-03 cs.AI 版本更新 57%

Latent Actions from Factorized Transition Effects under Agent Ambiguity

基于因子化转移效应的潜在动作在智能体模糊性下的研究

Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero

机构 * Brown University(布朗大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 针对多物体或干扰场景中动作源模糊问题,提出观测转移因子化(OTF)方法,将转移分解为稀疏的观测转移基元,并构建OTF-LAM模型,在逆向前向动力学框架下抽象出动作潜变量,实现零样本迁移和下游策略学习。

Comments Project Page: https://hazel-heejeong-nam.github.io/LAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10680 2026-08-03 cs.HC cs.AI 57%

A Platform-Agnostic Multimodal Digital Human Modelling Framework: Neurophysiological Sensing in Game-Based Interaction

一种平台无关的多模态数字人类建模框架:基于游戏交互的神经生理传感

Daniel J. Buxton, Mufti Mahmud, Jordan J. Bird, Thomas Hughes-Roberts, David J. Brown

机构 * Nottingham Trent University(诺丁汉特伦大学) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出了一种平台无关的多模态数字人类建模框架,通过统一的神经生理传感和游戏交互环境,支持AI驱动的可重复、可扩展的交互研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00537 2026-07-30 cs.RO 版本更新 57%

PACE: Phase-Aware Chunk Execution for Robot Policies with Action Chunking

PACE: 面向动作分块策略的相位感知分块执行方法

Junnan Nie, Jiayi Li, Jiachen Zhang, Junyi Lao, Chenghao Liu, Tianle Zhang, Liang Lin, Songfang Huang

机构 * Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 提出PACE方法,通过在线预测动作分块中的低速过渡点作为重规划边界,自适应选择执行步长,无需重新训练即可提升机器人策略成功率。

Comments 21 pages, 7 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24431 2026-07-28 cs.CV 新提交 57%

InterOCF: Spatio-Temporal 2D-3D Interaction for Camera-Only 4D Occupancy Forecasting

InterOCF:用于仅相机4D占用预测的时空2D-3D交互

Qi Zhang, Xinquan Yu, Kaiyi Zhang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 研究针对仅相机4D占用预测中输入多视图帧间时空建模不足问题,提出InterOCF框架,通过联合建模3D体素表示和多视图分割序列中的时间动态,并纳入2D与3D分支特征交互,实验证明其性能优于现有方法。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23077 2026-07-28 cs.AI 新提交 57%

Structure over Depth: A Single-Block Spatio-Temporal Transformer for Multi-Entity Reasoning

深度之上的结构:用于多实体推理的单块时空变换器

Narthana Sivalingam, Santhirarajah Sivasthigan, Buddhi Wijenayake, Roshan Godaliyadda, Vijitha Herath, Parakrama Ekanayake

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 研究多实体时间数据建模问题,提出结构化时空变换器块,通过并行自注意力和双向交叉注意力及门控融合,在单个阶段明确建模三种交互,减少深层堆叠需求,在多任务中表现良好,支持结构优先设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21681 2026-07-27 cs.LG 新提交 57%

CARNet Cycle-Conditioned Core Aggregation and Redistribution for Multivariate Time Series Forecasting

用于多变量时间序列预测的循环条件核心聚合与重新分配的CARNet

Awsaf Tausif Adib, Md. Shahria Sarker Shuvo, Md. Estehaar Ahmed Emon, Mustafa Kamal, Fuad Rahman, Shafin Rahman, Nabeel Mohammed

机构 * North South University(南北大学) Apurba Technologies(阿普尔巴科技公司)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 针对多变量时间序列预测中交叉变量依赖建模难题,提出CARNet框架,通过多头核心聚合将全局循环信息融入基于核心的交互建模,实验证明其在不同预测范围优于基线,且保持线性复杂度。

Comments Accepted at ECML PKDD 2026 (Research Track). Shortlisted for Best Research Track Student Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23620 2026-07-16 cs.RO 版本更新 57%

Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation

移动-然后-操作:用于类人机器人操作的行为相位

Haoming Xu, Lei Lei, Jie Gu, Chu Tang, Jingmin Chen, Ruiqi Wang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China.(杭州高等研究院,中国科学院大学,中国杭州) University of Science and Technology of China, Hefei, China.(中国科学技术大学,中国合肥) School of Aritificial intelligence, Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China(人工智能学院,人工智能研究院,北京科技大学,中国北京)

专题命中 VLA模型 :vision language action(abstract);分类 cs.RO

AI总结 本文提出Move-Then-Operate框架,将机器人操作分为粗略移动和接触关键交互两个阶段,通过双专家策略提升操作精度与效率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11964 2026-07-15 cs.LG 新提交 57%

LIDAR-AD: A Decoder-Free Latent-Interaction Dreamer with Action-Residual Chains for Autonomous Driving

LIDAR-AD:一种用于自动驾驶的无解码器潜在交互梦想家与动作残差链

Yongzhi Liu, Yang Xiao, Zhong Cao, Zeng Kang, Sunan Zhang, Zhaozhi Dong, Guojun Yu, Weichao Zhuang

机构 * School of Mechanical Engineering, Southeast University(东南大学机械工程学院) Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系) Xheart Technology Co., Ltd.(芯驰科技有限公司)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 研究针对自动驾驶中多源观测冗余问题,提出LIDAR-AD,用减少冗余的潜在对齐取代观测重建,将车辆控制建模为残差动作更新,经实验验证其在模拟场景和现实布局下性能优异,能提升风险感知等能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09725 2026-07-14 cs.RO 新提交 57%

Learning High-Level Decision Making with an Interaction-Aware Attention-Based Network in Autonomous Driving

在自动驾驶中使用基于交互感知注意力的网络学习高级决策

Marcelo Contreras, Willi Poh, Christoph Stiller, Ehsan Hashemi

机构 * NODE lab, University of Alberta(节点实验室,阿尔伯塔大学) MRT Institute, Karlsruhe Institute of Technology(MRT 研究所,卡尔斯鲁厄理工学院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 研究自动驾驶中高级决策问题,提出DecisionPerceiver将动态代理特征投影到固定大小潜在空间,通过潜在查询数调节特征粒度,还细化动作集,经多场景评估有性能提升、泛化能力及可扩展性。

Comments 6 pages, 5 figures, 3 tables, submitted to 2026 IEEE Intelligent Transportation Systems Conference (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07206 2026-07-14 cs.LG math.OC 版本更新 57%

Causal Optimizer Interaction Calculus: Hidden Geometric Relaxation and Identifiable Interventions

几何-非几何优化器演算:一种用于可达梯度方法的模块化语言

Zavier Li

机构 * Xidian University(西安电子科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 研究提出几何-非几何优化器演算,用于审查可达梯度方法。核心方法是定义模块及相关机制,证明方向表达定理等。主要贡献是给出方向级诊断,将设计问题转为帕累托优化,还提升残差复杂性并提供诊断原型证据。

Comments 34 pages. Complete proofs, controlled real-data experiments, and reproducibility details are included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28469 2026-07-09 cs.RO cs.HC 版本更新 57%

When May I Help You? On The Effect of Proactivity on Group Human-Robot Collaboration

我何时能帮你?主动性对群体人机协作的影响

Thomas Vitry, Vanessa Maeder, Kieran von Valeburg, Asihati Hazaiti, Doga Deniz Ates, Connor Gäde, Jan-Gerrit Habekost, Dennis Becker, Stefan Wermter

机构 * Knowledge Technology, University of Hamburg(汉堡大学知识技术研究所) Ecole Normale Superieure de Rennes(里昂大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 研究在多人协作逃生室中,机器人采用反应式(仅被叫时响应)与主动式(持续监听并自主贡献)交互模型对协作效果的影响,发现主动模型增加交互频率但反应模型成功率更高,且用户先前经验和性格显著调节效果。

Comments Published at the RO-MAN 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20342 2026-07-08 cs.HC cs.AI cs.CY 版本更新 57%

Narrative-Centered Emotional Reflection: An Early Prototype for AI-Supported Emotional Self-Reflection

以叙事为中心的情感反思:人工智能支持的情感自我反思的早期原型

Shou-Tzu Han

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 该研究以Reflexion为早期原型,通过整合情感检测、分层反思提示和隐喻故事生成等方法,探索结构化情感自我反思,支持用户超越基本情感分类进行自主情感探索,记录了理论驱动的情感计算方向。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03017 2026-07-07 cs.RO 新提交 57%

Beyond Heuristics: A Standardized Real2Sim Pipeline for Physical Human Robot Interaction in Human-in-the-Loop Simulation

超越启发式方法:用于人在回路仿真中物理人机交互的标准化真实到仿真管道

Chengyuan Yang, Yifan Wang, Chun Kwang Tan, Sherwin Stephen Chan, Youlong Wang, Xiaoyue Yan, Lei Li, Wei Tech Ang

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航天工程学院) Guangdong Zhongxin Intelligent Rehabilitation Research Institute(广东众鑫智能康复研究院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 研究针对人在回路仿真中交互模型阻抗参数靠启发式调整的问题,提出Real2Sim管道,用协方差矩阵自适应进化策略识别动力学参数,提高仿真保真度,支持人体数字双胞胎用于个性化控制器临床前验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00269 2026-07-07 cs.AI 新提交 57%

Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理

Edward Y. Chang, Longling Geng, Emily J. Chang

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。

Comments 41 pages, 25 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01743 2026-07-03 cs.CV 新提交 57%

InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation

InterCMDM:用于自回归人体交互生成的块因果扩散

Qing Yu, Kent Fujiwara

机构 * LY Corporation(LY公司)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 提出InterCMDM块因果潜扩散框架,通过双流因果扩散Transformer和多重任务注意力掩码实现自回归双人交互生成,解决因果性缺失和时间漂移问题,在InterHuman和InterX上达到最优性能。

Comments Accepted to ECCV 2026, Project website: https://yu1ut.com/InterCMDM-HP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01088 2026-07-02 cs.RO cs.DC 新提交 57%

ROSA: A Robotics Foundation Model Serving System for Robot Factories

ROSA: 面向机器人工厂的基础模型服务系统

Wenqi Jiang, Jason Clemons, Rowland O'Flaherty, Hugo Hadfield, Alperen Degirmenci, Shuran Song, Yashraj Narang, Christos Kozyrakis

机构 * NVIDIA Research(英伟达研究院) Stanford University(斯坦福大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 提出ROSA系统,通过共享GPU池服务、多模型流水线支持和工厂目标驱动调度,将机器人工厂的RFM推理性能提升12倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31177 2026-07-01 cs.CV 新提交 57%

GaussianMap: Learning Gaussian Representation for Multi-Sensor Online HD Map Construction

GaussianMap: 学习高斯表示用于多传感器在线高清地图构建

Hongyu Lyu, Julie Stephany Berrio Perez, Mao Shan, Stewart Worrall

机构 * The University of Sydney, Australian Centre for Robotics(悉尼大学澳大利亚机器人中心) The University of Queensland(昆士兰大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 提出GaussianMap框架,利用自适应高斯表示代替固定分辨率BEV网格,通过高斯编码器与多传感器融合,实现高效在线高清地图构建,在nuScenes和Argoverse 2上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24184 2026-06-24 cs.LG 新提交 57%

Project Ariadne: Prompt-Conditioned Route Generation for Synthesis Planning

Project Ariadne: 用于合成规划的提示条件路线生成

Anton Morgunov, Victor S. Batista

机构 * Yale University(耶鲁大学)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 提出解码器专用路线生成器Ariadne,通过提示-补全序列统一表示目标、约束和路线,在RetroCast/PaRoutes基准上,深度约束和所需叶子约束的Solv-0分别提升13.7和31.2点,推理时间远低于DESP。

Comments Code is available at https://github.com/ischemist/project-ariadne

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18375 2026-06-24 cs.RO 新提交 57%

PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation

PAIWorld: 用于机器人操作的三维一致世界基础模型

Yuhang Huang, Xuan Lv, Junyan Xu, Zhiyuan Yu, Jiazhao Zhang, Ruizhen Hu, Wancheng Feng, Shilong Zou, Hewen Xiao, Ziqiao Zhou, Kaiyun Huang, Zhiyu Peng, Juzhan Xu, Hang Zhao, Chenyang Zhu, Renjiao Yi, Yifei Huang, Douhui Wu, Yan Zhang, Kexu Cheng, Chunhe Song, Yunzhi Xue, Xiuhong Zhang, Leitao Guo, Yunji Chen, Bin Wu, Haibin Yu, Kai Xu

机构 * Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 提出PAIWorld框架,通过几何感知交叉注意力、几何旋转位置编码和潜在3D-REPA蒸馏,解决多视图世界模型的3D不一致问题,在机器人操作基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23085 2026-06-23 cs.RO 新提交 57%

Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents

Foresight: 基于动作条件世界模型潜在变量的长时程机器人操作故障检测

Haoran Zhang, Yifu Lu, Boyang Wang, Xuhui Kang, Yen-Ling Kuo, Zezhou Cheng, Mengdi Wang, Odest Chadwicke Jenkins

机构 * University of Michigan(密歇根大学) Princeton University(普林斯顿大学) University of Virginia(弗吉尼亚大学)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 提出Foresight框架,利用动作条件世界模型的潜在表征监测操作轨迹,仅用最终任务级标签训练,结合函数共形预测自适应校准阈值,在仿真和真实机器人长时程任务中实现高效故障检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22823 2026-06-23 cs.LG q-bio.QM 新提交 57%

Retrieval-Augmented Multimodal Learning for Enzyme-Substrate Interaction Prediction Under Low-Homology Shift

检索增强的多模态学习用于低同源性偏移下的酶-底物相互作用预测

Chen Liu, Bingxin Zhou, Xinyuan Wang, Ming Li, Guisheng Fan, Liang Hong

机构 * School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院) Institute of Natural Sciences and Zhangjiang Institute for Advanced Study, Shanghai Jiao Tong University(上海交通大学自然科学研究院和张江高等研究院) School of Life Sciences and Biotechnology, Shanghai Jiao Tong University(上海交通大学生命科学技术学院)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 提出RAMMESI框架,通过跨模态交互建模、自适应融合和检索增强,解决酶-底物相互作用预测中稀疏正监督和低同源性分布偏移问题,在低序列一致性场景下表现优异。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18154 2026-06-17 cs.AI 新提交 57%

Learning Cardiac Electrophysiology Digital Twins Through Agentic Discovery of Hybrid Structure

通过智能体发现混合结构学习心脏电生理数字孪生

Ziqi Zhou, Yubo Ye, Sumeet Atul Vadhavka, Linwei Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 提出LEADS框架,利用LLM智能体在结构化动作空间中迭代发现混合物理-神经模型,实现个性化心脏电生理数字孪生构建,优于人工设计和其他LLM方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16178 2026-06-16 cs.RO 新提交 57%

Scaling Short-Term Memory of Visuomotor Policies for Long-Horizon Tasks

面向长时任务的视觉运动策略短期记忆扩展

Rutav Shah, Rajat Kumar Jenamani, Xiaohan Zhang, Lingfeng Sun, Roberto Martín-Martín, Yuke Zhu, Deva Ramanan, Karl Schmeckpeper

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Toyota Research Institute(丰田研究院)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 提出PRISM架构,通过门控注意力与层次化压缩扩展视觉运动策略的短期记忆至两分钟,在ReMemBench基准上超越现有方法5%-12%。

Comments 14 pages, 9 Figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14306 2026-06-15 cs.HC cs.AI 新提交 57%

Thinking Outside the [Chat]Box: Bridging Computer Science and Industrial Design for Cognitive-Inclusive Generative AI

跳出聊天框:融合计算机科学与工业设计的认知包容性生成式人工智能

Virginia Francisco, Daniel Guasch, Raquel Hervás

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 针对当前GenAI界面认知门槛高、对智力障碍者不友好等问题,通过跨学科设计挑战,提出融合计算机科学的结构化支架与工业设计的体验式支架的双层框架,以扩展认知包容性交互设计空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11187 2026-06-10 cs.CV 新提交 57%

Next Forcing: Causal World Modeling with Multi-Chunk Prediction

Next Forcing: 基于多块预测的因果世界建模

Gangwei Xu, Qihang Zhang, Jiaming Zhou, Xing Zhu, Yujun Shen, Xin Yang, Yinghao Xu

机构 * Robbyant HUST(华中科技大学) HKUST(香港科技大学) HKUST (GZ)(香港科技大学(广州))

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 提出Next Forcing框架,通过多块预测训练目标加速视频生成模型收敛、提升精度并实现推理加速,在多个基准上取得最优结果。

Comments Project page: https://gangweix.github.io/next-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07935 2026-06-09 cs.CV 新提交 57%

REACT 2026: The Fourth Multiple Appropriate Facial Reaction Generation Challenge: Personalised MAFRG and Appropriate EEG Reaction Prediction

REACT 2026:第四届多适切面部反应生成挑战赛:个性化MAFRG与适切脑电反应预测

Siyang Song, Micol Spitale, Zijian Wu, Xiangyu Kong, Cheng Luo, Cristina Palmero, German Barquero, Sergio Escalera, Michel Valstar, Mohamed Daoudi, Fabien Ringeval, Andrew Howes, Elisabeth Andre, Hatice Gunes

机构 * University of Exeter(埃克塞特大学) Politecnico di Milano(米兰理工大学) Nanjing University of Science and Technology(南京理工大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) King's College London(伦敦国王学院) Universitat de Barcelona(巴塞罗那大学) University of Nottingham(诺丁汉大学) IMT Nord Europe(IMT 北欧欧洲) Université Grenoble Alpes(格勒诺布尔-阿尔卑斯大学) University of Augsburg(奥格斯堡大学) University of Cambridge(剑桥大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 提出REACT 2026挑战赛,鼓励开发机器学习模型,用于生成个性化、适切、多样、真实且同步的人类面部反应,并引入个性标签和脑电记录,探索新的一对多个性化面部反应生成设置。

Comments arXiv admin note: text overlap with arXiv:2505.17223

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06832 2026-06-08 cs.RO 新提交 57%

STRIPS-WM: Learning Grounded Propositional STRIPS-style World Models from Images

STRIPS-WM:从图像学习基于命题的STRIPS风格世界模型

Abhiroop Ajith, Constantinos Chamzas

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 提出STRIPS-WM框架,从图像转换中学习符号化世界模型,用于机器人视觉任务规划,提升规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06915 2026-06-08 cs.CL cs.LG 版本更新 57%

A Dynamic Self-Evolving Extraction System

一种动态自演化抽取系统

Moin Amin-Naseri, Hannah Kim, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 提出DySECT系统,通过LLM抽取三元组构建知识库,结合概率知识和图推理丰富知识,再反馈优化抽取器,形成闭环持续提升。

详情

展开后加载摘要…

URL PDF HTML 收藏