arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 634 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 544 篇

2607.14428 2026-07-17 astro-ph.GA 新提交 67%

Accurate proper motions of the protostellar system VLA1623-2417

原恒星系统VLA1623 - 2417的精确自行

Ricardo Hernández Garnica, Laurent Loinard, Carlos Carrasco-González, Jazmín Ordóñez-Toro, Johanan Ramírez-Arellano, María José Maureira, Isaac C. Radley, Eleonora Bianchi, Claire J. Chandler, Luis F. Rodríguez, Rosa M. Torres, Aina Palau

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 对原恒星系统VLA1623 - 2417进行天体测量分析,结合多阵列观测数据得出各分量自行。Aa/Ab有轨道运动但难估质量,W与A、B投影距离减小,其运动不符弹出情景,推测W与A/B关系及轨道情况。

Comments Submitted to MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04443 2026-07-09 cs.CV cs.AI cs.GR cs.LG 新提交 67%

Wan-Streamer v0.2: Higher Resolution, Same Latency

万流播器v0.2:更高分辨率,相同延迟

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 介绍万流播器v0.2,它保持v0.1建模公式,将交互输出流分辨率提高,在保持低延迟下支持场景中景智能体。核心方法是优化架构,主要贡献是提升分辨率同时保持低延迟,集中硬件于视觉生成。

Comments Website: https://wan-streamer.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03592 2026-07-07 astro-ph.GA 新提交 67%

From Atomic Gas to Star Formation

从原子气体到恒星形成

Erik Rosolowsky, Eric Koch, Sambit Roychowdhury, Luca Cortese, Filippo M. Maccagni, Barbara Catinella, Nushkia Chamba, Timothy A. Davis, Cosima Eibensteiner, Eric Murphy, Mamta Pandey-Pommier, Amidou Sorgho

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究星系中气体循环,此前因对占质量主导的冷原子相了解少而受限。利用SKA及其他设备高分辨率观测,可解决恒星形成星际介质演化的开放性问题,介绍了相关观测的近期结果。

Comments Published in Advancing Astrophysics with the SKA II (AASKAII), 2026 (arXiv:2606.20366). Report-no:AASKAII/Rosolowsky01

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03368 2026-07-07 astro-ph.CO 新提交 67%

The giant radio source 0917+75: Origin and properties

巨型射电源0917+75:起源与性质

G. Giovannini, N. Biava, M. Girardi, W. Boschin, R. Barrena, A. Bonafede, L. Feretti, C. Ferrari, F. Govoni, M. Iacobelli, M. Murgia, E. Orru', R. Pizzo, V. Vacca

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究巨型射电源GRS0917 + 75,通过光学观测、低频射电成像及多频段射电数据分析,将其分类为特定类型星系,探讨其性质、起源及与环境的联系。

Comments 12 pages, 13 figures, accepted for publication in A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02417 2026-07-03 cs.RO cs.CV cs.LG 新提交 67%

LIME: Learning Intent-aware Camera Motion from Egocentric Video

LIME: 从自我中心视频学习意图感知的相机运动

Boyang Sun, Jiajie Li, Yung-Hsu Yang, Chenyangguang Zhang, Tim Engelbracht, Sunghwan Hong, Cesar Cadena, Marc Pollefeys, Hermann Blum

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft(微软) University of Bonn(波恩大学)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出LIME模型,从自我中心视频中挖掘多意图相机运动监督,结合自回归观察增益输出与连续流匹配位姿头,实现语言条件相机运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26044 2026-06-25 astro-ph.GA astro-ph.SR 新提交 67%

Jets and Outflows in Young Stellar Objects with the SKAO

年轻恒星天体中的喷流与外流与SKAO

Giovanni Sabatini, Gemma Busquet, Carlos Carrasco-González, Adriana Rodríguez-Kamenetzky, Codella Claudio, Linda Podio, Antonio Martínez-Henares, Josep Miquel Girart, Marta De Simone, Luca Cacciapuoti, Guillem Anglada, Lukasz Tychoniec, Lisa Giani, Manoj Puravankara, Francesca Bacciotti, Rafael Bachiller, Eleonora Bianchi, Guillermo Blázquez-Calero, Tyler L. Bourke, Stefano Bovino, Paola Caselli, Francesco Cavallaro, Cecilia Ceccarelli, Elena Diaz-Marquez, Stefano Facchini, Antonio Garufi, Greta Guidi, Tomoya Hirota, John D. Ilee, Adriano Ingallinera, Izaskun Jiménez-Serra, Valerio Lattanzi, Chin-Fei Lee, Manuela Lippi, Alessandro Lupi, Liton Majumdar, Mayank Narang, Mayra Osorio, Marco Padovani, Jaime Pineda, Isaac Radley, Basmah Riaz, Luis Felipe Rodríguez, Alvaro Sánchez-Monge, Alberto Sanna, Silvia Spezzano, Leonardo Testi, Claudia Toci, Alessio Traficante, Himanshu Tyagi, Grazia Maria Umana

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 本文综述了SKAO如何通过高分辨率厘米波观测、射电复合线和同步辐射,解决年轻恒星天体喷流/外流的加速、准直及化学影响等关键问题。

Comments Published in Advancing Astrophysics with the SKA II (AASKAII), 2026 (arXiv:2606.20366). Report-no:AASKAII/Sabatini01. Advancing Astrophysics with the SKA II (AASKAII) outlines the transformative scientific advances that will be enabled by the SKA telescopes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20980 2026-06-23 cs.CV cs.AI cs.RO 新提交 67%

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

Robusto-2: 在利马与纽约市对自动驾驶中人类与VLM的基准测试

Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza

机构 * Artificio Lima, Peru

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本研究通过视觉问答范式,比较人类驾驶员(来自利马和纽约)与视觉语言模型在利马和纽约的驾驶场景中的表现,发现人类与模型在回答事实、评级、反事实和推理四类问题时存在差异,但地理因素影响不显著。

Comments 11 pages main body. 42 pages total. Data publicly available online

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22845 2026-06-23 astro-ph.GA 新提交 67%

Observations of a Possible Transient Magnetically Arrested Accretion State in a Nearby Quasar: OQ208

邻近类星体OQ208中可能的瞬态磁捕获吸积态的观测

Brian Punsly, Cormac Reynolds, Paola Marziani, Gary J. Hill, Alexander B. Pushkarev, Carlo Stanghellini, Frank Schinzel, Christopher O'Dea, Gregory R. Zeimann, Andrew Biggs, Jian-Min Wang, Pu Du, Alberto Floris, Mauro D'Onofrio, Levi Malmstrom

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 基于39年多波段数据,发现OQ208在1997-2001年间Hα发射线减弱与射电耀斑同步,支持瞬态磁捕获吸积态模型。

Comments To appear in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09814 2026-06-18 astro-ph.SR astro-ph.GA 新提交 67%

ALMA measurements of mass loss and wind clumping in the massive stars of the Arches cluster

ALMA对Arches星团中大质量恒星的质量损失和风团块结构的测量

James P. Perry, Raman K. Prinja, Danielle M. Fenech, Francisco Najarro

专题命中 VLA模型 :VLA(summary_cn)

AI总结 利用ALMA和VLA数据,测量Arches星团中23颗大质量恒星的电离风质量损失率和团块结构,发现Wolf-Rayet星以热自由-自由辐射为主,而O型星存在非热同步辐射,并揭示风团块随半径减小。

Comments 16 pages, 5 figures, 7 tables, 2 appendices. Accepted for publication in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17210 2026-06-17 astro-ph.GA astro-ph.CO 新提交 67%

Testing masking effectiveness using multi-line image cubes based on COSMOS2020 for [CII] line intensity mapping at $z_{[CII]} > 3.5$

基于COSMOS2020的多线图像立方体测试掩膜有效性用于$z_{[CII]} > 3.5$的[CII]谱线强度映射

J. Clarke, C. Karoumpis, A. Dev, D. Riechers, T. Oak, Y. Okada, K. Narita, F. Bertoldi

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 利用COSMOS2020星系目录构建CO和[CII]发射线的强度映射立方体,通过掩膜技术恢复高红移[CII]信号,并评估噪声影响。

Comments 23 pages, 22 figures, submitted to A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13642 2026-06-12 gr-qc astro-ph.IM hep-ph 新提交 67%

Search for High-Frequency Gravitational Waves via Geomagnetic Conversion with Radio Telescopes

通过射电望远镜利用地磁转换搜索高频引力波

Hongliang Tian, Lei Wu, Xiaolong Yang, Qiang Yuan, Bin Zhu

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 利用甚大阵列和阿塔卡马大型毫米波/亚毫米波阵列,通过逆Gertsenshtein效应搜索高频引力波,未发现信号,将特征应变上限提高至三个数量级。

Comments 6 pages, 3 figures + Supplemental Materials(8 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21290 2026-07-24 cs.LG cs.AI 新提交 62%

Multi-Task Learning for Heterogeneous Prediction from Video Game State with Transfer Learning

基于迁移学习的视频游戏状态异构预测多任务学习

Jonas Peché, Aliaksei Tsishurou, Alexander Zap, Günter Wallner

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 研究视频游戏状态异构预测,通过适配多模态架构,采用跨任务联合训练共享模型,结合多种信息,经实验比较单多任务训练、评估策略及测试预训练等,还研究游戏内迁移,以降低成本并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04648 2026-07-07 cs.LG cs.AI 新提交 62%

Machine Learning for Depression Screening and Intervention: an Original Circadian Rhythm Score-based Methodology

用于抑郁症筛查和干预的机器学习:一种基于昼夜节律评分的原创方法

Bin Wang, Shuo Lian, Yuanyuan Hou, Dexian Wang, Peilan He, Feng Hong, Yanwei Yu, Tianrui Li

机构 * Ocean University of China(中国海洋大学) The Affiliated Hospital of Qingdao University(青岛大学附属医院) Chengdu University of Traditional Chinese Medicine(成都中医药大学) Southwest Jiaotong University(西南交通大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模行为数据筛查抑郁症的挑战,提出昼夜节律评分(CRS),构建可解释筛查框架及干预推理方法,通过实验验证其有效性,为抑郁症筛查和干预提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25434 2026-06-25 cs.LG cs.AI 新提交 62%

Interpretable Concept-Guided Polynomial Tabular Kolmogorov-Arnold Network for EEG-Based Mild Cognitive Impairment Detection

可解释概念引导的多项式表格Kolmogorov-Arnold网络用于基于EEG的轻度认知障碍检测

Yosef Bernardus Wirian, Qiang Cheng

机构 * Computer Science Department, University of Kentucky(肯塔基大学计算机科学系) Institute for Biomedical Informatics, University of Kentucky(肯塔基大学生物医学信息学研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 提出CPTabKAN模型,通过概念编码、二阶多项式交互和傅里叶参数化TabKAN分类器,在睡眠EEG数据上实现MCI检测,F1达0.9038。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25753 2026-06-25 cs.LG cs.AI math.OC physics.comp-ph physics.optics 新提交 62%

Gradient-based inverse lithography for EUV masks via the waveguide method and a physics-informed neural operator

基于梯度方法的EUV掩模逆光刻:波导方法与物理信息神经算子

Vasiliy A. Es'kin, Egor V. Ivanov

机构 * University of Nizhny Novgorod(下诺夫哥罗德大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于梯度方法的极紫外掩模逆光刻技术,利用可微波导方法和波导神经算子作为端到端物理引擎,通过自动微分恢复掩模吸收体介电常数,实验验证了在多种材料下实现所需晶圆场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21623 2026-06-23 cs.CV cs.AI 新提交 62%

A DVDrive Approach for doScenes Instructed Driving Challenge

一种面向 doScenes 指令驾驶挑战的 DVDrive 方法

Zijian Fu, Xiangyang Chu, Mengshi Qi, Huadong Ma, Guanghao Zhang, Wei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Xiaomi EV(小米汽车)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 提出基于 OmniDrive 的指令条件轨迹预测方法,引入 DVPE 分视角感知模块减少跨视角干扰,提升多视角视觉定位与语言指令对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19408 2026-06-19 cs.LG cs.RO 新提交 62%

FlexLAM: Resolving the Bottleneck Trade-off in Latent Action Learning

FlexLAM: 解决潜在动作学习中的瓶颈权衡

Takanori Yoshimoto, Yang Hu, Naruya Kondo, Tatsuya Matsushima

机构 * University of Tsukuba(筑波大学) The University of Tokyo(东京大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.LG

AI总结 针对潜在动作模型中固定容量瓶颈导致的权衡问题,提出FlexLAM,通过嵌套dropout实现变长潜在动作,在不增加架构或损失的情况下,在稀缺标签和低回报任务中优于固定容量模型,并支持推理时调整令牌预算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17480 2026-06-17 cs.CV cs.RO 新提交 62%

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

GeneralVLA-2: 几何感知重建与受控记忆用于机器人规划

Haoyu Wang, Guoqing Ma, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) CASIA(中国科学院自动化研究所) AI 2 Robotics

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 针对机器人规划中3D物体重建幻觉和记忆质量不可控的问题,提出GeoFuse-MV3D几何先验引导重建分支和受控长期记忆系统,在GSO-30和Terminal-Bench等基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14777 2026-06-16 cs.CV cs.AI 新提交 62%

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

JoyAI-VL-Interaction: 实时视觉-语言交互智能

Dingyu Yao, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Haowen Hou, Zheming Liang, Congcong Wang, Yuhang Cao, Shenglong Ye, Shuai Xie, Shuhuan Gu, Haoyang Huang, Qingyi Si, Nan Duan, Jiaqi Wang

机构 * JD.com(京东)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

AI总结 提出一种持续观察、自主决定是否回应的视觉-语言交互模型,并开源8B规模模型及完整部署系统,在六个真实场景中优于现有方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09388 2026-08-11 cs.CV 新提交 57%

Efficient Human-Contact Representation for Human-Scene Interaction

面向人-场景交互的高效人体接触表示

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen

机构 * AIOZ University of Liverpool(利物浦大学) NTHU(国立清华大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 针对人-场景交互中接触表示效率不足的问题,提出稀疏接触掩码与稀疏算子,在三个基准数据集的接触预测和场景合成任务上,实现至少12倍提速且精度优于现有最优模型。

Comments Accepted in ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08632 2026-08-11 cs.AI 新提交 57%

A QUBO-Inspired Computational Framework for Airport Landside Bottleneck Diagnosis and Dynamic Dispatch Optimization

一种受QUBO启发的机场陆侧瓶颈诊断与动态调度优化计算框架

Wuming Lei, Xiaobin Li, Mingyan Sun, Jianing Long, Yulin Tong, Yanbin Gao

机构 * East China Jiaotong University(华东交通大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本研究针对机场陆侧高峰耦合拥堵问题,提出受QUBO启发的计算框架,通过5分钟状态模型与多指标诊断瓶颈,采用两种调度方案优化,在两大机场测试中显著缩减旅客队列,且具备鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28829 2026-08-03 cs.NI cs.LG 新提交 57%

When Unlearning Fails: Reliable Data Deletion under Post-Training in Agent Networks

当遗忘失效时:智能体网络后训练下的可靠数据删除

Zihao Ding, Jun Huang, Liang Dong

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.LG

AI总结 针对自改进联邦智能体网络后训练时数据删除易出现影响回声的问题,提出MUTE方法,经实验验证其可在保障任务效用的同时降低行为泄漏且通信开销更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24431 2026-07-28 cs.CV 新提交 57%

InterOCF: Spatio-Temporal 2D-3D Interaction for Camera-Only 4D Occupancy Forecasting

InterOCF:用于仅相机4D占用预测的时空2D-3D交互

Qi Zhang, Xinquan Yu, Kaiyi Zhang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 研究针对仅相机4D占用预测中输入多视图帧间时空建模不足问题,提出InterOCF框架,通过联合建模3D体素表示和多视图分割序列中的时间动态,并纳入2D与3D分支特征交互,实验证明其性能优于现有方法。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23077 2026-07-28 cs.AI 新提交 57%

Structure over Depth: A Single-Block Spatio-Temporal Transformer for Multi-Entity Reasoning

深度之上的结构:用于多实体推理的单块时空变换器

Narthana Sivalingam, Santhirarajah Sivasthigan, Buddhi Wijenayake, Roshan Godaliyadda, Vijitha Herath, Parakrama Ekanayake

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 研究多实体时间数据建模问题,提出结构化时空变换器块,通过并行自注意力和双向交叉注意力及门控融合,在单个阶段明确建模三种交互,减少深层堆叠需求,在多任务中表现良好,支持结构优先设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21681 2026-07-27 cs.LG 新提交 57%

CARNet Cycle-Conditioned Core Aggregation and Redistribution for Multivariate Time Series Forecasting

用于多变量时间序列预测的循环条件核心聚合与重新分配的CARNet

Awsaf Tausif Adib, Md. Shahria Sarker Shuvo, Md. Estehaar Ahmed Emon, Mustafa Kamal, Fuad Rahman, Shafin Rahman, Nabeel Mohammed

机构 * North South University(南北大学) Apurba Technologies(阿普尔巴科技公司)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 针对多变量时间序列预测中交叉变量依赖建模难题,提出CARNet框架,通过多头核心聚合将全局循环信息融入基于核心的交互建模,实验证明其在不同预测范围优于基线,且保持线性复杂度。

Comments Accepted at ECML PKDD 2026 (Research Track). Shortlisted for Best Research Track Student Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11964 2026-07-15 cs.LG 新提交 57%

LIDAR-AD: A Decoder-Free Latent-Interaction Dreamer with Action-Residual Chains for Autonomous Driving

LIDAR-AD:一种用于自动驾驶的无解码器潜在交互梦想家与动作残差链

Yongzhi Liu, Yang Xiao, Zhong Cao, Zeng Kang, Sunan Zhang, Zhaozhi Dong, Guojun Yu, Weichao Zhuang

机构 * School of Mechanical Engineering, Southeast University(东南大学机械工程学院) Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系) Xheart Technology Co., Ltd.(芯驰科技有限公司)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 研究针对自动驾驶中多源观测冗余问题,提出LIDAR-AD,用减少冗余的潜在对齐取代观测重建,将车辆控制建模为残差动作更新,经实验验证其在模拟场景和现实布局下性能优异,能提升风险感知等能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09725 2026-07-14 cs.RO 新提交 57%

Learning High-Level Decision Making with an Interaction-Aware Attention-Based Network in Autonomous Driving

在自动驾驶中使用基于交互感知注意力的网络学习高级决策

Marcelo Contreras, Willi Poh, Christoph Stiller, Ehsan Hashemi

机构 * NODE lab, University of Alberta(节点实验室,阿尔伯塔大学) MRT Institute, Karlsruhe Institute of Technology(MRT 研究所,卡尔斯鲁厄理工学院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 研究自动驾驶中高级决策问题,提出DecisionPerceiver将动态代理特征投影到固定大小潜在空间,通过潜在查询数调节特征粒度,还细化动作集,经多场景评估有性能提升、泛化能力及可扩展性。

Comments 6 pages, 5 figures, 3 tables, submitted to 2026 IEEE Intelligent Transportation Systems Conference (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03017 2026-07-07 cs.RO 新提交 57%

Beyond Heuristics: A Standardized Real2Sim Pipeline for Physical Human Robot Interaction in Human-in-the-Loop Simulation

超越启发式方法:用于人在回路仿真中物理人机交互的标准化真实到仿真管道

Chengyuan Yang, Yifan Wang, Chun Kwang Tan, Sherwin Stephen Chan, Youlong Wang, Xiaoyue Yan, Lei Li, Wei Tech Ang

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航天工程学院) Guangdong Zhongxin Intelligent Rehabilitation Research Institute(广东众鑫智能康复研究院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 研究针对人在回路仿真中交互模型阻抗参数靠启发式调整的问题,提出Real2Sim管道,用协方差矩阵自适应进化策略识别动力学参数,提高仿真保真度,支持人体数字双胞胎用于个性化控制器临床前验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00269 2026-07-07 cs.AI 新提交 57%

Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理

Edward Y. Chang, Longling Geng, Emily J. Chang

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。

Comments 41 pages, 25 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01743 2026-07-03 cs.CV 新提交 57%

InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation

InterCMDM:用于自回归人体交互生成的块因果扩散

Qing Yu, Kent Fujiwara

机构 * LY Corporation(LY公司)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 提出InterCMDM块因果潜扩散框架,通过双流因果扩散Transformer和多重任务注意力掩码实现自回归双人交互生成,解决因果性缺失和时间漂移问题,在InterHuman和InterX上达到最优性能。

Comments Accepted to ECCV 2026, Project website: https://yu1ut.com/InterCMDM-HP/

详情

展开后加载摘要…

URL PDF HTML 收藏