arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 266 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 266 篇

2512.02076 2026-07-09 cs.LG cs.AI 版本更新 76%

FDRMFL: Multimodal Federated Feature Extraction Model Based on Information Maximization and Contrastive Learning

FDRMFL:基于信息最大化和对比学习的多模态联邦特征提取模型

Haozhe Wu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

AI总结 针对非IID数据分布下联邦回归的多模态特征提取难题,提出FDRMFL框架,通过统一的四项局部目标应对挑战,实验表明该框架能有效降低平均MSE,在六种联邦算法中表现最佳。

Comments Accepted author manuscript; published version DOI: 10.1016/j.asoc.2026.115874

Journal ref Applied Soft Computing 202 (2026) 115874

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18714 2026-06-16 cs.RO cs.AI cs.LG 版本更新 75%

Explainable deep learning improves human mental models of self-driving cars

可解释深度学习提升人类对自动驾驶汽车的心理模型

Eoin M. Kenny, Akshay Dharmavaram, Sang Uk Lee, Tung Phan-Minh, Shreyas Rajesh, Yunqing Hu, Laura Major, Momchil S. Tomov, Julie A. Shah

机构 * Computer Science & Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院) Motional AD Inc.(Motional AD公司) Department of Psychology and Center for Brain Science, Harvard University(心理学系和大脑科学中心,哈佛大学) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与宇航系,麻省理工学院)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出概念包装网络(CW-Net),在真实自动驾驶车上实现可解释规划,通过因果性概念解释提升驾驶员对车辆行为的预测能力,尤其在意外场景中。

Comments MST & JAS contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27933 2026-08-07 cs.AI 版本更新 74%

The Geometry of Flow-Matching Uncertainty: A Cost-free Uncertainty Proxy and Its Application in Flow-based VLA Failure Detection

流匹配不确定性的几何本质与自由代理

Ziyang Rao, Yiren Zhao, Weiyu Guo, Ben Fei, Yandong Guo, Hui Xiong

专题命中 VLA模型 :VLA(title);分类 cs.AI

AI总结 该研究针对流匹配(FM)不确定性估计方法的缺陷,提出去噪加速度(accel)作为高泛化无成本的不确定性代理,可提前识别FM生成动作的失败,性能优于相关基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新 73%

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10350 2026-07-20 cs.AI cs.RO 版本更新 73%

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

ABot-AgentOS:一个具有终身多模态记忆的通用机器人智能体操作系统

Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Wenbin Tang, Mu Xu

机构 * AMAP CV Lab(AMAP计算机视觉实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究针对长期具身智能体运行需求,提出ABot-AgentOS通用机器人智能体操作系统,引入EmbodiedWorldBench基准,采用通用多模态图记忆及失败驱动自我进化循环,在相关测试中表现良好,证明该系统层可提升具身执行并提供持久记忆。

Comments Code: https://github.com/amap-cvlab/ABot-AgentOS Project page: https://amap-cvlab.github.io/ABot-AgentOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 73%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21241 2026-07-07 cs.RO cs.AI 版本更新 73%

CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors

CorridorVLA:通过稀疏锚点实现生成动作头的显式空间约束

Dachong Li, ZhuangZhuang Chen, Jin Zhang, Jianqiang Li

机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 CorridorVLA通过稀疏锚点提供显式空间约束,提升动作生成性能,在LIBERO-Plus基准上改进成功率3.4%-12.4%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15757 2026-06-23 cs.RO cs.AI 版本更新 73%

You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector

你有一张金票:用单一噪声向量改进生成式机器人策略

Omkar Patil, Ondrej Biza, Thomas Weng, Karl Schmeckpeper, Wil Thomason, Xiaohan Zhang, Kausik Sivakumar, Robin Walters, Nakul Gopalan, Sebastian Castro, Stephen Hart, Eric Rosen

机构 * Robotics and AI Institute(机器人与人工智能研究所) Arizona State University(亚利桑那州立大学) Northeastern University(东北大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出用固定初始噪声替换高斯采样,通过蒙特卡洛搜索找到“金票”,无需训练即可提升预训练扩散/流匹配策略在46/51个任务中的成功率,最高提升55%。

Comments 34 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22022 2026-08-17 math.NA 版本更新 71%

A High-Accuracy Symplectic Scheme for a nonlinear transport problem

非线性输运问题的高精度辛格式

Farjana Siddiqua, Catalin Trenchea

专题命中 VLA模型 :action model(title)

AI总结 针对可建模色谱法的非齐次边界条件平流-扩散-反应问题,采用辛单步隐式中点法和有限元法,完成稳定性、误差分析及全离散解存在性证明,数值测试验证了理论结果。

Comments 33 pages, 5 Figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14969 2026-07-23 cond-mat.str-el 版本更新 71%

On the Symmetries of Anisotropic Spin Interaction Models

关于各向异性自旋相互作用模型的对称性

Arist Zhenyuan Yang

专题命中 VLA模型 :action model(title)

AI总结 研究各向异性自旋相互作用模型的对称性,通过重新定义纯自旋群\(S_0\)制定tSSG理论,研究自旋-1模型发现\(\mathbb{Z}_2\)拓扑四极激发及相关特性,建立相互作用自旋系统对称语言,开辟非常规磁性研究途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12381 2026-07-23 quant-ph 版本更新 71%

Enhanced quantum illumination of a lossy target: A sequential interaction model

增强的损失性目标量子照明:一个顺序交互模型

Shilpi Srivastava, Shubhrangshu Dasgupta

专题命中 VLA模型 :action model(title)

AI总结 研究在现实环境中量子照明对损失性目标的有效性,比较高斯双模压缩态与最优经典协议的性能,发现TMSS在低反射率目标下具有更高的SNR和更强的抗热噪声能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02564 2026-07-13 cs.CL 版本更新 71%

Relation Extraction Model Based on Semantic Enhancement Mechanism

基于语义增强机制的关系抽取模型

Peiyu Liu, Junping Du, Yingxia Shao, Zeli Guan

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(计算机学院(国家试点软件工程学院)、北京邮电大学) Beijing Key Laboratory of Intelligent Telecommunication Software and Multimedia(智能电信软件与多媒体北京重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLA模型 :action model(title)

AI总结 研究自然语言处理中关系抽取的三元组重叠问题,提出基于CasRel框架结合语义增强机制的CasAug模型,通过对可能主语预分类、计算语义相似度等操作,提升关系抽取效果,增强处理重叠问题及抽取多关系的能力。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16752 2026-07-09 quant-ph 版本更新 71%

Characterizing Phase Fragility via Algorithmically Prepared Ancillas in Repeated-Interaction Models

通过重复相互作用模型中算法制备的辅助量子比特表征相位脆弱性

S. Elham Mousavigharalari, Deniz Türkpençe

专题命中 VLA模型 :action model(title)

AI总结 研究通过单比特门序列编码的相位参数$\phi$在噪声动力学下的量子费希尔信息,采用碰撞模型和脉冲分辨开放系统模拟两种方法,结果表明二者QFI分布对相位依赖性相似,稳态框架可表征相位敏感性,还给出未来应用方向。

Comments 21 pages, 5 figures. This work presents an analytic and simulation-based study of phase sensitivity in noisy quantum devices, linking collision models and device-level simulations via quantum Fisher information, and will be of interest to readers in quantum computing and quantum metrology

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10187 2026-06-23 astro-ph.SR astro-ph.HE gr-qc 版本更新 71%

Modern tidal interaction models for rapid binary population synthesis: I. Methods

现代潮汐相互作用模型用于快速双星族合成:I. 方法

Veome Kapil, Ilya Mandel, Evgeni Grishin, Jim Fuller, Jeff Riley, Emanuele Berti

专题命中 VLA模型 :action model(title)

AI总结 本文提出适用于快速双星族合成的现代潮汐耗散理论简化表达式,在COMPAS中实现并验证了潮汐与恒星演化及双星性质的自洽耦合,潮汐耗散效率可比常用模型高1-7个数量级。

Comments 24 pages, 11 figures, accepted for publication by ApJ

Journal ref ApJ 1002 200 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06370 2026-06-12 nucl-th 版本更新 71%

New approach for the quantification of uncertainties in reaction modeling via data-driven multi-objective optimization

通过数据驱动的多目标优化量化反应建模中不确定性的新方法

N. Dimitrakopoulos, G. Perdikakis, F. Montes, P. Gastis, S. A. Kuvin, H. Y. Lee, P. Tsintari, A. V. Voinov

专题命中 VLA模型 :action model(title)

AI总结 提出一种多目标优化方法,在Hauser-Feshbach框架下同时考虑多通道数据,量化核反应参数的不确定性,并在Ni-Ge区域验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22670 2026-06-11 physics.comp-ph 版本更新 71%

A survey of interlayer interaction models for graphene and other 2D materials

石墨烯及其他二维材料层间相互作用模型综述

Gourav Yadav, Shakti S. Gupta, Roger A. Sauer

专题命中 VLA模型 :action model(title)

AI总结 综述了描述二维材料间范德华相互作用的力学模型,涵盖连续弹性体与离散晶体材料,重点讨论了法向和切向接触模型、外部载荷及尺度变化对基态构型和摩擦接触行为的影响,并分析了多尺度建模中降低计算成本的策略。

Comments 55 pages, 25 figures

Journal ref Adv. Mater. Interfaces (2026), e70553

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03781 2026-08-14 cs.RO 版本更新 70%

OpenRC: An Open-Source Robotic Colonoscopy Framework for Multimodal Data Acquisition and Autonomy Research

OpenRC:一种用于多模态数据采集和自主性研究的开源机器人结肠镜框架

Siddhartha Kapuria, Mohammad Rafiee Javazm, Naruhiko Ikoma, Joga Ivatury, Mohammad Ali Nasseri, Nassir Navab, Farshid Alambeigi

机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系) Department of Surgical Oncology, Division of Surgery, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心外科肿瘤学系) School of Medicine and Health, Technical University of Munich(慕尼黑工业大学医学与健康学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 OpenRC框架通过整合开源硬件和多模态数据集,为机器人结肠镜和手术自主性研究提供了可重复的基础,支持同时记录视频、操作指令、执行状态和末端位置,并验证了运动一致性和跨模态延迟。

Comments Abstract: Added repository and contribution statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12908 2026-08-13 cs.RO 版本更新 70%

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干

Zijian Song, Qichang Li, Jiawei Zhou, Zhenlong Yuan, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) X-Era AI Lab(X-Era人工智能实验室) AMAP, Alibaba(阿里妈妈实验室) Guangdong University of Technology(广东工业大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01151 2026-08-11 cs.LG 版本更新 70%

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

拉格朗日扰动扩散引导:用于生成策略的潜在强化学习

Hikmet Simsir, Ozgur S. Oguz

机构 * University of Michigan(密歇根大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.LG

AI总结 提出拉格朗日扰动扩散引导(LP-DS),通过学习紧凑的噪声空间扰动来微调冻结的生成策略,利用拉格朗日信任区域目标优化,在保持潜在先验约束的同时提升下游价值,在多个基准上实现样本效率和回报提升。

Comments Accepted as a regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15890 2026-08-06 cs.CV 版本更新 70%

Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting

Exo2EgoPose:利用外心演示进行视觉语言引导的自我中心3D手部姿态预测

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Xiang Li, Hongliang Li

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.CV

AI总结 研究视觉语言引导的自我中心3D手部姿态预测任务,提出Exo2EgoPose框架,利用外心演示补偿自我中心视角线索不足,含双层外心重建模块和全局到局部调制模块,实验显示该方法优于现有技术,具备人机转移能力且有改进。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09971 2026-07-30 cs.RO 版本更新 70%

TiPToP: A Modular Open-Vocabulary Robot Manipulation System That Plans

TiPToP:一种用于机器人操作的模块化开放式词汇规划系统

William Shen, Nishanth Kumar, Sahit Chintalapudi, Ryan Lindeborg, Jie Wang, Christopher Watson, Edward Hu, Jing Cao, Dinesh Jayaraman, Leslie Pack Kaelbling, Tomás Lozano-Pérez

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 TiPToP是一种模块化开放式词汇规划系统,结合预训练视觉模型与任务规划器,通过自然语言指令和RGB图像直接解决多步骤操作任务,实现实时高效的操作规划。

Comments Project website: https://tiptop-robot.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18709 2026-07-23 cs.RO 版本更新 70%

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。

Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25746 2026-07-22 cs.RO 版本更新 70%

TacRefineNet: Goal-Conditioned Tactile Grasp Refinement for Edge-Prominent Objects

TacRefineNet:用于边缘突出物体的目标条件触觉抓取优化

Shuaijun Wang, Haoran Zhou, Diyun Xiang, Yangwei You

机构 * Xiaomi Robotics(小米机器人)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 研究针对边缘突出物体抓取对齐难的问题,提出TacRefineNet框架,利用连体策略网络预测手腕姿态增量,经交叉组合训练,在模拟样本上训练后部署到实际五指手,实验表明其在可见物体抓取上有一定成功率及误差控制,还有长期扰动校正等特点。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15038 2026-07-20 cs.CV 版本更新 70%

Video = World + Event Stream

视频 = 世界 + 事件流

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 研究提出Wan-Streamer v0.3,将视频视为世界加事件流,据此有通用预训练任务,应用于实时全双工视听交互,保留v0.2运行点,为实时下游任务提供能力。

Comments website: https://wan-streamer.com/v0.3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07420 2026-07-16 cs.RO cs.HC 版本更新 70%

Initiation Safety: A Missing Dimension in Generalist-Robot Safety

启动安全:通用机器人安全中缺失的维度

Zhijin Meng, Francisco Cruz

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 探讨通用机器人安全中缺失的启动授权维度,通过在人形机器人上实施PAS等方法进行研究,并提出包含三个条件的用户研究,涉及多方面开放性问题。

Comments 4 pages, 2 figures. Accepted to RSS 2026 Workshop on Rethinking Safety for Generalist Robots

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05461 2026-06-15 cs.AI 版本更新 70%

Output Type Before Quality: A Standards-Derived XAI Admissibility Rubric for Autonomous-Driving Safety

先输出类型,后质量:基于标准的自动驾驶安全XAI可接受性评估标准

Abhinaw Priyadershi, Mandar Pitale, Jelena Frtunikj, Maria Spence

机构 * NVIDIA Corporation(英伟达公司) NVIDIA GmbH(英伟达德国分公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.AI

AI总结 针对基于ML的自动驾驶安全标准与XAI方法输出类型不匹配的证据类型缺口,从多个安全标准推导出19项可测试证据标准,评估六类XAI方法,发现因果XAI在三个生命周期阶段结构上必需,并提出了结构可接受性概念。

Comments Accepted at SAFECOMP 2026 Workshops (SASSUR); to appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27476 2026-06-09 cs.CV 版本更新 70%

EdgeFM: Efficient Edge Inference for Vision-Language Models

EdgeFM: 为视觉-语言模型高效边缘推理设计的框架

Mengling Deng, Yuanpeng Chen, Sheng Yang, Wei Tao, Wenhai Zhang, Hui Song, Linyuanhao Qin, Kai Zhao, Xiaojun Ye, Shanhui Mo, Jingli Fan, Shuang Zhang, Bei Liu, Tiankun Zhao, Xiangjing An

机构 * Go Further. AI School of Data Science Fudan University(复旦大学数据科学学院) RUYi Dynamics Co. Ltd(RUYi Dynamics有限公司) Independent Researcher(独立研究者)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.CV

AI总结 EdgeFM通过轻量级代理驱动框架,优化边缘部署的视觉-语言模型推理,提升跨平台性能和可移植性,实现比传统工具链更快的推理速度。

Comments Technique Report version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29699 2026-08-14 cs.CV cs.AI cs.RO 版本更新 67%

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift

视觉分布偏移下OpenVLA故障的早期预警信号

Dipesh Tharu Mahato, Rachel Ren

机构 * New York University(纽约大学)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 研究在视觉分布偏移下,OpenVLA内部激活是否包含可线性解码的近期任务失败信息,通过LIBERO操作实验发现第16层逻辑探针在遮挡条件下预测失败AUROC达0.972。

Comments 16 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15844 2026-08-07 astro-ph.IM astro-ph.CO 版本更新 67%

Radio-Interferometric Image Reconstruction with Denoising Diffusion Restoration Models

利用去噪扩散恢复模型进行无线电干涉成像重建

Michel Morales, Emma Tolley, Remi Poitevineau

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 本文提出基于去噪扩散概率模型的无线电天空成像重建方法,通过训练DDPM并结合DDRM技术,在不依赖网格化可见度数据的情况下实现高保真重建,优于传统CLEAN方法。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08105 2026-08-06 astro-ph.SR astro-ph.GA 版本更新 67%

The SOFIA Massive (SOMA) Radio Survey. III. Radio Emission from Intermediate-Mass Protostars

SOFIA大规模恒星形成调查。III. 中等质量原恒星的无线电发射

Francisco Sequeira-Murillo, Viviana Rosero, Joshua Marvil, Jonathan C. Tan, Ruben Fedriani, Yichen Zhang, Prasanta Gorai, James M. De Buizer, Maria T. Beltrán

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 SOFIA调查研究了中等质量原恒星的无线电发射,揭示了其形态和光谱特性,扩展了样本并提供了对原恒星演化模型的新约束。

Comments Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏