arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-03 至 2026-06-03 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 数据集与评测 2 篇

2606.02745 2026-06-03 cs.RO cs.LG 82%

SeeTraceAct: Visibility-Aware Latent Planning from Cross-Embodiment Demonstration Videos

SeeTraceAct: 跨具身演示视频中的可见性感知潜在规划

Jaehyeon Son, Junhyun Kim, Kyle Kam, Jeremiah Coholich, Seok Joon Kim, Jinhoo Kim, Chris Dongjoo Kim, Jaemin Cho, Dieter Fox, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院) Allen Institute for AI(Allen人工智能研究所) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学)

专题命中 数据集与评测 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 提出SeeTraceAct框架,通过可见性感知的未来末端执行器轨迹预测增强空间定位,实现基于单次跨具身演示视频的机器人策略泛化,在模拟和真实场景中取得最优成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02971 2026-06-03 cs.CL 50%

EURO-5K: When Does Domain Pretraining Matter? Benchmarking Transformers for EU Reporting Obligation Extraction

EURO-5K:领域预训练何时重要?用于欧盟报告义务提取的Transformer基准测试

Marios Koniaris, Vasileios Kotronis, Eugenia Giannini, Panayiotis Tsanakas

机构 * Division of Computer Science, School of Electrical and Computer Engineering(计算机科学系,电气与计算机工程学院) National Technical University of Athens(雅典技术大学) Department of Humanities Social Sciences and Law, School of Applied Mathematical and Physical Sciences(人文社会科学与法律系,应用数学与物理科学学院)

专题命中 数据集与评测 :action model(abstract)

AI总结 本文构建了EURO-5K数据集,通过对比判别式与生成式模型在欧盟报告义务提取上的表现,发现领域预训练在参数高效微调时收益显著,且模型可作为专用提取器。

详情

展开后加载摘要…

URL PDF HTML 收藏