CommentsAccepted for publication at the 2026 IEEE International Conference on Cyber Security and Resilience (IEEE CSR), Lisbon, Portugal, August 3-5, 2026. 8 pages, 1 figure
Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning
视觉语言动作模型所言即所指?论忠实性在具身推理中的作用
Matthew Foutter, Matteo Cercola, Lena Wild, Yunshan Wang, Michelle Li, Daniele Gammelli, Marco Pavone
机构
*
Stanford University(斯坦福大学)
;
Politecnico di Milano(米兰理工大学)
;
KTH Royal Institute of Technology(皇家理工学院)
;
Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所)
;
NVIDIA Research(英伟达研究院)
机构
*
Nanjing University(南京大学)
;
Tencent Youtu Lab(腾讯优图实验室)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
;
University of Washington(华盛顿大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Australian National University(澳大利亚国立大学)
Comments23 pages, 3 figures. Published in Findings of the Association for Computational Linguistics: ACL 2026
Journal refFindings of the Association for Computational Linguistics: ACL 2026, pages 36427-36449, San Diego, California, United States. Association for Computational Linguistics