机构
*
Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科沃科学与技术研究所)
机构
*
Tsinghua University(清华大学)
;
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Peking University(北京大学)
专题命中
GUI与屏幕智能体
:grounding(abstract);multimodal large language model(abstract);MLLM(abstract)
SCLARO: A Dataset for Grounded Scenario-Level Scene Understanding and ScenarioCLIP for Benchmarking
SCLARO:面向场景级场景理解的数据集及用于基准测试的ScenarioCLIP
Advik Sinha, Saurabh Atreya, Aashutosh A, Sk Aziz Ali, Abhijit Das
机构
*
Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Science, Pilani – Hyderabad Campus(人工智能组,计算机科学与信息系,比拉理工学院和科学学院,比拉-海得拉巴校区)
专题命中
GUI与屏幕智能体
:visual language model(title);分类 cs.CV
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系)
;
Communication University of China(中国传媒大学)
;
Imperial College London(伦敦帝国学院)
;
School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)
GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation
GUIDE:通过实时网络视频检索和即插即用标注解决GUI代理的领域偏见
Rui Xie, Zhi Gao, Chenrui Shi, Zirui Shang, Lu Chen, Qing Li
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)
;
Beijing Institute of Technology(北京理工大学)
CommentsAccepted to ECCV 2026. 30 pages: 15-page main paper followed by supplementary material as an appendix (Sections A-F). Project page: https://sharryXR.github.io/GUIDE/
NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms
NormAct:具身规划中隐藏社会规范遵守的基准
Shiyun Zhao, Xinwei Song, Tianyu Guo, Xiaomeng Gao, Mingyuan Liu, Xu Han, Yuanyuan Zhang, Zhenliang Zhang, Xue Feng, Bo Dai
机构
*
State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院)
;
China Academy of Information and Communications Technology(中国信息通信研究院)
;
ShanghaiTech University(上海科技大学)
专题命中
GUI与屏幕智能体
:multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models
UAOR: 面向视觉-语言-动作模型的不确定性感知观测重注入
Jiabing Yang, Yixiang Chen, Yuan Xu, Peiyan Li, Zichen Wen, Bowen Fang, Tao Yu, Xiangnan Wu, Qisen Ma, Kai Wang, Ziheng He, Yingda Li, Zhengbo Zhang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新技术实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
FiveAges(五代)