Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges
构建第一人称程序化AI助手:方法、基准和挑战
Junlong Li, Huaiyuan Xu, Sijie Cheng, Kejun Wu, Kim-Hui Yap, Lap-Pui Chau, Yi Wang
机构
*
Department of EEE(电子工程系)
;
The Hong Kong Polytechnic University(香港理工大学)
;
RayNeo
;
Tsinghua University(清华大学)
;
Huazhong University of Science and Technology(华中科技大学)
;
Nanyang Technological University(南洋理工大学)
SMMILE: An Expert-Driven Benchmark for Multimodal Medical In-Context Learning
SMMILE:一个多模态医学上下文学习的专家驱动基准
Melanie Rieff, Maya Varma, Ossian Rabow, Subathra Adithan, Julie Kim, Ken Chang, Hannah Lee, Nidhi Rohatgi, Christian Bluethgen, Mohamed S. Muneer, Jean-Benoit Delbrouck, Michael Moor
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
Stanford University(斯坦福大学)
;
Lund University(隆德大学)
;
Jawaharlal Institute of Postgraduate Medical Education and Research(贾瓦哈拉尔·尼赫鲁医学教育与研究学院)
;
UCSF(加州大学旧金山分校)
;
University of Zurich(苏黎世大学)
;
University Hospital Zurich(苏黎世大学医院)
;
HOPPR
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.LG
GRASP: Guided Region-Aware Sparse Prompting for Adapting MLLMs to Remote Sensing
GRASP: 基于区域感知的稀疏提示引导方法用于适应遥感图像的多模态大语言模型
Qigan Sun, Chaoning Zhang, Jianwei Zhang, Xudong Wang, Jiehui Xie, Pengcheng Zheng, Haoyu Wang, Sungyoung Lee, Chi-lok Andy Tai, Yang Yang, Heng Tao Shen
机构
*
School of Computing, Kyung Hee University(京畿大学计算机学院)
;
School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)
;
School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
;
College of Computer Science and Information Engineering, Harbin Normal University(哈尔滨师范大学计算机科学与信息工程学院)
;
College of Professional and Continuing Education, The Hong Kong Polytechnic University(香港理工大学专业及继续教育学院)
;
School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Yuezhe Yang, Hao Wang, Yige Peng, Jinman Kim, Lei Bi
机构
*
Institute of Translational Medicine, Shanghai Jiao Tong University(翻译医学研究院,上海交通大学)
;
School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)
RPIQ: Residual-Projected Multi-Collaboration Closed-Loop and Single Instance Quantization for Visually Impaired Assistance
RPIQ: 基于残差投影多协作闭环和单实例量化的方法用于视障辅助
Xuanyu Wang, Haisen Su, Jingtao Zhang, Xiangxiang Wang, Yongbin Yu, Manping Fan, Jialing Xiao, Bo Gong, Siqi Chen, Mingsheng Cao, Liyong Ren, Zhenglin Yang
机构
*
School of Information
;
Software Engineering, University of Electronic Science
;
School of Mathematical Sciences, Sichuan Normal University, Chengdu, Sichuan, China
;
Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science
;
Research Unit for Blindness Prevention, Chinese Academy of Medical Sciences, Sichuan Academy of Medical Sciences
;
Sichuan Provincial People’s Hospital, Chengdu, Sichuan, China
;
School of Medicine, University of Electronic Science
;
Tibetan Language Intelligence National Key Laboratory, Qinghai Normal University, Xining, Qinghai, China
Towards Vision-Language Geo-Foundation Model: A Survey
迈向视觉-语言地理基础模型:一种综述
Yue Zhou, Zhihang Zhong, Xue Yang
机构
*
School of GeoAI(地理人工智能学院)
;
Hindon STAI Institute(Hindon STAI研究所)
;
Key Laboratory of Geographic Information Science (Ministry of Education)(地理信息科学重点实验室)
;
East China Normal University(华东师范大学)
;
School of AI(人工智能学院)
;
Shanghai Jiao Tong University(上海交通大学)
;
School of Automation and Intelligent Sensing(自动化与智能感知学院)
SpatialReasoner: Active Perception for Large-Scale 3D Scene Understanding
SpatialReasoner: 大规模3D场景理解中的主动感知
Hongpei Zheng, Shijie Li, Yanran Li, Hujun Yin
机构
*
University of Manchester(曼彻斯特大学)
;
Institute for Infocomm Research (I2R), A*STAR, Singapore(信息与通信研究 institute(I2R),A*STAR,新加坡)
;
University of Bedfordshire(贝德福德郡大学)
机构
*
South China University of Technology(华南理工大学)
;
Sun Yat-sen University(中山大学)
;
Hangzhou Dianzi University(杭州电子科技大学)
;
Zhejiang University of Finance & Economics(浙江财经大学)
;
National University of Singapore(新加坡国立大学)
;
Shenzhen Research Institute of Big Data(深圳大数据研究院)
;
City University of Hong Kong(香港城市大学)
VLMs Guided Interpretable Decision Making for Autonomous Driving
Xin Hu, Taotao Jing, Renran Tian, Zhengming Ding
机构
*
Department of Computer Science, Tulane University(路易斯安那大学计算机科学系)
;
Qualcomm(高通公司)
;
Department of Industrial and Systems Engineering, North Carolina State University(北卡罗来纳州立大学工业与系统工程系)
Tracing and Mitigating Hallucinations in Multimodal LLMs via Dynamic Attention Localization
Tiancheng Yang, Lin Zhang, Jiaye Lin, Guimin Hu, Di Wang, Lijie Hu
机构
*
MBZUAI
;
Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析实验室)
;
King Abdullah University of Science and Technology(卡迪夫大学科学与技术大学)
;
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院)
;
University of Copenhagen(哥本哈根大学)
;
Tsinghua University(清华大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
OIDA-QA: A Multimodal Benchmark for Analyzing the Opioid Industry Documents Archive
Xuan Shen, Brian Wingenroth, Zichao Wang, Jason Kuen, Wanrong Zhu, Ruiyi Zhang, Yiwei Wang, Lichun Ma, Anqi Liu, Hongfu Liu, Tong Sun, Kevin S. Hawkins, Kate Tasker, G. Caleb Alexander, Jiuxiang Gu
专题命中
视觉问答
:grounding(abstract);multimodal large language model(abstract);分类 cs.AI
CommentsAccepted by AAAI 2026 Artificial Intelligence for Social Impact Track
机构
*
Columbia University, United States Shanghai Jiao Tong University, China San Francisco State University, United States Carnegie Mellon University, United States Texas A\&M University, College Station, United States University of California, San Diego, United States
机构
*
ZJU-Angelalign R&D Center for Intelligence Healthcare(浙江大学智能医疗研发中心)
;
Zhejiang University(浙江大学)
;
Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)
;
Guangdong Institute of Intelligence Science and Technology(广东省智能科学与技术研究院)
MedAlign: A Synergistic Framework of Multimodal Preference Optimization and Federated Meta-Cognitive Reasoning
Siyong Chen, Jinbo Wen, Jiawen Kang, Tenghui Huang, Xumin Huang, Yuanjia Su, Hudan Pan, Zishao Zhong, Dusit Niyato, Shengli Xie, Dong In Kim
机构
*
School of Automation, Guangdong University of Technology(广东工业大学自动化学院)
;
College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)
;
State Key Laboratory of Traditional Chinese Medicine Syndrome, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine, Guangdong Provincial Hospital of Chinese Medicine, Guangdong Provincial Academy of Chinese Medical Sciences(广东省中医药科学院中医证候重点实验室,广州中医药大学第二附属医院,广东省中医院,广东省中医药科学院)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)
;
Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系)
MedReason-R1: Learning to Reason for CT Diagnosis with Reinforcement Learning and Local Zoom
Yifan Li, Fenghe Tang, Yingtai Li, Shaohua Kevin Zhou
机构
*
1 School of Biomedical Engineering, Division of Life Sciences
;
Medicine, University of Science
;
Technology of China, Hefei, Anhui, 230026, P.R. China 2 Center for Medical Imaging, Robotics
;
Analytic Computing \& LEarning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou 215123, P.R. China 3 Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123 4 State Key Laboratory of Precision