Test-Time Hallucination Control in Large Vision-Language Models
大型视觉语言模型的测试时幻觉控制
Mehran Tamjidi, Hamidreza Dastmalchi, Ali Cheraghian, Mohammadreza Alimoradijazi, Aijun An, Hossein Rahmani
机构
*
Australian National University(澳大利亚国立大学)
;
The University of New South Wales(新南威尔士大学)
;
University of Technology Sydney(悉尼科技大学)
;
York University(约克大学)
;
Lancaster University(兰卡斯特大学)
机构
*
School of Computer Science, Peking University(北京大学计算机科学学院)
;
Microsoft Research Asia(微软亚洲研究院)
;
Princeton University(普林斯顿大学)
;
Tsinghua University(清华大学)
From Prompts to Pavement Through Time: Temporal Grounding in Agentic Scene-to-Plan Reasoning
从提示到路面通过时间:代理场景到计划推理中的时间定位
Ahmed Y. Gado, Omar Y. Goba, Alaa Hassanein, Catherine M. Elias, Ahmed Hussein
机构
*
Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大大学(GUC)计算机科学与工程系,埃及)
;
C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室,埃及开罗,C-DRiVeS)
;
M.Eng. Robotics Candidate at Deggendorf Institute of Technology, Germany(德国德格多夫技术学院机器人硕士候选人)
;
IAV GmbH, Berlin, Germany(德国柏林IAV GmbH公司)
ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
具身融合智能体:以人为中心的智能体人工智能新范式
Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Yao, Kelong Mao, Hao Sun, Zhiyao Luo, Jiankai Tang, Lei Li, Jiadong Guo, Minheng Ni, Weicong Lin, Chenxi Yang, Hongxiang Gao, Zhenghua Chen, Yang Bai, Min Wu, Jun Cheng, Huazhu Fu, Dacheng Tao, Bang Liu
机构
*
Université de Montréal(蒙特利尔大学)
;
Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所)
;
Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所)
;
Nanjing Medical University(南京医科大学)
;
Nanjing University(南京大学)
;
Renmin University of China(中国人民大学)
;
University of Cambridge(剑桥大学)
;
University of Oxford(牛津大学)
;
Tsinghua University(清华大学)
;
National University of Singapore(新加坡国立大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
Southern University of Science and Technology(南方科技大学)
;
Southeast University(东南大学)
;
University of Glasgow(格拉斯哥大学)
;
Nanyang Technological University(南洋理工大学)
专题命中
视频多模态
:multimodal(abstract);分类 cs.AI
AI总结
该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。
机构
*
Sun Yat-sen University(中山大学)
;
Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室)
;
X-Era AI Lab(X-Era人工智能实验室)
;
AMAP, Alibaba(阿里妈妈实验室)
;
Guangdong University of Technology(广东工业大学)
Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System
推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统
Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen
机构
*
Fudan University(复旦大学)
;
College of Future Information Technology(未来信息技术学院)
;
Shanghai Innovation Institute(上海创新研究院)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)